0% encontró este documento útil (0 votos)
87 vistas27 páginas

Introducción a Modelos de Datos de Panel

Este documento introduce los modelos de datos de panel y su especificación y estimación. Explica que los datos de panel aprovechan la variabilidad tanto temporal como transversal de las variables para mejorar la precisión de los parámetros estimados. Además, los modelos de datos de panel permiten controlar la heterogeneidad transversal inobservable que puede ser constante en el tiempo. Finalmente, el documento presenta un ejemplo práctico de modelo de datos de panel con dos observaciones transversales para dos años diferentes con el objetivo de estimar la relación entre criminalidad y desempleo.

Cargado por

Leonardo Moreno
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
87 vistas27 páginas

Introducción a Modelos de Datos de Panel

Este documento introduce los modelos de datos de panel y su especificación y estimación. Explica que los datos de panel aprovechan la variabilidad tanto temporal como transversal de las variables para mejorar la precisión de los parámetros estimados. Además, los modelos de datos de panel permiten controlar la heterogeneidad transversal inobservable que puede ser constante en el tiempo. Finalmente, el documento presenta un ejemplo práctico de modelo de datos de panel con dos observaciones transversales para dos años diferentes con el objetivo de estimar la relación entre criminalidad y desempleo.

Cargado por

Leonardo Moreno
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

INTRODUCCIN A LA ESPECIFICACIN Y

ESTIMACIN DE MODELOS
CON DATOS DE PANEL
Ramn Maha
Dpto. ECONOMA APLICADA
UNIVERSIDAD AUTNOMA DE MADRID
[Link]@[Link]
[Link]/[Link]
pg. 2

1.- CUESTIONES GENERALES

1.A.- DEFINICINES EN TORNO A LOS MODELOS DE DATOS DE PANEL

La tcnica se encuadra en el anlisis de regresin, incluida en el conjunto de herramientas


multivariantes destinadas al anlisis de la dependencia entre variables, medidas todas ellas (endgena
y exgenas) preferentemente en una escala estrictamente cuantitativa.

El trmino modelo de datos de panel se aplica genricamente (aunque no siempre con acierto) a
aquel modelo de regresin que utiliza, para la estimacin de los parmetros de inters, la variabilidad
temporal y transversal de los datos.

Generalmente, los paneles de datos se distinguen unos de otros segn su amplitud transversal y
profundidad temporal. As, los paneles con un nmero muy amplio de observaciones transversales
(ejemplo 1 anterior) se denominan Paneles Micro, mientras que los paneles centrados en una amplia
dimensin temporal se suelen denominar Paneles Macro. En el caso, realmente extraordinario, de
contar con un panel con amplia dimensin tanto temporal como transversal hablaramos de un
Campo Aleatorio o Random Field.

As mismo, resulta habitual hablar de paneles de datos equilibrados cuando el nmero de


observaciones transversales es el mismo para cada perodo del tiempo y de paneles completos
cuando el nmero de observaciones temporales es el mismo para cada elemento del panel.

Es importante dejar claro que, en sentido estricto, no son datos de panel los paneles rotatorios o la
mera agregacin de cortes transversales independientes 1. Para construir un elemento verdaderamente
til de cara a la inferencia, se trata de que la variabilidad temporal y transversal corresponda a una
misma muestra de individuos para todas las observaciones. En este sentido, disponer de paneles es
muy complicado cuando hablamos de individuos, unidades familiares o empresas y algo ms fcil
cuando nos referimos a unidades ms agregadas (regiones, pases, sectores). En todo caso,
disponer de cortes transversales independientes permite tambin interesantes anlisis gracias a
disponer de observaciones temporales y transversales como, por ejemplo, analizar la incidencia del
paso del tiempo en el efecto de una variable exgena de inters, o realizar un anlisis de evaluacin
de polticas evaluacin de utilizando el denominado Modelo de Diferencias en Diferencias

1.B.- QU JUSTIFICA EL INTERS POR LOS DATOS DE PANEL

La utilizacin de datos de panel en lugar de series temporales se justifica por aprovechar la


variabilidad transversal. La identificacin y estimacin de los parmetros de una funcin de
respuesta explota la variacin de las variables incluidas. Si las variables no presenta presentan
excesiva variabilidad temporal pero s transversal, la aproximacin con datos de panel aportara
capacidad extra para esa estimacin (mayor precisin menor varianza en los parmetros).

La utilizacin de datos de panel en lugar de series transversales se justifica por aprovechar la


variabilidad temporal para:

1.- De modo simtrico a lo expuesto en el punto anterior, algunas variables pueden presentar
variabilidad temporal pero no transversal de modo que su efecto slo podra captarse con
dimensin temporal. Si disponemos de ms de un corte temporal para los mismos individuos, la
bsqueda de la eficiencia sugerira una estimacin con todo el panel de datos. En este sentido,
resulta prctico tener en mente la siguiente relacin simplificada:

1
A este tipo de conjuntos de datos se los denomina pseudo paneles o POOLED INDEPENDENT
CROSS SECTIONS.
pg. 3

V (U )
V ( ) f
V ( X )
2.- Por otro lado, y esto es lo que centrar la mayor parte de la exposicin en este documento,
veremos que la mayor parte de los anlisis con datos de panel se centran en lograr estimaciones
insesgadas y/o consistentes de los parmetros de inters controlando, gracias al panel, la
heterogeneidad transversal inobservable cuando sta puede considerarse constante en el tiempo.

En algunos casos especficos, la introduccin de la variabilidad transversal en procedimientos


clsicos de anlisis meramente temporal, favorece las propiedades estadsticas de los procedimientos
de inferencia tradicionales. As, por ejemplo, la potencia y propiedades asintticas de los test de
integracin y cointegracin se ven claramente favorecidas cuando se combinan datos de corte
temporal y transversal, lo que justifica el actual inters por las lneas metodolgicas que combinan
anlisis de series temporales y utilizacin de variabilidad transversal.

1.C.- PANEL CON DOS OBSERVACIONES: Introduccin a la lgica de especificacin de un


modelo de datos de panel con un ejemplo prctico2

Tenemos dos cortes transversales NO INDEPENDIENTES, esto es, correspondientes a los mismos
individuos (en este caso ciudades). Esto es MUY IMPORTANTE dado que, en caso de SER
INDEPENDIENTES no tendra sentido posteriormente considerar la presencia de una
heterogeneidad transversal constante en el tiempo, base fundamental del planteamiento de los
modelos con datos de panel.

Los cortes temporales NO HAN DE SER PERODOS CONSECUTIVOS. Esto es importante no


slo porque a veces no se dispone de informacin de dos aos consecutivos sino porque, en muchas
ocasiones NO INTERESA. De hecho, la ventaja de separar las observaciones radica en que una
de las limitaciones que puede presentar la estimacin de un panel con dos observaciones usando
diferencias (veremos qu significa esto) es la escasa variabilidad temporal de algunas exgenas; en
este sentido, una mayor separacin entre los perodos de anlisis puede ayudarnos a solucionar el
problema. El coste de separar excesivamente las observaciones puede ser, sin embargo, que la idea
de controlar la heterogeneidad transversal inobservable pasa por el supuesto de que esa
heterogeneidad es constante en el tiempo, cosa ms complicada si las observaciones temporales estn
ms distantes.

Ejemplo:

Cul es la relacin entre criminalidad (crmenes por cada 100 habitantes) y nivel de desempleo
(unemployment rate)?
Fichero= 92 ciudades con datos para 1982 y 1987

Estimacin simple usando slo un corte transversal

(con datos para 1982)

smpl @all if year=87 (46 observaciones)


ls crmrte c unem

Dependent Variable: CRMRTE


Sample: 1 92 IF YEAR=82
Included observations: 46

2
Ejemplo tomado parcialmente del texto Introductory Econometrics. A Modern Approach. de J.M.
Wooldridge. Ed. Thomson. Epgrafe 13.3 de la edicin inglesa del ao 2003.
pg. 4

Coefficient Std. Error t-Statistic Prob.

C 84.56873 10.90404 7.755723 0.0000


UNEM 1.306915 1.027090 1.272444 0.2099

(con datos para 1987)

smpl @all if year=82 (46 observaciones)


ls crmrte c unem

Dependent Variable: CRMRTE


Sample: 1 92 IF YEAR=87
Included observations: 46

Coefficient Std. Error t-Statistic Prob.

C 128.3781 20.75663 6.184922 0.0000


UNEM -4.161134 3.416456 -1.217968 0.2297

o Parmetro positivo en 1982, aunque no significativamente.


o En 1987 parmetro negativo! y, en todo caso, no significativo.??

Cmo mejoramos esta ecuacin?:

Aadiendo ms variables explicativas transversales en el 87 u en el 82 como polpc (police per


1000 people) y lawexpc law enforce. expend. pc, $

ls crmrte c unem polpc lawexpc

Dependent Variable: CRMRTE


Sample: 1 92 IF YEAR=82
Included observations: 46

Coefficient Std. Error t-Statistic Prob.

C 60.94657 15.15890 4.020513 0.0002


UNEM -0.116927 1.182623 -0.098871 0.9217
POLPC 11.13200 7.247529 1.535971 0.1320
LAWEXPC 0.016460 0.021853 0.753205 0.4555

Sample: 1 92 IF YEAR=87
Included observations: 46

C 93.44828 28.90758 3.232656 0.0024


UNEM -5.251756 3.277266 -1.602481 0.1165
POLPC 22.15821 7.918048 2.798444 0.0077
LAWEXPC -0.008296 0.015957 -0.519869 0.6059
pg. 5

o El parmetro de LAWEXPC tiene signo diferente en 1982 y 1987 (adems de no


significativo).
o En todo caso, la variable de inters, el desempleo, sigue mostrando parmetro negativo
ahora en ambos cortes transversales! y siempre poco o nada significativo. Tambin
polpc tiene signo cambiado (aunque puede haber problemas de endogeneidad)

Consideremos que pueden existir factores inobservables que tambin querran incluirse pero
para los que no se dispone de informacin. Podemos clasificar estos factores en (a)
heterogeneidad transversal constante en el tiempo, esto es, factores constantes o casi
constantes en el tiempo pero variables entre observaciones (como por ejemplo factores
geogrficos o culturales, composicin demogrfica o racial) y (b) heterogeneidad temporal
constante para todas las observaciones, es decir factores variables en el tiempo que afecten a
todos los individuos (ciudades) por igual (tendencias seculares en el pas, ).

La inclusin de los factores inobservables constantes para los individuos pero variables en
el tiempo puede solucionarse igual agregando (pooling) todas las observaciones del 82 y el 87
y utilizando una dummy de tiempo con valores 0 (para t=1) y 1 (para t=2).

yit 0 0 d 2t 1i x1it uit

De este modo, para todas las observaciones (sin distinguir unas de otras) el trmino constante
para t=1 (1982) sera 0 en tanto que para t=2 (1987) el trmino constante podra recoger un
cambio en la media global tomando como valor 0+0.

La inclusin de la heterogeneidad transversal constante en el tiempo podra solucionarse de


modo anlogo, introduciendo una nueva variable ai. Esta variable se denomina efecto
inobservable, heterogeidad inobservable o tambin efecto fijo (fijo en el tiempo) y, por
extensin, al modelo suele denominrsele Modelos de Efectos Fijos.

yit 0 0 d 2t 1i x1it ai uit

2.- MODELO DE ESFECTOS FIJOS: ESTIMACIN CON DATOS DE PANEL


ESTTICOS
2.A.- INTRODUCCIN GENERAL

Continuando la exposicin con el ejemplo previo, a la vista del modelo planteado en el epgrafe
anterior, la pregunta es cmo podra estimarse este modelo?.

Una posibilidad es considerar que el factor de heterogeneidad transversal ai est


incorrelacionado con la/las variable/s de inters xit. En este caso, expresndolo para un modelo
con una nica exgena, bastara con considerar que ai es una parte idiosincrtica de la
perturbacin aleatoria

yit 0 0 d 2t 1i x1it ai uit yit 0 0 d 2t 1i x1it ai uit 3


yit 0 0 d 2t 1i x1it vit

Si efectivamente ai est incorrelacionado con la variable de inters xit y, adems, no se tiene


inters especfico en determinar su valor podemos simplemente agregar todas las observaciones de
1982 y 1987 (como en la primera estimacin) y estimar el modelo:

3
Utilizaremos el modelo con una nica variable exgena para simplicar la representacin matemtica.
pg. 6

yit 0 0d 2t 1i x1it vit

smpl @all
ls crmrte c unem polpc lawexpc d87

Dependent Variable: CRMRTE


Sample: 1 92
Included observations: 92

Coefficient Std. Error t-Statistic Prob.

C 66.30238 14.57614 4.548693 0.0000


UNEM -1.005169 1.180835 -0.851236 0.3970
POLPC 18.24876 5.390587 3.385301 0.0011
LAWEXPC 0.001241 0.012018 0.103298 0.9180
D87 0.439644 8.634015 0.050920 0.9595

o El parmetro de la variable D87 recoge el cambio secular medio para todas las
ciudades en la tasa de criminalidad producido entre 1982 y 1987.
o Los parmetros de unem, polpc2 y lawexpc estn ahora estimados con 92
observaciones (en lugar de con 46) obtenidas en distintos momentos del tiempo por lo
que se supone una mayor eficiencia (debida a una mayor variabilidad).

Sin embargo, recordemos que esta regresin supone que la heterogeneidad transversal ai est
incorrelacionada con las variables exgenas unemp, polpc y lawexpc. Y si no fuera as?. En
ese caso, los parmetros seran insesgados e inconsistentes de modo que, si no podemos asumir
ai como parte de la perturbacin aleatoria y debemos considerar su estimacin, como una
serie de parmetros ms, para garantizar la insesgadez de las variables de inters, aun cuando no
tengamos inters especfico en conocer el valor de cada uno de esos a i. El siguiente grfico
muestra una clara representacin del error que puede cometerse cuando se estima la regresin
pooled frente a las estimaciones que, ms adelante, llamaremos de efectos fijos:

Pooled regresin Vs Efectos Fijos


pg. 7

2.B.- INTRODUCCIN A LA ESTIMACIN DEL MODELO DE EFECTOS FIJOS

Suponemos en este caso que existe heterogeneidad transversal inobservable, constante en el


tiempo de carcter no aleatorio o, al menos, relacionada con las variables exgenas. Por tanto
permitiremos la presencia de trminos independientes diferentes ai para cada individuo del panel,
independientemente de que, adems, consideremos la presencia de factores de cambio temporal 0:

yit 0 0 d 2t 1i x1it ai uit

o no:

yit 0 1i x1it ai uit

En este contexto, una primer estrategia para la estimacin de parmetros podra ser utilizar el
estimador MCO tradicional sobre el modelo en niveles utilizando variables ficticias (dummies)
de individuo (dummy variable regression). El problema ser entonces la gran cantidad de
parmetros (ficticias) a estimar (N-1, siendo N el nmero de individuos disponibles en cada corte
transversal) dado que, habitualmente, los paneles consideran un elevado nmero de observaciones
transversales. Una de las ventajas de esta estrategia de estimacin radicara, no obstante, en que se
podran obtener de forma directa los intervalos de confianza para los efectos fijos estimados.

Como segunda estrategia, podemos transformar el modelo en diferencias temporales y aplicar


MCO. Efectivamente, dado que disponemos, como mnimo, de dos observaciones temporales,
podemos plantear la transformacin en diferencias del modelo

yit 0 0 d 2t 1i x1it ai uit


yi 2 yi1 0 0 0 d 22 d 21 1i x1i 2 x1i1 ai ai ui 2 ui1
yit 0 1i x1it uit

De este modo, los parmetros as obtenidos, se corresponden con los parmetros de inters del
modelo original pero, estaran ahora seran insesgados y consistentes, siempre y cuando,
obviamente, uit est incorrelacionado con xit, o lo que es igual, que la perturbacin aleatoria
original en niveles uit est incorrelacionada con las variables exgenas en cada uno de los cortes
transversales.

Debe observarse que en anterior modelo, estamos considerando SIMULTANEAMENTE efectos


fijos en ambas dimensiones: la presencia de efectos fijos transversales ai para cada individuo del
panel y, adems, un efecto fijo entre individuos de cambio temporal 0.

Los resultados del modelo del ejemplo previo, para el caso de una sola exgena son en este caso:

smpl @all
ls ccrmrte c cunem

**(Ojo: los datos de E-Views no pueden utilizarse tal y como estn dispuestas las series para generar la serie en diferencias por
lo que el Fichero ya contiene esas variables en diferencias que se denominan CCRMRTE (change in crime rate) y CUNEM
(change in unemployment rate).

Dependent Variable: CCRMRTE


Method: Least Squares
Sample (adjusted): 2 92
pg. 8

Included observations: 46 after adjustments

Coefficient Std. Error t-Statistic Prob.

C 15.40220 4.702117 3.275589 0.0021


CUNEM 2.217999 0.877866 2.526581 0.0152

o Parece que, ahora s, el parmetro del desempleo es positivo y significativo: un


incremento de la tasa de paro de un 1% habra generado un incremento de 2.2
vctimas por cada 1000 habitantes.
o Por otro lado, debe observarse que el trmino independiente de esta nueva regresin se
corresponde con el parmetro de la variabilidad temporal generalizada (secular) para
todas las ciudades. Esto es, aun cuando la tasa de desempleo no hubiera crecido entre
1982 y 1987 en las 46 ciudades, el incremento medio global de la tasa de criminalidad
en el conjunto de ciudades habra crecido en 15.40 crmenes por cada 1.000 habitantes.

o La estimacin aadiendo las dems variables exgenas consideradas en el apartado


previo arroja valores algo mayores, pero muy similares en esencia para el parmetro de
inters (desempleo). La estimacin es adems, levemente ms precisa lo que,
posiblemente, se deba a una reduccin del error (R2=0.20 frente a 0,13) que compense
la posible presencia de multicolinealidad.

Dependent Variable: CCRMRTE


Method: Least Squares
Sample (adjusted): 2 92
Included observations: 46 after adjustments

Coefficient Std. Error t-Statistic Prob.

C 16.31966 6.176036 2.642417 0.0115


CUNEM 2.466734 0.855926 2.881948 0.0062
CPOLPC 26.68003 12.43268 2.145960 0.0377
CLAWEXPC -0.005039 0.013092 -0.384928 0.7022

Este mtodo de estimacin, puede generalizarse para cuando se dispone de ms de dos


perodos. En ese caso, los coeficientes de las exgenas se interpretan del mismo modo aunque el
trmino independiente no tiene ya una interpretacin tan sencilla como en el caso de disponer de solo
dos aos. Ms adelante se comentarn los inconvenientes de esta aproximacin y se generalizarn los
procedimientos de estimacin.

A la hora de utilizar el procedimiento de primeras diferencias respecto al perodo previo, ilustrado en el


sencillo ejemplo anterior, deben considerarse una serie de cuestiones esenciales:

La utilizacin del procedimiento en diferencias exige que las perturbaciones uit se muestren
incorrelacionadas con las exgenas. En este sentido, debe considerarse que un panel simple de
efectos fijos ai no garantiza la estimacin insesgada de los parmetros si hemos omitido
importantes variables en la dimensin temporal. En ese sentido, si el nmero de perodos es corto
(como en muchos paneles) resulta poco costoso y muy interesante incluir trminos fijos
temporales a fin de descontar las variaciones temporales no consideradas explcitamente en el
modelo.

No obstante, conviene tener en cuenta una limitacin en este sentido. Si introducimos tantas variables
dummies temporales como observaciones temporales tenemos (menos una) no podremos entonces
pg. 9

aadir a la regresin ninguna otra variable que vare en el tiempo de forma constante (por ejemplo la
experiencia de un trabajador).

Dado que se requiere la utilizacin de variables en diferencias, debemos tener en cuenta que las
variables explicativas debern ofrecer suficiente variabilidad temporal. En primer lugar, eso
implica que no podrn estimarse coeficientes para variables que no cambien en el tiempo (por
ejemplo el gnero de un individuo o su raza) y que para aquellas variables que no ofrezcan suficiente
variabilidad, el aumento de la varianza de los parmetros estimados podra impedir resultados lo
suficientemente precisos. En realidad, el mecanismo de efectos fijos considera que cada efecto fijo
ai contiene la estimacin de toda aquella informacin que no vare en el tiempo, sin que podamos
separar unas variables de otras.

En todo caso, aunque no pueda testarse la influencia de variables constantes en el tiempo (como
por ejemplo la influencia de la raza o el gnero en el salario) si puede analizarse al menos la
interaccin de estas variables con variables dummies de tiempo. Estas interacciones permitiran
observar si el efecto de esas las variables que son constantes en el tiempo han ido variando con el
paso del tiempo. As, podra observarse por ejemplo, en un fichero de panel con datos temporales de
salarios anuales 1980,1990,2000,2010 para miles de trabajadores, podra testarse si efecto del gnero
sobre la remuneracin ha variado en 1990, 2000 y 2010 con relacin al ao base 1980. No podramos
conocer el ao efecto base, pero al menos si ha habido evolucin o no y en qu sentido.

Un claro inconveniente de este mtodo es, aparentemente, que no permite calcular el valor de
los parmetros fijos ai lo que, en ocasiones, resulta de inters. En realidad, esto no es cierto
dado que, a partir de los coeficientes estimados podemos derivar los coeficientes a i con
sencillez, operacin que, por otro lado, realizan automticamente todos los programas informticos.
Eso si, lo que no podremos hacer es disponer de estimaciones de la varianza e esos parmetros.

[Link].1.- EJERCICIO:

Realice este mismo anlisis utilizando un modelo de elasticidades constante. Realice la estimacin
pooled simple en logaritmos (las variables se denominan todas respectivamente con el sufijo l
log) y despus compare los resultados frente al modelo de efectos fijos estimados con diferencias
(las variables se denominan todas respectivamente con el sufijo cl change in log). Recuerdo que la
variable unemp no es necesario especificarla en logaritmos dado que ya representa en si mismo
una tasa.
Compare adems los resultados obtenidos en el modelo en logaritmos con los obtenidos en el
modelo en niveles.

2.C.- MANIPULACIN DE DATOS DE PANEL EN E-VIEWS

Antes de continuar desarrollando las cuestiones tericas relativas a la especificacin y estimacin de


modelos con datos de panel, vamos a resumir cmo manipular los datos en E-Views.

La forma ms habitual de disponer los datos de panel para su lectura posterior por cualquier
programa (E-Views, STATA,.) es de forma apilada por individuos (stacked). Es decir, para
cada variable se apilan en orden las observaciones temporales de cada individuo hasta terminar la
lista de individuos.

Ejemplo de 3 variables para un panel de pases


con datos temporales 1990-1997
pg. 10

Fuente: Forum E-Views. [Link]

Si los datos se encuentran as dispuestos, leerlos con E-Views (u otro programa) es sencillo. En el
caso del E-Views.

FORMA 1: Trabajar con ficheros temporales con estructuras no apiladas y objetos Pool
(vlido para cualquier versin de E-Views)

1. Creamos un fichero unstructured/undated con un nmero de observaciones igual al nmero


total de datos (Casos x Observaciones temporales)
2. Importamos (File-Import-Read Text/Lotus/Excel) los datos de Excel apilados
(*) Alternativamente a las fases 1 y 2, podemos directamente tratar de abrir el Excel usando la
opcin File-Open-Foreig Data as Workfile

3. Una vez disponibles los datos, re-estructuramos el fichero, desapilando los datos en un Panel,
informando el E-Views de sus caractersticas (Proc-Reshape Current Page Unstack in new
page).

o Como variable o serie a especificar como series containing unstacking identifiers


especificamos aquella que contiene los identificadores de caso (pas, ciudad, familia,
individuo)
o Como variable o serie a especificar como series containing observation identifiers
especificamos aquella que contiene los identificadores de tiempo (ao, estacin,
)
o En el ltimo recuadro, escribimos el nombre de aquellas series que queremos procesar
en el nuevo formato (utilizando * si queremos procesar todas las series del fichero
original).

Procedimiento Reshape-Unstack
pg. 11

4. Una vez desapilados los datos, Definimos el objeto Pool (Object-New Object Pool ) y
escribimos los identificadores cross-section, es decir, los sufijos utilizados para diferenciar las
unidades tranversales (pases, empresas, individuos, ).4

Este objeto pool presenta una doble funcionalidad. Por un lado, permite administrar los
miembros del panel (identificadores transversales) y en segundo lugar, sirve de base para
realizar de forma sencilla, las operaciones que requiramos a nivel de panel: generacin de
series de panel, anlisis estadstico diferenciando las dos dimensiones del panel,
estimaciones de panel, pruebas estadsticas para una estimacin de panel.

Una de las ventajas de esta forma de trabajar es que pueden definirse distintos objetos
panel (variando los elementos que forman parte de cada uno de ellos) sobre la base de un
mismo fichero, con el fin de realizar, por ejemplo, pruebas de estimacin alternativas para
grupos (paneles) con distintos elementos (individuos, pases,).

La principal desventaja de este mtodo es que resulta visualmente muy engorroso (sobre
todo para paneles con muchos individuos) y que el objeto de panel deja al margen algunos
procedimientos que pueden resultar interesantes y que han de enfocarse de modo indirecto
(por ejemplo opciones de panel en los grficos)

FORMA 2: Trabajar con estructuras apiladas (ficheros Panel Data) en E-Views

2.1.- Mtodo 1: Creamos el fichero de panel y leemos los datos

4
Es interesante recordar que en esta lista de identificadores pueden aadirse subgrupos
pg. 12

1. Creamos un fichero Panel Data (File New WorkFile Balanced Panel)


2. Definimos la frecuencia temporal empleada (Date specification) y el inicio y fin del perodo.
Creacin de un fichero nuevo de Panel en Eviews

3. Importamos los datos stacked de Excel con el procedimiento habitual (File-Import-Read


Text/Lotus/Excel)

2.2.- Mtodo 2: Leemos los datos y despus creamos el fichero de panel

1. Abrimos el Excel usando la opcin File-Open-Foreig Data as Workfile


2. Utilizamos ahora la opcin de restructurar (Proc-Structure/Reshape current page/Dated Panel)
Reestructuracin de un fichero apilado a un Panel en Eviews

La principal ventaja de este mtodo reside en la sencillez de manejo de los ficheros y en la posibilidad de
utilizar procedimientos de anlisis / exploracin de panel especialmente pensados para este tipo de
estructuras (por ejemplo los grficos disponen de opciones para observar el panel). Quiz la nica
desventaja reside en la dificultad para gestionar grupos (subpaneles) con tanta facilidad como con el
objeto pool.

[Link].1.- EJERCICIO:

Observe los datos salvados en CRIME2_REDUCED_STACKED.xls y cree un fichero de Panel en


E-Views siguiendo las dos opciones comentadas anteriormente.

[Link].2.- EJERCICIO:

Observe los datos salariales para un panel anual individual contenidos en el fichero
[Link] y cree un fichero de datos de panel siguiendo cualquiera de las dos opciones
pg. 13

comentadas anteriormente. La variable que identifica los individuos ( trabajadores) es nregister


y la que identifica el tiempo es year.

2.D.- GENERALIZACIN DEL PROCEDIMIENTO DE ESTIMACIN DE MODELOS CON


DATOS DE PANEL: DE LAS DIFERENCIAS SIMPLES A LA ESTIMACIN EFECTOS
FIJOS

Un defecto esencial del mtodo de primeras diferencias para la estimacin de datos de panel es
que, en presencia de ms de dos observaciones (T>2) la transformacin en diferencias provocara la
aparicin de autocorrelacin en los residuos de esas nuevas ecuaciones en diferencias:

ui 2 ui 2 ui1
Cov(ui 2 ui1 ) Eui 2 E ui 2 ui 3 E ui 3
ui 3 ui 3 ui 2
Eui 2 ui1 ui 3 ui 2 Eui 2ui 3 ui1ui 3 ui 2ui 2 ui1ui 2
Cov(ui 2ui 3 ) Cov(ui1ui 3 ) V (ui 2 ) Cov(ui1ui 2 )
Cov(ui 2 ui1 ) 2

Esto implica que la estimacin MCO sobre el modelo en diferencias simple generar estimadores
ineficientes.

Dado que la varianza, por su parte, puede demostrarse que es constante e igual 2 (25), el problema
puede resolverse recurriendo a una estimacin MCG (con mnimos cuadrados factibles) calculando
con alguna estimacin previa (por ejemplo la de primeras diferencias) la nueva matriz no escalar de
varianzas y covarianzas para uit que, suponiendo que no exista previamente autocorrelacin
serial en u, sera:

2 1 0 0
X '
i
i
1
Yi
1 2 1 0

con
X ' 1
X i 0 1
i
i 0 0 2

Sin embargo, existen algunas alternativas a la diferenciacin simple para la estimacin del modelo
de panel efectos fijos y una de las ms conocidas es la denominada transformacin de efectos
fijos, estimador de covarianzas o simplemente estimador intragrupal (IG, within estimator).
Este ltimo nombre, procede de considerarse para su aplicacin, como se ver a continuacin, la
desviacin intragrupal para todas las variables X e Y.

La idea de este mtodo IG consiste en eliminar las N coordenadas fijas ai remplazando los
valores de las variables originales por los valores en diferencias respecto a la media temporal de
cada individuo/grupo (time demeaned data)

ui 2 ui 2 ui1
ui 3 ui 3 ui 2

V ( u i 3 ) Cov( u i 3 u i 3 ) E ui3E ui3 2 Eui3ui 2 ui3ui 2 Eui3ui3ui3ui 2 ui 2ui3ui 2ui 2
2
V ( u i 3 ) Cov( u i 3u i 2 ) Cov( u i 2 u i 3 ) V ( u i 2 ) V ( u i 3 ) 2
pg. 14

yit yi 1 ( x1it x1i ) 2 ( x2it x2i ) ........uit ui


yit 1 xit 2 x2t ....uit
donde:

T T

yit x jit
yi t 1
; x ji t 1
T T
Al ser los factores fijos ai constantes en el tiempo, esta transformacin los elimina de la regresin
de modo que, de igual manera que con la estimacin en primeras diferencias, la estimacin se
concentra en un nico conjunto de parmetros pudiendo calcularse posteriormente los parmetros
ai individuales simplemente como:

ai yi 1 x1i 2 x2i .... k xki

Esta estrategia resulta generalmente vlida por lo que es en la prctica la forma ms comn de
resolver la estimacin de un modelo de efectos fijos.

Una interesante puntualizacin es que, al utilizar esta transformacin, perdemos un grado de


libertad adicional por cada una de las medias grupales calculadas necesarias para la
transformacin. Los grados de libertad de un modelo estimado de este modo no son por tanto NT-
k, sino NT-k-N.

Qu resulta ms idneo, primeras diferencias o intragrupos (IG)?. En principio, ambos mtodos


generan estimaciones insesgadas y consistentes de los parmetros j por lo que las ventajas relativas
pueden encontrarse en la eficiencia relativa de ambas estimaciones.

Si existe incorrelacin serial en uit, el estimador IG es ms eficiente que las primeras


diferencias por lo que resulta el mtodo habitual de estimacin (dado que normalmente se
supone esa incorrelacin en uit).

De modo inverso, si tenemos razones para pensar que existen importantes factores omitidos que
correlacionan temporalmente, el mtodo de primeras diferencias elimina esa autocorrelacion
siendo preferible al IG. Esto debe tenerse en cuenta especialmente en paneles con dimensiones
temporales largas en donde el riesgo de autocorrelacin e incluso de procesos de races unitarias
es importante.

[Link].1.- EJERCICIO:

Utilice los datos del fichero [Link] que contiene datos de salarios y caractersticas
personales de los empleados para realizar las siguientes operaciones.

Importe los datos de Excel y cree un fichero de panel en la misma pgina (recuerde que la
variable que contiene el nmero de registro del empleado es nregister y la variable de
observaciones temporales es year. Cuntos individuos tiene? y cuntas observaciones
temporales?

Realice una estimacin pooled MCO simple del salario en logaritmos (lwage) en funcin de
educ black, hisp, exper, expersq, married y union. Interprete los resultados e
indique qu posibles problemas plantea la interpretacin de los parmetros obtenidos.

Intente estimar ese mismo modelo utilizando una estimacin de panel con efectos fijos
transversales y SIN efectos temporales. Qu sucede? Arregle el problema planteando una
correccin adecuada.
pg. 15

Replantee ahora el modelo tomando slo las variables exper, expersq, married y unin e
intente una estimacin de efectos fijos transversales incluyendo adems efectos fijos
temporales. Qu sucede? Plantee una solucin al problema.

Analice si los rendimientos salariales de la educacin han ido aumentando o disminuyendo


con el tiempo con relacin a 1980.

3.- MODELO DE EFECTOS ALEATORIOS.

3.A.- DEFINICIN DEL MODELO DE EFECTOS ALEATORIOS

El modelo de Efectos Aleatorios (EA) es esencialmente el mismo descrito anteriormente y, por tanto,
puede representarse igualmente como (para el caso de una variable):

yit 0 1i x1it ai uit

Cul es la diferencia entonces con el modelo de Efectos Fijos (EF)?.

Ambos modelos, EF y EA, suponen la existencia de heterogeneidad transversal inobservable ai


como un aspecto fundamental de la especificacin. La diferencia no es por tanto la presencia y
necesidad de control de ai, sino la existencia o no de independencia/correlacin entre esa
heterogeneidad inobservable ai y los regresores xit.. Si, como expusimos previamente, los
efectos individuales ai se consideran correlacionados con las exgenas, optamos por un modelo EF
usando IG o primeras diferencias para la estimacin de los parmetros ; si no existe correlacin,
optaremos por la estimacin de un modelo EA

En este modelo EA, se supone una sola ordenada en el origen comn a todos los individuos a (lo
que, por otro lado, implica que el conjunto de las a i especficas tendrn media nula) en tanto que
las N ordenadas especficas ai correspondientes a cada individuo del panel se integran en la
perturbacin aleatoria:
vit ai it
yit 0 1i x1it vit

por esta razn a estos modelos se les llama tambin modelos con errores compuestos (error
components models).

A diferencia del modelo de EF, en el modelo de efectos aleatorios no se realizar transformacin


alguna para eliminar el trmino ai de cara a la estimacin. La heterogeneidad ai se considerar
parte de la perturbacin aleatoria y, una vez estimados los parmetros, se dispondr as mismo de los
parmetros se estimarn sin transformaciones

3.B.- ESTIMACIN DEL MODELO II(B) DE EFECTOS ALEATORIOS

La estimacin de los parmetros de un modelo de efectos aleatorios no requiere, como en el


caso de efectos fijos, diferencias o desviaciones o cualquier otra transformacin que elimine la
presencia del efecto fijo ai. Muy al contrario, junto con la estimacin de los parmetros
interesa la estimacin diferenciada de la varianza debida a los efectos aleatorios a dentro de la
estimacin global de la varianza de la perturbacin aleatoria, por lo que NO conviene que el efecto
ai sea obviado en el procedimiento de estimacin.
pg. 16

Llegados a este punto, podra pensarse en utilizar el estimador simple MCO sobre el modelo en
niveles, tal y como se realizaba en un conjunto de observaciones transversales apiladas (pooled cross
section):

yit xit (ai uit )

Sin embargo, la estrategia de MCO simple no resulta vlida ya que la presencia de un efecto
temporalmente constante en la perturbacin aleatoria a i provoca, obviamente,
autocorrelacin residual y modifica la expresin tradicional de la varianza de la perturbacin
aleatoria. As, la matriz de varianzas y covarianzas de la perturbacin queda:

a2 u2 a2 a2 a2 1

a2 a2 u2 a2 a2 2 1

2
2
v
a a
2 2
2
2
a a a u

con:
a2 a2
2 2
v u a2

Por tanto, la estrategia correcta consiste en usar MCG sobre el modelo en niveles utilizando una
estimacin adecuada de la anterior matriz . A este estimador se le denomina estimador Balestra-
Nerlove Estimador Entre Grupos, nombre este ltimo que proviene de la equivalencia entre estos
resultados y los que se obtendran planteando la estimacin MCO entre las medias grupales
temporales de y y x.

Como siempre, debemos recordar que existe una transformacin previa sobre los datos (mnimos
cuadrados factibles) que permite eliminar la autocorrelacin procediendo a su estimacin simple
por MCO y evitando as la utilizacin del estimador MCG (aunque nunca eludiendo la estimacin
de las varianzas 2a y 2u como se ver). Esta transformacin de las variables X e Y se
denomina quasi-demeaned, en contraste con el time-demeaned de efectos fijos, en la medida en que a
cada observacin restaremos una proporcin de la media temporal del grupo (observacin), una
proporcin que resulta ser, precisamente, la proporcin de varianza constante/total:

Efectos Fijos Efectos Aleatorios


y yit yi
*
it yit* yit yi
x xit xi
*
it xit* xit xi

Respecto al parmetro , se encuentra entre 0 y 1 y es funcin inversa de 2u y directa de T y


2a.6 Obviamente, el parmetro debe a su vez estimarse, para lo que puede usarse una estimacin
preliminar, bien de Efectos Fijos o bien a partir de un pooled MCO. Dado que EF es una
transformacin quasi-demeaned en contraste con la time-demeaned de EF, es obvio que en la medida
en que se acerca a 1 el estimador BN coincide con EF (efectos fijos) en tanto que un valor de
0 lo hace coincidir con un pooled MCO.

Debe observarse que el crecimiento de ocurre cuando la varianza de ai sobra especial relevancia
en relacin con la varianza total de v o bien cuando, por otro lado, T es muy grande, lo que a la
postre significa que, en esos dos casos, obtendremos resultados muy similares en EF y EA.

6
pg. 17

Debe recordarse que, en todo caso, los estimadores de mnimos generalizados factibles ofrecen
estimaciones consistentes (que NO Insesgadas) para un nmero grande de individuos (N) y
relativamente pequeo de observaciones temporales (T).

La estimacin EG (Balestra Nerlove) requerir por tanto necesariamente dos etapas:

1.- Estimacin de un modelo previo del que utilizar los residuos para aproximar 2a y 2v.
Normalmente suele utilizarse, o bien una estimacin MCO simple del modelo, con trmino
independiente comn, o bien una estimacin del modelo con efectos fijos.

2.- Estimacin de las varianzas 2a y 2v y aplicacin del estimador MCG. Para este paso,
partiendo de:

vit i it

utilizaremos una aproximacin por descomposicin tradicional de la varianza del siguiente


modo:

v
i ,t
it v 2 vit vi 2 vi v 2
i ,t i ,t

Para el primer trmino, la media cuadrtica intragrupal, tenemos que:

vi ,t
it v i 2
i ,t
it i 2

Utilizando ahora el concepto de cuasivarianza muestral que, supuesta la distribucin N(0,2x)


para una muestra x1, x2,....xT nos dice que:


x x i 2
it

E x2
T 1

y aplicndolo a la perturbacin , (supuesta la normalidad de la misma), tenemos que:


E


i ,t
it i 2 N (T 1) 2

Para el segundo trmino, de modo similar, escribiremos que:

v v a a 2 ai a i
2 2 2
i i i
i ,t i ,t i ,t i ,t

teniendo ahora:
pg. 18

N 2
E ai a ( N 1) a2
i1 7

N 2 2
E i ( N 1)
i1 T

de modo que:

v v
2
i ( N 1)T a2 ( N 1) 2
i ,t

En trminos operativos el clculo no resultara complejo en cuanto que implicara tan slo el
clculo inicial de 2:

v
2
it vi
i ,t
2
N (T 1)
y a continuacin el de 2a como:

a2
1 T N
vi v
T N 1 i1

2
2



3.C.- UTILIDAD Y SELECCIN DEL MODELO DE EFECTOS ALEATORIOS FRENTE AL


MODELO DE EFECTOS FIJOS

Si el estimador IG permite controlar el efecto de la heterogeneidad inobservable sobre los parmetros


, qu puede motivar el uso de un modelo alternativo como EA?. La respuesta es mltiple:

1. Lo ms importante es que, en caso de no existir correlacin, la estimacin del modelo de EF


usando IG o primeras diferencias supondra una innecesaria prdida de eficiencia en la
estimacin de los parmetros . Efectivamente, al eliminar las variables ai usando IG o
primeras diferencias, renunciamos innecesariamente al poder explicativo de esas variables sobre
la variable yit.

2. Por otro lado, es posible que interesase cuantificar la influencia de ese aspecto transversal a i
permanente sobre la variable endgena. En este sentido, usando un modelo de EA resultar
posible distinguir qu parte de los aspectos inobservables v it influyen en yit con
carcter intertemporal (ait) y que parte es esencialmente transitoria (uit), algo que
efectivamente puede obtenerse usando EA.

Supongamos que, por ejemplo8, disponemos de un corte transversal y queremos relacionar el


input de las explotaciones agrcolas con el output de las mismas. En la perturbacin aleatoria
quedaran shocks incontrolables como el rgimen de lluvias u otros cambios climticos. Sin
embargo, es posible que en la perturbacin quedase incluido tambin un factor trascendental de
carcter no aleatorio: la calidad del suelo. Si esa calidad del suelo fuese cuantificable se
incorporara como una variable ms pero, si fuese inobservable, podramos controlar su
impacto con datos de panel ya que esa calidad y su efecto seran constantes en el tiempo. Pero
adems, suponiendo la ausencia de correlacin entre calidad e input (algo razonable),
podramos usar un estimador EG que permitiese diferenciar los efectos de la variable de

7
En la segunda de las expresiones se entiende que cada una de las i que entran en la media se han
extrado de una poblacin N(0/T,2/T)
8
Tomado de Mundlak, (1978)
pg. 19

CALIDAD DEL SUELO, efectos inobservables de naturaleza permanente, de otros shocks


tambin de carcter inobservable, pero cuyo efecto es transitorio y se diluye en el tiempo.

3. Una importante razn adicional de carcter tcnico pero especialmente importante desde el punto
de vista prctico es que la estimacin del modelo de EA no implicar la transformacin IG o
en primeras diferencias por lo que podrn incluirse entre las explicativas, variables con
poca o ninguna variabilidad temporal.

4. Por ltimo, una diferencia conceptualmente interesante (aunque pocas veces utilizada en la
prctica) es que el modelo de efectos aleatorios, supone que los individuos que componen la
muestra son una extraccin aleatoria de todos los individuos poblacionales existentes. Si la
muestra NO es una extraccin aleatoria, lo coherente sera utilizar efectos fijos.

Una vez admitido que la decisin EF Vs. EA debe ser analizada conceptualmente (en funcin de la
supuesta relacin entre ai y xit) es cierto que existen algunos recursos tcnicos para ayudarnos a
decidir entre una especificacin/estimacin u otra. Entre los ms conocidos, el ms comn es el
test de HAUSMAN.

El test de Hausman es un contraste clsico de robustez frente a eficiencia. Este tipo de contrastes
plantean siempre dos estimadores para un mismo conjunto de parmetros, uno robusto R consistente
tanto en la hiptesis nula H0 como en la alternativa H1 (cualesquiera que sean) y otro eficiente E
pero consistente slo bajo la hiptesis nula H 0. Si, una vez calculados ambos, la diferencia observada
entre los dos estimadores (R -E) es escasa, se toma evidencia a favor de la hiptesis nula.

En nuestro contexto los estimadores son R=Intra-Grupos y E=Balestra Nerlove y la hiptesis nula
ser que el efecto ai est incorrelacionado con xit (H0) en cuyo caso el modelo EA sera el
adecuado. Estimados ambos, diferencias significativas entre IG y BN evidenciaran correlacin
entre ai y xit. Efectivamente, en presencia de H0 (ausencia de correlacin ai/xit) BN ser
consistente e IG tambin (aunque algo menos eficiente) por lo que su diferencia ser significativa.

Formalmente, el test de Hausman se presenta, aproximadamente, como una 2 formada por la


diferencia relativa entre las dos estimaciones alternativas relativizadas por la varianza de esa
diferencia. Valores de la 2 superiores a la referencia de tabla indican la presencia de correlacin
entre i y xit.

Tras todo lo previo, es importante recordar en todo caso, que la eleccin entre uno u otro modelo no
puede tomarse basndonos exclusivamente en el resultado de un contraste estadstico de
especificacin sino que debe apoyarse en las peculiaridad de la realidad del fenmeno analizado.
Como sealan Arellano y Bover (1990): ....Una costumbre muy extendida en el trabajo aplicado
consiste en estimar ambos modelos para a continuacin contrastar si los efectos son fijos o
aleatorios. Este es quiz el malentendido ms extendido en este campo.....
pg. 20

BIBLIOGRAFA BSICA

Arellano, M. y Bond, S. (1988). Some Test of Especification for Panel data: Monte Carlo Evidence and
and an Application to Employment Equiations. Applied Economics Discussion Papers 55, Oxford.

Arellano,M. y Bover, O. (1990). La Econometra de Datos de Panel. Investigaciones Econmicas. Vol.


14. N 1. pp. 3-45.

Deaton, A. (1985). Panel data from Times Series of Cross Sections. Journal of Econometrics, 30. pp.
109-126.

Chamberlain, G. (1984). panel data. Z. Griliches and M.D. Intrilligator (editores). Handbook of
Econometrics, Vol. II. Elsevier Science.

Griliches, Z. (1977). Estimating the returns of Schooling: some econometric problems. Economtrica,
45, pp. 1- 22.

Hausman, J. A. (1978). Specification tests in Econometrics. Econometrica, 46, pp. 1251-1272.

Johnston, J. (1992). Mtodos de Econometra. Ed. Vicens Vivens.

MaCurdy, T.E. (1981). An Empirical Model of Labor Supply in a Life-Cycle Setting. Journal of
Political Economy, 89, pp.1059-1085.

Mundlak, Y. (1978). On the pooling of time series and cross section

Wooldridge (2009). Introductory Econometrics. Thomson South-Western.


pg. 21

ANEXO: SOLUCIONES A LOS EJERCICIOS

[Link].1.- EJERCICIO:

Realice este mismo anlisis utilizando un modelo de elasticidades constante. Realice la


estimacin pooled simple en logaritmos (las variables se denominan todas respectivamente
con el sufijo l log) y despus compare los resultados frente al modelo de efectos fijos
estimados con diferencias (las variables se denominan todas respectivamente con el sufijo cl
change in log). Recuerdo que la variable unemp no es necesario especificarla en logaritmos
dado que ya representa en si mismo una tasa.
Compare adems los resultados obtenidos en el modelo en logaritmos con los obtenidos en
el modelo en niveles.

Regresin pooled MCO simple:

Dependent Variable: LCRMRTE


Method: Least Squares
Date: 10/19/12 Time: 12:10
Sample: 1 92
Included observations: 92

Coefficient Std. Error t-Statistic Prob.

C 3.722407 0.681688 5.460573 0.0000


UNEM -0.005275 0.008714 -0.605313 0.5465
LPOLPC 0.385330 0.115911 3.324373 0.0013
LLAWEXPC 0.087090 0.102214 0.852033 0.3965

R-squared 0.173547 Mean dependent var 4.572393


Adjusted R-squared 0.145372 S.D. dependent var 0.283785
S.E. of regression 0.262348 Akaike info criterion 0.204214
Sum squared resid 6.056726 Schwarz criterion 0.313857
Log likelihood -5.393860 Hannan-Quinn criter. 0.248467
F-statistic 6.159695 Durbin-Watson stat 1.083901
Prob(F-statistic) 0.000753

Dependent Variable: CLCRMRTE


Method: Least Squares
Date: 10/19/12 Time: 12:11
Sample (adjusted): 2 92
Included observations: 46 after adjustments

Coefficient Std. Error t-Statistic Prob.

C 0.103642 0.056267 1.841979 0.0725


CUNEM 0.018747 0.007526 2.490953 0.0168
CLPOLPC 0.750578 0.298261 2.516510 0.0158
CLLAWEXPC -2.87E-05 0.000117 -0.245307 0.8074

R-squared 0.239055 Mean dependent var 0.036692


Adjusted R-squared 0.184702 S.D. dependent var 0.190330
pg. 22

S.E. of regression 0.171856 Akaike info criterion -0.601374


Sum squared resid 1.240453 Schwarz criterion -0.442362
Log likelihood 17.83161 Hannan-Quinn criter. -0.541808
F-statistic 4.398177 Prob(F-statistic) 0.008861

El coeficiente del desempleo indica que un aumento de un 1% en el nivel de desempleo de la


ciudad elva la ratio de criminalidad en un 1,8%.
Comparando con el modelo en niveles, pensemos que la tasa de criminalidad media en las 46
ciudades es en 1987 de 100 crmenes y de casi 98 en 1982 por cada 1000 habitantes. En el
modelo en niveles, el resultado para unemp indicaba que un incremento del 1% se traduca en
un aumento de criminalidad de 2.5 nuevas vctimas, es decir, un 2,5% sobre el nivel de
1982/1987, algo por encima de la estimacin que refleja el modelo en logaritmos.

[Link].1.- EJERCICIO:

Observe los datos salvados en CRIME2_REDUCED_STACKED.xls y cree un fichero de Panel en


E-Views siguiendo las dos opciones comentadas anteriormente.

Este fichero contiene datos de dos aos separados cinco aos 1982 y 1987 por lo que en la opcin de
creacin del panel deber utilizarse un perodo de dos nmeros enteros y despus, si se quiere,
transformarse esa variable al ao 1982 1987.

[Link].2.- EJERCICIO:

Observe los datos contenidos en el fichero [Link] y cree un fichero de datos de panel
siguiendo cualquiera de las dos opciones comentadas anteriormente.

Este fichero contiene 44 variables con 4360 observaciones cada una correspondientes a datos de salarios,
nivel educativo, etc de 545 empleados con datos anuales entre los aos 1980 y 1987.

[Link]

[Link].1.- EJERCICIO:

Utilice los datos del fichero [Link] que contiene datos de salarios y caractersticas
personales de los empleados para realizar las siguientes operaciones.

Realice una estimacin pooled MCO simple del salario en logaritmos (lwage) en funcin de educ
black, hisp, exper, expersq, married y union. Interprete los resultados e indique qu
posibles problemas plantea la interpretacin de los parmetros obtenidos.

Dependent Variable: LWAGE


Method: Panel Least Squares
Date: 10/19/12 Time: 19:48
Sample: 1980 1987
Periods included: 8
Cross-sections included: 545
Total panel (balanced) observations: 4360

Coefficient Std. Error t-Statistic Prob.

EDUC 0.097237 0.002422 40.14522 0.0000


pg. 23

BLACK -0.144628 0.023512 -6.151238 0.0000


HISP 0.013246 0.020303 0.652396 0.5142
EXPER 0.087186 0.009406 9.269581 0.0000
EXPERSQ -0.002765 0.000690 -4.007465 0.0001
MARRIED 0.108522 0.015614 6.950296 0.0000
UNION 0.179691 0.017104 10.50554 0.0000

R-squared 0.186533 Mean dependent var 1.649147


Adjusted R-squared 0.185411 S.D. dependent var 0.532609
S.E. of regression 0.480704 Akaike info criterion 1.374475
Sum squared resid 1005.877 Schwarz criterion 1.384719
Log likelihood -2989.357 Hannan-Quinn criter. 1.378091
Durbin-Watson stat 0.863111

El principal problema puede ser la omisin de variables relevantes que puede estar generando sesgo en la
estimacin. Aunque el modelo est bien trabajado, estas seran de dos tipos:

Es posible que existan caractersticas individuales que estn incidiendo en los salarios y que no
puedan medirse (habilidad, inteligencia,..) y es posible que algunas de ellas sean constantes en el
tiempo = podramos eliminarlas con una estimacin de panel.

Adems, es posible que, a lo largo del perodo 1980-1987 los salarios hayan crecido o decrecido
de forma comn para todas las observaciones (estado de la economa, beneficios de la
empresa,) lo que invitara a pensar en aadir variables dummies temporales que recojan esa
evolucin (transversalmente constante).

Intente estimar ese mismo modelo utilizando una estimacin de panel con efectos fijos
transversales y SIN efectos temporales. Qu sucede? Arregle el problema planteando una
correccin adecuada?

Al intentarlo, obtenemos el mensaje (near singular matrix). Esto sucede porque algunas de las
variables NO PRESENTAN variabilidad transversal (como black, hisp o educ). La nica manera
de poder realizar una estimacin de efectos fijos es eliminar estas variables de la ecuacin:

Dependent Variable: LWAGE


Method: Panel Least Squares
Date: 10/29/12 Time: 09:22
Sample: 1980 1987
Periods included: 8
Cross-sections included: 545
Total panel (balanced) observations: 4360

Coefficient Std. Error t-Statistic Prob.

C 1.064880 0.026661 39.94198 0.0000


EXPER 0.116847 0.008420 13.87780 0.0000
EXPER^2 -0.004301 0.000605 -7.105690 0.0000
MARRIED 0.045303 0.018310 2.474282 0.0134
UNION 0.082087 0.019291 4.255264 0.0000

Effects Specification

Cross-section fixed (dummy variables)


pg. 24

R-squared 0.619740 Mean dependent var 1.649147


Adjusted R-squared 0.565061 S.D. dependent var 0.532609
S.E. of regression 0.351255 Akaike info criterion 0.862648
Sum squared resid 470.2024 Schwarz criterion 1.666030
Log likelihood -1331.572 Hannan-Quinn criter. 1.146182
F-statistic 11.33412 Durbin-Watson stat 1.819814
Prob(F-statistic) 0.000000

En este nuevo modelo, obtenemos valores sensiblemente diferentes de los parmetros, quiz menos
sesgados. Dos preguntas son interesantes:

- Es mucho mejor en trminos de ajuste?. Observando la R2 as parece, pero ha de tenerse en


cuenta que este segundo modelo es equivalente a uno que utilice una dummie para cada
observacin transversal y, por tanto, mucho ms especificado, con menos grados de libertad, que
el original. Para contrastar la mejora podemos realizar el contraste F:

- Qu significa el trmino independiente?: en realidad, la transformacin de EF elimina el


trmino independiente en la regresin de modo que qu interpretacin tiene cuando aparece en
la estimacin?. En realidad, no tiene interpretacin ninguna ms all que, cuando aparece, los
trminos ai deben entenderse como los efectos fijos de cada individuo en comparacin a la
media global.

Replantee ahora el modelo tomando slo las variables exper, expersq, married y unin e intente una
estimacin de efectos fijos transversales incluyendo adems efectos fijos temporales. Qu sucede?
Plantee una solucin al problema.

- Lo que sucede es que, al incluir dicotmicas temporales, no podemos utilizar ninguna variable
montonamente creciente dado que generamos multicolinealidad exacta. Esto es lo que sucede
con la variable Exper.

La regresin eliminando EXper queda:

Dependent Variable: LWAGE


Method: Panel Least Squares
Date: 10/29/12 Time: 10:40
Sample: 1980 1987
Periods included: 8
Cross-sections included: 545
Total panel (balanced) observations: 4360

Coefficient Std. Error t-Statistic Prob.

C 1.870609 0.037844 49.42997 0.0000


EXPER^2 -0.005185 0.000704 -7.361196 0.0000
MARRIED 0.046680 0.018310 2.549385 0.0108
UNION 0.080002 0.019310 4.142962 0.0000
pg. 25

Effects Specification

Cross-section fixed (dummy variables)


Period fixed (dummy variables)

R-squared 0.620912 Mean dependent var 1.649147


Adjusted R-squared 0.565718 S.D. dependent var 0.532609
S.E. of regression 0.350990 Akaike info criterion 0.862313
Sum squared resid 468.7531 Schwarz criterion 1.674475
Log likelihood -1324.843 Hannan-Quinn criter. 1.148946
F-statistic 11.24956 Durbin-Watson stat 1.821184
Prob(F-statistic) 0.000000

- Los parmetros son muy similares a los anteriores por lo que esas time dummies podran no ser
necesarias. Al eliminar exper, no podemos observar el efecto lineal de la experiencia pero si el
efecto cuadrtico.

- Qu significan los fixed effects de perodos?. Representan la evolucin constante temporal en


cada ao (comn a todos los individuos variables) con relacin al promedio (OJO CON ESTO,
LA SUMA DE ESTOS EFECTOS FIJOS TEMPORALES ES TAMBIN NULA, no se
refieren a efectos diferencias respecto al primer perodo, sino respecto a la media, por eso hay
positivos y negativos. Si queremos ver el valor del efecto fijo de cada perodo respecto a 1980
habra que introducir ficticias d81 hasta d87 (el resto de los parmetros no cambia pero ahora los
efectos fijos temporales se refieren a los cambios temporales cross constantes respecto a 1980):

Dependent Variable: LWAGE


Method: Panel Least Squares
Date: 10/29/12 Time: 10:50
Sample: 1980 1987
Periods included: 8
Cross-sections included: 545
Total panel (balanced) observations: 4360

Coefficient Std. Error t-Statistic Prob.

C 1.426019 0.018341 77.74835 0.0000


EXPER^2 -0.005185 0.000704 -7.361196 0.0000
MARRIED 0.046680 0.018310 2.549385 0.0108
UNION 0.080002 0.019310 4.142962 0.0000
D81 0.151191 0.021949 6.888319 0.0000
D82 0.252971 0.024418 10.35982 0.0000
D83 0.354444 0.029242 12.12111 0.0000
D84 0.490115 0.036227 13.52914 0.0000
D85 0.617482 0.045244 13.64797 0.0000
D86 0.765497 0.056128 13.63847 0.0000
D87 0.925025 0.068773 13.45039 0.0000

Effects Specification

Cross-section fixed (dummy variables)

R-squared 0.620912 Mean dependent var 1.649147


Adjusted R-squared 0.565718 S.D. dependent var 0.532609
S.E. of regression 0.350990 Akaike info criterion 0.862313
Sum squared resid 468.7531 Schwarz criterion 1.674475
pg. 26

Log likelihood -1324.843 Hannan-Quinn criter. 1.148946


F-statistic 11.24956 Durbin-Watson stat 1.821184
Prob(F-statistic) 0.000000

Analice si los rendimientos salariales de la educacin han ido aumentando o disminuyendo


con el tiempo con relacin a 1980.

En teora, habamos quedado que la variable educ no poda introducirse en la regresin por ser
constante. Efectivamete, esto NO PUEDE HACERSE, pero s podemos incluir la interaccin de esta
variable con las ficticias de modo que podamos observar cmo ha ido ganando/perdiendo importancia con
el paso del tiempo respecto al ao 1980. Dado que no podemos computar el efecto base de 1980 no
podemos computar el efecto sobre el salario (rendimiento de la educacin) pero s la variacin de ese
rendimiento a lo largo de los aos.

Com puede observarse, el resultado es interesante y refleja que, progresivamente, el rendimiento salarial
de la educacin se ha ido reduciendo a partir de 1983.

Dependent Variable: LWAGE


Method: Panel Least Squares
Date: 10/29/12 Time: 10:57
Sample: 1980 1987
Periods included: 8
Cross-sections included: 545
Total panel (balanced) observations: 4360

Coefficient Std. Error t-Statistic Prob.

C 1.436283 0.019277 74.50899 0.0000


EXPER^2 -0.006044 0.000863 -7.001011 0.0000
MARRIED 0.047434 0.018328 2.588085 0.0097
UNION 0.078976 0.019333 4.085073 0.0000
D81 0.098420 0.145999 0.674115 0.5003
D82 0.247202 0.149379 1.654867 0.0980
D83 0.408813 0.155715 2.625399 0.0087
D84 0.639925 0.165240 3.872708 0.0001
D85 0.772940 0.177991 4.342574 0.0000
D86 0.969932 0.194175 4.995151 0.0000
D87 1.188777 0.213586 5.565809 0.0000
D81*EDUC 0.004991 0.012222 0.408329 0.6831
D82*EDUC 0.001651 0.012330 0.133892 0.8935
D83*EDUC -0.002662 0.012510 -0.212806 0.8315
D84*EDUC -0.009826 0.012759 -0.770082 0.4413
D85*EDUC -0.009214 0.013072 -0.704894 0.4809
D86*EDUC -0.012138 0.013442 -0.903010 0.3666
D87*EDUC -0.015789 0.013868 -1.138536 0.2550

Effects Specification

Cross-section fixed (dummy variables)

R-squared 0.621275 Mean dependent var 1.649147


Adjusted R-squared 0.565334 S.D. dependent var 0.532609
pg. 27

S.E. of regression 0.351145 Akaike info criterion 0.864566


Sum squared resid 468.3044 Schwarz criterion 1.686972
Log likelihood -1322.755 Hannan-Quinn criter. 1.154815
F-statistic 11.10587 Durbin-Watson stat 1.822316
Prob(F-statistic) 0.000000

También podría gustarte