Introducción a Modelos de Datos de Panel
Introducción a Modelos de Datos de Panel
ESTIMACIN DE MODELOS
CON DATOS DE PANEL
Ramn Maha
Dpto. ECONOMA APLICADA
UNIVERSIDAD AUTNOMA DE MADRID
[Link]@[Link]
[Link]/[Link]
pg. 2
El trmino modelo de datos de panel se aplica genricamente (aunque no siempre con acierto) a
aquel modelo de regresin que utiliza, para la estimacin de los parmetros de inters, la variabilidad
temporal y transversal de los datos.
Generalmente, los paneles de datos se distinguen unos de otros segn su amplitud transversal y
profundidad temporal. As, los paneles con un nmero muy amplio de observaciones transversales
(ejemplo 1 anterior) se denominan Paneles Micro, mientras que los paneles centrados en una amplia
dimensin temporal se suelen denominar Paneles Macro. En el caso, realmente extraordinario, de
contar con un panel con amplia dimensin tanto temporal como transversal hablaramos de un
Campo Aleatorio o Random Field.
Es importante dejar claro que, en sentido estricto, no son datos de panel los paneles rotatorios o la
mera agregacin de cortes transversales independientes 1. Para construir un elemento verdaderamente
til de cara a la inferencia, se trata de que la variabilidad temporal y transversal corresponda a una
misma muestra de individuos para todas las observaciones. En este sentido, disponer de paneles es
muy complicado cuando hablamos de individuos, unidades familiares o empresas y algo ms fcil
cuando nos referimos a unidades ms agregadas (regiones, pases, sectores). En todo caso,
disponer de cortes transversales independientes permite tambin interesantes anlisis gracias a
disponer de observaciones temporales y transversales como, por ejemplo, analizar la incidencia del
paso del tiempo en el efecto de una variable exgena de inters, o realizar un anlisis de evaluacin
de polticas evaluacin de utilizando el denominado Modelo de Diferencias en Diferencias
1.- De modo simtrico a lo expuesto en el punto anterior, algunas variables pueden presentar
variabilidad temporal pero no transversal de modo que su efecto slo podra captarse con
dimensin temporal. Si disponemos de ms de un corte temporal para los mismos individuos, la
bsqueda de la eficiencia sugerira una estimacin con todo el panel de datos. En este sentido,
resulta prctico tener en mente la siguiente relacin simplificada:
1
A este tipo de conjuntos de datos se los denomina pseudo paneles o POOLED INDEPENDENT
CROSS SECTIONS.
pg. 3
V (U )
V ( ) f
V ( X )
2.- Por otro lado, y esto es lo que centrar la mayor parte de la exposicin en este documento,
veremos que la mayor parte de los anlisis con datos de panel se centran en lograr estimaciones
insesgadas y/o consistentes de los parmetros de inters controlando, gracias al panel, la
heterogeneidad transversal inobservable cuando sta puede considerarse constante en el tiempo.
Tenemos dos cortes transversales NO INDEPENDIENTES, esto es, correspondientes a los mismos
individuos (en este caso ciudades). Esto es MUY IMPORTANTE dado que, en caso de SER
INDEPENDIENTES no tendra sentido posteriormente considerar la presencia de una
heterogeneidad transversal constante en el tiempo, base fundamental del planteamiento de los
modelos con datos de panel.
Ejemplo:
Cul es la relacin entre criminalidad (crmenes por cada 100 habitantes) y nivel de desempleo
(unemployment rate)?
Fichero= 92 ciudades con datos para 1982 y 1987
2
Ejemplo tomado parcialmente del texto Introductory Econometrics. A Modern Approach. de J.M.
Wooldridge. Ed. Thomson. Epgrafe 13.3 de la edicin inglesa del ao 2003.
pg. 4
Sample: 1 92 IF YEAR=87
Included observations: 46
Consideremos que pueden existir factores inobservables que tambin querran incluirse pero
para los que no se dispone de informacin. Podemos clasificar estos factores en (a)
heterogeneidad transversal constante en el tiempo, esto es, factores constantes o casi
constantes en el tiempo pero variables entre observaciones (como por ejemplo factores
geogrficos o culturales, composicin demogrfica o racial) y (b) heterogeneidad temporal
constante para todas las observaciones, es decir factores variables en el tiempo que afecten a
todos los individuos (ciudades) por igual (tendencias seculares en el pas, ).
La inclusin de los factores inobservables constantes para los individuos pero variables en
el tiempo puede solucionarse igual agregando (pooling) todas las observaciones del 82 y el 87
y utilizando una dummy de tiempo con valores 0 (para t=1) y 1 (para t=2).
De este modo, para todas las observaciones (sin distinguir unas de otras) el trmino constante
para t=1 (1982) sera 0 en tanto que para t=2 (1987) el trmino constante podra recoger un
cambio en la media global tomando como valor 0+0.
Continuando la exposicin con el ejemplo previo, a la vista del modelo planteado en el epgrafe
anterior, la pregunta es cmo podra estimarse este modelo?.
3
Utilizaremos el modelo con una nica variable exgena para simplicar la representacin matemtica.
pg. 6
smpl @all
ls crmrte c unem polpc lawexpc d87
o El parmetro de la variable D87 recoge el cambio secular medio para todas las
ciudades en la tasa de criminalidad producido entre 1982 y 1987.
o Los parmetros de unem, polpc2 y lawexpc estn ahora estimados con 92
observaciones (en lugar de con 46) obtenidas en distintos momentos del tiempo por lo
que se supone una mayor eficiencia (debida a una mayor variabilidad).
Sin embargo, recordemos que esta regresin supone que la heterogeneidad transversal ai est
incorrelacionada con las variables exgenas unemp, polpc y lawexpc. Y si no fuera as?. En
ese caso, los parmetros seran insesgados e inconsistentes de modo que, si no podemos asumir
ai como parte de la perturbacin aleatoria y debemos considerar su estimacin, como una
serie de parmetros ms, para garantizar la insesgadez de las variables de inters, aun cuando no
tengamos inters especfico en conocer el valor de cada uno de esos a i. El siguiente grfico
muestra una clara representacin del error que puede cometerse cuando se estima la regresin
pooled frente a las estimaciones que, ms adelante, llamaremos de efectos fijos:
o no:
En este contexto, una primer estrategia para la estimacin de parmetros podra ser utilizar el
estimador MCO tradicional sobre el modelo en niveles utilizando variables ficticias (dummies)
de individuo (dummy variable regression). El problema ser entonces la gran cantidad de
parmetros (ficticias) a estimar (N-1, siendo N el nmero de individuos disponibles en cada corte
transversal) dado que, habitualmente, los paneles consideran un elevado nmero de observaciones
transversales. Una de las ventajas de esta estrategia de estimacin radicara, no obstante, en que se
podran obtener de forma directa los intervalos de confianza para los efectos fijos estimados.
De este modo, los parmetros as obtenidos, se corresponden con los parmetros de inters del
modelo original pero, estaran ahora seran insesgados y consistentes, siempre y cuando,
obviamente, uit est incorrelacionado con xit, o lo que es igual, que la perturbacin aleatoria
original en niveles uit est incorrelacionada con las variables exgenas en cada uno de los cortes
transversales.
Los resultados del modelo del ejemplo previo, para el caso de una sola exgena son en este caso:
smpl @all
ls ccrmrte c cunem
**(Ojo: los datos de E-Views no pueden utilizarse tal y como estn dispuestas las series para generar la serie en diferencias por
lo que el Fichero ya contiene esas variables en diferencias que se denominan CCRMRTE (change in crime rate) y CUNEM
(change in unemployment rate).
La utilizacin del procedimiento en diferencias exige que las perturbaciones uit se muestren
incorrelacionadas con las exgenas. En este sentido, debe considerarse que un panel simple de
efectos fijos ai no garantiza la estimacin insesgada de los parmetros si hemos omitido
importantes variables en la dimensin temporal. En ese sentido, si el nmero de perodos es corto
(como en muchos paneles) resulta poco costoso y muy interesante incluir trminos fijos
temporales a fin de descontar las variaciones temporales no consideradas explcitamente en el
modelo.
No obstante, conviene tener en cuenta una limitacin en este sentido. Si introducimos tantas variables
dummies temporales como observaciones temporales tenemos (menos una) no podremos entonces
pg. 9
aadir a la regresin ninguna otra variable que vare en el tiempo de forma constante (por ejemplo la
experiencia de un trabajador).
Dado que se requiere la utilizacin de variables en diferencias, debemos tener en cuenta que las
variables explicativas debern ofrecer suficiente variabilidad temporal. En primer lugar, eso
implica que no podrn estimarse coeficientes para variables que no cambien en el tiempo (por
ejemplo el gnero de un individuo o su raza) y que para aquellas variables que no ofrezcan suficiente
variabilidad, el aumento de la varianza de los parmetros estimados podra impedir resultados lo
suficientemente precisos. En realidad, el mecanismo de efectos fijos considera que cada efecto fijo
ai contiene la estimacin de toda aquella informacin que no vare en el tiempo, sin que podamos
separar unas variables de otras.
En todo caso, aunque no pueda testarse la influencia de variables constantes en el tiempo (como
por ejemplo la influencia de la raza o el gnero en el salario) si puede analizarse al menos la
interaccin de estas variables con variables dummies de tiempo. Estas interacciones permitiran
observar si el efecto de esas las variables que son constantes en el tiempo han ido variando con el
paso del tiempo. As, podra observarse por ejemplo, en un fichero de panel con datos temporales de
salarios anuales 1980,1990,2000,2010 para miles de trabajadores, podra testarse si efecto del gnero
sobre la remuneracin ha variado en 1990, 2000 y 2010 con relacin al ao base 1980. No podramos
conocer el ao efecto base, pero al menos si ha habido evolucin o no y en qu sentido.
Un claro inconveniente de este mtodo es, aparentemente, que no permite calcular el valor de
los parmetros fijos ai lo que, en ocasiones, resulta de inters. En realidad, esto no es cierto
dado que, a partir de los coeficientes estimados podemos derivar los coeficientes a i con
sencillez, operacin que, por otro lado, realizan automticamente todos los programas informticos.
Eso si, lo que no podremos hacer es disponer de estimaciones de la varianza e esos parmetros.
[Link].1.- EJERCICIO:
Realice este mismo anlisis utilizando un modelo de elasticidades constante. Realice la estimacin
pooled simple en logaritmos (las variables se denominan todas respectivamente con el sufijo l
log) y despus compare los resultados frente al modelo de efectos fijos estimados con diferencias
(las variables se denominan todas respectivamente con el sufijo cl change in log). Recuerdo que la
variable unemp no es necesario especificarla en logaritmos dado que ya representa en si mismo
una tasa.
Compare adems los resultados obtenidos en el modelo en logaritmos con los obtenidos en el
modelo en niveles.
La forma ms habitual de disponer los datos de panel para su lectura posterior por cualquier
programa (E-Views, STATA,.) es de forma apilada por individuos (stacked). Es decir, para
cada variable se apilan en orden las observaciones temporales de cada individuo hasta terminar la
lista de individuos.
Si los datos se encuentran as dispuestos, leerlos con E-Views (u otro programa) es sencillo. En el
caso del E-Views.
FORMA 1: Trabajar con ficheros temporales con estructuras no apiladas y objetos Pool
(vlido para cualquier versin de E-Views)
3. Una vez disponibles los datos, re-estructuramos el fichero, desapilando los datos en un Panel,
informando el E-Views de sus caractersticas (Proc-Reshape Current Page Unstack in new
page).
Procedimiento Reshape-Unstack
pg. 11
4. Una vez desapilados los datos, Definimos el objeto Pool (Object-New Object Pool ) y
escribimos los identificadores cross-section, es decir, los sufijos utilizados para diferenciar las
unidades tranversales (pases, empresas, individuos, ).4
Este objeto pool presenta una doble funcionalidad. Por un lado, permite administrar los
miembros del panel (identificadores transversales) y en segundo lugar, sirve de base para
realizar de forma sencilla, las operaciones que requiramos a nivel de panel: generacin de
series de panel, anlisis estadstico diferenciando las dos dimensiones del panel,
estimaciones de panel, pruebas estadsticas para una estimacin de panel.
Una de las ventajas de esta forma de trabajar es que pueden definirse distintos objetos
panel (variando los elementos que forman parte de cada uno de ellos) sobre la base de un
mismo fichero, con el fin de realizar, por ejemplo, pruebas de estimacin alternativas para
grupos (paneles) con distintos elementos (individuos, pases,).
La principal desventaja de este mtodo es que resulta visualmente muy engorroso (sobre
todo para paneles con muchos individuos) y que el objeto de panel deja al margen algunos
procedimientos que pueden resultar interesantes y que han de enfocarse de modo indirecto
(por ejemplo opciones de panel en los grficos)
4
Es interesante recordar que en esta lista de identificadores pueden aadirse subgrupos
pg. 12
La principal ventaja de este mtodo reside en la sencillez de manejo de los ficheros y en la posibilidad de
utilizar procedimientos de anlisis / exploracin de panel especialmente pensados para este tipo de
estructuras (por ejemplo los grficos disponen de opciones para observar el panel). Quiz la nica
desventaja reside en la dificultad para gestionar grupos (subpaneles) con tanta facilidad como con el
objeto pool.
[Link].1.- EJERCICIO:
[Link].2.- EJERCICIO:
Observe los datos salariales para un panel anual individual contenidos en el fichero
[Link] y cree un fichero de datos de panel siguiendo cualquiera de las dos opciones
pg. 13
Un defecto esencial del mtodo de primeras diferencias para la estimacin de datos de panel es
que, en presencia de ms de dos observaciones (T>2) la transformacin en diferencias provocara la
aparicin de autocorrelacin en los residuos de esas nuevas ecuaciones en diferencias:
ui 2 ui 2 ui1
Cov(ui 2 ui1 ) Eui 2 E ui 2 ui 3 E ui 3
ui 3 ui 3 ui 2
Eui 2 ui1 ui 3 ui 2 Eui 2ui 3 ui1ui 3 ui 2ui 2 ui1ui 2
Cov(ui 2ui 3 ) Cov(ui1ui 3 ) V (ui 2 ) Cov(ui1ui 2 )
Cov(ui 2 ui1 ) 2
Esto implica que la estimacin MCO sobre el modelo en diferencias simple generar estimadores
ineficientes.
Dado que la varianza, por su parte, puede demostrarse que es constante e igual 2 (25), el problema
puede resolverse recurriendo a una estimacin MCG (con mnimos cuadrados factibles) calculando
con alguna estimacin previa (por ejemplo la de primeras diferencias) la nueva matriz no escalar de
varianzas y covarianzas para uit que, suponiendo que no exista previamente autocorrelacin
serial en u, sera:
2 1 0 0
X '
i
i
1
Yi
1 2 1 0
con
X ' 1
X i 0 1
i
i 0 0 2
Sin embargo, existen algunas alternativas a la diferenciacin simple para la estimacin del modelo
de panel efectos fijos y una de las ms conocidas es la denominada transformacin de efectos
fijos, estimador de covarianzas o simplemente estimador intragrupal (IG, within estimator).
Este ltimo nombre, procede de considerarse para su aplicacin, como se ver a continuacin, la
desviacin intragrupal para todas las variables X e Y.
La idea de este mtodo IG consiste en eliminar las N coordenadas fijas ai remplazando los
valores de las variables originales por los valores en diferencias respecto a la media temporal de
cada individuo/grupo (time demeaned data)
ui 2 ui 2 ui1
ui 3 ui 3 ui 2
V ( u i 3 ) Cov( u i 3 u i 3 ) E ui3E ui3 2 Eui3ui 2 ui3ui 2 Eui3ui3ui3ui 2 ui 2ui3ui 2ui 2
2
V ( u i 3 ) Cov( u i 3u i 2 ) Cov( u i 2 u i 3 ) V ( u i 2 ) V ( u i 3 ) 2
pg. 14
T T
yit x jit
yi t 1
; x ji t 1
T T
Al ser los factores fijos ai constantes en el tiempo, esta transformacin los elimina de la regresin
de modo que, de igual manera que con la estimacin en primeras diferencias, la estimacin se
concentra en un nico conjunto de parmetros pudiendo calcularse posteriormente los parmetros
ai individuales simplemente como:
Esta estrategia resulta generalmente vlida por lo que es en la prctica la forma ms comn de
resolver la estimacin de un modelo de efectos fijos.
De modo inverso, si tenemos razones para pensar que existen importantes factores omitidos que
correlacionan temporalmente, el mtodo de primeras diferencias elimina esa autocorrelacion
siendo preferible al IG. Esto debe tenerse en cuenta especialmente en paneles con dimensiones
temporales largas en donde el riesgo de autocorrelacin e incluso de procesos de races unitarias
es importante.
[Link].1.- EJERCICIO:
Utilice los datos del fichero [Link] que contiene datos de salarios y caractersticas
personales de los empleados para realizar las siguientes operaciones.
Importe los datos de Excel y cree un fichero de panel en la misma pgina (recuerde que la
variable que contiene el nmero de registro del empleado es nregister y la variable de
observaciones temporales es year. Cuntos individuos tiene? y cuntas observaciones
temporales?
Realice una estimacin pooled MCO simple del salario en logaritmos (lwage) en funcin de
educ black, hisp, exper, expersq, married y union. Interprete los resultados e
indique qu posibles problemas plantea la interpretacin de los parmetros obtenidos.
Intente estimar ese mismo modelo utilizando una estimacin de panel con efectos fijos
transversales y SIN efectos temporales. Qu sucede? Arregle el problema planteando una
correccin adecuada.
pg. 15
Replantee ahora el modelo tomando slo las variables exper, expersq, married y unin e
intente una estimacin de efectos fijos transversales incluyendo adems efectos fijos
temporales. Qu sucede? Plantee una solucin al problema.
El modelo de Efectos Aleatorios (EA) es esencialmente el mismo descrito anteriormente y, por tanto,
puede representarse igualmente como (para el caso de una variable):
En este modelo EA, se supone una sola ordenada en el origen comn a todos los individuos a (lo
que, por otro lado, implica que el conjunto de las a i especficas tendrn media nula) en tanto que
las N ordenadas especficas ai correspondientes a cada individuo del panel se integran en la
perturbacin aleatoria:
vit ai it
yit 0 1i x1it vit
por esta razn a estos modelos se les llama tambin modelos con errores compuestos (error
components models).
Llegados a este punto, podra pensarse en utilizar el estimador simple MCO sobre el modelo en
niveles, tal y como se realizaba en un conjunto de observaciones transversales apiladas (pooled cross
section):
Sin embargo, la estrategia de MCO simple no resulta vlida ya que la presencia de un efecto
temporalmente constante en la perturbacin aleatoria a i provoca, obviamente,
autocorrelacin residual y modifica la expresin tradicional de la varianza de la perturbacin
aleatoria. As, la matriz de varianzas y covarianzas de la perturbacin queda:
a2 u2 a2 a2 a2 1
a2 a2 u2 a2 a2 2 1
2
2
v
a a
2 2
2
2
a a a u
con:
a2 a2
2 2
v u a2
Por tanto, la estrategia correcta consiste en usar MCG sobre el modelo en niveles utilizando una
estimacin adecuada de la anterior matriz . A este estimador se le denomina estimador Balestra-
Nerlove Estimador Entre Grupos, nombre este ltimo que proviene de la equivalencia entre estos
resultados y los que se obtendran planteando la estimacin MCO entre las medias grupales
temporales de y y x.
Como siempre, debemos recordar que existe una transformacin previa sobre los datos (mnimos
cuadrados factibles) que permite eliminar la autocorrelacin procediendo a su estimacin simple
por MCO y evitando as la utilizacin del estimador MCG (aunque nunca eludiendo la estimacin
de las varianzas 2a y 2u como se ver). Esta transformacin de las variables X e Y se
denomina quasi-demeaned, en contraste con el time-demeaned de efectos fijos, en la medida en que a
cada observacin restaremos una proporcin de la media temporal del grupo (observacin), una
proporcin que resulta ser, precisamente, la proporcin de varianza constante/total:
Debe observarse que el crecimiento de ocurre cuando la varianza de ai sobra especial relevancia
en relacin con la varianza total de v o bien cuando, por otro lado, T es muy grande, lo que a la
postre significa que, en esos dos casos, obtendremos resultados muy similares en EF y EA.
6
pg. 17
Debe recordarse que, en todo caso, los estimadores de mnimos generalizados factibles ofrecen
estimaciones consistentes (que NO Insesgadas) para un nmero grande de individuos (N) y
relativamente pequeo de observaciones temporales (T).
1.- Estimacin de un modelo previo del que utilizar los residuos para aproximar 2a y 2v.
Normalmente suele utilizarse, o bien una estimacin MCO simple del modelo, con trmino
independiente comn, o bien una estimacin del modelo con efectos fijos.
2.- Estimacin de las varianzas 2a y 2v y aplicacin del estimador MCG. Para este paso,
partiendo de:
vit i it
v
i ,t
it v 2 vit vi 2 vi v 2
i ,t i ,t
vi ,t
it v i 2
i ,t
it i 2
x x i 2
it
E x2
T 1
E
i ,t
it i 2 N (T 1) 2
v v a a 2 ai a i
2 2 2
i i i
i ,t i ,t i ,t i ,t
teniendo ahora:
pg. 18
N 2
E ai a ( N 1) a2
i1 7
N 2 2
E i ( N 1)
i1 T
de modo que:
v v
2
i ( N 1)T a2 ( N 1) 2
i ,t
En trminos operativos el clculo no resultara complejo en cuanto que implicara tan slo el
clculo inicial de 2:
v
2
it vi
i ,t
2
N (T 1)
y a continuacin el de 2a como:
a2
1 T N
vi v
T N 1 i1
2
2
2. Por otro lado, es posible que interesase cuantificar la influencia de ese aspecto transversal a i
permanente sobre la variable endgena. En este sentido, usando un modelo de EA resultar
posible distinguir qu parte de los aspectos inobservables v it influyen en yit con
carcter intertemporal (ait) y que parte es esencialmente transitoria (uit), algo que
efectivamente puede obtenerse usando EA.
7
En la segunda de las expresiones se entiende que cada una de las i que entran en la media se han
extrado de una poblacin N(0/T,2/T)
8
Tomado de Mundlak, (1978)
pg. 19
3. Una importante razn adicional de carcter tcnico pero especialmente importante desde el punto
de vista prctico es que la estimacin del modelo de EA no implicar la transformacin IG o
en primeras diferencias por lo que podrn incluirse entre las explicativas, variables con
poca o ninguna variabilidad temporal.
4. Por ltimo, una diferencia conceptualmente interesante (aunque pocas veces utilizada en la
prctica) es que el modelo de efectos aleatorios, supone que los individuos que componen la
muestra son una extraccin aleatoria de todos los individuos poblacionales existentes. Si la
muestra NO es una extraccin aleatoria, lo coherente sera utilizar efectos fijos.
Una vez admitido que la decisin EF Vs. EA debe ser analizada conceptualmente (en funcin de la
supuesta relacin entre ai y xit) es cierto que existen algunos recursos tcnicos para ayudarnos a
decidir entre una especificacin/estimacin u otra. Entre los ms conocidos, el ms comn es el
test de HAUSMAN.
El test de Hausman es un contraste clsico de robustez frente a eficiencia. Este tipo de contrastes
plantean siempre dos estimadores para un mismo conjunto de parmetros, uno robusto R consistente
tanto en la hiptesis nula H0 como en la alternativa H1 (cualesquiera que sean) y otro eficiente E
pero consistente slo bajo la hiptesis nula H 0. Si, una vez calculados ambos, la diferencia observada
entre los dos estimadores (R -E) es escasa, se toma evidencia a favor de la hiptesis nula.
En nuestro contexto los estimadores son R=Intra-Grupos y E=Balestra Nerlove y la hiptesis nula
ser que el efecto ai est incorrelacionado con xit (H0) en cuyo caso el modelo EA sera el
adecuado. Estimados ambos, diferencias significativas entre IG y BN evidenciaran correlacin
entre ai y xit. Efectivamente, en presencia de H0 (ausencia de correlacin ai/xit) BN ser
consistente e IG tambin (aunque algo menos eficiente) por lo que su diferencia ser significativa.
Tras todo lo previo, es importante recordar en todo caso, que la eleccin entre uno u otro modelo no
puede tomarse basndonos exclusivamente en el resultado de un contraste estadstico de
especificacin sino que debe apoyarse en las peculiaridad de la realidad del fenmeno analizado.
Como sealan Arellano y Bover (1990): ....Una costumbre muy extendida en el trabajo aplicado
consiste en estimar ambos modelos para a continuacin contrastar si los efectos son fijos o
aleatorios. Este es quiz el malentendido ms extendido en este campo.....
pg. 20
BIBLIOGRAFA BSICA
Arellano, M. y Bond, S. (1988). Some Test of Especification for Panel data: Monte Carlo Evidence and
and an Application to Employment Equiations. Applied Economics Discussion Papers 55, Oxford.
Deaton, A. (1985). Panel data from Times Series of Cross Sections. Journal of Econometrics, 30. pp.
109-126.
Chamberlain, G. (1984). panel data. Z. Griliches and M.D. Intrilligator (editores). Handbook of
Econometrics, Vol. II. Elsevier Science.
Griliches, Z. (1977). Estimating the returns of Schooling: some econometric problems. Economtrica,
45, pp. 1- 22.
MaCurdy, T.E. (1981). An Empirical Model of Labor Supply in a Life-Cycle Setting. Journal of
Political Economy, 89, pp.1059-1085.
[Link].1.- EJERCICIO:
[Link].1.- EJERCICIO:
Este fichero contiene datos de dos aos separados cinco aos 1982 y 1987 por lo que en la opcin de
creacin del panel deber utilizarse un perodo de dos nmeros enteros y despus, si se quiere,
transformarse esa variable al ao 1982 1987.
[Link].2.- EJERCICIO:
Observe los datos contenidos en el fichero [Link] y cree un fichero de datos de panel
siguiendo cualquiera de las dos opciones comentadas anteriormente.
Este fichero contiene 44 variables con 4360 observaciones cada una correspondientes a datos de salarios,
nivel educativo, etc de 545 empleados con datos anuales entre los aos 1980 y 1987.
[Link]
[Link].1.- EJERCICIO:
Utilice los datos del fichero [Link] que contiene datos de salarios y caractersticas
personales de los empleados para realizar las siguientes operaciones.
Realice una estimacin pooled MCO simple del salario en logaritmos (lwage) en funcin de educ
black, hisp, exper, expersq, married y union. Interprete los resultados e indique qu
posibles problemas plantea la interpretacin de los parmetros obtenidos.
El principal problema puede ser la omisin de variables relevantes que puede estar generando sesgo en la
estimacin. Aunque el modelo est bien trabajado, estas seran de dos tipos:
Es posible que existan caractersticas individuales que estn incidiendo en los salarios y que no
puedan medirse (habilidad, inteligencia,..) y es posible que algunas de ellas sean constantes en el
tiempo = podramos eliminarlas con una estimacin de panel.
Adems, es posible que, a lo largo del perodo 1980-1987 los salarios hayan crecido o decrecido
de forma comn para todas las observaciones (estado de la economa, beneficios de la
empresa,) lo que invitara a pensar en aadir variables dummies temporales que recojan esa
evolucin (transversalmente constante).
Intente estimar ese mismo modelo utilizando una estimacin de panel con efectos fijos
transversales y SIN efectos temporales. Qu sucede? Arregle el problema planteando una
correccin adecuada?
Al intentarlo, obtenemos el mensaje (near singular matrix). Esto sucede porque algunas de las
variables NO PRESENTAN variabilidad transversal (como black, hisp o educ). La nica manera
de poder realizar una estimacin de efectos fijos es eliminar estas variables de la ecuacin:
Effects Specification
En este nuevo modelo, obtenemos valores sensiblemente diferentes de los parmetros, quiz menos
sesgados. Dos preguntas son interesantes:
Replantee ahora el modelo tomando slo las variables exper, expersq, married y unin e intente una
estimacin de efectos fijos transversales incluyendo adems efectos fijos temporales. Qu sucede?
Plantee una solucin al problema.
- Lo que sucede es que, al incluir dicotmicas temporales, no podemos utilizar ninguna variable
montonamente creciente dado que generamos multicolinealidad exacta. Esto es lo que sucede
con la variable Exper.
Effects Specification
- Los parmetros son muy similares a los anteriores por lo que esas time dummies podran no ser
necesarias. Al eliminar exper, no podemos observar el efecto lineal de la experiencia pero si el
efecto cuadrtico.
Effects Specification
En teora, habamos quedado que la variable educ no poda introducirse en la regresin por ser
constante. Efectivamete, esto NO PUEDE HACERSE, pero s podemos incluir la interaccin de esta
variable con las ficticias de modo que podamos observar cmo ha ido ganando/perdiendo importancia con
el paso del tiempo respecto al ao 1980. Dado que no podemos computar el efecto base de 1980 no
podemos computar el efecto sobre el salario (rendimiento de la educacin) pero s la variacin de ese
rendimiento a lo largo de los aos.
Com puede observarse, el resultado es interesante y refleja que, progresivamente, el rendimiento salarial
de la educacin se ha ido reduciendo a partir de 1983.
Effects Specification