0% encontró este documento útil (0 votos)
2 vistas7 páginas

Modelos de Datos de Panel Explicados

Cargado por

marcsll1902
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
2 vistas7 páginas

Modelos de Datos de Panel Explicados

Cargado por

marcsll1902
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Modelos con datos de panel

1. Introducción
Un modelo utiliza datos de panel cuando la información en la que se basa proviene de
distintos individuos o de diferentes regiones y, además, dicha información se recoge a lo
largo de un periodo temporal.
El objetivo de este tipo de modelos es, por tanto, el de recoger el comportamiento
heterogéneo (individual) de los individuos, no solo en un momento determinado, sino a lo
largo del tiempo. En esta sentencia, se pueden observar dos factores fundamentales que
pueden tener efecto o no en la variable explicada:
• Efectos individuales. Recogen la respuesta diferencial de los individuos ante un
fenómeno concreto, con independencia del periodo de tiempo
• Efectos temporales. Recoge la respuesta común de todos los individuos, pero
diferente en cada momento del tiempo, ante un mismo fenómeno
* Por ejemplo, si se tiene el modelo 𝑦 = 𝛽0 + 𝛽1 𝑥 donde y es la nota y x las horas de
estudio, se pueden definir los siguientes efectos:
• Efectos individuales. Factores como las capacidades innatas o la forma en que
afronta el estudio modificará la relación entre la nota y las horas de estudio
• Efectos temporales1. Factores como la dificultad específica del curso
(evolutivo) o la llegada de una pandemia (concreto) pueden modificar como se
afectan las horas de estudio a la nota.
Adicionalmente, existen especificaciones de modelos que no tienen en cuenta ni los efectos
individuales ni los temporales, y otros tipos que tienen en cuenta ambos factores.
2. Especificaciones de los modelos de datos de panel
• Especificación general
El panel de datos se compone de N individuos observados durante T periodos
temporales. Por tanto, se tienen N x T observaciones de cada una de las variables X
(datos de panel balanceado, sin faltantes):

1 2 … t … T
1 X11 X12 … X1t … X1T
2 X21 X22 … X2t … X2T
… … … … … … …
i Xi1 Xi2 … Xit … XiT
… … … … … … …
N XN1 XN2 … XNt … XNT

De esta forma, 𝑋𝑖𝑡 es la observación de la variable X para el individuo i en el instante


de tiempo t.
No obstante, las bases de datos de panel que se suelen observar en la práctica tienen
una forma más parecida a la del siguiente ejemplo:

1Los efectos temporales deben ser una característica del tiempo, no el tiempo en sí, por tanto, el curso no
sería un factor temporal. Además, dicha característica ha de afectar a todos los individuos
La especificación general de un modelo con datos de panel con K variables
explicativas sería la siguiente:
𝑌𝑖𝑡 = 𝛼𝑖 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
donde:
▪ 𝑌𝑖𝑡 es la matriz que recoge la información de la variable explicada de cada
individuo en cada momento de tiempo
▪ 𝛼𝑖 no es constante ya que puede variar según el individuo. De esta forma se
recoge el comportamiento distinto de cada individuo
▪ Cada 𝛽 es la mima para todos los individuos y periodos de tiempo, ya que se
asume que el efecto de las variables explicativas sobre la respuesta es el mismo
para todos los individuos y periodos de tiempo.
* Sobre el ejemplo de la relación entre horas de estudio y nota obtenida, si se
supone que cada 𝛽 es la misma para todos los individuos y periodos de
tiempo, la contribución de las horas de estudio a la nota es independiente de
las capacidades de los estudiantes y de la dificultad del curso
• Modelo de coeficientes constantes (pool de datos)
Esta especificación supone que todos los individuos se comportan de la misma forma,
de forma que no hay diferencias ni en las pendientes ni en las constantes. Con estos
supuestos, la especificación sería:
𝒀𝒊𝒕 = 𝜶 + 𝜷𝟏 𝑿𝟏 𝒊𝒕 + 𝜷𝟐 𝑿𝟐 𝒊𝒕 + ⋯ + 𝜷𝒌 𝑿𝒌 𝒊𝒕 + 𝒖𝒊𝒕
Este modelo presenta como principal problema que se oculta la heterogeneidad
(individualidad) que puede existir entre los distintos individuos y momentos de tiempo.
Esta heterogeneidad se subsume en el término de perturbación 𝑢𝑖𝑡 , lo que hace muy
posible que éste se correlacione con alguna de los regresores del modelo. Esto puede
provocar que la estimación de los coeficientes esté sesgada, además de ser
inconsistente.
* Sobre el ejemplo de la relación entre horas de estudio y nota obtenida, se supone
la siguiente situación con 3 individuos y 3 notas por individuo:

Como se puede ver, aunque con pendientes distintas, todos los individuos
obtuvieron una nota mayor a medida que se incrementaba el número de horas de
estudio. Sin embargo, si ajustamos los puntos mediante una recta de regresión, se
obtiene la conclusión contraria (la nota disminuye a medida que aumenta el número
de horas de estudio):
Como solución a este problema se han de plantear modelos de tomen en cuenta los
factores individuales
• Modelo de efectos fijos individuales MCVD
Este modelo considera que sí existen diferencias de comportamientos entre los
individuos, pero no diferencias a lo largo del tiempo. De esta forma, todas las
pendientes parciales son las mismas, pero la constante difiere entre cada individuo.
Por tanto, la estimación de mínimos cuadrados con variables dicotómicas (MCVD)
parte de la especificación general
𝑌𝑖𝑡 = 𝛼𝑖 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
a la que se agrega una variable dicotómica por cada individuo (excepto para el que se
toma como base). Cada variable dicotómica 𝐷𝑖 (𝑖 ∈ 2. . . 𝑁) toma valor 1 para el
individuo i y 0 para el resto.
De esta forma, la ecuación a estimar queda así:
𝒀𝒊𝒕 = 𝜶𝟏 + 𝜶𝟐 𝑫𝟐 + ⋯ + 𝜶𝑵 𝑫𝑵 + 𝜷𝟏 𝑿𝟏 𝒊𝒕 + 𝜷𝟐 𝑿𝟐 𝒊𝒕 + ⋯ + 𝜷𝒌 𝑿𝒌 𝒊𝒕 + 𝒖𝒊𝒕
* Importante. Si se tienen dos individuos, podrían plantearse 2 modelos de la
siguiente forma:

▪ 𝑌1𝑡 = 𝛼1 + 𝛽1 𝑋1 𝑖𝑡 + 𝑢𝑖𝑡
▪ 𝑌2𝑡 = 𝛼2 + 𝛽1 𝑋1 𝑖𝑡 + 𝑢𝑖𝑡

Pero si se quiere plantear un modelo de efectos fijos individuales MCVD, se ha de


tener en cuenta que, dado el siguiente modelo:
𝑌𝑖𝑡 = 𝛼1 + 𝛼 ′ 2 𝐷2 + 𝛽1 𝑋1 𝑖𝑡 + 𝑢𝑖𝑡
el alfa del individuo 2 es 𝛼 ′ 2 = 𝛼2 + 𝛼1 . Por ejemplo, a partir de la siguiente salida
de R, que muestra los resultados de un modelo estimado por MCVD:

se tiene que 𝛼2 = −1.31𝑥105 + 6.01𝑥105

El principal inconveniente de este método es que si el número de individuos es muy


elevado, pueden aparecer problemas de multicolinealidad por la falta de grados de
libertad. Esto dificulta la estimación del modelo o, si se puede estimar, que el valor de
𝑅2 sea cercano a cero. En estos casos, se puede sustituir este método por alguno de
los siguientes modelos.
• Modelo de efectos fijos individuales DG
Al igual que el anterior, éste es un modelo de efectos individuales: considera que sí
existen diferencias de comportamientos entre los individuos, pero no diferencias a lo
largo del tiempo. Como consecuencia, todas las pendientes parciales son las mismas,
pero la constante difiere entre cada individuo.
Además, esta especificación supone que las diferencias entre individuos dependen
del valor de las variables explicativas, i.e. 𝑐𝑜𝑣(𝛼𝑖 , 𝑋𝑘𝑖 ) ≠ 0
A diferencia de MCVD, el estimador de efectos fijos dentro del grupo (within) expresa
los valores de las variables dependiente y explicativas de cada individuo como
desviaciones de sus respectivos valores medios. Es decir, a cada observación 𝑌𝑖𝑡 le
restamos la media temporal 𝑌̅𝑖 . Si 𝑌𝑖𝑡 = 𝛼𝑖 + 𝛽𝑋𝑖𝑡 + 𝑢𝑖𝑡 , entonces 𝑌
̅𝑖 = 𝛼𝑖 + 𝛽𝑋̅𝑖 . 2

La especificación general de este modelo tiene la siguiente forma:


̅𝑖 = 𝛼𝑖 + 𝛽𝑋𝑖𝑡 + 𝑢𝑖𝑡 − 𝛼𝑖 − 𝛽𝑋̅𝑖 = 𝛽𝑋𝑖𝑡 − 𝛽𝑋̅𝑖 + 𝑢𝑖𝑡 = 𝛽(𝑋𝑖𝑡 − 𝑋̅𝑖 ) + 𝑢𝑖𝑡
𝑌𝑖𝑡 − 𝑌
Por tanto:
𝒀𝒊𝒕 − 𝒀̅𝒊 = 𝜷(𝑿𝒊𝒕 − ̅̅̅
𝑿𝒊 ) + 𝒖𝒊𝒕

Esta ecuación se puede estimar por MCO para obtener 𝛽̂ , que a su vez se utiliza para
obtener 𝛼̂𝑖 :
̅𝑖 − 𝛽̂ 𝑋̅𝑖
𝛼̂𝑖 = 𝑌

* Restar a cada uno de los valores la media de la variable en cuestión supone


desplazar los puntos hacia la ordenada en el origen. Por tanto, la situación del
ejemplo anterior (con los puntos ya ajustados) sería la siguiente.

Como se puede ver, en este caso, sí que se llegaría a la conclusión que cabría
esperar: al aumentar el número de horas de estudio, la nota también aumenta.

Este método supera el problema que tenía el anterior (MCVD) ya que en este caso no
son necesarios tantos grados de libertad, por lo que se evita el problema de la
multicolinealidad.
• Modelo de efectos individuales aleatorio
El modelo de efectos aleatoria considera que hay diferencias entre los individuos
(𝛼𝑖 en los modelos anteriores), pero que estas no son fijas, sino que es una variable
aleatoria que se distribuye normalmente con valor medio igual a 𝛼 (sin subíndice). Este
modelo supone que las diferencias entre individuos son independientes del valor de
las variables explicativas, i.e. (𝛼𝑖 , 𝑋𝑘𝑖 ) = 0
El valor del intercepto para un individuo se expresaría como:
𝛼𝑖 = 𝛼 + 𝜀𝑖
donde 𝜀𝑖 es un término de error aleatorio con valor medio igual a 0 y varianza 𝜎𝜀2 .

2 Nótese que la media de 𝑢𝑖𝑡 es cero, que 𝛼̅𝑖 = 𝛼𝑖 porque 𝛼𝑖 no cambia en el tiempo y que 𝛽̅𝑖 = 𝛽𝑖 .
De esta forma, la especificación general
𝑌𝑖𝑡 = 𝛼𝑖 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
se transforma en

𝑌𝑖𝑡 = (𝛼 + 𝜀𝑖 ) + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
o, de forma equivalente
𝒀𝒊𝒕 = 𝜶 + 𝜷𝟏 𝑿𝟏 𝒊𝒕 + 𝜷𝟐 𝑿𝟐 𝒊𝒕 + ⋯ + 𝜷𝒌 𝑿𝒌 𝒊𝒕 + 𝒖𝒊𝒕 + 𝜺𝒊
que equivale a
𝑌𝑖𝑡 = 𝛼 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑤𝑖𝑡
donde 𝑤𝑖𝑡 = 𝜀𝑖 + 𝑢𝑖𝑡 .

De esta forma, el término del error compuesto 𝑤𝑖𝑡 consta de dos componentes:
▪ El error específico del individuo (𝜀𝑖 ), que es constante durante todos los periodos
de tiempo. Por ejemplo, 𝜀𝑖 podría recoger la capacidad de aprendizaje de cada
individuo (los individuos con mayor capacidad tendrán un error más alto)
▪ La combinación del componente de error de series de tiempo y corte
transversal (𝑢𝑖𝑡 ), es decir, el error de cada individuo en cada momento del
tiempo. Este error también recibe el nombre de error idiosincrático
• Modelo de efectos temporales
En los modelos anteriores se considera que existen diferencias de comportamiento
entre los individuos, pero que este comportamiento no cambia a lo largo del tiempo.
Nada impide que se pueda modelar de forma inversa: existen diferencias temporales
de comportamiento en los distintos instantes de tiempo, pero que el comportamiento
es el mismo para todos los individuos.
La especificación general de un modelo que contemple los efectos temporales sería:
𝑌𝑖𝑡 = 𝛼𝑡 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
A su vez, esta especificación general se podría estimar por un método de efectos fijos
o de efectos aleatorios, para lo cual bastaría con trasponer la matriz.

• Modelo de efectos individuales y temporales


En este caso, se considera que existen diferencias de comportamiento entre individuos
y a lo largo del tiempo simultáneamente. Este modelo supone las mismas pendientes
para todos los individuos en todos los periodos de tiempo, si bien la ordenada en el
origen cambia para cada individuo en cada momento de tiempo.
En consecuencia, la especificación general sería la siguiente:
𝑌𝑖𝑡 = 𝛼𝑖𝑡 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
Existen diversos métodos de estimación de este modelo. En una estimación MCVD,
se introducirían tantas variables ficticias como individuos + periodos, para luego aplicar
mínimos cuadrados ordinarios:

▪ 𝑁 − 1 variables para los individuos. 𝐷𝑖 = 1 para el individuo i, y 𝐷𝑖 = 1 para


el resto.
▪ 𝑇 − 1 variables para los períodos. 𝑍𝑡 = 1 en el periodo t, y 𝑍𝑡 = 0 para el
resto.
De esta forma, la ecuación a estimar queda así:
𝑌𝑖𝑡 = 𝛼1 + 𝛼2 𝐷2 + ⋯ + 𝛼𝑁 𝐷𝑁 + 𝛾2 𝑍2 + ⋯ + 𝛾𝑇 𝑍𝑇 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
• Modelo con todos los coeficientes distintos
Este modelo asume que existen diferencias de comportamiento entre los individuos
tanto en la parte exógena del modelo como en el impacto de cada variable explicativa.
Es decir los 𝛼 y 𝛽 son distintos para cada individuo e instante del tiempo.
En consecuencia, la especificación sería la siguiente:
𝑌𝑖𝑡 = 𝛼𝑖 + 𝛽1𝑖 𝑋1 𝑖𝑡 + 𝛽2𝑖 𝑋2 𝑖𝑡 + ⋯ + 𝛽𝑘𝑖 𝑋𝑘 𝑖𝑡 + 𝑢𝑖𝑡
Esta especificación no se considera modelo de datos de panel porque en realidad es
equivalente a una regresión para cada individuo de forma independiente
3. Selección de modelos de datos de panel
• Contraste de homogeneidad
El contraste de homogeneidad sirve para elegir entre pool de datos y un modelo de
efectos fijos (ya sea MCVD o DG) ya que consiste en comparar los 𝛼 del modelo de
efectos fijos. Más concretamente, el test es el siguiente:

Como se puede ver, la hipótesis nula afirma que no hay diferencias entre los individuos
(o periodos de tiempo), en cuyo caso, es preferible utilizar el modelo de pool de datos.
La hipótesis alternativa afirma que existen diferencias entre los individuos (o periodos
de tiempo), por lo que conviene utilizar un modelo que lo tenga en cuenta.
Para hacer el contraste se calcula el estadístico 𝐹 ∗ , que se distribuye como una
𝐹𝑁−1,𝑁·𝑇−𝐾 y que se obtiene de la siguiente forma:
2 2
𝑅𝐸𝐼 − 𝑅𝑃𝐷
𝐹∗ = 𝑁−1
2
1 − 𝑅𝐸𝐼
𝑁·𝑇−𝐾
donde:
▪ 2
𝑅𝐸𝐼 es el 𝑅2 del modelo de efectos individuales
▪ 2
𝑅𝑃𝐷 es el 𝑅2 del modelo de pool de datos
▪ N es el número de individuos
▪ T es el número de periodos de tiempo considerados
▪ K es el número de variables independientes utilizadas en los modelos
La idea, por tanto, es estimar ambos modelos, calcular los 𝑅2 y, con estos, obtener el
estadístico 𝐹 ∗ .
Si 𝐹 ∗ < 𝐹𝑁−1,𝑁·𝑇−𝐾 , se utilizará el modelo del pool de datos (la hipótesis nula no es
rechazada puesto que 𝐹 ∗ es pequeña y por tanto el p-valor es elevado). En caso
contrario, se elegirá el modelo de efectos individuales.
• Contraste de Hausman
El contraste de Hausman se utiliza para elegir entre un modelo de efectos fijos y uno
de efectos aleatorios.
La hipótesis nula es que no hay diferencias significativas entre los estimadores de
ambos modelos, es decir, si 𝛽 es el estimador del modelo efectos fijos de un modelo
con una variable explicativa y 𝛽′ es el estimador del modelo de efectos aleatorios de
un modelo con la misma característica, la hipótesis nula es:
𝐻0 : 𝛽 = 𝛽′
Si se rechaza esta hipótesis (p-valor lo suficientemente bajo), es probable que los
efectos aleatorios estén correlacionados con algunas de las variables independientes
(i.e. 𝑐𝑜𝑣(𝛼𝑖 , 𝑋𝑘𝑖 ) ≠ 0), por lo que es preferible el modelo de efectos fijos. En cambio,
si no se rechaza la hipótesis, es preferible elegir un modelo de efectos aleatorios,
cuyos estimadores son más eficientes (puesto que consumen menos grados de
libertad).

• Consideraciones en la elección de modelo


Para elegir entre utilizar un modelo de efectos fijos o uno de efectos aleatorios hay
que reflexionar sobre la correlación de los errores específicos (𝜀𝑖 ) con las variables
regresoras. Si se supone que 𝜀𝑖 no está correlacionado con las X, un modelo de
efectos aleatorios puede resultar más apropiado; pero si se asume correlación, un
modelo de efectos fijos puede ser más adecuado.
Hay que tener en cuenta también que los modelos de EA parten del supuesto de que
los individuos se han extraído como una muestra aleatoria de una población más
grande. Esto no será así, por ejemplo, si se estudia un panel con las 17 Comunidades
Autónomas. Como es lógico, no se puede suponer que éstas son una muestra de las
comunidades.
Otras observaciones que pueden resultar de utilidad son:
▪ Si T es grande respecto a N, es probable que haya muy poca diferencia entre
las estimaciones por EF y EA. En este caso es preferible utilizar EF por la
conveniencia de cálculo3.
▪ Cuando N es grande respecto a T, las estimaciones por EF y EA pueden variar
de forma importante. EF resulta adecuado si se piensa que los individuos de la
muestra no se extrajeron de forma aleatoria. En caso de suponer extracción
aleatoria, el modelo de EA es el adecuado ya que permite hacer inferencia
estadística. En este último caso, se sabe también que los estimadores de EA
son más eficientes que los de EF.
▪ Los modelos de EA pueden estimar los coeficientes de las variables que no
cambian con el tiempo, como el género o el grupo sanguíneo. Los EF controlan
por estas variables, pero no pueden estimarlas directamente. Por ejemplo, si se
tiene el siguiente modelo, tanto 𝛼𝑖 como 𝛽2 recogen el efecto de GENERO:

𝑌𝑖𝑡 = 𝛼𝑖 + 𝛽1 𝑋1 𝑖𝑡 + 𝛽2 GENERO𝑖𝑡 + 𝑢𝑖𝑡


Por otro lado, EF controla por todas las variables invariantes en el tiempo,
mientras que EA controla sólo por aquellas que se introducen explícitamente.

3
Aunque esto ya no tiene mucho sentido actualmente

También podría gustarte