UNIDAD #2
Datos de Panel
Los datos de panel, a veces denominados datos longitudinales, son datos que contienen
observaciones sobre diferentes secciones transversales a lo largo del tiempo.
Hay una serie de ventajas de los datos de panel como:
• Los datos del panel pueden modelar los comportamientos comunes e individuales
de los grupos.
• Los datos del panel contienen más información, más variabilidad y más eficiencia
que los datos de series de tiempo puros o los datos transversales.
• Los datos del panel pueden detectar y medir efectos estadísticos que las series
de tiempo puras o los datos transversales no pueden.
• Los datos de panel pueden minimizar los sesgos de estimación que pueden surgir
de la agregación de grupos en una sola serie de tiempo.
¿Como se pueden aplicar en estudios en economía?
Microeconomía: PIB de microeconomía en varios países, desempleo en diferentes estados,
estudios de dinámica de ingresos, saldos de cuenta corriente internacional.
Macroeconomía: Tablas de comercio internacional, tablas socioeconómicas mundiales, tablas de
tipos de cambio.
Finanzas: Precios de las acciones por empresa, volatilidades del mercado por país o empresa.
¿Como se visualizan los datos de panel?
son una colección de cantidades obtenidas a través de múltiples individuos, que se reúnen en
intervalos uniformes en el tiempo y se ordenan cronológicamente.
Datos de Panel y Heterogeneidad
Se centra en abordar la posible dependencia entre las observaciones de datos dentro del mismo
grupo.
La principal diferencia entre los modelos de datos de panel y los modelos de series de tiempo es
que los modelos de datos de panel permiten la heterogeneidad entre grupos e introducen efectos
específicos de cada individuo.
¿Qué es heterogeneidad?
Se refiere a un grupo o mezcla compuesto por varios elementos diferentes y distinguibles a simple
vista.
Homogeneidad vs. Heterogeneidad
Son conceptos que se utilizan a menudo en las ciencias y estadísticas relacionadas con la
uniformidad de una sustancia u organismo.
Un material o imagen que es homogéneo es uniforme en composición o carácter.
Uno que es heterogéneo es claramente no uniforme en una de estas cualidades.
Homogeneidad de varianza
También llamada homocedasticidad. Se usa para describir un conjunto de datos que tiene la misma
varianza.
El principal objetivo de aplicar y estudiar los datos en panel:
Es capturar la heterogeneidad no observable, ya sea entre agentes económicos o de estudio, así
como también en el tiempo, dado que esta heterogeneidad no se puede detectar ni con estudios de
series temporales ni tampoco con los de corte transversal.
Técnicas de regresión de datos de panel: Regresión simple
Permite realizar un análisis más dinámico al incorporar la dimensión temporal de los datos, lo que
enriquece el estudio, particularmente en períodos de grandes cambios.
El modelo de regresión simple:
La relación y = f (x) puede estudiarse a través de un modelo econométrico simple:
En términos más formales, R2 indica: qué proporción de la variabilidad muestral total exhibida
por y viene explicada por x:
Modelo de Regresión Múltiple:
Es la extensión a k variables explicativas del modelo de regresión simple.
Las perturbaciones o errores aleatorios deben verificar las siguientes hipótesis:
• Su esperanza es cero
• Su varianza es constante
• Son independientes entre sí
• Su distribución es normal
Las regresiones multivariadas: tienen la gran ventaja de que los coeficientes de las variables
explicativas pueden interpretarse como efectos netos o ceteris paribus.
R-cuadrado:
En la regresión lineal múltiple, el 𝑅 2 representa el coeficiente de correlación entre los valores
observados de la variable de resultado (y) y los valores ajustados (es decir, predichos) de y. Por
ello, el valor de R siempre será positivo y oscilará entre cero y uno.
𝑅 2 representa la proporción de varianza, en la variable de resultado y, que se puede predecir
conociendo el valor de las variables x. Un valor de 𝑅 2 cercano a 1 indica que el modelo explica
una gran parte de la varianza en la variable de resultado.
Un problema con el 𝑅 2:
Es que siempre aumentará cuando se agreguen más variables al modelo, incluso si esas variables
solo están débilmente asociadas con la respuesta.
Una solución es ajustar el 𝑅 2 teniendo en cuenta el número de variables predictoras.
El ajuste en el valor "R cuadrado ajustado" en la salida de resumen es una corrección para el
número de variables x incluidas en el modelo de predicción.
Correlación lineal:
Para estudiar la relación lineal existente entre dos variables continuas es necesario disponer de
parámetros que permitan cuantificar dicha relación. Uno de estos parámetros es la covarianza, que
indica el grado de variación conjunta de dos variables aleatorias.
La covarianza:
Depende de las escalas en que se miden las variables estudiadas, por lo tanto, no es comparable
entre distintos pares de variables.
Las principales diferencias entre estos tres coeficientes de asociación son:
La correlación de Pearson. - funciona bien con variables cuantitativas que tienen una distribución
normal. Es más sensible a los valores extremos que las otras dos alternativas.
La correlación de Spearman. - se emplea cuando los datos son ordinales, de intervalo, o bien
cuando no se satisface la condición de normalidad para variables continuas y los datos se pueden
transformar a rangos. Es un método no paramétrico.
La correlación de Kendall. - es otra alternativa no paramétrica para el estudio de la correlación
que trabaja con rangos. Se emplea cuando se dispone de pocos datos y muchos de ellos ocupan la
misma posición en el rango, es decir, cuando hay muchas ligaduras.
La correlación lineal entre dos variables, además del valor del coeficiente de correlación y de su
significancia, también tiene un tamaño de efecto asociado. Se conoce como coeficiente de
determinación 𝑹 𝟐 . Se interpreta como la cantidad de varianza de 𝒀 explicada por.
Coeficiente de Pearson y el de Spearman, 𝑹 𝟐 se obtiene:
Elevando al cuadrado el coeficiente de correlación.
Kendall: no se puede calcular de este modo. (No he encontrado como se calcula).
Coeficiente de Pearson:
El coeficiente de correlación de Pearson es la covarianza estandarizada, y su ecuación difiere
dependiendo de si se aplica a una muestra, Coeficiente de Pearson muestral (r), o si se aplica la
población Coeficiente de Pearson poblacional (ρ).
REGRESIÓN CUADRÁTICA
El modelo de regresión cuadrática es una alternativa cuando el modelo lineal no logra un
coeficiente de determinación apropiado, o cuando el fenómeno en estudio tiene un comportamiento
que puede considerarse como parabólico.
Para ajustar un modelo de regresión cuadrático en R:
Basta con indicar en el argumento formula de la función lm que una de las variables independientes
está elevada al cuadrado mediante el símbolo ^2.
¿Por qué pasarnos a Rstudio?
Una gran ventaja que presenta el software Rstudio es que Incluye una consola, editor de sintaxis
que apoya la ejecución de código, así como herramientas para el trazado, la depuración y la gestión
del espacio de trabajo