María Teresa González Valencia
Luis Alejandro Villacorta Devoto
• ¿Ajuste de qué?
• ¿En qué caso el ajuste sería perfecto?
• ¿Ajuste de qué?
• ¿En qué caso el ajuste sería perfecto?
𝑌𝑖 = 𝑌𝑖 + 𝑒𝑖
തො 2 + 𝑒𝑖2
ത 2 = (𝑦ො𝑖 − 𝑦)
(𝑦𝑖 − 𝑦)
SCT = SCE + SCR
Partición de la variación de Yi en 2 componentes:
𝑆𝐶𝑇 = 𝑆𝐶𝐸 + 𝑆𝐶𝑅
El coeficiente de determinación (𝒓𝟐 , 𝑹𝟐 ) como medida de bondad de ajuste
σ(𝑌𝑖 − 𝑌)
ത 2 𝑆𝐶𝐸
𝑅2 = = • Mide la proporción de la variación
ത
σ(𝑌𝑖 − 𝑌) 2 𝑆𝐶𝑇
total en Y explicada por el modelo
de regresión
σ 2
𝑒𝑖 • Es una constante no negativa
𝑅2 = 1 −
σ(𝑌𝑖 − 𝑌)ത 2 • Toma valores entre 0 y 1, inclusive
𝑆𝐶𝑅
=1−
𝑆𝐶𝑇
¿Qué sucede cuando el 𝑹𝟐 es igual a cero? ¿Y cuándo es igual a 1?
𝟏) 𝑹𝟐
Consideraciones:
a) La variable Y debe ser la misma en los modelos
b) Las observaciones deben ser las mismas
c) El período de análisis (corte transversal) debe ser el mismo
d) Aumenta cuando añadimos más variables explicativas al modelo
2) 𝑹𝟐 ajustado
𝑛−1
𝑅ത 2 = 1 – (1-𝑅2 )( )
𝑛−(𝑘+1)
¿Qué se ha corregido? ¿Qué problema se mantiene?
3)𝑪𝒓𝒊𝒕𝒆𝒓𝒊𝒐 𝒅𝒆 𝒊𝒏𝒇𝒐𝒓𝒎𝒂𝒄𝒊ó𝒏 𝑨𝒌𝒂𝒊𝒌𝒆
2𝑘 𝑆𝑅𝐶
𝐿𝑛 𝐶𝐼𝐴= = 𝑛
+ ln(𝑛
)
2)𝑪𝒓𝒊𝒕𝒆𝒓𝒊𝒐 𝒅𝒆 𝒊𝒏𝒇𝒐𝒓𝒎𝒂𝒄𝒊ó𝒏 𝑺𝒄𝒉𝒘𝒂𝒓𝒛
𝑘 𝑆𝑅𝐶
𝐿𝑛 𝐶𝐼𝑆= = 𝑛 ln(𝑛) + ln( )
𝑛
¿En qué criterios la penalización es mayor? ¿Se prefiere un valor mayor o menor?
¿Con qué criterios puedo predecir dentro y fuera de la muestra? ¿En qué criterios la
variable Y debe ser la misma entre modelos para poder comparar?
• Matriz de varianzas y covarianzas
𝐸 𝑢 − 𝐸(𝑢) 𝑢 − 𝐸(𝑢) ′
𝐸 𝑢−0 𝑢−0 ′ =𝐸 𝑢 𝑢 ′
𝑢1
𝑢2 𝑢12 𝑢1 𝑢2 … 𝑢1 𝑢𝑛
.. 𝑢22 … 𝑢1 𝑢𝑛
𝐸 𝑢1 𝑢2 … 𝑢3 = 𝐸 𝑢2.𝑢1 . … .
.
𝑢𝑛 𝑢𝑛 𝑢1 𝑢𝑛 𝑢2 … 𝑢𝑛2
𝐸(𝑢12 ) 𝐸(𝑢1 𝑢2 ) . . . 𝐸(𝑢1 𝑢𝑛 ) 𝜎2 0 … 0
= 𝐸(𝑢2. 𝑢1 ) 𝐸(𝑢22 ) .. . 𝐸(𝑢2 𝑢𝑛 ) = 0 𝜎2 …
… 0.
. .. . . . .
𝐸(𝑢𝑛 𝑢1 ) 𝐸(𝑢𝑛 𝑢2 ) .. . 𝐸(𝑢𝑛2 ) 0 0 … 𝜎2
𝐸(𝑢12 ) 𝐸(𝑢1 𝑢2 ) . . . 𝐸(𝑢1 𝑢𝑛 ) 𝜎2 0 … 0
= 𝐸(𝑢2. 𝑢1 ) 𝐸(𝑢22 ) . . . 𝐸(𝑢2 𝑢𝑛 ) = 0 𝜎2 … 0.
…
. .. . . . .
𝐸(𝑢𝑛 𝑢1 ) 𝐸(𝑢𝑛 𝑢2 ) . . . 𝐸(𝑢𝑛2 ) 0 0 … 𝜎2
𝐸 𝑢𝑢′ = 𝜎 2 I
Matriz de varianzas y covarianzas de la perturbación.
«Matriz escalar»
• Matrices P y M: simétricas, idempotentes y ortogonales
𝑃 = 𝑋 𝑋′𝑋 −1 𝑋 ′ 𝑦 𝑀 = 𝐼 − 𝑋 𝑋′𝑋 −1 𝑋′
𝑦ො = 𝑋 𝑋 ′ 𝑋 −1 𝑋 ′ y = Py
e= 𝐼 − 𝑋 𝑋 ′ 𝑋 −1 𝑋 ′ 𝑦 = 𝑀𝑦
𝑀𝑒 = 𝑀𝑀𝑒 = 𝑀𝑦 = 𝑒
𝑀𝑋 = 𝐼 − 𝑃 𝑋 = 𝑋 − 𝑃𝑋 = 𝑋 − 𝑋 = 0
• Varianza desconocida:
𝜎 2 → 𝜎ො 2
e= 𝑦 − 𝑋𝛽መ = 𝑦 − 𝑋 𝑋 ′ 𝑋 −1
𝑋′𝑦
= 𝐼 − 𝑋 𝑋′𝑋 −1
𝑋′ 𝑦 = 𝑀𝑦
• Además:
e= 𝐼 − 𝑋 𝑋 ′ 𝑋 −1 𝑋′ 𝑦
= 𝐼 − 𝑋 𝑋′𝑋 −1 𝑋′ 𝑋𝛽 + 𝑢
= 𝑋𝛽 − 𝑋 𝑋 ′ 𝑋 −1 ′
𝑋 𝑋𝛽 + 𝑢 − 𝑋 𝑋 ′ 𝑋 −1 ′
𝑋𝑢
• Además:
= 𝑋𝛽 − 𝑋𝛽 + 𝐼 − 𝑋 𝑋 ′ 𝑋 −1
𝑋′ 𝑢
𝐼 − 𝑋 𝑋′𝑋 −1 𝑋′ 𝑢
= 𝑀𝑢
𝑒 ′ 𝑒 = 𝑢′ 𝑀′ 𝑀𝑢 = 𝑢′ 𝑀𝑢
𝐸 𝑒 ′ 𝑒 = 𝐸 𝑢′ 𝑀𝑢 = 𝑡𝑟𝐸 𝑢′ 𝑀𝑢 = E 𝑡𝑟(𝑢′ 𝑀𝑢)
= E 𝑡𝑟(𝑢′ 𝑀𝑢) = 𝑡𝑟𝑀𝐸 𝑢𝑢′ = 𝑡𝑟𝑀𝜎 2 𝐼
= 𝜎 2 𝑡𝑟𝑀 = 𝜎 2 (𝑛 − (𝑘 + 1))
𝑡𝑟𝑀 = 𝑡𝑟 𝐼𝑛𝑥𝑛 − 𝑋 𝑋 ′ 𝑋 −1 𝑋′ = 𝑡𝑟𝐼𝑛𝑥𝑛 − 𝑡𝑟𝑋 𝑋 ′ 𝑋 −1 𝑋′
= 𝑛 − (𝑘 + 1)
• Entonces:
𝐸[𝑒 ′ 𝑒] 𝑒 ′𝑒
2
𝜎 = 𝜎ො 2 =
𝑛 − (𝑘 + 1) 𝑛 − (𝑘 + 1)
• Toda vez que
2
𝑒 ′𝑒 𝐸(𝑒 ′ 𝑒) 𝜎 2 [𝑛 − 𝑘 + 1 ]
𝐸 𝜎ො =𝐸 = = = 𝜎2
𝑛 − (𝑘 + 1) 𝑛 − (𝑘 + 1) 𝑛 − (𝑘 + 1)
• CONCEPTOS PREVIOS
• Las propiedades del estimador MCO se establecen
bajo el supuesto de normalidad.
• Los estimadores son funciones lineales de Y (también de µ)
• Si µ ~ N(0, 𝜎 2 ) … Entonces los estimadores también tienen
distribución normal.
• Pruebas de hipótesis sencillas
• Estadísticos t, F y 𝑋 2
[Link]:
𝐸(𝛽መ1 )=𝛽1
[Link]
𝜎2 𝜎 2
𝑉𝑎𝑟 𝛽መ1 = 𝑛 2
= ൗ𝑆𝐶𝑇
σ𝑖=1(𝑥𝑖 − 𝑥)ҧ 𝑥
[Link]: 𝐸(𝛽መ1 )=𝛽1
[Link]: 𝐸 𝛽መ1 =𝛽1
𝑛 𝑛 𝑛
𝛽መ1 = 𝑥𝑖 − 𝑥ҧ 𝛽0 + 𝑥𝑖 − 𝑥ҧ 𝛽1 𝑥𝑖 + (𝑥𝑖 − 𝑥)𝑢
ҧ 𝑖
𝑖=1 𝑖=1 𝑖=1
𝑛 𝑛 𝑛
= 𝛽0 ( 𝑥𝑖 − 𝑥)ҧ + 𝛽1 𝑥𝑖 − 𝑥ҧ 𝑥𝑖 + (𝑥𝑖 − 𝑥)𝑢
ҧ 𝑖
𝑖=! 𝑖=1 𝑖=1
[Link]:
𝛽መ1 = 𝛽1 + (𝑥𝑖 − 𝑥)𝑢
ҧ 𝑖 /𝑆𝑆𝑇𝑥
𝑖=1
𝐸(𝛽መ1 )=𝛽1
2. Eficiente:
𝑛
𝑉𝑎𝑟 𝛽መ1 = 𝜎 2 / 𝑥𝑖 − 𝑥ҧ 2
= 𝜎 2 /𝑆𝐶𝑇𝑥
𝑖=1
2. Eficiente:
σ𝑛𝑖=1 𝑥𝑖 − 𝑥ҧ 𝑢𝑖
𝛽መ1 = 𝛽1 +
𝑆𝐶𝑇𝑥
= 𝛽1 + (1/𝑆𝐶𝑇𝑥 ) 𝑑𝑖 𝑢𝑖
𝑖=1
2. Eficiente:
• No correlación serial de
perturbaciones.
• Las Xi son fijas, no aleatorias.
• Perturbaciones homoscedásticas.
𝑉𝑎𝑟 𝛽መ1 = 𝜎 2 / 𝑥𝑖 − 𝑥ҧ 2 = 𝜎 2 /𝑆𝑆𝑇𝑥
𝑖=1
• En el modelo de regresión lineal, el estimador de
mínimos cuadrados es el mejor estimador lineal e
insesgado del parámetro.
• Demostración: Se propone un estimador distinto, pero
de similares propiedades.
𝛽෨ = 𝑋 ′ 𝑋 −1
𝑋′ + 𝐴 𝑦
• Insesgadez:
𝛽෨ = 𝑋 ′ 𝑋 −1 𝑋 ′ + 𝐴 𝑋𝛽 + 𝜇 = 𝛽 + 𝐴𝑋𝛽 + 𝑋 ′ 𝑋 −1 𝑋 ′ +𝐴 𝜇
𝐸 𝛽෨ = 𝛽 + 𝐴𝑋𝛽 + 𝑋 ′ 𝑋 −1
𝑋 ′ + 𝐴 E 𝜇 = β + 𝐴𝑋𝛽
• Debe cumplirse: AX = Φ
• Entonces:
𝐸 𝛽෨ = 𝛽
• Varianza:
′
𝑉𝑎𝑟 𝛽෨ = 𝐸( 𝛽෨ − 𝛽 𝛽෨ − 𝛽 )
=𝐸 𝑋′𝑋 −1
𝑋 ′ + 𝐴 𝑢𝑢′ 𝑋 ′ 𝑋 −1
𝑋′ + 𝐴 ′
=𝐸 𝑋′𝑋 −1
𝑋 ′ 𝑢𝑢′ 𝑋 𝑋 ′ 𝑋 −1
+ 𝐴𝐴′
• Diferencia entre varianzas:
𝑉𝑎𝑟 𝛽෨ − 𝑉𝑎𝑟 𝛽መ = 𝜎 2 𝑋 ′ 𝑋 −1 + 𝐴𝐴′ − 𝑋 ′ 𝑋 −1 = 𝜎 2 𝐴𝐴′
𝑉𝑎𝑟 𝛽෨ − 𝑉𝑎𝑟 𝛽መ = 𝜎 2 𝐴𝐴′ ≥ 0
• Insesgadez:
lim 𝐸 𝜃𝑛 = 𝜃
𝑛→∞
• Ejemplo:
σ(𝑋𝑖 − ത 2
𝑋)
𝑠2 =
𝑛
1
𝐸 𝑆2 = 𝜎 2 (1 − )
𝑛
• Consistencia: lim 𝑃 𝜃መ − 𝜃 < 𝛿 = 1 𝛿>0
𝑛→∞