Modelo de Regresión Lineal Simple
Análisis y Aplicación
Jorge D. Guerrero N.
Universidad Nacional del Caaguazu
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 1 / 18
Contenido
1 El Modelo de Regresión Simple
2 Estimación de los Parámetros
3 Medidas de Ajuste
4 Supuestos del Modelo
5 Propiedades de los MCO
6 Contrastes de Hipótesis
7 Intervalos de Confianza
8 Caso de Estudio
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 2 / 18
El Modelo de Regresión Simple
Especificación e Interpretación
Especificación del modelo
El modelo de regresión lineal simple se expresa como:
Yi = β0 + β1 Xi + εi
donde:
Yi : Variable dependiente (variable a explicar)
Xi : Variable independiente (variable explicativa)
β0 : Término constante (intercepto)
β1 : Coeficiente de pendiente (efecto de X sobre Y )
εi : Término de error aleatorio
Interpretación
β0 : Valor esperado de Y cuando X = 0
β1 : Cambio esperado en Y por un aumento unitario en X
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 3 / 18
Estimación de los Parámetros
Mı́nimos Cuadrados Ordinarios (MCO)
Función objetivo
Minimizar la suma de cuadrados de los residuos:
n
X
mı́n (Yi − βb0 − βb1 Xi )2
β
b0 ,β
b1
i=1
Condiciones de primer orden
n
∂S X
= −2 (Yi − βb0 − βb1 Xi ) = 0
∂ βb0 i=1
n
∂S X
= −2 (Yi − βb0 − βb1 Xi )Xi = 0
∂ βb1 i=1
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 4 / 18
Solución MCO
Estimadores de los parámetros
De las condiciones de primer orden se obtienen los estimadores MCO:
Para βb1
Pn
i=1 (Xi − X̄ )(Yi − Ȳ )
βb1 = Pn 2
i=1 (Xi − X̄ )
Para βb0
βb0 = Ȳ − βb1 X̄
Nota
Estos estimadores minimizan la suma de cuadrados de los residuos y proporcionan
la mejor lı́nea de ajuste a los datos.
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 5 / 18
Medidas de Ajuste
Coeficiente de Determinación R 2
Definición de R 2
SSR SSE
R2 = =1−
SST SST
donde:
Pn
SST = i=1 (Yi − Ȳ )2 (Suma total de cuadrados)
Pn
SSR = i=1 (Ŷi − Ȳ )2 (Suma de cuadrados de la regresión)
Pn
SSE = i=1 (Yi − Ŷi )2 (Suma de cuadrados de los errores)
Interpretación
R 2 mide la proporción de la variabilidad de Y explicada por X
0 ≤ R 2 ≤ 1 (valores cercanos a 1 indican mejor ajuste)
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 6 / 18
Error Estándar de la Regresión
Medida de la bondad del ajuste
Fórmula
v
u n r
u 1 X SSE
SER = t (Yi − Ŷi )2 =
n−2 n−2
i=1
Interpretación
Mide la desviación promedio de los puntos alrededor de la lı́nea de regresión
Valores más pequeños indican mejor ajuste
Se utiliza para evaluar la precisión de las predicciones
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 7 / 18
Supuestos del Modelo de Regresión Lineal
1 La relación entre X e Y es lineal
2 E [εi |Xi ] = 0
3 Var (εi |Xi ) = σ 2 (varianza constante)
4 Cov (εi , εj ) = 0 para i ̸= j
5 εi ∼ N(0, σ 2 ) para inferencia (opcional)
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 8 / 18
Propiedades de los MCO
Insesgadez
Prueba de insesgadez
P
(Xi − X̄ )(Yi − Ȳ )
E [β̂1 |X ] = E P X
(Xi − X̄ )2
P
(Xi − X̄ )((β0 + β1 Xi + εi ) − (β0 + β1 X̄ + ε̄))
=E P X
(Xi − X̄ )2
P
(Xi − X̄ )(εi − ε̄)
= β1 + E P X = β1
(Xi − X̄ )2
Resultado
Bajo los supuestos 1 y 2, los estimadores MCO son insesgados
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 9 / 18
Varianza de β̂1
Derivación de la fórmula
Cálculo de la varianza
P
(Xi − X̄ )(Yi − Ȳ )
Var (β̂1 |X ) = Var P X
(Xi − X̄ )2
P
(Xi − X̄ )εi
= Var P X
(Xi − X̄ )2
(Xi − X̄ )2 σ 2 σ2
P
= P 2 2
=P
[ (Xi − X̄ ) ] (Xi − X̄ )2
Interpretación
La varianza disminuye con mayor variabilidad de X
Mayor tamaño muestral reduce la varianza
Menor varianza del error (σ 2 ) reduce la varianza
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 10 / 18
Consistencia de los MCO
Prueba de consistencia
Condiciones para consistencia
1 β̂1 es insesgado (ya demostrado)
2 Var (β̂1 ) → 0 cuando n → ∞
Prueba
σ2
lı́m Var (β̂1 ) = lı́m Pn 2
i=1 (Xi − X̄ )
n→∞ n→∞
σ2
= 1
Pn =0
n · lı́mn→∞ n i=1 (Xi − X̄ )2
Resultado
Bajo los supuestos del modelo, β̂1 es un estimador consistente de β1
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 11 / 18
Contrastes de Hipótesis
Pruebas para β1
Estadı́stico de prueba
β̂1 − β1,0
t= ∼ tn−2
SE (β̂1 )
donde β1,0 es el valor hipotético bajo H0
Tipos de pruebas
Bilateral: H0 : β1 = c vs H1 : β1 ̸= c
Unilateral derecho: H0 : β1 ≤ c vs H1 : β1 > c
Unilateral izquierdo: H0 : β1 ≥ c vs H1 : β1 < c
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 12 / 18
Regiones de Rechazo
Tipo de prueba Hipótesis nula Región de rechazo
Bilateral H0 : β1 = c |t| > tn−2,1−α/2
Unilateral derecho H0 : β1 ≤ c t > tn−2,1−α
Unilateral izquierdo H 0 : β1 ≥ c t < −tn−2,1−α
Cuadro: Regiones de rechazo para diferentes pruebas de hipótesis
Nota
tn−2,1−α es el cuantil 1 − α de la distribución t-Student con n − 2 grados de
libertad
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 13 / 18
Intervalos de Confianza
Para el parámetro β1
Fórmula del intervalo de confianza
β̂1 ± tn−2,1−α/2 · SE (β̂1 )
Interpretación
Con (1 − α) × 100 % de confianza, el verdadero valor de β1 está contenido en
el intervalo
α es el nivel de significancia (usualmente 0.05, 0.01)
Para un IC al 95 %: α = 0,05
Nota
El intervalo de confianza proporciona un rango de valores plausibles para el
parámetro poblacional
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 14 / 18
Caso de Estudio
Relación entre educación e ingresos
Problema
Investigar la relación entre años de educación (X) e ingresos salariales (Y)
Datos
Muestra: 526 individuos
Variable X: Años de educación
Variable Y: salario por hora promedio (en $)
Objetivo
Estimar el efecto de un año adicional de educación sobre el ingreso salarial
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 15 / 18
Resultados del Análisis
Parámetro Estimación Error estándar
Intercepto (β0 ) -0.905 0.685
Pendiente (β1 ) 0.541 0.053
Cuadro: Resultados de la regresión
Interpretación
Por cada año adicional de educación, el ingreso aumenta en $0.541 en
promedio
Una persona sin educación tendrı́a un ingreso esperado de -$0.905 (?)
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 16 / 18
Medidas de Ajuste y Pruebas
Medidas de ajuste
R 2 = 0,165: 16.5 % de la variación en ingresos es explicada por la educación
SER = 3,378: Desviación estándar de los residuos es $3.378
Prueba de hipótesis
H0 : β1 = 0 vs H1 : β1 ̸= 0
t = 10,17 (valor p menor a 0.05 y a 0.01)
Rechazamos H0 : efecto estadı́sticamente significativo
Intervalo de confianza
IC 95 % para β1 : [0.436, 0.646]
Con 95 % de confianza, el efecto de un año de educación está entre $0.436 y
$0.646
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 17 / 18
Resumen del Caso de Estudio
Conclusiones
Existe una relación positiva y estadı́sticamente significativa entre educación e
ingresos
Cada año adicional de educación aumenta los ingresos en aproximadamente
$0.541
El modelo explica el 16.5 % de la variación en ingresos
Limitaciones
Posible omisión de variables relevantes (experiencia, habilidad)
Relación podrı́a no ser estrictamente lineal
Causalidad vs. correlación
Jorge D. Guerrero N. (Universidad Nacional del Caaguazu) Modelo de Regresión Lineal Simple 18 / 18