ESTADISTICA Y PROBABILIDAD
UNMSM-FCF
REGRESION LINEAL
JAVIER CARDENAS TEODORO 04130014
DIAGRAMA DE DISPERSION
Un diagrama de dispersión (también llamado gráfico de dispersión o scatter plot) es
una representación gráfica que muestra la relación entre dos variables cuantitativas.
Cada punto en el gráfico representa una observación, donde la posición en el eje
horizontal (X) corresponde a la variable independiente, y la posición en el eje vertical (Y)
corresponde a la variable dependiente.
Características del Diagrama de Dispersión
1. Ejes:
Eje X: Representa la variable independiente.
Eje Y: Representa la variable dependiente.
2. Puntos:
Cada punto en el diagrama representa una observación de datos. La
posición del punto se determina por el valor de la variable independiente
(en X) y el valor de la variable dependiente (en Y).
3. Patrones:
Los diagramas de dispersión son útiles para visualizar la relación entre
las dos variables:
Relación positiva: Si los puntos tienden a subir de izquierda
a derecha, significa que a medida que aumenta X, también
aumenta Y.
Relación negativa: Si los puntos tienden a bajar de izquierda
a derecha, significa que a medida que aumenta X, Y
disminuye.
Sin relación: Si los puntos están dispersos sin ningún patrón
claro, puede no haber una relación lineal entre las variables.
ESTADISTICA Y PROBABILIDAD
UNMSM-FCF
AJUSTES DEL MODELO LINEAL
El análisis de regresión lineal es una técnica estadística que se utiliza para
investigar la relación entre dos variables cuantitativas. Su objetivo principal es
modelar la relación entre una variable dependiente (también llamada variable
de respuesta o Y) y una variable independiente (o explicativa, X) para predecir
los valores de la variable dependiente basados en la independiente.
Conceptos Básicos
1. Ecuación de la Regresión Lineal Simple:
𝒀 = 𝜷 𝟎 + 𝜷𝟏 𝑿 + 𝜺
Y: Variable dependiente o respuesta.
X: Variable independiente o explicativa.
𝛽0 : Intercepto de la recta. Es el valor de Y cuando X es 0.
𝛽1 : Pendiente de la recta. Indica el cambio en Y por cada unidad de cambio
en X.
𝜀: Termino del error que captura la variabilidad no explicada por la relación
lineal. “Residuo”
El error estándar de la estimación (también llamado error estándar residual) es una
medida que indica cuánto se desvían, en promedio, los valores observados de la
variable dependiente (Y) de los valores predichos por el modelo de regresión. En otras
palabras, mide la precisión de las predicciones hechas por el modelo.
𝟐
̂𝒊)
∑(𝒀𝒊 − 𝒀
𝑬𝑺 = √
𝒏−𝟐
𝐸𝑆 : Error estándar de la estimación.
𝑌𝑖 : Valores observados de la variable dependiente.
𝑌̂𝑖 : Valores predichos de la variable dependiente (calculados a partir de la
ecuación de regresión).
𝑛: Número de observaciones.
ESTADISTICA Y PROBABILIDAD
UNMSM-FCF
INTERPRETACION
Un 𝐸𝑆 bajo indica que los valores predichos están muy cercas de los
valores reales, es decir, el modelo tiene una buena precisión.
Un 𝐸𝑆 alto sugiere que hay una gran variabilidad entre los valores
observados y los valores predichos, lo que indica que el modelo no está
ajustando bien los datos.
METODO DE LOS MINIMOS CUADRADOS
El método de mínimos cuadrados es una técnica estadística que se utiliza para
encontrar la mejor línea de ajuste (o modelo de regresión) que minimiza la suma
de los cuadrados de las diferencias entre los valores observados y los valores
predichos. Es la base para la estimación de los coeficientes en la regresión lineal.
¿Qué son los Mínimos Cuadrados?
El objetivo del método de mínimos cuadrados es ajustar una línea recta (en el
caso de la regresión lineal simple) de tal manera que la suma de los cuadrados
de las diferencias verticales (residuos) entre los valores observados y los valores
predichos sea lo más pequeña posible.
PASOS DEL METODO DE MINIMOS CUADRADOS
1. Definir los residuos: los residuos 𝜀𝑖 son las diferencias entre los valores
observados 𝑌𝑖 y los valores predichos 𝑌̂𝑖 :
̂𝒊
𝜺𝒊 = 𝒀𝒊 − 𝒀
2. Función de minimización: la técnica busca minimizar la suma de los
cuadrados de estos residuos.
𝑴𝒊𝒏𝒊𝒎𝒊𝒛𝒂𝒓 ∑(𝒀𝒊 − ̂
𝒀𝒊 )𝟐 = ∑(𝒀𝒊 − (𝜷𝟎 + 𝜷𝟏 𝑿))𝟐
3. Derivación de las ecuaciones normales: se derivan las ecuaciones
necesarias para encontrar los valores de 𝛽0 𝑦 𝛽1 :
̅ ) (𝒀𝒊 − 𝒀
∑(𝑿𝒊 − 𝑿 ̅)
𝜷𝟏 =
∑(𝑿𝒊 − 𝑿 ̅ )𝟐
̅ − 𝜷𝟏 𝑿
𝜷𝟎 = 𝒀 ̅
Donde:
ESTADISTICA Y PROBABILIDAD
UNMSM-FCF
𝑋̅: promedio de los valores de X.
𝑌̅: promedio de los valores de Y.
4. Resolución para los coeficientes: al resolver las ecuaciones anteriores, se
obtienen los valores óptimos de 𝛽0 𝑦 𝛽1 que minimizan la suma de los
cuadrados de los residuos.
INTERPRETACION DE LOS COEFICIENTES
𝛽0 : Es el intercepto y representa el valor esperado de Y cuando X=0.
Puede no tener un significado realista si el rango de X no incluye a 0.
𝛽1 : Es la pendiente, que indica el cambio esperado de Y por cada unidad
de cambio en X. si 𝛽1 es positivo, hay una relación directa; si es negativo,
la relación es inversa.
Ejemplo:
Dado el siguiente conjunto de datos de la relación entre el tamaño de la
casa (en metros cuadrados) y el precio (en miles de dólares)
TAMAÑO (m2) (X) PRECIO REAL (Y)
50 200
60 240
70 260
80 300
90 320
PROMEDIO 𝑋̅ = 70 PROMEDIO 𝑌̅ = 264
ESTADISTICA Y PROBABILIDAD
UNMSM-FCF
Determinado la tendencia lineal:
𝑌̂ = 𝛽0 + 𝛽1 𝑋
∑(𝑋𝑖 − 𝑋̅ ) (𝑌𝑖 − 𝑌̅)
𝛽1 =
∑(𝑋𝑖 − 𝑋̅ )2
𝑋𝑖 𝑋̅ (𝑋𝑖 − 𝑋̅) 𝑌𝑖 𝑌̅ 𝑌𝑖 − 𝑌̅
50 70 -20 200 264 -64
60 70 -10 240 264 -24
70 70 0 260 264 -4
80 70 10 300 264 36
90 70 20 320 264 56
(𝑋𝑖 − 𝑋̅)(𝑌𝑖 − 𝑌̅) (𝑋_𝑖 − 𝑋 ̅ )2
1268 400
240 100
0 0
360 100
1120 400
∑(𝑋𝑖 − 𝑋̅) (𝑌𝑖 − 𝑌̅ ) ∑(𝑋𝑖 − 𝑋̅)2
2988 1000
2988
𝛽1 = → 𝛽1 = 2.988
1000
𝛽0 = 𝑌̅ − 𝛽1 𝑋̅
𝑌̅ = 264
𝛽1 = 2.988
𝑋̅ = 70
𝛽0 = 264 − 2.988 × 70
𝛽0 = 54.84
∴ 𝑌̂ = 54.84 + 2.988𝑋
ESTADISTICA Y PROBABILIDAD
UNMSM-FCF
X 𝑌̂
50 204.24
60 234.12
70 264
80 293.88
90 323.76
Determinando el error estándar de estimación:
2
∑(𝑌𝑖 − 𝑌̂𝑖 )
𝐸𝑆 = √
𝑛−2
2
𝑌 𝑌̂ (𝑌 − 𝑌̂) (𝑌 − 𝑌̂ )
200 204.24 -0.24 0.0576
240 234.12 5.88 34.5744
260 264 4 16
300 293.88 6.12 37.4544
320 323.76 -3.76 14.1376
∑(𝑌𝑖 − 𝑌̂𝑖 )
2 102.224
102.224
𝐸𝑆 = √ → 𝐸𝑆 = 5.837
5−2
Tiene una precisión de 5.837