Medición de Moisés Muñoz en Regresión
Medición de Moisés Muñoz en Regresión
5
REGRESIÓN
LINEAL SIMPLE
OBJETIVO EDUCACIONAL
1
__________________________________________________________________________________ Estadística II
1.1 Introducción
El término regresión fue usado por primera vez como concepto estadístico en 1877 por Sir
Francis Galton; quien efectuó un estudio que demostró que las estaturas de los hijos de padres
altos tendían a retroceder, o a “regresar”, hacia la estatura promedio de la población. Regresión
fue el nombre que le dio al proceso general de predecir una variable a partir de otra.
Diagrama de Dispersión.
En el análisis de regresión que implica una variable dependiente y una variable independiente,
los valores individuales se representan en una gráfica bidimensional conocida como diagrama de
dispersión. En la siguiente gráfica se muestran los tipos de relación más comunes que pueden
observarse en los diagramas de dispersión.
3
_____________________________________________________________ Regresión Lineal Simple y Correlación
La naturaleza de la relación entre dos variables puede tomar muchas formas, desde las sencillas
hasta las funciones matemáticas extremadamente complicadas. La relación más sencilla consiste
en una línea o relación lineal, de la forma
yi 0 1 xi i
ŷ i b0 b1 x i
El análisis de regresión lineal simple tiene que ver con la búsqueda de la línea recta que mejor se
ajuste a los datos. El mejor ajuste significa que deseamos encontrar la línea recta para la cual las
diferencias entre los valores reales (yi) y los valores que serían estimados a partir de la línea
ajustada de regresión ( ŷ i ) sean lo más pequeñas posible. Debido a que tales diferencias serán
positivas y negativas para las diferentes observaciones, se minimiza matemáticamente la
expresión
n n n
e i2 ( y i ŷ i ) 2 y i ( b0 b1 x i ) 2
i 1 i 1 i 1
Esta técnica matemática utilizada para determinar los valores de b0 y b1 que mejor se ajusten a los
datos observados se conoce como método de mínimos cuadrados. Cualesquiera valores
diferentes de b0 y b1 que sean diferentes a los determinados por el método de mínimos cuadrados
tendrían como resultado una suma mayor del cuadrado de las diferencias entre el valor real y el
valor estimado.
e i2 ( y i ŷ i ) 2 y i ( b0 b1 x i ) ,
2
Al derivar parcialmente la expresión primero con
i 1 i 1 i 1
respecto a b0 y después con respecto a b1, e igualar a cero, obtenemos las siguientes dos
ecuaciones conocidas como normales:
n n
I. nb0 b1
i 1
xi
i 1
yi
n n n
II . b0
i1
x i b1
i 1
x i2
i 1
xi yi
n n n
n xi yi
x i
yi
i 1 i 1
n n
b1
i1
S xy yi b xi
2
S xx i1 i1
n n b0 y b1 x
n x i2 xi
i 1
n
i1
donde:
2 2
n n n n
S xx xi2 xi / n
i1
S yy yi2
yi / n
i 1
i1 i1
n n n
S xy xy i i x i yi / n
i 1 i 1
i 1
2
E ( b1 ) 1 y V ( b1 )
Sxx
SCE S yy b1 S x y
Una estimación insesgada de 2 es: ˆ 2 s 2
n2 n2
n n
i1
x i2 x
i1
2
i
b0 t / 2 , n 2 s 0 b0 t / 2 , n 2 s
nS xx nS xx
s s
b1 t / 2,n 2 1 b1 t / 2 ,n 2
S xx S xx
b1 1 ,0 b1 1 ,0
t0
2) El estadístico de prueba es: Sb s2 / Sx x
SCR / 1 CMR
2) El estadístico de prueba es: f 0
SCE /( n 2 ) CME
Rechazar H0 si f 0 f v 21, 1
v
ó Pvalor
1 ( x0 x )2 1 ( x0 x )2
ŷ 0 t / 2 , n 2 s E ( y 0 ) ŷ 0 t / 2 , n 2 s
n S xx n S xx
Intervalo de Confianza para y0 Un intervalo de confianza del ( 1 )100% para una sola
respuesta y0 es:
1 ( x0 x )2 1 ( x x )2
ŷ 0 t / 2 , n 2 s 1 y 0 ŷ 0 t / 2 , n 2 s 1 0
n S xx n S xx
3. Independencia del error, requiere que el error (la diferencia entre un valor
observado y un valor estimado) es independiente de cada valor de X.
representan anomalías. Si los residuos aparecen como en b), entonces la varianza de las
observaciones puede incrementarse con el tiempo o con la magnitud de las y i o x i . Si una
gráfica de los residuos contra el tiempo tiene la apariencia de b), entonces la varianza de las
observaciones se incrementa con el tiempo. Las gráficas contra y i y y i que se observan como
c) indican también desigualdad de varianza. Las gráficas de residuos que se observan como d)
indican insuficiencia del modelo; esto es, términos de mayor orden que deben ser añadidos al
modelo.
La suma de cuadrados del error consiste en dos partes: la cantidad debida a la variación entre los
valores de y dentro de los valores dados de x y el componente que normalmente reciben el
nombre de contribución por falta de ajuste. La primera refleja la mera variación aleatoria o el
error experimental puro, mientras que el segundo componente es una medición de la variación
sistemática debida a los términos de orden superior. Para calcular la suma de cuadrados del
error puro debemos tener observaciones repetidas en y para al menos un nivel de x.
Suponga que tenemos n observaciones en total tales que
y 2 1 , y 2 2 , , y 2 n2 observaciones repetidas en x2
y k 1 , y k 2 , , y k nk observaciones repetidas en xk
k ni k ni ki Ti 2
SCE puro ( yi j
i 1 j1
yi ) 2
i 1j 1
y i2 j -
i1 ni
2 Reste la suma de cuadrados del error puro de la suma de cuadrados del error, por medio
de lo cual se obtiene la suma de cuadrados debida a la falta de ajuste. Los grados de
libertad para falta de ajuste se obtienen también restando: (n –2) – (n – k) = k – 2.
Una prueba para la “bondad de ajuste” del modelo lineal de regresión es la siguiente:
Rechazar H0 si f 0 f v 21, 1
v
ó Pvalor
k ni
xk, ( n
i1
ni , Ti y
j 1
i j )
2
S xy SCR
r2
Sx xSy y Sy y
1 1
Recíproca: y x* y contra x *
x x
x 1 1
Función Hiperbólica: y x y* ; x* y * contra x *
y x
1.7 Correlación
La intensidad de una relación entre dos variables de una población por lo general se mide
mediante el coeficiente de correlación poblacional . Es costumbre referirse a la estimación r
como el coeficiente de correlación producto-momento de Pearson, o simplemente coeficiente
de correlación muestral; cuyos valores van desde 1, correspondiente una correlación perfecta
negativa, hasta +1, correspondiente a una correlación perfecta positiva, de asociación lineal entre
dos variables X y Y. Se estima con el coeficiente de correlación muestral r, donde:
S xx S xy
ˆ r b
S yy S x x S yy
Ejemplo 1.1 Las cantidades de un compuesto químico y, en gramos, que se disuelven en 100
gramos de agua a varias temperaturas, x, en ° C, se registran como sigue:
x C y ( gr ) xy x2 y2
0 8
0 6
0 8
15 12
15 10
15 14
30 25
30 21
30 24
45 31
45 33
45 28
60 44
60 39
60 42
75 48
75 51
75 44
i) Trazar una gráfica de probabilidad normal de los residuales para verificar el supuesto de
normalidad.
j) Trazar e interpretar una gráfica de los residuales versus valores predichos para verificar el
supuesto de Homoscedasticidad.
Moisés Muñoz Díaz 13
__________________________________________________________________________________ Estadística II
k) Trazar e interpretar una gráfica de los residuales versus orden de obtención de los datos para
verificar el supuesto de independencia.
60
50
40
Cantidad
30
20
10
0
0 15 30 45 60 75 90
Temperatura
Se observa en el diagrama una posible relación lineal directa.
2
n n
S xx xi2 xi / n 37125 675 2 / 18 11812 .5
i1
i 1
n n n
S xy i i i yi / n 25005 675 488 / 18 6705
x y x
i1 i 1 i 1
2
n n
S yy yi / n 17142 488 2 / 18 3911 .777778
yi2
i 1 i 1
6705 488 675
b1 0.567619 y b0 ( 0.567619 ) 5.8254
11812.5 18 18
b1 = 0.567619, significa que la cantidad disuelta aumenta en 0.567619 gramos por cada grado
centígrado que aumente la temperatura.
vi) Conclusión: la regresión es significativa, tal como se obtuvo en la prueba t, existe una
cantidad significativa en la variación de la cantidad disuelta que se explica por la
variación de la temperatura)
Esto significa que el 97.29% de la variación en la cantidad del compuesto químico que se
disuelve en 100 gramos de agua se explica por la variación en la temperatura.
h ) Encuentre un intervalo de confianza del 95% para la respuesta media y un intervalo de
predicción del 95% para una respuesta individual para Y cuando x0 35
1 ( 35 37.5 ) 2 1 ( 35 37.5 ) 2
25.6921 2.12 ( 2.5726 ) E ( y ) 25.6921 2.12( 2.5726 )
18 11812 .5 18 11812 .5
1 ( 35 37.5 ) 2 1 ( 35 37.5 ) 2
25.6921 2.12( 2.5726 ) 1 y 0 25.6921 2.12( 2.5726 ) 1
18 11812 .5 18 11812 .5
20.1193 < y0 < 31.2649
porcentaje
verificar el supuesto de normalidad.
80
En la gráfica se observa que los puntos 50
20
siguen la línea recta, por lo que podemos 5
1
suponer que los residuales se distribuyen
0.1
en forma normal. -4.4 -2.4 -0.4 1.6 3.6 5.6
Residuales
Residuo estudentizado
2.9
residuales versus valores predichos para
1.9
verificar el supuesto de homocedas-
0.9
ticidad.
-0.1
No se observa ningún patrón anormal en la
-1.1
gráfica (forma de embudo), por lo que se
-2.1
satisface el supuesto de 0 10 20 30 40 50
Y_Cant predicho
Homoscedasticidad.
k) Trazar e interpretar una gráfica de los residuales versus orden de obtención de los datos para
verificar el supuesto de independencia.
No se observa ningún patrón anormal en la gráfica, por lo que se satisface el supuesto de
independencia.
Ejercicios
Gráfico de Residuos
Residuo estudentizado
siguientes: -0.1
-2.1
x 77 50 71 71 81 94 96 96 0
96 3
99 667 67
9
81
12
50
15 18
y 82 66 78 44 55 85 99 95 97 99 número
70 68de fila
70 60
2. Se llevó a cabo un estudio acerca de la cantidad de azúcar refinada obtenida (y), mediante un
cierto proceso a varias temperaturas (x), diferentes. Los datos se codificaron y registraron en
la siguiente tabla. (x0 = 1.75)
x 50 35 35 40 55 65 35 60 90 35
y 53 41 61 56 68 36 11 70 79 59
x 90 80 60 60 60 40 55 50 65 50
y 54 91 48 71 71 47 53 68 57 79