0% encontró este documento útil (0 votos)
21 vistas20 páginas

Medición de Moisés Muñoz en Regresión

Este documento describe el proceso de regresión lineal simple. Explica cómo se construye un modelo de regresión lineal para predecir una variable dependiente basada en una variable independiente. Detalla los pasos de representar los datos en un diagrama de dispersión, estimar los parámetros de la línea de regresión usando el método de mínimos cuadrados, y calcular la ecuación de la línea de regresión. El objetivo es desarrollar un modelo estadístico que pueda predecir valores de la variable dependiente en función de la independiente.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOC, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
21 vistas20 páginas

Medición de Moisés Muñoz en Regresión

Este documento describe el proceso de regresión lineal simple. Explica cómo se construye un modelo de regresión lineal para predecir una variable dependiente basada en una variable independiente. Detalla los pasos de representar los datos en un diagrama de dispersión, estimar los parámetros de la línea de regresión usando el método de mínimos cuadrados, y calcular la ecuación de la línea de regresión. El objetivo es desarrollar un modelo estadístico que pueda predecir valores de la variable dependiente en función de la independiente.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOC, PDF, TXT o lee en línea desde Scribd

UNIDAD

5
REGRESIÓN
LINEAL SIMPLE

OBJETIVO EDUCACIONAL

Al término de esta unidad el alumno será capaz de:

 Interpretar el proceso metodológico para la construcción de un modelo de


regresión lineal simple, así como manipular un conjunto de datos, ya sea
con una calculadora de escritorio o un programa de computadora

1
__________________________________________________________________________________ Estadística II

diseñado especialmente para ello o a través de un paquete estadístico con


el fin de obtener los parámetros del modelo.

1.1 Introducción

El término regresión fue usado por primera vez como concepto estadístico en 1877 por Sir
Francis Galton; quien efectuó un estudio que demostró que las estaturas de los hijos de padres
altos tendían a retroceder, o a “regresar”, hacia la estatura promedio de la población. Regresión
fue el nombre que le dio al proceso general de predecir una variable a partir de otra.

El objetivo en el análisis de regresión lineal es el desarrollo de un modelo estadístico que pueda


ser utilizado para predecir los valores de una variable de respuesta o dependiente basados en
los valores de al menos una variable independiente o explicatoria. En esta unidad enfocaremos
nuestra atención en un modelo de regresión lineal simple que utiliza una sola variable numérica
independiente X para predecir la variable numérica dependiente Y. En la unidad 2
desarrollaremos un modelo de regresión múltiple que utiliza varias variables explicatorias (X1,
X2, . . . . , Xk) para predecir una variable numérica dependiente Y.

Diagrama de Dispersión.

En el análisis de regresión que implica una variable dependiente y una variable independiente,
los valores individuales se representan en una gráfica bidimensional conocida como diagrama de
dispersión. En la siguiente gráfica se muestran los tipos de relación más comunes que pueden
observarse en los diagramas de dispersión.

2 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

Grafica 1.1. Tipos de relación

3
_____________________________________________________________ Regresión Lineal Simple y Correlación

Modelo de regresión lineal simple.

La naturaleza de la relación entre dos variables puede tomar muchas formas, desde las sencillas
hasta las funciones matemáticas extremadamente complicadas. La relación más sencilla consiste
en una línea o relación lineal, de la forma

yi   0   1 xi   i

donde:  0 es la intersección con el eje Y para la ecuación poblacional;  1 es la pendiente de la


ecuación poblacional y el error aleatorio i, es el error del modelo, debe necesariamente tener una
media de cero. Si ciertas suposiciones son válidas (Normalidad, Homocedasticidad,
Independencia del Error y Linealidad), entonces la intersección con el eje Y de la muestra (b0 ) y
la pendiente de la ecuación muestral (b1) pueden utilizarse como estimaciones de los respectivos
parámetros de la ecuación poblacional. Por consiguiente, la ecuación de regresión de la muestra
que representa al modelo de regresión lineal será:

ŷ i  b0  b1 x i

1.2 Estimación de Parámetros.

El análisis de regresión lineal simple tiene que ver con la búsqueda de la línea recta que mejor se
ajuste a los datos. El mejor ajuste significa que deseamos encontrar la línea recta para la cual las
diferencias entre los valores reales (yi) y los valores que serían estimados a partir de la línea
ajustada de regresión ( ŷ i ) sean lo más pequeñas posible. Debido a que tales diferencias serán
positivas y negativas para las diferentes observaciones, se minimiza matemáticamente la
expresión

n n n

 e i2   ( y i  ŷ i ) 2    y i  ( b0  b1 x i ) 2
i 1 i 1 i 1

Esta técnica matemática utilizada para determinar los valores de b0 y b1 que mejor se ajusten a los
datos observados se conoce como método de mínimos cuadrados. Cualesquiera valores
diferentes de b0 y b1 que sean diferentes a los determinados por el método de mínimos cuadrados
tendrían como resultado una suma mayor del cuadrado de las diferencias entre el valor real y el
valor estimado.

Moisés Muñoz Díaz 4


_____________________________________________________________ Regresión Lineal Simple y Correlación
n n n

 e i2   ( y i  ŷ i ) 2    y i  ( b0  b1 x i ) ,
2
Al derivar parcialmente la expresión primero con
i 1 i 1 i 1

respecto a b0 y después con respecto a b1, e igualar a cero, obtenemos las siguientes dos
ecuaciones conocidas como normales:

n n
I. nb0  b1 
i 1
xi  
i 1
yi

n n n
II . b0 
i1
x i  b1 
i 1
x i2  
i 1
xi yi

Las estimaciones de mínimos cuadrados b0 y b1 de los respectivos coeficientes de regresión


 0 y  1 . Dada la muestra {(xi, yi), i= 1, 2, . . . , n}, se calculan por medio de las siguientes

fórmulas que resultan de resolver de manera simultanea para b0 y b1:

n  n  n 
n  xi yi   
x i  
yi 
 i  1  i  1 
n n

b1 
i1   

S xy  yi  b  xi
2
S xx i1 i1
n  n  b0   y  b1 x
n x i2    xi 
i  1 
n
i1  

donde:
2 2
n  n  n  n 
S xx   xi2   xi  / n
i1 
S yy   yi2   
yi  / n
 i 1 
i1   i1  

n  n  n 
S xy  xy i i   x i  yi  / n
 i  1  i  1 
i 1   

Propiedades de los Estimadores.

Puede demostrarse que


1 x2 
E ( b0 )   0 y V ( b0 )   2   
 n S x x 

2
E ( b1 )   1 y V ( b1 ) 
Sxx

En consecuencia b0 es un estimador insesgado de la ordenada al origen  0 y b1 es un

estimador insesgado de la pendiente verdadera  1 .

Moisés Muñoz Díaz 5


__________________________________________________________________________________ Estadística II

SCE S yy  b1 S x y
Una estimación insesgada de  2 es: ˆ 2  s 2  
n2 n2

Estimación por Intervalos de Confianza para los Parámetros

Intervalo de Confianza para  0 . Un intervalo de confianza del ( 1   )100% para el


parámetro  0 en la línea de regresión y i   0   1 x i   i es:

n n


i1
x i2 x
i1
2
i

b0  t  / 2 , n  2 s   0  b0  t  / 2 , n  2 s
nS xx nS xx

Intervalo de Confianza para  1 . Un intervalo de confianza del ( 1   )100% para el


parámetro  1 , en la línea de regresión y i   0   1 x i   i es:

s s
b1  t  / 2,n 2   1  b1  t  / 2 ,n  2
S xx S xx

1.3 Pruebas de Hipótesis en la Regresión Lineal Simple

1) Las hipótesis son

H0 : 1  0 (la variación de Y resulta de fluctuaciones aleatorias que son


independientes de los valores de X)
H1 : 1  0 (existe una cantidad significativa en la variación de Y que se explica por la
variación de X)

b1   1 ,0 b1   1 ,0
t0  
2) El estadístico de prueba es: Sb s2 / Sx x

3) La regla de decisión para un nivel de significancia  y v  n  2 grados de libertad es

Rechazar H0 si t 0  t 1 / 2 , n  2 ó Pvalor  

4) Evaluar el estadístico de prueba:

5) Decisión: se rechaza o no se rechaza H0

6) Conclusión: el rechazo de H 0 :  1  0 , implica que existe una cantidad significativa en la


variación de Y que se explica por la variación de X

6 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

Para probar la significancia de la regresión se puede utilizar el análisis de varianza

1) Las hipótesis son

H0 : 1  0 (La variación de Y resulta de fluctuaciones aleatorias que son


independientes de los valores de X)
H1 : 1  0 (Existe una cantidad significativa en la variación de Y que se explica por la
variación de X)

SCR / 1 CMR
2) El estadístico de prueba es: f 0  
SCE /( n  2 ) CME

3) La regla de decisión para un nivel de significancia  , v1  1 y v 2  n  2 es

Rechazar H0 si f 0  f v 21, 1 
v
ó Pvalor  

4) Evaluar el estadístico de prueba:

Análisis de varianza para probar la hipótesis nula H 0 :  1  0


Fuente de Suma de Grados de Cuadrados fo
Variación Cuadrados Libertad Medios
Regresión CMR
SCR  b1 S x y 1 CMR
s2
SCE
Error SCE  S y y  b1 S x y n2 s2 
n2
Total SCT  S y y

5) Decisión: se rechaza o no se rechaza H0

6) Conclusión: el rechazo de H 0 :  1  0 implica que existe una cantidad significativa en la


variación de Y que se explica por la variación de X

Moisés Muñoz Díaz 7


__________________________________________________________________________________ Estadística II

1.4 Predicción de Nuevas Observaciones

Intervalo de Confianza para Y | x 0 Un intervalo de confianza del ( 1   )100% para la

respuesta media Y | x0 es:

1 ( x0  x )2 1 ( x0  x )2
ŷ 0  t / 2 , n  2 s   E ( y 0 )  ŷ 0  t  / 2 , n  2 s 
n S xx n S xx

Intervalo de Confianza para y0 Un intervalo de confianza del ( 1   )100% para una sola
respuesta y0 es:

1 ( x0  x )2 1 ( x  x )2
ŷ 0  t  / 2 , n  2 s 1    y 0  ŷ 0  t  / 2 , n  2 s 1   0
n S xx n S xx

1.5 Mediciones de la Adecuación del Modelo de Regresión

Al evaluar la adecuación de un modelo de regresión a un conjunto de datos lo que se quiere, es


verificar que se cumplen las suposiciones necesarias para poder hacer un análisis de regresión,
que son:

1. Normalidad, requiere que los valores de Y estén distribuidos normalmente en cada


valor de X.

2. Homoscedasticidad, requiere que la variación alrededor de la línea de regresión


sea constante para todos los valores de X.

3. Independencia del error, requiere que el error (la diferencia entre un valor
observado y un valor estimado) es independiente de cada valor de X.

4. Linealidad, establece que la relación entre las variables es lineal.

1.5.1 Análisis Residual

Se definen los residuos como e i  y i  ŷ i , i = 1, 2, . . . , n, donde y i es una observación y ŷ i es


el valor estimado correspondiente a partir del modelo de regresión. A menudo es útil graficar los
residuos: 1) en secuencia de tiempo (si se conoce), 2) contra ŷ i , y 3) contra la variable
independiente x. Estas gráficas suelen verse como una de los cuatro patrones generales de la
figura 1.2 El patrón a) representa la situación normal, en tanto que los patrones b), c) y d)

8 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

representan anomalías. Si los residuos aparecen como en b), entonces la varianza de las
observaciones puede incrementarse con el tiempo o con la magnitud de las y i o x i . Si una
gráfica de los residuos contra el tiempo tiene la apariencia de b), entonces la varianza de las
observaciones se incrementa con el tiempo. Las gráficas contra y i y y i que se observan como
c) indican también desigualdad de varianza. Las gráficas de residuos que se observan como d)
indican insuficiencia del modelo; esto es, términos de mayor orden que deben ser añadidos al
modelo.

Figura 1.2 Patrones para las gráficas de los residuos

1.5.2 Prueba de Falta de Ajuste

Moisés Muñoz Díaz 9


__________________________________________________________________________________ Estadística II

La suma de cuadrados del error consiste en dos partes: la cantidad debida a la variación entre los
valores de y dentro de los valores dados de x y el componente que normalmente reciben el
nombre de contribución por falta de ajuste. La primera refleja la mera variación aleatoria o el
error experimental puro, mientras que el segundo componente es una medición de la variación
sistemática debida a los términos de orden superior. Para calcular la suma de cuadrados del
error puro debemos tener observaciones repetidas en y para al menos un nivel de x.
Suponga que tenemos n observaciones en total tales que

y 11 , y 1 2 ,  , y 1n1 observaciones repetidas en x1

y 2 1 , y 2 2 ,  , y 2 n2 observaciones repetidas en x2
 

y k 1 , y k 2 ,  , y k nk observaciones repetidas en xk

Donde k es el numero de valores diferentes de x. Un procedimiento computacional para separar


la suma de cuadrados del error en los dos componentes que representan el error puro y la falta de
ajuste es el siguiente:

1 Calcule la suma de cuadrados del error puro:

k ni k ni ki Ti 2
SCE puro    ( yi j
i 1 j1
 yi  ) 2
 
i  1j  1
y i2 j - 
i1 ni

2 Reste la suma de cuadrados del error puro de la suma de cuadrados del error, por medio
de lo cual se obtiene la suma de cuadrados debida a la falta de ajuste. Los grados de
libertad para falta de ajuste se obtienen también restando: (n –2) – (n – k) = k – 2.

Una prueba para la “bondad de ajuste” del modelo lineal de regresión es la siguiente:

1) Las hipótesis son

H 0 : El modelo lineal se ajusta adecuadamente a los datos

H 1 : El modelo lineal no se ajusta a los datos

SCE  SCE puro


2) El estadístico de prueba es: f 0 
s2(k  2 )

3) La regla de decisión para un nivel de significancia  , v1  k  2 y v 2  n  k es

10 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

Rechazar H0 si f 0  f v 21, 1 
v
ó Pvalor  

4) Evaluar el estadístico de prueba:

Análisis de varianza para probar la linealidad de la regresión


Grados
Fuente de Suma de Cuadrados fo
de
Variación Cuadrados Medios
Libertad
CMR
Regresión SCR  b1 S x y 1 CMR
s2
SCE
Error SCE  S y y  b1 S x y n2 s2 
n2
Falta SCE  SCE puro SCE  SCE puro
de SCE  SCE puro k2
k2 s2 ( k  2 )
Ajuste
Error k ni ki Ti 2 SCE puro
Puro
SCE puro  
i  1j  1
y i2 j - 
i 1 ni
nk s2 
nk
Total SCT  S y y n1

Donde k = valores distintos de x, x1 , x 2 , , xk , de tal forma que la muestra contenga n1


valores observados de la variable aleatoria y1 correspondiente a x1, n2 valores observados de y2
correspondientes a x2, y así , sucesivamente, nk valores observados de yk correspondientes a

k ni

xk, ( n 
i1
ni , Ti   y
j 1
i j )

5) Decisión: se rechaza o no se rechaza H0


6) Conclusión: si H 0 no se rechaza, entonces no hay razón aparente para dudar que el
modelo lineal es adecuado.

1.5.3 Coeficiente de Determinación

El coeficiente de determinación muestral, r 2 expresa la proporción de la variación total de


los valores de la variable Y que se pueden contabilizar o explicar por una relación lineal con
los valores de la variable aleatoria X.

2
S xy SCR
r2  
Sx xSy y Sy y

1.6 Transformaciones Lineales

Moisés Muñoz Díaz 11


__________________________________________________________________________________ Estadística II

En ocasiones encontramos que el modelo de regresión lineal y i   0   1 x i   i es inapropiado


porque la función de regresión verdadera no es lineal; la necesidad de realizar una transformación
es bastante simple de diagnosticar en el caso de la regresión lineal simple debido que las gráficas
de dos dimensiones dan una imagen real de cómo entra cada variable en el modelo. En ciertas
situaciones una función no lineal puede expresarse como una línea recta utilizando una
transformación apropiada. Tales modelos lineales se llaman lineales intrínsecamente. (ver tabla
1.1)

Tabla 1.1 Algunas transformaciones útiles


Forma de regresión
Forma funcional que relaciona y con x Transformación
lineal simple

Exponencial: y  e x y *  ln y y * contra x

Potencia: y   x y *  log y ; x *  log x y * contra x *

1 1
Recíproca: y      x*  y contra x *
 x x
x 1 1
Función Hiperbólica: y     x y*  ; x*  y * contra x *
y x

1.7 Correlación

La intensidad de una relación entre dos variables de una población por lo general se mide
mediante el coeficiente de correlación poblacional  . Es costumbre referirse a la estimación r
como el coeficiente de correlación producto-momento de Pearson, o simplemente coeficiente
de correlación muestral; cuyos valores van desde 1, correspondiente una correlación perfecta
negativa, hasta +1, correspondiente a una correlación perfecta positiva, de asociación lineal entre
dos variables X y Y. Se estima con el coeficiente de correlación muestral r, donde:

S xx S xy
ˆ  r  b 
S yy S x x S yy

12 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

Ejemplo 1.1 Las cantidades de un compuesto químico y, en gramos, que se disuelven en 100
gramos de agua a varias temperaturas, x, en ° C, se registran como sigue:

x C y ( gr ) xy x2 y2
0 8
0 6
0 8
15 12
15 10
15 14
30 25
30 21
30 24
45 31
45 33
45 28
60 44
60 39
60 42
75 48
75 51
75 44

a) Elaborar el diagrama de dispersión

b) Obtener la ecuación de regresión

c) Interprete los valores de los coeficientes de regresión estimados b0 y b1

d) Pruebe la hipótesis: H 0 :  1  0 contra la alternativa H 1 :  1  0 e interprete la decisión


resultante, empleando el estadístico t

e) Utilice el análisis de varianza para probar la significancia de la regresión

f) Utilice el análisis de varianza para probar la linealidad de la regresión (prueba de falta de


ajuste)

g) Obtenga e interprete el coeficiente de determinación muestral r 2

h) Encuentre un intervalo de confianza del 95% para la respuesta media y un intervalo de


predicción del 95% para una respuesta individual para Y cuando x0  35

i) Trazar una gráfica de probabilidad normal de los residuales para verificar el supuesto de
normalidad.

j) Trazar e interpretar una gráfica de los residuales versus valores predichos para verificar el
supuesto de Homoscedasticidad.
Moisés Muñoz Díaz 13
__________________________________________________________________________________ Estadística II

k) Trazar e interpretar una gráfica de los residuales versus orden de obtención de los datos para
verificar el supuesto de independencia.

Solución. En seguida se presenta la solución de este problema


a) Elaborar el diagrama de dispersión

Diagrama de Dispersión para Cantidad vs Temperatura

60

50

40
Cantidad

30

20

10

0
0 15 30 45 60 75 90
Temperatura
Se observa en el diagrama una posible relación lineal directa.

b) Obtener la ecuación de regresión


x C y ( gr ) xy x2 y2
0 8 0 0 64
0 6 0 0 36
0 8 0 0 64
15 12 180 225 144
15 10 150 225 100
15 14 210 225 196
30 25 750 900 625
30 21 630 900 441
30 24 720 900 576
45 31 1395 2025 961
45 33 1485 2025 1089
45 28 1260 2025 784
60 44 2640 3600 1936
60 39 2340 3600 1521
60 42 2520 3600 1764
75 48 3600 5625 2304
75 51 3825 5625 2601
75 44 3300 5625 1936
675 488 25005 37125 17142

2
n  n 
S xx   xi2    xi  / n  37125   675  2 / 18  11812 .5
i1 
i 1  

14 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

n  n  n 
S xy   i i   i   yi  / n  25005   675  488 / 18  6705
x y   x
i1  i  1  i  1 
2
n  n 
S yy      yi  / n  17142   488  2 / 18  3911 .777778
yi2
 
i 1 i 1 
6705 488  675 
b1   0.567619 y b0   ( 0.567619 )   5.8254
11812.5 18  18 

Entonces la ecuación de regresión es:


ŷ  5.8254  0.567619 x

c) Interprete los valores de los coeficientes de regresión estimados b0 y b1

b0 = 5.8254 representa el valor de la cantidad disuelta cuando la temperatura es 0 ° C

b1 = 0.567619, significa que la cantidad disuelta aumenta en 0.567619 gramos por cada grado
centígrado que aumente la temperatura.

d) Pruebe la hipótesis: H 0 :  1  0 contra la alternativa H 1 :  1  0 e interprete la


decisión resultante, empleando el estadístico t
i) Las hipótesis son
H0 : 1  0 (la variación de la cantidad disuelta resulta de fluctuaciones aleatorias que
son independientes de los valores de la temperatura)
H1 : 1  0 (existe una cantidad significativa en la variación de la cantidad disuelta que se
explica por la variación de la temperatura)
b1  0 b1  0
t0  
ii) El estadístico de prueba es: Sb s2 / Sx x

iii) La regla de decisión para un nivel de significancia   0.05 y v  n  2  16 grados de


libertad es
Rechazar H0 si t 0  2.12 ó Pvalor  0.05

iv) Evaluar el estadístico de prueba:


S yy  b1 S x y 3911.777778  0.567619( 6705 )
ˆ 2  s 2    6.6183
n 2 16
b1  0 0.567619  0
t0    23.9803
2
s / Sx x 6.6183
11812 .5

v) Decisión: como t 0  23.9803  2.12 , se rechaza H0

Moisés Muñoz Díaz 15


__________________________________________________________________________________ Estadística II

vi) Conclusión: el rechazo de H 0 :  1  0 , implica que existe una cantidad significativa en


la variación de la cantidad disuelta que se explica por la variación de la temperatura

e) Utilice el análisis de varianza para probar la significancia de la regresión

i) Las hipótesis son


H0 : 1  0 (la variación de la cantidad disuelta resulta de fluctuaciones aleatorias que
son independientes de los valores de la temperatura)
H1 : 1  0 (existe una cantidad significativa en la variación de la cantidad disuelta que se
explica por la variación de la temperatura)
SCR / 1 CMR
ii) El estadístico de prueba es: f0  
SCE /( n  2 ) CME

iii) La regla de decisión para un nivel de significancia   0.05 y v  n  2  16 grados de


libertad es

Rechazar H0 si f 0  4.49 ó Pvalor  0.05

iv) Evaluar el estadístico de prueba:


Análisis de varianza para probar la linealidad de la regresión
-----------------------------------------------------------------------------
Fuente de Variación Suma de Cuadrados Gl Cuadrado Medios F F = 0.05
-----------------------------------------------------------------------------
Regresion 3805.89 1 3805.89 575.06 4.49
Error 105.892 16 6.61825
-----------------------------------------------------------------------------
Falta de ajuste 36.5587 4 9.13968 1.58 3.26
Error puro 69.3333 12 5.77778
-----------------------------------------------------------------------------
Total 3911.78 17

v) Decisión: como F = 575.06 es mayor que 4.49 se rechaza H0

vi) Conclusión: la regresión es significativa, tal como se obtuvo en la prueba t, existe una
cantidad significativa en la variación de la cantidad disuelta que se explica por la
variación de la temperatura)

f) Utilice el análisis de varianza para probar la linealidad de la regresión (prueba de falta de


ajuste)

i. Las hipótesis son

H 0 : El modelo lineal se ajusta adecuadamente a los datos

16 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

H 1 : El modelo lineal no se ajusta a los datos


SCE  SCE puro
ii. El estadístico de prueba es: f 0 
s2(k  2 )

iii. La regla de decisión para un nivel de significancia  , v1  k  2 y v 2  n  k es

Rechazar H0 si f 0  3.26 ó Pvalor  0.05

iv. Evaluar el estadístico de prueba:


Análisis de varianza para probar la linealidad de la regresión
-----------------------------------------------------------------------------
Fuente de Variación Suma de Cuadrados Gl Cuadrado Medios F F = 0.05
-----------------------------------------------------------------------------
Regresión 3805.89 1 3805.89 575.06 4.49
Error 105.892 16 6.61825
-----------------------------------------------------------------------------
Falta de ajuste 36.5587 4 9.13968 1.58 3.26
Error puro 69.3333 12 5.77778
-----------------------------------------------------------------------------
Total 3911.78 17

v. Decisión: el valor de f = 1.58 es menor que 3.26, NO se Rechaza H0


vi. Conclusión: por lo que el modelo lineal es adecuado
g) Obtenga e interprete el coeficiente de determinación muestral r 2
2
2
S xy ( 6705 ) 2
r    0.9729  97.29%
Sx xSy y ( 11812.5 )( 3911.777778 )

Esto significa que el 97.29% de la variación en la cantidad del compuesto químico que se
disuelve en 100 gramos de agua se explica por la variación en la temperatura.
h ) Encuentre un intervalo de confianza del 95% para la respuesta media y un intervalo de
predicción del 95% para una respuesta individual para Y cuando x0  35

ŷ 0  5.8254  0.567619x 0  5.8254  0.567619( 35 )  25.6921

Intervalo de Confianza del 95% para la respuesta media, E ( y ) es:

1 ( 35  37.5 ) 2 1 ( 35  37.5 ) 2
25.6921  2.12 ( 2.5726 )   E ( y )  25.6921  2.12( 2.5726 ) 
18 11812 .5 18 11812 .5

24.4005 < E(y) < 26.9837

Intervalo de Confianza del 95% para una sola respuesta y0 es:

1 ( 35  37.5 ) 2 1 ( 35  37.5 ) 2
25.6921  2.12( 2.5726 ) 1   y 0  25.6921  2.12( 2.5726 ) 1 
18 11812 .5 18 11812 .5
20.1193 < y0 < 31.2649

Moisés Muñoz Díaz 17


__________________________________________________________________________________ Estadística II

i) Trazar una gráfica de Gráfico de Probabilidad Normal


99.9
probabilidad normal de los residuales para 99
95

porcentaje
verificar el supuesto de normalidad.
80
En la gráfica se observa que los puntos 50
20
siguen la línea recta, por lo que podemos 5
1
suponer que los residuales se distribuyen
0.1
en forma normal. -4.4 -2.4 -0.4 1.6 3.6 5.6

Residuales

j) Trazar e interpretar una gráfica de los Gráfico de Residuos

Residuo estudentizado
2.9
residuales versus valores predichos para
1.9
verificar el supuesto de homocedas-
0.9
ticidad.
-0.1
No se observa ningún patrón anormal en la
-1.1
gráfica (forma de embudo), por lo que se
-2.1
satisface el supuesto de 0 10 20 30 40 50

Y_Cant predicho
Homoscedasticidad.

k) Trazar e interpretar una gráfica de los residuales versus orden de obtención de los datos para
verificar el supuesto de independencia.
No se observa ningún patrón anormal en la gráfica, por lo que se satisface el supuesto de
independencia.
Ejercicios
Gráfico de Residuos
Residuo estudentizado

1. Las calificaciones de un grupo de 2.9

estudiantes en su reporte de medio año (x) 1.9

y en los exámenes finales (y) fueron los 0.9

siguientes: -0.1

(x0 = 85) -1.1

-2.1
x 77 50 71 71 81 94 96 96 0
96 3
99 667 67
9
81
12
50
15 18
y 82 66 78 44 55 85 99 95 97 99 número
70 68de fila
70 60

18 Moisés Muñoz Díaz


_____________________________________________________________ Regresión Lineal Simple y Correlación

2. Se llevó a cabo un estudio acerca de la cantidad de azúcar refinada obtenida (y), mediante un
cierto proceso a varias temperaturas (x), diferentes. Los datos se codificaron y registraron en
la siguiente tabla. (x0 = 1.75)

Moisés Muñoz Díaz 19


__________________________________________________________________________________ Estadística II

x 6.3 6.3 6.9 6.9 7.5 7.5 7.8 7.8


y 13. 16. 16. 15. 17. 16. 18. 17.
8 5 4 7 6 9 3 2
5. Se aplica una prueba de ubicación de matemáticas a todos los alumnos de primer grado que
están ingresando a un institución de educación superior. No se admiten a los que obtienen
una calificación inferior a 35 en el examen de matemáticas y se les coloca en un curso de
regularización. Las calificaciones del examen de ubicación y del examen final de 20
estudiantes fueron las siguientes: (x0 = 60)

x 50 35 35 40 55 65 35 60 90 35
y 53 41 61 56 68 36 11 70 79 59

x 90 80 60 60 60 40 55 50 65 50
y 54 91 48 71 71 47 53 68 57 79

20 Moisés Muñoz Díaz

También podría gustarte