Regresión Lineal Simple y Correlación
Regresión Lineal Simple y Correlación
INGENIERIA EN GESTIÓN
EMPRESARIAL
ESTADISTICA INFERENCIAL II
5G1
UNIDAD I
1.- Regresión lineal simple y correlación
Relación inversa: La pendiente de esta línea es negativa, por que a medida que
aumenta el valor de la variable Y, el valor de la variable X disminuye.
VARIABLE INDEPENDIENTE (X)
En el análisis de regresión una variable cuyo valor se suponga conocido y que se utilice para
explicar o predecir el valor de otra variable de interés se llama variable independiente;
se simboliza con la letra X.
Otros nombres alternativos para la variable independiente (X), son variable explicatoria,
variable predictora y en ocasiones variable regresora.
VARIABLE DEPENDIENTE (Y)
En el análisis de regresión una variable cuyo valor se suponga desconocido y que se explique
o prediga con ayuda de otra se llama variable dependiente y se simboliza con la letra Y.
La variable dependiente, al igual que la variable independiente es llamada de diferentes
maneras algunas de ellas son: variable explicada o variable pronosticada.
DIAGRAMAS DE DISPERSIÓN
Un diagrama de dispersión es una ilustración gráfica que se usa en el análisis de
regresión. Consta de una dispersión de puntos tal que cada punto representa un valor de la
variable independiente (medido a lo largo del eje horizontal), y un valor asociado de la
variable dependiente (medido a lo largo del eje vertical).
El diagrama de dispersión, también llamado nube de puntos, brinda dos tipos de
información, visualmente se pueden determinar los patrones que indican como las
variables están relacionadas (lineal o mediante una curva) y por otro lado si existe una
relación entre ellas visualizando la clase de línea o ecuación de estimación que describe a
dicha relación.
A continuación se ilustran algunas relaciones en los diagramas de dispersión:
Un modelo de regresión es un modelo que permite describir cómo influye una variable X
sobre otra variable Y . I
X: Variable independiente o explicativa o exógena I
Y: Variable dependiente o respuesta o endógena
El objetivo es obtener estimaciones razonables de Y para distintos valores de X a partir
de una muestra de n pares de valores (x1, y1), . . . ,(xn, yn).
Tipos de relación I
Determinista:
Conocido el valor de X, el valor de Y queda perfectamente establecido. Son del tipo:
y = f (x)
Ejemplo: La relación existente entre la temperatura en grados centígrados (X) y grados
Fahrenheit (Y ) es:
y = 1,8x + 32
No determinista:
Conocido el valor de X, el valor de Y no queda perfectamente establecido. Son del tipo:
y = f (x) + u
donde u es una perturbación desconocida (variable aleatoria).
Ejemplo: Se tiene una muestra del volumen de producción (X) y el costo total (Y )
asociado a un producto en un grupo de empresas.
Lineal: Cuando la función f (x) es lineal,
f (x) = β0 + β1x
Si β1 > 0 hay relación lineal positiva.
Si β1 < 0 hay relación lineal negativa.
No lineal: Cuando la función f (x) no es lineal.
Por ejemplo, f (x) = log(x), f (x) = x 2 + 3, . . .
Ausencia de relación: Cuando f (x) = 0.
La covarianza
Una medida de la dependencia lineal es la covarianza:
Donde
Las variables a y b son constantes numéricas que son las que se calculan mediante el
método de mínimos cuadrados.
1.5_ Determinar el coeficiente de correlación .
Convertimos la tabla de doble entrada en tabla simple.
xi yi fi x i ·f i xi² y i ·f i y i ² ·f i x i ·y i ·f i X = ∑X/N
fi
0 1 2 0 0 2 2 0
0 2 1 0 0 2 4 0 y = ∑Y/N
0 3 2 0 0 6 18 0
2 1 1 2 4 1 1 2
2 2 4 8 16 8 16 16
2 3 5 10 20 15 45 30
4 1 3 12 48 3 3 12
2 2 8 32 4 8 16
=4
20 40 120 41 97 76
xy
σ x 2 = 120/20 - 2 2 = 2 σ y 2 = 97/20 – 2,05 2 = 0.65
σ x = √2= 1.41 σ y = √0,65= 0.81
σ x y = 76/20 – (2)(2.05) = .0.3
r = -0-3/(1.41(0.81) = -0-26
Coeficiente de correlación lineal
El coeficiente de correlación lineal es el cociente entre la covarianza y el producto de
las desviaciones típicas de ambas variables.
El coeficiente de correlación lineal se expresa mediante la letra r.
Propiedades
1. El coeficiente de correlación no varía al hacerlo la escala de medición.
Es decir, si expresamos la altura en metros o en centímetros el coeficiente de
correlación no varía.
2. El signo del coeficiente de correlación es el mismo que el de la covarianza.
Si la covarianza es positiva, la correlación es directa.
Si la covarianza es negativa, la correlación es inversa.
Si la covarianza es nula, no existe correlación.
3. El coeficiente de correlación lineal es un número real comprendido entre −1 y 1.
−1 ≤ r ≤ 1
4. Si el coeficiente de correlación lineal toma valores cercanos a −1 la correlación
es fuerte e inversa, y será tanto más fuerte cuanto más se aproxime r a −1.
5. Si el coeficiente de correlación lineal toma valores cercanos a 1 la correlación
es fuerte y directa, y será tanto más fuerte cuanto más se aproxime r a 1.
6. Si el coeficiente de correlación lineal toma valores cercanos a 0, la correlación
es débil.
7. Si r = 1 ó −1, los puntos de la nube están sobre la recta creciente o decreciente.
Entre ambas variables hay dependencia funcional.
Ejemplos
Las notas de 12 alumnos de una clase en Matemáticas y Física son las siguientes:
Matemáticas 2 3 4 4 5 6 6 7 7 8 10 10
Física 1 3 2 4 4 4 6 4 6 7 9 10
Hallar el coeficiente de correlación de la distribución e interpretarlo.
xi yi xi ·yi x i² yi²
2 1 2 4 1 1º Hallamos las medias aritméticas.
3 3 9 9 9
4 2 8 16 4
4 4 16 16 16
5 4 20 25 16 2º Calculamos la covarianza.
6 4 24 36 16
6 6 36 36 36
7 4 28 49 16
7 6 42 49 36 3º Calculamos las desviaciones típicas
8 7 56 64 49
10 9 90 100 81
10 10 100 100 100
72 60 431 504 380
Cuanto mayor sea el error estándar de la estimación, más grande será la dispersión (o
esparcimiento) de puntos alrededor de la línea de regresión. Por el contrario, si Se= 0, se
espera que la ecuación de estimación sea un estimador “perfecto” de la variable
dependiente, en este caso todos los puntos caerían directamente sobre la línea de
regresión y no habría puntos dispersos, como se muestra en la siguiente figura:
Por ejemplo:
Una cadena de Pizzerías toma una muestra de diez de sus sucursales para tratar de
encontrar un modelo matemático que le permita predecir sus ventas y obtuvo los siguientes
datos: la población de personas en miles fue de 2, 6, 8, 8, 12, 16, 20, 20, 22, 26; y las ventas
trimestrales en miles de pesos
fue de: 58, 105, 88, 118, 117, 137, 157, 169, 169, 149, 202.
Realice una regresión para estimar las ventas de dos sucursales que tienen 14,000 y
30,000 personas como potenciales clientes respectivamente.
Solución
Datos n=10
X: Población de personas en miles
Y: Ventas trimestrales en miles de pesos
1. Tabular los datos obtenidos:
Sucursal X Y
1 2 58
2 6 105
3 8 88
4 8 118
5 12 117
6 16 137
7 20 157
8 20 168
9 22 149
10 26 202
= = 12.21
ŷ = 60 + 5(14) = 130
(14,130)
1
Recuerda que estamos trabajando con miles de pesos, en este ejercicio.
CORRELACIÓN SIMPLE
Dependiendo del tamaño de esta medida cuantitativa se puede decir, que tan
cercanamente se mueven dos variables, y por lo tanto, con cuanta confiabilidad
se puede estimar una variable con ayuda de la otra.
(a • y)+ (b • xy)− (n • y 2 )
r 2
=
y − (n • y )
2 2
(a • y)+ (b • xy)− (n • y 2 )
r 2
=
y − (n • y )
2 2
r=
r2
INTERVALO DE CONFIANZA
yc = ŷ t / 2 S
, gl e
n−2
INTERVALO DE PREDICCIÓN
• +
y p = yˆ t 2 n − 2 • Se1+
Solución
X: Años de experiencia
Y: Ventas anuales en miles de pesos.
Vendedor X Y
1 1 80
2 3 97
3 4 92
4 4 102
5 6 103
6 8 111
7 10 119
8 10 123
9 11 117
10 13 136
= 70 1080
2. Diagrama de dispersión.
3. Realizar los cálculos correspondientes y determinar la pendiente y
ordenada al origen.
Vendedor X Y XY X2 Y2
1 1 80 80 1 6400
2 3 97 291 9 9409
3 4 92 368 16 8464
4 4 102 408 16 10404
5 6 103 618 36 10609
6 8 111 888 64 12321
7 10 119 1190 100 14161
8 10 123 1230 100 15129
9 11 117 1287 121 13689
10 13 136 1768 169 18496
= 70 1080 8128 632 119082
1080
y= = 108
10
70
x= =7
10
8128 −10(7)(108)
b= =4
2
632 −10(7)
a = 108 − 4(7) = 80
Se = = 4.61
r= 0.9303 = 0.9645
Este número nos indica que las variables X Y tienen una correlación positiva
intensa.
Determinar el intervalo de confianza al 95%.
Considerando
yˆ 108 ventas anuales
4.61
y 108 2.306
c
10
104.6383 yc 111.3617
Se puede asegurar con un nivel de confianza del 95% que las ventas de los vendedores con 7 años de
experiencia están entre 104.6 y 111.4 miles pesos anuales.
1+ +
yp yˆ t 2n 2 Se
Sustituyendo:
2
1 9 7
yp 108 2.306 4.61 1
10 632 10(7) 2
108 11.291 y p 108 11.291
96.709 yp 119.291
Se puede asegurar con un nivel de confianza del 95% que las ventas pronosticadas de un vendedor
con 9 años de experiencia están entre 96.71 y 119.3 miles pesos anuales.
Ejercicios propuestos:
El jefe del departamento de aguas de una ciudad desea establecer una relación entre el
consumo mensual domiciliario de agua Y, y el tamaño de las familias X, Dados los datos
muestrales, determine:
Galones Tamaño
de Agua de familia.
Y X
650 2
1200 7
1300 9
430 4
1400 12
900 6
1800 9
640 3
793 3
925 2
Y X
6.7 9.7
7.3 9.8
8.9 7.6
9.1 6.1
7.2 10.2
5.2 12.7
6.9 14.3
6.9 7.9
7.1 8.9
Un director de ventas desea establecer la relación entre las ventas del segundo año de
vendedores Y, y sus ventas del primer año X. Realice un análisis de regresión.
Y X
520 13
550 13
600 15
610 15
620 16
724 21
680 21
300 14
962 40
270 12
Se hizo una encuesta a una muestra de 10 los estudiantes de 3er. Semestre de la carera de Lic.
En administración del grupo 1301 del semestre 2009-1 y se encontraron los siguientes datos:
Los datos siguientes muestran las ventas (en miles de cajas) y los costos de un anuncio
publicitario para la televisión (en millones de pesos) para 7 marcas principales de refrescos.
Marca Gastos de Ventas de cajas
publicidad ($) (miles)
Coca-Cola 13.0 19.3
Pepsi-Cola 9.4 13.8
Sprite 6.4 8.4
Diet Coke 5.7 5.5
7-Up 4.2 5.9
Jarritos 2.9 5.3
Boing 1.6 2.5
¿Dibuje el diagrama de dispersión, que parece indicar este diagrama acerca de la relación
entre las dos variables?
Trace una recta que pase por los datos, para aproximar una relación lineal entre los gastos
del anuncio y las ventas.
Aplique el método de los cuadrados mínimos para plantear la ecuación estimada de regresión.
Prediga las ventas para una marca que decida gastar $7 millones de pesos en un anuncio
publicitario.
Calcule el error estándar en la regresión.
Calcule el coeficiente de determinación y correlación e interprételos.
Determina el intervalo de confianza al 95%.
Determina el intervalo de predicción 95%
La revista del consumidor publico en su número 381 del mes de noviembre del 2008 la
siguiente información acerca del uso de los teléfonos celulares:
Año Usuarios que compran tiempo
aire en (miles de usuarios)
2000 1628
2001 1784
2002 2006
2003 2029
2004 2508
2005 3268
2006 4035
2007 5199
Un vendedor de Century 21 desea establecer la relación entre el tiempo en meses que están a
la venta los departamentos antes de lograr su venta y el precio pedido por ellos. Los datos
de una muestra de 9 departamentos se muestran a continuación:
Meses en venta 6.5 7.0 8.6 12.1 9.0 9.5 8.6 10.6 15.0
Precio pedido (en 800 1000 990 1250 1400 1100 990 990 1250
miles de pesos)
El gerente de una mueblería “FAMSA” quiere conocer la relación de las ventas logradas por
un vendedor en dos años, toma una muestra de 8 vendedores que lograron la etiqueta de
(vendedor del mes) y encontró los siguientes datos:
Unidades vendidas en el año 2007 170 133 86 161 112 133 136 82
Unidades vendidas en el año 2006 99 95 50 80 92 88 130 100
Trace un diagrama de dispersión para estos datos,
Aplique el método de mínimos cuadrados para plantear la ecuación estimada de regresión.
Calcule el error estándar en la regresión.
Calcule el coeficiente de correlación y el coeficiente de determinación e interprételos.
Determina el intervalo de confianza al 95%.
Determina el intervalo de predicción 95%
Según el INEGI los nacimientos registrados en el país en el 2007 fueron:
Nacimientos
Mes de Registrados
registro
1 Enero 220,670
2 Febrero 211,330
3 Marzo 213,299
4 Abril 270,819
5 Mayo 225,298
6 Junio 205,572
7 Julio 211,180
8 Agosto 249,626
9 Septiembre 220,666
10 Octubre 241,529
11 Noviembre 211,857
12 Diciembre 173,237
Aplique el método de mínimos cuadrados para plantear la ecuación estimada de regresión.
El INEGI reporto que en julio de 2007 se registraron 211,330 nacimientos, utiliza la
ecuación obtenida y predice cuantos debieron de haberse registrado en ese mes, compara
resultados y obtén tus conclusiones.
Estime cuantos nacimientos se registraron en enero de 2008.
Calcule el error estándar en la regresión.
Calcule el coeficiente de correlación y el coeficiente de determinación e interprételos.
Determina el intervalo de confianza al 95%.
Determina el intervalo de predicción 95%
1.4 Medidas de variación.
MEDIDAS DE VARIABILIDAD
Las medidas de variabilidad nos informan sobre el grado de concentración o dispersión
que presentan los datos respecto a su promedio. Llamaremos homogénea, concentrada o
poco dispersa a aquella distribución en la que todos los datos están cercanos al centro,
como 4 4 5 5 5 5 6 6 6 6 7, y heterogénea o dispersa a la distribución con datos más
separados del centro, como 1 3 5 8 10 16 20
Existen muchas formas de medir la variabilidad. Se Destacan las más importantes
RANGO
También llamado Recorrido o Amplitud total, es la diferencia entre el máximo valor del
conjunto de datos y el mínimo de ellos. A mayor rango, mayor dispersión.
El rango del conjunto 4 6 4 7 8 6 5 3 4 7 7 9 6 5 es 6, la diferencia entre el máximo 9 y el
mínimo 3.
A veces se usa el Rango verdadero que consiste en considerar cada dato rodeado de una
unidad, por efecto de los redondeos, con lo que en el ejemplo anterior el mínimo sería 2,5
y el máximo 9,5. Con ello el rango se convertiría en 7
No es una medida buena, pues ignora todo lo que ocurre dentro de ese rango.
DESVIACIÓN MEDIA
Es una medida de la dispersión consistente en la media aritmética de las desviaciones
individuales respecto a la media, tomadas en valor absoluto. También se usan
desviaciones respecto a la mediana.
VARIANZA
Es una medida muy sensible de la variabilidad y base de muchas técnicas estadísticas.
Junto con la media forma el conjunto más importante de medidas.
Es propia de las medidas de intervalo o razón. Su inconveniente es que no usa la misma
unidad que los datos, sino su cuadrado.
No se deben comparar varianzas en conjuntos de unidades muy distintas, como estatura e
inteligencia.
En teoría del muestreo se sustituye por la cuasi-varianza, de idéntica fórmula, pero con
cociente N-1 en lugar de N. En este caso no sería válida la segunda fórmula
DESVIACIÓN TÍPICA
Es la raíz cuadrada de la anterior. Su objeto es conseguir medir la variabilidad en las
mismas unidades que los datos. Así, un conjunto medido en metros, tendrá la varianza
medida en metros cuadrados, pero la desviación típica en metros.
Como en la varianza, para datos aislados basta con suprimir las frecuencias ni.
La desviación típica s es base de muchas técnicas, al igual que la media y la varianza. Su
gran ventaja es estar medida en las mismas unidades que los datos y la media, lo que
permite establecer razones y proporciones entre ellas.
La desviación típica cumple la llamada desigualdad de Tchebychev: según la cual, los
datos que se alejan de la media una distancia igual o menor que s, multiplicado por un
coeficiente k suponen más de la proporción 1-1/k2. Así, el 75% de los datos al menos, se
encuentra a menos de dos desviaciones típicas y el 89% a menos de tres
Es decir, es una definición muy similar a la de la varianza s2, pero mezclando las
desviaciones de ambas variables. Al igual que ocurría con la varianza, en muchas
ocasiones en el denominador se utiliza n en vez de n − 1. Aquí usaremos esta segunda
definición.
En el caso general de que haya valores repetidos, o agrupamiento en intervalos, la
definición de la covarianza sería
Propiedades
1. El coeficiente de correlación no varía al hacerlo la escala de medición.
Es decir, si expresamos la altura en metros o en centímetros el coeficiente de correlación
no varía.
2. El signo del coeficiente de correlación es el mismo que el de la covarianza.
Si la covarianza es positiva, la correlación es directa.
Si la covarianza es negativa, la correlación es inversa.
Si la covarianza es nula, no existe correlación.
3. El coeficiente de correlación lineal es un número real comprendido entre −1 y 1.
−1 ≤ r ≤ 1
4. Si el coeficiente de correlación lineal toma valores cercanos a −1 la correlación es fuerte
e inversa, y será tanto más fuerte cuanto más se aproxime r a −1.
5. Si el coeficiente de correlación lineal toma valores cercanos a 1 la correlación es fuerte
y directa, y será tanto más fuerte cuanto más se aproxime r a 1.
6. Si el coeficiente de correlación lineal toma valores cercanos a 0, la correlación es débil.
7. Si r = 1 ó −1, los puntos de la nube están sobre la recta creciente o decreciente. Entre
ambas variables hay dependencia funcional.
Ejemplos
Las notas de 12 alumnos de una clase en Matemáticas y Física son las siguientes:
Matemáticas 2 3 4 4 5 6 6 7 7 8 10 10
Física 1 3 2 4 4 4 6 4 6 7 9 10
Estadísticas de la regresión
Coeficiente de correlación 0.93550714
múltiple
Coeficiente de determinación 0.87517361
R^2
R^2 ajustado 0.86269097
Error típico 0.99930531
Observaciones 12
0.93550714 ≈ 0.94
Calculo en análisis de datos de Excel coeficiente de correlacion
xi yi
xi 1
yi 0.93550714 1
Observaciones 12
0.93550714 ≈ 0.94
1.6 Análisis residual.
¿QUÉ SON LOS RESIDUOS?
Los residuos (o errores) son la diferencia entre los valores observados y los valores que
predice el modelo:
Residuos = Valores observados – Valores que predice el modelo
e=y–ŷ
Por ejemplo, para el modelo de regresión lineal simple (i.e. una variable explicativa o
predictor, de la forma y(x)=ax+b) tenemos el siguiente gráfico:
<[Link]
alt=»» />
En adelante seguiremos trabajando con el modelo de regresión lineal que si recuerdas
asume tres cuestiones importantes: que la relación es de tipo lineal, que los residuos
siguen una distribución normal y que la varianza de dichos residuos es constante.
¿QUÉ SON LOS GRÁFICOS DE RESIDUOS?
Como mencioné en el post anterior (aquí) debes evaluar mediante gráficos los supuestos
del modelo y si el ajuste es adecuado.
Cuando trabajas con un modelo de regresión lineal simple (i.e. una única variable
explicativa) solo necesitas un gráfico de dispersión con las variables originales.
Sin embargo, cuando quieres ajustar un modelo de regresión múltiple (i.e. múltiples
variables explicativas) es más sencillo que evalúes el ajuste del modelo mediante
los gráficos de residuos.
GRÁFICOS DE RESIDUOS PARA ENTENDER Y MEJORAR TU REGRESIÓN
Dos son los gráficos diagnósticos principales que se suelen realizar con los residuos del
modelo:
el gráfico de los residuales en función de los valores ajustados por el modelo (Residuals
vs. Fitted) y
el gráfico cuantil-cuantil (Normal Q-Q) permite comparar la distribución de los residuos con
la distribución normal teórica.
TODO LO QUE NECESITAS SABER
SOBRE LA INTERPRETACIÓN DE LOS RESIDUOS
Residuos vs. Valores predichos por el modelo
Este tipo de gráficos te permite evaluar 3 cuestiones principalmente:
Si has utilizado el tipo de relación adecuada (e.g. si el modelo debería ser no lineal en
lugar de lineal). Si el tipo de modelo que utilizaste no es el adecuado encontrarás sesgos –
bias– o tendencias en los residuos.
Si la varianza es constante o por el contrario tienes problemas de dispersión irregular. Uno
de los supuestos del modelo de regresión lineal es que la varianza de los residuos es
constante, es decir, que los residuos se distribuyen al azar alrededor del valor cero.
Si existen datos extremos (outliers) que puedan perturbar e invalidar tu modelo. Este tipo
de datos se aparta del comportamiento del resto de residuos, tendrán un valor muy distinto
al cero.
¿Quieres conocer los patrones que puedes encontrar en este gráfico?
a continuación los principales patrones y su interpretación, luego te enseñaré cómo
solucionar cada tipo de problema.
Patrón Interpretación
Dispersión irregular o en forma Varianza no constante, (i.e. heterocedasticidad)
de embudo o abanico
Curvilíneo Falta incluir algún termino de mayor orden (e.g.
cuadrático cubico)
Aumento o disminución de Outliers
puntos
Predominio de residuos positivos Outliers
o negativos
Un punto lejos del cero Outliers
Un punto muy lejos de la Punto influyente
dirección de los demas
Tendencias. Cuando los residuos se separan del cero de manera sistemática (no
aleatoria), tanto si aumentan como si disminuyen para valores de predicciones mayores, el
patrón nos sugiere que la función de regresión no es lineal. A este patrón se le suele
llamar tendencia, sesgo o «bias» en inglés.
Dispersión irregular. Si observas un patrón de dispersión no aleatorio de los residuos, la
variabilidad de los residuos es mayor para ciertos valores predichos por el modelo, esto
indica que no se cumple el supuesto de varianza constante en los errores del modelo.
Puedes observar alguno de los siguientes casos:
Un patrón de «abanico». Es decir, los residuos son cercanos a 0 para valores de x
pequeños y están más extendidos para valores de x grandes.
Un patrón de «canalización». Es decir, los residuos se separan para valores de x
pequeños pero se cercan a 0 para valores de x grandes.
Un patrón más complejo.
Datos extremos (Outliers). Ocurre cuando uno o más residuos se apartan del patrón
aleatorio del resto. Incluso, podemos observar que si eliminamos el/los outlier el patrón de
los residuos cambia.
Ejemplos de patrones:
Un modelo válido implica encontrar un patrón de residuos al azar, es decir, que no haya
sesgos en los residuos (tendencias) ni una dispersión (varianza) no constante ni valores
que desvíen el comportamiento observado (outliers); esto ocurre solamente en la figura
«a».
Las figuras «b» y «c» tienen problemas de tendencia, lo cual podría indicar que la relación
entre las variables estudiadas no es la indicada o que existe correlación en los residuales
(e.g. si se trata de una serie temporal).
Las figuras «d», «e» y «f» tienen problemas de dispersión irregular. En todos los casos la
varianza de los residuos aumenta con los valores ajustados, esto indica que la variabilidad
de los errores aumenta al aumentar su media.
Entonces, ¿cómo puedes mejorar el modelo?
Si encuentras problemas de tendencia podrías necesitar términos de mayor orden
(cuadrática o cúbica) o nuevas variables explicativas, o incluir términos de interacción
entre las variables explicativas. Agrega los términos y reajusta el modelo.
Si encuentras problemas de dispersión irregular utiliza pruebas de igualdad de varianza
(complementarias a los análisis gráficos), considera utilizar transformaciones de las
variables o modelar la heterogeneidad encontrada con modelos generalizados (GLM) o
modelos mixtos (MM).
Si encuentras posibles valores extremos (outliers) o puntos de influencia verifica que no
sean errores de medición y considera realizar análisis robustos.
Gráfico Q-Q Normal
El modelo de regresión lineal también supone que los residuos siguen una distribución
normal.
Recuerda que el gráfico cuantil-cuantil (Normal Q-Q) te permite comparar la distribución de
los residuos con la distribución normal teórica.
Por lo tanto, si los residuos tienen una distribución normal deberías observar que siguen
aproximadamente la línea recta diagonal en el gráfico Q-Q normal, en caso contrario los
residuos se van a apartar de la diagonal.
Patrón Interpretación
No se observa una línea recta Falta de normalidad)
Curvatura en las colas de la Asimetría
distribucion
Un punto alejado de la recta Outliers
Cambio en a pendiente Una variable sin idetificar.
Ejemplos de patrones:
Si los residuos presentan una distribución normal debes obtener un gráfico similar al «a».
Sin embargo, curvas de tipo «s» indican colas largas en la distribución de los residuales
(como en el ejemplo «d»),
Una forma de «s» invertida indica colas cortas (como en el caso «e»), líneas hacia arriba o
abajo indican asimetrías (mira los casos «b» o «c»), y
Si tienes puntos que se apartan de la línea es un indicio de que tienes datos extremos
(outliers).
Entonces, ¿cómo puedes mejorar el modelo?
Investiga con otros gráficos si la falta de normalidad se puede deber a algo más, realiza
pruebas estadísticas de normalidad, realiza transformaciones de las variables
involucradas, o utiliza modelos más complejos que consideren la falta de normalidad
(GLM).
Y si aún tenemos algunos problemas con los residuos, ¿cómo seguir?
Tú decides. Si luego de seguir todas las recomendaciones que te he mencionado sigues
detectando problemas (menores) en los patrones de los residuos, debes decidir qué tan
preciso necesitas que sea tu modelo. Ya lo dijo G. Box, todos los modelos son erróneos, y
yo te recuerdo que generalmente un modelo decente es mejor que ningún modelo.
Análisis de Residuales
Un residual es la diferencia entre el valor observado y el valor estimado por la línea de
regresión , El residual puede ser considerado como el error aleatorio observado. También
se acostumbra usar el Residual estandarizado, el cual se obtiene al dividir el residual entre
la desviación estándar del residual, y el Residual estudentizado "deleted", que es similar al
anterior pero eliminando de los cálculos la observación cuyo residual se desea hallar.
En un analisis de residuales se puede detectar:
• Si efectivamente la relación entre las variables X e Y es lineal.
• Si hay normalidad de los errores.
• Si hay valores anormales en la distribución de errores.
• Si hay varianza constante (propiedad de Homocedasticidad) y
• Si hay independencia de los errores.
Análisis de Residuales
Plot de Normalidad: Permite cotejar normalidad. Si los puntos están bien cerca de una
línea recta se concluye, que hay normalidad.
Histograma de Residuales: También permite cotejar normalidad. Cuando el histograma es
simétrico, con un único pico en el centro, se concluye que hay normalidad.
Plot de Residuales versus los valores predichos (FITS): Se usa para detectar si hay datos
anormales, cuando hay datos que caen bastantes alejados, tanto en el sentido vertical
como horizontal. También permite detectar si la varianza de los errores es constante con
respecto a la variable de respuesta.
Plot de Residuales versus el índice de la observación: Es más específico para detectar
que observación es un dato anormal. Si se usan residuales estandarizados, entonces un
dato con residual más allá de 2 ó -2 es considerado un "outlier" en el sentido vertical
. Plot de Residuales versus la variable predictora: Es usado para detectar datos anormales
así como si la varianza de los errores es constante con respecto a la variable predictora.
Gráficas
x y xy x2
43.2 40.6 1753.92 1866.24
39.7 37.5 1488.75 1576.09
39.5 34.7 1370.65 1560.25
39.3 33.9 1332.27 1544.49
34.2 33.4 1142.28 1169.64
26.1 25.1 655.11 681.21
25.4 23 584.2 645.16
26.6 22 585.2 707.56
26.8 21.6 578.88 718.24
23.8 19.2 456.96 566.44
22 19.2 422.4 484
15.5 13.1 203.05 240.25
10.9 10.7 116.63 118.81
373 334 10690.3 11878.38
Los puntos del plot de
normalidad no caen cerca de
una línea recta y en el
extremo superior se detecta
un “outlier”. Similarmente, el
histograma no es simétrico
con un pico central y también
muestra un “outlier” en el
extremo superior. En
conclusión, no hay normalidad
de los errores. El plot de
residuales versus el índice de
la observación muestra que la
observación 14 es un "outlier",
pues el residual estandarizado
cae más allá de dos. El plot de
los residuales versus los
valores predichos muestra
que la varianza de los errores
no es constante con respecto
a la variable de respuesta,
pues tiende ha aumentar
cuando el valor de la variable
de respuesta aumenta.
Cómo encontrar desviaciones residuales en Excel
Por C. Taylor
Stockbyte/Stockbyte/Getty Images
Las desviaciones residuales ofrecen una medida de variabilidad de datos en las líneas de
regresión. Estas líneas de regresión ilustran una relación predecible entre dos variables,
por lo que saber la variabilidad de los datos implica tener un cierto nivel de confianza
respecto de las predicciones de la línea de regresión. Por ejemplo, una desviación residual
de 20 significa que la información se acercó mucho a la línea de regresión, por lo que esta
ofrece predicciones confiables. Una desviación de 2000 significa que los datos estaban
mezclados, por lo que las predicciones de esa línea de regresión son dudosas. Calcular la
desviación residual a mano es tedioso, pero si creas una hoja de cálculo con
el Microsoft Excel, será mucho más sencillo.
[Link]
Tabla resumen de las sumas de cuadrados utilizadas en el analisis de reresion lineal simple
Ejemplo 1
Se quiere evaluar la eficacia de distintas dosis de un fármaco contra la hipertensión
arterial, comparándola con la de una dieta sin sal. Para ello se seleccionan al azar 25
hipertensos y se distribuyen aleatoriamente en 5 grupos. Al primero de ellos no se le
suministra ningún tratamiento, al segundo una dieta con un contenido pobre en sal, al
tercero una dieta sin sal, al cuarto el fármaco a una dosis determinada y al quinto el mismo
fármaco a otra dosis. Las presiones arteriales sistólicas de los 25 sujetos al finalizar los
tratamientos son:
Grupo
1 2 3 4 5
180 172 163 158 147
173 158 170 146 152
175 167 158 160 143
182 160 162 171 155
181 175 170 155 160
La tabla de anova es:
Fuente de variación GL SS MS F
Tratamiento 4 2010,64 502,66 11,24
Error 20 894,4 44,72
Total 24 2905,04
Como F0,05(4,20) =2,87 y 11,24>2,87 rechazamos la hipótesis nula y concluimos que los
resultados de los tratamientos son diferentes.
Nota: Para hacerlo con un paquete estadístico, p.e. el SPSS, deberíamos crear un archivo
con 2 variables: Trata (con un código distinto para cada grupo, p.e. de 1 a 5) y Presion con
la presión arterial de cada individuo al acabar el estudio. Para calcular
el Anova desplegamos los menús que se ven en la gráfica:
Análisis de varianza de un factor
RESUMEN
Grupos Cuenta Suma Promedio Varianza
1 5 891 178.2 15.7
2 5 832 166.4 54.3
3 5 823 164.6 27.8
4 5 790 158 81.5
5 5 757 151.4 44.3
ANÁLISIS DE VARIANZA
Origen de Suma de Grados de Promedio F Probabilid Valor
las cuadrados libertad de los ad crítico
variacione cuadrados para F
s
Entre 2010.64 4 502.66 11.24016 6.06E-05 2.866081
grupos
Dentro de 894.4 20 44.72
los grupos
Total 2905.04 24
c) La varianza de es σ2/Sxx y la α es
6. INTERPRETACIÓN
Se obtiene: