Regresión Lineal Múltiple en Bioestadística
Regresión Lineal Múltiple en Bioestadística
Ideas clave 4
2.1. Introducción y objetivos 4
2.2. Regresión lineal simple 5
© Universidad Internacional de La Rioja (UNIR)
A fondo 36
Test 37
Esquema
© Universidad Internacional de La Rioja (UNIR)
De este modo, podemos querer establecer la relación lineal que existe entre el
salario de un trabajador y su educación, su experiencia laboral y su género. También
podemos intentar predecir las ventas de un producto en función de los gastos de
publicidad y los precios o la tensión arterial según el consumo de sal, el valor del
índice de masa corporal y el ejercicio físico.
Es la forma más sencilla, se trata de una técnica que permite explorar, cuantificar y
predecir la relación entre dos variables cuantitativas. Tendremos 𝑌 (dependiente) y
𝑋 (independiente). Buscamos encontrar una función de 𝑋 muy simple (lineal) que nos
permita aproximar 𝑌 mediante:
𝑦 =𝑎+𝑏∙𝑥+𝑒
Donde:
𝑎: ordenada en el origen, es un valor constante que representa el valor que
tomaría la variable 𝑦 en el caso de que la variable 𝑥 tomase el valor cero. Si
estuviésemos analizando la estatura (variable dependiente, 𝑦) según la edad
(variable independiente, 𝑥), representaría la altura que tiene un bebé en su
nacimiento.
© Universidad Internacional de La Rioja (UNIR)
Figura 1. Representación del modelo de regresión lineal simple. Fuente: elaboración propia.
𝑌 e Ŷ lo habitual es que no coincidan por muy bueno que sea el modelo de regresión
(siendo 𝑌 los valores observados e Ŷ los estimados por el modelo). A la cantidad: 𝑒 =
𝑦 − 𝑦 ̂ se le denomina residuo o error residual (parte aleatoria que mide el error).
• La recta de regresión siempre pasa por el punto correspondiente a la media de
las 𝑥 y las medias de las 𝑦. Se le llama centroide o centro de gravedad (𝑥 ̅, 𝑦 ̅).
𝑦𝑖 = 𝑎 + 𝑏 ∙ 𝑥𝑖 + 𝑒𝑖
𝑦𝑖 Valor observado
𝑎 + 𝑏 ∙ 𝑥𝑖 𝑉𝑎𝑙𝑜𝑟 𝑝𝑟𝑜𝑛𝑜𝑠𝑡𝑖𝑐𝑎𝑑𝑜 𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 𝑦̂𝑖
𝑒𝑖 Residuo
© Universidad Internacional de La Rioja (UNIR)
Representa la diferencia entre cada punto observado y el valor asignado por la recta
de regresión, expresa el error que existe en el modelo. ¿Hasta qué punto es
importante esté error? ¿Qué porcentaje de la variabilidad de la variable respuesta
puede ser explicada por el efecto de 𝑋 y cuál no es explicado?
Tabla 2. Resumen del modelo de regresión lineal de la base y la altura máxima del tumor. Tabla obtenida a
partir del programa IBM SPSS Statistics. Base de datos propia.
Recta de regresión
𝑆𝑦
𝑏=𝑟∙
𝑆𝑥
𝑎 = 𝑦̅ − 𝑏 ∙ 𝑥̅
𝑉𝐸
𝑅2 =
𝑉𝑇
Figura 4. Representación gráfica de diferentes modelos de regresión lineal simple según el valor obtenido en el
coeficiente de determinación. Fuente: elaboración propia.
En este caso como es un modelo de regresión simple, coincide con el valor absoluto
del coeficiente de correlación de Pearson.
̅2
Coeficiente de determinación corregido R
Tabla 3. Resumen del modelo de regresión lineal simple del ejemplo. Fuente: elaboración propia.
𝑅 2 : 𝐶𝑜𝑟𝑟𝑒𝑔𝑖𝑑𝑜 = 0,504
En este caso, apenas varían porque tenemos 187 datos y una variable explicativa. En
un estudio en el que se tengan pocos casos y muchas variables independientes, el
valor de 𝑅 2 puede ser artificialmente alto y, en este caso, la diferencia entre ambos
será mucho mayor.
𝑆𝑥
𝛽=𝐵∙
𝑆𝑦
Sea 𝑋 una variable aleatoria que toma los valores 𝑥1 , 𝑥2 , … , 𝑥𝑛 , que llamaremos
puntuaciones directas y son observadas en los datos. Si 𝑥 ̅ es su media y 𝑆 su
desviación típica, se llaman puntuaciones típicas de la variable a los valores
resultantes de restarle la media y dividir por su desviación típica (a cada una de las
observaciones).
xi − x̅
S
Son muy utilizadas en las ciencias sociales y su media es cero y su desviación típica es
de 1. Se utilizan para comparar las puntuaciones obtenidas en distintas
distribuciones.
Figura 5. Representación gráfica de dos modelos de regresión lineal simple según exista o no relación lineal
entre sus variables. Fuente: elaboración propia.
Para el ejemplo:
Se tiene un 𝑝 −valor del contraste < 0,001 por lo tanto, sí existe regresión, el
coeficiente de correlación múltiple es distinto de cero.
© Universidad Internacional de La Rioja (UNIR)
Figura 6. Representación gráfica de la pendiente del modelo de regresión. Fuente: elaboración propia.
Tabla 5. Resultados del modelo de regresión lineal simple del ejemplo 1. Fuente: elaboración propia.
Siguiendo con el ejemplo, tenemos que 𝑝 − 𝑣𝑎𝑙𝑜𝑟 < 0,001 en ambos casos,
luego, los coeficientes de regresión son distintos de cero.
En la naturaleza no se suelen dar relaciones únicamente entre dos variables sino que
existen muchos más factores, por ejemplo, los kilos perdidos por una persona a lo
largo de un mes no solo estarán condicionados a la dieta alimentaria en sí, también
se pueden ver afectados por el ejercicio realizado si tenemos en cuenta la duración,
la intensidad, la ingesta de algún suplemento de aceleración del metabolismos, la
edad, el sexo, etc.
Esto es lo que nos permite analizar un modelo de regresión lineal múltiple y cómo
© Universidad Internacional de La Rioja (UNIR)
afectan a nuestra variable dependiente todos los factores que tengan alguna
influencia sobre su resultado.
𝑦 = 𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 + 𝑒
Componentes de la ecuación
Ejemplo 1 (ampliación)
Figura 8. Gráficos de dispersión de la base máxima ECO con el resto de las variables explicativas del análisis.
Fuente: elaboración propia.
Tabla 6. Matriz de correlaciones de las variables para la elaboración del modelo de regresión lineal múltiple.
Fuente: elaboración propia.
Tabla 7. Resumen de las variables del modelo de regresión lineal múltiple. Fuente: elaboración propia.
Tabla 9. Tabla ANOVA del modelo de regresión lineal múltiple. Fuente: elaboración propia.
Tabla 10. Resultados del modelo de regresión lineal múltiple. Fuente: elaboración propia.
Realizando los mismos pasos que los que se han realizado en regresión lineal simple,
tendríamos:
© Universidad Internacional de La Rioja (UNIR)
𝑦 = 𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 + 𝑒
𝐻0 : 𝑏1 = 𝑏2 = ⋯ = 𝑏𝑘 = 0 (≡ 𝑅 = 0)
𝐻1 : 𝑏𝑖 ≠ 0 (≡ 𝑅 ≠ 0) 𝑃𝑎𝑟𝑎 𝑎𝑙𝑔ú𝑛 𝑖 = 1,2, ⋯ , 𝑘
𝐻0 : 𝑏𝑖 = 0
𝐻1 : 𝑏𝑖 ≠ 0 𝑃𝑎𝑟𝑎 𝑎𝑙𝑔ú𝑛 𝑖 = 1,2, ⋯ , 𝑘
El contraste sobre los parámetros sirve para determinar si cada uno de estos puede
considerarse nulo o no. Si se cumple la hipótesis nula, entonces los coeficientes de
regresión valen cero en la población y tendremos tantos contrastes como parámetros
del modelo.
Son las condiciones para garantizar la validez del modelo. Estas han de cumplirse y
son [3]:
Exactitud de los valores pronosticados por el modelo. Cuanto más pequeño mejor
será el ajuste.
Detección de valores erróneos o alejados.
El estudio detallado de aquellos que presentan valores grandes, positivos o
negativos, (grandes en valor absoluto) puede ayudarnos a perfeccionar la
ecuación de regresión realizando un estudio detallado de estos y reciben el
nombre de casos atípicos.
A partir de las tablas 12 y 13, es fácil reconocer los casos que poseen residuos
grandes.
Tabla 13. Tabla de estadístico sobre los residuos. Fuente: elaboración propia.
Tabla 14. Tabla de resumen del modelo con el estadístico Durbin-Watson. Fuente: elaboración propia.
Siguiendo con el ejemplo 1, y a la vista de la Tabla 14, el estadístico vale 1,689, por
tanto, se encuentra entre 1,5 y 2,5. Luego, podemos asumir que los residuos son
independientes.
Figura 10. Representación de los residuos de la regresión con la variable dependiente. Distintas situaciones
que nos podemos encontrar. Fuente: elaboración propia.
Figura 11. Histograma con la curva de normalidad y gráfico P-P de normalidad de los residuos obtenidos en la
regresión. Fuente: elaboración propia.
Tabla 15. Pruebas de normalidad para los residuos del modelo. Fuente: elaboración propia.
Gráficamente, podríamos pensar que los residuos del modelo siguen una distribución
normal. Sin embargo, el 𝑝 −valor del test de Kolmogorov-Smirnov, cuyo valor es de
0,015 (Tabla 15), rechaza la hipótesis nula de normalidad.
Colinealidad
© Universidad Internacional de La Rioja (UNIR)
Existencia de colinealidad:
Valores de tolerancia muy pequeños (próximos a cero).
© Universidad Internacional de La Rioja (UNIR)
FIV grandes.
Los valores de tolerancia [4] se utilizan para calcular las varianzas de los coeficientes
de regresión. A mayor FIV para una variable, mayor será también la varianza del
respectivo coeficiente.
Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas
Diagnósticas
28
Tema 2. Ideas clave
Uno de los problemas de la colinealidad (tolerancias pequeñas, FIV grandes) es la
inestabilidad de las estimaciones de los coeficientes de regresión.
Autovalor [4]
Se calcula como la raíz cuadrada del cociente entre el autovalor más grande y cada
uno del resto de los autovalores.
Valores:
< 15 No colinealidad.
15 − 30 Posible problema de colinealidad.
> 30 Colinealidad.
Consecuencias de la colinealidad
Hacia adelante: en cada paso entra la variable más significativa, es decir, la que
mayor incremento del 𝑅 2 produce.
Hacia atrás: se parte de un modelo con todas las variables y en cada caso sale la
© Universidad Internacional de La Rioja (UNIR)
Tabla 18. Información de las variables que son introducidas y eliminadas en el modelo de regresión lineal por
pasos. Fuente: elaboración propia.
Tabla 19. Resumen del modelo de regresión lineal por pasos. Fuente: elaboración propia.
© Universidad Internacional de La Rioja (UNIR)
Tabla 20. Resultados de la tabla ANOVA del modelo de regresión lineal por pasos. Fuente: elaboración propia.
Tabla 22. Información de las variables excluidas del modelo de regresión lineal por pasos. Fuente: elaboración
propia.
Código
#Representación conjunta:
ggplot(datos, aes(x = prediccion, y = residuos)) +
geom_point(aes(color = residuos)) +
scale_color_gradient2(low = "blue", mid = "grey", high = "red") +
geom_hline(yintercept = 0) +
geom_segment(aes(xend = prediccion, yend = 0), alpha = 0.2) +
labs(title = "Distribución de los residuos", x = "Predicción modelo",
y = "Residuo") +
theme_bw() +
theme([Link] = element_text(hjust = 0.5), [Link] = "none")
Material audiovisual
2. Weisberg S. Applied Linear Regression. 3ra edición. New Jersey: John Wiley & Sons;
2005.
En el campo de las ciencias de la salud no son muy frecuentes las publicaciones en las
que se realicen modelos de regresión lineal. Por tanto, este artículo es un buen
ejemplo de los usos que este tipo de estudios pueden tener y en él se presentan
varios modelos para que los estudiantes puedan ver una aplicación real llevada a la
práctica.
6. Nos presentan dos estudios sobre el peso. Un primer estudio examina la variable
grado de estrés en función de horas de trabajo semanales y encuentra 𝑅 2 = 0,85.
Un segundo estudio examina la misma variable grado de estrés según las horas
semanales dedicadas al deporte y encuentra 𝑅 2 = 0,305. De estos, podemos
deducir que:
A. El grado de estrés no depende del tiempo dedicado al deporte.
B. La relación lineal del grado de estrés es más fuerte con el número de horas
de trabajo semanales.
C. Ambos estudios muestran una relación lineal de pendiente positiva.
D. El grado de estrés es más fuerte con el número de horas semanales
dedicadas al deporte.
© Universidad Internacional de La Rioja (UNIR)
8. En el modelo anterior, ¿cuál sería el valor predicho de IMC para un chico que de
media duerme 8 horas?
A. 20,067.
B. 23,507.
C. 26,947.
D. No es posible calcularlo con estos datos.
© Universidad Internacional de La Rioja (UNIR)
10. Las hipótesis que debe cumplir un modelo de regresión lineal son:
A. Linealidad.
B. Normalidad.
C. Homogeneidad de varianzas.
D. Todas son ciertas.
© Universidad Internacional de La Rioja (UNIR)