Regresión Logística en Bioestadística
Regresión Logística en Bioestadística
Regresión logística
Índice
Esquema 3
Ideas clave 4
4.1. Introducción y objetivos 4
© Universidad Internacional de La Rioja (UNIR)
A fondo 30
Test 31
Esquema
© Universidad Internacional de La Rioja (UNIR)
¿Regresión Lineal? / ¿Regresión Logística? ¿Por qué tenemos que realizar un modelo
de regresión logística en vez de un modelo de regresión lineal? A partir del siguiente
ejemplo vamos a ver qué representa cada modelo.
Ejemplo 1
Este ejemplo visualiza las diferencias entre un modelo de regresión lineal y un modelo
de regresión logística. En la Figura 2 se representa el resultado obtenido entre la dosis
de un medicamento y la mejoría del paciente:
© Universidad Internacional de La Rioja (UNIR)
Tenemos que:
Un modelo ideal es aquel que atribuye probabilidades altas a los individuos que
han tenido resultado 1 en la variable respuesta.
© Universidad Internacional de La Rioja (UNIR)
Odds
𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟)
𝑂𝑑𝑑𝑠 =
1 − 𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟)
0.7
𝑂𝑑𝑑𝑠 = = 2.33
1 − 0.7
© Universidad Internacional de La Rioja (UNIR)
Este concepto de odds se maneja con gran frecuencia en el mundo anglosajón, por
ejemplo, en el lenguaje de las apuestas. Supongamos que un caballo ha ganado en la
Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas
Diagnósticas
7
Tema 4. Ideas clave
última temporada un 80 % de las carreras y ha perdido (no ha ganado) un 20 %,
entonces, la odds de ese caballo es 4. Cuando se oye en una película que las apuestas
van 4 a 1, se interpreta que ese caballo tiene una probabilidad de ganar del 80 % [2].
𝑂𝑑𝑑𝑠
𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟) =
1 + 𝑂𝑑𝑑𝑠
Tanto la odds como las proporciones expresan lo mismo pero usando dos escalas
numéricas diferentes: las proporciones oscilan entre 0 y 1 y la odds entre 0 e infinito.
A veces interesa pasar de una escala a otra y, para ello, se utilizan las expresiones que
hemos visto (2).
Odds ratio
𝑃𝐹 (𝐸)
1 − 𝑃𝐹 (𝐸)
𝑂𝑅 =
𝑃𝐹̅ (𝐸)
1 − 𝑃𝐹̅ (𝐸)
𝑃𝐹 (𝐸)
Odds correspondiente al suceso de enfermar dentro del grupo expuesto al
1−𝑃𝐹 (𝐸)
factor.
𝑃𝐹 (𝐸)
Odds correspondiente al suceso de enfermar dentro del grupo no expuesto
1−𝑃𝐹 (𝐸)
al factor.
© Universidad Internacional de La Rioja (UNIR)
Ejemplo 2
Tabla 2. Tabla de doble entrada para el estado del paciente según su hábito tabáquico. Fuente: elaboración
propia.
55𝑥52
𝑂𝑅 = = 1,88
40𝑥38
𝑝
𝑙𝑛 ( ) = 𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘
© Universidad Internacional de La Rioja (UNIR)
1−𝑝
𝑝
Donde: 𝑂𝑑𝑑𝑠 = 1−𝑝 odds de que se produzca el evento.
exp(𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 )
𝑃(𝑦 = 1) =
1 + exp(𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 )
1 𝑒𝑥
=
1 + 𝑒 −𝑥 1 + 𝑒 𝑥
1
𝑃(𝑦 = 1) =
1 + exp(−𝑎 − 𝑏1 ∙ 𝑥1 − 𝑏2 ∙ 𝑥2 − ⋯ − 𝑏𝑘 ∙ 𝑥𝑘 )
Ejemplo 1 (continuación)
Con dosis pequeñas del fármaco, el paciente apenas mejora y, a medida que
aumentamos la dosis, aumenta la probabilidad de que el paciente mejore. Este
aumento es grande hasta el momento en el cual la mejoría permanece constante. E
incluso podría ser que la curva descendiese de nuevo indicándonos que con grandes
dosis del fármaco el efecto que se produce no es de mejoría si no de empeoramiento.
Figura 5. Dosis de un medicamento frente a la mejoría o no del paciente. Situación 2. Fuente: elaboración
propia.
Coeficiente 𝒂
Los parámetros 𝒃 guardan relación con una medida de cuantificación de riesgo, odds
ratio, y se cumple la siguiente relación:
𝑏̂ = ln(𝑂𝑅) → 𝑂𝑅 = exp(𝑏̂)
Variable dicotómica
1 𝐹𝑢𝑚𝑎𝑑𝑜𝑟
© Universidad Internacional de La Rioja (UNIR)
𝑂𝑅 = exp(𝑏̂)
Variable continua
A efectos del modelo, significa que efectuar ejercicio físico frecuentemente es dos
veces mayor que solo hacerlo esporádicamente, lo cual no tienen ningún sentido.
Si tenemos una variable como estado civil, la cual es una variable nominal y se
organiza en las siguientes categorías [4]:
1 = 𝑆𝑜𝑙𝑡𝑒𝑟𝑜.
2 = 𝐶𝑎𝑠𝑎𝑑𝑜.
3 = 𝐷𝑖𝑣𝑜𝑟𝑐𝑖𝑎𝑑𝑜.
4 = 𝑉𝑖𝑢𝑑𝑜.
5 = 𝑉𝑖𝑣𝑒 𝑒𝑛 𝑝𝑎𝑟𝑒𝑗𝑎.
Debemos calcular el odds ratio de la categoría que se está estudiando con respecto
al nivel de referencia (así planteada sería la primera respuesta). En nuestro ejemplo
cuantifica cómo cambia el riesgo respecto a no haber fumado nunca. Aunque la
categoría de referencia puede ser también la última o cualquiera de las intermedias.
¿Cuál debemos tomar? Dependerá de la codificación de la variable y del interés del
investigador.
𝐶𝑜𝑒𝑓𝑖𝑐𝑖𝑒𝑛𝑡𝑒 𝑏 = 0
Ejemplo 3
A partir de este ejemplo iremos explicando las diferentes tablas de resultados que
proporciona el programa IBM SPSS Statistics.
Tabla 4. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.
Tabla 5. Codificación de la variable dependiente del modelo (tabla obtenida con el programa IBM SPSS
Statistics). Fuente: elaboración propia.
Información del modelo: pruebas que nos indican cómo de bueno es el modelo que
estamos ajustando (Tablas 7 y 8).
Tabla 7. Pruebas ómnibus sobre los coeficientes del modelo (tabla obtenida con el programa IBM SPSS
Statistics). Fuente: elaboración propia.
© Universidad Internacional de La Rioja (UNIR)
Deviance
La bondad del ajuste del modelo suele valorarse con esta medida. Bastaría con
conocer que el modelo cuando se satura (el cual tendría el mismo número de
coeficientes que observaciones y que, por tanto, ajustaría perfectamente los datos)
tendrá el valor de−2𝑙𝑜𝑔(𝑣𝑒𝑟𝑜𝑠𝑖𝑚𝑖𝑙𝑖𝑡𝑢𝑑) determinado y que será más pequeño que
el obtenido para cualquier modelo con menos coeficientes. Nos interesa que su valor
sea pequeño, puesto que, cuanto más elevado sea, peor será el ajuste. Este resultado
también se utiliza para comparar distintos modelos: el que obtenga un resultado
menor será el mejor.
Otra forma de valorar el ajuste del modelo consiste en construir e interpretar la tabla
de clasificación (Tabla 9). Esta tabla trata de clasificar a los individuos en las categorías
de la variable dependiente, de tal forma que tenemos Infección hospitalaria con
valores No y Sí, los cuales podemos observar en nuestros datos, y la misma
clasificación pronosticada por el modelo.
Tabla 9. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.
Tabla 10. Variables en la ecuación (tabla obtenida con el programa IBM SPSS Statistics). Fuente: elaboración
propia.
© Universidad Internacional de La Rioja (UNIR)
Sustituyendo por los valores de la ecuación podemos desarrollar las ecuaciones del
modelo:
𝑃(𝑌 = 1)
1
=
1 + exp (1,88 + 0,87 ∙ 𝑛𝑒𝑜 + 1,37 ∙ 𝑙𝑖𝑛𝑒𝑎 − 0,99 ∙ 𝑖𝑛𝑚𝑢𝑛𝑜𝑑𝑒𝑓 − 1,81 ∙ 𝑛𝑒𝑢𝑡𝑟𝑜𝑝
−1,31 ∙ 𝑐𝑎𝑡𝑎𝑟 − 1,49 ∙ 𝑏𝑟𝑜𝑛𝑐𝑜 − 1,21 ∙ 𝑜𝑏𝑒𝑠𝑜 − 3,15 ∙ 𝑢𝑙𝑐𝑒𝑟)
𝑃(𝑌 = 1)
(−1,88 − 0,87 ∙ 𝑛𝑒𝑜 − 1,37 ∙ 𝑙𝑖𝑛𝑒𝑎 + 0,99 ∙ 𝑖𝑛𝑚𝑢𝑛𝑜𝑑𝑒𝑓 + 1,81 ∙ 𝑛𝑒𝑢𝑡𝑟𝑜𝑝
+1,31 ∙ 𝑐𝑎𝑡𝑎𝑟 + 1,49 ∙ 𝑏𝑟𝑜𝑛𝑐𝑜 + 1,21 ∙ 𝑜𝑏𝑒𝑠𝑜 + 3,15 ∙ 𝑢𝑙𝑐𝑒𝑟)
=
1 + exp (−1,88 − 0,87 ∙ 𝑛𝑒𝑜 − 1,37 ∙ 𝑙𝑖𝑛𝑒𝑎 + 0,99 ∙ 𝑖𝑛𝑚𝑢𝑛𝑜𝑑𝑒𝑓 + 1,81 ∙ 𝑛𝑒𝑢𝑡𝑟𝑜𝑝
+1,31 ∙ 𝑐𝑎𝑡𝑎𝑟 + 1,49 ∙ 𝑏𝑟𝑜𝑛𝑐𝑜 + 1,21 ∙ 𝑜𝑏𝑒𝑠𝑜 + 3,15 ∙ 𝑢𝑙𝑐𝑒𝑟)
𝐶𝑎𝑡𝑒𝑡𝑒𝑟 𝑎𝑟𝑡𝑒𝑟𝑖𝑎𝑙 = 1.
𝐵𝑟𝑜𝑛𝑐𝑜 = 0.
Ú𝑙𝑐𝑒𝑟𝑎 𝑝𝑟𝑒𝑠𝑖ó𝑛 = 1.
𝑂𝑏𝑒𝑠𝑖𝑑𝑎𝑑 = 1.
𝑉í𝑎 𝑝𝑒𝑟𝑖𝑓é𝑟𝑖𝑐𝑎 = 0.
Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas
Diagnósticas
22
Tema 4. Ideas clave
Entonces, tendremos:
1
𝑃(𝑌 = 1) =
1 + exp (1,88 + 0,87 ∙ 0 + 1,37 ∙ 0 − 0,99 ∙ 1 − 1,81 ∙ 0
−1,31 − 1 − 1,49 ∙ 0 − 1,21 ∙ 1 − 3,15 ∙ 1
Tabla 11. Prueba de Hosmer y Lemeshow (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.
© Universidad Internacional de La Rioja (UNIR)
Confusión
dosis del tratamiento son diferentes. En este caso diremos que la edad es una
variable de confusión.
Confusión: resultados
HTA / Apnea-Edad-Sexo-IMC
𝑒𝑥𝑝(𝑏𝑎𝑝𝑛𝑒𝑎 ) odds ratio debido a la apnea, ajustado o controlado para el resto de los
factores (Edad-Sexo-IMC).
Confusión: existencia
Tabla 13. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.
Confusión: comparación
Será el investigador quién establezca el criterio para decidir cuando hay diferencia.
Lo habitual es considerar que existe confusión cuando la exponencial del coeficiente
𝑏 (el OR) cambia en más del 10 % [7].
Interacción
Existe interacción cuando la asociación entre dos variables varía según los diferentes
niveles de otra u otras [7].
© Universidad Internacional de La Rioja (UNIR)
1
𝑃(𝑦 = 1) =
1 + exp(−𝑎 − 𝑏1 ∙ 𝑥1 − 𝑏2 ∙ 𝑥2 − 𝑥 ∙ ג1 ∙ 𝑥2 )
1
𝑃(𝑦 = 1) =
1 + exp (−𝑎 − 𝑏1 ∙ 𝑥1 − 𝑏2 ∙ 𝑥2 − 𝑏3 ∙ 𝑥3 − 𝑥 ∙ ג1 ∙ 𝑥2 ∙ 𝑥3
− ∙ 𝑥1 ∙ 𝑥2 − ∙ 𝑥2 ∙ 𝑥3 − ∙ 𝑥1 ∙ 𝑥3 )
Tabla 15. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.
𝑃(𝑌 = 1)
1
=
1 + exp (4,885 − 4,813 ∙ 𝑐𝑎𝑡𝑎𝑟 − 1,948 ∙ 𝑙𝑖𝑛𝑒𝑎 + 1,758 ∙ 𝑐𝑎𝑡𝑎𝑟 ∙ 𝑙𝑖𝑛𝑒𝑎
© Universidad Internacional de La Rioja (UNIR)
Código
Material audiovisual
Tesfaw LM, Fenta HM. Multivariate logistic regression analysis on the association
between anthropometric indicators of under-five children in Nigeria: NDHS 2018. BMC
Pediatrics. 2021; 21, 193. [Link] 1186/s12887-021-02657-5
Artículo desarrollado con mucho detalle donde se explica cada paso de la aplicación
de un modelo de regresión logística a niños menores de 5 años en Nigeria.
© Universidad Internacional de La Rioja (UNIR)
A. Mejores.
B. Similares y Mejores.
C. Similares.
D. Peores.
9. Un resultado para la odds ratio de 2,5 que analice la asociación entre fumar y el
desarrollo de una enfermedad pulmonar significa que:
A. Es un factor protector.
© Universidad Internacional de La Rioja (UNIR)
B. Es un factor de riesgo.
C. El factor no es estadísticamente significativo.
D. Ninguna es correcta.
IC 95 % para OR
p-valor OR
Inferior Superior
Género (Masculino vs. femenino) 0,354 1,136 0,867 1,488
11-13 años (Ref.) 0,151
Edad 14-16 años 0,218 1,200 0,898 1,602
17
17-18 años 0,453 0,839 0,530 1,327
Síntomas psicosomáticos físicos
0,016 1,388 1,062 1,812
(Poco frecuente vs. muy frecuente)
Síntomas psicosomáticos psíquicos
0,006 1,481 1,121 1,956
(Poco frecuente vs. muy frecuente)
Toma de medicamentos (Poco
<0,001 2,197 1,572 3,069
frecuente vs. muy frecuente)
IMC <0,001 0,908 0,873 0,943
Consumo de tabaco (No vs. sí) 0,001 1,669 1,224 2,276
Resultados académicos Peores (Ref.) <0,001
respecto a sus Similares <0,001 1,781 1,290 2,458
compañeros Mejores <0,001 2,017 1,402 2,903
Actividad física mejor amigo
0,013 1,361 1,066 1,738
(Frecuente vs. nada o poco frecuente)
Actividad física en familia (Sí vs. no) 0,049 1,316 1,001 1,729
Asistencia como espectador a eventos
0,023 1,334 1,040 1,711
deportivos (Sí vs. no)
Autopercepción de capacidad física
<0,001 4,842 3,634 6,451
(Buena vs. mala)
Satisfacción con capacidad física (Sí <0,001 2,506 1,889 3,325
vs. no)
Lugares al aire libre para actividad
0,017 1,448 1,069 1,961
física cerca del domicilio (Sí vs. no)
Come fruta a diario (Sí vs. no) 0,001 1,585 1,218 2,064