0% encontró este documento útil (0 votos)
12 vistas35 páginas

Regresión Logística en Bioestadística

Cargado por

infozeky
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
12 vistas35 páginas

Regresión Logística en Bioestadística

Cargado por

infozeky
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Tema 4

Herramientas para el Análisis Bioestadístico: Técnicas


Multivariantes y Validez de las Pruebas Diagnósticas

Regresión logística
Índice
Esquema 3

Ideas clave 4
4.1. Introducción y objetivos 4
© Universidad Internacional de La Rioja (UNIR)

4.2. Conceptos previos 7


4.3. Regresión logística 10
4.4. Interacción y confusión 24
4.5. Referencias bibliográficas 28

A fondo 30

Test 31
Esquema
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
3
Tema 4. Esquema
Ideas clave

4.1. Introducción y objetivos

El análisis de regresión logística es una técnica estadística utilizada para estudiar la


relación entre dos o más variables. Se puede utilizar en muchas situaciones y
pretende dar respuesta a si es posible explicar, predecir o estudiar la relación de una
variable llamada dependiente (𝑌) en función de una o más variables
independientes (𝑋1 , 𝑋2 , … 𝑋𝑘 ). La diferencia que presenta con el modelo de
regresión lineal es la variable dependiente, que en este caso es una variable
cualitativa dicotómica y solo presenta dos valores (Figura 1):

Figura 1. Esquema de un modelo de regresión logística. Fuente: adaptado de [1].

Tendremos diferentes factores que pueden influir en nuestra variable dependiente


(Figura 1) que en este caso puede representar desde la recaída o la mortalidad de un
© Universidad Internacional de La Rioja (UNIR)

paciente a la finalización de los estudios o la concesión o no de un préstamo, por


ejemplo: ¿cuáles son los factores que influyen en el desarrollo de un infarto de
miocardio?, ¿es posible predecir de antemano que un paciente corre cierto riesgo de
infarto? etc.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
4
Tema 4. Ideas clave
Al igual que en el modelo de regresión lineal se tiene el siguiente esquema (Tabla 1):

Tabla 1. Variable en un modelo de regresión logística. Fuente: adaptado de [1].

Cuando tenemos una variable dependiente se lo conoce como modelo de


regresión logística simple y cuando son más de dos variables independientes
regresión logística múltiple.

¿Regresión Lineal? / ¿Regresión Logística? ¿Por qué tenemos que realizar un modelo
de regresión logística en vez de un modelo de regresión lineal? A partir del siguiente
ejemplo vamos a ver qué representa cada modelo.

Ejemplo 1

Este ejemplo visualiza las diferencias entre un modelo de regresión lineal y un modelo
de regresión logística. En la Figura 2 se representa el resultado obtenido entre la dosis
de un medicamento y la mejoría del paciente:
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
5
Tema 4. Ideas clave
Figura 2. Representación de un modelo de regresión logística frente al modelo de regresión lineal. Dosis de un
medicamento frente a la mejoría o no del paciente. Fuente: elaboración propia.

A la vista de la figura, con dosis pequeñas la mejoría del paciente es inapreciable. A


medida que aumentamos la dosis aumenta también la mejoría del paciente.

Nosotros observamos si mejora o no el paciente y la estimación de un modelo de


regresión lineal nos da estimaciones por encima o por debajo de los valores 0-1, que
son los valores que yo observo en la respuesta de la variable que estamos analizando.

Tenemos que:
 Un modelo ideal es aquel que atribuye probabilidades altas a los individuos que
han tenido resultado 1 en la variable respuesta.
© Universidad Internacional de La Rioja (UNIR)

 En situaciones en las cuales 𝑌 no es numérica (continua) la regresión lineal no es


adecuada.
 Independientemente de los valores que asuman las variables explicativas, los
valores predichos (valores estimados) por el modelo deben estar entre 0 y 1.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
6
Tema 4. Ideas clave
Los objetivos de un modelo de regresión logística son:
 Estimar como influye en la probabilidad de aparición de un suceso la presencia de
uno o varios factores.
 Desarrollar un modelo que permita conocer la predicción de futuros sujetos.

4.2. Conceptos previos

Odds

El odds asociado a un suceso se define como el cociente entre la probabilidad de que


dicho suceso ocurra y la probabilidad de que no ocurra.

Sea el suceso «Enfermar» cuya probabilidad de que ocurra es 𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟),


entonces:

𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟)
𝑂𝑑𝑑𝑠 =
1 − 𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟)

Como la suma de las probabilidades ha de ser 1, tenemos que la probabilidad de no


enfermar es igual a 1 − 𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟).

Por ejemplo, si la probabilidad de que un paciente trasplantado sobreviva es del 70 %,


su odds será:

0.7
𝑂𝑑𝑑𝑠 = = 2.33
1 − 0.7
© Universidad Internacional de La Rioja (UNIR)

Es 2,33 veces más probable que el paciente sobreviva a que no lo haga.

Este concepto de odds se maneja con gran frecuencia en el mundo anglosajón, por
ejemplo, en el lenguaje de las apuestas. Supongamos que un caballo ha ganado en la
Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas
Diagnósticas
7
Tema 4. Ideas clave
última temporada un 80 % de las carreras y ha perdido (no ha ganado) un 20 %,
entonces, la odds de ese caballo es 4. Cuando se oye en una película que las apuestas
van 4 a 1, se interpreta que ese caballo tiene una probabilidad de ganar del 80 % [2].

De igual forma conociendo el odds podemos calcular la probabilidad del suceso:

𝑂𝑑𝑑𝑠
𝑃(𝐸𝑛𝑓𝑒𝑟𝑚𝑎𝑟) =
1 + 𝑂𝑑𝑑𝑠

Tanto la odds como las proporciones expresan lo mismo pero usando dos escalas
numéricas diferentes: las proporciones oscilan entre 0 y 1 y la odds entre 0 e infinito.
A veces interesa pasar de una escala a otra y, para ello, se utilizan las expresiones que
hemos visto (2).

Odds ratio

Es el cociente entre dos odds y su cálculo se realiza a partir de la siguiente fórmula:

𝑃𝐹 (𝐸)
1 − 𝑃𝐹 (𝐸)
𝑂𝑅 =
𝑃𝐹̅ (𝐸)
1 − 𝑃𝐹̅ (𝐸)

𝑃𝐹 (𝐸)
Odds correspondiente al suceso de enfermar dentro del grupo expuesto al
1−𝑃𝐹 (𝐸)

factor.
𝑃𝐹 (𝐸)
Odds correspondiente al suceso de enfermar dentro del grupo no expuesto
1−𝑃𝐹 (𝐸)

al factor.
© Universidad Internacional de La Rioja (UNIR)

Este concepto también recibe el nombre de razón de productos cruzado, el cual se


debe a su cálculo tal y como veremos en el ejemplo a continuación.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
8
Tema 4. Ideas clave
Otros nombres que puede recibir: razón de oportunidades, razón de monomios,
razón de posibilidades, oportunidad relativa o razón de probabilidades.

La OR carece de unidades de medida.

Ejemplo 2

Ejemplo sencillo para el cálculo de la odds ratio: se ha registrado el estado del


paciente y si fuma o no. Los datos se resumen en la siguiente tabla (Tabla 2):

Tabla 2. Tabla de doble entrada para el estado del paciente según su hábito tabáquico. Fuente: elaboración
propia.

55𝑥52
𝑂𝑅 = = 1,88
40𝑥38

Situaciones que se pueden dar:


 𝑂𝑅 > 1, hay una asociación positiva entre el suceso y el factor de estudio.
 En el ejemplo el estar enfermo/sano está asociado al tabaco. El tabaco ofrece un
riesgo 1,88 veces mayor de estar enfermo con respecto a no fumar.
 𝑂𝑅 = 1, el suceso no está asociado al factor.
© Universidad Internacional de La Rioja (UNIR)

 𝑂𝑅 < 1, en este caso existe una asociación negativa entre el factor y la


enfermedad.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
9
Tema 4. Ideas clave
Figura 3. Factor de protección/factor de riesgo. Fuente: elaboración propia.

4.3. Regresión logística

El objetivo es modelar cómo influye en la probabilidad de aparición de un suceso la


presencia o no de diversos factores y el valor o nivel de estos.

Utilizaremos regresión logística cuando tengamos una variable dependiente


dicotómica.

1 𝑒𝑙 𝑠𝑢𝑐𝑒𝑠𝑜 𝑜𝑐𝑢𝑟𝑟𝑒 (𝑒𝑛𝑓𝑒𝑟𝑚𝑜)


Dada la variable dicotómica 𝑦 = { } y las
2 𝑛𝑜 𝑜𝑐𝑢𝑟𝑟𝑒 𝑒𝑙 𝑠𝑢𝑐𝑒𝑠𝑜 (𝑛𝑜 𝑒𝑛𝑓𝑒𝑟𝑚𝑜 =
variables independientes (𝑋1 , 𝑋2 , … , 𝑋𝑘 ) pueden ser de tipo cuantitativo o
cualitativo.

El modelo de regresión logística es:

𝑝
𝑙𝑛 ( ) = 𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘
© Universidad Internacional de La Rioja (UNIR)

1−𝑝

𝑝
Donde: 𝑂𝑑𝑑𝑠 = 1−𝑝 odds de que se produzca el evento.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
10
Tema 4. Ideas clave
La transformación logarítmica es necesaria para adaptarse a un fenómeno como la
probabilidad cuyos límites teóricos son tan estrechos como 0 y 1.

Desarrollando la ecuación del modelo llegamos a:

exp(𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 )
𝑃(𝑦 = 1) =
1 + exp(𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 )

Dado que se cumple:

1 𝑒𝑥
=
1 + 𝑒 −𝑥 1 + 𝑒 𝑥

También se puede expresar como:

1
𝑃(𝑦 = 1) =
1 + exp(−𝑎 − 𝑏1 ∙ 𝑥1 − 𝑏2 ∙ 𝑥2 − ⋯ − 𝑏𝑘 ∙ 𝑥𝑘 )

El modelo de regresión logística simple es la versión más sencilla, donde únicamente


se tiene una variable independiente y el modelo se expresa como:
exp (𝑎 + 𝑏 ∙ 𝑥)
𝑃(𝑦 = 1) =
1 + exp (𝑎 + 𝑏 ∙ 𝑥)

Ejemplo 1 (continuación)

Dado un modelo de regresión logística simple donde:


 𝑋: 𝐷𝑜𝑠𝑖𝑠 𝑑𝑒 𝑢𝑛 𝑓á𝑟𝑚𝑎𝑐𝑜.
 𝑌: 𝐶𝑢𝑟𝑎𝑐𝑖ó𝑛 𝑜 𝑚𝑒𝑗𝑜𝑟í𝑎 𝑑𝑒𝑙 𝑝𝑎𝑐𝑖𝑒𝑛𝑡𝑒.
© Universidad Internacional de La Rioja (UNIR)

Veamos que ocurre con la función logística cuando 𝑏 > 0:

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
11
Tema 4. Ideas clave
Figura 4. Dosis de un medicamento frente a la mejoría o no del paciente. Situación 1. Fuente: elaboración
propia.

Con dosis pequeñas del fármaco, el paciente apenas mejora y, a medida que
aumentamos la dosis, aumenta la probabilidad de que el paciente mejore. Este
aumento es grande hasta el momento en el cual la mejoría permanece constante. E
incluso podría ser que la curva descendiese de nuevo indicándonos que con grandes
dosis del fármaco el efecto que se produce no es de mejoría si no de empeoramiento.

Función logística cuando 𝑏 < 0:


© Universidad Internacional de La Rioja (UNIR)

Figura 5. Dosis de un medicamento frente a la mejoría o no del paciente. Situación 2. Fuente: elaboración
propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
12
Tema 4. Ideas clave
En este caso de da el efecto contrario, con dosis pequeñas del fármaco el paciente
mejora mucho y, a medida que se aumenta la dosis del paciente, la probabilidad de
que se produzca una mejoría se va reduciendo.

Interpretación de los coeficientes

Coeficiente 𝒂

Se interpreta como el logaritmo del odds cuando el resto de las variables


independientes valen cero.

Odds de tener el suceso de estudio (enfermar):


𝑃(𝐸)
𝑃(𝐸̅ )
Cuando las variables independientes no toman valor 0 (no tiene sentido físico) se
interpreta como el odds basal, el cual no depende de las variables independientes.

Los parámetros 𝒃 guardan relación con una medida de cuantificación de riesgo, odds
ratio, y se cumple la siguiente relación:
𝑏̂ = ln(𝑂𝑅) → 𝑂𝑅 = exp(𝑏̂)

La interpretación de los coeficientes obtenidos para las variables explicativas


varía según el tipo de variable.

Variable dicotómica

1 𝐹𝑢𝑚𝑎𝑑𝑜𝑟
© Universidad Internacional de La Rioja (UNIR)

Sea la variable fumador = { } el coeficiente 𝑏 de la ecuación para ese


0 𝑁𝑜 𝑓𝑢𝑚𝑎𝑑𝑜𝑟
factor está directamente relacionado con el odds ratio (OR) de ser fumador respecto
a no serlo:

𝑂𝑅 = exp(𝑏̂)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
13
Tema 4. Ideas clave
Es una medida que cuantifica el riesgo que representa poseer el factor
correspondiente (fumar) respecto a no poseerlo, suponiendo que el resto de las
variables del modelo permanecen constantes.

Supongamos que tenemos las variables:


 𝑌 = 𝑑𝑒𝑠𝑎𝑟𝑟𝑜𝑙𝑙𝑎𝑟 𝑢𝑛𝑎 𝑒𝑛𝑓𝑒𝑟𝑚𝑒𝑑𝑎𝑑 𝑝𝑢𝑙𝑚𝑜𝑛𝑎𝑟.
 𝑋 = 𝐹𝑢𝑚𝑎𝑟.
𝑃𝐹 (𝐸)
1−𝑃𝐹 (𝐸)
Se tiene que: 𝑂𝑅 = ̂𝑓𝑢𝑚𝑎𝑟 )
= 𝑒𝑥𝑝(𝑏
̅ (𝐸)
𝑃𝐹
̅ (𝐸)
1−𝑃𝐹

Variable continua

Cuantifica el cambio en el riesgo cuando el valor de la variable independiente


aumenta en una unidad y el resto de las variables permanecen constantes.

La odds ratio que supone pasar de la edad 𝑥1 a la edad 𝑥2 , siendo 𝑏 el coeficiente


correspondiente a la edad en el modelo logístico es [3]:

𝑂𝑅 = exp (𝑏̂ ∙ (𝑥2 − 𝑥1 )

Variables cualitativas con más de dos categorías

La metodología empleada para la estimación del modelo logístico se basa en la


utilización de variables dicotómicas, al igual que en cualquier otro procedimiento de
regresión, ya que es incorrecto que en él intervengan variables cualitativas, ya sean
nominales u ordinales [4].
© Universidad Internacional de La Rioja (UNIR)

Como dijimos, no es correcto introducir una variable cualitativa directamente en el


modelo de regresión logística y la asignación de un número a cada categoría no
resuelve el problema como podemos ver a continuación:

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
14
Tema 4. Ideas clave
Si tenemos la variable ejercicio físico con tres posibles respuestas, podemos
representarlas con las siguientes variables ordinales:
 0 = 𝑆𝑒𝑑𝑒𝑛𝑡𝑎𝑟𝑖𝑜.
 1 = 𝐸𝑠𝑝𝑜𝑟á𝑑𝑖𝑐𝑎𝑚𝑒𝑛𝑡𝑒.
 2 = 𝐹𝑟𝑒𝑐𝑢𝑒𝑛𝑡𝑒𝑚𝑒𝑛𝑡𝑒.

A efectos del modelo, significa que efectuar ejercicio físico frecuentemente es dos
veces mayor que solo hacerlo esporádicamente, lo cual no tienen ningún sentido.
Si tenemos una variable como estado civil, la cual es una variable nominal y se
organiza en las siguientes categorías [4]:
 1 = 𝑆𝑜𝑙𝑡𝑒𝑟𝑜.
 2 = 𝐶𝑎𝑠𝑎𝑑𝑜.
 3 = 𝐷𝑖𝑣𝑜𝑟𝑐𝑖𝑎𝑑𝑜.
 4 = 𝑉𝑖𝑢𝑑𝑜.
 5 = 𝑉𝑖𝑣𝑒 𝑒𝑛 𝑝𝑎𝑟𝑒𝑗𝑎.

¿Cómo se interpretan los coeficientes de esta variable en el estudio?

La solución sería crear tantas variables dicotómicas como 𝑛ú𝑚𝑒𝑟𝑜 𝑑𝑒 𝑟𝑒𝑠𝑝𝑢𝑒𝑠𝑡𝑎𝑠 −


1. Estas nuevas variables, artificialmente creadas, reciben el nombre de variables
dummy o variables indicadoras.

Para la variable tabaco las registramos como:


 𝑁𝑜 𝑓𝑢𝑚𝑎𝑑𝑜𝑟.
 𝐸𝑥𝑓𝑢𝑚𝑎𝑑𝑜𝑟.
 𝑀𝑒𝑛𝑜𝑠 𝑑𝑒 10 𝑐𝑖𝑔𝑎𝑟𝑟𝑖𝑙𝑙𝑜𝑠 𝑎𝑙 𝑑í𝑎.
 10 𝑜 𝑚á𝑠 𝑐𝑖𝑔𝑎𝑟𝑟𝑖𝑙𝑙𝑜𝑠 𝑑𝑖𝑎𝑟𝑖𝑜𝑠.
© Universidad Internacional de La Rioja (UNIR)

Tenemos 4 posibles respuestas por lo que construiremos 3 variables dicotómicas


(valores 0,1) de la siguiente forma:

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
15
Tema 4. Ideas clave
Tabla 3. Variables dummy para la variable categórica de tabaco. Fuente: elaboración propia.

Existen diferentes posibilidades de codificación, que conducen a diferentes


interpretaciones, siendo esta la más habitual y la más sencilla.

Interpretación del coeficiente

Debemos calcular el odds ratio de la categoría que se está estudiando con respecto
al nivel de referencia (así planteada sería la primera respuesta). En nuestro ejemplo
cuantifica cómo cambia el riesgo respecto a no haber fumado nunca. Aunque la
categoría de referencia puede ser también la última o cualquiera de las intermedias.
¿Cuál debemos tomar? Dependerá de la codificación de la variable y del interés del
investigador.

Factor de riesgo / de protección.

Factor de riesgo (factor positivo)


© Universidad Internacional de La Rioja (UNIR)

El coeficiente 𝑏 correspondiente a la variable es positivo, por tanto, el resultado de


la odds ratio será mayor que 1. La presencia del factor está asociada con una mayor
frecuencia del suceso.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
16
Tema 4. Ideas clave
Factor de protección (factor negativo)

El coeficiente 𝑏 es negativo, por tanto, el resultado para el valor de la odds ratio es


menor que 1. La presencia del factor está asociada con una disminución de la
frecuencia del suceso.

𝐶𝑜𝑒𝑓𝑖𝑐𝑖𝑒𝑛𝑡𝑒 𝑏 = 0

Si el coeficiente 𝑏 obtiene el valor 0, entonces, la variable correspondiente a dicho


coeficiente no está asociada al suceso y el valor de la odds ratio será de 1. Podríamos
tomar la decisión de eliminarla del modelo.

Ejemplo 3

Se ha realizado un estudio acerca de la información de los pacientes ingresados en


una unidad de cuidados intensivos con el objetivo de intentar predecir la mortalidad
de los pacientes. En el registro de los datos disponemos de:
 Datos personales: edad, sexo, etc.
 Datos del ingreso: fecha de ingreso en el servicio, programado o urgente, etc.
 Traslados: fecha y servicio.
 Datos del alta: fecha y motivo.
 Intervención quirúrgica: programada o urgente, fecha, tipo, duración, etc.
 Infecciones: hospitalarias, comunitarias, localización de estas, etc.
 Antibióticos: identificación, fecha de inicio y fin del tratamiento, etc.
 Factores de riesgo de naturaleza intrínseca: coma, insuficiencia renal, etc.
 Maniobras (factores de riesgo de naturaleza extrínseca): sondaje urinario,
ventilación mecánica, línea periférica, catéter central, etc.
© Universidad Internacional de La Rioja (UNIR)

A partir de este ejemplo iremos explicando las diferentes tablas de resultados que
proporciona el programa IBM SPSS Statistics.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
17
Tema 4. Ideas clave
La Tabla 4 nos proporciona un resumen de los datos —debemos tener en cuenta que
si la base de datos presenta valores perdidos esos casos serán eliminados—. En
nuestro ejemplo tenemos 33 pacientes que por alguna razón han sido eliminados del
estudio, por tal motivo, de los 533 pacientes se analizarán 500.

Tabla 4. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.

La siguiente tabla nos presenta la información de la variable dependiente o respuesta


y nos indica cómo está codificada.

Tabla 5. Codificación de la variable dependiente del modelo (tabla obtenida con el programa IBM SPSS
Statistics). Fuente: elaboración propia.

Creación para el modelo de las variables indicadoras o dummy. Codificación interna


de las variables categóricas que realiza el programa (Tabla 6).
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
18
Tema 4. Ideas clave
Tabla 6. Codificación de las variables categóricas (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.

Información del modelo: pruebas que nos indican cómo de bueno es el modelo que
estamos ajustando (Tablas 7 y 8).

Tabla 7. Pruebas ómnibus sobre los coeficientes del modelo (tabla obtenida con el programa IBM SPSS
Statistics). Fuente: elaboración propia.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
19
Tema 4. Ideas clave
Tabla 8. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.

Deviance

La bondad del ajuste del modelo suele valorarse con esta medida. Bastaría con
conocer que el modelo cuando se satura (el cual tendría el mismo número de
coeficientes que observaciones y que, por tanto, ajustaría perfectamente los datos)
tendrá el valor de−2𝑙𝑜𝑔(𝑣𝑒𝑟𝑜𝑠𝑖𝑚𝑖𝑙𝑖𝑡𝑢𝑑) determinado y que será más pequeño que
el obtenido para cualquier modelo con menos coeficientes. Nos interesa que su valor
sea pequeño, puesto que, cuanto más elevado sea, peor será el ajuste. Este resultado
también se utiliza para comparar distintos modelos: el que obtenga un resultado
menor será el mejor.

El resultado nos indica si el modelo es estadísticamente significativo, en este caso


𝑝 < 0,001.

R cuadrado de Cox y Snell y R cuadrado de Nagelkerke

Estas medidas se obtienen a partir del modelo ajustado y su interpretación es similar


a la del coeficiente de determinación múltiple de la regresión lineal. Toma valores
© Universidad Internacional de La Rioja (UNIR)

entre 0 y 1 y se interpreta como la proporción de variabilidad de la variable


dependiente explicada por el modelo.

El método empleado para la estimación de los coeficientes es el de máxima


verosimilitud.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
20
Tema 4. Ideas clave
Tabla de clasificación

Otra forma de valorar el ajuste del modelo consiste en construir e interpretar la tabla
de clasificación (Tabla 9). Esta tabla trata de clasificar a los individuos en las categorías
de la variable dependiente, de tal forma que tenemos Infección hospitalaria con
valores No y Sí, los cuales podemos observar en nuestros datos, y la misma
clasificación pronosticada por el modelo.

Tabla 9. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.

Tabla 10. Variables en la ecuación (tabla obtenida con el programa IBM SPSS Statistics). Fuente: elaboración
propia.
© Universidad Internacional de La Rioja (UNIR)

La significación estadística de cada coeficiente del modelo (basada en el estadístico


de Wald) ofrece el equivalente a la significación de los coeficientes de regresión lineal
múltiple. Si una variable independiente resulta no significativa podemos considerar
eliminarla del modelo (a menos que esté actuando como variable de confusión con
otra independiente significativa).

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
21
Tema 4. Ideas clave
La significación del estadístico de Wald para el coeficiente es la que corresponde a
contrastar la hipótesis nula de que este vale 0 en la población o, lo que es lo mismo,
que la OR asociada vale uno [5]. Por lo tanto, la variable correspondiente a este
coeficiente no es estadísticamente significativa y puede ser candidata a ser eliminada
del análisis.

A partir de los resultados obtenidos en la Tabla 10 obtendremos la ecuación


del modelo.

Sustituyendo por los valores de la ecuación podemos desarrollar las ecuaciones del
modelo:

𝑃(𝑌 = 1)
1
=
1 + exp (1,88 + 0,87 ∙ 𝑛𝑒𝑜 + 1,37 ∙ 𝑙𝑖𝑛𝑒𝑎 − 0,99 ∙ 𝑖𝑛𝑚𝑢𝑛𝑜𝑑𝑒𝑓 − 1,81 ∙ 𝑛𝑒𝑢𝑡𝑟𝑜𝑝
−1,31 ∙ 𝑐𝑎𝑡𝑎𝑟 − 1,49 ∙ 𝑏𝑟𝑜𝑛𝑐𝑜 − 1,21 ∙ 𝑜𝑏𝑒𝑠𝑜 − 3,15 ∙ 𝑢𝑙𝑐𝑒𝑟)

𝑃(𝑌 = 1)
(−1,88 − 0,87 ∙ 𝑛𝑒𝑜 − 1,37 ∙ 𝑙𝑖𝑛𝑒𝑎 + 0,99 ∙ 𝑖𝑛𝑚𝑢𝑛𝑜𝑑𝑒𝑓 + 1,81 ∙ 𝑛𝑒𝑢𝑡𝑟𝑜𝑝
+1,31 ∙ 𝑐𝑎𝑡𝑎𝑟 + 1,49 ∙ 𝑏𝑟𝑜𝑛𝑐𝑜 + 1,21 ∙ 𝑜𝑏𝑒𝑠𝑜 + 3,15 ∙ 𝑢𝑙𝑐𝑒𝑟)
=
1 + exp (−1,88 − 0,87 ∙ 𝑛𝑒𝑜 − 1,37 ∙ 𝑙𝑖𝑛𝑒𝑎 + 0,99 ∙ 𝑖𝑛𝑚𝑢𝑛𝑜𝑑𝑒𝑓 + 1,81 ∙ 𝑛𝑒𝑢𝑡𝑟𝑜𝑝
+1,31 ∙ 𝑐𝑎𝑡𝑎𝑟 + 1,49 ∙ 𝑏𝑟𝑜𝑛𝑐𝑜 + 1,21 ∙ 𝑜𝑏𝑒𝑠𝑜 + 3,15 ∙ 𝑢𝑙𝑐𝑒𝑟)

Si queremos conocer la probabilidad de que un paciente tenga una infección


hospitalaria, basándonos en los resultados del modelo anterior y a partir de las
siguientes características:
 𝑁𝑒𝑜𝑝𝑙𝑎𝑠𝑖𝑎 = 0.
 𝐼𝑛𝑚𝑢𝑛𝑜𝑑𝑒𝑓𝑖𝑐𝑖𝑒𝑛𝑐𝑖𝑎 = 1.
 𝑁𝑒𝑢𝑡𝑟𝑜𝑝𝑒𝑛í𝑎 = 0.
© Universidad Internacional de La Rioja (UNIR)

 𝐶𝑎𝑡𝑒𝑡𝑒𝑟 𝑎𝑟𝑡𝑒𝑟𝑖𝑎𝑙 = 1.
 𝐵𝑟𝑜𝑛𝑐𝑜 = 0.
 Ú𝑙𝑐𝑒𝑟𝑎 𝑝𝑟𝑒𝑠𝑖ó𝑛 = 1.
 𝑂𝑏𝑒𝑠𝑖𝑑𝑎𝑑 = 1.
 𝑉í𝑎 𝑝𝑒𝑟𝑖𝑓é𝑟𝑖𝑐𝑎 = 0.
Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas
Diagnósticas
22
Tema 4. Ideas clave
Entonces, tendremos:
1
𝑃(𝑌 = 1) =
1 + exp (1,88 + 0,87 ∙ 0 + 1,37 ∙ 0 − 0,99 ∙ 1 − 1,81 ∙ 0
−1,31 − 1 − 1,49 ∙ 0 − 1,21 ∙ 1 − 3,15 ∙ 1

𝑃(𝑌 = 1) = 0,9916 ⇒ 99,16 %

Prueba de bondad de ajuste de Hosmer - Lemeshow

Es un estadístico que sirve para contrastar la hipótesis de que el modelo se ajusta


bien (la distancia entre las respuestas observadas y las estimadas por el modelo son
pequeñas) de forma global.

Con los resultados anteriores se tiene:

Tabla 11. Prueba de Hosmer y Lemeshow (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
23
Tema 4. Ideas clave
Tabla 12. Tabla de contingencia para la prueba de Hosmer y Lemeshow (tabla obtenida con el programa IBM
SPSS Statistics). Fuente: elaboración propia.

Con esto podemos deducir que el modelo se ajusta bien.

4.4. Interacción y confusión

Confusión

Existe confusión cuando la asociación entre dos variables difiere significativamente


según que se considere, o no, otra variable. A esta última variable se la denomina
variable de confusión para la asociación [6].

En el ejemplo 1, existe confusión cuando, en el modelo de regresión en el cual


estamos estudiando la mejoría de un paciente en función de la dosis del tratamiento
proporcionada, la relación existente entre ambas variables es diferente según se
incluya o no la edad en el modelo y los coeficientes en uno y otro modelo para la
© Universidad Internacional de La Rioja (UNIR)

dosis del tratamiento son diferentes. En este caso diremos que la edad es una
variable de confusión.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
24
Tema 4. Ideas clave
Confusión: planteamiento

HTA / Síndrome de apnea nocturna


El resultado puede ser diferente si se tienen en cuenta otras variables como:
 Edad.
 Sexo.
 Índice de masa corporal.

Solución: incluirlas en el modelo de regresión logística como variables


independientes.

Confusión: resultados

HTA / Apnea-Edad-Sexo-IMC
𝑒𝑥𝑝(𝑏𝑎𝑝𝑛𝑒𝑎 ) odds ratio debido a la apnea, ajustado o controlado para el resto de los
factores (Edad-Sexo-IMC).

Confusión: existencia

Contrastar la existencia de confusión requiere comparar los coeficientes de regresión


obtenidos en dos modelos diferentes y si hay diferencia, existe confusión, en cuyo
caso la mejor estimación es la ajustada [7].
© Universidad Internacional de La Rioja (UNIR)

Tabla 13. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
25
Tema 4. Ideas clave
Tabla 14. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.

Confusión: comparación

No se precisa realizar un contraste de hipótesis estadístico, ya que, aunque la


diferencia encontrada sea debida al azar, representa una distorsión que la estimación
ajustada corrige.

Será el investigador quién establezca el criterio para decidir cuando hay diferencia.
Lo habitual es considerar que existe confusión cuando la exponencial del coeficiente
𝑏 (el OR) cambia en más del 10 % [7].

Interacción

Existe interacción cuando la asociación entre dos variables varía según los diferentes
niveles de otra u otras [7].
© Universidad Internacional de La Rioja (UNIR)

Supongamos que la probabilidad de padecer HTA cuando se tiene síndrome de apnea


aumenta con la edad.
 En este caso decimos que existe interacción entre las variables EDAD y APNEA.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
26
Tema 4. Ideas clave
 Esto puede extenderse a más de dos variables, se pueden incluir interacciones de
3 o más variables.
 Si un ajuste incluye un término de cierto orden, el modelo ha de incluir todas las
interacciones de orden inferior.
 En la práctica no se suelen usar las de más de dos variables.

Interacción de dos variables

1
𝑃(𝑦 = 1) =
1 + exp(−𝑎 − 𝑏1 ∙ 𝑥1 − 𝑏2 ∙ 𝑥2 − ‫𝑥 ∙ ג‬1 ∙ 𝑥2 )

Interacción de tres variables

1
𝑃(𝑦 = 1) =
1 + exp (−𝑎 − 𝑏1 ∙ 𝑥1 − 𝑏2 ∙ 𝑥2 − 𝑏3 ∙ 𝑥3 − ‫𝑥 ∙ ג‬1 ∙ 𝑥2 ∙ 𝑥3
−  ∙ 𝑥1 ∙ 𝑥2 −  ∙ 𝑥2 ∙ 𝑥3 −  ∙ 𝑥1 ∙ 𝑥3 )

Tabla 15. Información del modelo realizado (tabla obtenida con el programa IBM SPSS Statistics). Fuente:
elaboración propia.

𝑃(𝑌 = 1)
1
=
1 + exp (4,885 − 4,813 ∙ 𝑐𝑎𝑡𝑎𝑟 − 1,948 ∙ 𝑙𝑖𝑛𝑒𝑎 + 1,758 ∙ 𝑐𝑎𝑡𝑎𝑟 ∙ 𝑙𝑖𝑛𝑒𝑎
© Universidad Internacional de La Rioja (UNIR)

Código

#Cálculo del modelo de regresión logística simple:


datos<-Lectura de los datos

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
27
Tema 4. Ideas clave
head(datos)
atacch(datos)

reg_logística<- glm(mortalidad ~ infección, data=datos, family="binomial")


summary(reg_logística) # Información del modelo
confint(reg_logística, level=0.95) # Intervalos de confianza para los
parámetros
residuals(reg_logística) #Residuales del modelo
[Link](reg_logística) #Valores ajustados
coef(reg_logística) #Coeficientes
predicts(reg_logística, type="response") #Predicciones del modelo

Material audiovisual

Vídeo: Variables de ajuste en un modelo de regresión logística

Se llevará a cabo un modelo de regresión logística en el que serán consideradas


determinadas variables como ajuste.

4.5. Referencias bibliográficas

1. Martínez-González MA, Irala J, Faulin-Fajardo FJ. Bioestadística Amigable. Madrid:


Díaz de Santos; 2001.
© Universidad Internacional de La Rioja (UNIR)

2. Monografias [internet]. Introducción a los modelos multivariables [citado 2022 jun.


2]; [4 pantallas]. Disponible en:
[Link]
multivariables/introduccion-modelos-multivariables

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
28
Tema 4. Ideas clave
3. Ripoll Martín R. Cuantificación en tiempo real de la subunidad hTERT (Telomerase
Reverse Transcriptase) del gen de la telomerasa en plasma de pacientes con cáncer
colorrectal [tesis doctoral]. [Valencia]: Universitat de Valencia; 2007 jul. 5. 183 p.
Tesis doctoral para la Universitat de Valencia. [Link]

4. Calderón-Saldaña JP, Alzamora de los Godos-Urcia L. Regresión logística aplicada a


la epidemiología. Revista Salud, Sexualidad y Sociedad. 2009; 1(4).

5. Barón-López FJ. Regresión logística binaria. Estadística básica y avanzada [apuntes].


Máster en Nuevas Tendencias en Ciencias de la Salud. 2019 my. 8. Universidad de
Málaga. 2019 [inédito] Disponible en:
[Link]

6. Cruz-Trejos E, Espinosa Peña J, Aristizábal Hernández S. Modelo para la medición


del riesgo de insolvencia empresarial: PYME de Colombia, un caso de estudio. Entre
Ciencia e Ingeniería. 2019; 8(16), 16-28. Disponible en:
[Link]

7. Abraira V. Modelos de regresión logística [apuntes]. Unidad de Bioestadística


Clínica. Hospital Universitario Ramón y Cajal. S.f. [inédito]. Disponible en:
[Link]
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
29
Tema 4. Ideas clave
A fondo
Cuadernos de estadística: regresión logística

Silva-Aycaguer LC. Regresión logística (cuadernos de estadística). Madrid: La Muralla,


2004.

En este recurso, el estudiante tendrá un desarrollo teórico y práctico de los


conocimientos vistos en este tema. Los cuadernos de estadística de la edición Muralla
son pequeños libros que pueden servirle al estudiante de manual para el desarrollo
de nuevos ejemplos y casos prácticos.

Análisis de regresión logística multivariante sobre la asociación entre los


indicadores antropométricos de los niños menores de cinco años en Nigeria: NDHS
2018

Tesfaw LM, Fenta HM. Multivariate logistic regression analysis on the association
between anthropometric indicators of under-five children in Nigeria: NDHS 2018. BMC
Pediatrics. 2021; 21, 193. [Link] 1186/s12887-021-02657-5

Artículo desarrollado con mucho detalle donde se explica cada paso de la aplicación
de un modelo de regresión logística a niños menores de 5 años en Nigeria.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
30
Tema 4. A fondo
Test
1. Si quisiera analizar los factores de riesgo del sedentarismo en la población
adolescente, necesitaríamos como variable dependiente:
A. Una variable cualitativa.
B. Una variable cualitativa dicotómica.
C. Una variable cuantitativa.
D. No importa el tipo de variable.

2. Siguiendo el ejemplo anterior, en la siguiente tabla se presenta el efecto de la


comida no saludable, de lo que podemos deducir que:

A. Ingerir comida no saludable es un factor protector de ser sedentario.


B. La ingesta de comida no saludable es un factor de riesgo de ser sedentario.
C. La ingesta de comida saludable no afecta al sedentarismo.
D. No podemos valorar el efecto de la comida no saludable con esta tabla.

3. En un modelo de regresión logística las variables independientes son:


A. Todas variables cuantitativas.
© Universidad Internacional de La Rioja (UNIR)

B. Todas variables cualitativas dicotómicas.


C. Variables cualitativas o cuantitativas.
D. Todas variables cualitativas

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
31
Tema 4. Test
4. En un análisis de regresión logística una variable independiente de tipo cualitativo
con más de dos categorías:
A. Se debe incluir como variable dummy o variable indicadora.
B. No se puede incluir en el modelo.
C. Se incluye directamente en el modelo.
D. Ninguna es verdadera.

5. En el siguiente análisis la variable notas se ha introducido como variable


independiente con tres categorías, la categoría de referencia es tener notas:

A. Mejores.
B. Similares y Mejores.
C. Similares.
D. Peores.

6. El factor de protección es aquel que:


A. Presenta en el modelo de regresión logística un valor de 𝑏 negativo.
B. Presenta un valor para la odds ratio igual a 1.
C. Presenta en el modelo de regresión logística un valor de 𝑏 positivo.
D. Presenta un valor para la odds ratio mayor que 1.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
32
Tema 4. Test
7. A partir de la siguiente tabla podemos concluir que:

A. Todas las variables independientes son factores de riesgo y estadísticamente


significativas.
B. La edad no influye en la dependiente analizada.
C. Todas las variables independientes son factores protectores y salvo la edad
el resto son estadísticamente significativas.
D. La edad es la única que influye en la variable dependiente.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
33
Tema 4. Test
8. En el siguiente gráfico aparecen representados los resultados para un modelo de
regresión logística en el cual se analizan los resultados asociados al sedentarismo.
El gráfico presenta el valor de la OR con un cuadrado azul y su intervalo de
confianza con una línea. A la vista del gráfico podemos decir que:

A. Todas las variables independientes analizadas presentan significación


estadística.
B. Algunas variables no influyen, puesto que su intervalo de confianza incluye
el valor 1.
C. Todas las variables son factores protectores.
D. Todas las variables son factores de riesgo.

9. Un resultado para la odds ratio de 2,5 que analice la asociación entre fumar y el
desarrollo de una enfermedad pulmonar significa que:
A. Es un factor protector.
© Universidad Internacional de La Rioja (UNIR)

B. Es un factor de riesgo.
C. El factor no es estadísticamente significativo.
D. Ninguna es correcta.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
34
Tema 4. Test
10. En el siguiente resultado para un modelo de regresión logística tenemos que:

IC 95 % para OR
p-valor OR
Inferior Superior
Género (Masculino vs. femenino) 0,354 1,136 0,867 1,488
11-13 años (Ref.) 0,151
Edad 14-16 años 0,218 1,200 0,898 1,602
17
17-18 años 0,453 0,839 0,530 1,327
Síntomas psicosomáticos físicos
0,016 1,388 1,062 1,812
(Poco frecuente vs. muy frecuente)
Síntomas psicosomáticos psíquicos
0,006 1,481 1,121 1,956
(Poco frecuente vs. muy frecuente)
Toma de medicamentos (Poco
<0,001 2,197 1,572 3,069
frecuente vs. muy frecuente)
IMC <0,001 0,908 0,873 0,943
Consumo de tabaco (No vs. sí) 0,001 1,669 1,224 2,276
Resultados académicos Peores (Ref.) <0,001
respecto a sus Similares <0,001 1,781 1,290 2,458
compañeros Mejores <0,001 2,017 1,402 2,903
Actividad física mejor amigo
0,013 1,361 1,066 1,738
(Frecuente vs. nada o poco frecuente)
Actividad física en familia (Sí vs. no) 0,049 1,316 1,001 1,729
Asistencia como espectador a eventos
0,023 1,334 1,040 1,711
deportivos (Sí vs. no)
Autopercepción de capacidad física
<0,001 4,842 3,634 6,451
(Buena vs. mala)
Satisfacción con capacidad física (Sí <0,001 2,506 1,889 3,325
vs. no)
Lugares al aire libre para actividad
0,017 1,448 1,069 1,961
física cerca del domicilio (Sí vs. no)
Come fruta a diario (Sí vs. no) 0,001 1,585 1,218 2,064

A. El índice de masa corporal es factor protector.


B. Todos los factores son factores de riesgo.
C. La edad y el sexo son considerados factores de confusión.
D. Son correctas A y C.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
35
Tema 4. Test

También podría gustarte