0% encontró este documento útil (0 votos)
5 vistas41 páginas

Regresión Lineal Múltiple en Bioestadística

Cargado por

infozeky
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
5 vistas41 páginas

Regresión Lineal Múltiple en Bioestadística

Cargado por

infozeky
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Tema 2

Herramientas para el Análisis Bioestadístico: Técnicas


Multivariantes y Validez de las Pruebas Diagnósticas

Regresión lineal múltiple


Índice
Esquema 3

Ideas clave 4
2.1. Introducción y objetivos 4
2.2. Regresión lineal simple 5
© Universidad Internacional de La Rioja (UNIR)

2.3. Contrastes en el modelo de regresión 13


2.4. Regresión lineal múltiple 16
2.5. Regresión lineal múltiple con SPSS: pasos 30
2.6. Referencias bibliográficas 34

A fondo 36

Test 37
Esquema
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
3
Tema 2. Esquema
Ideas clave

2.1. Introducción y objetivos

El análisis de regresión lineal es una técnica estadística utilizada para estudiar la


relación lineal entre dos o más variables. Se puede utilizar en muchas situaciones y
pretende dar respuesta a si es posible explicar, predecir o estudiar la relación de una
variable llamada dependiente (𝑌) en función de una o varias variables
independientes (𝑋1 , 𝑋2 , … 𝑋𝑘 ) [1].

De este modo, podemos querer establecer la relación lineal que existe entre el
salario de un trabajador y su educación, su experiencia laboral y su género. También
podemos intentar predecir las ventas de un producto en función de los gastos de
publicidad y los precios o la tensión arterial según el consumo de sal, el valor del
índice de masa corporal y el ejercicio físico.

Tabla 1. Variables en un modelo de regresión. Fuente: adaptado de [1].


© Universidad Internacional de La Rioja (UNIR)

Cuando tenemos una variable independiente, se conoce como modelo de regresión


lineal simple y, cuando tenemos más de dos variables, regresión lineal múltiple.

La correlación y la regresión lineal tienen objetivos distintos. En el primer análisis, es


el de conocer el grado de asociación entre dos variables cuantitativas y, en el

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
4
Tema 2. Ideas clave
segundo, predecir una variable en función de otra. Un gráfico de dispersión ofrece
una idea aproximada del tipo de relación entre dos variables y su objetivo es buscar
la línea que mejor se ajusta a los puntos, para así obtener la mejor predicción de 𝑦 a
partir de 𝑥.

Por lo tanto, tenemos dos objetivos:

 Explorar y cuantificar la relación entre una variable llamada variable dependiente


o respuesta (𝑌) y una o más variables llamadas independientes o predictoras
(𝑋1 , 𝑋2 , … 𝑋𝑘 ).
 Desarrollar una ecuación lineal con fines predictivos.

2.2. Regresión lineal simple

Es la forma más sencilla, se trata de una técnica que permite explorar, cuantificar y
predecir la relación entre dos variables cuantitativas. Tendremos 𝑌 (dependiente) y
𝑋 (independiente). Buscamos encontrar una función de 𝑋 muy simple (lineal) que nos
permita aproximar 𝑌 mediante:
𝑦 =𝑎+𝑏∙𝑥+𝑒
Donde:
 𝑎: ordenada en el origen, es un valor constante que representa el valor que
tomaría la variable 𝑦 en el caso de que la variable 𝑥 tomase el valor cero. Si
estuviésemos analizando la estatura (variable dependiente, 𝑦) según la edad
(variable independiente, 𝑥), representaría la altura que tiene un bebé en su
nacimiento.
© Universidad Internacional de La Rioja (UNIR)

 𝑏: pendiente de la recta 𝑦, se interpreta como el incremento de 𝑦 por cada unidad


de incremento de 𝑋, es decir, cuántos centímetros crece un niño por año.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
5
Tema 2. Ideas clave
Estos valores representados gráficamente se corresponden con:

Figura 1. Representación del modelo de regresión lineal simple. Fuente: elaboración propia.

𝑌 e Ŷ lo habitual es que no coincidan por muy bueno que sea el modelo de regresión
(siendo 𝑌 los valores observados e Ŷ los estimados por el modelo). A la cantidad: 𝑒 =
𝑦 − 𝑦 ̂ se le denomina residuo o error residual (parte aleatoria que mide el error).
• La recta de regresión siempre pasa por el punto correspondiente a la media de
las 𝑥 y las medias de las 𝑦. Se le llama centroide o centro de gravedad (𝑥 ̅, 𝑦 ̅).

Representación de los residuos

𝑦𝑖 = 𝑎 + 𝑏 ∙ 𝑥𝑖 + 𝑒𝑖
𝑦𝑖 Valor observado
𝑎 + 𝑏 ∙ 𝑥𝑖 𝑉𝑎𝑙𝑜𝑟 𝑝𝑟𝑜𝑛𝑜𝑠𝑡𝑖𝑐𝑎𝑑𝑜 𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 𝑦̂𝑖
𝑒𝑖 Residuo
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
6
Tema 2. Ideas clave
Figura 2. Representación de los residuos en un modelo de regresión lineal simple. Fuente: elaboración propia.

Representa la diferencia entre cada punto observado y el valor asignado por la recta
de regresión, expresa el error que existe en el modelo. ¿Hasta qué punto es
importante esté error? ¿Qué porcentaje de la variabilidad de la variable respuesta
puede ser explicada por el efecto de 𝑋 y cuál no es explicado?

Pacientes con melanoma uveal

El melanoma uveal es una enfermedad que afecta al ojo mediante la formación de


células cancerosas. Un diagnóstico precoz es fundamental, por lo que las mediciones
de la altura y la base del tumor son imprescindibles a la hora de realizar cualquier
procedimiento o tratamiento.

En pacientes que presentan este tipo de tumor, se trata de establecer cuál es la


relación que existe entre la altura y la base máxima.

Un primer análisis podría ser el coeficiente de correlación de Pearson, cuyo valor es


de 0,712. Esto nos indica que existe una relación directa y dicha relación es fuerte. Al
© Universidad Internacional de La Rioja (UNIR)

representar su diagrama de dispersión junto con la recta de regresión observamos:

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
7
Tema 2. Ideas clave
Figura 3. Representación en un gráfico de dispersión de la altura y la base máxima del tumor en pacientes con
melanoma uveal. Fuente: elaboración propia.

Ahora debemos establecer el grado de dicha relación, es decir, el modelo de


regresión lineal simple, en este caso, es:

𝐵𝑎𝑠𝑒 𝑚á𝑥𝑖𝑚𝑎 = 𝑎 + 𝑏 ∙ 𝐴𝑙𝑡𝑢𝑟𝑎 𝑚á𝑥𝑖𝑚𝑎


© Universidad Internacional de La Rioja (UNIR)

Tabla 2. Resumen del modelo de regresión lineal de la base y la altura máxima del tumor. Tabla obtenida a
partir del programa IBM SPSS Statistics. Base de datos propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
8
Tema 2. Ideas clave
Esto nos permite conocer cuánto varía la base máxima del tumor en función de su
altura. A la vista de los resultados, vemos que este valor es de 0,773, luego, por cada
unidad de altura la

𝐵𝑎𝑠𝑒 𝑚á𝑥𝑖𝑚𝑎 = 7,276 + 0,773 ∙ 𝐴𝑙𝑡𝑢𝑟𝑎 𝑚á𝑥𝑖𝑚𝑎

Recta de regresión

¿Cómo se consigue el ajuste de la recta de regresión?, ¿Cuál es la mejor recta que


puede ajustarse a nuestros datos? Se obtiene a partir del criterio de «mínimos
cuadrados» donde para 𝑦 = 𝑎 + 𝑏 ∙ 𝑥, se tiene que [1]:

𝑆𝑦
𝑏=𝑟∙
𝑆𝑥
𝑎 = 𝑦̅ − 𝑏 ∙ 𝑥̅

La pendiente 𝑏 de la recta tiene el mismo signo que el coeficiente de correlación 𝑟 y,


como ya hemos visto, es una estimación del cambio en el valor medio de la variable
respuesta frente a un cambio en una unidad en la variable explicativa.

El modelo de regresión construido mediante esta técnica presenta la ventaja de que


el error residual medio es nulo y la varianza del error residual es mínima en dicha
estimación.

El ajuste es tanto mejor cuanto mayor sea 𝑅 2 , ya que representa el porcentaje


de la variabilidad de la respuesta explicada por la regresión
© Universidad Internacional de La Rioja (UNIR)

Bondad de ajuste del modelo

El coeficiente de determinación 𝑅 2 es el que nos va a permitir valorar la bondad de


un ajuste en un modelo de regresión. Es una cantidad que no tiene dimensión y que

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
9
Tema 2. Ideas clave
únicamente puede tomar valores entre 0 y 1. Cuando un ajuste es bueno, 𝑅 2 será
cercano a uno y será malo si 𝑅 2 presenta un resultado cercano a cero.

También se conoce como el porcentaje de variabilidad explicado por el modelo de


regresión. Dada la variabilidad total de la variable respuesta 𝑌 (VT), esta se puede
descomponer en una parte explicada por la regresión (VE) y en otra no explicada o
variabilidad «residual» (VNE). Este coeficiente se obtiene a partir del cociente entre
la variabilidad explicada y la total:

𝑉𝐸
𝑅2 =
𝑉𝑇

El valor de 𝑅 2 se va a ver afectado con la presencia de valores extremos (conocidos


como outliers). También en las ocasiones en las que el número de datos (𝑛) es
pequeño, su resultado será sensible a los valores 𝑛 y 𝑘 (tamaño muestral y número
de variables explicativas, respectivamente).

Según el valor que tome el coeficiente de determinación, podremos hacernos una


idea de si nuestro modelo es bueno o no, vamos a ver por qué en los siguientes
gráficos. Un modelo de regresión con 𝑅 2 ≥ 75 % se puede considerar aceptable.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
10
Tema 2. Ideas clave
En los gráficos de la Figura 4 podemos observar distintas situaciones en función de su
valor:

Figura 4. Representación gráfica de diferentes modelos de regresión lineal simple según el valor obtenido en el
coeficiente de determinación. Fuente: elaboración propia.

R: coeficiente de correlación múltiple

En este caso como es un modelo de regresión simple, coincide con el valor absoluto
del coeficiente de correlación de Pearson.

̅2
Coeficiente de determinación corregido R

Es una corrección de 𝑅 2 que toma en cuenta el número de casos y variables


independientes que se tienen en el estudio (grados de libertad), su resultado ha de
ser menor que el obtenido para 𝑅 2 .
© Universidad Internacional de La Rioja (UNIR)

Error típico de la estimación

Es la desviación típica de los residuos y va a representar la parte de variabilidad de la


variable dependiente que no es explicada por la recta de regresión.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
11
Tema 2. Ideas clave
En los resultados de un modelo de regresión (Tabla 3) podemos observar estos
resultados:

Tabla 3. Resumen del modelo de regresión lineal simple del ejemplo. Fuente: elaboración propia.

𝑅 2 : 𝐶𝑜𝑒𝑓𝑖𝑐𝑖𝑒𝑛𝑡𝑒 𝑑𝑒 𝐷𝑒𝑡𝑒𝑟𝑚𝑖𝑛𝑎𝑐𝑖ó𝑛 = 0,507, luego, el coeficiente de


determinación nos indica que el 50,7 % de la variación de la base máxima es explicada
por la variable altura máxima.

𝑅 2 : 𝐶𝑜𝑟𝑟𝑒𝑔𝑖𝑑𝑜 = 0,504

En este caso, apenas varían porque tenemos 187 datos y una variable explicativa. En
un estudio en el que se tengan pocos casos y muchas variables independientes, el
valor de 𝑅 2 puede ser artificialmente alto y, en este caso, la diferencia entre ambos
será mucho mayor.

Coeficientes de regresión estandarizados

También llamados coeficientes Beta, definen la ecuación de regresión cuando es


obtenida tras estandarizar las variables originales y convertir las puntuaciones
directas en típicas.
© Universidad Internacional de La Rioja (UNIR)

Se obtienen a través de la siguiente fórmula:

𝑆𝑥
𝛽=𝐵∙
𝑆𝑦

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
12
Tema 2. Ideas clave
Va a coincidir con el coeficiente de correlación de Pearson en la regresión lineal
simple y en la regresión lineal múltiple nos ayudará a valorar la importancia relativa
de cada variable dependiente dentro de la ecuación.

Puntuaciones típicas de una variable

Sea 𝑋 una variable aleatoria que toma los valores 𝑥1 , 𝑥2 , … , 𝑥𝑛 , que llamaremos
puntuaciones directas y son observadas en los datos. Si 𝑥 ̅ es su media y 𝑆 su
desviación típica, se llaman puntuaciones típicas de la variable a los valores
resultantes de restarle la media y dividir por su desviación típica (a cada una de las
observaciones).

xi − x̅
S

Son muy utilizadas en las ciencias sociales y su media es cero y su desviación típica es
de 1. Se utilizan para comparar las puntuaciones obtenidas en distintas
distribuciones.

2.3. Contrastes en el modelo de regresión

En un modelo de regresión se tienen dos contrastes, el contraste general y el


contraste sobre la pendiente.

Contraste general (contraste F)


© Universidad Internacional de La Rioja (UNIR)

Se obtiene a través de un análisis de la varianza de la regresión. Para calcularlo, la


variación de la variable 𝑌 se descompone en dos:
 Variación de 𝑌 alrededor de los valores predichos por la regresión.
 Variación de los valores predichos alrededor de la media.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
13
Tema 2. Ideas clave
Consiste en analizar si existe o no regresión lineal entre las dos variables, si el
coeficiente de correlación múltiple puede considerarse cero o no. Entonces, el
contraste es:
𝐻𝟎 : 𝒃 = 𝟎 ≡ 𝑹 = 𝟎
𝐻𝟏 : 𝒃 ≠ 𝟎 ≡ 𝑹 ≠ 𝟎

𝑅 representa el coeficiente de correlación múltiple.

Figura 5. Representación gráfica de dos modelos de regresión lineal simple según exista o no relación lineal
entre sus variables. Fuente: elaboración propia.

Para el ejemplo:

𝐵𝑎𝑠𝑒 𝑚á𝑥𝑖𝑚𝑎 = 𝑎 + 𝑏 ∙ 𝐴𝑙𝑡𝑢𝑟𝑎 𝑚á𝑥𝑖𝑚𝑎

Se tiene un 𝑝 −valor del contraste < 0,001 por lo tanto, sí existe regresión, el
coeficiente de correlación múltiple es distinto de cero.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
14
Tema 2. Ideas clave
Tabla 4. Resultados de la tabla ANOVA del modelo de regresión lineal del ejemplo 1. Fuente: elaboración
propia.

Contraste sobre la pendiente (test de Wald)

Figura 6. Representación gráfica de la pendiente del modelo de regresión. Fuente: elaboración propia.

Contrastamos si la pendiente de la recta de regresión o, lo que es lo mismo, el


coeficiente del modelo es igual a cero en la población. Si es igual a cero nos estará
indicando ausencia de relación lineal, de este modo, podremos conocer cuáles son
las variables relevantes en la regresión.

Contraste sobre la constante


© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
15
Tema 2. Ideas clave
Figura 7. Representación gráfica de la constante del modelo de regresión. Fuente: elaboración propia.

Contrastar si la recta de regresión pasa por el origen de coordenadas (punto (0,0)) o


corta al eje 𝑌. Es decir, debemos determinar qué valor tomaría la variable 𝑌 en el
caso de que la variable 𝑋 tomase el valor cero.

Tabla 5. Resultados del modelo de regresión lineal simple del ejemplo 1. Fuente: elaboración propia.

Siguiendo con el ejemplo, tenemos que 𝑝 − 𝑣𝑎𝑙𝑜𝑟 < 0,001 en ambos casos,
luego, los coeficientes de regresión son distintos de cero.

2.4. Regresión lineal múltiple

En la naturaleza no se suelen dar relaciones únicamente entre dos variables sino que
existen muchos más factores, por ejemplo, los kilos perdidos por una persona a lo
largo de un mes no solo estarán condicionados a la dieta alimentaria en sí, también
se pueden ver afectados por el ejercicio realizado si tenemos en cuenta la duración,
la intensidad, la ingesta de algún suplemento de aceleración del metabolismos, la
edad, el sexo, etc.

Esto es lo que nos permite analizar un modelo de regresión lineal múltiple y cómo
© Universidad Internacional de La Rioja (UNIR)

afectan a nuestra variable dependiente todos los factores que tengan alguna
influencia sobre su resultado.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
16
Tema 2. Ideas clave
Un modelo de regresión lineal múltiple es la generalización del modelo de regresión
lineal simple cuya expresión es de la forma:

𝑦 = 𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 + 𝑒

Componentes de la ecuación

 Variable dependiente 𝒚: variable de interés en el estudio, aquella que queremos


relacionar.
 Variables explicativas (𝒙𝟏 , 𝒙𝟐 , ⋯ , 𝒙𝒌 ): variables que desde el punto de vista del
investigador están relacionadas con la principal del estudio.
 Constante del modelo (a, intercept): valor (numérico) que toma la variable
dependiente cuando el resto de las variables tomen valor 0 (valor desconocido).
 Parámetros (𝒃𝟏 , 𝒃𝟐 , … , 𝒃𝒌 ): indica el peso relativo de esa variable en la ecuación,
representa el incremento por término medio en la variable respuesta por cada
unidad adicional en la variable explicativa (valores desconocidos).
 Componente aleatoria (e): residuos del modelo, diferencias entre las respuestas
observadas y las predichas por el modelo (parte que las variables independientes
no son capaces de explicar)

Ejemplo 1 (ampliación)

Pacientes con melanoma uveal

Se recoge información de un grupo de pacientes con melanoma uveal en los cuales


se tiene: sexo, edad, base máxima, altura máxima, agudeza visual, PIO, fecha de
diagnóstico, n.º de cuadrantes afectados. Nuestra variable dependiente es la base
© Universidad Internacional de La Rioja (UNIR)

máxima y las explicativas serían el resto tal y como observamos en la Figura 8.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
17
Tema 2. Ideas clave
Analizamos visualmente si existe relación lineal entre la variable base máxima y el
resto:
© Universidad Internacional de La Rioja (UNIR)

Figura 8. Gráficos de dispersión de la base máxima ECO con el resto de las variables explicativas del análisis.
Fuente: elaboración propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
18
Tema 2. Ideas clave
Observando la matriz de correlaciones en la Tabla 6 observamos que salvo la edad,
todas son estadísticamente significativas, cuyo coeficiente de correlación es positivo
para la altura, el valor PIO y el n.º de cuadrantes afectados y en el resto presentan
una relación inversa.

Tabla 6. Matriz de correlaciones de las variables para la elaboración del modelo de regresión lineal múltiple.
Fuente: elaboración propia.

Si realizamos un modelo de regresión lineal múltiple considerando la base máxima


como variable respuesta e introduciendo el resto como explicativas, tendremos la
siguiente ecuación:

𝑏𝑎𝑠𝑒 = 𝑎 + 𝑏1 ∙ 𝑎𝑙𝑡𝑢𝑟𝑎 + 𝑏2 ∙ 𝑒𝑑𝑎𝑑 + 𝑏3 ∙ 𝑎𝑔𝑢𝑑𝑒𝑧𝑎 𝑣𝑖𝑠𝑢𝑎𝑙 + 𝑏4 ∙ 𝑝𝑖𝑜 + 𝑏5


∙ 𝑛. º 𝑑𝑒 𝑐𝑢𝑎𝑑𝑟𝑎𝑛𝑡𝑒𝑠 𝑎𝑓𝑒𝑐𝑡𝑎𝑑𝑜𝑠
© Universidad Internacional de La Rioja (UNIR)

Tabla 7. Resumen de las variables del modelo de regresión lineal múltiple. Fuente: elaboración propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
19
Tema 2. Ideas clave
Tabla 8. Resumen del modelo de regresión lineal múltiple. Fuente: elaboración propia.

Tabla 9. Tabla ANOVA del modelo de regresión lineal múltiple. Fuente: elaboración propia.

Tabla 10. Resultados del modelo de regresión lineal múltiple. Fuente: elaboración propia.

Realizando los mismos pasos que los que se han realizado en regresión lineal simple,
tendríamos:
© Universidad Internacional de La Rioja (UNIR)

Contraste general de regresión:

𝑦 = 𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 + 𝑒
𝐻0 : 𝑏1 = 𝑏2 = ⋯ = 𝑏𝑘 = 0 (≡ 𝑅 = 0)
𝐻1 : 𝑏𝑖 ≠ 0 (≡ 𝑅 ≠ 0) 𝑃𝑎𝑟𝑎 𝑎𝑙𝑔ú𝑛 𝑖 = 1,2, ⋯ , 𝑘

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
20
Tema 2. Ideas clave
Si la hipótesis 𝐻0 es cierta asumimos que no existe relación lineal, el efecto de todas
las variables sobre la respuesta es cero.

En nuestro ejemplo (resultados en la Tabla 9) se rechaza la hipótesis nula,


𝑝 − 𝑣𝑎𝑙𝑜𝑟 < 0001. Por lo tanto, no todos los parámetros pueden considerarse cero
en la población.

Contraste de los parámetros del modelo

Dada la variable 𝑖, el contraste a realizar en el parámetro que le corresponde es:

𝐻0 : 𝑏𝑖 = 0
𝐻1 : 𝑏𝑖 ≠ 0 𝑃𝑎𝑟𝑎 𝑎𝑙𝑔ú𝑛 𝑖 = 1,2, ⋯ , 𝑘

El contraste sobre los parámetros sirve para determinar si cada uno de estos puede
considerarse nulo o no. Si se cumple la hipótesis nula, entonces los coeficientes de
regresión valen cero en la población y tendremos tantos contrastes como parámetros
del modelo.

A la vista de los resultados (Tabla 10) el único que presenta diferencias


estadísticamente significativas (𝑝 < 0001) es el correspondiente a la altura máxima,
el resto podrían considerarse cero.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
21
Tema 2. Ideas clave
Tabla 11. Situaciones que nos podemos encontrar teniendo en cuenta el contraste general e individual en el
modelo de regresión. Fuente: adaptado de [2].

Cómo saber si una variable es adecuada

Para conocer si una variable es adecuada en nuestro estudio observamos el contraste


individual de los parámetros del modelo, el cambio en los coeficientes 𝑅 2 y 𝑅 2
corregido y los coeficientes de regresión estandarizados.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
22
Tema 2. Ideas clave
Hipótesis del modelo

Son las condiciones para garantizar la validez del modelo. Estas han de cumplirse y
son [3]:

 Linealidad: en la población de la cual procede la muestra existe una relación tal


que:
𝑦 = 𝑎 + 𝑏1 ∙ 𝑥1 + 𝑏2 ∙ 𝑥2 + ⋯ + 𝑏𝑘 ∙ 𝑥𝑘 + 𝑒
 Normalidad: los residuos se distribuyen normalmente con media 0 para cada valor
de la variable independiente (o combinación de valores de las variables
independientes).
 Homogeneidad de varianzas: la varianza de los residuos es constante, σ, para
cada valor de la variable independiente (o combinación de valores de las variables
independientes). Esta hipótesis, también conocida como homocedasticidad,
implica que la varianza de los residuos es constante. Se detecta fácilmente al
representar los residuos del modelo frente a los valores predichos.

Estas tres condiciones se consideran cumplidas si los residuales 𝑒 = 𝑦 − 𝑦̂


siguen una distribución normal.

 Independencia de las observaciones 𝑦𝑖 : cada observación de la variable 𝑦 debe ser


independiente de las demás, esto se controla en el diseño del estudio.
 No-colinealidad: no debe existir relación lineal exacta entre ninguna de las
variables independientes. Por lo tanto, las variables explicativas 𝑋1 , 𝑋2 , … , 𝑋𝑘 son
linealmente independientes.

Linealmente independientes: ninguna de ellas puede escribirse como


© Universidad Internacional de La Rioja (UNIR)

combinación lineal del resto.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
23
Tema 2. Ideas clave
Validación de las hipótesis

Se basa en el análisis (fundamentalmente gráfico) de los residuos. Estos, se definen


como la diferencia entre el resultado observado y el pronosticado por el modelo
(𝑦𝑖 − 𝑦̂𝑖 )

Información que proporcionan:

 Exactitud de los valores pronosticados por el modelo. Cuanto más pequeño mejor
será el ajuste.
 Detección de valores erróneos o alejados.
 El estudio detallado de aquellos que presentan valores grandes, positivos o
negativos, (grandes en valor absoluto) puede ayudarnos a perfeccionar la
ecuación de regresión realizando un estudio detallado de estos y reciben el
nombre de casos atípicos.

A partir de las tablas 12 y 13, es fácil reconocer los casos que poseen residuos
grandes.

Tabla 12. Tabla de diagnósticos por caso. Fuente: elaboración propia.


© Universidad Internacional de La Rioja (UNIR)

Tabla 13. Tabla de estadístico sobre los residuos. Fuente: elaboración propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
24
Tema 2. Ideas clave
Independencia: estadístico Durbin-Watson

 Su valor oscila entre 0 y 4.


 Toma el valor 2 cuando los residuos son independientes.
 Valores menores de 2 tendríamos autocorrelación positiva.
 Valores mayores de 2 indican autocorrelación negativa.
 Podemos asumir independencia entre residuos cuando tome valores entre 1,5 y
2,5.

Tabla 14. Tabla de resumen del modelo con el estadístico Durbin-Watson. Fuente: elaboración propia.

Siguiendo con el ejemplo 1, y a la vista de la Tabla 14, el estadístico vale 1,689, por
tanto, se encuentra entre 1,5 y 2,5. Luego, podemos asumir que los residuos son
independientes.

Homocedasticidad o igualdad de varianzas

Se basa fundamentalmente en la representación de los residuos frente a los valores


predichos por el modelo.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
25
Tema 2. Ideas clave
Figura 9. Representación de los residuos de la regresión con la variable dependiente. Fuente: elaboración
propia.

Distintas situaciones que podemos encontrarnos:


© Universidad Internacional de La Rioja (UNIR)

Figura 10. Representación de los residuos de la regresión con la variable dependiente. Distintas situaciones
que nos podemos encontrar. Fuente: elaboración propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
26
Tema 2. Ideas clave
Normalidad

Comprobación gráfica y mediante un test de normalidad:

Figura 11. Histograma con la curva de normalidad y gráfico P-P de normalidad de los residuos obtenidos en la
regresión. Fuente: elaboración propia.

Tabla 15. Pruebas de normalidad para los residuos del modelo. Fuente: elaboración propia.

Gráficamente, podríamos pensar que los residuos del modelo siguen una distribución
normal. Sin embargo, el 𝑝 −valor del test de Kolmogorov-Smirnov, cuyo valor es de
0,015 (Tabla 15), rechaza la hipótesis nula de normalidad.

Colinealidad
© Universidad Internacional de La Rioja (UNIR)

Se tienen dos tipos de colinealidad [4]:


 Colinealidad perfecta: una de las variables independientes se relaciona de forma
perfecta con una o más del resto de las variables independientes en la ecuación;
es una combinación lineal de ellas.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
27
Tema 2. Ideas clave
 Colinealidad parcial o simplemente colinealidad: se produce cuando entre las
variables independientes de una ecuación existen correlaciones altas.

Por lo general, se suele dar la segunda de las opciones:

Tabla 16. Estadísticos de colinealidad. Fuente: elaboración propia.

Tabla 17. Tabla de diagnósticos de colinealidad. Fuente: elaboración propia.

La tolerancia para la variable altura máxima, se obtendría como el 𝑅 2 del siguiente


modelo:

𝐴𝑙𝑡𝑢𝑟𝑎 𝑚á𝑥𝑖𝑚𝑎 = 𝛼 + 𝛽1 ∙ 𝐸𝑑𝑎𝑑 + 𝛽2 ∙ 𝑃𝐼𝑂 + 𝛽3 ∙ 𝐴𝑔𝑢𝑑𝑒𝑧𝑎 𝑣𝑖𝑠𝑢𝑎𝑙


+𝛽4 ∙ 𝐶𝑢𝑎𝑑𝑟𝑎𝑛𝑡𝑒𝑠 𝑎𝑓𝑒𝑐𝑡𝑎𝑑𝑜𝑠

Existencia de colinealidad:
 Valores de tolerancia muy pequeños (próximos a cero).
© Universidad Internacional de La Rioja (UNIR)

 FIV grandes.

Los valores de tolerancia [4] se utilizan para calcular las varianzas de los coeficientes
de regresión. A mayor FIV para una variable, mayor será también la varianza del
respectivo coeficiente.
Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas
Diagnósticas
28
Tema 2. Ideas clave
Uno de los problemas de la colinealidad (tolerancias pequeñas, FIV grandes) es la
inestabilidad de las estimaciones de los coeficientes de regresión.

Autovalor [4]

Informan sobre cuántas dimensiones o factores subyacen en el conjunto de variables


independientes utilizadas. La presencia de varios autovalores próximos a cero indica
que las variables están muy relacionadas entre sí, es decir, que existe colinealidad.

Índice de condición [4]

Se calcula como la raíz cuadrada del cociente entre el autovalor más grande y cada
uno del resto de los autovalores.

Valores:
 < 15 No colinealidad.
 15 − 30 Posible problema de colinealidad.
 > 30 Colinealidad.

Proporciones de la varianza [4]

Recogen la proporción de varianza de cada coeficiente de regresión parcial que está


explicada por cada dimensión o factor. En condiciones de no-colinealidad, cada
dimensión suele explicar gran cantidad de la varianza de un solo coeficiente. Excepto
el coeficiente de la constante, que siempre aparece asociado a uno de los otros
coeficientes. En este caso, aparece asociado a los meses desde el contrato.
© Universidad Internacional de La Rioja (UNIR)

La colinealidad es un problema cuando una dimensión o factor con un índice


de condición alto contribuye a explicar gran cantidad de la varianza de los
coeficientes de dos o más variables.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
29
Tema 2. Ideas clave
Si se detecta la presencia de colinealidad en un conjunto de datos, hay que aplicar
algún tipo de remedio:
 Aumentar el tamaño de la muestra: esto puede resultar útil si se tienen pocos
casos en relación con el número de variables.
 Excluir variables redundantes, es decir, excluir variables que correlacionan muy
alto con otras quedándonos con las que consideremos más importantes.

Consecuencias de la colinealidad

 Gran varianza de los estimadores 𝑏.


 Cambio importante en las estimaciones al eliminar o incluir variables en el modelo.
 Cambio de los contrastes al eliminar o incluir regresores en el modelo.
 Contradicciones entre el contraste 𝐹 (contraste general de regresión) y los
contrastes individuales.

La gran varianza de los estimadores puede aparecer como consecuencia de la


colinealidad o también por tener una muestra insuficiente de datos.

2.5. Regresión lineal múltiple con SPSS: pasos

Métodos de selección de variables

 Hacia adelante: en cada paso entra la variable más significativa, es decir, la que
mayor incremento del 𝑅 2 produce.
 Hacia atrás: se parte de un modelo con todas las variables y en cada caso sale la
© Universidad Internacional de La Rioja (UNIR)

más irrelevante (hasta que solo quedan variables significativas en el modelo).


 Pasos sucesivos: permite que, dado el caso, las variables que se convierten en no
significativas salgan del modelo.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
30
Tema 2. Ideas clave
En los tres casos es preciso especificar el valor del nivel de significación de entrada
y/o salida de las variables. Lo normal es dejar los que tiene establecidos el programa.
Todos estos métodos nos van a proporcionar métodos predictivos.

Regresión lineal múltiple con SPSS: resultados

Aplicando un modelo por pasos al ejemplo, se tienen los siguientes resultados:

Tabla 18. Información de las variables que son introducidas y eliminadas en el modelo de regresión lineal por
pasos. Fuente: elaboración propia.

Tabla 19. Resumen del modelo de regresión lineal por pasos. Fuente: elaboración propia.
© Universidad Internacional de La Rioja (UNIR)

Tabla 20. Resultados de la tabla ANOVA del modelo de regresión lineal por pasos. Fuente: elaboración propia.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
31
Tema 2. Ideas clave
Tabla 21. Tabla de los coeficientes que han sido introducidos en el modelo de regresión lineal por pasos.
Fuente: elaboración propia.

Tabla 22. Información de las variables excluidas del modelo de regresión lineal por pasos. Fuente: elaboración
propia.

Código

#Cálculo del modelo de regresión lineal simple:


datos<-Lectura de los datos
head(datos)
atacch(datos)
reg_lineal<- lm(base ~ altura, datos)
# lm() devuelve el modelo de regresión lineal
summary(reg_lineal) # Información del modelo
confint(reg_lineal) # Intervalos de confianza para los parámetros
#Representación gráfica del modelo
library(ggplot2)
ggplot(datos, mapping = aes(x = altura, y = base)) +
© Universidad Internacional de La Rioja (UNIR)

geom_point(color = "firebrick", size = 2) +


labs(title = 'Base ~ Altura máxima ECO', x = 'Altura máxima ECO') +
geom_smooth(method = "lm", se = FALSE, color = "black") +
theme_bw() +
theme([Link] = element_text(hjust = 0.5))
#Verificar condiciones para poder aceptar un modelo lineal:

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
32
Tema 2. Ideas clave
datos$prediccion<- reg_lineal$[Link] # Predicciones
datos$residuos<- reg_lineal$residuals # Residuos

#Representación conjunta:
ggplot(datos, aes(x = prediccion, y = residuos)) +
geom_point(aes(color = residuos)) +
scale_color_gradient2(low = "blue", mid = "grey", high = "red") +
geom_hline(yintercept = 0) +
geom_segment(aes(xend = prediccion, yend = 0), alpha = 0.2) +
labs(title = "Distribución de los residuos", x = "Predicción modelo",
y = "Residuo") +
theme_bw() +
theme([Link] = element_text(hjust = 0.5), [Link] = "none")

#Distribución normal de los residuos:


qqnorm(reg_lineal$residuals)
qqline(reg_lineal$residuals)
[Link](reg_lineal$residuals)
#Varianza constante de los residuos (Homocedasticidad):
ggplot(data = datos, aes(x = prediccion, y = residuos)) +
geom_point(aes(color = residuos)) +
scale_color_gradient2(low = "blue3", mid = "grey", high = "red") +
geom_segment(aes(xend = prediccion, yend = 0), alpha = 0.2) +
geom_smooth(se = FALSE, color = "firebrick") +
labs(title = "Distribución de los residuos", x = "predicción modelo",
y = "residuo") +
geom_hline(yintercept = 0) +
theme_bw() +
theme([Link] = element_text(hjust = 0.5), [Link] = "none")
# Test de Breush-Pagan
library(lmtest)
bptest(reg_lineal)
#Autocorrelación de residuos: Gráficamente
© Universidad Internacional de La Rioja (UNIR)

ggplot(data = datos, aes(x = seq_along(residuos), y = residuos)) +


geom_point(aes(color = residuos)) +
scale_color_gradient2(low = "blue3", mid = "grey", high = "red") +
geom_line(size = 0.3) +
labs(title = "Distribución de los residuos", x = "index", y = "residuo") +
geom_hline(yintercept = 0) +
theme_bw() +

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
33
Tema 2. Ideas clave
theme([Link] = element_text(hjust = 0.5), [Link] = "none")
#Autocorrelación de residuos: test de Durbin-Watson
dwtest(base~altura)

#Método por pasos en un modelo de regresión múltiple

reg_lineal2<- lm(base ~ altura + edad + n_cuadrantes + agudeza_visual + pio,


datos)
step(object = modelo, direction = "both", trace = 1)

# direction = "both" / direction = "forward" / direction = "back"

Material audiovisual

Vídeo: Variables cualitativas en un modelo de regresión lineal

Se realizará un modelo de regresión lineal donde algunas de las variables


independientes son cualitativas. Se enseñará al estudiante el tratamiento de estas
variables en SPSS.

2.6. Referencias bibliográficas

1. Martínez-González MA, Irala J, Faulin Fajardo FJ. Bioestadística Amigable. 1ra


edición. Madrid: Díaz de Santos; 2001.
© Universidad Internacional de La Rioja (UNIR)

2. Weisberg S. Applied Linear Regression. 3ra edición. New Jersey: John Wiley & Sons;
2005.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
34
Tema 2. Ideas clave
3. Bilbao A, Bonansea M. Análisis de algunos factores que inciden en la divulgación
de información de responsabilidad social en las cooperativas en Argentina. En: XVI
Congreso de Investigadores en Economía Social y Cooperativa. 2016 oct. 19-21.
Valencia (España). Disponible en: [Link]
content/uploads/2016/11/[Link]

4. Arancibia-Carvajal S, Andrade C. Estadística aplicada y econometría. Aplicaciones


de SPSS [apuntes]. Magíster en Gestión y Políticas Públicas. Primer semestre 2012.
Universidad de Chile. 2012 [inédito]. Disponible en: [Link]
[Link]
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
35
Tema 2. Ideas clave
A fondo
Impacto psicológico de la maloclusión en los adolescentes

Iranzo Cortés JE, Montiel-Company JM, Bellot-Arcis C, Almerich-Torres T, Acevedo-Atala


C, Ortolá-Siscar JC, et. al. Factors related to the psychological impact of malocclusion in
adolescents. Sci Rep [internet]. 2020 ag. 10 [citado 2022 my. 30] 10(13471). Disponible
en: [Link]

En el campo de las ciencias de la salud no son muy frecuentes las publicaciones en las
que se realicen modelos de regresión lineal. Por tanto, este artículo es un buen
ejemplo de los usos que este tipo de estudios pueden tener y en él se presentan
varios modelos para que los estudiantes puedan ver una aplicación real llevada a la
práctica.

Competencia en Práctica Basada en la Evidencia y factores asociados en las


enfermeras de Atención Primaria en España

Fernández-Salazar S, Ramos-Morcillo AJ, Leal-Costa C, García-González J, Hernández-


Méndez S, Ruzafa-Martínez M. Competencia en Práctica Basada en la Evidencia y
factores asociados en las enfermeras de Atención Primaria en España. Aten primaria
[internet]. 2021 abr. 20 [citado 2022 my. 30] 53(7). Disponible en:
[Link]

En este artículo pueden ver un ejemplo de un estudio reciente realizado en España


© Universidad Internacional de La Rioja (UNIR)

para analizar una visión diferente de aplicación en atención primaria.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
36
Tema 2. A fondo
Test
1. En una regresión lineal los residuos se calculan como:
A. La suma de total de los cuadrados más la suma de los cuadrados de la
regresión.
B. La suma de los cuadrados no explicada por la recta.
C. La diferencia entre lo predicho por la recta y lo observado para cada
individuo.
D. La diferencia entre la media de la muestra y el valor observado para cada
individuo.

2. Si encontramos el valor 1 para el coeficiente de determinación, siempre se cumple


que:
A. La regresión predice el 100 % de la variabilidad de 𝑦.
B. La fuerza de asociación entre las variables es máxima.
C. Todos los residuales valen 0 sea cual sea el valor observado.
D. Todas son ciertas.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
37
Tema 2. Test
3. Supongamos que la siguiente tabla es el análisis de la varianza de un determinado
modelo de regresión lineal simple:

A. Según el test 𝐹 no tendríamos problema para seguir con el modelo de


regresión.
B. El 𝑝 −valor obtenido en el contraste es de 0,091, por lo tanto, aceptamos la
hipótesis de que existe regresión lineal entre las variables.
C. La tabla ANOVA nos indica que entre las dos variables no existe relación o,
por lo menos, no de tipo lineal y no tiene sentido continuar con la regresión.
D. Esta tabla no nos permite tomar ninguna decisión del modelo de regresión
lineal.

4. Al usar la transaminasa glutámico oxalacética (GOT) para predecir los niveles de


bilirrubina encontramos el siguiente resultado en SPSS:

Podemos afirmar que:


© Universidad Internacional de La Rioja (UNIR)

A. Una concentración más alta de GOT se asocia a mayor concentración de


bilirrubina.
B. La asociación entre ambas variables es estadísticamente significativa.
C. La asociación entre ambas variables no es estadísticamente significativa.
D. No puede afirmarse nada de lo anterior.

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
38
Tema 2. Test
5. Siguiendo con el ejemplo anterior, ¿qué porcentaje de la variabilidad de la
bilirrubina es explicado linealmente por la transaminasa GOT?
A. El 0,336 %.
B. El 0,219 %.
C. El 58 %.
D. El 33,6 %.

6. Nos presentan dos estudios sobre el peso. Un primer estudio examina la variable
grado de estrés en función de horas de trabajo semanales y encuentra 𝑅 2 = 0,85.
Un segundo estudio examina la misma variable grado de estrés según las horas
semanales dedicadas al deporte y encuentra 𝑅 2 = 0,305. De estos, podemos
deducir que:
A. El grado de estrés no depende del tiempo dedicado al deporte.
B. La relación lineal del grado de estrés es más fuerte con el número de horas
de trabajo semanales.
C. Ambos estudios muestran una relación lineal de pendiente positiva.
D. El grado de estrés es más fuerte con el número de horas semanales
dedicadas al deporte.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
39
Tema 2. Test
7. Al relacionar el índice de masa corporal (IMC) con la media de horas que se
duermen de lunes a viernes obtenemos la siguiente salida en SPSS:

¿Cuál de las siguientes sería la interpretación más adecuada?


A. La relación obtenida es negativa.
B. La relación entre el número medio de horas de sueño es estadísticamente
significativa (𝑝 < 0,001).
C. Según el modelo, si de media aumentamos en una hora las horas dormidas,
el IMC descendería en 0,430 unidades.
D. Todas son correctas.

8. En el modelo anterior, ¿cuál sería el valor predicho de IMC para un chico que de
media duerme 8 horas?
A. 20,067.
B. 23,507.
C. 26,947.
D. No es posible calcularlo con estos datos.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
40
Tema 2. Test
9. Alguno de los siguientes criterios para la aplicación de la regresión lineal se
considera cumplido si los residuos siguen una distribución normal:
A. Diseño prospectivo de la recogida de datos.
B. Homogeneidad de las varianzas.
C. Independencia de las observaciones.
D. Son ciertas B. y C.

10. Las hipótesis que debe cumplir un modelo de regresión lineal son:
A. Linealidad.
B. Normalidad.
C. Homogeneidad de varianzas.
D. Todas son ciertas.
© Universidad Internacional de La Rioja (UNIR)

Herramientas para el Análisis Bioestadístico: Técnicas Multivariantes y Validez de las Pruebas


Diagnósticas
41
Tema 2. Test

También podría gustarte