0% encontró este documento útil (0 votos)
52 vistas5 páginas

PEC2: Regresión Múltiple y Modelos

Este documento presenta una prueba de evaluación continua (PEC) sobre regresión múltiple. La PEC consta de dos ejercicios. El primer ejercicio utiliza datos sobre diabetes para explorar diferentes modelos de regresión, incluyendo lineal, cuadrático, PLS y Ridge/Lasso. El segundo ejercicio analiza una regresión segmentada con datos sobre intoxicación por hierro. Se pide calcular el test de Chow y los coeficientes de la regresión segmentada.

Cargado por

Lucas Grijander
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
52 vistas5 páginas

PEC2: Regresión Múltiple y Modelos

Este documento presenta una prueba de evaluación continua (PEC) sobre regresión múltiple. La PEC consta de dos ejercicios. El primer ejercicio utiliza datos sobre diabetes para explorar diferentes modelos de regresión, incluyendo lineal, cuadrático, PLS y Ridge/Lasso. El segundo ejercicio analiza una regresión segmentada con datos sobre intoxicación por hierro. Se pide calcular el test de Chow y los coeficientes de la regresión segmentada.

Cargado por

Lucas Grijander
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Regresión, modelos y métodos

Prueba de evaluación continua 2


Francesc Carmona

Fecha publicación del enunciado: 01-01-2022


Fecha límite de entrega de la solución: 16-01-2022

Presentación Esta PEC consta de ejercicios similares a los planteados en los ejercicios con los que po-
dréis contrastar vuestra asimilación de los conceptos y métodos presentados en las tres últimas unidades.

Objetivos El objetivo de esta PEC es trabajar los conceptos de regresión múltiple trabajados en la
segunda parte de la asignatura.

Descripción de la PEC Debéis responder cada problema por separado. Recordad que tan importante
como el resultado es el razonamiento y el proceso que os lleva a ello, es decir el consultor debe poder ver
no tan sólo donde habéis llegado sino también como y porqué habéis llegado hasta allí. Incluid el código
de R en la solución.

Criterios de valoración Cada PEC representa un 50 % de la nota de la asignatura. La presentación


de los ejercicios aportará una puntuación que se sumará a los puntos obtenidos por las PECs.
Se valorará positivamente la contención en las respuestas del software y negativamente los
volcados de datos innecesarios.

Código de honor Cuando presentáis ejercicios individuales os adherís al código de honor de la UOC,
con el que os comprometéis a no compartir vuestro trabajo con otros compañeros o a solicitar de su
parte que ellos lo hagan. Asimismo aceptáis que, de proceder así, es decir, en caso de copia probada, la
calificación total de la PEC será de cero, independientemente del papel (copiado o copiador) o la cantidad
(un ejercicio o todos) de copia detectada.

Formato Para hacer la entrega se tiene que enviar un mensaje al buzón de entregas del aula. En este
mensaje debéis adjuntar un fichero PDF (obtenido a partir de vuestra solución en Word, Open Office,
LATEX, LyX o RMarkdown). El nombre del fichero debe ser la composición de vuestro apellido y vuestro
nombre seguido de _Reg_PEC2.pdf (por ejemplo: si vuestro nombre es “Joan Manuel Serrat”, el fichero
debe llamarse serrat_joan_Reg_PEC2.pdf). También puede ser en formato HTML.
Es importante que el examen sea legible y, a ser posible, elegante. Como si fuera un informe a vuestro
jefe. Por ello valoraremos que separéis el código R (no necesario para la comprensión de la resolución)
de los resultados y la discusión. Podéis hacerlo por ejemplo dejando el código completo en un apéndice.
En medio de las explicaciones podéis poner vuestro código pero controlad la longitud de los resultados
(evitad por ejemplo páginas enteras que únicamente contienen números).
Ejercicio 1 (60 pt.)
En este ejercicio usaremos los datos del trabajo de Efron et al. (2004) sobre diabetes. Los datos consisten
en la observación de 442 pacientes con una medida cuantitativa de la progresión de la enfermedad después
de un año desde el inicio. Además se dispone de 10 variables tomadas al inicio del estudio: edad, sexo,
índice de masa corporal, presión sanguínea media y seis medidas del suero sanguíneo. Estos datos se
pueden hallar en el archivo [Link] de la página
[Link]
Como nombres de estas variables tomaremos los siguientes:
age, sex, bmi, map, tc, ldl, hdl, tch, ltg, glu
En esta misma página se hallan los datos de la Tabla 1 del tra-
bajo de Efron et al. (2004) ya normalizados de forma que las
columnas tienen media cero y norma L2 uno. En esa página
el archivo es [Link]. Finalmente, en el archivo
[Link] se halla la matriz con 64 columnas del modelo cua-
drático, donde tenemos las variables originales con sus interac-
ciones y los cuadrados (excepto para el sexo), todas normaliza-
das también con media cero y norma L2 uno.

pPn1 : La norma L2 de un vector (una columna) es kxk =


Nota
2
i=1 xi , de forma que para que una columna tenga norma
L2 uno habrá que dividir todos sus elementos por su valor kxk.
Bradley Efron.
Nota 2 : Aunque la variable sexo es un factor, vamos a mantener
su valor numérico original como en el trabajo de Efron.
(a) En primer lugar y a partir de los datos del archivo [Link], vamos a obtener los datos
centrados y normalizados de los archivos [Link] y [Link] con nuestros propios
cálculos. Para ello, vamos a considerar las tres matrices que conforman [Link] por separado.
Esas tres matrices las podemos llamar X (las variables originales), X2 (los cuadrados de las variables
originales) y [Link] (las interacciones o productos entre las variables originales).
La matriz X se calcula a partir de los datos originales, primero se centra cada columna y luego se
normaliza en dos pasos distintos.
La matriz X2 se calcula con el cuadrado de los datos originales, luego se centra cada columna y
finalmente se normaliza en dos pasos distintos. No tiene sentido calcular el cuadrado de la variable
sexo.
Finalmente, la matrix [Link] con las interacciones o productos se calcula con los datos de la matriz
X y para ello podemos aprovechar una parte del resultado de la función [Link]() para un
modelo cuadrático. El resultado se debe centrar y normalizar también en dos pasos distintos.
La reunión de las tres matrices debe coincidir con los datos del archivo [Link].
Si no coinciden, continuaremos el ejercicio con los datos del archivo [Link].
Nota: Los mismos datos ya centrados y normalizados se pueden hallar en el archivo diabetes del
paquete lars.
(b) Calcular el modelo lineal para predecir la variable respuesta centrada con las 10 variables de X (que
coinciden con las de [Link] y también con diabetes$x del paquete lars).
Realizar un ligero análisis de los residuos del modelo. ¿Hay puntos influyentes?
¿Cuantos VIF hay mayores que 10? ¿Hay colinealidad o multicolinealidad? ¿Qué debemos hacer?
Nota: Aunque las variables que intervienen en los modelos son todas centradas y se puede prescindir
del intercept, para calcular los VIF es necesario incluirlo.
Estudiar el modelo lineal completo y el modelo reducido que proporciona el método de stepwise.

Página 2 de 5
(c) Para empezar vamos a fijar la semilla 213 y a dividir los datos con la instrucción sample() en dos
bloques: conjunto de entrenamiento ([Link]) y conjunto de prueba ([Link]). El primero
debe ser del 80 % de la muestra.
Encontrar los mejores modelos usando el AIC, el R2 ajustado y el estadístico Cp de Mallows con los
datos [Link]. Comparar los modelos obtenidos aquí con el obtenido en el apartado anterior.
¿Coinciden?
Comparar el RMSE de los modelos con los datos [Link] y [Link].
(d) En este apartado y los siguientes, para mejorar el ajuste se piensa en un modelo cuadrático, es
decir, el modelo lineal con las 64 variables del archivo [Link] también separado en los mismos
grupos de entrenamiento y de prueba.
Comparar el modelo completo con la regresión por componentes principales para los datos de entre-
namiento [Link]. ¿Cuantas componentes se necesitan para conseguir un 80 % de variabilidad
explicada de las variables predictoras? ¿Cuantas componentes selecciona la validación cruzada?
Comparar el RMSE del conjunto de prueba para el modelo completo con algunas propuestas de
regresión con un número de componentes razonable.
(e) Estudiar una regresión PLS del mismo modo que en el apartado anterior.
(f) Estudiar el método Ridge Regression. Para hallar el λ óptimo se puede empezar con un límite
superior bajo y incrementarlo hasta que el valor óptimo no coincida con este límite. Acompañar el
análisis con un gráfico de los coeficientes.
Dar los valores de RMSE para el grupo de entrenamiento y el de prueba.
(g) Estudiar el método LASSO. Hallar el valor mínimo del parámetro para optimizar la validación
cruzada LOO.
Dar también los valores de RMSE para el grupo de entrenamiento y el de prueba. Valorar el
resultado.

Ejercicio 2 (20 pt.)


En el trabajo de Parveen et al. (2014) sobre la intoxicación por hierro se analizó la mejora con la inyección
de diversas dosis de timoquinona en ratas Wistar. El estudio confirmó las propiedades antioxidantes y de
mejora de la timoquinona con el mejor resultado en la dosis de 18 mg/kg.
Supongamos que disponemos de los siguientes datos:
Treatment Dose Value
FeSO4 200 104.17
TQ1 6 98.17
TQ2 9 92
TQ3 12 86.67
TQ4 15 77.33
TQ5 18 71.33
TQ6 21 74.83
TQ7 24 82.17
Se trata de calcular la regresión segmentada en dos trozos y reproducir un gráfico similar al del trabajo
de Parveen con estos datos (ver figura 1).
Nota: Observemos que la variable regresora en el gráfico de la figura 1 no es el valor numérico de la dosis.
(a) Aunque es evidente, calcular el test de Chow para comprobar la necesidad de una regresión seg-
mentada entre las dos partes.
(b) Calcular la regresión segmentada en dos trozos (con continuidad) y proporcionar los coeficientes de
los dos segmentos. Indicar también el coeficiente de determinación del modelo.

Página 3 de 5
Figura 1: Una de las imágenes de la regresión segmentada en el trabajo de Parveen et al. (2014).

(c) Dibujar el gráfico de la figura 1 con estos datos.


¿Tiene sentido dar dos R2 , uno para cada segmento, en la regresión segmentada como vemos en la
figura 1?
En la misma figura 1 aparece el coeficiente de correlación (al cuadrado) r2 . Sabemos que coincide
con el coeficiente de determinación, pero. . . ¿tiene sentido calcular el coeficiente de correlación con
estos datos?

Ejercicio 3 (20 pt.)

En un estudio de comparación de biomarcadores para pre-


decir la gravedad de la enfermedad y el pronóstico respira-
torio a largo plazo en pacientes con embolia pulmonar agu-
da se dispone de los datos de 2000 pacientes en el archivo
acute_pulmonary_embolism.txt. Este archivo consta de dos
columnas, una con los valores de un biomarcador destacado y
la otra con valores dicotómicos en función de la severidad de la
enfermedad: 1 para los casos graves y 0 para los leves o asinto-
máticos.

Embolia pulmonar.

(a) Dibujar un diagrama de puntos con las frecuencias relativas de pacientes graves en los intervalos
con puntos de corte en los valores mín = 0.5, 1, 1.5, 2, 2.5, 3, 3.5, 4, 4.5, máx = 5.2 y valores x en las
marcas de clase de dichos intervalos. ¿Qué nos sugiere este diagrama?
(b Estimar un modelo logístico para predecir la gravedad de la embolia pulmonar en función de los
valores del biomarcador.
¿Es significativamente distinto de cero el coeficiente de la variable biomarker? ¿Cual es el test que
contrasta esta hipótesis?
Dar un intervalo de confianza para este coeficiente y para la razón de oportunidades u OR cuando
incrementamos biomarker en una unidad.

Página 4 de 5
(c) ¿Cual es la predicción de las marcas de clase de los intervalos del apartado (a)?
Añadir estos puntos y la curva que pasa por ellos al gráfico del apartado (a).
(d) Calcular el coeficiente de ajuste R2 para este modelo y un test de bondad de ajuste.

Referencias
[1] Bradley Efron, Trevor Hastie, Iain Johnstone, Robert Tibshirani. “Least angle regression”. Ann. Sta-
tist. 32 (2) 407 - 499, April 2004.
[2] Parveen, Nuzhat & Umar, Ahmad & Gupta, Sonam & Singh, Sarika & Shadab, G.G.. (2014). Ame-
lioration of Iron Induced Clastogenicity and DNA Damage in Wistar Rats by Thymoquinone. Science
of Advanced Materials. 6. 933-945. 10.1166/sam.2014.1857.

Página 5 de 5

También podría gustarte