Universidad Autónoma Metropolitana
Estadística y Diseño de Experimentos
Examen 2
Apellidos Ramírez Escutia ___________ Nombre(s)Israel __________________ Calif. _______
Nota. Leer las siguientes indicaciones.
a) Las respuestas deben ir en el espacio correspondiente a cada pregunta, para evitar su anulación.
b) Si se encuentran exámenes con respuestas idénticas, dichos exámenes serán anulados.
c) Al final del examen deben anexar el código de R con el cuál resolvieron el examen, en caso de no hacerlo
a la calificación obtenida se le bajará un punto.
d) Busque la manera de no cometer errores en la captura de los datos, en caso de cometer error se le bajará
un punto.
Se en la respuesta aparecen resultados directamente como les da R, sin ningún argumento, se anula la respuesta.
1.- Los paneles de las paredes laterales del interior de un aeroplano se forman en una prensa de 1500 toneladas.
El costo de fabricación de cada unidad cambia con el tamaño del lote de producción. La tabla que aparece a
continuación proporciona el costo promedio por unidad (en cientos de dólares) para este producto y el tamaño del
lote de producción (x)
y 1.81 1.70 1.65 1.55 1.48 1.52 1.63 1.65 1.76 1.80 1.82 1.83
x 20 25 30 35 40 45 50 55 60 65 70 75
1) Realizar un gráfico de dispersión (con todos sus elementos) y su análisis.
Costo de fabricación vs tamaño del lote de producción
Figura 1
En la Figura 1 no se observan puntos alejados de los demás, por lo que no hay puntos atípicos, además los puntos
no siguen una tendencia lineal.
2) Realizar diferentes ajustes polinomiales y hacer una tabla con resultados estadísticos con los porcentajes
de ajuste y la suma de cuadrados de los errores, que le ayuden a elegir el mejor ajuste.
Coeficiente de
Grado del polinomio SCE
determinación 𝑹𝟐
1 0.086 0.138
2 0.705 0.040
3 0.902 0.011
El mejor polinomio es:
𝐶𝑜𝑠𝑡𝑜 = 3.249 − 0.108 𝑇𝑎𝑚𝑎ñ𝑜𝐿𝑜𝑡𝑒 + 0.002130 𝑇𝑎𝑚𝑎ñ𝑜𝐿𝑜𝑡𝑒 2 − 0.00001254 𝑇𝑎𝑚𝑎ñ𝑜𝐿𝑜𝑡𝑒 3
Ya que es el polinomio que tiene la mejor bondad de ajuste con un coeficiente de determinación 𝑅 2 = 0.902.
Además la suma del cuadrado de los errores es la menor con 0.011
3) Dar el costo promedio por unidad esperado para un lote de producción de tamaño 28 y 47, además dar los
intervalos de confianza al 96% para el ajuste de los datos del inciso.
Para 𝑇𝑎𝑚𝑎ñ𝑜𝐿𝑜𝑡𝑒 = 28
̂ = 1.620
𝐶𝑜𝑠𝑡𝑜
Con un intervalo de 96% de confianza de [1.573, 1.666]
Para 𝑉𝑒𝑙𝑜𝑐𝑖𝑑𝑎𝑑𝑀𝑎𝑞𝑢𝑖𝑛𝑎𝑃𝑎𝑝𝑒𝑙 = 47
̂ = 1.576
𝐶𝑜𝑠𝑡𝑜
Con un intervalo de 96% de confianza de [1.535, 1.617]
4) ¿Cuál es la utilidad que se le da a las bandas de confianza ya sea para “prediction” o “confidence”?
Al realizar un ajuste o un pronóstico con el modelo de regresión obtenido y dado un porcentaje de confianza, las
bandas de confianza nos indican el límite tanto superior como inferior en donde se puede encontrar el dato que se
está prediciendo, es decir, es la incertidumbre que existe al predecir un dato con el modelo ajustado.
2.- Se piensa que la potencia eléctrica consumida al mes por una planta química está relacionada con la
temperatura ambiente promedio (x1) –en F-, el número de días del mes (x2), la pureza promedio del producto
(x3) (en %) y las toneladas de producto elaboradas (x4). Los datos correspondientes al año pasado son los
siguientes:
Y X1 X2 X3 X4
240 25 24 91 100
236 31 21 90 95
290 45 24 88 110
274 60 25 87 88
301 65 25 91 94
316 72 26 94 99
300 80 25 87 97
296 84 25 86 96
267 75 24 88 110
276 60 25 91 105
288 50 25 90 100
261 38 23 89 98
1) Hacer un análisis de correlación ¿Qué observa?
La potencia eléctrica consumida por la planta tiene una correlación alta y positiva con la temperatura del ambiente
promedio (x1) y con el número de días del mes (x2), por lo que estas dos variables aportan mucha información a
la potencia eléctrica. La correlación de la potencia eléctrica con la pureza promedio del producto (x3) y las
toneladas de producto elaboradas (x4) es muy baja por lo que estas dos variables no aportan información a la
potencia eléctrica.
2) Ajuste un modelo de regresión lineal múltiple total de los datos contenidos en la tabla anterior, y dar su
bondad de ajuste.
̂ = −102.713 + 0.605 𝑇𝑒𝑚𝑝𝑒𝑟𝑎𝑡𝑢𝑟𝑎 + 8.924 𝐷𝑖𝑎𝑠 + 1.437 𝑃𝑢𝑟𝑒𝑧𝑎 + 0.014 𝑇𝑜𝑛𝑒𝑙𝑎𝑑𝑎𝑠𝑃𝑟𝑜𝑑𝑢𝑐𝑡𝑜
𝑃𝑜𝑡𝑒𝑛𝑐𝑖𝑎
Con un coeficiente de determinación de 𝑅 2 = 0.60
3) Plantear y realizar pruebas de hipótesis para cada beta, usar el criterio del intervalo de confianza. Sea α=0.04.
Prueba |𝒕𝒄 | Signo. 𝒕𝟏−𝜶, 𝒏+𝒌−𝟏𝒈𝒍
Valor-p. Signo. 𝜶/𝟐 Decisión.
𝟐
para: = 𝟎. 𝟎𝟐
𝛽0 0.49 < 2.52 0.03 > 0.02 Se acepta
𝐻0
𝛽1 1.64 < 2.52 0.03 > 0.02 Se acepta
𝐻0
𝛽2 1.68 < 2.52 0.03 > 0.02 Se acepta
𝐻0
𝛽3 0.60 < 2.52 0.03 > 0.02 Se acepta
𝐻0
𝛽4 0.02 < 2.52 0.03 > 0.02 Se acepta
𝐻0
4) Concluir con respecto a las pruebas realizadas en c).
5) Realizar una selección de variables con la función stepAIC (direction="backward") e indicar el valor del
AIC y las variables que aportan información a Y.
El AIC más bajo fue AIC= 66.05 y se obtiene con las variables Temperatura y Dias, las cuales son las que
aportan información a la potencia eléctrica (Y).
6) Dar la ecuación del modelo ajustado en según el resultado del inciso anterior.
̂ = 0.529 + 0.497 𝑇𝑒𝑚𝑝𝑒𝑟𝑎𝑡𝑢𝑟𝑎 + 10.267 𝐷𝑖𝑎𝑠
𝑃𝑜𝑡𝑒𝑛𝑐𝑖𝑎
7) De los modelos dados en 2) y 6) determinar al mejor y escribirlo.
El mejor modelo es:
̂ = 0.529 + 0.497 𝑇𝑒𝑚𝑝𝑒𝑟𝑎𝑡𝑢𝑟𝑎 + 10.267 𝐷𝑖𝑎𝑠
𝑃𝑜𝑡𝑒𝑛𝑐𝑖𝑎
Ya que su coeficiente de determinación 𝑅 2 = 0.67 es mayor al del primero modelo ajustado el cual era
𝑅 2 = 0.60
8) Con el modelo dado en g), prediga el consumo de potencia para un mes en el que x1 = 75F, x2 = 24 días, x3
=92 y x4 =96. Nota, considerar que algunas variables podrían no estar en el modelo óptimo.
Para x1 = 75F, x2 = 24 días
̂ = 284.24
𝑃𝑜𝑡𝑒𝑛𝑐𝑖𝑎
Con un intervalo de 95% de confianza: [267.24, 301.16]
9) Concluir con respecto al ejercicio
El modelo ajustado fue
̂ = 0.529 + 0.497 𝑇𝑒𝑚𝑝𝑒𝑟𝑎𝑡𝑢𝑟𝑎 + 10.267 𝐷𝑖𝑎𝑠
𝑃𝑜𝑡𝑒𝑛𝑐𝑖𝑎
Con un coeficiente de determinación 𝑅 2 = 0.67, solo las variables Temperatura y Dias aportan
información a la potencia eléctrica.
Codigo en R
> library(openxlsx)
> Datos<-[Link]("[Link]", sheet=1, colNames=T)
> print(Datos)
> with(Datos, plot(TamañoLote, Costo))
> P1<- lm(Costo~TamañoLote, data=Datos)
> P2<- lm(Costo~TamañoLote+I(TamañoLote^2), data=Datos)
> P3<- lm(Costo~TamañoLote+I(TamañoLote^2)+I(TamañoLote^3), data=Datos)
> summary(P1)
summary(P2)
> summary(P3)
> res<-resid(P1)
> sumcuares<-sum(res^2)
> print(sumcuares)
> res<-resid(P2)
> sumcuares<-sum(res^2)
> print(sumcuares)
> res<-resid(P3)
> sumcuares<-sum(res^2)
> print(sumcuares)
> ND<- [Link](TamañoLote=c(28, 47))
> predict(P3,ND,interval="confidence",level=0.96)
> Datos1<-[Link]("[Link]", sheet=1, colNames=T)
> print(Datos1)
> ggpairs(Datos1, lower=list(continuous='smooth'),
+ diag=list(continuous='barDiag'), axisLabels='none', color='yellow')
> Modelo<- lm(Potencia~Temperatura+Dias+Pureza+ToneladasProducto, data=Datos1)
> summary(Modelo)
> qt(0.98, 7, [Link]=T)
> step(object = Modelo, direction = "both", trace = 1)
> Modelo<- lm(Potencia~Temperatura+Dias, data=Datos1)
> summary(modelo)
> ND<-[Link](Temperatura=c(75), Dias=c(24))
> predict(Modelo,ND,interval="confidence",level=0.95)