1. Relacione cada diagrama de dispersión con el enunciado que lo describa mejor.
i. La relación entre xx y yy es casi lineal: gráfico b.
ii. La relación entre xx y yy no es lineal: dispersograma d.
iii. No hay mucho que relacione a xx con yy: dispersograma a.
iv. La relación entre xx y yy es casi lineal, menos un dato atípico: dispersograma c.
2. Considere los siguientes datos bivariados:
xx: 1.4, 2.4, 4.0, 4.9, 5.7, 6.3, 7.8, 9.0, 9.3, 11.0
yy: 2.3, 3.7, 5.7, 9.9, 6.9, 15.8, 15.4, 36.9, 34.6, 53.2
Hacer un dispersograma de yy frente a xx y calcular el coeficiente de correlación
correspondiente. ¿La relación entre xx y yy es lineal?
A continuación se presenta un dispersogra de yy frente xx. Además, el coeficiente de
correlación entre xx y yy es
r=COV(x,y)sx∗sy=0.9147.r=COV(x,y)sx∗sy=0.9147.
# datos
x <- c(1.4, 2.4, 4.0, 4.9, 5.7, 6.3, 7.8, 9.0, 9.3, 11.0)
y <- c(2.3, 3.7, 5.7, 9.9, 6.9, 15.8, 15.4, 36.9, 34.6, 53.2)
# dispersograma
plot(x, y, col = "red", pch = 16)
grid()
# correlacion
cor(x,y)
## [1] 0.9147475
# otra manera
cov(x,y)/(sd(x)*sd(y))
## [1] 0.9147475
Hacer un dispersograma de ln(y)ln(y) frente a xx y calcular el coeficiente de
correlación correspondiente. ¿La relación entre xx y ln(y)ln(y) es lineal?
A continuación se presenta un dispersograma de w=ln(y)w=ln(y) frente xx. Además, el
coeficiente de correlación entre xx y w=ln(y)w=ln(y) es
r=COV(x,w)sx∗sw=0.9791.r=COV(x,w)sx∗sw=0.9791.
A partir del dispersograma y el coeficiente de correlación, ese observa que la relación
entre xx y ww es lineal y fuerte.
# datos
x <- c(1.4, 2.4, 4.0, 4.9, 5.7, 6.3, 7.8, 9.0, 9.3, 11.0)
y <- c(2.3, 3.7, 5.7, 9.9, 6.9, 15.8, 15.4, 36.9, 34.6, 53.2)
w <- log(y)
# dispersograma
plot(x, w, col = "blue", pch = 15)
grid()
# correlacion
cor(x,w)
## [1] 0.9791125
# otra manera
cov(x,w)/(sd(x)*sd(w))
## [1] 0.9791125
¿Para estos datos, ¿es más fácil trabajar con xx y yy o con xx y ln(y)ln(y)? ¿Por
qué?
En este caso, parece ser más fácil trabajar con xx y ln(y)ln(y) porque la relación lineal
entre estas variables es más notoria y fuerte que entre xx y yy.
3. Considere la base de datos dada en el archivo taller06_datos.txt, la cual
contiene los datos de n=1,000n=1,000 individuos en relación con las siguientes
variables:
Peso (en kilogramos).
Estatura (en metros).
Primero, se importa la base de datos en R para tenerla disponible en el ambiente global.
# establecer directorio de trabajo
setwd("C:/Users/Juan
Camilo/Dropbox/UN/probabilidad_y_estadistica_2021_2/")
# importar base de datos
datos <- [Link](file = "taller_06_datos.txt", header = TRUE, sep =
";")
a. Hacer un dispersograma del peso (yy) en función de la estatura (xx).
A continuación se presenta el dispersograma correspondiente:
plot(x = datos$estatura, y = datos$peso, pch = 16, col = "darkgreen",
xlab = "Estatura (metros)", ylab = "Peso (kilogramos)")
b. Calcular e interpretar la covarianza entre la estatura y el peso.
La covarianza entre la estatura y el peso es
COV(estatura,peso)=1n−1∑i=1n(xi−x¯)
(yi−y¯)=0.3702COV(estatura,peso)=1n−1∑i=1n(xi−x¯)(yi−y¯)=0.3702
donde n=1000n=1000. Este valor indica que que la variabilidad conjunta entre las
variables es positiva, lo que se traduce en la factibilidad de una relación directa entre la
estatua y el peso.
cov(datos$estatura,datos$peso)
## [1] 0.3702795
c. Calcular e interpretar el coeficiente de correlación entre el peso y la estatura.
El coeficiente de correlación entre la estatura y el peso es
r=COV(x,y)sx∗sy=0.8129.r=COV(x,y)sx∗sy=0.8129.
Este valor indica que la relación entre las dos variables, además de directa, es fuerte.
cor(datos$estatura,datos$peso)
## [1] 0.8129277
d. Por un error con la calibración del instrumento para medir el peso, los datos del
peso deben disminuirse 5% junto con un aumento constate de 2,500 gramos para
todos los individuos. Calcular nuevamente la covarianza y el coeficiente de
correlación.
Se debe realizar una transformación de la variable peso (yy). Para ello se define la
variable ww como la variable peso disminuida 5% con un aumento constante de 2500
gramos, esto es,
w=0.95y+2.5.w=0.95y+2.5.
Así, aplicando las propiedades de la covarianza, se tiene que
COV(x,w)=COV(x,0.95y+2.5)=0.95COV(x,y)=(0.95)
(0.3702)=[Link](x,w)=COV(x,0.95y+2.5)=0.95COV(x,y)=(0.95)(0.3702)=0.3517.
De otra parte, aplicando las propiedades de la varianza, se obtiene que el coeficiente de
correlación correspondiente es
COV(x,w)sx∗sw=0.95COV(x,y)sx∗0.952∗s2y−−−−−−−
−√=0.95COV(x,y)sx∗0.95∗sy=COV(x,y)sx∗sy=0.8129COV(x,w)sx∗sw=0.95COV(
x,y)sx∗0.952∗sy2=0.95COV(x,y)sx∗0.95∗sy=COV(x,y)sx∗sy=0.8129
y por lo tanto el coeficiente de correlación no cambia bajo esta transformación de la
varible peso.
# covarianza
0.95*cov(datos$estatura,datos$peso)
## [1] 0.3517655
# calculo directo covarianza
cov(datos$estatura,0.95*datos$peso+2.5)
## [1] 0.3517655
# calculo directo correlacion
cor(datos$estatura,0.95*datos$peso+2.5)
## [1] 0.8129277
# valor original correlacion
cor(datos$estatura,datos$peso)
## [1] 0.8129277
4. Considerar la siguiente información:
∑i=110xi=110,∑i=110yi=60,∑i=110x2i=3156,∑i=110y2i=1138y∑i=110
xiyi=1868.∑i=110xi=110,∑i=110yi=60,∑i=110xi2=3156,∑i=110yi2=1138y∑i=110xiyi
=1868.
a. Calcular e interpretar el coeficiente de correlación de Pearson entre XX y YY.
El coeficiente de correlación se define como
r=COV(x,y)sx∗sy.r=COV(x,y)sx∗sy.
La covarianza se calcula como
COV(x,y)=1n−1∑i=1n(xi−x¯)
(yi−y¯)=1n−1(∑i=1nxiyi−nx¯y¯)COV(x,y)=1n−1∑i=1n(xi−x¯)
(yi−y¯)=1n−1(∑i=1nxiyi−nx¯y¯)
Como n=10n=10, x¯=1n∑i=1nxi=11010=11x¯=1n∑i=1nxi=11010=11,
y y¯=1n∑i=1nyi=6010=6y¯=1n∑i=1nyi=6010=6, por lo tanto
COV(x,y)=19(1868−10∗11∗6)=134.2222COV(x,y)=19(1868−10∗11∗6)=134.2222
Dado que el coeficiente de correlación se define como
r=COV(x,y)sx∗sy=COV(x,y)V(x)−−−−√∗V(y)−−−
−√r=COV(x,y)sx∗sy=COV(x,y)V(x)∗V(y)
y que la varianza se puede espresar como
V(x)=1n−1∑i=1n(xi−x¯)2=1n−1(∑i=1nx2i−nx¯2)=19(3156−10∗112)=216.
2222V(x)=1n−1∑i=1n(xi−x¯)2=1n−1(∑i=1nxi2−nx¯2)=19(3156−10∗112)=216.2222
Analogamente, la varianza de yy es V(y)=86.44444V(y)=86.44444, y así, el
coeficiente de correlación es
r=134.2222216.2222−−−−−−−√∗86.44444−−−−−−
−√=0.9817r=134.2222216.2222∗86.44444=0.9817
# tamaño de la muestra
n <- 10
# promedios
xb <- 110/n
xb
## [1] 11
yb <- 60/n
yb
## [1] 6
# covarianza
covxy <- (1868 - n*xb*yb)/(n-1)
covxy
## [1] 134.2222
# varianzas
varx <- (3156 - n*xb^2)/9
varx
## [1] 216.2222
vary <- (1138 - n*yb^2)/9
vary
## [1] 86.44444
# correlacion
covxy/(sqrt(varx)*sqrt(vary))
## [1] 0.9817609
b. Calcular e interpretar nuevamente el coeficiente de correlación de Pearson si para
todos los individuos de la muestra la variable XX aumenta en 5% y la
variable YY aumenta en 3%.
Aplicando las proiedades de la covarianza y de la varianza se tiene que
COR(1.05x,1.03y)=COV(1.05x,1.03y)V(1.05x)−−−−−−−√∗V(1.03y)−−−−
−−−√=(1.05)(1.03)COV(x,y)1.052V(x)−−−−−−−−√∗1.032V(y)−−−−−
−−−√=(1.05)
(1.03)COV(x,y)1.05∗sx∗1.03∗sy=COV(x,y)sx∗syCOR(1.05x,1.03y)=COV(1.05x,1.03
y)V(1.05x)∗V(1.03y)=(1.05)(1.03)COV(x,y)1.052V(x)∗1.032V(y)=(1.05)
(1.03)COV(x,y)1.05∗sx∗1.03∗sy=COV(x,y)sx∗sy
Es decir que con esta transformación de las variables, no hay un cambio en el coefiente
de correlación.
5. Considere la información de la siguiente tabla de contingencia en relación con la
opinión acerca de una medida sanitaria en un sector de la ciudad.
6. A favor En contra
Hombre 241 53
Mujer 204 12
a. Calcular y graficar las frecuencias relativas.
Tabla de frecuencias relativas:
# datos
tabla <- rbind(c(241,53,12), c(204,12,11))
rownames(tabla) <- c("Hombre","Mujer")
colnames(tabla) <- c("A favor","En contra","NS/NR")
# tabla de frecuencias relativas
round(addmargins(A = 100*[Link](x = tabla), margin = c(1,2)),
digits = 2)
## A favor En contra NS/NR Sum
## Hombre 45.22 9.94 2.25 57.41
## Mujer 38.27 2.25 2.06 42.59
## Sum 83.49 12.20 4.32 100.00
Gráfico de frecuencias relativas:
# diagrama de barras
barplot(height = tabla, xlab = "Opinión", ylab = "Porcentaje (%)",
[Link] = TRUE, beside = TRUE, [Link] = list(x =
"topright"))
b. Calcular y graficar los perfiles fila.
Tabla de perfiles fila:
# perfiles fila
round(addmargins(A = 100*[Link](x = tabla, margin = 1), margin =
2), digits = 2)
## A favor En contra NS/NR Sum
## Hombre 78.76 17.32 3.92 100
## Mujer 89.87 5.29 4.85 100
Gráfico de los perfiles fila:
# perfiles fila
pf <- 100*[Link](x = tabla, margin = 1)
# grafico
barplot(height = t(pf), ylim = c(0,120), [Link] = TRUE,
[Link] = list(x = "top", bty = "n", ncol = 3),
main = "Perfil fila", xlab = "Sexo", ylab = "Porcentaje (%)")
c. Calcular y graficar los perfiles columna.
Tabla de perfile columna:
round(addmargins(A = 100*[Link](x = tabla, margin = 2), margin =
1), digits = 2)
## A favor En contra NS/NR
## Hombre 54.16 81.54 52.17
## Mujer 45.84 18.46 47.83
## Sum 100.00 100.00 100.00
Gráfico de los perfiles columna:
# perfiles columna
pc <-100*[Link](x = tabla, margin = 2)
# diagrama de barras perfiles columna
barplot(height = pc, beside = FALSE, las = 1, ylim = c(0, 120),
[Link] = TRUE, [Link] = list(x = "top", bty = "n",
ncol = 2),
main = "Perfil columna", xlab = "Nivel educativo", ylab =
"Porcentaje (%)")
d. Completar:
El porcentaje de individuos que son hombres y están en contra es: 9.94%.
De las mujeres, el porcentaje que está a favor es: 89.87%.
De los los individuos en contra, el porcentaje de hombres es: 81.54%.
e. Comentar brevemente los resultados obtenidos.
Al comparar el sexo en función de la opinión (perfiles fila), se observa que la mayor
diferencia está en el porcentaje de hombres en contra, el cual parece ser superior que el
de mujeres. La misma diferencia se nota al comparar la opinión en función del sexo
(perfiles columna).