Tutorial 5.
1. Basado en “The General Social Survey” (GSS – 2024), hemos creado la siguiente
tabla. Se trata de una muestra aleatoria.
Permitir libros comunistas en la
biblioteca
No
quita
Quitar r Total
Demócrata 100 329 429
Independient
e 77 197 274
Republicano 137 228 365
Total 314 754 1068
a) Calcula la probabilidad de que las variables sean independientes. Interpreta el
resultado.
b) Calcula una medida para evaluar la fuerza de la relación entre la identidad
partidista con la opinión sobre permitir libros comunistas en la biblioteca. Interpreta
el resultado. [En los cálculos es suficiente usar un decimal]
c) Según la muestra, ¿cómo se relacionan la identidad partidista con la opinión sobre
permitir libros comunistas en la biblioteca? Haz los cálculos que sustenten la
respuesta.
[La respuesta tiene que incluir los cálculos.]
Solución – paso a paso.
Paso 1: Usamos la definición de independencia para obtener la tabla de e ij.
Permitir libros comunistas
e ij en la biblioteca
No
Quitar quitar
Demócrata 126,1 302,9
Independiente 80,6 193,4
Republicano 107,3 257,7
Comentario: Mira el archivo de Excel para comprobar los cálculos. Hemos redondeado a una
precisión de un decimal. En la primera celda hemos calculado, 314*429/1068=126,1.
2
( nij −e ij )
Paso 2a: Usamos la fórmula de Chi-cuadrado para obtener la tabla de .
e ij
Paso 2:
2 Permitir libros
( nij −e ij ) comunistas en la
e ij biblioteca
No
Quitar quitar
Demócrata 5,4 2,3
Independiente 0,2 0,1
Republicano 8,2 3,4
Comentario: Mira el archivo de Excel para comprobar los cálculos. Hemos redondeado a una
precisión de un decimal. En la primera celda hemos calculado, ((100-126,1)^2)/126,1=5,4.
La suma del contenido de la tabla es χ 2. Aquí χ 2 ≅ 19 , 5. En el archivo de Excel enseñamos
[∑ ∑ n2ij
]
I J
2
χ =n −1
i=1 j=1 ni. n. j
como calcular chi2 en un paso, en lugar de dos, usando la fórmula:
Ya que se trata de datos de una muestra, debemos contrastar la hipótesis de independencia.
Nos interesa encontrar la probabilidad de independencia.
Paso 2b: Calcula los grados de libertad y usa la tabla de la distribución Chi-cuadrado.
En este caso tenemos ( I −1 )∗( J −1 )=( 3−1 )∗ (2−1 )=2 grado de libertad.
Distribució Khi-quadrat
acumulada
P(X<a)
El valor que apareix a la taula és a
Probabilitat acumulada fins a
g.l 0,005 0,01 0,025 0,05 0,1 0,15 0,85 0,9 0,95 0,975 0,99 0,995
1 0,000 0,000 0,001 0,004 0,016 0,036 2,072 2,706 3,841 5,024 6,635 7,879
2 0,010 0,020 0,051 0,103 0,211 0,325 3,794 4,605 5,991 7,378 9,210 10,60
3 0,072 0,115 0,216 0,352 0,584 0,798 5,317 6,251 7,815 9,348 11,34 12,84
Los grados de libertado indica la fila que nos interesa. Buscamos el valor 19,5, mientras la tabla
solo llega a 10,60. Este valor critico indica una probabilidad de independencia de 1-
0,995=0,005. Es decir, la probabilidad de independencia es mucho menor que 0.005. Si nos
interesa una respuesta más exacta podemos usar la formula =[Link](19,5;2) en
Excel y obtenemos, 0,00005764. Con el criterio de nivel de significación de 0,05 rechazamos
claramente la hipótesis de independencia.
a) Interpretación: La probabilidad de independencia entre la identidad partidista y la opinión
sobre permitir libros comunistas en la biblioteca es mucho menor que 0,005.
Nota: El procedimiento de calcular Chi-cuadrado en Excel es diferente, en el sentido que se
puede calcular primero la probabilidad de independencia, y después Chi-cuadrado, usando los
grados de libertad.
Paso 3: Usamos la fórmula de C para calcular el coeficiente C de contingencia.
√ √
2
χ 19 , 5
C= ≅ ≅ 0.134
2
χ +n 19 ,5+1068
Paso 4: Usamos la fórmula de C max;
√
C max= 1−
1
√
min (¿ I , J )
1
= 1− ≅ 0,707 ¿
2
Paso 5: Compara C con C max;
C /Cmax ≅ 0,134 /0,707 ≅ 0,189
b) Interpretación: Hay una relación débil entre la identidad partidista y la opinión sobre
permitir libros comunistas en la biblioteca.
Paso 6: Calcula perfil fila.
Permitir libros
comunistas en la
biblioteca
No
quita
Quitar r
Demócrata 0,23 0,77
Independiente 0,28 0,72
Republicano 0,38 0,62
c) Interpretación: Entre todos los demócratas 23% quiere quitar los libros comunistas de la
biblioteca, mientras entre todos los republicanos 38% tiene esta opinión, es decir la
proporción es más alta. La relación débil que hemos encontrado indica que son los
republicanos que tienen más tendencia de querer quitar los libros comunistas de la biblioteca.
2. Basado en “The General Social Survey” (GSS – 2024), hemos creado la siguiente
tabla. Se trata de una muestra aleatoria.
Estar a favor o en contra de la pena de muerte por
asesinato
A favor En contra Total
Demócrata 343 451 794
Independient
e 313 201 514
Republicano 555 140 695
Total 1211 792 2003
a) Calcula la probabilidad de que las variables sean independientes. Interpreta el
resultado.
b) Calcula una medida para evaluar la fuerza de la relación entre la identidad
partidista con la opinión sobre pena de muerte por asesinato. Interpreta el
resultado. [En los cálculos es suficiente usar un decimal]
c) Según la muestra, ¿cómo se relacionan la identidad partidista con la opinión sobre
pena de muerte por asesinato? Haz los cálculos que sustenten la respuesta.
[La respuesta tiene que incluir los cálculos.]
3. Tenemos los datos “cars” y queremos analizar la importancia del peso del coche sobre el
consumo de gasolina. La variable dependiente es litros por 100km (l/100km) y el peso se mide
en kilos.
Desviación
Media
estándar
l/100km (y) 11,2 3,9
kilos(x) 1350,6 385,3
Covarianza(x,y) 1334,6
Tamaño de la muestra (n) 392
Suponemos que no hay otras variables relevantes que afecten el consumo de gasolina.
a) Calcula la recta de regresión. Interpreta el resultado.
b) Calcula el coeficiente de determinación ajustado. Interpreta el resultado.
[La respuesta tiene que incluir los cálculos.]
Solución – paso a paso.
Paso 1: Usamos la fórmula de b para calcular la pendiente de la recta de regresión.
σ xy 1334 ,6
b= 2
= 2
≅ 0,009
σ x 385 , 3
Paso 2: Usamos la fórmula de a para calcular la constante de la recta de regresión.
a= y−b x ≅ 11, 2−0,009∗1334 ,6 ≅ −0,942
a) Interpretación:
Si el peso del coche aumenta con un kilo, el consumo de gasolina aumentaría con
aproximadamente 0,009 litros por 100km. Aquí no interpretamos la constante, ya el
peso de 0 no es relevante para coches.
Paso 3: Usamos la fórmula de r para calcular el coeficiente de correlación lineal, ya que lo
usaremos para calcular el coeficiente de determinación.
σ xy 1334 , 6
r= = ≅ 0,888
σ x σ y 385 ,3∗3 , 9
Paso 3: Usamos la fórmula de R2 para calcular el coeficiente de determinación, ya que lo
2
usaremos para calcular el coeficiente de determinación ajustada Radj .
2 2 2
R =r ≅ 0,888 ≅ 0,789
2
Paso 4: Usamos la fórmula de Radj para calcular el coeficiente de determinación ajustada (ya
que estamos analizado una muestra).
R2adj =1− ( n−1
n−k ) ( 1−R ) ≅ 1−( 392−1 ) (1−0,789 ) ≅ 0,788
2
392−2
Recuerda que k =2, ya que el modelo contiene dos coeficientes (a y b) que hemos tenido que
estimar basado en la muestra.
a) Interpretación: La recta de regresión explica aproximadamente 78,8% de la variación
en consumo de gasolina.
3. Tenemos los datos “cars” y queremos analizar la importancia del peso del coche sobre el
consumo de gasolina. La variable dependiente es millas por galón (mpg) y el peso se mide en
libras.
Desviación
Media
estándar
mpg (y) 23,4 7,8
libras(x) 2977,6 849,4
Covarianza(x,y) -5517,4
Tamaño de la muestra (n) 392
Suponemos que no hay otras variables relevantes que afecten el consumo de gasolina.
a) Calcula la recta de regresión. Interpreta el resultado.
b) Calcula el coeficiente de determinación ajustado. Interpreta el resultado.
[La respuesta tiene que incluir los cálculos.]