Tutorial de Statistix
Segunda Parte
Autor: Ángel J. Tabullo
ÍNDICE
Prueba T para 2 muestras (Two-Sample T Test) 19
Prueba T para datos apareados (PAIRED T TEST) 21
Prueba de proporciones 22
Prueba de hipótesis para variables nominales (Chi-Square 23
Test)
Cómo estudiar la relación lineal entre dos variables: 27
Correlations (Pearson)
Cómo hallar r2, gráfico y ecuación de la recta de regresión y 28
de una variable sobre otra
Prueba T para 2 muestras (Two-Sample T Test)
Se usa para estudiar la diferencia entre dos medias de variables que se distribuyen normal e
independientemente. Considérese el siguiente ejemplo similar al Ejercicio 11 de la PRÁCTICA 6.
Se asignaron al azar nueve niños a cada uno de dos grupos. Un grupo fue entrenado
en la resolución creativa de problemas y el otro no. A todos los niños se les dio una
serie de problemas para resolver. El número de problemas para los que cada sujeto
presentó una solución posible fue:
Grupo entrenado: 12, 16, 19, 8, 10, 13, 9, 15, 14,
Grupo no entrenado: 15, 5, 11, 8, 9, 5, 6, 11, 10
Decida si la media del grupo entrenado es significativamente mayor que la del otro
grupo al nivel del 5%.
Opción 1: Ingresar los datos de cada uno de los grupos como en forma de tabla
1. Crear una variable para cada grupo (“GE” y “GNE”) e ingresar los datos. Ir a ONE, TWO, MULTI-
SAMPLE TESTS – TWO – SAMPLE T TEST
2. Seleccionar la opción “Table” donde dice “Model Specification”
3. Seleccionar las variables de la lista (GE y GNE) usando el botón de la flecha. Es importante el orden en
que se seleccionan para formular la hipótesis nula.
4. En “Alternative Hypothesis”, seleccionar: “Greater Than” (MAYOR QUE), “Less Than” (MENOR
QUE) o “Not Equal” (DISTINTO) según corresponda a la hipótesis alternativa que se pretende
contrastar. El programa arma la hipótesis alternativa en función del orden en que seleccionaron las
variables: Si seleccionaron primero GE y después GNE; y eligieran “Greater Than” la hipótesis
alternativa queda (para el programa):
GE “Greater Than” GNE => o sea => Media GE > Media GNE
Si seleccionaron primero GNE y después GE (les queda GNE arriba de GE en el cuadro “Table
Variables”), tendrían que elegir la opción “Less Than”:
GNE “Less Than” GE => o sea => Media GNE < Media GE (la hipótesis anterior, escrita de forma
distinta)
6. OK.
19
Statistix 8.0 07/04/04, 06:40:08 p.m.
Two-Sample T Tests for GE vs GNE
Variable Mean N SD SE
GE 12.889 9 3.5512 1.1837
GNE 8.8889 9 3.2956 1.0985
Difference 4.0000
Null Hypothesis: difference = 0
Alternative Hyp: difference > 0
95% CI for Difference
Assumption T DF P Lower Upper
Equal Variances 2.48 16 0.0124 0.5765 7.4235
Unequal Variances 2.48 15.9 0.0124 0.5749 7.4251
Test for Equality F DF P
of Variances 1.16 8,8 0.4189
Cases Included 18 Missing Cases 0
7. En primer lugar, observamos el resultado del Test de Igualdad de Varianzas (Test for Equality of
Variances) para ver si podemos trabajar asumiendo que ambas variables se distribuyen normalmente con
igual varianza. Si el valor P para el Test es menor o igual a 0.05 se rechaza la igualdad de varianzas, si es
mayor que 0.05 se considera que las varianzas son iguales.
8. Para ubicar el resultado del test de comparación de medias trabajamos con los datos de la fila Equal
Variances si el Test for equality of Variances indica igualdad de varianzas; de lo contrario consideramos
los de Unequal Variances. El programa indica el valor del estadístico (T), los grados de libertad (DF:
noten que DF = n1 + n2 – 2) y lo más importante el valor P. En este caso, siendo que P es menor al nivel
de significación (0.0124 < 0.05) la hipótesis nula se rechaza y puede afirmarse que la media del grupo
entrenado es significativamente mayor que la del otro grupo (el entrenamiento ha mejorado
significativamente la capacidad de resolución de problemas)
Opción 2: Ingresar los datos de ambos grupos en una misma variable y usar otra
variable como condición
1. Crear una variable para los puntajes (para este ejemplo: X: “cantidad de problemas resueltos”) y otra
cualitativa para definir las condiciones ( E: “entrenamiento”, con el valor 1 para grupo entrenado y 2 para
no entrenado).
2. Ir a ONE, TWO, MULTI-SAMPLE TESTS – TWO – SAMPLE T TEST.
3. Seleccionar la opción “Categorical” en el cuadro “Model Specification”
4. Seleccionar la variable con los valores (“X” en este caso) como “Dependent Variables” y la variable con
la condición (“E” en este caso) como “Categorical Variable”.
5. Para formular la hipótesis nula, el programa coloca por defecto la condición 1, antes que la 2. Por lo
tanto, si seleccionan “Greater Than”, el programa contrastará la hipótesis: Media grupo entrenado >
Media grupo no entrenado.
Statistix 8.0 07/04/04, 07:32:53 p.m.
Two-Sample T Tests for X by E
E Mean N SD SE
Entrenado 12.889 9 3.5512 1.1837
No Entren. 8.8889 9 3.2956 1.0985
Difference 4.0000
20
Null Hypothesis: difference = 0
Alternative Hyp: difference > 0
95% CI for Difference
Assumption T DF P Lower Upper
Equal Variances 2.48 16 0.0124 0.5765 7.4235
Unequal Variances 2.48 15.9 0.0124 0.5749 7.4251
Test for Equality F DF P
of Variances 1.16 8,8 0.4189
Cases Included 18 Missing Cases 0
(Noten que en ambas opciones, el valor P es el mismo)
Prueba T para datos apareados (PAIRED T TEST)
Se usa para estudiar la diferencia de medias de variables que se observan sobre las mismas unidades en
particular para poner a prueba la existencia de diferencia significativa entre las medias obtenidas en
sujetos de un mismo grupo, sometidos a dos condiciones de una variable. Un ejemplo característico es la
evaluación de los indicadores sintomáticos numéricos de una enfermedad en un grupo de pacientes antes
y después de un tratamiento terapéutico. Considérese el siguiente caso:
Un equipo de psicoterapeutas estudia el tratamiento de la agarofobia mediante la
utilización de entornos virtuales. Una muestra de pacientes agarofóbicos fue evaluado
antes y después del tratamiento según la cantidad de situaciones en las que no
manifestó pánico:
Paciente 1 2 3 4 5 6 7 8 9 10 11 12
Puntaje antes del tratamiento 7 2 3 5 6 1 1 7 6 5 3 8
Puntaje después del tratamiento 8 2 4 5 7 1 1 7 5 6 4 9
¿Puede considerarse que el tratamiento implementado fue efectivo con un nivel de
significación 0,05?
1. Crear una variable para cada condición (antes y después de las clases del tratamiento)
2. Ir a ONE, TWO, MULTI-SAMPLE TESTS – PAIRED T TEST
3. Seleccionar con el botón de la flecha las variables, en el orden que se quiera formular la hipótesis
alternativa.
4. En “Alternative Hypothesis”, seleccionar: “Greater Than” (MAYOR QUE), “Less Than” (MENOR
QUE) o “Not Equal” (DISTINTO) según corresponda a la hipótesis alternativa que se pretende
contrastar. El programa arma la hipótesis alternativa en función del orden en que seleccionaron las
variables (ver .5 del caso anterior)
5. OK.
21
STATISTIX FOR WINDOWS EJINGRID, 28/10/03, 10:23:31 a.m.
PAIRED T TEST FOR DESPUES - ANTES
NULL HYPOTHESIS: DIFFERENCE = 0
ALTERNATIVE HYP: DIFFERENCE > 0
MEAN 0.4167
STD ERROR 0.1930
LO 95% CI -8.11E-03
UP 95% CI 0.8414
T 2.16
DF 11
P 0.0269
CASES INCLUDED 12 MISSING CASES 0
5. El cuadro anterior nos da el valor del estadístico T, los grados de libertad (nótese que en este caso, DF
“degrees of freedom” es igual n– 1) y el valor P. En este caso, dado que 0,0269 es menor que el nivel de
significación (0,05), la hipótesis nula se rechaza y puede afirmarse que el tratamiento implementado fue
efectivo.
Prueba de proporciones
La prueba de proporciones se usa para comprobar si la proporción de éxitos en una muestra (cantidad de
unidades que satisfacen cierta condición dividida por el tamaño de muestra) es significativamente mayor,
menor o diferente a un valor determinado – entre 0 y 1 – (One-sample Test); o bien para comprobar si la
diferencia entre las proporciones de éxito en dos muestras es significativamente mayor, menor o diferente de
cero.
Considérese el siguiente caso:
Al final del cuatrimestre, una de las dos Cátedras de cierta materia de la Facultad
presenta 180 alumnos aprobados de 200 seleccionados al azar y la otra, 320
aprobados de 400 seleccionados al azar. ¿Son significativamente diferentes las
proporciones observadas de aprobados en una cátedra y la otra?
1. Ir a STATISTICS – ONE, TWO, MULTI-SAMPLE TESTS – PROPORTION TEST
2. Seleccionar “Two-sample Test” en “Model Specification”.
3. Ingresar el tamaño de la muestra (“Sample Size”) y el número de éxitos (“No. Successes”) (Esto es,
frecuencia de la condición o valor que se tiene en cuenta) para cada grupo en Sample 1 y Sample 2
respectivamente.
4. Seleccionar la hipótesis alternativa (Diferente “Not Equal”, Mayor “Greater Than”, Menor “Less Than”).
Si se trabaja con una sola muestra (opción “One-sample Test”), debe ingresarse la hipótesis nula, siendo
esta la proporción hipotética (número entre 0 y 1) con la que se compara la proporción observada.
5. OK.
22
Statistix 8.0 01/03/04, 11:22:26 a.m.
Two-Sample Proportion Test
Sample 1 Sample 2
Sample Size 200 400
Successes 180 320
Proportion 0.90000 0.80000
Null Hypothesis: P1 = P2
Alternative Hyp: P1 <> P2
Difference 0.10000
SE (diff) 0.03227
Z (uncorrected) 3.10 P 0.0019
Z (corrected) 2.98 P 0.0029
95% Confidence Interval of Difference
Lower Limit 0.04286
Upper Limit 0.15714
Puesto que el valor P (0.0019) es menor que los niveles de significación
que habitualmente se usan, puede afirmarse que la proporción observada de
aprobados de una cátedra difiere significativamente de la de la otra.
Prueba de hipótesis para variables nominales (Chi-Square Test)
Opción 1: Cuando se tienen los valores observados de ambas variables para
todos los sujetos
Ejemplo:
En una investigación, un grupo de estudiantes fue interrogado sobre varios tópicos.
Particularmente respondieron varias preguntas relativas al hábito de fumar.
Pregunta A. ¿Qué restricción a fumar establecería en lugares públicos cerrados como
aulas, colectivos o teatros? Las posibles respuestas fueron codificadas de la siguiente
23
manera: 1- Prohibiría fumar, 2.-Permitiría fumar sólo en áreas destinadas para ello y
3.- Permitiría fumar sin ningún tipo de restricción.
Pregunta B. ¿Fuma usted? Cuyas respuestas fueron: 1.- Si y 2.- No
Debajo se proporcionan las respuestas de los sujetos interrogados en la investigación.
Estudiar la asociación entre las variables de actitud y de hábito presentadas en el
problema.
Sujeto A B Sujeto A B Sujeto A B Sujeto A B Sujeto A B Sujeto A B Sujeto A B
1 2 2 35 2 1 69 3 2 103 2 2 137 2 1 171 2 2 205 3 2
2 3 1 36 2 2 70 2 2 104 3 2 138 1 2 172 2 2 206 1 2
3 2 2 37 2 2 71 3 1 105 2 1 139 2 2 173 3 1 207 3 1
4 1 2 38 2 2 72 2 2 106 2 1 140 3 1 174 3 2 208 2 2
5 2 2 39 2 1 73 2 2 107 3 1 141 2 2 175 2 2 209 2 2
6 1 2 40 2 2 74 2 2 108 2 1 142 2 2 176 3 1 210 3 2
7 2 1 41 2 2 75 2 2 109 3 2 143 3 2 177 3 2 211 2 1
8 2 2 42 2 2 76 3 1 110 1 2 144 2 2 178 2 2 212 2 2
9 2 2 43 2 1 77 2 2 111 2 2 145 1 2 179 2 1 213 2 2
10 2 1 44 2 2 78 2 2 112 3 2 146 2 2 180 2 2 214 3 1
11 3 1 45 2 2 79 2 2 113 1 2 147 3 2 181 2 2 215 3 2
12 1 2 46 1 2 80 3 2 114 2 1 148 2 1 182 2 2 216 2 1
13 3 1 47 2 1 81 1 2 115 2 2 149 1 1 183 1 2 217 2 2
14 2 1 48 1 2 82 2 1 116 2 1 150 2 2 184 3 2 218 2 2
15 2 1 49 2 2 83 2 2 117 2 2 151 2 2 185 2 2 219 3 1
16 2 2 50 2 2 84 3 1 118 1 2 152 3 2 186 2 1 220 2 2
17 2 2 51 1 2 85 2 2 119 2 2 153 1 2 187 3 1 221 2 1
18 1 2 52 2 2 86 2 2 120 3 1 154 3 1 188 2 2 222 2 2
19 2 2 53 1 2 87 2 1 121 3 2 155 1 2 189 2 2 223 2 2
20 3 2 54 2 2 88 2 2 122 2 1 156 3 2 190 2 2 224 2 2
21 1 2 55 2 2 89 3 1 123 3 2 157 3 2 191 2 2 225 2 2
22 2 2 56 1 2 90 3 1 124 2 1 158 1 2 192 2 2 226 2 2
23 3 1 57 2 2 91 1 2 125 3 2 159 2 2 193 3 2 227 2 2
24 2 2 58 2 1 92 2 2 126 2 2 160 3 1 194 2 2 228 1 2
25 2 1 59 1 2 93 2 2 127 1 1 161 2 2 195 3 2 229 2 2
26 2 2 60 2 2 94 2 2 128 2 2 162 2 2 196 3 2 230 2 2
27 2 2 61 1 2 95 2 2 129 3 2 163 2 2 197 2 2 231 2 1
28 2 1 62 2 2 96 1 2 130 2 2 164 2 2 198 1 2 232 3 1
29 3 2 63 1 2 97 3 1 131 2 2 165 2 1 199 3 2 233 2 2
30 3 2 64 1 2 98 2 2 132 1 2 166 1 2 200 2 2 234 1 2
31 2 2 65 2 1 99 3 1 133 2 2 167 2 2 201 1 1
32 3 1 66 2 2 100 2 2 134 2 1 168 2 2 202 2 2
33 2 2 67 2 2 101 2 2 135 3 1 169 2 2 203 2 2
34 2 1 68 3 2 102 1 2 136 2 1 170 3 2 204 1 2
24
1. Ir al menú STATISTICS – ASSOCIATION TESTS- Chi-Square Test
2. Seleccionar la opción Categorical en Model Specification
3. Ingresar la variable que quieren que aparezca en las FILAS de la tabla en Row Variable
4. Ingresar la variable que quieren que aparezca en las COLUMNAS de la tabla en Column Variable
5. OK.
Statistix 8.0 P7E1bis, 01/03/04, 04:35:39 p.m.
Chi-Square Test for Heterogeneity or Independence for 1 = B A
A
B 1 2 3
+-----------+-----------+-----------+
1 Observed | 3 | 33 | 25 | 61
Expected | 9.65 | 37.28 | 14.08 |
Cell Chi-Sq | 4.58 | 0.49 | 8.48 |
+-----------+-----------+-----------+
2 Observed | 34 | 110 | 29 | 173
Expected | 27.35 | 105.72 | 39.92 |
Cell Chi-Sq | 1.61 | 0.17 | 2.99 |
+-----------+-----------+-----------+
37 143 54 234
Overall Chi-Square 18.32
P-Value 0.0001
Degrees of Freedom 2
Cases Included 234 Missing Cases 0
25
El valor del estadístico de prueba CHI CUADRADO es de 18.32, y le corresponde un valor P=0,0001. O sea,
que a un nivel de significación del 5% o aún bastante menor, podemos rechazar la hipótesis de independencia
de las variables.
Observen además que en cada celda les aparece, para cada frecuencia observada (OBS), la frecuencia
esperada según la hipótesis de independencia (EXPECTED)*. Ambos valores resaltados en el primer
casillero.
* es decir, la frecuencia que se esperaría si las variables fueran independientes
Opción 2: Cuando la información se presenta organizada en una tabla que
muestra la distribución conjunta de frecuencias.
En este caso, los datos ya están agrupados apareciendo de la siguiente forma:
1. Ir al menú STATISTICS – ASSOCIATION TESTS- Chi-Square Test
2. Seleccionar la opción Table en Model Specification.
3. Ingresar cada una de las variables (que representan a cada una de las columnas de la tabla) en Table
Variables,
4. OK.
Statistix 8.0 P7E1, 01/03/04, 04:43:09 p.m.
Chi-Square Test for Heterogeneity or Independence
Variable
Case col1 col2 col3
+-----------+-----------+-----------+
1 Observed | 3 | 33 | 25 | 61
Expected | 9.65 | 37.28 | 14.08 |
Cell Chi-Sq | 4.58 | 0.49 | 8.48 |
+-----------+-----------+-----------+
2 Observed | 34 | 110 | 29 | 173
Expected | 27.35 | 105.72 | 39.92 |
Cell Chi-Sq | 1.61 | 0.17 | 2.99 |
+-----------+-----------+-----------+
37 143 54 234
Overall Chi-Square 18.32
P-Value 0.0001
Degrees of Freedom 2
Cases Included 6 Missing Cases 0
Noten que el chi-cuadrado, el valor P y los grados de libertad coinciden con los de la salida anterior. Esto es
así porque el programa usó la misma información.
26
Cómo estudiar la relación lineal entre dos variables: Correlations (Pearson)
Ejemplo:
Se consideran los puntajes de un grupo de niños de 5to grado en una Prueba de
Autoconcepto de Piers-Harris (Prueba 1) y en el Inventario de Autoestima de Cooper-
Smith (Prueba 2), obteniéndose:
Sujeto 1 2 3 4 5 6 7 8 9 10
Prueba 1 8 8 12 12 16 16 20 20 24 24
Prueba 2 8 6 6 10 8 14 14 12 16 12
a) Determinar mediante un coeficiente adecuado el grado y sentido de la
asociación lineal entre ambas variables. Interpretar el resultado.
b) Determinar mediante un coeficiente adecuado el grado de ajuste del modelo
lineal a los datos. Interpretar el resultado.
c) Hallar la recta de regresión para predecir el puntaje en la Prueba 2 a partir del
puntaje obtenido en la Prueba 1.
d) Predecir el puntaje en la Prueba 2 para un niño que obtuvo 10 puntos en la
prueba 1.
1. Ir al menú STATISTICS – ASSOCIATION TESTS – Correlations (Pearson) ; ó bien al menú
STATISTICS – LINEAL MODELS - Correlations (Pearson)...
2. Ingresar las dos variables cuya relación lineal quiere estudiarse en el cuadro Correlation Variables
3. Verificar que esté tildada la opción Fit Constant (así no fuerza a la recta a pasar por el origen).
4. OK
Statistix 8.0 P7ej4resueltos, 02/03/04, 07:49:57 p.m.
Correlations (Pearson)
P1
P2 0.8015
Cases Included 10 Missing Cases 0
Resulta r= 0,8015. Esto indica que estamos frente a una relación lineal de sentido directo o positivo.
27
Cómo hallar coeficiente de determinación r2, el gráfico y la ecuación de la
recta de regresión
Continuamos con el ejemplo anterior
1. Ir al menú STATISTICS – LINEAR MODELS – LINEAL REGRESSION
2. Ingresar la variable dependiente (la que va al eje Y) en Dependent Variable y la variable independiente
(la que va al eje X) en Independent Variable.
3. Fíjense que esté tildada la opción Fit Constant (para no forzar a la recta a pasar por el origen de
coordenadas).
4. OK.
Statistix 8.0 P7ej4resueltos, 02/03/04, 08:04:05 p.m.
Unweighted Least Squares Linear Regression of P2 Autoestima
Predictor
Variables Coefficient Std Error T P
Constant 3.00000 2.12662 1.41 0.1960
P1 0.47500 0.12531 3.79 0.0053
R-Squared 0.6423 Resid. Mean Square (MSE) 5.02500
Adjusted R-Squared 0.5976 Standard Deviation 2.24165
Source DF SS MS F P
Regression 1 72.200 72.2000 14.37 0.0053
Residual 8 40.200 5.0250
Total 9 112.400
Cases Included 10 Missing Cases 0
El r2=0,6423 indica que el ajuste del modelo lineal a los datos es bueno.
28
5. NO CIERREN LA VENTANA DONDE LES APARECE EL CUADRO, PARA PODER HACER LOS
PUNTOS QUE VIENEN A CONTINUACIÓN:
Para obtener el gráfico de la recta de regresión lineal:
1. Van al menú RESULTS – PLOTS – SIMPLE REGRESSION PLOT
2. Aparece el gráfico de la recta de regresión. DEBAJO DEL GRÁFICO FIGURA LA ECUACIÓN
DE DICHA RECTA.
Notar que los coeficientes de la recta de regresión se pueden ver en la salida del análisis de regresión
arriba de R-squared (r2).
Para predecir un valor de la variable dependiente en función de un valor
de la variable independiente:
1. Van al menú RESULTS – PREDICTION
2. En Specification Method seleccionan la opción Values Method
3. En Predictor Values ingresan el valor de la variable independiente para el que quieren realizar la
predicción.
4. OK.
29
Statistix 8.0 P7ej4res, 02/03/04, 08:10:29 p.m.
Predicted/Fitted Values of P2
Lower Predicted Bound 2.0579 Lower Fitted Bound 5.3671
Predicted value 7.7500 Fitted Value 7.7500
Upper Predicted Bound 13.442 Upper Fitted Bound 10.133
SE (Predicted Value) 2.4684 SE (Fitted Value) 1.0334
Unusualness (Leverage) 0.2125
Percent Coverage 95.0
Corresponding T 2.31
Predictor Values: P1 = 10.000
Es decir, que para un niño que obtuvo puntaje de 10 en la Prueba 1 se predice un puntaje de 7.75 en la Prueba
2.
30