Módulo 2.
Técnicas estadísticas con el programa informático SPSS para Windows
MÓDULO II – UNIDAD DIDÁCTICA 2
ESTADÍSTICA DESCRIPTIVA
Exploración de datos
Autores: Ana Fernández Palacín 1
Contenidos de esta Unidad
1.- INTRODUCCIÓN......................................................................................................................................... 1
2.- TIPOS DE DATOS ....................................................................................................................................... 2
3.- EXPLORACIÓN Y ANÁLISIS DESCRIPTIVO DE LOS DATOS ..................................................... 2
EXPLORACIÓN DE DATOS
1.- INTRODUCCIÓN.
La fase preliminar de cualquier estudio estadístico se dedica a la recogida y ordenación de los
datos. Este conjunto de procedimientos necesarios para recoger, tabular, representar y
resumir el conjunto de datos de interés se conoce con el nombre de “Estadística Descriptiva”.
Mediante estas técnicas podremos inspeccionar los datos, identificar valores atípicos (outliers),
describir los datos, etc.
1
Profesora titular de Bioestadística. Facultad de Medicina. Universidad de Sevilla
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 1
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
2.- TIPOS DE DATOS
Lo usual es distinguir entre dos tipos de datos: cuantitativos y cualitativos, según que la
característica en estudio sea o no medible.
Se dice que un dato es de tipo cualitativo cuando no se observa numéricamente (sexo, raza
estado civil, etc.). A éste tipo de datos se les denomina también atributos, datos categóricos o
datos nominales. Los atributos no se pueden medir o expresar mediante números (¡Cuidado!,
a veces se usan sistemas de codificación numérica para este tipo de datos). Cada uno de las
categorías o de los resultados posibles de un atributo es una modalidad. Cuando un dato
cualitativo sólo tiene dos categorías posibles se le denomina dicotómico (si/ no, varón/ hembra,
etc.). Cuando una información de tipo cualitativo se puede ordenar se denomina ordinal.
Los datos de tipo cuantitativos son aquellos que requieren una expresión numérica para su
medición (edad, nivel de glucosa en sangre, número de hijos, etc.). Hablamos entonces de
variables. Los datos cuantitativos pueden ser a su vez de dos tipos: discretos y continuos. Los
discretos son aquellos que toman un número limitado de valores de forma que entre dos
valores consecutivos no hay ningún valor intermedio (número de latidos por minuto, número
de dientes cariados, etc.), mientras que los datos cuantitativos continuos son los que pueden
tomar infinitos valores, de manera que entre dos valores consecutivos siempre existe un valor
intermedio de la característica en estudio (nivel de colesterol en sangre, temperatura, edad,
etc.).
3.- EXPLORACIÓN Y ANÁLISIS DESCRIPTIVO DE LOS DATOS
a) Los datos de tipo cualitativos (nominal y ordinal) se resumen mediante frecuencias
absolutas o recuentos y porcentajes. Esta información numérica puede ser complementada
mediante alguna representación gráfica como, entre otras, el diagrama de sectores. El
procedimiento Frecuencias de SPSS proporciona dicha información numérica y gráficos. Las
tablas de frecuencias obtenidas a partir de este procedimiento nos servirán también para
explorar los datos e identificar posibles errores de trascripción o registro de ellos.
Estadística/ Resumir/ Frecuencias
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 2
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
En la muestra de 200 mujeres no detectamos errores en sus valores (sí/ no). De las 200 mujeres 7
carecen de información de esta variable y de las 193 restante, el 33,7% (65/193) son diabéticas y el
66,3%
(128/193) no lo son. El diagrama de sectores representa estos datos. Dependientes: Muestra las
variable/s numérica/s que ha elegido para el análisis (grosor del pliegue cutáneo en triceps)
b) Las variables numéricas se describen mediante un conjunto de medidas denominadas
de distribución de frecuencias y se clasifican de la siguiente forma:
Medidas de centralización. Los estadísticos que describen la localización de la distribución,
incluyen:
media, mediana, moda de todos los valores.
La media aritmética: suma de todas las observaciones de una variable dividida entre el número de
valores válidos.
La mediana: valor que divide a la distribución de los datos en dos partes iguales (50% de
los valores menores que la mediana y 50% de los valores mayores).
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 3
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
La moda: valor de frecuencia máxima. Puede haber más de una moda. Salvo la moda,
las otras medidas no se pueden calcular para información cualitativas.
Valores percentiles. Son los valores de una variable cuantitativa que dividen los datos
ordenados en grupos, de forma que un porcentaje de los casos se encuentre por encima
y otro porcentaje se encuentre por debajo. Los cuartiles (percentiles 25, 50 y 75) dividen
las observaciones en cuatro grupos de igual tamaño. Si deseamos un número grupos
distinto de cuatro, seleccionamos Puntos de corte para n grupos iguales. También se
pueden especificar percentiles individuales (por ejemplo, el percentil 95, el valor por
debajo del cual se encuentran el 95% de las observaciones).
Dispersión. Los estadísticos que miden la cantidad de variación o de discrepancia en los
datos, incluyen: desviación típica, varianza, rango, rango intercuartílico, etc.
Forma. Asimetría y curtosis son estadísticos que describen la forma y la simetría de la
distribución. Estos estadísticos se muestran con sus errores típicos.
La exploración de datos es el primer paso en el análisis de una variable numérica ya que
servirá para inspeccionar los datos, identificando valores erróneos o extremos que
afectarán a los resultados. SPSS incorpora un procedimiento denominado “Explorar” que
nos permite obtener descripciones, comprobar hipótesis y caracterizar diferencias entre
subpoblaciones (subgrupos de casos).
Analizar/ Estadísticos descriptivos/ Explorar…
Dependientes: Se incluirán todas la/s variable/s numérica/s que se han elegido para el
análisis (p.e. el grosor del pliegue cutáneo en tríceps).
Factores: Identifica a la/s variable/s que dividirán a la muestra original en grupos de
casos, realizándose análisis separados para cada uno de ellos. La/s variable/s que se
incluyen como factores serán variables cualitativas o de cadena (p.e la paridad), o bien
variables numéricas previamente categorizadas. Si selecciona más de una variable de
factor, se generarán por separado los resúmenes para cada variable dependiente en
cada variable de factor.
El botón nos lleva al subcuadro de diálogo, en el que podremos seleccionar
algunos análisis estadísticos adicionales.
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 4
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
Descriptivos. Nos mostrará la media, la mediana, la moda, la media recortada al 5%, el error
típico, la varianza, la desviación típica, el mínimo, el máximo, la amplitud, la amplitud
intercuartil, la asimetría, el error típico de la asimetría, la curtosis y el error típico de la curtosis.
Estimadores robustos centrales. Obtendremos diversas medidas similares a la media, pero
en las cuales la contribución de cada observación en las mismas dependerá de la distancia de
dicha observación a un punto central.
Valores atípicos. Obtendremos información de los cinco valores mayores y los cinco menores
e identificará las líneas en las que están ubicados estos valores en el editor de datos.
Percentiles. Nos proporcionará los valores de los percentiles 5, 10, 25, 50, 75, 90 y 95.
Resumen del procesamiento de los casos
Casos
Válidos Perdidos Total
paridad N Porcentaje N Porcentaje N Porcentaje
grosor del pliegue nulíparas 28 100,0% 0 ,0% 28 100,0%
cutáneo en triceps (mm) primíparas 45 100,0% 0 ,0% 45 100,0%
multíparas 127 100,0% 0 ,0% 127 100,0%
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 5
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
Descriptivos
paridad Estadístico Error típ.
grosor del pliegue nulíparas Media 29,43 2,233
cutáneo en triceps (mm) Intervalo de confianza Límite inferior 24,85
para la media al 95% Límite superior
34,01
Media recortada al 5% 28,97
Mediana 28,00
Varianza 139,587
Desv. típ. 11,815
Mínimo 10
Máximo 60
Rango 50
Amplitud intercuartil 18
Asimetría ,554 ,441
Curtosis ,169 ,858
primíparas Media 28,36 1,813
Intervalo de confianza Límite inferior 24,70
para la media al 95% Límite superior
32,01
Media recortada al 5% 28,17
Mediana 28,00
Varianza 147,871
Desv. típ. 12,160
Mínimo 8
Máximo 52
Rango 44
Amplitud intercuartil 20
Asimetría ,289 ,354
Curtosis -,893 ,695
multíparas Media 29,47 1,032
Intervalo de confianza Límite inferior 27,43
para la media al 95% Límite superior
31,51
Media recortada al 5% 29,06
Mediana 30,00
Varianza 135,219
Desv. típ. 11,628
Mínimo 7
Máximo 99
Rango 92
Amplitud intercuartil 14
Asimetría 1,570 ,215
Curtosis 8,779 ,427
En los grupos nulíparas y primíparas la media junto con la desviación típica describirían
adecuadamente al grosor del pliegue, ya que el coeficiente de asimetría no supera a la unidad
en valor absoluto. No ocurre lo mismo en el grupo de multíparas (Asimetría/Error típica)>2 por
lo que debe resumirse con la mediana junto con los percentiles 25 y 75 de la tabla posterior.
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 6
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
Percentiles
Promedio ponderado(definición 1) Bisagras de Tukey
grosor del pliegue cutáneo en triceps grosor del pliegue cutáneo en triceps
(mm) (mm)
paridad paridad
Percentiles nulíparas primíparas multíparas nulíparas primíparas multíparas
5 11,80 10,30 12,00
10 14,00 12,00 15,00
25 18,50 18,50 22,00 19,00 19,00 22,00
50 28,00 28,00 30,00 28,00 28,00 30,00
75 36,50 38,00 36,00 36,00 36,00 36,00
90 46,00 46,80 42,20
95 53,70 50,00 45,60
Los valores percentiles obtenidos mediante el “promedio ponderado (HAVERAGE)”,
proporciona el método clásico de obtención de percentiles. Los resultados también muestran
las bisagras de Tukey: una versión distinta de los clásicos cuartiles: la primera bisagra (similar
al cuartil primero) es el valor que ocupa la posición intermedia entre el valor más pequeño de
la muestra y la mediana, el segundo es la mediana y el tercero es el valor que ocupa la
posición intermedia entre la mediana y el valor mayor observado (son los valores usados para
representar el diagrama de cajas).
Valores extremos
Número
paridad del caso Valor
grosor del pliegue nulíparas Mayores 1 95 60
cutáneo en triceps (mm) 2 49 46
3 188 46
4 91 45
5 3 43
Menores 1 125 10
2 183 14
3 93 14
4 27 17
5 16 17a
primíparas Mayores 1 9 52
2 77 50
3 79 50
4 86 48
5 158 46
Menores 1 11 8
2 18 10
3 80 11
4 97 12
5 64 12
multíparas Mayores 1 185 99
2 177 49
3 199 49
4 165 48
5 149 46b
Menores 1 138 7
2 69 11
3 40 11
4 166 12
5 113 12c
a. En la tabla de valores extremos menores sólo se muestra una lista parcial de
los casos con el valor 17.
b. En la tabla de valores extremos mayores sólo se muestra una lista parcial de
los casos con el valor 46.
c. En la tabla de valores extremos menores sólo se muestra una lista parcial de
los casos con el valor 12.
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 7
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
Obtenemos los cinco valores mayores y los cinco menores del grosor en cada uno de los
grupos de paridad. Siempre debemos chequear valores sospechosos para asegurarnos de
que no son resultado de errores de registro o entrada de ellos. Si los valores fueron errores se
podrían modificar. Si los valores atípicos fueran correctos, debemos seleccionar medidas
descriptivas no afectadas por ellos (mediana, media truncada, etc. )
El botón proporciona varios procedimientos gráficos para resumir la
información
Histograma. Una representación gráfica dibujada en un sistema de ejes de coordenadas,
formada por un conjunto de rectángulos yuxtapuestos cuyas bases son las amplitudes de
los intervalos en los que se han agrupado los datos, y la altura de cada rectángulo es el
porcentaje de datos en cada intervalo.
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 8
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
Diagramas de caja. Es una representación gráfica útil para visualizar la distribución de
una variable numérica. Representa simultáneamente la mediana, los percentiles 25 y 75
(en realidad son las bisagras de Tukey), y una serie de valores (atípicos y extremos) que
proporcionan información bastante completa sobre, entre otras cosas, el grado de
dispersión y el grado de asimetría de los datos en cada en cada grupo (si hay variable
factor). Es una representación gráfica más compacta que un histograma, pero no ofrece
una información tan detallada como él.
Las alternativas controlan la presentación de los diagramas de caja cuando existe más de
una variable dependiente: “Niveles de los factores juntos” genera una representación
para cada variable dependiente, en cada una, se muestran diagramas de caja para cada
uno de los grupos definidos por una variable de factor. “Dependientes juntas” genera
una representación para cada grupo definido por una variable de factor, en cada una, se
muestran juntos los diagramas de caja de todas las variables dependientes. Esta
disposición es particularmente útil cuando las variables representan una misma
característica medida en momentos distintos.
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 9
Módulo 2. Técnicas estadísticas con el programa informático SPSS para Windows
Valor extremo
Los bigotes se extienden
Mediana hasta el valor menor y
mayor observados
Percentil 25 y 75
dentro de 1,5 veces la
Gráficos con pruebas de normalidad. Esta opción gráfica muestra los diagramas de
probabilidad normal y de probabilidad sin tendencia. Asimismo, obtiene el estadístico de
Kolmogorov-Smirnov y el estadístico de Shapiro_Wilk (sólo válido para muestras con 50
o menos observaciones) contrastar la normalidad, previamente a la realización de
algunas técnicas inferenciales (se verá posteriormente).
Valores perdidos. El botón controla el tratamiento de los valores perdidos
· Excluir casos según lista (homogeneizar recursos). Los casos con valores perdidos
para cualquier variable de factor o variable dependiente incluidas en el cuadro de diálogo,
se excluyen de todos los análisis. Éste es el valor por defecto.
· Excluir casos según pareja (maximizar recursos). Los casos que no tengan valores
perdidos para las variables incluidas en el análisis actual se incluyen en dicho análisis. El
caso puede tener valores perdidos para las variables utilizadas en otros análisis.
· Mostrar los valores. Los valores perdidos para las variables de factor se tratan como
una categoría diferente. Todos los resultados se generan para esta categoría adicional.
Las tablas de frecuencias incluyen categorías para los valores perdidos. Los valores
perdidos para una variable de factor se incluyen.
SPSS dispone también otros procedimientos en los que podemos realizar análisis
descriptivos de variables numéricas tal como “Frecuencias”, “descriptiva”, “razón”, etc.
Máster en Metodología de Investigación en Ciencias de la Salud. Universidad de Huelva
pg. 10