ESTADISTICA DESCRIPTIVA
La estadística descriptiva es el conjunto de métodos estadísticos que describen y/o
caracterizan un grupo de datos. La estadística descriptiva es la parte de la
estadística que arregla los datos de forma que puedan ser analizados e
interpretados. Los métodos de estadística descriptiva nos permiten:
Determinar la tendencia central de una variable: promedio o media aritmética,
mediana o moda.
Determinar la variabilidad de una variable: desviación estándar, varianza,
rangos.
Determinar cómo es la distribución de una variable: histograma de
frecuencias, distribución normal.
Las medidas descriptivas pueden calcularse a partir de los datos de una población
o de una muestra, para diferenciarlos se tienen diferentes términos y definiciones;
a) Una medida descriptiva calculada a partir de los datos de una muestra se
conoce como: Estadístico.
b) Una medida descriptiva calculada a partir de los datos de una población se
conoce como: Parámetro.
Cuando muestreamos en una población es habitual que tengamos una cantidad
grande de datos más o menos desorganizados, que se llaman “datos crudos”,
resulta lógico pensar que en esta forma los datos no proporcionan información
relevante para el o los investigadores, por lo tanto es razonable pensar que una
manera de organizar los datos nos ayudara a obtener la información que
necesitamos de ellos.
Los métodos que se usan en la estadística descriptiva se pueden agrupar en tres
temas; Distribución de frecuencias de los datos, análisis grafico de los mismos y
métodos numéricos. Lo primero que podemos hacer para organizar nuestros datos
es un “arreglo ordenado”, que es un listado de valores de nuestros datos
organizados en orden creciente, es decir de menor a mayor.
El arreglo ordenado nos aporta información general sobre nuestros datos, por
ejemplo así podemos saber fácilmente cual es el menor y el mayor de nuestros
datos, también no proporciona de manera general una visión de sus magnitudes en
nuestra población de estudio. Cuando el número de datos es pequeño, el arreglo
ordenado se puede hacer manualmente, pero con número de datos mayor se
recomienda el uso de un programa de computadora para realizarlo.
La desviación estándar (SD) representa la variación en los valores de una variable,
mientras que el error estándar de la media (Estándar Error of the Mean, SEM)
representa la dispersión que tendría la media de una muestra de valores si se
continuaran tomando muestras. Por lo tanto, el SEM proporciona una idea de la
precisión de la media y el SD nos da una idea de la variabilidad de las observaciones
individuales. Estos dos parámetros están relacionados:
SEM = SD/√n
Donde:
SEM = Error estándar de la media
SD = Desviación estándar
n = tamaño de la muestra
Algunos consideran que deberían presentar el SEM con las medias debido a que
creen que es importante indicar cuan precisa es la estimación de la media. Cuando
se comparan dos medias suele argumentarse que al presentar el SEM se tiene una
idea de si existe una diferencia estadísticamente significativa entre las medias. Todo
muy bien pero, esto es lo que no va por el camino correcto:
Para la estadística descriptiva de los sujetos, se debe presentar el SD para dar al
lector una idea de la dispersión entre lo sujetos. Presentar el SEM con la media es
absurdo.
Cuando se comparan medias grupales, la presentación del SD proporciona una idea
de la magnitud de las diferencias entre las medias, debido a que se puede observar
cuán grande es la diferencia en relación con el SD. En otras palabras, se puede
observar cuán grande es el tamaño del efecto.
Es importante visualizar el SD cuando hay varios grupos experimentales, debido a
que si el SD difiere en gran medida, se podría utilizar una transformación logarítmica
o por rangos antes de computar los intervalos de confianza o los valores p. Si el
número de sujeto difiere entre los grupos, el SEM no proporciona una impresión
visual directa de si hay diferencias en el SD.
Si pensamos que es importante indicar la significancia estadística, entonces se
deben reportar los valores de p o los límites de confianza de los resultados
estadísticos. Esto es mucho más preciso que reportar los valores del SEM. Además
¿Alguien sabe cuánto de los SEM deben superponerse o no superponerse para
estipular que una diferencia es significativa? Asimismo ¿Alguien sabe si la magnitud
de la superposición o no superposición depende del tamaño relativo de la muestra?
Más importante aún, cuando se tienen valores medios para puntajes pre y post en
un experimento con medidas repetidas, el SEM de estas medias NO proporciona
una impresión de la significancia estadística del cambio – un punto sutil que desafía
a muchos estadísticos. Por lo tanto, si el SEM no muestra significancia estadística
en los experimentos
Un intervalo de confianza es un rango de valores, derivado de los estadísticos de la
muestra, que posiblemente incluya el valor de un parámetro de población
desconocido. Debido a su naturaleza aleatoria, es poco probable que dos muestras
de una población en particular produzcan intervalos de confianza idénticos. Sin
embargo, si usted repitiera muchas veces su muestra, un determinado porcentaje
de los intervalos de confianza resultantes incluiría el parámetro de población
desconocido.
En este caso, la línea negra horizontal representa el valor fijo de la media
desconocida de la población, µ. Los intervalos de confianza azules verticales que
se sobreponen a la línea horizontal contienen el valor de la media de la población.
El intervalo de confianza rojo que está completamente por debajo de la línea
horizontal no lo contiene. Un intervalo de confianza de 95% indica que 19 de 20
muestras (95%) de la misma población producirán intervalos de confianza que
contendrán el parámetro de población.
Utilice el intervalo de confianza para evaluar la estimación del parámetro de
población. Por ejemplo, un fabricante desea saber si la longitud media de los lápices
que produce es diferente de la longitud objetivo. El fabricante toma una muestra
aleatoria de lápices y determina que la longitud media de la muestra es 52
milímetros y el intervalo de confianza de 95% es (50,54). Por lo tanto, usted puede
estar 95% seguro de que la longitud media de todos los lápices se encuentra entre
50 y 54 milímetros.
El intervalo de confianza se determina calculando una estimación de punto y luego
determinando su margen de error.
Estimación de punto
Este valor individual estima un parámetro de población usando los datos de la
muestra.
Margen de error
Cuando usted utiliza estadísticos para estimar un valor, es importante recordar que,
sin importar lo bien que esté diseñado su estudio, su estimación está sujeta a error
de muestreo aleatorio. El margen de error cuantifica este error e indica la precisión
de la estimación.
Usted probablemente ya entiende el margen de error, porque está relacionado con
los resultados de las encuestas. Por ejemplo, una encuesta política podría indicar
que el nivel de popularidad de un candidato es de 55% con un margen de error de
5%. Esto significa que el nivel de popularidad real es +/- 5% y, por lo tanto, se ubica
entre 50% y 60%.
Para un intervalo de confianza bilateral, el margen de error es la distancia desde el
estadístico estimado hasta cada el valor del intervalo de confianza. Cuando un
intervalo de confianza es simétrico, el margen de error es la mitad del ancho del
intervalo de confianza. Por ejemplo, la longitud media estimada de un árbol de levas
es 600 mm y el intervalo de confianza oscila entre 599 y 601. El margen de error es
1.
Mientras mayor sea el margen de error, más ancho será el intervalo y menos seguro
podrá estar usted del valor de la estimación de punto.
El error estándar de la media (en inglés “standard error of the mean”; SEM o SE)
es el valor que cuantifica cuánto se apartan los valores de la media de la población.
Es decir, el error estándar de la media cuantifica las oscilaciones de la media
muestral (media obtenida en base a los datos medidos en la muestra
utilizada) alrededor de la media poblacional (verdadero valor de la media). Es una
medida del error que se comete al tomar la media calculada en una muestra como
estimación de la media de la población total.
A partir del error estándar se construye el intervalo de confianza de la medida
correspondiente.
1) El error estándar de la media estimado en la muestra del ejemplo es 1,47. Se
calcula dividiendo la desviación estándar por la raíz cuadrada del tamaño muestral
14,7/√100=14,7/10
2) Calculado a partir de él, el intervalo de confianza al 95% para la media va
desde 43,3 a 49,1
Límite inferior = media - 1,96 veces el error estándar = 46,2 – 1,96 * 1,47 =
43,3 (límite inferior)
Límite superior = media + 1,96 veces el error estándar = 46,2 + 1,96 * 1,47 =
49,1 (límite superior)
Este es uno de los métodos estadísticos que exige normalidad de la población.
Quiere decir que podemos afirmar, con una confianza del 95%, que la media
poblacional está incluida en dicho intervalo. Compárese con el valor de la media
poblacional (verdadero valor de la media) que, en este ejemplo y en contra de lo
que ocurre en las investigaciones reales, es conocido. Vemos que el valor verdadero
(44,5 años) está dentro del intervalo de confianza que habíamos calculado (43,3 –
49,1). Por tanto, hablar de una confianza del 95% significa que en el 95% de las
posibles muestras que podríamos tomar de la población total, la edad media (44,5)
estaría contenida en el intervalo construido.