Velarde Torres Erandi Nina
Reporte de lectura 3
Estadística descriptiva: presentaciones tabulares y gráficas
La media (promedio) es una variable que proporciona una medida de
localización central de datos, se calcula de la siguiente manera:
La mediana igualmente es una medida de localización central, pero es el valor de
en medio de los datos ordenados de menor a mayor. Si la cantidad de datos es
impar, la mediana es el valor de en medio, en caso de ser par, es el promedio de
las dos observaciones de en medio. La moda es el valor que más se repite.
El percentil p es un valor tal que por lo menos p por ciento de las observaciones
son menores o iguales que este valor y por lo menos (100 p) por ciento de las
observaciones son mayores o iguales que este valor. La formula es la siguiente:
Los cuartiles sólo son percentiles determinados, los pasos para calcular los
percentiles también se emplean para los cuartiles. Los cuartiles han sido definidos
como el percentil 25, el percentil 50 y el percentil 75.
La medida de variabilidad más sencilla es el rango, el rango intercuartílico es el
rango en que se encuentra el 50% central de los datos. La varianza está basada
En la diferencia entre el valor de cada observación (xi) y la media. A la diferencia
entre cada valor xi y la media (cuando se trata de una muestra, μ cuando se trata
de una población) se le llama desviación respecto de la media. Si se trata de una
muestra, una desviación respecto de la media se escribe (xi), y si se trata de una
población se escribe (xi μ). Para calcular la varianza, estas desviaciones respecto
de la media se elevan al cuadrado.
Si los datos son de una población, el promedio de estas desviaciones elevadas al
cuadrado es la varianza poblacional. La varianza poblacional se denota con la
letra griega σ2
La desviación estándar se define como la raíz cuadrada positiva de la varianza.
El coeficiente de variación es una medida
relativa de la variabilidad; mide la desviación
estándar en relación con la media.
El teorema de Chebyshev permite decir qué proporción de los valores que se
tienen en los datos debe estar dentro de un determinado número de desviaciones
estándar de la media. Cuando se cree que los datos tienen aproximadamente esta
distribución, se puede emplear la regla empírica para determinar el porcentaje de
los valores de los datos que deben encontrarse dentro de un determinado número
de desviaciones estándar de la media.
Algunas veces un conjunto de datos tiene una o más observaciones cuyos valores
son mucho más grandes o mucho más pequeños que la mayoría de los datos. A
estos valores extremos se les llama observaciones atípicas.
En el resumen de cinco números se usan los cinco números siguientes para
resumir los datos (El valor menor, el primer cuartil (Q1), la mediana (Q2)).
Un diagrama de caja es un resumen gráfico de los datos con base en el resumen
de cinco números. La clave para la elaboración de un diagrama de caja es el
cálculo de la mediana y de los cuartiles Q1 y Q3 También se necesita el rango
intercuartílico, RIC Q3 Q1.
La covarianza es una medida de la asociación lineal entre dos variables.
Anderson, D. R., Sweeney, D. J., Williams, T. A., & Hano Roa, M. del C. (2008).
Estadística para administración y economía, “Estadística descriptiva: medidas numéricas”
(10a. edición). Cengage Learning, pp. 26-81