ESTADÍSTICA BÁSICA
Unidad 2
MEDIDAS DE TENDENCIA CENTRAL Y DE DISPERSIÓN
Tema 1
Medidas de tendencia central para datos agrupados
y no agrupados
ING. JUAN T. CALDERON CISNEROS, PhD.
Docente Titular Agregado 1 UNEMI / Docente Investigador Invitado ECOTEC
Investigador – Acreditado – Senescyt-Reg-Inv:18-02756
Coordinador de la Red Académica "Herramientas de Estadística Multivariante para el Análisis de Big Data“
Nro. Senescyt-2018-040_ Reg-Red –18-0011.
RESEARCHERID IS: K-6083-2014
Scopus Author ID: 57204238028
[Link]
Subtemas
» Subtemas:
1 Media.
2 Mediana.
3 Moda.
4 Cuartiles, deciles y percentiles.
Objetivo
Identificar la medida de tendencia central como la moda
para datos agrupados y no agrupados de igual manera las
medidas de dispersión como los cuantiles, evaluando los
problemas estadísticos para la correcta interpretación de
datos.
Introducción
En las presentes láminas se plantean las principales medidas
de tendencia central y las medidas de dispersión dentro de
un conjunto de datos agrupados y sin agrupar para
determinar la posición que quedan los intervalos
proporcionalmente repartidos.
ACTIVIDAD DE INICIO
Lluvia de ideas sobre la temática de:
Moda y cuantiles
3. Moda para datos tabulados y sin tabular.
Se denomina moda de un conjunto de datos al
valor que más se presenta, es decir, el atributo
o el valor de mayor frecuencia. La moda se
representa por 𝑴𝒐 y puede ser aplicada a las
variables cualitativas y cuantitativas discretas o
continuas. Si dos valores tienen la misma
frecuencia se dice que el conjunto es bimodal.
Cuando más de dos valores ocurren con la
misma frecuencia y ésta es la más alta, todos
los valores son modas, por lo que el conjunto
de datos recibe el nombre de multimodal.
Moda para datos sin tabular.
Para obtener la moda de un
conjunto de datos que están sin
agrupar, se construyen las
frecuencias y se ubica el valor o la
característica que corresponde a
la frecuencia mayor.
Por ejemplo, los siguientes son los resultados obtenidos al indagar a varias personas
por el color de preferencia: blanco, azul, rosado, azul, negro, azul, morado, azul, negro
y blanco; al construir las frecuencias en la preferencia de las personas, se tiene:
En la tabla se observa que el color con mayor frecuencia es el azul, por tanto, la moda en el
color de preferencia de las personas es el azul.
Ejemplo: Veamos, el número de cursos matriculados por varios estudiantes en un
semestre son: 6, 7, 6, 6, 7, 8, 9, 7; en este caso existen dos modas: 6 y 7, dado que cada
uno de estos cursos presentan igual número de frecuencia y, además es la máxima; por
tal razón, se denomina una distribución multimodal (particularmente bimodal).
Moda para datos tabulados.
Cuando los datos se encuentran
agrupados la moda es la marca de clase
del intervalo de clase que contiene la
mayor frecuencia.
Las siguientes tablas de frecuencias indican el número de personas de
acuerdo a su edad que asistieron al estreno de una película.
Fuente: Elaboración propia.
Fuente: Elaboración propia.
En la tabla donde los datos se encuentran
En la tabla donde los datos están sin agrupados, la moda se encuentra en el intervalo
agrupar, la moda es 22, valor de clase 19.5 – 22.5 y corresponde a la marca
correspondiente a la mayor frecuencia de clase que es 21.
que es 5.
Cuando los datos han sido agrupados en clases o
intervalos, la moda se calcula utilizando la siguiente
expresión:
𝑓 𝑖 −𝑓 𝑖−1
𝑀𝑜 = 𝐿𝑖 + *𝐶
𝑓 𝑖 −𝑓 𝑖−1 +(𝑓𝑖−𝑓𝑖+1)
Donde:
𝐿𝑖 = 𝐿í𝑚𝑖𝑡𝑒 𝑖𝑛𝑓𝑒𝑟𝑖𝑜𝑟 𝑑𝑒𝑙 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜 𝑐𝑜𝑛 𝑚𝑎𝑦𝑜𝑟 𝑓𝑟𝑒𝑐𝑢𝑒𝑛𝑐𝑖𝑎 𝑎𝑏𝑠𝑜𝑙𝑢𝑡𝑎.
𝑓𝑖 = 𝐹𝑟𝑒𝑐𝑢𝑒𝑛𝑐𝑖𝑎 𝑎𝑏𝑠𝑜𝑙𝑢𝑡𝑎 𝑑𝑒𝑙 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜.
𝑓𝑖−1 = 𝐹𝑟𝑒𝑐𝑢𝑒𝑛𝑐𝑖𝑎 𝑎𝑏𝑠𝑜𝑙𝑢𝑡𝑎 𝑑𝑒𝑙 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜 𝑎𝑛𝑡𝑒𝑟𝑖𝑜𝑟.
𝑓𝑖+1 = 𝐹𝑟𝑒𝑐𝑢𝑒𝑛𝑐𝑖𝑎 𝑎𝑏𝑠𝑜𝑙𝑢𝑡𝑎 𝑑𝑒𝑙 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜 𝑠𝑖𝑔𝑢𝑖𝑒𝑛𝑡𝑒.
𝐶 = 𝐴𝑚𝑝𝑙𝑖𝑡𝑢𝑑 𝑑𝑒𝑙 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜.
Moda para el ejemplo del tiempo (en minutos) requerido por un grupo de personas para
realizar una actividad.
Fuente: Elaboración propia.
1. El intervalo de mayor frecuencia absoluta es el 3.
2. Los valores para el cálculo de la moda son:
𝐿𝑖 = 55
𝑓𝑖 = 12
𝑓𝑖−1 = 9
𝑓𝑖+1 = 11
𝐶 =5
𝑓 𝑖 −𝑓 𝑖−1
𝑀𝑜 = 𝐿𝑖 + *𝐶
𝑓 𝑖 −𝑓 𝑖−1 +(𝑓 𝑖 −𝑓 𝑖+1 )
12−9 3 15
𝑀𝑜 = 55 + * 5 = 55 + ∗ 5 = 55 + = 58.75 𝑚𝑖𝑛𝑢𝑡𝑜𝑠.
12−9 +(12−11) 4 4
Es decir, el tiempo que la mayoría de personas invierten para realizar la actividad es 58,75 minutos.
Ejemplo
A través de la siguiente tabla de distribución de frecuencias,
calcule la media, la mediana y la moda.
4. Cuartiles, deciles y percentiles.
Medidas de posición
Las medidas de posición, también llamadas cuantiles, son aquellas que
permiten calcular valores en la distribución de los datos y que la dividen en
partes iguales, de tal forma que los intervalos generados por los cuantiles
contienen el mismo número de datos. Los cuantiles más usados son los
cuartiles, deciles y percentiles. Cuando se tienen datos agrupados en
intervalos, estas medidas se consideran en cierta forma como una extensión
de la mediana.
Medidas de posición
Los cuartiles, deciles y percentiles son medidas que se utilizan para
determinar los intervalos dentro de los cuales quedan
proporcionalmente repartidos los términos de la distribución.
Cuartiles
Los cuartiles (𝑄𝑘) son valores que fraccionan la distribución de los datos
en cuatro partes iguales (Ruíz Muñoz, 2005). Existen tres cuartiles y cada
una de las partes representa un 25% de los datos.
Cuartiles
El primer cuartil (𝑸𝟏) deja por debajo el 25% de la distribución de los
datos o el 75% por encima de él. El segundo cuartil (𝑸𝟐) acumula el 50%
de los datos por debajo y el otro 50% por encima de él (por tal razón es
igual a la mediana); y el tercer cuartil (𝑸𝟑) deja por debajo el 75% de los
datos y por encima el 25% (Ruíz Muñoz, 2005).
Cuartiles
El cálculo de los cuartiles se realiza mediante el siguiente
procedimiento:
1. Ordenar los datos de forma ascendente.
𝑘
2. Calcular la posición 𝒊 con la ecuación: 𝑖 = ∗ 𝑛. Donde K es el
4
número del cuartil (k = 1, 2, 3) y n el número total de datos.
3. Si 𝒊 no es un número entero, se debe redondear al entero siguiente
y el valor que ocupa esta posición será el cuartil requerido. Si 𝒊 es un
número entero, el cuartil es el promedio de los valores 𝒊 𝒆 𝒊+𝟏.
Ejemplo
Se le consultó a un grupo de siete estudiantes el número de horas semanal
que dedican para el repaso de los temas vistos en clase, obteniendo los
siguientes resultados: 3, 5, 2, 7, 6, 4, 9 horas. Para el cálculo de los cuartiles,
se empleará el procedimiento descrito anteriormente.
Desarrollo
1. Ordenar los datos en forma ascendente: 2, 3, 4, 5, 6, 7, 9.
1
2. Para el cuartil 𝑸𝟏 la posición 𝒊 sería: 𝑖 = 4 ∗ 7 = 1.75
3. Dado que 𝒊 no es un entero, se redondea al entero siguiente, es
decir a 2. En este caso, el cuartil 𝑸𝟏 corresponde al valor ubicado en
la posición 2, el cual es 3 horas. Su interpretación significa que el 25%
de los estudiantes dedican máximo 3 horas semanales para el repaso
a los temas vistos en clase.
De forma similar, para el cuartil 𝑸𝟐 la posición 𝒊 sería: 𝑖 = 2 ∗
4
7 = 3.5
Como 𝒊 no es un entero, se redondea al entero siguiente, es
decir a 4. Por tanto, el cuartil 𝑸𝟐 será el valor correspondiente a
la posición 4, el cual es 5 horas. Esto es, el 50% de los
estudiantes dedican máximo 5 horas semanales para el repaso
a los temas vistos en clase. Nótese que este valor corresponde
a la mediana.
Para el cuartil 𝑸𝟑 la posición 𝒊 sería:
3
𝑖 = ∗ 7 = 5.25
4
Al redondearla quedaría en 6, y el valor del cuartil 𝑸𝟑 es 7 horas.
Indica que el 75% de los estudiantes dedican máximo 7 horas
semanales para el repaso a los temas vistos en clase.
Ejemplo
La talla de los neonatos prematuros nacidos en los partos durante una
noche en un hospital fueron: 40, 37, 29, 31, 32, 38, 38, 38 cm.; para el
cálculo de los cuartiles se empleará el procedimiento del ejemplo anterior,
teniendo en cuenta el resultado obtenido al calcular la posición 𝒊 .
Cuartiles para datos agrupados
Si los datos se han agrupado en clases o intervalos, los cuartiles se calculan
mediante la siguiente ecuación:
𝑛
𝑘 4 − 𝐹𝑖−1
𝑄𝑘 = 𝐿𝑖 + ∗𝑐
𝑓𝑖
Donde:
𝒌 es el número del cuartil, k= 1, 2, 3.
𝒏 es el número total de datos.
𝑳𝒊 es el límite inferior del intervalo que contiene a k(n/4).
𝑭𝒊− es la frecuencia absoluta acumulada anterior al intervalo que contiene a
k(n /4).
𝒇𝒊 es la frecuencia absoluta del intervalo que contiene a k(n /4).
𝑪 es la amplitud del intervalo.
Ejemplo
En la siguiente tabla se presentan los datos ordenados de la estatura, en centímetros, de un
grupo de mujeres que asisten al gimnasio.
Fuente: Elaboración propia.
Desarrollo
El cuartil uno se calcula mediante el siguiente procedimiento:
𝑛 35
1.- Se halla k(n /4). 𝑘 4
=1 = 8.75
4
2.- Se ubica el intervalo que contiene a k(n /4) en la frecuencia absoluta acumulada 𝐹𝑖. (El segundo intervalo
contiene a 8,75 en la frecuencia absoluta acumulada).
3.- El primer cuartil se obtiene mediante la fórmula:
𝑛
𝑘 4 − 𝐹𝑖−1
𝑸𝟏 = 𝐿𝑖 + ∗𝑐
𝑓𝑖
1 35 −1 7.75
4
𝑸𝟏 = 155 + ∗ 5 = 155 + ∗ 5 = 155 + 3.52 = 158.52 𝑐𝑚.
11 11
Se estima que el 25% de las mujeres que asisten al gimnasio presentan una estatura máxima de 158.52 cm.
Fuente: Elaboración propia.
De forma similar se obtienen los cuartiles dos y tres:
2 𝑛 −𝐹𝑖−1 2 35 −12
4 4
𝑸𝟐 = 𝐿 𝑖 + 𝑓𝑖
∗𝑐 𝑸𝟐 = 160 + 13
∗ 5 = 162.1 𝑐𝑚.
3 𝑛 −𝐹𝑖−1 3 35 −25
4 4
𝑸𝟑 = 𝐿 𝑖 + 𝑓𝑖
∗𝑐 𝑸𝟑 = 165 + 6
∗ 5 = 166.0 𝑐𝑚.
El 50% de las mujeres presentan una estatura máxima de 162,1 cm
(cuartil dos) y el 75% tienen una estatura máxima de 166 cm (cuartil
tres).
Deciles
Los deciles (𝐷𝑘) son valores que fraccionan la distribución de los datos
en diez partes iguales (Ruíz Muñoz, 2005). En la distribución se
presentan nueve deciles: el 𝐷1 acumula el 10% del conjunto de datos,
el 𝐷2 deja el 20%, y así sucesivamente hasta el 𝐷9, que acumula el 90%
de los datos.
Deciles
Para el cálculo de los deciles se usa un procedimiento similar al de los
cuartiles:
1. Ordenar los datos de forma ascendente.
𝑘
2. Calcular la posición 𝒊 con la ecuación: 𝑖 = ∗ 𝑛. Donde K es el número
10
del decil (k = 1, 2, 3, 4, 5, 6, 7, 8, 9) y n el número total de datos.
3. Si la posición 𝒊 no es un número entero, se debe redondear al entero
siguiente y el valor que ocupa esta posición será el decil requerido. Si la
posición 𝒊 es un número entero, el decil es el promedio de los
valores 𝒊 𝒆 𝒊+𝟏.
Deciles para datos agrupados
Para datos agrupados en intervalos se utiliza la siguiente expresión:
𝑛
𝑘 10 − 𝐹𝑖−1
𝐷𝑘 = 𝐿𝑖 + ∗𝑐
𝑓𝑖
Fuente: Elaboración propia.
El cálculo de los deciles uno y nueve para el ejemplo de la estatura
de las mujeres, presentado en la tabla, se detalla a continuación:
𝑛 35
1 − 𝐹𝑖 − 1 10 − 1
𝑫𝟏 = 𝐿 𝑖 + 10 ∗ 𝑐 = 155 + ∗ 5 = 156.1 𝑐𝑚.
1
𝑓𝑖 11
𝑛 35
9 − 𝐹𝑖 − 9 10 − 31
𝑫𝟗 = 𝐿 𝑖 + 10 ∗ 𝑐 = 170 + ∗ 5 = 170.6 𝑐𝑚.
1
𝑓𝑖 4
Percentiles
Los percentiles (𝑃𝑘) son valores que fraccionan la distribución de los
datos en cien partes iguales (Ruíz Muñoz, 2005). En la distribución se
presentan 99 percentiles: el primer percentil 𝑷𝟏 acumula el 1% del
conjunto de datos, el percentil 𝑷𝟐 deja el 2%, y de forma similar los
demás percentiles hasta llegar al percentil 𝑷𝟗𝟗 que acumula el 99% de los
datos.
Percentiles
Para el cálculo de los percentiles se usa un procedimiento similar al
empleado para los cuartiles y deciles:
1. Ordenar los datos de forma ascendente.
𝑘
2. Calcular la posición 𝒊 con la ecuación: 𝑖 = ∗𝑛 . Donde K es el
100
número del percentil (k = 1, 2, 3, 4, 5… 10, 11, 12…..98, 99) y n el
número total de datos.
3. Si 𝒊 no es un número entero, se debe redondear al entero siguiente y
el valor que ocupa esta posición será el percentil requerido. Si 𝒊 es un
número entero, el percentil es el promedio de los valores 𝒊 𝒆 𝒊+𝟏.
Percentil para datos agrupados
Para datos agrupados en intervalos se utiliza la siguiente expresión:
𝑛
𝑘 100 − 𝐹𝑖−1
𝑃𝑘 = 𝐿𝑖 + ∗𝑐
𝑓𝑖
De acuerdo a la tabla que presentan los datos ordenados de la estatura,
en centímetros, de un grupo de mujeres que asisten al gimnasio.
Calcule los Percentiles 1 – 10 - 25 – 50 -
99
Al analizar los cuartiles, deciles y percentiles se pueden deducir las
siguientes relaciones:
Q2 = D5 = P50 = Me
Q1 = P25
Q3 = P75
D1 = P10
D2 = P20
D3 = P30
D4 = P40
D6 = P60
D7 = P70
D8 = P80
D9 = P90
ACTIVIDAD DE CIERRE
Conclusiones y preguntas sobre la clase
Utilice el botón “levantar la mano”de MEET, para acceder al uso
del micrófono de forma ordenada.
ó
Realizar la pregunta por vía chat de MEET
Bibliografía
» Anderson, D. R., Sweeney, D. J., & Williams, T. A. (2008). Estadística para administración y economía.
México: Cengage Learning.
» Anderson, D. R., Sweeney, D. J., Williams, T. A., Camm, J. D., & Cochran, J. J. (2012). Estadística para
negocios y economía. México: Cengage Learning.
» Blair, R. C., & Taylor, R. A. (2008). Bioestadística. México: Pearson.
» Congacha Aushay, J. W. (2016). ESTADÍSTICA APLICADA A LA EDUCACIÓN CON ACTIVIDADES DE
APRENDIZAJE. Riobamba-Ecuador: Editorial académica española.
» Johnson, R. A. (2012). Probabilidad y estadística para ingenieros. México: Pearson Educación.
» Levin, R. I., & Rubin, D. S. (2010). ESTADÍSTICA PARA ADMINISTRACIÓN Y ECONOMÍA. México: Pearson
Educación.
» Newbold, P., Carlson, W. L., & Thorne, B. M. (2008). Estadística para Administración y Economía. Madrid:
Pearson educación.
» Pérez Borges, A. (2009). Relación fuente - recurso de información - documento. Biblios.
» Spiegel, M. R., & Stephens, L. J. (2009). ESTADÍSTICA. México: McGraw-Hill.
» Triola, M. F. (2004). Probabilidad y estadística. México: Pearson Educación