0% encontró este documento útil (0 votos)
35 vistas48 páginas

Distribuciones de Frecuencias en Datos

Este documento describe distribuciones de frecuencias y frecuencias relativas. Explica que las distribuciones de frecuencias organizan los datos en tablas con valores y sus frecuencias para facilitar el análisis. Luego, describe cómo calcular frecuencias relativas dividiendo las frecuencias absolutas por el total de datos, y que esto permite expresar los porcentajes de cada categoría. Finalmente, ilustra ejemplos de distribuciones de frecuencias y frecuencias relativas con datos sobre pasajeros del Titanic y regiones de trabajo.

Cargado por

Keyla Bautista
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
35 vistas48 páginas

Distribuciones de Frecuencias en Datos

Este documento describe distribuciones de frecuencias y frecuencias relativas. Explica que las distribuciones de frecuencias organizan los datos en tablas con valores y sus frecuencias para facilitar el análisis. Luego, describe cómo calcular frecuencias relativas dividiendo las frecuencias absolutas por el total de datos, y que esto permite expresar los porcentajes de cada categoría. Finalmente, ilustra ejemplos de distribuciones de frecuencias y frecuencias relativas con datos sobre pasajeros del Titanic y regiones de trabajo.

Cargado por

Keyla Bautista
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

Distribuciones de frecuencias

2.6 Distribuciones de frecuencias
La organización de los datos constituye la primera etapa de su tratamiento, puesto que
facilita los cálculos posteriores y evita posibles confusiones. Realmente, la organización de
la información tiene una raíz histórica y, actualmente, con el desarrollo de los medios
informáticos, tiene menos importancia desde un punto de vista aplicado. Cuando no
existían ordenadores, o ni siquiera calculadoras, si se disponía de un conjunto de datos, era
necesario dotarlos de alguna estructura que permitiera resumirlos y comprenderlos de una
forma más o menos sencilla.

La organización va a depender del número de observaciones distintas que se tengan y de las


veces que se repitan cada una de ellas. En base a lo anterior, se pueden estructurar los datos
de maneras diferentes.

Cuando se tiene un gran número de observaciones, pero muy pocas distintas, se pueden
organizar en una tabla de frecuencias, es decir, cada uno de los valores acompañado de la
frecuencia (también llamada frecuencia absoluta) con la que aparece. Este es el tipo de
tabla que acompaña a una variable discreta.

La siguiente tabla indica que los valores 1 y 3 se repiten 12 veces, el valor 5 se repite 3
veces, etc….

xix
nini
i
1 12
3 12
5 3
6 45
8 72
Este es también el formato con que suele representarse también una
variable cualitativa o categórica, como por ejemplo la distribución del color del
cabello de veinte personas:

Color del
Número de personas
pelo

Rubio 2

Moreno 6
Color del
Número de personas
pelo

Castaño 5

Verde 7

El 10 de abril de 1912, el Titanic zarpaba con 1317 pasajeros a bordo, ante la admiración de
una muchedumbre de curiosos que contemplaban atónitos como aquella mole de acero se
alejaba majestuosamente del puerto. Cinco días después los medios de comunicación de
todo el mundo se hicieron eco de la increíble noticia: el barco más grande jamás construido
yacía a casi cuatro mil metros de profundidad.

Figura 2.5: ¿Por qué no termina bien?

Esta historia la conocemos todos desde 1997 (cuando se estrenó Titanic). Desde estas
fechas (o quizá de antes) se trabaja muy a menudo con el fichero de datos que contiene la
lista de pasajeros, junto con la distribución de los mismos según edad, sexo, supervivencia
y clase social.

Este fichero lo utilizaremos en más de una ocasión a lo largo de estos apuntes. En el


siguiente trozo de código (chunk), los datos, al estar en formato excel, los leemos mediante
la libreria readxl. El comando datatable convierte la tabla en interactiva.
library(readxl)
Datos_Titanic <- read_excel("Data/[Link]")
# Interactive table
datatable(Datos_Titanic, options = list(pageLength = 5))
Show   entries
Search:
Pasajero sobrevivio sexo edad

6 Carter, Mrs. Ernest Courtenay ( no female 44 2

7 Chapman, Mrs. John Henry (Sara no female 29 2

8 Corbett, Mrs. Walter H (Irene C no female 30 2

9 Corey, Mrs. Percy C (Mary Phyll no female 2

10 Funk, Miss. Annie Clemmer no female 38 2

Showing 6 to 10 of 1,309 entries

Las distribuciones de frecuencias son tablas en que se dispone


las modalidades de la variable por filas. En las columnas se
dispone el número de ocurrencias por cada valor, porcentajes,
etc. La finalidad de las agrupaciones en frecuencias es facilitar la
obtención de la información que contienen los datos.

Ejemplo: Quieren conocer si un grupo de individuos está a


favor o en contra de la exhibición de imágenes violentas por
televisión, para lo cual han recogido los siguientes datos:

La inspección de los datos originales no permite responder


fácilmente a cuestiones como cuál es la actitud mayoritaria del
grupo, y resulta bastante más difícil determinar la magnitud de
la diferencia de actitud entre hombres y mujeres.

Podemos hacernos mejor idea si disponemos en una tabla los


valores de la variable acompañados del número de veces (la
frecuencia) que aparece cada valor:

X: Símbolo genérico de la variable.

f: Frecuencia (también se simboliza como ni).

La distribución de frecuencias de los datos del ejemplo muestra


que la actitud mayoritaria de los individuos del grupo estudiado
es indiferente.

La interpretación de los datos ha sido facilitada porque se ha


reducido el número de números a examinar (en vez de los 20
datos originales, la tabla contiene 5 valores de la variable y 5
frecuencias).

Generalmente las tablas incluyen varías columnas con las


frecuencias relativas (son el número de ocurrencias dividido por
el total de datos, y se simbolizan "fr" o "pi"), frecuencias
acumuladas (la frecuencia acumulada es el total de frecuencias
de los valores iguales o inferiores al de referencia, y se
simbolizan "fa" o "na". No obstante la frecuencia acumulada
también es definida incluyendo al valor de referencia),
frecuencias acumuladas relativas (la frecuencia acumulada
relativa es el total de frecuencias relativas de los valores iguales
o inferiores al de referencia, y se simbolizan "fr" o "pa")

Ejemplo: Consideremos el siguiente grupo de datos:


La distribución de freciemcias es:

La reducción de datos mediante el agrupamiento en frecuencias


no facilita su interpretación: La tabla es demasiado grande. Para
reducir el tamaño de la tabla agrupamos los valores en
intervalos, y las frecuencias son las de los conjuntos de valores
incluidos en los intervalos:
Ahora es más sencillo interpretar los datos. Por ejemplo,
podemos apreciar inmediatamente que el intervalo con mayor
número de datos es el 34-39, o que el 75% de los datos tiene
valor inferior a 46.

Este tipo de tabla es denominado "tabla de datos agrupados en


intervalos".

Elementos básicos de las tablas de intervalos:

 Intervalo: Cada uno de los grupos de valores de la variable


que ocupan una fila en una distribución de frecuencias
 Límites aparentes: Valores mayor y menor del intervalo
que son observados en la tabla. Dependen de la precisión
del instrumento de medida. En el ejemplo, los límites
aparentes del intervalo con mayor número de frecuencias
son 34 y 39.
 Límites exactos: Valores máximo y mínimo del intervalo
que podrían medirse si se contara con un instrumento de
precisión perfecta. En el intervalo 34-39, estos límites son
33.5 y 39.5
 Punto medio del intervalo (Mco Marca de clase): Suma de
los límites dividido por dos. Mc del intervalo del ejemplo=
36.5
 Amplitud del intervalo: Diferencia entre el límite exacto
superior y el límite exacto inferior. En el ejemplo es igual a
6.

FRECUENCIA RELATIVA
Frecuencia relativa[editar]
La frecuencia relativa es igual al número de veces que se repite un evento o sea la frecuencia
multiplicado por el 100% y dividida entre el total de la frecuencia.
Ejemplo:
Frecuencia* % = % Total de frecuencia 15* 100% = 1,500 = 90%
Es el total de la frecuencia relativa del 100% o 99% dependiendo de los decimales que uses,
si no te da tu ejercicio tiene algún error.
Una distribución de frecuencia relativa describe los porcentajes del número total de
observaciones correspondiente a cada categoría. Una distribución de frecuencia
relativa no nos indica cuál es el número de observaciones en cada categoría, sino cuál
es el porcentaje de observaciones en cada categoría. Esta información es muy valiosa.

Cuadro 4. Distribución de frecuencia relativa de matrículas primarias por género en


Balochistán.

Género Porcentaje del total matriculado (1998)


Niños 79,7 %
Niñas 20,3 %

En el Cuadro 4 se representa la distribución de frecuencias relativa correspondiente al


Cuadro 3 anterior. Las distribuciones de frecuencias pueden ser relativamente simples,
como en el Cuadro 4, pero también pueden ser más complejas y proporcionar mucha
más información, como veremos más adelante.

Hasta ahora, nuestros ejemplos se han limitado a variables discretas, que se


representan fácilmente mediante gráficos de barras. Pero los gráficos de barras no son
la mejor forma de representar variables continuas, sino que es mejor usar
distribuciones de frecuencia continuas.

Usted ya debería haber recibido una copia de la lista del curso. Usando esa lista, dibuje
una distribución de frecuencia y una distribución de frecuencia relativa de los
participantes en el curso de acuerdo a la variable “región del mundo” en la cual
trabajan (puede usar las regiones que normalmente utiliza el Banco Mundial (ver por
ejemplo Figura 5) o puede definir (claramente) las regiones que usted prefiera usar
como categorías.

Frecuencia relativa

Francisco Javier Marco Sanjuán

Lectura: 3 min

La frecuencia relativa es una medida estadística que se calcula como el


cociente de la frecuencia absoluta de algún valor de la población/muestra (fi)
entre el total de valores que componen la población/muestra (N).

Para calcular la frecuencia relativa antes es necesario calcular la frecuencia


absoluta. Sin ella no podríamos obtener la frecuencia relativa. La frecuencia
reltavia se representa con las letras hi y su fórmula de cálculo es la siguiente:

hi    = Frecuencia relativa de la observación i-ésima

fi     = Frecuencia absoluta de la observación i-ésima

N    = Número total de observaciones de la muestra

De la fórmula de cálculo de la frecuencia relativa se desprenden dos conclusiones:

 La primera es que la frecuencia relativa va a estar acotada entre 0 y 1, debido a


que la frecuencia de los valores de la muestra, siempre va a ser menor al tamaño de la
muestra.
 La segunda es que la suma de todas las frecuencias relativas va a ser 1 si se mide
en tanto por 1, o 100 si se mide en tanto por ciento.

Por consiguiente la frecuencia relativa nos informa acerca de la proporción o el


peso que tiene algún valor u observación en la muestra. Esto la hace de especial
utilidad, dado que a diferencia de la frecuencia absoluta, la frecuencia relativa nos
va a permitir hacer comparaciones entre muestras de tamaños distintos. Esta se
puede expresar como un valor decimal, como fracción o como porcentaje.

Ejemplo de frecuencia relativa (hi) para una variable


discreta
Supongamos que las notas de 20 alumnos de primer curso de economía son las
siguientes:

1,2,8,5,8,3,8,5,6,10,5,7,9,4,10,2,7,6,5,10.

Por tanto tenemos:

Xi = Variable aleatoria estadística, nota del examen de primer curso de economía.

N = 20

fi = Frecuencia relativa (número de veces que se repite el suceso, en este caso la


nota del examen).

Xi fi hi

1 1 5%

2 2 10%

3 1 5%

4 1 5%

5 4 20%

6 2 10%

7 2 10%
8 3 15%

9 1 5%

10 3 15%

∑ 20 100%

Como resultado vemos que la frecuencia relativa nos da un resultado más visual al
relativizar la variable y nos permite juzgar si 4 personas de 20 es mucho o poco.
Hay que tener en cuenta, que para una muestra de un tamaño tan pequeño, la
anterior afirmación puede parecer obvia, pero para muestras de tamaños muy
grandes, esto podría no ser tan obvio.

Ejemplo de frecuencia relativa (hi) para una variable


continua
Supongamos que la altura de 15 personas que se presentan a las oposiciones del
cuerpo de policía nacional son las siguientes:

1,82, 1,97, 1,86, 2,01, 2,05, 1,75, 1,84, 1,78, 1,91, 2,03, 1,81, 1,75, 1,77, 1,95,
1,73.

Para elaborar la tabla de frecuencias, los valores se ordenan de menor a mayor,


pero en este caso dado que la variable es continua y podría tomar cualquier valor
de un espacio continuo infinitesimal, hay que agrupar las variables por intervalos.

Por tanto tenemos:

Xi = Variable aleatoria estadística, altura de los opositores al cuerpo de policía


nacional.

N = 15

fi = Frecuencia absoluta (número de veces que se repite el suceso en este caso,


las alturas que se encuentran dentro de un determinado intervalo).

hi = Frecuencia relativa (proporción que representa el valor i-ésimo en la muestra).


Xi fi hi

[1,70 , 1,80) 5 33%

[1,80 , 1,90) 4 27%

[1,90 , 2,00) 3 20%

[2,00 , 2,10) 3 20%

∑ 15 100%

Frecuencia acumulada
Frecuencia acumulada

Francisco Javier Marco Sanjuán


Lectura: 2 min

La frecuencia acumulada es el resultado de sumar sucesivamente las


frecuencias absolutas o relativas, desde el menor al mayor de sus valores.

Para calcular la frecuencia acumulada hay que ordenar los datos de menor a
mayor. Para un cálculo más sencillo y una imagen más visual, estos se colocan en
una tabla. Tras tener los datos ordenados y tabulados, la frecuencia acumulada se
obtiene simplemente de ir sumando una clase o grupo de la muestra con la
anterior (primer grupo + segundo grupo, primer grupo + segundo grupo + tercer
grupo y así sucesivamente hasta llegar a acumular del primer grupo al último).

Tipos de frecuencias acumuladas


Existen dos tipos de frecuencia acumulada, la absoluta y la relativa:

1. Frecuencia absoluta acumulada

La frecuencia absoluta nos da información acerca de la cantidad de veces que se


repite un suceso al realizar un número determinado de experimentos aleatorios.
Para hallar la frecuencia absoluta acumulada, no tendríamos más que acumular
las frecuencias absolutas. Esta se denomina con las letras Fi.

Supongamos que las notas de 20 alumnos de primer curso de economía son las
siguientes:

1,2,8,5,8,3,8,5,6,10,5,7,9,4,10,2,7,6,5,10.

Para hallar la frecuencia absoluta acumulada, en primer lugar se ordenan los


datos de menor a mayor, se tabulan y posteriormente se acumulan.

Por tanto tenemos:

Xi = Variable aleatoria estadística, nota del examen de primer curso de economía.

N = 20

fi = Número de veces que se repite el suceso (en este caso, la nota del examen).

Xi fi Fi
1 1 1

2 2 3

3 1 4

4 1 5

5 4 9

6 2 11

7 2 13

8 3 16

9 1 17

10 3 20

∑ 20

A resaltar es que el total de acumular las frecuencias absolutas, tiene que coincidir
con el total de la muestra. Esta es una buena forma de comprobar que se ha
calculado correctamente.
2. Frecuencia relativa acumulada

La frecuencia relativa se calcula como el cociente de la frecuencia absoluta de


algún valor de la población/muestra (fi) entre el total de valores que componen la
población/muestra (N). Para hallar la frecuencia relativa acumulada, no tendríamos
más que ir acumulando las frecuencias relativas. Esta se denomina con las letras
Hi.

Supongamos que las notas de 20 alumnos de primer curso de economía son las
siguientes:

1,2,8,5,8,3,8,5,6,10,5,7,9,4,10,2,7,6,5,10.

Por tanto tenemos:

Xi = Variable aleatoria estadística, nota del examen de primer curso de economía.

N = 20

fi = Número de veces que se repite el suceso (en este caso, la nota del examen).

Hi = Proporción que representa el valor i-ésimo en la muestra.

DEFINICIÓN DE FRECUENCIA
ACUMULADA
Frecuencia es el número de veces que se reitera un suceso en un
determinado periodo de tiempo. Lo acumulado, por otra parte, es la suma,
el rejunte o la reunión de diversos elementos.
En cuanto a la idea de frecuencia acumulada,
el concepto aparece en el ámbito de
la estadística, donde se entiende la frecuencia
como la cantidad de veces que un cierto evento
se repite en una muestra o en un experimento.
Este número de repeticiones se conoce como frecuencia absoluta. Si se
divide la frecuencia absoluta por el tamaño de la muestra, obtenemos
la frecuencia relativa.
A partir de estos datos, podemos calcular dos tipos de frecuencia
acumulada: la frecuencia absoluta acumulada y la frecuencia
relativa acumulada.
La frecuencia absoluta acumulada (en ocasiones llamada simplemente
frecuencia acumulada) señala la cantidad de frecuencias absolutas para
la totalidad de los eventos que, en un listado ordenado, son menores o
idénticos que un determinado valor.
Tomemos el caso de los goles anotados por un futbolista a lo largo de cinco
años. Estos datos constituyen la muestra estadística:

14, 12, 14, 11, 15


La frecuencia absoluta de 14, por ejemplo, es 2, ya que el 14 aparece 2 veces
en la muestra. Esto quiere decir que el deportista marcó 14 goles en 2
temporadas diferentes en los últimos cinco años. El cálculo de la
frecuencia absoluta acumulada para dicho valor (14) es 4: hay 4 valores en la
muestra que son iguales o menores que 14.
Otra frecuencia acumulada que podemos calcular es la frecuencia relativa
acumulada. En este caso, tenemos que dividir la frecuencia absoluta
acumulada por el total de la muestra. Retomando el ejemplo anterior, como
la frecuencia absoluta acumulada de 14 es 4 y el total de números de la
muestra estadística es 5, la frecuencia relativa acumulada es 0,8.
Con el objetivo de formular la distribución de este concepto en una ecuación
matemática sin caer en el uso de una tabla, es posible adaptarla a lo que se
denomina distribución de probabilidad acumulativa. En los ámbitos
de la estadística y la probabilidad, se habla de distribución de
probabilidad para hacer referencia a una función que se aplica sobre una
variable y le da a los sucesos que se definen sobre ella diferentes
probabilidades de que tengan lugar.

Gracias al uso de
una ecuación matemática en lugar de una tabla también es más fácil
interpolar y extrapolar valores. Se entiende por interpolación, dentro del
análisis numérico, al proceso que da como resutado una serie de puntos a
partir de un conjunto de puntos discreto. Con respecto a la extrapolación,
por otra parte, se trata de la estimación que supera los límites de la
observación, o sea que es más incierta que la interpolación y conlleva un
mayor riesgo de fallo.
Es importante señalar que al extrapolar una distribución de frecuencia
acumulada pueden surgir errores tales como que no siga la distribución de
probabilidad una vez superado el rango observado. En este marco tenemos
diferentes métodos para llevar a cabo el mismo proceso, como ser la
distribución normal, la exponencial, la de Gumbel y la de Pareto.
Otra opción consiste en la introducción de discontinuidad entre los datos,
algo que puede ser muy beneficioso si los valores extremos y la cola de la
distribución se alejan de la masa mediana. Una de las aplicaciones de este
método se encuentra en el análisis de las precipitaciones cuando el clima
cambia de comportamiento según la influencia de las corrientes.
Dicho todo esto, queda claro que llevar a cabo una predicción basados en la
distribución de frecuencias acumuladas acarrea un cierto margen de error
que no siempre es aceptable. Para reducir al mínimo los resultados inútiles
se recomienda evitar aquellos casos en los cuales las condiciones de los
rangos de datos a comparar son muy diferentes.

MEDIDAS DE TENDENCIA CENTRAL


Medidas de tendencia central

Promedio o media
La medida de tendencia central más conocida y utilizada es la media aritmética o promedio aritmético. Se
representa por la letra griega µ cuando se trata del promedio del universo o población y por Ȳ (léase Y barra)
cuando se trata del promedio de la muestra. Es importante destacar que µ es una cantidad fija mientras que el
promedio de la muestra es variable puesto que diferentes muestras extraídas de la misma población tienden a
tener diferentes medias. La media se expresa en la misma unidad que los datos originales: centímetros, horas,
gramos, etc.

Si una muestra tiene cuatro observaciones: 3, 5, 2 y 2, por definición el estadígrafo será:

Estos cálculos se pueden simbolizar:

Donde Y1 es el valor de la variable en la primera observación, Y2 es el valor de la segunda observación y así


sucesivamente. En general, con “n” observaciones, Yi representa el valor de la i-ésima observación. En este
caso el promedio está dado por

De aquí se desprende la fórmula definitiva del promedio:

Desviaciones: Se define como la desviación de un dato a la diferencia entre el valor del dato y la media:

Ejemplo de desviaciones:

Una propiedad interesante de la media aritmética es que la suma de las desviaciones es cero.

Mediana
Otra medida de tendencia central es la mediana. La mediana es el valor de la variable que ocupa la posición
central, cuando los datos se disponen en orden de magnitud. Es decir, el 50% de las observaciones tiene
valores iguales o inferiores a la mediana y el otro 50% tiene valores iguales o superiores a la mediana.

Si el número de observaciones es par, la mediana corresponde al promedio de los dos valores centrales. Por
ejemplo, en la muestra 3, 9, 11, 15, la mediana es (9+11)/2=10.

Moda
La moda de una distribución se define como el valor de la variable que más se repite. En un polígono de
frecuencia la moda corresponde al valor de la variable que está bajo el punto más alto del gráfico. Una
muestra puede tener más de una moda.
Medidas de dispersión

Las medidas de dispersión entregan información sobre la variación de la variable. Pretenden resumir en un
solo valor la dispersión que tiene un conjunto de datos. Las medidas de dispersión más utilizadas son: Rango
de variación, Varianza, Desviación estándar, Coeficiente de variación.

Rango de variación
Se define como la diferencia entre el mayor valor de la variable y el menor valor de la variable.

La mejor medida de dispersión, y la más generalizada es la varianza, o su raíz cuadrada, la desviación


estándar. La varianza se representa con el símbolo σ² (sigma cuadrado) para el universo o población y con el
símbolo s2 (s cuadrado), cuando se trata de la muestra. La desviación estándar, que es la raíz cuadrada de la
varianza, se representa por σ (sigma) cuando pertenece al universo o población y por “s”, cuando pertenece a
la muestra. σ² y σ son parámetros, constantes para una población particular; s2 y s son estadígrafos, valores
que cambian de muestra en muestra dentro de una misma población. La varianza se expresa en unidades de
variable al cuadrado y la desviación estándar simplemente en unidades de variable.

Fórmulas
Donde µ es el promedio de la población.

Donde Ȳ es el promedio de la muestra.

Consideremos a modo de ejemplo una muestra de 4 observaciones

Según la fórmula el promedio calculado es 7, veamos ahora el cálculo de las medidas de dispersión:

s2 = 34 / 3 = 11,33 Varianza de la muestra

La desviación estándar de la muestra (s) será la raíz cuadrada de 11,33 = 3,4.

Interpretación de la varianza (válida también para la desviación estándar): un alto valor de la varianza indica
que los datos están alejados del promedio. Es difícil hacer una interpretación de la varianza teniendo un solo
valor de ella. La situación es más clara si se comparan las varianzas de dos muestras, por ejemplo varianza de
la muestra igual 18 y varianza de la muestra b igual 25. En este caso diremos que los datos de la muestra b
tienen mayor dispersión que los datos de la muestra a. esto significa que en la muestra a los datos están más
cerca del promedio y en cambio en la muestra b los datos están más alejados del promedio.

Coeficiente de variación
Es una medida de la dispersión relativa de los datos. Se define como la desviación estándar de la muestra
expresada como porcentaje de la media muestral.

Es de particular utilidad para comparar la dispersión entre variables con distintas unidades de medida. Esto
porque el coeficiente de variación, a diferencia de la desviación estándar, es independiente de la unidad de
medida de la variable de estudio.

Medidas de tendencia central y de dispersión en datos agrupados

Se identifica como datos agrupados a los datos dispuestos en una distribución de frecuencia. En tal caso las
fórmulas para el cálculo de promedio, mediana, modo, varianza y desviación estándar deben incluir una leve
modificación. A continuación se entregan los detalles para cada una de las medidas.

Promedio en datos agrupados


La fórmula es la siguiente:
Donde ni representa cada una de las frecuencias correspondientes a los diferentes valores de Yi.

Consideremos como ejemplo una distribución de frecuencia de madres que asisten a un programa de lactancia
materna, clasificadas según el número de partos. Por tratarse de una variable en escala discreta, las clases o
categorías asumen sólo ciertos valores: 1, 2, 3, 4, 5.

Entonces las 42 madres han tenido, en promedio, 2,78 partos.

Si la variable de interés es de tipo continuo será necesario determinar, para cada intervalo, un valor medio que
lo represente. Este valor se llama marca de clase (Yc) y se calcula dividiendo por 2 la suma de los límites
reales del intervalo de clase. De ahí en adelante se procede del mismo modo que en el ejercicio anterior,
reemplazando, en la formula de promedio, Yi por Yc.

Mediana en datos agrupados


Si la variable es de tipo discreto la mediana será el valor de la variable que corresponda a la frecuencia
acumulada que supere inmediatamente a n/2. En los datos de la tabla 1 Me=3, ya que 42/2 es igual a 21 y la
frecuencia acumulada que supera inmediatamente a 21 es 33, que corresponde a un valor de variable (Yi)
igual a 3.

Si la variable es de tipo continuo es necesario, primero, identificar la frecuencia acumulada que supere en
forma inmediata a n/2, y luego aplicar la siguiente fórmula:

Donde:

Moda en datos agrupados


Si la variable es de tipo discreto la moda o modo será al valor de la variable (Yi) que tenga la mayor
frecuencia absoluta ( ). En los datos de la tabla 1 el valor de la moda es 3 ya que este valor de variable
corresponde a la mayor frecuencia absoluta =16.

Más adelante se presenta un ejemplo integrado para promedio, mediana, varianza y desviación estándar en
datos agrupados con intervalos.

Varianza en datos agrupados


Para el cálculo de varianza en datos agrupados se utiliza la fórmula

Con los datos del ejemplo y recordando que el promedio (Y) resultó ser 2,78 partos por madre,

Cuando los datos están agrupados en intervalos de clase, se trabaja con la marca de clase (Yc), de tal modo
que la fórmula queda:

Donde Yc es el punto medio del intervalo y se llama marca de clase del intervalo

Yc= (Límite inferior del intervalo + limite superior del intervalo)/2.

Percentiles

Los percentiles son valores de la variable que dividen la distribución en 100 partes iguales. De este modo si el
percentil 80 (P80) es igual a 35 años de edad, significa que el 80% de los casos tiene edad igual o inferior a 35
años.

Su procedimiento de cálculo es relativamente simple en datos agrupados sin intervalos.

Retomemos el ejemplo de la variable número de partos:


El percentil j (Pj) corresponde al valor de la variable (Yi ) cuya frecuencia acumulada supera inmediatamente
al “j” % de los casos (jxn/100).

El percentil 80, en los datos de la tabla, será el valor de la variable cuyo Ni sea inmediatamente superior a
33,6 ((80x42) /100).

El primer Ni que supera a 33,6 es 39. Por lo tanto al percentil 80 le corresponde el valor 4. Se dice entonces
que el percentil 80 es 4 partos (P80=4). Este resultado significa que un 80% de las madres estudiadas han
tenido 4 partos o menos.

Si los datos están agrupados en una tabla con intervalos, el procedimiento es levemente más complejo ya que
se hace necesaria la aplicación de una fórmula.

Se aplica a los datos del intervalo cuya frecuencia acumulada ( Ni ) sea inmediatamente superior al “j” % de
los casos (jxn/100).

En la siguiente tabla se muestra la distribución de 40 familias según su ingreso mensual en miles de pesos.
Nótese que para calcular el centro de clase se usaron los límites reales de cada intervalo.

1. El ingreso mensual promedio será:

2. La mediana será:

Esto significa que un 50% de las familias tiene ingreso mensual igual o inferior a $127.270.

3. El percentil 78 será:

Por lo tanto se puede decir que 78% de las familias tienen ingreso igual o inferior a $174.660.

4. Los percentiles 10 y 90 serán:

A base de los valores de los percentiles 10 y 90 se pueden hacer tres afirmaciones:

 El 10% de las familias tiene ingreso igual o inferior a $90.000.


 El 90% de las familias tiene ingreso igual o inferior a $210.000.
 El 80% central, de las familias, tiene ingreso entre $90.000 y $210.000

5. - La varianza será:

6. La desviación estándar es la raíz cuadrada de esta cifra, es decir: 43,76.

Las medidas de tendencia central son valores que se ubican al centro de un conjunto de datos
ordenados según su magnitud. Generalmente se utilizan 4 de estos valores también conocidos
como estadigrafos, la media aritmética, la mediana, la moda y al rango medio. 

La media aritmética es la medida de posición utilizada con más frecuencia. Si se tienen n valores
de observaciones, la media aritmética es la suma de todos y caca uno de los valores dividida entre
el total de valores: Lo que indica que puede ser afectada por los valores extremos, por lo que
puede dar una imagen distorcionada de la información de los datos.
La Mediana, es el valor que ocupa la posición central en un conjunto de datos, que deben estar
ordenados, de esta manera la mitad de las observaciones es menor que la mediana y la otra mitad
es mayor que la mediana, resulta muy apropiada cuando se poseen observaciones extremas. 

La Moda es el valor de un conjunto de datos que aparece con mayor frecuencia. No depende de
valores extremos, pero es más variables que la media y la mediana.

Rango Medio es la media de las observaciones menor y mayor. como intervienen solamente estas
observaciones, si hay valores extremos, se distorsiona como medida de posición, pero 
ofrece un valor adecuado, rápido y sencillo para resumir al conjunto de datos. 

Datos Discretos

No Agrupados

Analicemos para ello las edades que utilizamos cuando se vió la organización y presentación de datos
discretos:

 
12 15 14 15 16
18 19 14 15 17
15 17 18 16 19
16 17 15 15 17
16 18 17 19 17
23 16 17 18 19
 

Estos fueron loa datos mostrados originalmente, no se han ordenado ni agrupado, determinemos ahora los
valores de la Media, la Mediana y la moda, para ello recurramos a las fórmulas de estas medidas que
resumimos en la siguiente tabla:

Medida Formula Observaciones


Media Donde xi se refiere a todo y cada
uno de los elementos de la
muestra y n es el numero total de
elementos en la muestra.
Mediana a)      p = (n/2) Es la posición en donde se
encuentra la mediana.
Si n es impar, entonces es la
opción a, en caso contrario, la b.
b)      p = (n/2) + 1
El valor de la mediana se obtiene
por observación
Moda   Se obtiene el valor por
observación
Rango Medio (Valor máximo + Valor Mínimo) / 2  

Aplicando, se obtienen los siguientes valores:

Para la media:

_     12 + 15 + 14 + 15 + 16 + 18 + 19 + 14 + 15 + 17 + 15 + 17 + 18 + 16 + 19 + 16 + 17 + 15 + 15 + 17 + 16 + 18
+ 17 + 19 + 17 + 23 + 16 + 17 + 18 + 19  
X =
------------------------------------------------------------------------------------------------------------------------------------------------
-----------------------------------------------------
                                                                                                     30
 
_         500
X = ------------ = 16.6667
             30
 
Para la mediana debera ordenarse el grupo de datos, como n = 30, utilizaremos la posición p = (30/2) = 15, el
primer valor mayor a 15 corresponde a la clase 17.
 
La moda estaría determinada por observación directa, y correspondería al valor 17, que se presenta hasta 7
veces en la muestra.

El rango medio se determina por la suma entre 23 y 12 dividido entre 2 (23 + 12)/2 = 35/2 = 17.5

Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se obtiene tuvo que
ordenar la información (así lo específica la definición), sin embargo podemos también observar que este
ordenamiento no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la
siguiente tabla:

Medida Valor Calculado Observaciones


Media 16.6667  
Mediana 17 Se requirió el cálculo de la frecuencia acumulada
Moda 17  
Rango Medio 17.5  

Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 17, no se notan
cambios en los resultados comparados con los datos originales, sin embargo las formulas si se ven
modificadas.

Agrupados

Recurramos ahora al agrupamiento de los datos discretos del ejercicio que hemos estado utilizando:
 Clase Repeticiones  Total de Años de la clase 
12 1 12
14 2 28
15 6 90
16 5 80
17 7 119
18 4 72
19 4 76
23 1 23
Total 30 500

En donde podemos observar la suma de las frecuencias y de los años multiplicados por la clase que agrupa a
los datos coinciden con los datos utilizados cuando no se agruparon en la sección anterior, utilizando ahora
las formulas de la siguiente tabla:

Medida Formula Observaciones


Media Donde xi se refiere a todo y cada uno
de los elementos de la muestra y n es
el número total de elementos en la
muestra y fi se refiere a la frecuencia
de la clase.
Es la posición en donde se encuentra
la mediana.
Se ubica en la tabla el primer valor de
Mediana p = (n/2) frecuencia acumulada mayor a la
  posición calculada, si ese valor es
  mayor, entonces la mediana es la
clase correspondiente al mismo. Si el
valor es igual a la posición, entonces
se suman el valor anterior más el
valor obtenido y se divide entre 2.
Moda   Se obtiene el valor por observación de
la mayor frecuencia
Rango (Valor máximo + Valor Mínimo) / 2  
Medio

Aplicando, se obtienen los siguientes valores:

Para la media:

_      12 * 1 + 14 * 2 + 15 * 6 + 16 * 5 + 17 * 7 + 18 * 4 + 19 * 4 + 23 * 1            12 + 28 + 90 +  80 + 119 + 72 +


76 + 23
X = -------------------------------------------------------------------------------------------- =
---------------------------------------------------------------
                                                      30                                                                                            30
 
_         500
X = ------------ = 16.6667
             30
 
Para la Mediana, utilizaremos la frecuencia acumulada:
 
 Clase Frecuencia Frecuencia Acumulada
12 1 1
14 2 3
15 6 9
16 5 14
17 7 21
18 4 27
19 4 29
23 1 30
Total 30
 
Como n = 30, utilizaremos la posición p = (30/2) = 15, el primer valor mayor a 15 corresponde a la clase 17.
 
La moda estaría determinada por observación directa, y correspondería al valor 17, que se presenta hasta 7
veces en la muestra.

El rango medio se determina por la suma entre 23 y 12 dividido entre 2 (23 + 12)/2 = 35/2 = 17.5

Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se obtiene tuvo que
ordenar la información (así lo específica la definición), sin embargo podemos también observar que este
ordenamiento no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la
siguiente tabla:

Medida Valor Calculado Observaciones


Media 16.6667  
Mediana 17 Se requirió el cálculo de la frecuencia acumulada
Moda 17  
Rango Medio 17.5  

Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 17, no se notan
cambios en los resultados comparados con los datos originales, sin embargo las formulas si se ven
modificadas.

Datos Continuos

No agrupados
Las medidas de tendencia central para datos continuos no agrupados no tienen mayor significación, ya que
el comportamiento es similar al de datos discretos no agrupados, por ello utilizaremos las mismas formúlas,
pero ahora con los datos continuos del ejercicio de la sección correspondiente:

1.25 1.2 1.28 1.29 1.2 1.24


1.27 1.21 1.32 1.27 1.18 1.29
1.2 1.23 1.25 1.28 1.24 1.28
1.27 1.25 1.24 1.25 1.27 1.28
1.29 1.18 1.21 1.24 1.2 1.23
1.25 1.27 1.28 1.24 1.29 1.21

Aplicando, se obtienen los siguientes valores:

Para la media, aplicando la formula de la media para datos no agrupados (vista en la sección de datos
discretos):

_    1.25 + 1.2 + 1.28+1.29+1.2 + 1.24 + 1.27 + 1.21 + 1.32 + 1.27 + 1.18 + 1.29 + 1.2 + 1.23 + 1.25 + 1.28 + 1.24 + 1.28 + 1.27 + 1.25 + 1.24 + 1.25 +
1.27 + 1.28 + 1.29 + 1.28 + 1.21 + 1.24 + 1.2 + 1.23 + 1.25 + 1.27 + 1.28 + 1.24 + 1.29 + 1.21
X =
------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
----------------------------------------------------------------------------------------------------------------------
                                                                                                                    30
 _         44.93
X = ------------ = 1.24805556
             30
 
Para la Mediana, como n = 36, es par, utilizaremos la posición p = (36/2) = 18
Por lo que la mediana se encontrará entre los valores que se ubiquen (de manera ordenada) entre las
posiciones 18 y 19 (observa que antes de esa posición hay 17 y después también hay 17 valores), se
encuentran 1.25 y 1.25, por lo que la mediana sería 1.25.
 
La moda estaría determinada por observación directa, y corresponderían a los valores 1.24, 1.25 y 1.27 que
se repiten en la muestra 5 veces, por lo que la característica según la moda es una muestra trimodal
(normalmente se le conoce como multimodal).

El rango medio se determina por la sumaentre 1.18 y 1.32 dividido entre 2 (1.18 + 1.32)/2 = 2.5 / 2 = 1.25

Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se tuvo que ordenar la
información (así lo específica la definición), sin embargo podemos también observar que este ordenamiento
no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la siguiente tabla:

Medida Valor Calculado Observaciones


Media 1.24805556  
Mediana 1.25 Se requirió del ordenamiento de los datos
Moda 1.24,1.25, 1.27 Muestra multimodal
Rango Medio 1.25  

Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 1.25.

Agrupados
Retomando los cálculos realizados en la sección correspondiente a organización y presentación de datos
continuos agrupados.

Clases Li Ls Mc F fa fc fr fra frc


I 1.175 1.203 1.189 6 6 30 16.67% 16.67% 83.33%
II 1.213 1.241 1.227 10 16 20 27.78% 44.44% 55.56%
III 1.251 1.279 1.265 10 26 10 27.78% 72.22% 27.78%
IV 1.289 1.317 1.303 9 35 1 25.00% 97.22% 2.78%
V 1.327 1.355 1.341 1 36 0 2.78% 100.00% 0.00%

En ella se pueden observar los límites superiores e inferiores de cada clase, lo que indica (de no conocer los
datos originales) que por ejemplo esos 6 valores de la clase pueden ubicarse en cualquier valor del rango,
pueden ser por ejemplo 1.17, 1.171, 1.20, 1.202, 1.18, 1.1901.

Es decir pueden tomar cualquier valor dentro del rango lo que dificulta tomar estos parametros como
elementos para el cálculo de las medidas de tendencia central, por ello se realizó el cálculo de la Mc (Marca
de Clase) que en otras palabras es el rango medio de cada clase, que servirá para el cálculo de la media
como lo establecemos en la siguiente tabla de cálculo para las medidas de tendencia central:

Medida Formula Observaciones


Media Donde Mc se refiere a la marca de clase
de cada clase, n es el número total de
elementos en la muestra y f i se refiere a
la frecuencia de la clase.
Es la posición en donde se encuentra la
mediana.
Mediana p = (n/2) Se ubica en la tabla el primer valor de
  frecuencia acumulada mayor a la
  posición calculada.
El valor de la mediana se calcula
tomando la formula del 5to. Decil.
Moda Donde Li es el límite inferior de la clase
que tiene la mayor frecuencia.
fm es la frecuencia  modal (aquella
donde se encuentra la
frecuencia  mayor)
f(m -1) es la frecuencia anterior a la
frecuencia modal, en caso de
encontrarse en la primera clase, este
valor es cero.
F(m+1) es la frecuencia posterior a la
frecuencia modal, en caso de
encontrarse en la última clase, este
valor es cero.
A es la amplitud de la clase modal.
Rango (Valor máximo + Valor  
Medio Mínimo) / 2

Aplicandolas para calcular la media y complementando la tabla anterior:

Clases Li Ls Mc F fa fc fr fra frc Mc * f


I 1.175 1.203 1.189 6 6 30 16.67% 16.67% 83.33% 7.134
II 1.213 1.241 1.227 10 16 20 27.78% 44.44% 55.56% 12.27
III 1.251 1.279 1.265 10 26 10 27.78% 72.22% 27.78% 12.65
IV 1.289 1.317 1.303 9 35 1 25.00% 97.22% 2.78% 11.727
V 1.327 1.355 1.341 1 36 0 2.78% 100.00% 0.00% 1.341
36 45.122

Con fundamento en la tabla podemos entonces obtener:

                   45.122
Media =  ---------------- = 1.253388889
                      36

Para el cálculo de la mediana, se utiliza la formula del 5to. Decil (puede ser el 50tavo percentil), para ello
determinamos la posición de este estadígrafo, p = (36/10)*5 = 3.6 * 5 = 18.

Con este valor recurrimos a la columna de la frecuencia acumulada y observarmos que el primer elemento
mayor al valor calculado se ubica en la clase III, aplicando la fórmula obtenemos:

                                       ((36/10)*5 – 16)                                            (18 – 16)


Mediana = 1.251 + (----------------------------) * 0.028 = 1.251 + (---------------) * 0.028
                                                  10                                                             10
 
                                         2
Mediana = 1.251 + ( ---------) * 0.028 = 1.251 + (0.2 * 0.028) = 1.251 + 0.0056 = 1.2566
                                        10

La moda se encontraría en las clases II y III, son las que mayores frecuencias manifiestan, por lo tanto
podemos definir que existen una característica de multimodalida en la muestra, calculemos la primera moda
(dejamos como actividad complementaria el cálculo de la segunda moda).

                              ( 10 – 6)                                                     4
Mo = 1.213 + ( -------------------------) 0.028 = 1.213 + (--------) * 0.028 = 1.213 + 0.028
                              (2* 10 – 6 – 10)                                         4

Mo = 1.241

El rango medio se determina por la sumaentre 1.18 y 1.32 dividido entre 2 (1.18 + 1.32)/2 = 2.5 / 2 = 1.25
Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se tuvo que ordenar la
información (así lo específica la definición), sin embargo podemos también observar que este ordenamiento
no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la siguiente tabla:

Medida Valor Calculado Observaciones


Media 1.253388889  
Mediana 1.2566 Se requirió del uso de fórmulas del 5to decil, se
pudieron usar las de 50tavo centil.
Moda 1.241 Muestra multimodal, solo se calculó la primera
moda
Rango Medio 1.25  

Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 1.25.

Construyamos una tabla comparativa de resultados de cálculo de estas medidas;

Medida No agrupados Agrupados


Media 1.24805556 1.253388889
Mediana 1.25 1.2566
Moda 1.24,1.25, 1.27 1.241
Rango Medio 1.25 1.25

Puede en esta tabla observarse una diferencia marcada en los valores obtenidos por agrupamiento y no
agrupamiento para la media, la mediana y la moda, la última, por observación en el caso de no
agrupamiento nos presenta 3 modas, mientras que en el agrupamiento, se obtienen 2 modas, la realidad es
que el agrupar datos continuos se tiene una perdida de valores por la aproximación que se tiene al calcular
por ejemplo la marca de clase como valor representativo medio de la misma.

MEDIDAS DE TENDENCIA CENTRAL


Un conjunto de datos puede conocerse numéricamente por medio de algunas medidas
que lo describen; por ejemplo, la media, la desviación estándar y otras. De esta
manera es posible comparar entre sí varios  grupos de datos.
Existen dos tipos de medidas: las conocidas como de tendencia central(o de posición)
y las de dispersión (o de variabilidad). Entre las primeras destacan la media, mediana
y moda, mientras que las medidas de dispersión más comunes son: rango, varianza y
la desviación estándar.

MEDIA ARITMÉTICA   O  PROMEDIO


Es aquella medida que se obtiene al dividir la suma de todos los valores de una
variable por la frecuencia total. En palabras más simples, corresponde a la suma de
un conjunto de datos dividida por el número total de dichos datos.

Ejemplo 1:
En matemáticas, un alumno tiene las siguientes notas: 4, 7, 7, 2, 5, 3
n = 6 (número total de datos)

La media aritmética de las notas de esa asignatura es 4,8. Este número representa
el promedio.

PROMEDIO ARMONICA (H)


De una serie de  N números X1, X2,X2,….Xn, es la recíproca de la Media aritmética de los
recíprocos de los números.

PROMEDIO PONDERADO
La media o promedio simple es la medida de tendencia central más utilizada; sin
embargo, cuando algunos de los valores por promediar son más importantes que
otros, por ejemplo, al evaluar a un empleado, su calificación en conocimientos,
puntualidad, presentación y otros conceptos tienen una importancia relativa diferente
en función de quién hace la evaluación.
Cuando los valores por promediar tienen diferentes grados de importancia entre sí,
debe utilizarse el promedio ponderado, el cual aplica un factor de ponderación (o
importancia relativa) a cada uno de los valores que se van a promediar.

 = 

 /n

MEDIA GEOMÉTRICA
Esta  es una medida que puede aplicarse al crecimiento exponencial o interés
compuesto, pues obtiene la raíz n-ésima de un grupo   de n datos multiplicados entre
sí; por ejemplo, la raíz cúbica del producto de 3 datos, o la raíz octava  del producto de
8 datos. El resultado obtenido, al elevarse a la potencia n-ésima, produce el producto
de todos los datos multiplicados entre sí.

G= 
MEDIA, MEDIANA Y MODA PARA
DATOS NO AGRUPADOS.
MODA (MO)
Es la medida que indica cual dato tiene la mayor frecuencia en un conjunto de datos;
o sea, cual se repite más.
Ejemplo 1:
Determinar la moda en el siguiente conjunto de datos que corresponden a las edades
de niñas de un Jardín Infantil.
5, 7, 3, 3, 7, 8, 3, 5, 9, 5, 3, 4, 3
La edad que más se repite es 3, por lo tanto, la Moda es 3 (Mo = 3)

MEDIANA (MED)
Para reconocer la mediana, es necesario tener ordenados los valores sea de mayor a
menor o lo contrario. Usted divide el total de casos (N) entre dos, y el valor resultante
corresponde al número del caso que representa la mediana de la distribución.
Es el valor central de un conjunto de valores ordenados en forma creciente o
decreciente. Dicho en otras palabras, la Mediana corresponde al valor que deja igual
número de valores antes y después de él en un conjunto de datos agrupados.
Según el número de valores que se tengan se pueden presentar dos casos:
Si el número de valores es impar, la Mediana corresponderá al valor central de dicho
conjunto de datos.
Si el número de valores es par, la Mediana corresponderá al promedio de los dos
valores centrales (los valores centrales se suman y se dividen por 2).
Ejemplo 1:
Se tienen los siguientes datos: 5, 4, 8, 10, 9, 1, 2
Al ordenarlos en forma creciente, es decir de menor a mayor, se tiene: 1, 2, 4, 5, 8, 9,
10
El 5 corresponde a la Med, porque es el valor central en este conjunto de datos
impares.
Ejemplo 2:
El siguiente conjunto de datos está ordenado en forma decreciente, de mayor a menor,
y corresponde a un conjunto de valores pares, por lo tanto, la Med será el promedio de
los valores centrales.
21, 19, 18, 15, 13, 11, 10, 9, 5, 3
MEDIA, MEDIANA Y MODA PARA
DATOS  AGRUPADOS.
Media: Son los mismos conceptos que cuando se aplican a datos individuales,
aunque su cálculo es más complejo y su exactitud es sólo aproximada en comparación
con el cálculo basado en datos individuales.
Media= Suma (Marca de clase * Frecuencia de cada clase)/Suma(frecuencia de cada
clase)

Media= 
Mediana: Primero se encuentra la clase mediana, la cual es la clase cuya
frecuencia acumulada es mayor o igual a n/2 y puede determinarse mediante la
siguiente fórmula:
Mediana= 

Mediana= 
CM= Clase que contiene la mediana
N= suma de frecuencias de cada clase.

Moda es la observación que ocurre con mayor frecuencia, por lo que es necesario
identificar la clase modal, esta se localiza encontrando la clase que tenga más
frecuencia.
Moda= 

Moda= Li +
MA= Clase más abundante o clase modal (fmo)

W= Frecuencia  de la clase siguiente a la MA.


Los cuantiles son medidas de posición que se determinan mediante un método que determina
la ubicación de los valores que dividen un conjunto de observaciones en partes iguales.
Los cuantiles son los valores de la distribución que la dividen en partes iguales, es decir, en
intervalos que comprenden el mismo número de valores. Cuando la distribución contiene un
número alto de intervalos o de marcas y se requiere obtener un promedio de una parte de ella,
se puede dividir la distribución en cuatro, en diez o en cien partes.
Los más usados son los cuartiles, cuando dividen la distribución en cuatro partes; los deciles,
cuando dividen la distribución en diez partes y los centiles o percentiles, cuando dividen la
distribución en cien partes. Los cuartiles, como los deciles y los percentiles, son en cierta forma
una extensión de la mediana.
Para algunos valores u , se dan nombres particulares a los cuantiles, Q (u):

u Q(u)

0.5 Mediana

0.25, 0.75 Cuartiles

0.1, ... , 0.99 Deciles

0.01, ..., 0.99 Centiles

CUARTILES
Los cuartiles son los tres valores que dividen al conjunto de datos ordenados en cuatro partes
porcentualmente iguales.
Hay tres cuartiles denotados usualmente Q1, Q2, Q3. El segundo cuartil es precisamente la
mediana. El primer cuartil, es el valor en el cual o por debajo del cual queda un cuarto (25%) de
todos los valores de la sucesión (ordenada); el tercer cuartil, es el valor en el cual o por debajo
del cual quedan las tres cuartas partes (75%) de los datos.
Datos Agrupados

Como los cuartiles adquieren su mayor importancia cuando contamos un número grande de
datos y tenemos en cuenta que en estos casos generalmente los datos son resumidos en una
tabla de frecuencia. La fórmula para el cálculo de los cuartiles cuando se trata de datos
agrupados es la siguiente:
k= 1,2,3
Donde:
Lk = Límite real inferior de la clase del cuartil k
n = Número de datos
Fk = Frecuencia acumulada de la clase que antecede a la clase del cuartil k.
fk = Frecuencia de la clase del cuartil k
c = Longitud del intervalo de la clase del cuartil k
Si se desea calcular cada cuartil individualmente, mediante otra fórmula se tiene lo siguiente:
 El primer cuartil Q1, es el menor valor que es mayor que una cuarta parte de los datos;
es decir, aquel valor de la variable que supera 25% de las observaciones y es superado por el
75% de las observaciones.
Fórmula de Q1, para series de Datos agrupados:

Donde:
L1 = limite inferior de la clase que lo contiene
P = valor que representa la posición de la medida
f1 = la frecuencia de la clase que contiene la medida solicitada.
Fa-1 = frecuencia acumulada anterior a la que contiene la medida solicitada.
Ic = intervalo de clase
 El segundo cuartil Q2, (coincide, es idéntico o similar a la mediana, Q2 = Md), es el
menor valor que es mayor que la mitad de los datos, es decir el 50% de las observaciones
son mayores que la mediana y el 50% son menores.

Fórmula de Q2, para series de Datos agrupados:

Donde:
L1 = limite inferior de la clase que lo contiene
P = valor que representa la posición de la medida
f1 = la frecuencia de la clase que contiene la medida solicitada.
Fa-1 = frecuencia acumulada anterior a la que contiene la medida solicitada.
Ic = intervalo de clase
 El tercer cuartil Q3, es el menor valor que es mayor que tres cuartas partes de los datos,
es decir aquel valor de la variable que supera al 75% y es superado por el 25% de las
observaciones.

Fórmula de Q3, para series de Datos agrupados:

Donde:
L1 = limite inferior de la clase que lo contiene
P = valor que representa la posición de la medida
f1 = la frecuencia de la clase que contiene la medida solicitada.
Fa-1 = frecuencia acumulada anterior a la que contiene la medida solicitada.
Ic = intervalo de clase.
Otra manera de verlo es partir de que todas las medidas no son sino casos particulares del
percentil, ya que el primer cuartil es el 25% percentil y el tercer cuartil 75% percentil.
Para Datos No Agrupados
Si se tienen una serie de valores X1, X2, X3 ... Xn, se localiza mediante las siguientes fórmulas:
- El primer cuartil:
Cuando n es par:

Cuando n es impar:

 Para el tercer cuartil

Cuando n es par:

Cuando n es impar:

DECILES
Los deciles son ciertos números que dividen la sucesión de datos ordenados en diez partes
porcentualmente iguales. Son los nueve valores que dividen al conjunto de datos ordenados en
diez partes iguales, son también un caso particular de los percentiles. Los deciles se denotan
D1, D2,..., D9, que se leen primer decil, segundo decil, etc.
Los deciles, al igual que los cuartiles, son ampliamente utilizados para fijar el aprovechamiento
académico.
Datos Agrupados
Para datos agrupados los deciles se calculan mediante la fórmula.

k= 1,2,3,... 9
Donde:
Lk = Límite real inferior de la clase del decil k
n = Número de datos
Fk = Frecuencia acumulada de la clase que antecede a la clase del decil k.
fk = Frecuencia de la clase del decil k
c = Longitud del intervalo de la clase del decil k
Otra fórmula para calcular los deciles:
 El cuarto decil, es aquel valor de la variable que supera al 40%, de las observaciones y
es superado por el 60% de las observaciones.

 El quinto decil corresponde a la mediana.

 El noveno decil supera al 90% y es superado por el 10% restante.

Donde (para todos):


L1 = limite inferior de la clase que lo contiene
P = valor que representa la posición de la medida
f1 = la frecuencia de la clase que contiene la medida solicitada.
Fa-1 = frecuencia acumulada anterior a la que contiene la medida solicitada.
Ic = intervalo de clase.
Fórmulas Datos No Agrupados
Si se tienen una serie de valores X1, X2, X3 ... Xn, se localiza mediante las siguientes fórmulas:

 Cuando n es par:

 Cuando n es impar:
Siendo A el número del decil.
CENTILES O PERCENTILES
Los percentiles son, tal vez, las medidas más utilizadas para propósitos de ubicación o
clasificación de las personas cuando atienden características tales como peso, estatura, etc.
Los percentiles son ciertos números que dividen la sucesión de datos ordenados en cien partes
porcentualmente iguales. Estos son los 99 valores que dividen en cien partes iguales el
conjunto de datos ordenados. Los percentiles (P1, P2,... P99), leídos primer percentil,...,
percentil 99.
Datos Agrupados
Cuando los datos están agrupados en una tabla de frecuencias, se calculan mediante la fórmula:
k= 1,2,3,... 99
Donde:
Lk = Límite real inferior de la clase del decil k
n = Número de datos
Fk = Frecuencia acumulada de la clase que antecede a la clase del decil k.
fk = Frecuencia de la clase del decil k
c = Longitud del intervalo de la clase del decil k
Otra forma para calcular los percentiles es:
 Primer percentil, que supera al uno por ciento de los valores y es superado por el
noventa y nueve por ciento restante.

 El 60 percentil, es aquel valor de la variable que supera al 60% de las observaciones y es


superado por el 40% de las observaciones.

 El percentil 99 supera 99% de los datos y es superado a su vez por el 1% restante.

Fórmulas Datos No Agrupados


Si se tienen una serie de valores X1, X2, X3 ... Xn, se localiza mediante las siguientes fórmulas:
Para los percentiles, cuando n es par:

Cuando n es impar:
Siendo A, el número del percentil.
Es fácil ver que el primer cuartil coincide con el percentil 25; el segundo cuartil con el percentil
50 y el tercer cuartil con el percentil 75.
3. EJEMPLO
Determinación del primer cuartil, el séptimo decil y el 30 percentil, de la siguiente tabla:

Salarios No. De fa

(I. De Clases) Empleados (f1)

200-299 85 85

300-299 90 175

400-499 120 295

500-599 70 365

600-699 62 427

700-800 36 463

Como son datos agrupados, se utiliza la fórmula

Siendo,

 La posición del primer cuartil.

La posición del 7 decil.

La posición del percentil 30.


Entonces,

El primer cuartil:
115.5 – 85 = 30.75
Li = 300, Ic = 100 , fi = 90
El 7 decil:

Posición:
324.1 – 295 = 29.1
Li = 500, fi = 70

El percentil 30
Posición:

138.9 – 85 = 53.9
fi = 90

Estos resultados nos indican que el 25% de los empleados ganan salarios por debajo de $ 334;
que bajo 541.57 gana el 57%de los empleados y sobre $359.88, gana el 70% de los empleados.

Medidas de dispersión
MUESTREO ALEATORIO
En ocasiones en que no es posible o conveniente realizar un censo (analizar a todos los elementos
de una población), se selecciona una muestra, entendiendo por tal una parte representativa de la
población. El muestreo es por lo tanto una herramienta de la investigación científica, cuya función
básica es determinar que parte de una población debe examinarse, con la finalidad de hacer
inferencias sobre dicha población. La muestra debe lograr una representación adecuada de la
población, en la que se reproduzca de la mejor manera los rasgos esenciales de dicha población
que son importantes para la investigación. Para que una muestra sea representativa, y por lo tanto
útil, debe de reflejar las similitudes y diferencias encontradas en la población, es decir ejemplificar
las características de ésta. Los errores más comunes que se pueden cometer son: 1.- Hacer
conclusiones muy generales a partir de la observación de sólo una parte de la Población, se
denomina error de muestreo. 2.- Hacer conclusiones hacia una Población mucho más grandes de
la que originalmente se tomo la muestra. Error de Inferencia. En la estadística se usa la palabra
población para referirse no sólo a personas si no a todos los elementos que han sido escogidos
para su estudio y el término muestra se usa para describir una porción escogida de la población.
TIPOS DE MUESTREO Existen diferentes criterios de clasificación de los diferentes tipos de
muestreo, aunque en general pueden dividirse en dos grandes grupos: métodos de muestreo
probabilísticos y métodos de muestreo no probabilísticos. I. Muestreo probabilístico Los métodos
de muestreo probabilísticos son aquellos que se basan en el principio de equiprobabilidad. Es
decir, aquellos en los que todos los individuos tienen la misma probabilidad de ser elegidos para
formar parte de una muestra y, consiguientemente, todas las posibles muestras de tamaño n
tienen la misma probabilidad de ser seleccionadas. Sólo estos métodos de muestreo
probabilísticos nos aseguran la representatividad de la muestra extraída y son, por tanto, los más
recomendables. Dentro de los métodos de muestreo probabilísticos encontramos los siguientes
tipos: 1.- Muestreo aleatorio simple: El procedimiento empleado es el siguiente: 1) se asigna un
número a cada individuo de la población y 2) a través de algún medio mecánico (bolas dentro de
una bolsa, tablas de números aleatorios, números aleatorios generados con una calculadora u
ordenador, etc.) se eligen tantos sujetos como sea necesario para completar el tamaño de
muestra requerido. Este procedimiento, atractivo por su simpleza, tiene poca o nula utilidad
práctica cuando la población que estamos manejando es muy grande. 2.- Muestreo aleatorio
sistemático: Este procedimiento exige, como el anterior, numerar todos los elementos de la
población, pero en lugar de extraer n números aleatorios sólo se extrae uno. Se parte de ese
número aleatorio i, que es un número elegido al azar, y los elementos que integran la muestra son
los que ocupa los lugares i, i+k, i+2k, i+3k,...,i+(n-1)k, es decir se toman los individuos de k en k,
siendo k el resultado de dividir el tamaño de la población entre el tamaño de la muestra: k= N/n. El
número i que empleamos como punto de partida será un número al azar entre 1 y k. El riesgo este
tipo de muestreo está en los casos en que se dan periodicidades en la población ya que al elegir a
los miembros de la muestra con una periodicidad constante (k) podemos introducir una
homogeneidad que no se da en la población. Imaginemos que estamos seleccionando una
muestra sobre listas de 10 individuos en los que los 5 primeros son varones y los 5 últimos
mujeres, si empleamos un muestreo aleatorio sistemático con k=10 siempre seleccionaríamos o
sólo hombres o sólo mujeres, no podría haber una representación de los dos sexos. 3.- Muestreo
aleatorio estratificado: Trata de obviar las dificultades que presentan los anteriores ya que
simplifican los procesos y suelen reducir el error muestral para un tamaño dado de la muestra.
Consiste en considerar categorías típicas diferentes entre sí (estratos) que poseen gran
homogeneidad respecto a alguna característica (se puede estratificar, por ejemplo, según la
profesión, el municipio de residencia, el sexo, el estado civil, etc.). Lo que se pretende con este
tipo de muestreo es asegurarse de que todos los estratos de interés estarán representados
adecuadamente en la muestra. Cada estrato funciona independientemente, pudiendo aplicarse
dentro de ellos el muestreo aleatorio simple o el estratificado para elegir los elementos concretos
que formarán parte de la muestra. En ocasiones las dificultades que plantean son demasiado
grandes, pues exige un conocimiento detallado de la población. (Tamaño geográfico, sexos,
edades,...). La distribución de la muestra en función de los diferentes estratos se denomina
afijación, y puede ser de diferentes tipos: Afijación Simple: A cada estrato le corresponde igual
número de elementos muéstrales. Afijación Proporcional: La distribución se hace de acuerdo con
el peso (tamaño) de la población en cada estrato. Afijación Optima: Se tiene en cuenta la previsible
dispersión de los resultados, de modo que se considera la proporción y la desviación típica. Tiene
poca aplicación ya que no se suele conocer la desviación. 4.- Muestreo aleatorio por
conglomerados: Los métodos presentados hasta ahora están pensados para seleccionar
directamente los elementos de la población, es decir, que las unidades muéstrales son los
elementos de la población. En el muestreo por conglomerados la unidad muestral es un grupo de
elementos de la población que forman una unidad, a la que llamamos conglomerado. Las unidades
hospitalarias, los departamentos universitarios, una caja de determinado producto, etc., son
conglomerados naturales. En otras ocasiones se pueden utilizar conglomerados no naturales
como, por ejemplo, las urnas electorales. Cuando los conglomerados son áreas geográficas suele
hablarse de "muestreo por áreas". El muestreo por conglomerados consiste en seleccionar
aleatoriamente un cierto numero de conglomerados (el necesario para alcanzar el tamaño
muestral establecido) y en investigar después todos los elementos pertenecientes a los
conglomerados elegidos.

MUESTREO NO ALEATORIO
El muestreo no probabilístico (o muestreo no aleatorio) es la técnica de
muestreo donde los elementos son elegidos a juicio del investigador. No
se conoce la probabilidad con la que se puede seleccionar a cada
individuo.
El muestreo no probabilístico se utiliza cuando es imposible o muy
difícil obtener la muestra por métodos de muestreo probabilístico.
Las muestras seleccionadas por métodos de muestreo no
aleatorios intentan ser representativas bajo los criterios del investigador,
pero en ningún caso garantizan la representatividad.
Por ejemplo, imaginemos que se quiere realizar un estudio de los
miembros de una secta secreta. De inicio, no se conoce a los miembros
de la secta, no se conoce a todos los sujetos y estos tendrán
probabilidad cero de estar en la muestra.
Tipos de muestreo no probabilístico
ANUNCIOS

1. Muestreo por cuotas: se basa en seleccionar la muestra después de


dividir la población en grupos o estratos. Los sujetos dentro de cada
grupo se eligen por métodos no probabilísticos.
2. Muestreo por conveniencia: consiste en seleccionar a los individuos
que convienen al investigador para la muestra. Esta conveniencia se
produce porque al investigador le resulta más fácil examinar a estos
sujetos, ya sea por proximidad geográfica, por ser sus amigos, etc.
3. Muestreo de bola de nieve (o muestreo por referidos): se realiza
sobre poblaciones donde no se conoce a sus individuos o es muy
difícil acceder a ellos. Se llama muestreo de bola de nieve porque cada
sujeto estudiado propone a otros, produciendo un efecto acumulativo
parecido a una bola de nieve.
4. Muestreo casual o accidental: los individuos son elegidos de manera
casual, sin ningún juicio previo. Las personas que realizan el estudio
eligen un lugar o un medio, y desde ahí realizan el estudio a los
individuos de la población que accidentalmente se encuentren a su
disposición.
5. Muestreo discrecional (o muestreo por juicio): los sujetos se
seleccionan a base del conocimiento y juicio del investigador.
Vamos a ver los tipos de muestreo no probabilístico uno a uno:

Muestreo por cuotas


El muestreo por cuotas es un método de muestreo no probabilístico.
Se basa en seleccionar la muestra después de dividir la población en
grupos o estratos.
Supongamos que tenemos una población de N individuos y que
queremos elegir una muestra de n sujetos. Tomaremos los individuos
para la muestra mediante el siguiente proceso:
1. La población se divide en k estratos o grupos, tales como la edad,
sexo, nivel educativo, etc. Supongamos que los estratos tienen N , N , 1 2

…, N  elementos, tales que:


k

2. El investigador elige las cuotas (número de sujetos) n , n ,…, n  que


1 2 k

se van a tomar de cada grupo, siendo su suma el total de


elementos n de la muestra:

Las cuotas se pueden decidir a criterio lógico del investigador o


mediante criterios adaptados a la muestra.
3. Se eligen los elementos en cada estrato o grupo por métodos no
probabilísticos. Por ejemplo, podríamos elegir los elementos de la
muestra de nuestra ciudad porque resulta más cómodo, o de un
grupo de voluntarios, etc.
Muestreo por conveniencia
El muestreo por conveniencia es un método de muestreo no
probabilístico. Consiste en seleccionar a los individuos que convienen al
investigador para la muestra. Esta conveniencia se produce porque al
investigador le resulta más sencillo examinar a estos sujetos, ya sea por
proximidad geográfica, por ser sus amigos, etc.

Muestreo de bola de nieve


El método de muestreo de bola de nieve (o muestreo por referidos) es
un método de muestreo no probabilístico. El muestreo se realiza
sobre poblaciones en las que no se conoce a sus individuos o es muy
difícil acceder a ellos. Podrían ser los casos de sectas secretas,
indigentes, grupos minoritarios, etc.
Se llama muestreo de bola de nieve porque cada sujeto estudiado
propone a otros, produciendo un efecto acumulativo parecido al de la
bola de nieve.

Muestreo casual o accidental


El muestreo casual o accidental es un método de muestreo no
probabilístico donde los individuos se eligen de manera casual, sin
ningún juicio previo. Las personas que realizan el estudio eligen un lugar
o un medio, y desde ahí realizan el estudio a los individuos de
la población que accidentalmente se encuentren a su disposición.
Muestreo discrecional
El método de muestreo discrecional (o muestreo por juicio) es un
método de muestreo no probabilístico. Los sujetos se seleccionan a base
del conocimiento y juicio del investigador.
El investigador selecciona a los individuos a través de
su criterio profesional. Puede basarse en la experiencia de otros estudios
anteriores o en su conocimiento sobre la población y el comportamiento
de ésta frente a las características que se estudian.

También podría gustarte