Distribuciones de Frecuencias en Datos
Distribuciones de Frecuencias en Datos
2.6 Distribuciones de frecuencias
La organización de los datos constituye la primera etapa de su tratamiento, puesto que
facilita los cálculos posteriores y evita posibles confusiones. Realmente, la organización de
la información tiene una raíz histórica y, actualmente, con el desarrollo de los medios
informáticos, tiene menos importancia desde un punto de vista aplicado. Cuando no
existían ordenadores, o ni siquiera calculadoras, si se disponía de un conjunto de datos, era
necesario dotarlos de alguna estructura que permitiera resumirlos y comprenderlos de una
forma más o menos sencilla.
Cuando se tiene un gran número de observaciones, pero muy pocas distintas, se pueden
organizar en una tabla de frecuencias, es decir, cada uno de los valores acompañado de la
frecuencia (también llamada frecuencia absoluta) con la que aparece. Este es el tipo de
tabla que acompaña a una variable discreta.
La siguiente tabla indica que los valores 1 y 3 se repiten 12 veces, el valor 5 se repite 3
veces, etc….
xix
nini
i
1 12
3 12
5 3
6 45
8 72
Este es también el formato con que suele representarse también una
variable cualitativa o categórica, como por ejemplo la distribución del color del
cabello de veinte personas:
Color del
Número de personas
pelo
Rubio 2
Moreno 6
Color del
Número de personas
pelo
Castaño 5
Verde 7
El 10 de abril de 1912, el Titanic zarpaba con 1317 pasajeros a bordo, ante la admiración de
una muchedumbre de curiosos que contemplaban atónitos como aquella mole de acero se
alejaba majestuosamente del puerto. Cinco días después los medios de comunicación de
todo el mundo se hicieron eco de la increíble noticia: el barco más grande jamás construido
yacía a casi cuatro mil metros de profundidad.
Esta historia la conocemos todos desde 1997 (cuando se estrenó Titanic). Desde estas
fechas (o quizá de antes) se trabaja muy a menudo con el fichero de datos que contiene la
lista de pasajeros, junto con la distribución de los mismos según edad, sexo, supervivencia
y clase social.
FRECUENCIA RELATIVA
Frecuencia relativa[editar]
La frecuencia relativa es igual al número de veces que se repite un evento o sea la frecuencia
multiplicado por el 100% y dividida entre el total de la frecuencia.
Ejemplo:
Frecuencia* % = % Total de frecuencia 15* 100% = 1,500 = 90%
Es el total de la frecuencia relativa del 100% o 99% dependiendo de los decimales que uses,
si no te da tu ejercicio tiene algún error.
Una distribución de frecuencia relativa describe los porcentajes del número total de
observaciones correspondiente a cada categoría. Una distribución de frecuencia
relativa no nos indica cuál es el número de observaciones en cada categoría, sino cuál
es el porcentaje de observaciones en cada categoría. Esta información es muy valiosa.
Usted ya debería haber recibido una copia de la lista del curso. Usando esa lista, dibuje
una distribución de frecuencia y una distribución de frecuencia relativa de los
participantes en el curso de acuerdo a la variable “región del mundo” en la cual
trabajan (puede usar las regiones que normalmente utiliza el Banco Mundial (ver por
ejemplo Figura 5) o puede definir (claramente) las regiones que usted prefiera usar
como categorías.
Frecuencia relativa
Lectura: 3 min
1,2,8,5,8,3,8,5,6,10,5,7,9,4,10,2,7,6,5,10.
N = 20
Xi fi hi
1 1 5%
2 2 10%
3 1 5%
4 1 5%
5 4 20%
6 2 10%
7 2 10%
8 3 15%
9 1 5%
10 3 15%
∑ 20 100%
Como resultado vemos que la frecuencia relativa nos da un resultado más visual al
relativizar la variable y nos permite juzgar si 4 personas de 20 es mucho o poco.
Hay que tener en cuenta, que para una muestra de un tamaño tan pequeño, la
anterior afirmación puede parecer obvia, pero para muestras de tamaños muy
grandes, esto podría no ser tan obvio.
1,82, 1,97, 1,86, 2,01, 2,05, 1,75, 1,84, 1,78, 1,91, 2,03, 1,81, 1,75, 1,77, 1,95,
1,73.
N = 15
∑ 15 100%
Frecuencia acumulada
Frecuencia acumulada
Para calcular la frecuencia acumulada hay que ordenar los datos de menor a
mayor. Para un cálculo más sencillo y una imagen más visual, estos se colocan en
una tabla. Tras tener los datos ordenados y tabulados, la frecuencia acumulada se
obtiene simplemente de ir sumando una clase o grupo de la muestra con la
anterior (primer grupo + segundo grupo, primer grupo + segundo grupo + tercer
grupo y así sucesivamente hasta llegar a acumular del primer grupo al último).
Supongamos que las notas de 20 alumnos de primer curso de economía son las
siguientes:
1,2,8,5,8,3,8,5,6,10,5,7,9,4,10,2,7,6,5,10.
N = 20
fi = Número de veces que se repite el suceso (en este caso, la nota del examen).
Xi fi Fi
1 1 1
2 2 3
3 1 4
4 1 5
5 4 9
6 2 11
7 2 13
8 3 16
9 1 17
10 3 20
∑ 20
A resaltar es que el total de acumular las frecuencias absolutas, tiene que coincidir
con el total de la muestra. Esta es una buena forma de comprobar que se ha
calculado correctamente.
2. Frecuencia relativa acumulada
Supongamos que las notas de 20 alumnos de primer curso de economía son las
siguientes:
1,2,8,5,8,3,8,5,6,10,5,7,9,4,10,2,7,6,5,10.
N = 20
fi = Número de veces que se repite el suceso (en este caso, la nota del examen).
DEFINICIÓN DE FRECUENCIA
ACUMULADA
Frecuencia es el número de veces que se reitera un suceso en un
determinado periodo de tiempo. Lo acumulado, por otra parte, es la suma,
el rejunte o la reunión de diversos elementos.
En cuanto a la idea de frecuencia acumulada,
el concepto aparece en el ámbito de
la estadística, donde se entiende la frecuencia
como la cantidad de veces que un cierto evento
se repite en una muestra o en un experimento.
Este número de repeticiones se conoce como frecuencia absoluta. Si se
divide la frecuencia absoluta por el tamaño de la muestra, obtenemos
la frecuencia relativa.
A partir de estos datos, podemos calcular dos tipos de frecuencia
acumulada: la frecuencia absoluta acumulada y la frecuencia
relativa acumulada.
La frecuencia absoluta acumulada (en ocasiones llamada simplemente
frecuencia acumulada) señala la cantidad de frecuencias absolutas para
la totalidad de los eventos que, en un listado ordenado, son menores o
idénticos que un determinado valor.
Tomemos el caso de los goles anotados por un futbolista a lo largo de cinco
años. Estos datos constituyen la muestra estadística:
Gracias al uso de
una ecuación matemática en lugar de una tabla también es más fácil
interpolar y extrapolar valores. Se entiende por interpolación, dentro del
análisis numérico, al proceso que da como resutado una serie de puntos a
partir de un conjunto de puntos discreto. Con respecto a la extrapolación,
por otra parte, se trata de la estimación que supera los límites de la
observación, o sea que es más incierta que la interpolación y conlleva un
mayor riesgo de fallo.
Es importante señalar que al extrapolar una distribución de frecuencia
acumulada pueden surgir errores tales como que no siga la distribución de
probabilidad una vez superado el rango observado. En este marco tenemos
diferentes métodos para llevar a cabo el mismo proceso, como ser la
distribución normal, la exponencial, la de Gumbel y la de Pareto.
Otra opción consiste en la introducción de discontinuidad entre los datos,
algo que puede ser muy beneficioso si los valores extremos y la cola de la
distribución se alejan de la masa mediana. Una de las aplicaciones de este
método se encuentra en el análisis de las precipitaciones cuando el clima
cambia de comportamiento según la influencia de las corrientes.
Dicho todo esto, queda claro que llevar a cabo una predicción basados en la
distribución de frecuencias acumuladas acarrea un cierto margen de error
que no siempre es aceptable. Para reducir al mínimo los resultados inútiles
se recomienda evitar aquellos casos en los cuales las condiciones de los
rangos de datos a comparar son muy diferentes.
Promedio o media
La medida de tendencia central más conocida y utilizada es la media aritmética o promedio aritmético. Se
representa por la letra griega µ cuando se trata del promedio del universo o población y por Ȳ (léase Y barra)
cuando se trata del promedio de la muestra. Es importante destacar que µ es una cantidad fija mientras que el
promedio de la muestra es variable puesto que diferentes muestras extraídas de la misma población tienden a
tener diferentes medias. La media se expresa en la misma unidad que los datos originales: centímetros, horas,
gramos, etc.
Desviaciones: Se define como la desviación de un dato a la diferencia entre el valor del dato y la media:
Ejemplo de desviaciones:
Una propiedad interesante de la media aritmética es que la suma de las desviaciones es cero.
Mediana
Otra medida de tendencia central es la mediana. La mediana es el valor de la variable que ocupa la posición
central, cuando los datos se disponen en orden de magnitud. Es decir, el 50% de las observaciones tiene
valores iguales o inferiores a la mediana y el otro 50% tiene valores iguales o superiores a la mediana.
Si el número de observaciones es par, la mediana corresponde al promedio de los dos valores centrales. Por
ejemplo, en la muestra 3, 9, 11, 15, la mediana es (9+11)/2=10.
Moda
La moda de una distribución se define como el valor de la variable que más se repite. En un polígono de
frecuencia la moda corresponde al valor de la variable que está bajo el punto más alto del gráfico. Una
muestra puede tener más de una moda.
Medidas de dispersión
Las medidas de dispersión entregan información sobre la variación de la variable. Pretenden resumir en un
solo valor la dispersión que tiene un conjunto de datos. Las medidas de dispersión más utilizadas son: Rango
de variación, Varianza, Desviación estándar, Coeficiente de variación.
Rango de variación
Se define como la diferencia entre el mayor valor de la variable y el menor valor de la variable.
Fórmulas
Donde µ es el promedio de la población.
Según la fórmula el promedio calculado es 7, veamos ahora el cálculo de las medidas de dispersión:
Interpretación de la varianza (válida también para la desviación estándar): un alto valor de la varianza indica
que los datos están alejados del promedio. Es difícil hacer una interpretación de la varianza teniendo un solo
valor de ella. La situación es más clara si se comparan las varianzas de dos muestras, por ejemplo varianza de
la muestra igual 18 y varianza de la muestra b igual 25. En este caso diremos que los datos de la muestra b
tienen mayor dispersión que los datos de la muestra a. esto significa que en la muestra a los datos están más
cerca del promedio y en cambio en la muestra b los datos están más alejados del promedio.
Coeficiente de variación
Es una medida de la dispersión relativa de los datos. Se define como la desviación estándar de la muestra
expresada como porcentaje de la media muestral.
Es de particular utilidad para comparar la dispersión entre variables con distintas unidades de medida. Esto
porque el coeficiente de variación, a diferencia de la desviación estándar, es independiente de la unidad de
medida de la variable de estudio.
Se identifica como datos agrupados a los datos dispuestos en una distribución de frecuencia. En tal caso las
fórmulas para el cálculo de promedio, mediana, modo, varianza y desviación estándar deben incluir una leve
modificación. A continuación se entregan los detalles para cada una de las medidas.
Consideremos como ejemplo una distribución de frecuencia de madres que asisten a un programa de lactancia
materna, clasificadas según el número de partos. Por tratarse de una variable en escala discreta, las clases o
categorías asumen sólo ciertos valores: 1, 2, 3, 4, 5.
Si la variable de interés es de tipo continuo será necesario determinar, para cada intervalo, un valor medio que
lo represente. Este valor se llama marca de clase (Yc) y se calcula dividiendo por 2 la suma de los límites
reales del intervalo de clase. De ahí en adelante se procede del mismo modo que en el ejercicio anterior,
reemplazando, en la formula de promedio, Yi por Yc.
Si la variable es de tipo continuo es necesario, primero, identificar la frecuencia acumulada que supere en
forma inmediata a n/2, y luego aplicar la siguiente fórmula:
Donde:
Más adelante se presenta un ejemplo integrado para promedio, mediana, varianza y desviación estándar en
datos agrupados con intervalos.
Con los datos del ejemplo y recordando que el promedio (Y) resultó ser 2,78 partos por madre,
Cuando los datos están agrupados en intervalos de clase, se trabaja con la marca de clase (Yc), de tal modo
que la fórmula queda:
Donde Yc es el punto medio del intervalo y se llama marca de clase del intervalo
Percentiles
Los percentiles son valores de la variable que dividen la distribución en 100 partes iguales. De este modo si el
percentil 80 (P80) es igual a 35 años de edad, significa que el 80% de los casos tiene edad igual o inferior a 35
años.
El percentil 80, en los datos de la tabla, será el valor de la variable cuyo Ni sea inmediatamente superior a
33,6 ((80x42) /100).
El primer Ni que supera a 33,6 es 39. Por lo tanto al percentil 80 le corresponde el valor 4. Se dice entonces
que el percentil 80 es 4 partos (P80=4). Este resultado significa que un 80% de las madres estudiadas han
tenido 4 partos o menos.
Si los datos están agrupados en una tabla con intervalos, el procedimiento es levemente más complejo ya que
se hace necesaria la aplicación de una fórmula.
Se aplica a los datos del intervalo cuya frecuencia acumulada ( Ni ) sea inmediatamente superior al “j” % de
los casos (jxn/100).
En la siguiente tabla se muestra la distribución de 40 familias según su ingreso mensual en miles de pesos.
Nótese que para calcular el centro de clase se usaron los límites reales de cada intervalo.
2. La mediana será:
Esto significa que un 50% de las familias tiene ingreso mensual igual o inferior a $127.270.
3. El percentil 78 será:
Por lo tanto se puede decir que 78% de las familias tienen ingreso igual o inferior a $174.660.
5. - La varianza será:
Las medidas de tendencia central son valores que se ubican al centro de un conjunto de datos
ordenados según su magnitud. Generalmente se utilizan 4 de estos valores también conocidos
como estadigrafos, la media aritmética, la mediana, la moda y al rango medio.
La media aritmética es la medida de posición utilizada con más frecuencia. Si se tienen n valores
de observaciones, la media aritmética es la suma de todos y caca uno de los valores dividida entre
el total de valores: Lo que indica que puede ser afectada por los valores extremos, por lo que
puede dar una imagen distorcionada de la información de los datos.
La Mediana, es el valor que ocupa la posición central en un conjunto de datos, que deben estar
ordenados, de esta manera la mitad de las observaciones es menor que la mediana y la otra mitad
es mayor que la mediana, resulta muy apropiada cuando se poseen observaciones extremas.
La Moda es el valor de un conjunto de datos que aparece con mayor frecuencia. No depende de
valores extremos, pero es más variables que la media y la mediana.
Rango Medio es la media de las observaciones menor y mayor. como intervienen solamente estas
observaciones, si hay valores extremos, se distorsiona como medida de posición, pero
ofrece un valor adecuado, rápido y sencillo para resumir al conjunto de datos.
Datos Discretos
No Agrupados
Analicemos para ello las edades que utilizamos cuando se vió la organización y presentación de datos
discretos:
12 15 14 15 16
18 19 14 15 17
15 17 18 16 19
16 17 15 15 17
16 18 17 19 17
23 16 17 18 19
Estos fueron loa datos mostrados originalmente, no se han ordenado ni agrupado, determinemos ahora los
valores de la Media, la Mediana y la moda, para ello recurramos a las fórmulas de estas medidas que
resumimos en la siguiente tabla:
Para la media:
_ 12 + 15 + 14 + 15 + 16 + 18 + 19 + 14 + 15 + 17 + 15 + 17 + 18 + 16 + 19 + 16 + 17 + 15 + 15 + 17 + 16 + 18
+ 17 + 19 + 17 + 23 + 16 + 17 + 18 + 19
X =
------------------------------------------------------------------------------------------------------------------------------------------------
-----------------------------------------------------
30
_ 500
X = ------------ = 16.6667
30
Para la mediana debera ordenarse el grupo de datos, como n = 30, utilizaremos la posición p = (30/2) = 15, el
primer valor mayor a 15 corresponde a la clase 17.
La moda estaría determinada por observación directa, y correspondería al valor 17, que se presenta hasta 7
veces en la muestra.
El rango medio se determina por la suma entre 23 y 12 dividido entre 2 (23 + 12)/2 = 35/2 = 17.5
Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se obtiene tuvo que
ordenar la información (así lo específica la definición), sin embargo podemos también observar que este
ordenamiento no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la
siguiente tabla:
Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 17, no se notan
cambios en los resultados comparados con los datos originales, sin embargo las formulas si se ven
modificadas.
Agrupados
Recurramos ahora al agrupamiento de los datos discretos del ejercicio que hemos estado utilizando:
Clase Repeticiones Total de Años de la clase
12 1 12
14 2 28
15 6 90
16 5 80
17 7 119
18 4 72
19 4 76
23 1 23
Total 30 500
En donde podemos observar la suma de las frecuencias y de los años multiplicados por la clase que agrupa a
los datos coinciden con los datos utilizados cuando no se agruparon en la sección anterior, utilizando ahora
las formulas de la siguiente tabla:
Para la media:
El rango medio se determina por la suma entre 23 y 12 dividido entre 2 (23 + 12)/2 = 35/2 = 17.5
Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se obtiene tuvo que
ordenar la información (así lo específica la definición), sin embargo podemos también observar que este
ordenamiento no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la
siguiente tabla:
Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 17, no se notan
cambios en los resultados comparados con los datos originales, sin embargo las formulas si se ven
modificadas.
Datos Continuos
No agrupados
Las medidas de tendencia central para datos continuos no agrupados no tienen mayor significación, ya que
el comportamiento es similar al de datos discretos no agrupados, por ello utilizaremos las mismas formúlas,
pero ahora con los datos continuos del ejercicio de la sección correspondiente:
Para la media, aplicando la formula de la media para datos no agrupados (vista en la sección de datos
discretos):
_ 1.25 + 1.2 + 1.28+1.29+1.2 + 1.24 + 1.27 + 1.21 + 1.32 + 1.27 + 1.18 + 1.29 + 1.2 + 1.23 + 1.25 + 1.28 + 1.24 + 1.28 + 1.27 + 1.25 + 1.24 + 1.25 +
1.27 + 1.28 + 1.29 + 1.28 + 1.21 + 1.24 + 1.2 + 1.23 + 1.25 + 1.27 + 1.28 + 1.24 + 1.29 + 1.21
X =
------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
----------------------------------------------------------------------------------------------------------------------
30
_ 44.93
X = ------------ = 1.24805556
30
Para la Mediana, como n = 36, es par, utilizaremos la posición p = (36/2) = 18
Por lo que la mediana se encontrará entre los valores que se ubiquen (de manera ordenada) entre las
posiciones 18 y 19 (observa que antes de esa posición hay 17 y después también hay 17 valores), se
encuentran 1.25 y 1.25, por lo que la mediana sería 1.25.
La moda estaría determinada por observación directa, y corresponderían a los valores 1.24, 1.25 y 1.27 que
se repiten en la muestra 5 veces, por lo que la característica según la moda es una muestra trimodal
(normalmente se le conoce como multimodal).
El rango medio se determina por la sumaentre 1.18 y 1.32 dividido entre 2 (1.18 + 1.32)/2 = 2.5 / 2 = 1.25
Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se tuvo que ordenar la
información (así lo específica la definición), sin embargo podemos también observar que este ordenamiento
no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la siguiente tabla:
Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 1.25.
Agrupados
Retomando los cálculos realizados en la sección correspondiente a organización y presentación de datos
continuos agrupados.
En ella se pueden observar los límites superiores e inferiores de cada clase, lo que indica (de no conocer los
datos originales) que por ejemplo esos 6 valores de la clase pueden ubicarse en cualquier valor del rango,
pueden ser por ejemplo 1.17, 1.171, 1.20, 1.202, 1.18, 1.1901.
Es decir pueden tomar cualquier valor dentro del rango lo que dificulta tomar estos parametros como
elementos para el cálculo de las medidas de tendencia central, por ello se realizó el cálculo de la Mc (Marca
de Clase) que en otras palabras es el rango medio de cada clase, que servirá para el cálculo de la media
como lo establecemos en la siguiente tabla de cálculo para las medidas de tendencia central:
45.122
Media = ---------------- = 1.253388889
36
Para el cálculo de la mediana, se utiliza la formula del 5to. Decil (puede ser el 50tavo percentil), para ello
determinamos la posición de este estadígrafo, p = (36/10)*5 = 3.6 * 5 = 18.
Con este valor recurrimos a la columna de la frecuencia acumulada y observarmos que el primer elemento
mayor al valor calculado se ubica en la clase III, aplicando la fórmula obtenemos:
La moda se encontraría en las clases II y III, son las que mayores frecuencias manifiestan, por lo tanto
podemos definir que existen una característica de multimodalida en la muestra, calculemos la primera moda
(dejamos como actividad complementaria el cálculo de la segunda moda).
( 10 – 6) 4
Mo = 1.213 + ( -------------------------) 0.028 = 1.213 + (--------) * 0.028 = 1.213 + 0.028
(2* 10 – 6 – 10) 4
Mo = 1.241
El rango medio se determina por la sumaentre 1.18 y 1.32 dividido entre 2 (1.18 + 1.32)/2 = 2.5 / 2 = 1.25
Si observamos los valores obtenidos veremos que solo para el cálculo de la mediana se tuvo que ordenar la
información (así lo específica la definición), sin embargo podemos también observar que este ordenamiento
no afecta de manera directa ninguno de los cálculos, de esta manera se puede construir la siguiente tabla:
Es de notar lo cercano de todos los valores que se han calculado, que circundan el valor de 1.25.
Puede en esta tabla observarse una diferencia marcada en los valores obtenidos por agrupamiento y no
agrupamiento para la media, la mediana y la moda, la última, por observación en el caso de no
agrupamiento nos presenta 3 modas, mientras que en el agrupamiento, se obtienen 2 modas, la realidad es
que el agrupar datos continuos se tiene una perdida de valores por la aproximación que se tiene al calcular
por ejemplo la marca de clase como valor representativo medio de la misma.
Ejemplo 1:
En matemáticas, un alumno tiene las siguientes notas: 4, 7, 7, 2, 5, 3
n = 6 (número total de datos)
La media aritmética de las notas de esa asignatura es 4,8. Este número representa
el promedio.
PROMEDIO PONDERADO
La media o promedio simple es la medida de tendencia central más utilizada; sin
embargo, cuando algunos de los valores por promediar son más importantes que
otros, por ejemplo, al evaluar a un empleado, su calificación en conocimientos,
puntualidad, presentación y otros conceptos tienen una importancia relativa diferente
en función de quién hace la evaluación.
Cuando los valores por promediar tienen diferentes grados de importancia entre sí,
debe utilizarse el promedio ponderado, el cual aplica un factor de ponderación (o
importancia relativa) a cada uno de los valores que se van a promediar.
=
/n
MEDIA GEOMÉTRICA
Esta es una medida que puede aplicarse al crecimiento exponencial o interés
compuesto, pues obtiene la raíz n-ésima de un grupo de n datos multiplicados entre
sí; por ejemplo, la raíz cúbica del producto de 3 datos, o la raíz octava del producto de
8 datos. El resultado obtenido, al elevarse a la potencia n-ésima, produce el producto
de todos los datos multiplicados entre sí.
G=
MEDIA, MEDIANA Y MODA PARA
DATOS NO AGRUPADOS.
MODA (MO)
Es la medida que indica cual dato tiene la mayor frecuencia en un conjunto de datos;
o sea, cual se repite más.
Ejemplo 1:
Determinar la moda en el siguiente conjunto de datos que corresponden a las edades
de niñas de un Jardín Infantil.
5, 7, 3, 3, 7, 8, 3, 5, 9, 5, 3, 4, 3
La edad que más se repite es 3, por lo tanto, la Moda es 3 (Mo = 3)
MEDIANA (MED)
Para reconocer la mediana, es necesario tener ordenados los valores sea de mayor a
menor o lo contrario. Usted divide el total de casos (N) entre dos, y el valor resultante
corresponde al número del caso que representa la mediana de la distribución.
Es el valor central de un conjunto de valores ordenados en forma creciente o
decreciente. Dicho en otras palabras, la Mediana corresponde al valor que deja igual
número de valores antes y después de él en un conjunto de datos agrupados.
Según el número de valores que se tengan se pueden presentar dos casos:
Si el número de valores es impar, la Mediana corresponderá al valor central de dicho
conjunto de datos.
Si el número de valores es par, la Mediana corresponderá al promedio de los dos
valores centrales (los valores centrales se suman y se dividen por 2).
Ejemplo 1:
Se tienen los siguientes datos: 5, 4, 8, 10, 9, 1, 2
Al ordenarlos en forma creciente, es decir de menor a mayor, se tiene: 1, 2, 4, 5, 8, 9,
10
El 5 corresponde a la Med, porque es el valor central en este conjunto de datos
impares.
Ejemplo 2:
El siguiente conjunto de datos está ordenado en forma decreciente, de mayor a menor,
y corresponde a un conjunto de valores pares, por lo tanto, la Med será el promedio de
los valores centrales.
21, 19, 18, 15, 13, 11, 10, 9, 5, 3
MEDIA, MEDIANA Y MODA PARA
DATOS AGRUPADOS.
Media: Son los mismos conceptos que cuando se aplican a datos individuales,
aunque su cálculo es más complejo y su exactitud es sólo aproximada en comparación
con el cálculo basado en datos individuales.
Media= Suma (Marca de clase * Frecuencia de cada clase)/Suma(frecuencia de cada
clase)
Media=
Mediana: Primero se encuentra la clase mediana, la cual es la clase cuya
frecuencia acumulada es mayor o igual a n/2 y puede determinarse mediante la
siguiente fórmula:
Mediana=
Mediana=
CM= Clase que contiene la mediana
N= suma de frecuencias de cada clase.
Moda es la observación que ocurre con mayor frecuencia, por lo que es necesario
identificar la clase modal, esta se localiza encontrando la clase que tenga más
frecuencia.
Moda=
Moda= Li +
MA= Clase más abundante o clase modal (fmo)
u Q(u)
0.5 Mediana
CUARTILES
Los cuartiles son los tres valores que dividen al conjunto de datos ordenados en cuatro partes
porcentualmente iguales.
Hay tres cuartiles denotados usualmente Q1, Q2, Q3. El segundo cuartil es precisamente la
mediana. El primer cuartil, es el valor en el cual o por debajo del cual queda un cuarto (25%) de
todos los valores de la sucesión (ordenada); el tercer cuartil, es el valor en el cual o por debajo
del cual quedan las tres cuartas partes (75%) de los datos.
Datos Agrupados
Como los cuartiles adquieren su mayor importancia cuando contamos un número grande de
datos y tenemos en cuenta que en estos casos generalmente los datos son resumidos en una
tabla de frecuencia. La fórmula para el cálculo de los cuartiles cuando se trata de datos
agrupados es la siguiente:
k= 1,2,3
Donde:
Lk = Límite real inferior de la clase del cuartil k
n = Número de datos
Fk = Frecuencia acumulada de la clase que antecede a la clase del cuartil k.
fk = Frecuencia de la clase del cuartil k
c = Longitud del intervalo de la clase del cuartil k
Si se desea calcular cada cuartil individualmente, mediante otra fórmula se tiene lo siguiente:
El primer cuartil Q1, es el menor valor que es mayor que una cuarta parte de los datos;
es decir, aquel valor de la variable que supera 25% de las observaciones y es superado por el
75% de las observaciones.
Fórmula de Q1, para series de Datos agrupados:
Donde:
L1 = limite inferior de la clase que lo contiene
P = valor que representa la posición de la medida
f1 = la frecuencia de la clase que contiene la medida solicitada.
Fa-1 = frecuencia acumulada anterior a la que contiene la medida solicitada.
Ic = intervalo de clase
El segundo cuartil Q2, (coincide, es idéntico o similar a la mediana, Q2 = Md), es el
menor valor que es mayor que la mitad de los datos, es decir el 50% de las observaciones
son mayores que la mediana y el 50% son menores.
Donde:
L1 = limite inferior de la clase que lo contiene
P = valor que representa la posición de la medida
f1 = la frecuencia de la clase que contiene la medida solicitada.
Fa-1 = frecuencia acumulada anterior a la que contiene la medida solicitada.
Ic = intervalo de clase
El tercer cuartil Q3, es el menor valor que es mayor que tres cuartas partes de los datos,
es decir aquel valor de la variable que supera al 75% y es superado por el 25% de las
observaciones.
Donde:
L1 = limite inferior de la clase que lo contiene
P = valor que representa la posición de la medida
f1 = la frecuencia de la clase que contiene la medida solicitada.
Fa-1 = frecuencia acumulada anterior a la que contiene la medida solicitada.
Ic = intervalo de clase.
Otra manera de verlo es partir de que todas las medidas no son sino casos particulares del
percentil, ya que el primer cuartil es el 25% percentil y el tercer cuartil 75% percentil.
Para Datos No Agrupados
Si se tienen una serie de valores X1, X2, X3 ... Xn, se localiza mediante las siguientes fórmulas:
- El primer cuartil:
Cuando n es par:
Cuando n es impar:
Cuando n es par:
Cuando n es impar:
DECILES
Los deciles son ciertos números que dividen la sucesión de datos ordenados en diez partes
porcentualmente iguales. Son los nueve valores que dividen al conjunto de datos ordenados en
diez partes iguales, son también un caso particular de los percentiles. Los deciles se denotan
D1, D2,..., D9, que se leen primer decil, segundo decil, etc.
Los deciles, al igual que los cuartiles, son ampliamente utilizados para fijar el aprovechamiento
académico.
Datos Agrupados
Para datos agrupados los deciles se calculan mediante la fórmula.
k= 1,2,3,... 9
Donde:
Lk = Límite real inferior de la clase del decil k
n = Número de datos
Fk = Frecuencia acumulada de la clase que antecede a la clase del decil k.
fk = Frecuencia de la clase del decil k
c = Longitud del intervalo de la clase del decil k
Otra fórmula para calcular los deciles:
El cuarto decil, es aquel valor de la variable que supera al 40%, de las observaciones y
es superado por el 60% de las observaciones.
Cuando n es par:
Cuando n es impar:
Siendo A el número del decil.
CENTILES O PERCENTILES
Los percentiles son, tal vez, las medidas más utilizadas para propósitos de ubicación o
clasificación de las personas cuando atienden características tales como peso, estatura, etc.
Los percentiles son ciertos números que dividen la sucesión de datos ordenados en cien partes
porcentualmente iguales. Estos son los 99 valores que dividen en cien partes iguales el
conjunto de datos ordenados. Los percentiles (P1, P2,... P99), leídos primer percentil,...,
percentil 99.
Datos Agrupados
Cuando los datos están agrupados en una tabla de frecuencias, se calculan mediante la fórmula:
k= 1,2,3,... 99
Donde:
Lk = Límite real inferior de la clase del decil k
n = Número de datos
Fk = Frecuencia acumulada de la clase que antecede a la clase del decil k.
fk = Frecuencia de la clase del decil k
c = Longitud del intervalo de la clase del decil k
Otra forma para calcular los percentiles es:
Primer percentil, que supera al uno por ciento de los valores y es superado por el
noventa y nueve por ciento restante.
Cuando n es impar:
Siendo A, el número del percentil.
Es fácil ver que el primer cuartil coincide con el percentil 25; el segundo cuartil con el percentil
50 y el tercer cuartil con el percentil 75.
3. EJEMPLO
Determinación del primer cuartil, el séptimo decil y el 30 percentil, de la siguiente tabla:
Salarios No. De fa
200-299 85 85
300-299 90 175
500-599 70 365
600-699 62 427
700-800 36 463
Siendo,
El primer cuartil:
115.5 – 85 = 30.75
Li = 300, Ic = 100 , fi = 90
El 7 decil:
Posición:
324.1 – 295 = 29.1
Li = 500, fi = 70
El percentil 30
Posición:
138.9 – 85 = 53.9
fi = 90
Estos resultados nos indican que el 25% de los empleados ganan salarios por debajo de $ 334;
que bajo 541.57 gana el 57%de los empleados y sobre $359.88, gana el 70% de los empleados.
Medidas de dispersión
MUESTREO ALEATORIO
En ocasiones en que no es posible o conveniente realizar un censo (analizar a todos los elementos
de una población), se selecciona una muestra, entendiendo por tal una parte representativa de la
población. El muestreo es por lo tanto una herramienta de la investigación científica, cuya función
básica es determinar que parte de una población debe examinarse, con la finalidad de hacer
inferencias sobre dicha población. La muestra debe lograr una representación adecuada de la
población, en la que se reproduzca de la mejor manera los rasgos esenciales de dicha población
que son importantes para la investigación. Para que una muestra sea representativa, y por lo tanto
útil, debe de reflejar las similitudes y diferencias encontradas en la población, es decir ejemplificar
las características de ésta. Los errores más comunes que se pueden cometer son: 1.- Hacer
conclusiones muy generales a partir de la observación de sólo una parte de la Población, se
denomina error de muestreo. 2.- Hacer conclusiones hacia una Población mucho más grandes de
la que originalmente se tomo la muestra. Error de Inferencia. En la estadística se usa la palabra
población para referirse no sólo a personas si no a todos los elementos que han sido escogidos
para su estudio y el término muestra se usa para describir una porción escogida de la población.
TIPOS DE MUESTREO Existen diferentes criterios de clasificación de los diferentes tipos de
muestreo, aunque en general pueden dividirse en dos grandes grupos: métodos de muestreo
probabilísticos y métodos de muestreo no probabilísticos. I. Muestreo probabilístico Los métodos
de muestreo probabilísticos son aquellos que se basan en el principio de equiprobabilidad. Es
decir, aquellos en los que todos los individuos tienen la misma probabilidad de ser elegidos para
formar parte de una muestra y, consiguientemente, todas las posibles muestras de tamaño n
tienen la misma probabilidad de ser seleccionadas. Sólo estos métodos de muestreo
probabilísticos nos aseguran la representatividad de la muestra extraída y son, por tanto, los más
recomendables. Dentro de los métodos de muestreo probabilísticos encontramos los siguientes
tipos: 1.- Muestreo aleatorio simple: El procedimiento empleado es el siguiente: 1) se asigna un
número a cada individuo de la población y 2) a través de algún medio mecánico (bolas dentro de
una bolsa, tablas de números aleatorios, números aleatorios generados con una calculadora u
ordenador, etc.) se eligen tantos sujetos como sea necesario para completar el tamaño de
muestra requerido. Este procedimiento, atractivo por su simpleza, tiene poca o nula utilidad
práctica cuando la población que estamos manejando es muy grande. 2.- Muestreo aleatorio
sistemático: Este procedimiento exige, como el anterior, numerar todos los elementos de la
población, pero en lugar de extraer n números aleatorios sólo se extrae uno. Se parte de ese
número aleatorio i, que es un número elegido al azar, y los elementos que integran la muestra son
los que ocupa los lugares i, i+k, i+2k, i+3k,...,i+(n-1)k, es decir se toman los individuos de k en k,
siendo k el resultado de dividir el tamaño de la población entre el tamaño de la muestra: k= N/n. El
número i que empleamos como punto de partida será un número al azar entre 1 y k. El riesgo este
tipo de muestreo está en los casos en que se dan periodicidades en la población ya que al elegir a
los miembros de la muestra con una periodicidad constante (k) podemos introducir una
homogeneidad que no se da en la población. Imaginemos que estamos seleccionando una
muestra sobre listas de 10 individuos en los que los 5 primeros son varones y los 5 últimos
mujeres, si empleamos un muestreo aleatorio sistemático con k=10 siempre seleccionaríamos o
sólo hombres o sólo mujeres, no podría haber una representación de los dos sexos. 3.- Muestreo
aleatorio estratificado: Trata de obviar las dificultades que presentan los anteriores ya que
simplifican los procesos y suelen reducir el error muestral para un tamaño dado de la muestra.
Consiste en considerar categorías típicas diferentes entre sí (estratos) que poseen gran
homogeneidad respecto a alguna característica (se puede estratificar, por ejemplo, según la
profesión, el municipio de residencia, el sexo, el estado civil, etc.). Lo que se pretende con este
tipo de muestreo es asegurarse de que todos los estratos de interés estarán representados
adecuadamente en la muestra. Cada estrato funciona independientemente, pudiendo aplicarse
dentro de ellos el muestreo aleatorio simple o el estratificado para elegir los elementos concretos
que formarán parte de la muestra. En ocasiones las dificultades que plantean son demasiado
grandes, pues exige un conocimiento detallado de la población. (Tamaño geográfico, sexos,
edades,...). La distribución de la muestra en función de los diferentes estratos se denomina
afijación, y puede ser de diferentes tipos: Afijación Simple: A cada estrato le corresponde igual
número de elementos muéstrales. Afijación Proporcional: La distribución se hace de acuerdo con
el peso (tamaño) de la población en cada estrato. Afijación Optima: Se tiene en cuenta la previsible
dispersión de los resultados, de modo que se considera la proporción y la desviación típica. Tiene
poca aplicación ya que no se suele conocer la desviación. 4.- Muestreo aleatorio por
conglomerados: Los métodos presentados hasta ahora están pensados para seleccionar
directamente los elementos de la población, es decir, que las unidades muéstrales son los
elementos de la población. En el muestreo por conglomerados la unidad muestral es un grupo de
elementos de la población que forman una unidad, a la que llamamos conglomerado. Las unidades
hospitalarias, los departamentos universitarios, una caja de determinado producto, etc., son
conglomerados naturales. En otras ocasiones se pueden utilizar conglomerados no naturales
como, por ejemplo, las urnas electorales. Cuando los conglomerados son áreas geográficas suele
hablarse de "muestreo por áreas". El muestreo por conglomerados consiste en seleccionar
aleatoriamente un cierto numero de conglomerados (el necesario para alcanzar el tamaño
muestral establecido) y en investigar después todos los elementos pertenecientes a los
conglomerados elegidos.
MUESTREO NO ALEATORIO
El muestreo no probabilístico (o muestreo no aleatorio) es la técnica de
muestreo donde los elementos son elegidos a juicio del investigador. No
se conoce la probabilidad con la que se puede seleccionar a cada
individuo.
El muestreo no probabilístico se utiliza cuando es imposible o muy
difícil obtener la muestra por métodos de muestreo probabilístico.
Las muestras seleccionadas por métodos de muestreo no
aleatorios intentan ser representativas bajo los criterios del investigador,
pero en ningún caso garantizan la representatividad.
Por ejemplo, imaginemos que se quiere realizar un estudio de los
miembros de una secta secreta. De inicio, no se conoce a los miembros
de la secta, no se conoce a todos los sujetos y estos tendrán
probabilidad cero de estar en la muestra.
Tipos de muestreo no probabilístico
ANUNCIOS