Histogramas, ejemplos y ejercicios
Un histograma es una representación gráfica de una variable en forma de
barras, teniendo en cuenta que la superficie de cada barra es proporcional a
la frecuencia de los valores representados. Un histograma nos permite ver
cómo se distribuyen los valores de la variable en estudio.
Usamos los histogramas cuando analizamos variables continuas, o cuando
trabajamos con variables discretas que toman un gran número de valores y
son agrupadas en intervalos. Cuando tenemos variables cualitativas, se
emplean los diagramas de barras.
¿Cómo construir un histograma?
Partimos de una tabla de frecuencias con datos agrupados, y seguimos
los siguientes pasos:
1. En el eje horizontal (X), colocamos los límites de clase.
Opcionalmente, puedes colocar las marcas de clase.
2. En el eje vertical (Y), colocamos las frecuencias. Se suele tomar la
frecuencia absoluta, pero también se puede trabajar con la
frecuencia relativa o con la frecuencia porcentual.
3. Dibujamos las barras de cada clase, teniendo en cuenta que la
altura de cada barra es igual a la frecuencia.
Ejemplo 1
Se registran los tiempos de las llamadas recibidas en un call center, y se
obtiene la siguiente tabla de frecuencias con datos agrupados. Construir un
histograma de frecuencias.
Solución:
Recuerda que, si vas a trabajar con una variable cualitativa o variable
discreta que asume pocos valores, deberás usar un diagrama de barras y
no un histograma.
Polígono de frecuencias
Es un gráfico que se forma uniendo los puntos medios de la parte
superior de las barras mediante segmentos de recta. El polígono de
frecuencias es de mucha utilidad cuando se representa más de una serie en
una misma gráfica.
Los polígonos de frecuencias se trazan tomando en cuenta las marcas de
clase de cada barra.
Ejemplo 2
A partir del histograma del ejemplo anterior, construir el polígono de
frecuencias.
Solución:
Ojiva
La ojiva es una gráfica asociada a la distribución de frecuencias acumuladas.
Nos permite ver cuántos datos u observaciones se encuentran por encima o
por debajo de determinado valor.
Las ojivas se trazan tomando en cuenta los límites superiores de cada clase
o intervalo, es decir, tomando el extremo derecho de la parte superior de
cada barra. Dibujar una ojiva es muy similar a dibujar un polígono
de frecuencias acumuladas.
Una ojiva también se puede construir con las frecuencias relativas
acumuladas o frecuencias porcentuales acumuladas.
Ejemplo 3
A partir del histograma del ejemplo anterior, construir la ojiva.
Solución:
Diferencia entre el polígono de frecuencias y ojiva
El polígono de frecuencias parte desde el histograma de frecuencias
absolutas, mientras que la ojiva parte del histograma de frecuencias
acumuladas. Además, el polígono de frecuencias se forma uniendo los puntos
medios de la parte superior de cada barra, mientras que la ojiva se forma
uniendo el extremo derecho de la parte superior de cada barra.
En el siguiente gráfico, se apreciará mejor:
Media, mediana y moda, ejemplos y ejercicios
La media es el valor que se obtiene al sumar todos los datos y dividir el
resultado entre la cantidad de datos. La mediana es el valor que ocupa la
posición central cuando todos los datos están ordenados en orden creciente o
decreciente. La moda es valor que más se repite. Veamos cada una de ellas a
detalle con ejemplos y ejercicios
Las medidas de tendencia central, como la media, mediana y moda, son
medidas que tratan de ubicar la parte central de un conjunto de datos.
Media (media aritmética)
La media es el valor que se obtiene al sumar todos los datos y dividir el
resultado entre la cantidad de datos.
Su fórmula es la siguiente:
Aunque la fórmula parezca complicada,
calcular el valor de la media es muy sencillo.
Ejemplo 1
Calcular la media de los siguientes datos: 11, 6, 7, 7, 4.
Ejemplo 2
Las edades de 8 niños que van a una fiesta son: 2, 2, 3, 5, 7, 7, 9, 10. Hallar la
edad media:
Ejemplo 3
En un examen calificado del 0 al 10, 3 personas obtuvieron 5 de nota, 5
personas obtuvieron 4 de nota, y 2 personas obtuvieron 3 de nota. Calcular la
nota media:
Mediana
La mediana es el valor que ocupa la posición central cuando todos los datos
están ordenados en orden creciente o decreciente.
La mediana se representa con las letras: Me.
Ejemplo 4
Calcular la mediana de los siguientes datos: 11, 6, 7, 7, 4.
Solución:
Ordenamos los datos de menor a mayor: 4, 6, 7, 7, 11.
Ahora tomamos el dato que se encuentra al centro: 4, 6, 7, 7, 11.
El valor de la mediana es: Me = 7.
¿Y si la cantidad de datos es un número par?
En ese caso, la mediana es la media entre los dos valores centrales.
Ejemplo 5
Calcular la mediana de los siguientes datos: 3, 6, 7, 9, 4, 4.
Solución:
Primero ordenamos los datos de menor a mayor: 3, 4, 4, 6, 7, 9.
La cantidad de datos es 6, es decir, un número par, así que vamos a ubicar los
2 valores centrales: 3, 4, 4, 6, 7, 9.
Entonces, la moda sería la media entre 4 y 6:
Ejemplo 6
En un examen calificado del 0 al 10, 3 personas obtuvieron 5 de nota, 5
personas obtuvieron 4 de nota, y 2 personas obtuvieron 3 de nota. Calcular la
mediana.
Solución:
Primero hacemos una lista de las notas obtenidas: 5, 5, 5, 4, 4, 4, 4, 4, 3, 3.
Ahora ordenamos los datos de menor a mayor: 3, 3, 4, 4, 4, 4, 4, 5, 5, 5.
Como el número de datos es par (10), entonces nos enfocamos en los 2
valores centrales: 3, 3, 4, 4, 4, 4, 4, 5, 5, 5.
Finalmente, encontramos la media de estos 2 valores centrales:
Si al momento de calcular la mediana, ordenas los datos en forma decreciente
o descendente, obtendrás el mismo resultado que al hacerlo de forma
creciente o ascendente.
Moda
La moda es el valor que más se repite. También podemos decir que la
moda es el valor con mayor frecuencia absoluta o el valor que ocurre con más
frecuencia.
La moda se representa con las letras: Mo.
Ejemplo 7
Calcular la moda de los siguientes datos: 11, 6, 7, 7, 4.
Podemos ver que el valor que más se repite es el 7, ya que tiene una
frecuencia absoluta de 2, por lo tanto, Mo = 7.
Ejemplo 8
En un examen calificado del 0 al 10, 3 personas obtuvieron 5 de nota, 5
personas obtuvieron 4 de nota, y 2 personas obtuvieron 3 de nota. Calcular la
moda.
Solución:
Los datos son los siguientes: 5, 5, 5, 4, 4, 4, 4, 4, 3, 3.
El valor que más se repite es el 4, que aparece 5 veces, por lo tanto, Mo = 4.
¿Y si hay varias modas?
Si en un grupo de datos, dos o más valores tienen la misma frecuencia, y es la
frecuencia máxima, entonces la distribución tiene dos o más modas y
decimos que es bimodal (2 modas), o multimodal (varias modas).
Ejemplo 9
Calcular la moda de los siguientes datos: 3, 4, 4, 6, 7, 7, 9, 11.
Solución:
Como vemos, hay 2 valores que se repiten 2 veces, el 4 y el 7, por lo tanto,
los valores de la moda son Mo = 4; 7.
¿Y si todos los valores tienen la misma frecuencia?
Si todos los valores tienen la misma frecuencia, entonces, no hay moda.
Ejemplo 10
Encontrar la moda de los siguientes datos: 3, 3, 5, 5, 6, 6, 7, 7. Todos los
valores tienen una frecuencia de 2, por lo tanto, no hay moda.
Media, mediana y moda para tablas sin intervalos
La media es el valor que se obtiene al sumar todos los datos multiplicados
por su frecuencia y dividir el resultado entre la cantidad de datos.
La mediana es el valor que ocupa la posición central si n es impar, y es el
promedio de los dos datos centrales si n es par, cuando todos los datos están
ordenados. La moda es valor con mayor frecuencia absoluta. Cuando
buscamos encontrar la media, mediana y moda para datos agrupados sin
intervalos o agrupados puntualmente, necesitamos realizar algunos pasos
adicionales y conocer un par de fórmulas. Veamos cómo hacerlo.
Media
La media es el valor que se obtiene al sumar todos los datos multiplicados
por su frecuencia y dividir el resultado entre la cantidad de datos. Usamos la
siguiente fórmula:
Ejemplo 1:
Calcular la media de la siguiente distribución:
Solución:
Para calcula la media, vamos a agregar una columna adicional, en la
que multiplicaremos el valor de la variable (x) por la frecuencia
absoluta (f).
Recordamos la fórmula:
Mediana
La mediana es el valor que ocupa la posición central si n es impar, y es el
promedio de los dos datos centrales si n es par, cuando todos los datos están
ordenados.
Una manera rápida de encontrar la mediana, es encontrar el dato que ocupa
la siguiente posición:
Y luego, ubicar dicho valor (x) a partir de la columna de frecuencias
acumuladas.
Ejemplo 2 (n impar):
Calcular la mediana de la siguiente distribución:
Encontramos la posición del valor que está ubicado al centro:
Ahora, buscamos la posición 17 en la columna de frecuencias acumuladas:
El valor (x) que ocupa dicha posición es 4, por lo tanto, Me = 4.
Ejemplo 3 (n par):
Calcular la mediana de la siguiente distribución:
Encontramos la posición del valor que está ubicado al centro:
Como nos ha quedado un valor con decimales, significa que la mediana será
la media aritmética del valor que ocupa la posición 17, con el valor que ocupa
la posición 18.
Buscamos los valores de posición 17 y 18 en la tabla de frecuencias
acumuladas:
La posición 17, pertenece al valor x = 4, y la posición 18 también pertenece al
mismo valor. Por lo tanto:
Ejemplo 4 (n par):
Calcular la mediana de la siguiente distribución:
Encontramos la posición del valor que está ubicado al centro:
Como nos ha quedado un valor con decimales, significa que la mediana será
la media aritmética del valor que ocupa la posición 29, con el valor que ocupa
la posición 30. Buscamos los valores de posición 29 y 30 en la tabla de
frecuencias acumuladas:
El valor que ocupa la posición 29, es x = 4; mientras que el valor que ocupa la
posición 30, es x = 5. Por lo tanto, la mediana sería:
Moda
La moda es el valor con mayor frecuencia absoluta.
Ejemplo 5:
Encontrar la moda de la siguiente distribución:
La moda es el valor con mayor frecuencia absoluta, así que ubicamos el
mayor valor de frecuencia absoluta con su correspondiente valor de la
variable x:
El valor con mayor frecuencia absoluta, es el 4, por lo tanto: Mo = 4.
Media, mediana y moda para datos agrupados en intervalos
Calcular la media, mediana y moda cuando trabajamos con datos agrupados
en intervalos o tablas de frecuencias con intervalos es muy sencillo, y solo se
necesitan algunas fórmulas.
Media
La media se calcula usando la siguiente fórmula:
Ejemplo 1
Determina la media de la siguiente distribución:
Dado que tenemos 5 intervalos, la media la calculamos usando la fórmula:
En la tabla, agregamos una columna donde colocaremos todos los valores
de x.f :
Calculamos los valores de x.f :
Finalmente, calculamos el valor de la media, dividiendo la suma de valores de
la columna x.f entre n.
El valor de la media sería 9,810.
Mediana
Para estimar la mediana, hay que seguir 2 pasos:
Encontrar el intervalo en el que se encuentra la mediana usando
la fórmula:
Usar la fórmula de la mediana:
Donde:
Li: límite inferior del intervalo en el cual se encuentra la
mediana.
n: número de datos del estudio. Es la sumatoria de las
frecuencias absolutas.
Fi-1: frecuencia acumulada del intervalo anterior al que se
encuentra la mediana.
Ai: amplitud del intervalo en el que se encuentra la
mediana.
fi: frecuencia absoluta del intervalo en el que se encuentra
la mediana.
Ejemplo 2
Encontrar la mediana de la siguiente distribución:
Para estimar el valor de la mediana, seguimos los 2 pasos.
Primero encontramos el intervalo en el cual se encuentra la mediana usando
la fórmula:
Este valor, lo buscamos en la columna de frecuencias acumuladas. Si no
aparece, buscamos el valor que sigue. Como vemos, después del 11 sigue el
14, por lo tanto, la mediana se ubica en el intervalo 3.
Ahora, aplicamos la fórmula de la mediana:
El valor de la mediana, sería: Me = 9,667.
Moda
Para estimar la moda, se siguen los siguientes pasos:
Encontrar el intervalo en el cual se encuentra la moda, que es el
intervalo con mayor frecuencia absoluta.
Usar la siguiente fórmula para estimar el valor de la moda:
Donde:
Li: límite inferior del intervalo en el cual se encuentra la
moda.
fi-1: frecuencia absoluta del intervalo anterior en el que se
encuentra la moda.
fi: frecuencia absoluta del intervalo en el que se encuentra
la moda.
fi+1: frecuencia absoluta del intervalo siguiente en el que
se encuentra la moda.
Ai: amplitud del intervalo en el que se encuentra la moda.
Ejemplo 3
Encontrar la moda de la siguiente distribución:
Primero, encontramos el intervalo en el cual se encuentra la moda, es decir, el
intervalo con mayor frecuencia absoluta. El intervalo 3, tiene la mayor
frecuencia absoluta (6), por lo tanto, aquí se encontrará la moda.
Ahora, aplicamos la fórmula para estimar la moda:
Por lo tanto, el valor de la moda sería: Mo = 9,333.
Medidas de dispersión o variabilidad
Las medidas de dispersión son medidas estadísticas que muestran la
variabilidad en la distribución de los datos. Las medidas de tendencia
central, como la media, la mediana y la moda, solo describen el centro de los
datos, pero no nos dicen nada acerca de la dispersión (separación) de los
datos. Y en ocasiones, es muy importante conocer que tan dispersos o
separados se encuentran los datos, y esto se consigue con las medidas de
dispersión o variabilidad.
Veamos los siguientes ejemplos.
Ejemplo 1:
Si tu estatura es de 1,80 metros y un guía de turismo te dice que el río que
estás a punto de cruzar a pie tiene una profundidad promedio de 1,50 metros,
¿lo cruzarías a pie? Antes de tomar una decisión, sería mejor saber cuál es la
profundidad máxima y cuál es la mínima. Si el guía te dice que la profundidad
mínima es de 1,40 metros y máxima es de 1,60 metros, seguramente te
animarás a cruzar el río a pie.
Pero, ¿qué pasaría si el guía te dice que la profundidad mínima es de 0,50
metros y la máxima es de 2,50 metros? ¿te animarías aún a cruzar el río?
Probablemente no. En este caso, no es suficiente con conocer el promedio, si
no también, el valor máximo y el mínimo.
Ejemplo 2:
Hace un tiempo, iba a comprar 10 000 frascos de perfumes para revenderlos
a un mejor precio a mis amigos. El vendedor me dijo que, en promedio, los
frascos traían 100 mililitros. Pero yo como yo sabía algo de estadística, decidí
realizar un muestreo de 15 frascos, y estos fueron los resultados que obtuve:
En el muestreo, efectivamente la media fue de 100 ml, pero hubo perfumes
con 88 ml, con 106 ml y con 112 ml. La dispersión de los datos obtenidos era
muy alta, iba a tener muchos problemas y quejas con mis amigos. Lo ideal
hubiera sido que todos los perfumes traigan 100 ml, o al menos volúmenes
muy cercanos a este valor, sin tanta dispersión o separación entre los valores,
es decir, que los valores se encuentren estrechamente agrupados.
Felizmente que eran perfumes, porque si eran medicinas y salían al mercado,
algunos pacientes hubieran recibido una dosis menor y otros una sobredosis.
Es por ello que son tan importantes las medidas de dispersión o variabilidad,
pues estas nos indican que tan dispersos o separados se encuentran
los datos.
Medidas de dispersión
Las medidas de dispersión son medidas estadísticas que muestran la
variabilidad en la distribución de los datos.
Los valores de las medidas de dispersión, nos permiten saber si los datos se
encuentran estrechamente agrupados, si se encuentran ampliamente
dispersos o si son iguales.
En la siguiente gráfica se muestran gráficas de tres muestras con diferente
dispersión en torno al centro. La primera tiene una medida más grande de
dispersión, la tercera tiene la cantidad más pequeña, mientras que la segunda
es intermedia con respecto a las otras dos.
En nuestro curso de estadística, estudiaremos las siguientes medidas de
dispersión:
Rango, amplitud o recorrido
El rango es la diferencia entre el valor máximo y mínimo de un conjunto de
datos. Es la medida de dispersión o variabilidad más sencilla de calcular y
tiene las mismas unidades que los datos. También es llamado amplitud o
recorrido.
La fórmula del rango es la siguiente:
Rango = valor máximo – valor mínimo
Ejemplo 1:
Dado el conjunto de datos, 1, 3, 5 y 7, encontrar el rango.
Solución:
De los datos, 1, 3, 5 y 7, el valor menor es el 1, y el valor mayor es el 7, por
lo tanto, aplicamos la fórmula:
Rango = valor máximo – valor mínimo
Rango = 7 – 1
Rango = 6
Ejemplo 2:
Las ganancias de la primera mitad del año pasado de una empresa que vende
ositos de peluche en lata, son las siguientes:
Enero Febrero Marzo Abril Mayo Junio
Ganancias $ 16 800 $ 34 500 $ 17 300 $ 12 500 $ 14 000 $ 18 600
Calcular el rango.
Solución:
Rango = valor máximo – valor mínimo
Rango = $ 34 500 – $ 12 500
Rango = $ 22 000
Características del rango
1. Tiene la misma unidad de medida que las observaciones.
2. Se utiliza para tener una idea rápida del grado de dispersión de un
conjunto de datos.
3. Es poco confiable.
4. El rango muestral es muy inestable.
5. El valor del rango no varía cuando se suma una constante K a
cada observación de un conjunto de datos.
6. El valor del rango si varía cuando se multiplica por constante K a
cada observación de un conjunto de datos.
Varianza y desviación estándar, ejemplos y ejercicios
La varianza y la desviación estándar son medidas de dispersión o variabilidad,
es decir, indican la dispersión o separación de un conjunto de datos. Hay que
tener en cuenta que las fórmulas de la varianza y la desviación estándar son
diferentes para una muestra que para una población.
A continuación, presentamos el resumen de fórmulas, las cuales analizaremos
líneas abajo:
Varianza de la población (σ2) (sigma al cuadrado)
La varianza se define como la media aritmética de los cuadrados de las
diferencias de los datos con su media aritmética.
Desviación estándar de la población (σ)
La desviación estándar es la raíz cuadrada positiva de la varianza.
Te recomendamos calcular primero la varianza de la población y luego sacar
su raíz cuadrada para obtener la desviación estándar.
Ten en cuenta que, si tienes una serie de valores de una población y necesitas
calcular su varianza y su desviación estándar, deberás calcular primero la
media poblacional µ con la siguiente fórmula:
Varianza de la muestra (s2)
La fórmula de la varianza de la muestra es diferente a la de varianza de la
población.
Desviación estándar de la muestra (s)
Recuerda que la desviación estándar es la raíz cuadrada positiva de la
varianza.
Te recomendamos calcular primero la varianza de la muestra y luego sacar su
raíz cuadrada para obtener la desviación estándar.
Ten en cuenta que, si tienes una serie de valores de una muestra y necesitas
calcular su varianza y su desviación estándar, deberás calcular primero la
media poblacional x̄ con la siguiente fórmula:
En los ejercicios, se siguen los siguientes pasos:
1. Se calcula la media.
2. Se calcula la varianza.
3. Se calcula la desviación estándar, que es la raíz cuadrada positiva
de la varianza.
Ejemplo 1:
Calcular la varianza y la desviación estándar de los siguientes datos: 2, 4, 6 y
8 sabiendo que corresponden a una población.
Solución:
Nos indican que estos datos forman una población, por lo tanto, usaremos las
fórmulas de varianza y desviación estándar para la población, teniendo en
cuenta que tenemos 4 datos, es decir, N = 4.
Empezamos calculando la media poblacional:
Ahora calculamos la varianza poblacional:
El valor de la varianza poblacional, es de 5.
Ahora calculamos la desviación estándar, teniendo en cuenta que es la raíz
cuadrada de la varianza.
Ejemplo 2:
Calcular la varianza y la desviación estándar de los siguientes datos: 1, 3, 5, 7
y 9 sabiendo que corresponden a una muestra
Solución:
Nos indican que estos datos forman una muestra, por lo tanto, usaremos las
fórmulas de varianza y desviación estándar para la muestra, teniendo en
cuenta que tenemos 5 datos, es decir, n = 5.
Empezamos calculando la media de la muestra:
Ahora calculamos la varianza de la muestra:
El valor de la varianza poblacional, es de 10.
Ahora calculamos la desviación estándar, teniendo en cuenta que es la raíz
cuadrada de la varianza.
Ejemplo 3:
Calcular la varianza y la desviación estándar de los siguientes datos: 10, 12,
13, 16, 9, 8, 12, 8, 6, 16 sabiendo que corresponden a una población.
Solución:
Empezaremos calculando la media y la varianza usando las fórmulas de la
población.
En este caso, como tenemos muchos datos, recurriremos a una tabla para
mantener el orden. Colocaremos los valores de los elementos de la población
(xi) y sumaremos los valores.
Teniendo en cuenta que tenemos 10 datos (N = 10), calculamos la media:
Con el valor de la media, vamos en busca de la varianza poblacional:
Agregamos 2 columnas más a nuestra tabla para llegar a la forma de la
varianza:
Reemplazamos los valores en la fórmula:
La varianza tiene un valor de 10,4.
Finalmente calculamos la desviación estándar:
La desviación estándar tiene un valor de 3,225.
Como calcular la varianza y la desviación estándar con fórmulas
rápidas
En la clase anterior revisamos las fórmulas básicas de varianza y desviación
estándar. Ahora veremos algunas fórmulas rápidas que nos permiten calcular
el valor de estas medidas de dispersión.
Veamos los ejemplos y ejercicios que hemos preparado.
Fórmulas rápidas de la varianza y la desviación estándar
En los ejercicios, seguiremos los siguientes pasos:
1. Calculamos la media.
2. Calculamos la varianza.
3. Calculamos la desviación estándar, que es la raíz cuadrada
positiva de la varianza.
Ahora veamos algunos ejemplos.
Ejemplo 1:
Si el conjunto de datos formado por 1, 3, 5 y 7 corresponde a una muestra,
calcular la varianza y desviación estándar.
Solución:
Dado que estos datos corresponden a una muestra, usaremos las fórmulas de
la muestra, empezando por la media:
Ahora calculamos la varianza de la muestra:
Finalmente, calculamos el valor de la desviación estándar de la muestra:
Ejemplo 2:
Si el conjunto de datos formado por 12, 6, 7, 10, 11, 12, 6, 11, 14 y 11
corresponde a una población, calcular la varianza y la desviación estándar.
Solución:
Dado que estos datos corresponden a una población, usaremos las fórmulas
de la población, empezando por la media:
Al ser muchos datos, usaremos una tabla para mantener el orden:
Calculamos la media, teniendo en cuenta que tenemos una población formada
por 10 elementos (N = 10).
Viene la fórmula de la varianza:
Para obtener este valor, agregamos una columna más a la tabla.
Reemplazamos en la fórmula:
El valor de la varianza poblacional es de 3,8.
Finalmente, calculamos el valor de la desviación estándar, teniendo en cuenta
que es la raíz cuadrada positiva de la varianza.
El valor de la desviación estándar poblacional es de 1,949.
Varianza y desviación estándar de datos agrupados de
variable discreta
Si trabajamos con una tabla de frecuencias con datos agrupados de una
variable discreta, es decir, la variable toma valores puntuales, no intervalos
de valores, podemos calcular la varianza y la desviación estándar usando las
fórmulas que veremos en esta clase.
Veamos los ejemplos y ejercicios que hemos preparado.
Fórmulas para la varianza y desviación estándar de datos agrupados
Donde:
fi: frecuencia absoluta de cada valor, es decir, número de
veces que aparece el valor en el estudio.
xi: valor de los elementos de la población.
σ2: varianza de la población.
σ: desviación estándar de la población.
μ: media poblacional.
s2: varianza de la muestra.
s: desviación estándar de la muestra.
x̄ : media de la muestra.
k: número de clases.
Tenemos siempre que fijarnos si estamos trabajando con datos que forman
una población o con datos que forman una muestra, pues las fórmulas son
diferentes.
Podemos ver también que la fórmula de la varianza se presenta de 2 formas
diferentes, puedes tomar cualquiera de ellas, obtendrás el mismo resultado.
En los problemas, seguiremos los siguientes pasos:
1. Calculamos el número de elementos.
2. Calculamos la media.
3. Calculamos la varianza.
4. Calculamos la desviación estándar, que es la raíz cuadrada de la
varianza.
Ejemplo 1:
Calcular la varianza y la desviación estándar de las edades de una población
de niños que asisten a una fiesta infantil.
Solución:
Para calcular la varianza y la desviación estándar, empezamos calculando el
número de elementos de la población:
En la tabla, sumamos las frecuencias fi:
Y así obtenemos el número de elementos de la población (N).
A continuación, calculamos la media poblacional partiendo de su fórmula:
En la tabla de frecuencias agregamos la columna xi · fi
Ahora sí, calculamos la media poblacional:
A continuación, recordamos la fórmula de la varianza de la población:
En la tabla, agregamos 3 columnas más, para buscar la expresión de la
fórmula:
Usamos la fórmula:
El valor de la varianza de esta población es de 1,8 (años) 2. Ten en cuenta que
la varianza queda expresada en las unidades originales elevadas al cuadrado,
por ello, nos quedaría en (años)2.
Finalmente calculamos la desviación estándar, teniendo en cuenta que es la
raíz cuadrada positiva de la varianza:
El valor de la desviación estándar poblacional es de 1,34 años.
Varianza y desviación estándar para datos agrupados por intervalos
Si necesitamos calcular la varianza y la desviación estándar de un conjunto de
datos agrupados por intervalos en una tabla de frecuencias, usaremos las
fórmulas que revisaremos en esta clase.
Ejemplos y ejercicios.
Fórmulas para la varianza y desviación estándar de datos agrupados
Donde:
k: número de clases.
fi: frecuencia absoluta de cada clase, es decir, el número de
elementos que pertenecen a dicha clase.
xi: marca de clase. Es el punto medio del límite inferior y del límite
superior.
σ2: varianza de la población.
σ: desviación estándar de la población.
μ: media de la población.
s2: varianza de la muestra.
s: desviación estándar de la muestra.
x̄: media de la muestra.
Tenemos siempre que fijarnos si estamos trabajando con datos que forman
una población o con datos que forman una muestra, pues las fórmulas son
diferentes.
En los problemas, seguiremos los siguientes pasos:
1. Calculamos el número de elementos.
2. Calculamos las marcas de clase.
3. Calculamos la media.
4. Calculamos la varianza.
5. Calculamos la desviación estándar, que es la raíz cuadrada de la
varianza.
Ejemplo 1:
Calcular la varianza y la desviación estándar de una población de niños a
partir de la siguiente tabla:
Solución:
En este caso, nos dicen que los datos pertenecen a una población de niños,
por lo tanto, usaremos las fórmulas de la población.
Primero calculamos el número de elementos de la población N:
Con ayuda de la tabla, calculamos la suma de las frecuencias fi.
Ahora sí, calculamos N.
Como segundo paso, calcularemos las marcas de clase. Recordemos que la
marca de clase xi, es el punto medio del límite inferior y el límite superior de
cada intervalo. Se calcula con la siguiente fórmula:
Agregamos una columna más a nuestra tabla para la marca de clase xi:
Como tercer paso, calculamos la media poblacional µ:
Agregamos una columna más a nuestra tabla, dónde colocaremos los valores
de xi・fi:
Aplicamos la fórmula:
La media poblacional µ tiene un valor de 4 años.
Como cuarto paso, calculamos la varianza de la población:
Agregamos más columnas a nuestra tabla, buscando la forma de la fórmula
de la varianza:
Aplicamos la fórmula de la varianza de la población:
Recuerda que la varianza queda expresada en unidades al cuadrado, por ello,
nos queda en años al cuadrado.
Como último paso, calculamos la desviación estándar, recordando que es la
raíz cuadrada positiva de la varianza.
El valor de la desviación estándar poblacional σ es de 2,175 años.