Estadística Descriptiva
Estadística: El análisis estadístico nos provee un conjunto de principios y procedimientos para manipular, resumir e
investigar datos con el fin de obtener información útil en la toma de decisiones. La estadística puede ser descriptiva o
inferencial.
Estadística descriptiva: Realiza el estudio sobre la población completa, observando una característica de la misma y
calculando unos parámetros que den información global de toda la población. Se dedica a analizar y representar los
datos.
Estadística inferencial: Realiza el estudio descriptivo sobre un subconjunto de la población llamado muestra y,
posteriormente, extiende los resultados obtenidos a toda la población.
Pasos de un estudio estadístico:
• Planteamiento del problema
• Recolección de datos
• Organización de datos
• Análisis y medición de datos
La estadística descriptiva es la rama de la estadística que provee procedimientos útiles para organizar y resumir, de
diversas formas de acuerdo a nuestro interés, un conjunto de datos obtenidos de la realidad.
Lenguaje de la estadística:
• Población: es el conjunto de todas las muestras posibles. Es el grupo total de objetos (elementos, personas,
registros, etc.) acerca del cual se obtienen conclusiones.
• Muestra: es una parte de la población que se usa como información.
• Variable: es la característica de interés que interesa observar en la población en relación al objetivo de estudio.
• Parámetro: es una medida que resume información de una variable.
Tipos de variable:
• Variables cualitativas o de atributos (color de ojos, sexo de nacimiento, el estado nutricional, etc.)
• Variables cuantitativas:
o Discretas (entre dos valores consecutivos de la variable no existe otro, cuando sólo puede asumir
valores aislados). Por ejemplo: cantidad de hijos, la edad, etc.
o Continua (cuando puede asumir cualquier valor en el intervalo real) Por ejemplo: peso, talla,
temperatura, etc.
Tablas estadísticas
Distribución de frecuencias
La distribución de frecuencias o tabla de frecuencias es una ordenación en forma de tabla de los datos estadísticos,
asignando a cada dato su frecuencia correspondiente.
Tipos de frecuencias
Frecuencia absoluta
La frecuencia absoluta es el número de veces que aparece un determinado valor en un estudio estadístico.
Se representa por 𝑛𝑖 .
La suma de las frecuencias absolutas es igual al número total de datos, que se representa por N.
𝑛1 + 𝑛2 + 𝑛3 + ⋯ + 𝑛𝑛 = 𝑛
Para indicar resumidamente estas sumas se utiliza la letra griega Σ (sigma mayúscula) que se lee suma o sumatoria.
𝑖=𝑛
∑ 𝑛𝑖 = 𝑛
𝑖=1
Frecuencia relativa
La frecuencia relativa es el cociente entre la frecuencia absoluta de un determinado valor y el número total de datos,
𝑛𝑖
se representa por 𝑓𝑖 . Por lo tanto 𝑓𝑖 = 𝑛
También se puede expresar en tantos por ciento.
La suma de las frecuencias relativas es igual a 1, o sea ∑𝑖=𝑛
𝑖=1 𝑓𝑖 = 1
Frecuencia absoluta acumulada
La frecuencia absoluta acumulada es la suma de las frecuencias absolutas de todos los valores inferiores o iguales al
valor considerado. Se representa por Ni.
𝑁𝑖 = 𝑛1 + ⋯ + 𝑛𝑖
Frecuencia relativa acumulada
La frecuencia relativa acumulada es el cociente entre la frecuencia acumulada de un determinado valor y el número
𝑁𝑖
total de datos, esto es 𝐹𝑖 = 𝑛
También se cumple que 𝐹𝑖 = 𝑓1 + ⋯ + 𝑓𝑖
Ejemplo: Durante el mes de enero, en una ciudad se han registrado las siguientes temperaturas máximas:
32, 31, 28, 29, 33, 32, 31, 30, 31, 31, 27, 28, 29, 30, 32, 31, 31, 30, 30, 29, 29, 30, 30, 31, 30, 31, 34, 33, 33, 29, 29.
En la primera columna de la tabla colocamos la variable ordenada de menor a mayor, en la segunda hacemos el
recuento y en la tercera anotamos la frecuencia absoluta.
xi Recuento ni Ni fi Fi
27 | 1 1
28 || 2 3
29 |||||| 6 9
30 ||||||| 7 16
31 |||||||| 8 24
32 ||| 3 27
33 ||| 3 30
34 | 1 31
REPRESENTACIONES GRAFICAS PARA VARIABLES DISCRETAS
1) Diagrama de barras
Un diagrama de barras se utiliza para de presentar datos cualitativos o datos cuantitativos de tipo discreto.
Se representan sobre unos ejes de coordenadas, en el eje de abscisas se colocan los valores de la variable, y sobre el
eje de ordenadas las frecuencias absolutas o relativas o acumuladas. Los datos se representan mediante barras de una
altura proporcional a la frecuencia.
Ejemplo
Un estudio hecho al conjunto de los 20 alumnos de una clase para determinar su grupo sanguíneo ha dado el siguiente
resultado:
𝑛𝑖
Grupo 𝐧𝐢
saguineo
A 6
B 4
AB 1
0 9
20
2) Polígonos de frecuencia
Un polígono de frecuencias se forma uniendo los extremos de las barras mediante segmentos.
También se puede realizar trazando los puntos que representan las frecuencias y uniéndolos mediante segmentos.
Ejemplo
Un supermercado realiza sondeo, preguntando a 74 de sus clientes cuántas veces compran en un mes.
Los datos se presentan en la tabla y polígono de frecuencias siguiente:
Nº de veces Cantidad
que compran de
por mes clientes
6 7
9 12
12 14
15 11
18 12
21 10
24 8
3) Diagrama de sectores
Un diagrama de sectores se puede utilizar para todo tipo de variables, pero se usa frecuentemente para las variables
cualitativas.
Los datos se representan en un círculo, de modo que el ángulo de cada sector es proporcional a la frecuencia relativa
correspondiente, siguiendo la fórmula:
𝛼 = 360° . 𝑓𝑖
Ejemplo
En una clase de 30 alumnos, 12 juegan a baloncesto, 3 practican la natación, 4 juegan al fútbol y el resto no practica
ningún deporte.
𝑥𝑖 𝑛𝑖 𝑓𝑖 𝛼𝑖
0.4 𝛼1 = 360°. 0.4 = 144°
Baloncesto 12 144°
Natación 3 𝛼2 =
Fútbol 9
Sin deporte 6 𝛼3 =
30
𝛼4 =
Quedando el gráfico así:
PARÁMETROS ESTADÍSTICOS PARA VARIABLES DISCRETAS
A) MEDIDAS DE CENTRALIZACIÓN
1) Moda
Definición de moda
La moda es el valor que tiene mayor frecuencia absoluta. Se
representa por [Link] puede hallar la moda para variables cualitativas y cuantitativas.
La moda de la distribución:2, 3, 3, 4, 4, 4, 5, 5 es Mo= 4
Si en un grupo hay dos o varias puntuaciones con la misma frecuencia y esa frecuencia es la máxima, la distribución es
bimodal o multimodal, es decir, tiene varias modas.
Lasmodasde la distribución: 1, 1, 1, 4, 4, 5, 5, 5, 7, 8, 9, 9, 9 son Mo: 1, 5, 9.
Cuando todas las puntuaciones de un grupo tienen la misma frecuencia, no hay moda.
La distribución:2, 2, 3, 3, 6, 6, 9, 9 no tiene moda.
Si dos puntuaciones adyacentes tienen la frecuencia máxima, la moda es el promedio de las dos puntuaciones
5+3
[Link] moda de la distribución:0, 1, 3, 3, 5, 5, 7, 8 es Mo = =4
2
2) Mediana
Definición de mediana
Es el valor que ocupa el lugar central de todos los datos cuando éstos están ordenados de menor a mayor.
La mediana se representa por Me.
La mediana se puede hallar sólo para variables cuantitativas.
Cálculo de la mediana
1) Ordenamos los datos de menor a mayor.
2) Si la serie tiene un número impar de medidas la mediana es la puntuación central de la misma.
Por ejemplo para la serie: 2, 3, 4, 4, 5, 5, 5, 6, 6 la mediana es Me= 5
3) Si la serie tiene un número par de puntuaciones la mediana es la media entre las dos puntuaciones centrales.
𝟗+𝟏𝟎
Por ejemplo para la serie: 7, 8, 9, 10, 11, 12 la mediana es Me= =9.5
𝟐
3)Media
Definición de media aritmética
La media aritmética es el valor obtenido al sumar todos losdatos y dividirel resultado entre el número total dedatos.
La media aritmética la anotamos con el siguiente símbolo: 𝑥̅ .
𝑛1 𝑥1+𝑛2𝑥2+𝑛3𝑥3+⋯+𝑛𝑛𝑥𝑛 ∑𝑖=𝑛
𝑖=1 𝑛𝑖 𝑥𝑖
Calculamos: 𝑥
̅= o también 𝑥̅ =
𝑛 𝑛
Ejemplo
Los pesos de seis amigos son: 78, 84, 91, 84, 72, 68, 91 , 91, 87 y 78 kg. Hallar el peso medio.
2 × 78 + 2 × 84 + 3 × 91 + 72 + 68 + 87
𝑥̅ = = 82.4
10
B) MEDIDAS DE POSICIÓN
Cuartiles
Los cuartiles son los tres valores de la variable que dividen a un conjunto de datos ordenados en cuatro partes iguales.
Q1, Q2 y Q3 determinan los valores correspondientes al 25%, al 50% y al 75% de los datos. Q2 coincide con la mediana.
Cálculo de los cuartiles
1)Ordenamos los datos de menor a mayor.
𝐾.𝑛
2)Buscamos el lugar que ocupa cada cuartil mediante la expresión: 𝑐𝑜𝑛 𝐾 = 1, 2, 3.
4
Número impar de datos 2, 5, 3, 6, 7, 4, Número par de datos 2, 5, 3, 4, 6, 7, 1, 9
C) MEDIDAS DE DISPERSIÓN
Las medidas de dispersión nos informan sobre cuanto se alejan del centro los valores de la distribución.
1) Rango o recorrido
El rango es la diferencia entre el mayor y el menor de los datos de una distribución estadística.
2) Varianza
La varianza es la media aritmética del cuadrado de las desviaciones respecto a la media de una distribución estadística.
Para simplificar los cálculos usaremos las siguientes expresiones:
𝑛1 𝑥1 2 +𝑛2 𝑥2 2 +⋯+𝑛𝑛 𝑥𝑛 2 2 ∑𝑖=𝑛
𝑖=1 𝑛𝑖 𝑥𝑖
2
𝑉𝑎𝑟(𝑥) = − 𝑥̅ o también 𝑉𝑎𝑟(𝑥) = − 𝑥̅ 2
𝑛 𝑛
1) Calcular la desviación típica de la distribución:9, 3, 8, 8, 9, 8, 9, 18
𝑥̅ = 𝑉𝑎𝑟(𝑥) = 𝜎 =
DISTRIBUCIÓN DE FRECUENCIAS AGRUPADAS
La distribución de frecuencias agrupadas o tabla con datos agrupados se emplea si la variable es continua, o cuando
la variable toma un número grande de valores.
Se agrupan los valores en intervalos que tengan la misma amplitud denominados clases. A cada clase se le asigna su
frecuencia correspondiente.
Límites de la clase
Cada clase está delimitada por el límite inferior de la clase y el límite superior de la clase.
Amplitud de la clase
La amplitud de la clase es la diferencia entre el límite superior e inferior de la clase.
Marca de clase
La marca de clase es el punto medio de cada intervalo y es el valor que representa a todo el intervalo para el cálculo de
algunos parámetros. Anotamos 𝒎𝒄𝒊 para representar la marca de clase del 𝑖.
Rango
El rango es la diferencia entre el mayor y el menor de los datos de una distribución estadística.
Construcción de una tabla de datos agrupados
Ejemplo
Dada la siguiente serie de datos
3, 15, 24, 28, 33, 35, 38, 42, 43, 38, 36, 34, 29, 25, 17, 7, 34, 36, 39, 44, 31, 26, 20, 11, 13, 22, 27, 47, 39, 37, 34, 32, 35,
28, 38, 41, 48, 15, 32, 13.
Para calcular la amplitud del intervalo procedemos de la siguiente forma:
1) Se calcula el rango R, en este caso R= 48-3=45
2)Se calcula la constante K =√𝑛 (siendo 𝒏el número de datos de la serie), en este caso K =√40 ≅ 6,3
𝑅 45
3) Calculamos 𝐿 = 𝐾, en este caso 𝐿 = 6,3 ≅ 7,14
4) La amplitud de clase A es el entero más próximo a 𝐿, en este caso A = 7
Se forman los intervalos teniendo presente que el límite inferior de una clase pertenece al intervalo, pero el límite
superior no pertenece intervalo, se cuenta en el siguiente intervalo.
I de Clase 𝒎𝒄𝒊 𝑛𝑖 𝑁𝑖 𝑓𝑖 𝐹𝑖
[3, 10)
[10, 17)
[17, 24)
[24, 31)
[31, 38)
[38, 45)
REPRESENTACIONES GRAFICAS PARA DATOS AGRUPADOS
1) Histograma
Un histograma es una representación gráfica de una variable en forma de barras.
Se utilizan para variables continuas o para variables discretas con un gran número de datos, y que se han agrupado en
clases.
En el eje abscisas se construyen unos rectángulos que tienen por base la amplitud del intervalo, y poraltura, la
frecuencia absoluta ( o relativa ) de cada intervalo.
La superficie de cada barra es proporcional a la frecuencia de los valores representados.
2) Polígono de frecuencia
Para construir el polígono de frecuencia se toma la marca de clase que coincide con el punto medio de cada
rectángulo.
Ejemplo
El peso de 60 personas adultas viene dado por la siguiente tabla:
I de Clase mci 𝑛𝑖 𝑁𝑖 𝑓𝑖 𝐹𝑖
[60, 70) 65 8
[70, 80) 75 10
[80, 90) 85 16
[90, 100) 95 14
[100, 110) 105 10
[110, 120) 115 2
60
HISTOGRAMA Y POLIGONO DE FRECUENCIAS
HISTOGRAMA DE FRECUENCIAS ACUMULADAS Y OJIVA
Nota: Ambas gráficas se puede realizar también con las frecuencias relativas.
Ejercicio: Complete la tabla anterior, realice el histograma de frecuencias relativas y la ojiva con las frecuencias relativas
acumuladas.
PARÁMETROS ESTADÍSTICOS PARA VARIABLES AGRUPADAS
A) MEDIDAS DE CENTRALIZACIÓN
1) Moda
𝐧𝐢 −𝐧𝐢−𝟏
𝐌𝐨 = 𝐋𝐢 + 𝐚Lies el límite inferior de la clase [Link] es la frecuencia absoluta de la
(𝐧𝐢 −𝐧𝐢−𝟏 )+(𝐧𝐢 −𝐧𝐢+𝟏 )
clase modal.n i--1 es la frecuencia absoluta inmediatamente inferior a la clase modal.n i-+1 es la frecuencia
absoluta inmediatamente posterior a la clase modal.a es la amplitud de la clase.
EjemploCalcularlamodade una distribución estadística que viene dada por la siguiente tabla:
I de Clase ni
[60, 63) 5
[63, 66) 18 𝟒𝟐 − 𝟏𝟖
[66, 69) 42 𝐌𝐨 = 𝟔𝟔 + 𝟑 = 𝟔𝟕. 𝟖𝟒𝟔
(𝟒𝟐 − 𝟏𝟖) + (𝟒𝟐 − 𝟐𝟕)
[69, 72) 27
[72, 75) 8
100
2)Mediana
La mediana se encuentra en el intervalo donde la frecuencia acumulada llega hasta la mitad de la cantidad de datos de
𝑛
la serie. Es decir tenemos que buscar el intervalo en el que se encuentre:
2
n
2
− Ni−1
La mediana es: Me = Li + a
ni
𝑛
Siendo: Li es el límite inferior de la clase donde se encuentra la mediana. donde 𝑛 es la cantidad de dados de la
2
[Link]-1 es la frecuencia acumulada anterior a la clase mediana.a es la amplitud de la clase.
Ejemplo:Calcular la mediana de una distribución estadística que viene dada por la siguiente tabla:
I de Clase ni Ni
n 100
[60, 63) 5 5 = = 50
[63, 66) 18 23 2 2
3) Media aritmética
[66, 69) 42 65
[69, 72) 27 92 Clase de la mediana: [66, 69)
[72, 75) 8 100
50 − 23
100 Me = 66 + 3 = 67.93
42
3)Media
Si los datos vienen agrupados en una tabla de frecuencias, la expresión de la media es:
𝑛1 .𝑚𝑐1 +𝑛2.𝑚𝑐2 +𝑛3.𝑚𝑐3+⋯+𝑛𝑛.𝑚𝑐𝑛 ∑𝑖=𝑛
𝑖=1 𝑛𝑖 .𝑚𝑐𝑖
𝑥̅ = o también 𝑥̅ =
𝑛 𝑛
Ejemplo de media aritmética
En un test realizado a un grupo de 42 personas se han obtenido las puntuaciones que muestra la tabla. Calcula la
puntuación media.
I de Clase mci ni mci · ni
[10, 20) 15 1 15
[20, 30) 25 8 200 1820
[30,40) 35 10 350 𝑥̅ = = 43. 3̅
[40, 50) 45 9 405 42
[50, 60 55 8 440
[60,70) 65 4 260
[70, 80) 75 2 150
42 1 820
Propiedades de la media aritmética
1) La suma de las desviaciones de todas las puntuaciones de una distribución respecto a la media de la misma
igual a cero, o sea: ∑( 𝑋𝑖 − 𝑋̅ ) = 0
La suma de las desviaciones de los números 8, 3, 5, 12, 10 de su media aritmética 7.6 es igual a 0:
8 − 7.6 + 3 − 7.6 + 5 − 7.6 + 12 − 7.6 + 10 − 7.6 =0. 4 − 4.6 − 2.6 + 4. 4 + 2. 4 = 0
2) La suma de los cuadrados de las desviaciones de los valores de la variable con respecto a un número cualquiera
se hace mínima cuando dicho número coincide con la media aritmética.
Esto es : ∑( 𝑋𝑖 − 𝑋̅ )2 es mínimo.
Observaciones sobre la media aritmética
1) La media se puede hallar sólo para variables cuantitativa
2) La media es independiente de las amplitudes de los intervalos.
3) La media es muy sensible a las puntuaciones extremas. Si tenemos una distribución con los siguientes pesos:
65 kg, 69kg , 65 kg, 72 kg, 66 kg, 75 kg, 70 kg, 110 kg.
La media es igual a 74 kg, que es una medida de centralización poco representativa de la distribución.
4) La media no se puede calcular si hay un intervalo con una amplitud indeterminada.
I de Clase ci ni
[60, 63) 61.5 5 En este caso no es posible hallar
[63, 66) 64.5 18 la media porque no podemos
[66, 69) 67.5 42 calcular la marca de clase de
[69, 72) 70.5 27 último intervalo.
[72, ∞ ) 8
100
B) MEDIDAS DE POSICIÓN
Cuartiles
Cálculo de los cuartiles para datos agrupados
𝑘.𝑁
En primer lugar buscamos la clase donde se encuentra 𝑐𝑜𝑛 𝑘 = 1, 2, 3. , en la tabla de las frecuencias acumuladas.
4
k.n
− N𝐢−𝟏
4
Q k = 𝐋𝐢 + 𝐧𝐢
𝐚 con 𝑘 = 1, 2,3
Li es el límite inferior de la clase donde se encuentra el cuartil.
n es la cantidad de datos de la serie.
N i-1 es la frecuencia acumulada anterior a la clase del cuartil.
aes la amplitud de la clase.
Ejemplo de cuartiles
𝟔𝟓 𝟏𝟔.𝟐𝟓 − 𝟖
Cálculo del primer cuartil :
𝟒
= 𝟏𝟔. 𝟐𝟓 ⇒ 𝑸𝟏 = 𝟔𝟎 + 𝟏𝟎
𝟏𝟎 = 𝟔𝟖. 𝟐𝟓
Cálculo del segundo cuartil ( corresponde al cálculo de la mediana ):
𝟔𝟓. 𝟐 𝟑𝟐. 𝟓 − 𝟏𝟖
= 𝟑𝟐. 𝟓 ⇒ 𝑸𝟏 = 𝟕𝟎 + 𝟏𝟎 = 𝟕𝟗. 𝟎𝟔
𝟒 𝟏𝟔
𝟔𝟓.𝟑 𝟒𝟖.𝟓 − 𝟒𝟖
Cálculo del tercer cuartil : = 𝟒𝟖. 𝟓 ⇒ 𝑸𝟏 = 𝟗𝟎 + 𝟏𝟎 = 𝟗𝟎. 𝟕𝟓
𝟒 𝟏𝟎
C) MEDIDAS DE DISPERSIÓN
1) Rango o recorrido
El rango es la diferencia entre el mayor límite superior de clase y el menor límite inferior de clase de los datos de
una distribución estadística.
2) Varianza
En este caso trabajamos con la marca de clase ( 𝑚𝑐𝑖 ) de cada intervalo.
𝑛1 𝑚𝑐1 2 +𝑛2 𝑚𝑐2 2 +⋯+𝑛𝑛 𝑚𝑐𝑛 2 ∑𝑖=𝑛 2
𝑖=1 𝑚𝑐𝑖 𝑛𝑖
𝑉𝑎𝑟(𝑥) = − 𝑥̅ 2 o también 𝑉𝑎𝑟(𝑥) = ̅2
−𝑥
𝑛 𝑛−1
3) Desviación típica
La desviación típica es la raíz cuadrada de la varianza.
La desviación típica se representa por σ = √𝑉𝑎𝑟(𝑥)
Ejemplo: Calcular la desviación típica de la distribución de la tabla:
I.c mci ni mci · ni mci2 · ni 𝑥̅ =
[10,20) 1
[20, 30) 8
𝑉𝑎𝑟(𝑥) =
[30, 40) 10
[40, 50) 9
[50, 60) 8
[60, 70) 4
[70, 80) 2 σ=
42
Observaciónes:
1) La varianza será siempre un valor positivo o cero, en el caso de que las puntuaciones sean iguales.
2)La varianza y la desviación típica, al igual que la media, es un índice muy sensible a las puntuaciones extremas.
3)En los casos que no se pueda hallar la media tampoco será posible hallar la varianza ni la desviación típica..4)La
varianza no viene expresada en las mismas unidades que los datos, ya que las desviaciones están elevadas al
cuadrado.5) Cuanta más pequeña sea la desviación típica mayor será la concentración de datos alrededor de la media.