CAPITULO III
Capítulo III, medidas de las distribuciones, como media, mediana, moda, medidas de
dispersión, medidas de simetría y asimetría, y medidas de achatamiento, también se
incluye el cálculo de los parámetros estadísticos utilizando la técnica de los momentos
lineales.
3.1 Medidas descriptivas de las distribuciones de frecuencias
Para describir ciertas características de un conjunto de datos, se pueden usar números
simples, llamados estadísticos. De ellos se puede obtener un conocimiento más preciso
de los datos, que el que se obtiene a partir de las tablas y los gráficos. Las características
más importantes de este conjunto de datos son:
Medida de tendencia central o medidas de localización
Indican cual será el punto medio o localización central. En la figura la curva A queda a
la izquierda de los puntos medios de las curvas B y C, las cuales tienen la misma
localización central.
Medidas de dispersión
Se refiere a la forma como se encuentran esparcidas las observaciones. En Ia figura, se
observa que la curva A tiene una mayor separación o dispersión que la curva B.
Medidas de simetría y asimetría
Las curvas que representan los datos puntuales de un conjunto pueden ser simétricas o
asimétricas. Las curvas simétricas, como la que se muestra en la figura, son las que al
trazar una línea vertical desde el pico de la curva al eje horizontal dividen su área en dos
partes iguales, cada una idéntica a la otra.
Las curvas asimétricas o sesgadas, como las que se muestran en la figura, son aquellas
en las cuales la distribución de frecuencia, se concentran en el extremo inferior o
superior de la escala de medida sobré el eje horizontal. Los valores no se distribuyen
igualmente, por lo que pueden ser sesgadas a la derecha, (curva A) o sesgadas a la
izquierda (curva B).
Medidas de achatamiento o curtosis
Indican el grado de llanura de la curva. Por ejemplo, en la figura, las curvas A y B
tienen la misma localización central, pero difieren por el hecho que una es más
puntiaguda que la otra, por lo que tienen diferente grado de curtosis.
De acuerdo al grado de achatamiento, las curvas pueden ser mesocúrtica (curva A),
leptocúrtica (curva B) y platicúrtica (curva C).
3.2 Medidas de tendencia central
Se define una medida de tendencia central, como un índice de localización central,
empleado en la descripción de las distribuciones de frecuencias. En términos generales
se tienen tres medidas: la media, la mediana y la moda.
La media aritmética
Dada la muestra compuesta de n datos, 𝑥1 , 𝑥2 , . . . , 𝑥𝑛 , la media, se define como la suma
algebraica de ellas, dividida entre el número de datos. Cuando se calcula la media para
una población, esta se denota por 𝝁, y cuando se trata de una muestra, por 𝒙 ̅.
1. Media aritmética de datos no agrupados
Matemáticamente la media de los datos no agrupados se representa por:
∑𝑛𝑖=1 𝑥𝑖
𝜇=
𝑛
∑𝑛𝑖=1 𝑥𝑖
𝑥̅ =
𝑛
Donde:
𝜇 = media poblacional
𝑥̅ = media muestral
𝑥𝑖 = valor i-ésimo de la muestra
𝑛 = número de datos de la muestra o población
2. Media aritmética de datos agrupados
∑𝐾
𝑖=1 𝑓𝑖 𝑥𝑖
𝑥̅ =
𝑛
∑𝑛𝑖=1 𝑃𝑖 𝐴𝑖
𝑃̅ =
∑𝑛𝑖=1 𝐴𝑖
Donde:
𝑃̅ = precipitación promedio
𝑃𝑖 = valor de la precipitación en la estación i
𝐴𝑖 = área de influencia de la estación i
𝑛 = número de estaciones
La media geométrica
Dada la muestra compuesta de n datos, 𝑥1 , 𝑥2 , . . . , 𝑥𝑛 , la media geométrica se define
como la raíz n-ésima, de la productoria de los datos, es decir:
1
𝑛 𝑛
̅̅̅̅
𝑋𝐺 = (∏ 𝑥𝑖 )
𝑖=1
Donde:
̅̅̅̅
𝑋𝐺 = media geométrica
∏𝑛𝑖=1 𝑥𝑖 = 𝑥1 , 𝑥2 , . . . , 𝑥𝑛 (productoria de los datos)
𝑥𝑖 = i-ésimo valor de la muestra
𝑛 = número de elementos de la muestra
La mediana
Este único elemento de los datos ordenados es el más cercano a la mitad, o el más
central en el conjunto de números. La mitad de los elementos quedan por encima de ese
punto, y la otra mitad por debajo de él.
1. Mediana de los datos no agrupados
Sean 𝑥1 , 𝑥2 , . . . , 𝑥𝑛 datos ordenados por magnitud creciente o decreciente y n el número
impar de datos, la mediana (Med) es el dato situado en el centro, es decir:
𝑀𝑒𝑑 = 𝑋(𝑛+1)/2, para n impar
Si n es par, la mediana es el promedio de los números centrales, es decir:
𝑋𝑛/2+𝑋𝑛
+1
2
𝑀𝑒𝑑 = , para n par
2
Ejemplo 3.1:
Para el conjunto de datos ordenados: 2, 5, 8, 14, 21,1a mediana es:
𝑀𝑒𝑑 = 8
Ejemplo 3.2:
Para el conjunto de datos ordenados: 2, 5, 8, 14, 21, 32, la mediana es:
8 + 14
𝑀𝑒𝑑 = = 11
2
2. Mediana de los datos agrupados
Siendo la mediana el valor de la observación central de un arreglo, y como no se
conocen los valores de cada observación en datos agrupados, la mediana se suele
aproximar, por la siguiente ecuación:
(𝑛 + 1)
− (𝐹 + 1)
𝑀𝑒𝑑 = [ 2 ] 𝑤 + 𝐿𝑚
𝑓𝑚
Donde:
𝑀𝑒𝑑 = mediana muestral
𝑛 = número total de elementos de la muestra
𝐹 = suma de todas las frecuencias hasta la clase de la mediana, pero sin incluirla
𝑓𝑚 = frecuencia únicamente de la clase de la mediana
𝑤 = amplitud del intervalo de clase
𝐿𝑚 = límite inferior de la clase de la mediana
En general la clase donde se encuentra la mediana es aquella que tiene al elemento
( 𝑛 + 1)
situado en la porción 2 .
La moda
Es aquel valor que se repite más frecuentemente en un conjunto de datos, se denota por
Mo.
Ejemplo 3.3:
Para el conjunto de datos: 2, 3, 4, 4, 4, 8, 9, la moda es:
𝑀𝑜 = 4
Para datos agrupados en intervalos de clase, la moda, una vez determinada la clase
modal, se calcula con la siguiente ecuación:
𝑑1
𝑀𝑜 = 𝐿𝑚 + 𝑤
𝑑1 + 𝑑2
Donde:
𝑀𝑜 = Moda
𝐿𝑚 = límite inferior de la clase modal
𝑑1 = diferencia entre la frecuencia de la clase modal y la premodal (clase anterior)
𝑑2 = diferencia entre la frecuencia de la clase modal y la postmodal (clase
siguiente)
𝑤 = amplitud del intervalo de clase
En general la clase modal es aquella que tiene la máxima frecuencia.
Comparación entre la media, la mediana y la moda
La media, la mediana y la moda de una distribución de frecuencias, son consideradas
como los tres promedios más importantes. Sin embargo, no son igualmente aplicables y
representativos a todas las situaciones.
Si la distribución es simétrica (figura 16a), las tres medidas de tendencia central tienen
valores idénticos. Si la distribución es asimétrica (figura 16b y 16c),los tres valores
divergen, aunque siempre para una distribución unimodal, la moda está localizada en su
punto más alto y la mediana está entre la media y la moda.
3.3 Medidas de dispersión
Las medidas de dispersión o variabilidad permiten observar como se reparten o dispersan los
datos a uno y otro lado del centro.
Rango
Es una medida de distancia y representa la diferencia entre el mayor y el menor de los
valores observados, es decir:
𝑅 = 𝑋𝑚á𝑥 − 𝑋𝑚í𝑛
Donde:
𝑅 = Rango
𝑋𝑚á𝑥 = valor máximo de los datos
𝑋𝑚í𝑛 = valor mínimo de los datos
El rango o la amplitud es una manera conveniente de describir la dispersión, sin
embargo, no da medida alguna de la dispersión entre los datos con respecto al valor
central.
Varianza
1. Datos no agrupados
La varianza poblacional (𝜎 2 ), se define como la suma de cuadrados de las desviaciones
de los datos con respecto a la media, dividida entre el número total de datos, es decir:
∑𝑛𝑖=1(𝑥𝑖 − 𝜇 )2
𝜎2 =
𝑛
La varianza muestral (𝑆 2 ), se obtiene dividiendo la suma de cuadrados de las
observaciones de los datos con respecto a la media, entre el número total de datos
menos uno, es decir:
∑𝑛𝑖=1(𝑥𝑖 − 𝑥̅ )2
𝑆2 =
𝑛−1
2. Datos agrupados
Para el caso de datos agrupados en intervalos de clase, la varianza poblacional, se define como
la suma de los cuadrados de las desviaciones de las marcas de clase con respecto a la media, por
la frecuencia absoluta, dividido entre el número total de datos, es decir:
2
∑𝑘𝑖=1(𝑥𝑖 − 𝜇 )2 𝑓𝑖
𝜎 =
𝑛
Y la varianza muestral por:
2
∑𝑘𝑖=1(𝑥𝑖 − 𝑥̅ )2 𝑓𝑖
𝑆 =
𝑛−1
Donde:
𝑥𝑖 = valor de la i-ésima marca de clase
𝑥̅ = 𝜇 = media
𝑓𝑖 = valor de la i-ésima frecuencia absoluta, es decir, número de datos en el
intervalo i
𝑘 = número de intervalos de clase
𝑛 = número total de datos
Desviación estándar
La desviación estándar, se define como la raíz cuadrada positiva de la varianza, es decir:
𝜎 = √𝜎 2 (𝑝𝑜𝑏𝑙𝑎𝑐𝑖𝑜𝑛𝑎𝑙 )
𝑆 = √𝑆 2 (𝑚𝑢𝑒𝑠𝑡𝑟𝑎𝑙 )
1. Datos no agrupados
𝑛
1
𝜎 = √ (∑ 𝑥𝑖2 − 𝑛𝜇 2 )
𝑛
𝑖=1
𝑛
1
𝑆=√ (∑ 𝑥𝑖2 − 𝑛𝑥̅ 2 )
𝑛−1
𝑖=1
Siendo:
𝑛
1
𝑥̅ = 𝜇 = ∑ 𝑥𝑖
𝑛
𝑖=1
2. Datos agrupados
𝑘
1
𝜎 = √ (∑ 𝑥𝑖2 𝑓𝑖 − 𝑛𝜇 2 )
𝑛
𝑖=1
𝑘
1
𝑆=√ (∑ 𝑥𝑖2 𝑓𝑖 − 𝑛𝑥̅ 2 )
𝑛−1
𝑖=1
Siendo:
𝑘
1
𝑥̅ = 𝜇 = ∑ 𝑥𝑖 𝑓𝑖
𝑛
𝑖=1
𝑥𝑖 = valor de la i-ésima marca de clase
𝑥̅ = 𝜇 = media
𝑓𝑖 = valor de la i-ésima frecuencia absoluta, es decir, número de datos en el
intervalo i
𝑘 = número de intervalos de clase
𝑛 = número total de datos
Coeficiente de variación
Es una medida relativa de dispersión, que relaciona la desviación estándar y la media, es
decir:
𝑆
𝐶𝑣 =
𝑥̅
Generalmente en Hidrología se suele trabajar con datos muestrales.
3.4 Medida de simetría y asimetría
Sesgo
El sesgo es el estadístico que mide la simetría y asimetría.
1. Datos no agrupados
El sesgo (𝛾 ) para datos poblacionales, se obtiene con la siguiente ecuación:
𝜇3
𝛾= 3
𝜎
Donde:
∑𝑛𝑖=1(𝑥𝑖 − 𝜇 )3
𝜇3 =
𝑛
1
𝜎 = √ ∑(𝑥𝑖 − 𝜇 )2
𝑛
𝑛
1
𝜇 = ∑ 𝑥𝑖
𝑛
𝑖=1
El sesgo para datos muestrales se obtiene con:
𝑛2 𝑀3
𝐶𝑠 =
(𝑛 − 1)(𝑛 − 2)𝑆 3
Donde:
∑𝑛𝑖=1(𝑥𝑖 − 𝑥̅ )3
𝑀3 =
𝑛
𝑛
1
𝑆=√ ∑(𝑥𝑖 − 𝑥̅ )2
𝑛−1
𝑖=1
𝑛
1
𝑥̅ = ∑ 𝑥𝑖
𝑛
𝑖=1
2. Datos agrupados
El sesgo (𝛾 ) para datos poblacionales, se obtiene con la siguiente ecuación:
𝜇3
𝛾= 3
𝜎
Donde:
∑𝑘𝑖=1(𝑥𝑖 − 𝜇 )3 𝑓𝑖
𝜇3 =
𝑛
1
𝜎 = √ ∑(𝑥𝑖 − 𝜇 )2 𝑓𝑖
𝑛
𝑘
1
𝜇 = ∑ 𝑓𝑖 𝑥𝑖
𝑛
𝑖=1
El sesgo para datos muestrales se obtiene con:
𝑛2 𝑀3
𝐶𝑠 =
(𝑛 − 1)(𝑛 − 2)𝑆 3
Donde:
3
∑𝑘𝑖=1(𝑥𝑖 − 𝑥̅ ) 𝑓𝑖
𝑀3 =
𝑛
𝑘
1
𝑆=√ ∑(𝑥𝑖 − 𝑥̅ )2 𝑓𝑖
𝑛−1
𝑖=1
𝑘
1
𝑥̅ = ∑ 𝑥𝑖 𝑓𝑖
𝑛
𝑖=1
𝑥𝑖 = marca de clase del intervalo i
𝑓𝑖 = valor de la i-ésima frecuencia
𝑘 = número de intervalos de clase
𝑛 = número total de datos
3.5 Medida de achatamiento
El grado de achatamiento se mide con el estadístico denominado coeficiente de curtosis.
Curtosis
1. Datos no agrupados
Para datos poblacionales el coeficiente de curtosis (k), se define mediante la siguiente
ecuación:
𝜇4
𝑘= 4
𝜎
Donde:
∑𝑛𝑖=1(𝑥𝑖 − 𝜇 )4
𝜇4 =
𝑛
𝑛
1
𝜎 = √ ∑(𝑥𝑖 − 𝜇 )2
𝑛
𝑖=1
𝑛
1
𝜇 = ∑ 𝑥𝑖
𝑛
𝑖=1
El coeficiente de curtosis para datos muestrales se define como:
𝑛3 𝑀4
𝐶𝑘 =
(𝑛 − 1)(𝑛 − 2)(𝑛 − 3)𝑆 4
Donde:
∑𝑛𝑖=1(𝑥𝑖 − 𝑥̅ )4
𝑀4 =
𝑛
𝑛
1
𝑆=√ ∑(𝑥𝑖 − 𝑥̅ )2
𝑛−1
𝑖=1
𝑛
1
𝑥̅ = ∑ 𝑥𝑖
𝑛
𝑖=1
2. Datos agrupados
𝜇4
𝑘=
𝜎4
Donde:
4
∑𝑘𝑖=1(𝑥𝑖 − 𝜇 )4 𝑓𝑖
𝜇 =
𝑛
𝑘
1
𝜎 = √ ∑(𝑥𝑖 − 𝜇 )2 𝑓𝑖
𝑛
𝑖=1
𝑘
1
𝜇 = ∑ 𝑓𝑖 𝑥𝑖
𝑛
𝑖=1
El coeficiente de curtosis para datos muestrales se define como:
𝑛3 𝑀4
𝐶𝑘 =
(𝑛 − 1)(𝑛 − 2)(𝑛 − 3)𝑆 4
Donde:
4
∑𝑘𝑖=1(𝑥𝑖 − 𝑥̅ ) 𝑓𝑖
𝑀4 =
𝑛
𝑘
1
𝑆=√ ∑(𝑥𝑖 − 𝑥̅ )2 𝑓𝑖
𝑛−1
𝑖=1
𝑘
1
𝑥̅ = ∑ 𝑓𝑖 𝑥𝑖
𝑛
𝑖=1
𝑥𝑖 = marca de clase del intervalo i
𝑓𝑖 = valor de la i-ésima frecuencia
𝑘 = número de intervalos de clase
𝑛 = número total de datos
Los cálculos de los estadísticos de una serie de datos son por sí laboriosos. Para la
simplificación de los cálculos, donde se requieren la determinación de la media,
varianza, desviación estándar, el coeficiente de variación, coeficiente de sesgo y
coeficiente de curtosis, tanto para datos poblacionales o muestrales y para datos
agrupados o no agrupados, es mejor contar con una aplicación que realice estos
cálculos.
3.6 Momentos Lineales (L-moments)
Los momentos lineales (L - moments), constituyen una metodología moderna que
permite estimar los parámetros estadísticos de una población o de una muestra. Son
similares a los momentos ordinarios pues proporcionan las medidas de localización,
dispersión, asimetría, curtosis, pero se calculan de las combinaciones lineales de los
datos (de aquí el nombre de momento lineal). Los parámetros estadísticos estimados con
esta metodología son menos sensibles a los valores extremos, por lo que permite
determinar la distribución teórica de probabilidad que mejor ajusta a los datos
analizados.
Método tradicional
Por el método tradicional la media aritmética, la varianza, la desviación estándar, el
coeficiente de variación, el coeficiente de asimetía y el coeficiente de curtosis de una
población, constituida pon n valores de la variable aleatoria X, se definen de la siguiente
manera:
Definición de los momentos lineales
Jonathan R. M. Hosking (1990) desarrolló la teoría de los momentos lineales basada en
el ordenamiento estadístico, a diferencia de los cálculos indirectos usando la
probabilidad de los momentos pesados. Hosking definió los cuatro primeros momentos
lineales de la siguiente forma:
Estimado directo de los momentos lineales
Existe una manera indirecta para el cálculo de los momentos lineales, la cual es utilizar
los momentos pesados por probabilidad, definido por Greenwood et al. Sin embargo,
una forma directa de estimar los momentos lineales, es siguiendo la definición misma
de los momentos lineales desarrollada por Hosking.