0% encontró este documento útil (0 votos)
42 vistas29 páginas

Medidas de forma y dispersión en estadística

El documento presenta medidas de forma de una muestra basadas en momentos, centrándose en la media, varianza y desviación típica. Se discute la sensibilidad de la media a datos atípicos y se introducen otras medidas como la media truncada y el coeficiente de variación. Además, se abordan conceptos de asimetría y curtosis para medir la forma de la distribución de los datos.

Cargado por

Junhy
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
42 vistas29 páginas

Medidas de forma y dispersión en estadística

El documento presenta medidas de forma de una muestra basadas en momentos, centrándose en la media, varianza y desviación típica. Se discute la sensibilidad de la media a datos atípicos y se introducen otras medidas como la media truncada y el coeficiente de variación. Además, se abordan conceptos de asimetría y curtosis para medir la forma de la distribución de los datos.

Cargado por

Junhy
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Resumenes númericas de una muestra II:

medidas basadas en momentos

Michael Wiper
Departamento de Estadística
Universidad Carlos III de Madrid

M. Wiper Estadística 1 / 18
Objetivo

Introducir medidas de forma de una muestra basadas en momentos.

M. Wiper Estadística 2 / 18
La media
Hasta ahora hemos visto dos medidas de localización: moda y mediana.
Una alternativa natural es la media (aritmética), es decir el promedio de los datos.

1
x̄ = (x1 + x2 + · · · x ).
n n

M. Wiper Estadística 3 / 18
La media
Hasta ahora hemos visto dos medidas de localización: moda y mediana.
Una alternativa natural es la media (aritmética), es decir el promedio de los datos.

1
x̄ = (x1 + x2 + · · · x ).
n n

Nota para los ingenieros: si se colocan pesos iguales sobre una barra muy ligera en
posiciones x1 , ...., x , la media es el centro de gravedad de la barra.
n

M. Wiper Estadística 3 / 18
La media
Hasta ahora hemos visto dos medidas de localización: moda y mediana.
Una alternativa natural es la media (aritmética), es decir el promedio de los datos.

1
x̄ = (x1 + x2 + · · · x ).
n n

Nota para los ingenieros: si se colocan pesos iguales sobre una barra muy ligera en
posiciones x1 , ...., x , la media es el centro de gravedad de la barra.
n

1, 2, 4, 5, 7, 9, 11, 13

1
x̄ = (1 + 2 + · · · + 13) = 6,5
8

M. Wiper Estadística 3 / 18
Calculando la media a través de la tabla de
frecuencias
Con datos discretas la tabla de frecuencias tiene forma:

Valor Frecuencia absoluta Frecuencia relativa


x1 n1 f1
x2 n2 f2
.. .. ..
. . .
x k n k f k

Total n 1
El valor x es repetido n veces. Luego, la media es
i i

1X
k k

x̄ = nx fx.
X
=
n i =1
i i

i =1
i i

M. Wiper Estadística 4 / 18
Ejemplo

1
x̄ = (7 × 0 + 26 × 1 + · · · + 2 × 9 + 0 × 10) = 3,365 accidentes mortales por día.
181

M. Wiper Estadística 5 / 18
Ejemplo
Con datos continuos, usamos las misma formulas, aproximando los valores dentro
de un intervalo con la marca de clase. Obviamente el resultado es sólo una
aproximación a la verdadera media de la muestra.

x̄ ≈ (0,06 × 25 + 0,18 × 75 + · · · + 0,02 × 2500 + 0 × 3250) = 326,5.


La verdadera media de los datos es x̄ = 320 hectáreas quemadas por provincia
No importa el hecho de que los intervalos son de anchuras distintas.

M. Wiper Estadística 6 / 18
Sensibilidad de la media a datos atípicos

Obviamente la media es muy sensible a atípicos.


1, 2, 4, 5, 7, 9, 11, 13
x̄ = 6,5.

M. Wiper Estadística 7 / 18
Sensibilidad de la media a datos atípicos

Obviamente la media es muy sensible a atípicos.


1, 2, 4, 5, 7, 9, 11, 13
x̄ = 6,5.
1, 2, 4, 5, 7, 9, 11, 130
x̄ = 21,125.
Luego para muestras muy asimétricas o con muchos datos atípicos, es preferible
emplear la mediana como medida de localización.

M. Wiper Estadística 7 / 18
Comparando media, mediana y moda

En contraste a la media, la mediana y moda no son afectadas por datos atípicos.

M. Wiper Estadística 8 / 18
Otras medias

La media truncada es un intento de evitar la sensibilidad a los datos atípicos,


calculando la media de los datos pero quitando (por ejemplo) los 5 % más
altos y los 5 % más bajos.
La media geométrica de una muestra (no-negativa) x1 , ..., x es igual a
√n x x ···x .
n

1 2 n

Son muy apropiadas para promediar índices porcentuales, por ejemplo la


variabilidad regional en Europe entre homicidios y otras formas de muerte
externa.

M. Wiper Estadística 9 / 18
Midiendo dispersión: la varianza y desvianza típica

Suponiendo que la media es una buena medida de localización de la muestra, una


idea razonable es medir la dispersión como la distancia típica de una observación
en torno de la media.
Con datos x1 , ..., x , con media x̄ , las distancias son x1 − x̄ , x2 − x̄ , ..., x − x̄ .
n n

Obviamente, algunas son positivas y otras negativas y n


x − x̄ ) = 0.
P
i =1 ( i

M. Wiper Estadística 10 / 18
Midiendo dispersión: la varianza y desvianza típica

Suponiendo que la media es una buena medida de localización de la muestra, una


idea razonable es medir la dispersión como la distancia típica de una observación
en torno de la media.
Con datos x1 , ..., x , con media x̄ , las distancias son x1 − x̄ , x2 − x̄ , ..., x − x̄ .
n n

Obviamente, algunas son positivas y otras negativas y n


x − x̄ ) = 0.
P
i =1 ( i

Entonces, una idea posible es considerar las distancias cuadradas ...

M. Wiper Estadística 10 / 18
La varianza
La varianza de la muestra se dene como:
1X 1X
n n

σ̂ 2 = (x − x̄ )2 = x 2 − x̄ 2 .
n i =1
i
n i =1
i

M. Wiper Estadística 11 / 18
La varianza
La varianza de la muestra se dene como:
1X 1X
n n

σ̂ 2 = (x − x̄ )2 = x 2 − x̄ 2 .
n i =1
i
n i =1
i

Nota para los ingenieros: la varianza es el momento de inercia de la barra en torno


del centro de gravedad.

M. Wiper Estadística 11 / 18
La varianza
La varianza de la muestra se dene como:
1X 1X
n n

σ̂ 2 = (x − x̄ )2 = x 2 − x̄ 2 .
n i =1
i
n i =1
i

Nota para los ingenieros: la varianza es el momento de inercia de la barra en torno


del centro de gravedad.

Nota para los estadísticos: la mayoria de paquetes estadísticos no calculan la


varianza así. Como alternativa se preere la cuasi-varianza:

1
n
n 2
s2 = (x − x̄ )2 =
X
σ̂ .
n−1 i =1
i
n−1
¾Porqué?

M. Wiper Estadística 11 / 18
La varianza
La varianza de la muestra se dene como:
1X 1X
n n

σ̂ 2 = (x − x̄ )2 = x 2 − x̄ 2 .
n i =1
i
n i =1
i

Nota para los ingenieros: la varianza es el momento de inercia de la barra en torno


del centro de gravedad.

Nota para los estadísticos: la mayoria de paquetes estadísticos no calculan la


varianza así. Como alternativa se preere la cuasi-varianza:

1
n
n 2
s2 = (x − x̄ )2 =
X
σ̂ .
n−1 i =1
i
n−1
¾Porqué?
Razones estadísticas complicadas: insesgadez, ...

M. Wiper Estadística 11 / 18
La desviación típica

El problema más importante de la varianza es su interpretación.


Volviendo al ejemplo de los accidentes de tráco, la varianza en este caso es 3,79

M. Wiper Estadística 12 / 18
La desviación típica

El problema más importante de la varianza es su interpretación.


Volviendo al ejemplo de los accidentes de tráco, la varianza en este caso es 3,79
(accidentes mortales cuadrados al día).
Más natural es una medida con las mismas unidades que los datos.
√ √
La desviación típica es σ̂ = σ̂ 2 y la cuasi-desviación típica es s = s 2.
En el ejemplo, la desviación típica es 1,95 accidentes mortales por día.

M. Wiper Estadística 12 / 18
El teorema de Chebyshev y la interpretación de la
desviación típica

El teorema de Chebyshev dice que para cualquier conjunto de datos:


Por lo menos 3/4 de los datos de la muestra están a menos de dos
desviaciones típicas en torno de la media.
Por lo menos 8/9 de los datos están a menos de tres desviaciones típicas de
la media.
Por lo menos 1 − 1/k 2 de los datos están a menos de k desviaciones típicas
de la media.

M. Wiper Estadística 13 / 18
El teorema de Chebyshev y la interpretación de la
desviación típica

El teorema de Chebyshev dice que para cualquier conjunto de datos:


Por lo menos 3/4 de los datos de la muestra están a menos de dos
desviaciones típicas en torno de la media.
Por lo menos 8/9 de los datos están a menos de tres desviaciones típicas de
la media.
Por lo menos 1 − 1/k 2 de los datos están a menos de k desviaciones típicas
de la media.
El teorema de Chebyshev es muy conservadora. Para datos más o menos
simétricas, una regla empírica dice que aproximadamente 68 % 95 % 99.7 % de los
datos están a menos de uno dos tres desviaciones de la media.

M. Wiper Estadística 13 / 18
Ejemplo
1, 2, 4, 5, 7, 9, 11, 13

1
x̄ = 6,5 x 2 = 466 σ̂ 2 =× 466 − 6,52 = 16 σ̂ = 4.
X
i
8
En este caso, un 100 % de los datos están comprendidos en la región
6,5 ± 2 × 4 = [−1,5, 14,5]

M. Wiper Estadística 14 / 18
Ejemplo
1, 2, 4, 5, 7, 9, 11, 13

1
x̄ = 6,5 x 2 = 466 × 466 − 6,52 = 16 σ̂ = 4.
σ̂ 2 =
X
i
8
En este caso, un 100 % de los datos están comprendidos en la región
6,5 ± 2 × 4 = [−1,5, 14,5]

1, 2, 4, 5, 7, 9, 11, 130

1
x̄ = 21,125 x 2 = 17197 σ̂ 2 = × 17197 − 21,1252 = 1703,36 σ̂ = 41,27.
X
i
8

En contraste el intervalo 21,125 ± 2 × 41,27 = [−61,42, 103,67] contiene un


87.5 % de lo datos.

M. Wiper Estadística 14 / 18
Midiendo la dispersión relativa: el coeciente de
variación

Supongamos que se quiere comparar la variabilidad en las cantidades de heroina


(gm) y de cigarillos ilegales (cajas) encontrados en sospechosos.

M. Wiper Estadística 15 / 18
Midiendo la dispersión relativa: el coeciente de
variación

Supongamos que se quiere comparar la variabilidad en las cantidades de heroina


(gm) y de cigarillos ilegales (cajas) encontrados en sospechosos.
Obviamente no tiene sentido comparar las desviaciones típicas directamente ya
que las cantidades típicas encontradas de los dos productos son muy distintos.
Luego se tiene que comparar las dispersiones relativas al tamaño típico.
Con este objetivo se utiliza el coeciente de variación:

σ̂
CV = .
|x̄ |

M. Wiper Estadística 15 / 18
Midiendo asimetría
La medida más típica es la asimetría de Fisher:

1 n
x − x̄ )3
P
n i =1 ( i
γˆ1 = .
σ̂ 3

Para datos simétricas, tipicamente γ1 ≈ 0.

La asimetría es γ̂1 = 3.
Para datos asimétricos a la derecha, la asimetría es positiva.
M. Wiper Estadística 16 / 18
Curtosis
Curtosis es otra medida de forma que está relacionado con la proporción de la
variabilidad de los datos debida a datos extremos.
La medida más utilizada es
1 n
x − x̄ )4
P
n i =1 ( i
κ̂ = .
σ̂ 4

Valores grandes de la curtosis indican una proiporción más alta de datos extremos.

Una muestra platicurtica tiene pocos atípicos y una muestra leptocurtica tiene
más atípicos.

M. Wiper Estadística 17 / 18
Resumen y siguiente sesión
En las últimas dos sesiones hemos introducido las resumenes numéricas más
típicas de un conjunto de datos.

En las siguientes sesiones empezamos a mirar conjuntos de varios tipos de datos y


ver las relaciones entre ellos.

M. Wiper Estadística 18 / 18

También podría gustarte