0% encontró este documento útil (0 votos)
4 vistas23 páginas

Unidad 2

La unidad 2 de estadística descriptiva aborda la organización y resumen de datos mediante medidas numéricas, diferenciando entre parámetros poblacionales y estadísticos de muestra. Se presentan medidas de posición, variabilidad y forma, así como métodos para analizar conjuntos de datos, tanto agrupados como no agrupados. Se incluyen ejemplos prácticos para calcular promedios, modas, medianas, y medidas de variabilidad, enfatizando la importancia de interpretar los resultados en contextos específicos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
4 vistas23 páginas

Unidad 2

La unidad 2 de estadística descriptiva aborda la organización y resumen de datos mediante medidas numéricas, diferenciando entre parámetros poblacionales y estadísticos de muestra. Se presentan medidas de posición, variabilidad y forma, así como métodos para analizar conjuntos de datos, tanto agrupados como no agrupados. Se incluyen ejemplos prácticos para calcular promedios, modas, medianas, y medidas de variabilidad, enfatizando la importancia de interpretar los resultados en contextos específicos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

Estadística

Unidad 2 - Estadística descriptiva

Como se vio en la unidad 1 la estadística se ocupa de organizar los datos para una mejor comprensión de
los mismos y entre sus fines se encuentra el de brindar medidas resumen mediante métodos numéricos.
Si las medidas son calculadas en base a un censo, o sea se toma a toda la población, se llaman
parámetros poblacionales; si se calculan en base a una muestra se llaman estadísticos de la muestra.

2.1 Medidas de posición

Las medidas de posición o localización indican generalmente el lugar que ocupa un valor de la
variable dentro de la distribución o una característica; las de tendencia central suelen situarse hacia el
centro de la distribución de datos, las no centrales se encuentran más bien en los extremos, aunque
pueden coincidir con una de las medidas centrales.

Media aritmética o promedio es la suma de todos los valores dividida por la cantidad de
valores. Modo es el valor de la variable que más veces se repite, en caso de haber dos
valores que se repiten igual cantidad de veces se dice que la distribución es bimodal.

Mediana es el valor de la variable que ocupa el lugar central de la distribución y la divide en dos
partes iguales.

Cuartiles son tres valores de la variable que dividen a la distribución en cuatro partes iguales.
Quintiles son cuatro valores de la variable que dividen a la distribución en cinco partes iguales.
Deciles son nueve valores de la variable que dividen a la distribución en diez partes iguales.
Percentiles o centiles son noventa y nueve valores de la variable que dividen a la
distribución en cien partes iguales.

2.2 Medidas de variabilidad

Las medidas de variabilidad indican la dispersión o agrupación de los datos entre si, que tan
dispersos o diferentes son los valores del conjunto de datos.

2.2.1 Medidas de variabilidad que consideran el campo de variación de la variable

1. Rango o amplitud: indica la extensión en la que varían la totalidad de los datos, se calcula
restando al valor máximo el valor mínimo.

2. Rango intercuatílico: indica la extensión en la que varían el 50% de los datos, se calcula
restando al valor del tercer cuartil el valor del primer cuartil.

| Estadística
1/ 23
2.2.2 Medidas de variabilidad que consideran variaciones de los valores de la variable en
forma individual.

Variancia: es el promedio de los cuadrados de la diferencia entre un valor de la variable


y la media aritmética. La unidad de medida de la variancia está al cuadrado porque los
valores de la variable lo están.

Desvío estándar: es la raíz cuadrada de la variancia. Estas dos últimas medidas


son absolutas, se expresan en la unidad de medida de la variable.

Coeficiente de variación porcentual: es el cociente entre el desvío


estándar y la media aritmética, expresado en porcentaje, indica la cantidad de variación
expresada como un porcentaje de la media aritmética.

2.3 Medidas de forma

Las medidas de forma permiten observar si los datos se distribuyen uniformemente alrededor de
la media aritmética. Se pueden distinguir tres formas:

Para determinar la forma de la distribución se utilizan dos métodos:

La regla empírica como lo señala su nombre se debe a la experiencia ya que se observó


que en las curvas asimétricas a izquierda la media aritmética es menor que la mediana
y esta es menor que el modo; en las curvas asimétricas a derecha el modo es menor
que la mediana y esta es menor que la media aritmética.

Coeficiente de asimetría de Pearson: indica la cantidad de desvíos estándar a los que

se encuentra la media el modo, se define como y no tiene unidad de


medida, si el CAP es negativo indica una asimetría a izquierda, si es positivo indica una
asimetría a derecha y si es cero indica una distribución simétrica.

| Estadística
2/ 23
Ver en el Anexo el cuadro comparativo de fórmulas.

2.4 Tratamiento del conjunto de datos

Al realizar un censo o muestra, recolectar datos que pueden ser históricos a través del tiempo o de un
momento específico, el investigador puede decidir cómo analizar los datos, básicamente se trabajan de
tres formas:

2.4.1 Datos sin agrupar se utiliza cuando la cantidad de datos es pequeña, en la práctica no
mayor de 20 valores y estos no se repiten o sólo algunos se repiten.

Ejemplo:
los montos depositados por un comercio durante 15 días hábiles en miles
de pesos: 2,5 – 1,6 – 2,1 – 1,5 – 1,6 – 2,2 – 2,3 – 2,6 – 1,6 – 1,8 – 1,4 – 1,9 – 1,2
– 2,3 – 2,4.

En este caso lo que se hace es ordenar los datos de menor a mayor:

1 ,2 – 1,4 – 1,5 – 1,6 – 1,6 – 1,6 – 1,8 – 1,9– 2,1– 2,2 – 2,3 – 2,3 – 2,4 – 2,5 – 2, 6.

| Estadística
3/ 23
De esta forma se ordenan los datos y se puede tener una visión de los mismos más organizada.

En primer lugar definir los siguientes ítems:

Variable: montos depositados por un comercio


Tipo de variable: cuantitativa continua
Unidad de medida: días hábiles
Cantidad de valores distintos de la variable: 12
Unidad de análisis: días (observar que la unidad de análisis coincide con la frecuencia)
Cantidad de datos: N = 15

Se desea saber:

a. ¿Cuál es el promedio diario de los montos depositados?

Interpretación: El promedio diario de montos depositados por un comercio es de $1933,33.

b. ¿Cuál es el monto más frecuente?


En este caso hay tres valores de la variable que se repiten, 1,6 por lo tanto es el valor más frecuente o
modo de la distribución: Mo = $1600

Interpretación: hay más días con $1600depositados diariamente(1).

c. ¿Cual es el valor central?

El valor central es la mediana, se obtiene primeramente conociendo el lugar u orden de la mediana.

El orden de la mediana es . En este caso la cantidad de datos es impar, el lugar de la

mediana es 8.

Para su cálculo se deben ordenar los datos de menor a mayor como se realizó al comienzo del ejercicio:

1,2 – 1,4 – 1,5 – 1,6 – 1,6 – 1,6 – 1,8 – 1,9 – 2,1– 2,2 – 2,3 – 2,3 – 2,4 – 2,5 – 2,6.
8º lugar

| Estadística
4/ 23
Interpretación: El 50% de los días se depositaron hasta 1,9 miles de pesos diarios y el otro 50% de
los días se depositaron hasta 1,9 miles de pesos diarios o más.

Si la cantidad de datos fuera par el valor de la mediana se calcula como el promedio


de los dos valores centrales, por ejemplo si la cantidad de datos fuera 12, el orden

de la mediana es , este lugar “no cae” en un valor de la


variable, sino en el medio de dos valores, por lo que se hace el promedio entre el 6º
y el 7º valor.

d. ¿Qué desvío estándar presentan los datos?

Para obtener el desvío estándar primero se debe calcular la variancia.

La variancia es

miles de pesos2

El Desvío estándar es miles de pesos

e. ¿Cuál es la variabilidad relativa y qué interpretación le tiene en este problema?

La medida de variabilidad relativa es el coeficiente de variación porcentual:

Interpretación: como el CV% es mayor al 20%, la distribución de “montos depositados por un


comercio” no es homogénea, y por lo tanto la media aritmética no es representativa de los datos.

f. Realice una tabla de frecuencias e interprete.

| Estadística
5/ 23
Si tomamos la quinta fila podemos interpretar:

fa5 = 1 día: en un día se depositaron exactamente $1800.


Fa5 = 7 días: en siete días se depositaron $1800 o menos. En siete días se depositaron a lo
sumo $1800. En siete días se depositaron como máximo $1800.

Ga8 = 9 días: en nueve días se depositaron $1800 o más. En nueve días se depositaron
por lo menos $1800. En nueve días se depositaron como mínimo $1800. fr5 = 0,0667: el
0,0667 partes de los días se depositaron exactamente $1800. fr%5 = 6,67%: el 6,67% de
los días se depositaron exactamente $1800.

Fr%5 = 46,67%: el 46,67% de los días se depositaron $1800 o menos. El 46,67% de los
días se depositaron a lo sumo $1800. El 46,67% de los días se depositaron como máximo
$1800. Gr%8 = 60%: el 60% de los días se depositaron $1800 o más. El 60% de los días se
depositaron por lo menos $1800. El 60% de los días se depositaron como mínimo $1800.

(1) Algunos autores consideran que en tan pocos números y con tan baja repetición no se debería considerar
que el valor 1,6 es el modo.

2.4 Tratamiento del conjunto de datos -2

2.4.2 Datos agrupados por frecuencia se utiliza cuando se tiene una cantidad de datos

| Estadística
6/ 23
más grande que la anterior y la mayoría de los valores de la variable se repiten.

Ejemplo secontabiliza
la cantidadde cajas de lámparasbajo consumo
vendidas por un mayorista a 40 comercios, en el último mes; los datos son
los siguientes:

Como se puede observar la distribución de las ventas de las cajas de lámparas de bajo
consumo es mayor de 20 y la mayoría de los valores se repiten, por estos motivos es
conveniente agruparlos por la frecuencia de presentación:

Cantidad de cajas (xi ) 1 2 3 4 5 6 7 8 9


10 Cantidad de comercios (fai ) 1 1 2 5 4 8 9
7 2 1

Primero definir los siguientes ítems:

Variable: cajas vendidas a comercios minoristas


Tipo de variable: cuantitativa discreta
Unidad de medida: cajas
Unidad de análisis: comercios (observe que la unidad de
análisis coincide con la frecuencia)

Cantidad de datos: N = 40

Se desea saber:

a. ¿Cuál es la venta promedio del mes?

cajas por comercio

Interpretación: El promedio de cajas vendidas a comercios minoristas es de 6,1 cajas.

b. ¿Cuál es la venta de cajas más frecuente?

Cantidad de cajas (xi ) 1 2 3 4 5 6 7 8 9


10 Cantidad de comercios (fai ) 1 1 2 5 4 8 9
7 2 1

| Estadística
7/ 23
Se observa en la tabla que el valor más frecuente es 7 cajas vendidas en 9 comercios:

Mo = 7 cajas

Interpretación: hubo más comercios con 7 cajas compradas.

c. ¿Cual es el valor central?

1°. Se obtiene el orden de la mediana:

2°. Para obtener el valor de la mediana, hay que observar la de frecuencia absoluta acumulada por
izquierda (Fai) en la siguiente tabla:

Cantidad de cajas (xi ) 1 2 3 4 5 6 7 8 9 10


Cantidad de comercios (fai ) 1 1 2 5 4 8 9 7 2 1
Frecuencia acumulada (Fai) 1 2 4 9 13 21 30 37 39 40

Vemos que la primera frecuencia que supera al 20º lugar es la que corresponde al valor 6 de la
variable, en este caso 21, por lo tanto la mediana es: Ma = 6 cajas vendidas

Interpretación: El 50% de los comercios compraron hasta 6 cajas de lámparas de bajo consumo y
el otro 50% compraron 6 o más cajas.

d. Calcule las dos medidas de variabilidad absoluta

- Variancia cajas2

- Desvío estándar cajas

e. ¿Es la distribución de cajas vendidas homogénea?

Para contestar esta pregunta es necesario conocer el coeficiente de variación porcentual

Interpretación: El CV% es mayor del 20% y se puede afirmar que la distribución de “las cajas de
lámparas de bajo consumo vendidas a comercios minoristas” no es homogénea, y por lo tanto la
media aritmética no es representativa de los datos.

f. Realice una tabla de frecuencias e interprete.

| Estadística
8/ 23
Si tomamos la quinta fila (i = 5) podemos interpretar:

fa5 = 4 comercios: Hay cuatro comercios que compraron exactamente 5 cajas. Fa 5


= 13 comercios: Trece comercios compraron 5 o menos cajas. Trece comercios
compraron a lo sumo 5 cajas. Trece comercios compraron como máximo 5.

Ga6 = 31 comercios: Hay 31 comercios que compraron 5 o más cajas. Hay 31


comercios que compraron por lo menos 5 cajas. Hay 31 comercios que compraron

como mínimo 5 cajas. fr5= 0,1: El 0,1 de los comercios compraron exactamente 5

cajas. fr%5 = 10%: El 10% de los comercios compraron exactamente 5 cajas.

Fr%5 = 32,5%: El 32,5% de los comercios compraron 5 cajas o menos. El

32,5% de los comercios compraron a lo sumo 5 cajas. El 32,5% de los comercios compraron
como máximo 5 cajas.

Gr%6 = 77,5%: El 77,5% de los comercios compraron 5 cajas o más. El 77,5% de


los comercios compraron por lo menos 5 cajas. El 77,5% de los comercios
compraron como mínimo 5 cajas.

g. Realice un gráfico de la frecuencia absoluta simple y de la acumulada.

Para la frecuencia absoluta o relativa simple se realiza un gráfico de bastones por ser la variable
cuantitativa discreta

| Estadística
9/ 23
Nota: las barras son de trazo fino

Para la frecuencia absoluta o relativa acumulada se realiza un gráfico escalonado por ser la variable
cuantitativa discreta

2.4 Tratamiento del conjunto de datos - 3

2.4.3 Datos agrupados en una tabla de distribución de frecuencia con intervalos

Ejemplo:

En una empresa importadora se considera la posibilidad de abrir una sucursal en una ciudad capital del
interior, con este objetivo se recolectan los datos de las importaciones realizadas con países limítrofes en

| Estadística
10/ 23
los últimos diez años y una de las variables de interés es la duración en horas del trámite aduanero. Se
recolectan los siguientes datos.

Como se tiene una cantidad importante de datos, los valores de la variable se encuentran en un rango
amplio, el menor es 18 y el mayor 58, y los valores no todos se repiten, se agrupan por intervalo.

Para armar cada intervalo o clase se debe considerar el valor máximo y mínimo del conjunto de datos, el
primer intervalo debe contener al valor mínimo y el último debe contener al máximo; cada intervalo tiene
un límite inferior que pertenece al mismo y un límite superior que no pertenece, por ejemplo en el
intervalo 18 – 24 se cuentan todas las importaciones cuya duración del trámite aduanero duró desde 18
horas (inclusive) hasta 24 horas sin tomar el 24, este valor se cuenta en el intervalo siguiente,
matemáticamente es un intervalo cerrado a izquierda y abierto a derecha.

En el ejemplo del intervalo 18 – 24 se contaron los valores: 18 – 19 – 20 – 20 – 21


– 21 – 21 – 21 – 21 – 21 – 21 – 22 – 23 – 23 – 23 – 23 – 23, en total 17 observaciones.

La agrupación de datos por intervalo es la siguiente:

X 18 - 24 24 - 30 30 - 36 36 - 42 42 - 48 48 - 54 54 - 60 fa 17
24 26 21 12 10 10

Primeramente se debe tener en claro lo siguiente:

Variable: horas de duración del trámite aduanero


Tipo de variable: cuantitativa continua
Unidad de medida: horas

| Estadística
11/ 23
Unidad de análisis: importación (observe que la unidad de análisis coincide con la frecuencia )
Cantidad de datos: N = 120

Se desea saber:

a. ¿Cuál es la duración promedio del trámite?

Al tener los datos agrupados por intervalo se necesita tener un valor que los represente en cada uno y

se toma el punto medio , quedando la siguiente tabla:

X 18- 24 24 - 30 30 - 36 36 - 42 42- 48 48- 54 54- 60


P 21 27 33 39 45 51 57
f
M 17 24 26 21 12 10 10
a

horas

Interpretación: El promedio de duración del trámite aduanero es de 35,85 horas.

b. ¿Cuál es la duración más frecuente?

Como se puede observar en la tabla, el intervalo más frecuente es de 30 a 36 años en el cual se contaron
26 importaciones, por lo tanto el intervalo modal es 30 - 36

X fa Fa
18 - 24 17 17
24 - 30 24 41
30 - 36 26 67
36- 42 21 88
42 - 48 12 100
48 - 54 10 110
54 - 60 10 120

El valor del modo se obtiene con la siguiente fórmula:

Límite inferior del intervalo

La diferencia 1 es igual a la frecuencia del


frecuencia del intervalo anterior intervalo menos la

frecuencia del intervalo siguiente


| Estadística
12/ 23
Límite inferior del intervalo La diferencia 2 es igual a la frecuencia del intervalo menos la

La longitud o amplitud del intervalo es

La frecuencia del intervalo


igual al Límite superior menos el Límite
inferior

horas

Interpretación: Hay más importaciones con una duración del trámite aduanero de 31,71 horas.

c. ¿Cual es el valor central?

Se obtiene el orden de la mediana:

Se puede observar en la tabla, en la frecuencia acumulada, cual es la primera que contiene al 60, por lo
tanto el intervalo de la mediana es 30 - 36

X fa Fa
18 - 24 17 17
24 - 30 24 41
30 - 36 26 67
36- 42 21 88
42 - 48 12 100
48 - 54 10 110
54 - 60 10 120

El valor de la mediana se obtiene

La frecuencia acumulada del intervalo anterior

, a es la longitud del intervalo y es igual al Límite superior menos el Límite


inferior

horas

| Estadística
13/ 23
Interpretación: El 50% de las importaciones tienen una duración del trámite de hasta 34,38 horas y el
otro 50% tiene 34,38 o más horas.

d. Indique las dos medidas de variabilidad absoluta

Variancia:

horas2

Desvío estándar: es horas

e. ¿Es la distribución de la duración del trámite homogénea?

Para contestar esta pregunta es necesario conocer el coeficiente de variación porcentual

Interpretación: El CV% es mayor del 20% y se puede afirmar que la distribución de “la duración del
trámite aduanero” no es homogénea, y en consecuencia la media aritmética no es representativa de los
datos.

i X fa Fa Ga fr fr% Fr% Gr%


1 18 - 24 17 17 120 0,1417 14,2 14,2 100,0
2 24 -30 24 41 103 0,200 20,0 34,2 85 , 8
3 30 - 36 26 67 79 0,2167 21,7 55,8 65 , 8
4 36 - 42 21 88 53 0,1750 17,5 73,3 44 , 2

5 42 - 48 12 100 32 0,1000 10,0 83,3 26 , 7


6 48 - 54 10 110 20 0,0833 8,3 91,7 16 , 7

7 54 - 60 10 120 10 0,0833 8,3 100,0 8,3


Total 120 1 100
f. Realice una tabla de frecuencias e interprete.
Si tomamos la segunda fila podemos interpretar: fa 2 = 24 importaciones: Hay 24 importaciones que
tienen una duración del trámite exactamente entre
24 y 30 horas.
Fa2 = 41 importaciones: 41 importaciones tienen una duración del trámite de menos de 30 horas. 41
importaciones tienen una duración del trámite de a lo sumo 30 horas. 41 importaciones tienen una
duración del trámite de como máximo 30 horas. 41 importaciones tienen una duración del trámite de
entre 18 y 30 horas.

| Estadística
14/ 23
Ga6 = 103 importaciones: 103 importaciones tienen una duración del trámite de 24 o más horas. 103
importaciones tienen una duración del trámite de por lo menos 24 horas. 103 importaciones tienen una
duración del trámite de como mínimo 24 horas. 103 importaciones tienen una duración del trámite de

entre 24 y 60 horas. fr2 = 0,2: El 0,2 de las importaciones tienen una duración del trámite exactamente

entre 24 y 30 horas. fr%2 =20%: El 20% de las importaciones tienen una duración del trámite
exactamente entre 24 y 30 horas.

Fr%2 =34,2%: El 34,2% de las importaciones tienen una duración del trámite de menos de 30 horas. El

34 ,2% de las importaciones tienen una duración del trámite de a lo sumo 30 horas. El 34,2% de las
importaciones tienen una duración del trámite de como máximo 30 horas. El 34,2% de las importaciones
tienen una duración del trámite de entre 18 y 24 horas.

Gr%6 = 85,8%: El 85,8% de las importaciones tienen una duración del trámite de más de 24 horas. El

85 ,8% de las importaciones tienen una duración del trámite de por lo menos 24 horas. El 85,8% de las
importaciones tienen una duración del trámite de como mínimo 24 horas. El 85,8% de las importaciones
tienen una duración del trámite de entre 24 y 60 horas.

2.4 Tratamiento del conjunto de datos -4

g. Calcule el percentil 40, el percentil 25 y el percentil 75

Los percentiles o centiles son medidas de posición no central, como en la mediana se debe obtener
el orden o lugar para indicar la posición, buscando en la frecuencia acumulada.

Percentil 40: se obtiene el orden del percentil por lo tanto el percentil


40 se encuentra en el intervalo 30 – 36

| Estadística
15/ 23
Interpretación: El 40% de las importaciones tienen una duración del trámite de hasta 31,62 horas,
el otro 60% duran 31,62 horas o más.

Percentil 25 también llamado cuartil 1: se obtiene el orden del percentil ,

por lo tanto el percentil 25 se encuentra en el intervalo 24 - 30

Interpretación: El 25% de las importaciones tienen una duración del trámite de hasta 27,25 horas,
el otro 75% duran 27,25 horas o más.

| Estadística
16/ 23
Percentil 75 también llamado cuartil 3: se obtiene el orden del percentil

por lo tanto el percentil 75 se encuentra en el intervalo 42 - 48

Interpretación: El 75% de las importaciones tienen una duración del trámite de hasta 43 horas, el
otro 25% duran 43 horas o más.

h. Calcule el porcentaje de importaciones en que la duración del trámite es de hasta 50 horas


y 21 horas

En este caso se debe encontrar el valor de K

Para el valor 50 horas le corresponde el intervalo 48 - 54

Se realiza el despeje

El valor de la
variable de 50 horas ocupa el lugar 103,33

| Estadística
17/ 23
Interpretación: El 86,1% de las importaciones tienen una duración del trámite de hasta 50 horas y
el otro 13,9% duran 50 o más horas.

Para el valor 21 horas le corresponde el intervalo 18 - 24

Se realiza el despeje

El valor 21 horas ocupa el lugar 8,5

Interpretación: El 7,1% de las importaciones tienen una duración del trámite de hasta 21 horas y
el otro 92,9% tienen 21 o más horas.

i. Indique la asimetría de la distribución

Se considera la regla empírica que compara tres medidas de posición central: media aritmética,
mediana y modo. Se ordenan estos valores de menor a mayor:

Utilizando el coeficiente de asimetría de Pearson:

| Estadística
18/ 23
Por ambos métodos, regla empírica o coeficiente de asimetría de Pearson, nos indica que la
distribución se concentra en los valores bajos de la variable, la asimetría es a derecha y el
sesgo es positivo.

Interpretación: Hay más cantidad de importaciones cuyo trámite es rápido, es decir tiene una
duración corta.

j. Realice un gráfico de la frecuencia absoluta simple y de la acumulada.

| Estadística
19/ 23
k. Realice un gráfico que reúna las medidas de posición

El gráfico que muestra las medidas de posición es el Box-plot o diagrama de caja –bigote, en su
construcción se usan tres medidas de posición: mediana, 1º cuartil y 3º cuartil, y los valores
máximo y mínimo. El beneficio de este gráfico es que permite tener información de la
tendencia central, dispersión, simetría y valores extremos o
atípicos.

El gráfico consiste en un rectángulo o caja de cuyos lados


superior e inferior se derivan dos segmentos. Las partes del
gráfico se obtienen teniendo los siguientes datos: mediana,
1 º cuartil y 3º cuartil, rango intercuartílico y los valores
máximo y mínimo. En nuestro ejemplo los datos son los
siguientes:

a. Tercer cuartil: Q3 = 43 horas


b. Mediana: Ma = 34,38 horas
c. Primer cuartil: Q1 = 25,25 horas
d. RI: rango intercuartílico = Q3 – Q1 = 43 horas -
25 ,25 horas = 17,75 horas
e. Valor máximo: 58 horas
f. Valor mínimo: 18 horas
g. Límite superior: es el extremo superior del bigote
Q3 + 1,5RI = 43 horas + 1,5 • 17,75 horas =
69,625

| Estadística
20/ 23
h. Limite inferior: es el extremo inferior del bigote
Q1 - 1,5RI = 25,25 horas –1,5 • 17,75 horas = -1,375
i. Valores extremos o atípicos: datos que están apartados del cuerpo principal del
conjunto de datos. Pueden representar efectos de causas extrañas, opiniones
extremas o en el caso de la tabulación manual, errores de medición o registro. Se
representan con un asterisco (*) o puntos (.) y son los que se encuentran antes del
límite inferior o después del límite superior.

j. Media aritmética: originalmente no forma parte del box-plot, sin embargo, se


consideró su inclusión para dar una idea del puntaje general obtenido por pregunta.

El gráfico box-plot tiene una interpretación más profunda que un gráfico convencional:

Cuánto más larga es la caja y los bigotes, más dispersa es la distribución de


datos. La cantidad de elementos entre las cinco medidas usadas (mediana, 1º
cuartil y 3º cuartil, y los valores máximo y mínimo) es aproximadamente la misma,
aunque la distancia puede variar. Se considera aproximado porque pudiera haber valores
atípicos, en cuyo caso la cantidad de elementos se ve levemente modificada.

La línea que representa la mediana indica la simetría. Si está relativamente en el centro


de la caja la distribución es simétrica. Si por el contrario se acerca al primer o tercer
cuartil, la distribución pudiera ser sesgada a la derecha (asimétrica positiva) o sesgada a
la izquierda (asimétrica negativa respectivamente.

Los siguientes ejemplos muestran la curva de una distribución teórica y su gráfico de boxplot:

En una distribución
en forma de
campana el
gráfico es
simétrico, la
mediana se
ubica en el
centro y los
bigotes son
largos en
comparación
con la caja.

| Estadística
21/ 23
En una distribución
asimétrica a izquierda la
mediana no se encuentra
en el

centro del gráfico, el bigote y la parte de la caja que se encuentra a la izquierda de la mediana
son más largos que los que están a derecha.

En una distribución
asimétrica a derecha la

mediana no se
encuentra en el
centro del gráfico,
el bigote y la
parte de la caja
que se encuentra
a la derecha de la
mediana son más
largos que los que
están a izquierda.

| Estadística
22/ 23
En una distribución rectangular cada
parte del gráfico es de igual largo.

En nuestro ejemplo de las horas de duración del tramite aduanero. El gráfico de box-plot es el
siguiente:

Gráfico realizado con el programa Minitab.

| Estadística
23/ 23

También podría gustarte