0% encontró este documento útil (0 votos)
14 vistas22 páginas

Introducción a la Estadística y sus Métodos

La estadística es la ciencia que se encarga de recopilar, organizar, analizar e interpretar datos para facilitar la toma de decisiones. Se divide en estadística descriptiva, que describe y organiza datos, y estadística inferencial, que permite hacer deducciones sobre una población a partir de una muestra. Además, se introducen conceptos como variables cualitativas y cuantitativas, así como la importancia de las distribuciones de frecuencias para la organización de datos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
14 vistas22 páginas

Introducción a la Estadística y sus Métodos

La estadística es la ciencia que se encarga de recopilar, organizar, analizar e interpretar datos para facilitar la toma de decisiones. Se divide en estadística descriptiva, que describe y organiza datos, y estadística inferencial, que permite hacer deducciones sobre una población a partir de una muestra. Además, se introducen conceptos como variables cualitativas y cuantitativas, así como la importancia de las distribuciones de frecuencias para la organización de datos.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

1.

CONCEPTOS INTRODUCTORIOS

NOCIONES BASICAS DE ESTADISTICA

¿Qué es la Estadística?

Es la ciencia que trata de los métodos para:

Recopilar
Organizar
Analizar
Interpretar
datos, con el objeto de tomar decisiones más eficaces.

La Estadística sirve para la descripción y también para la realización de


inferencias. Dos ramas distintas del saber confluyeron en el siglo XIX para llegar
a lo que es hoy el saber estadístico: la estadística antigua y la teoría de
probabilidades. Etimológicamente, la palabra estadística proviene de la palabra
“estado” y se usó de esta forma porque en la antigüedad romanos y egipcios
comenzaron a determinar el estado en que se encontraban sus naciones, ya sea
en términos de habitantes o de posesiones. Para ello recolectaban datos y
trataban de resumirlos de forma de hacer comprensible la información recogida.

Está claro que las conclusiones eran aplicables al conjunto de datos


obtenidos. Lo que permitió el cálculo de probabilidades es el desarrollo de un
conjunto de métodos para poder extrapolar las conclusiones a entidades no
observadas. Es decir, posibilitó el instrumento adecuado para poder hacer
inferencias acerca de grandes cantidades de observaciones potenciales a partir de
unas pocas observaciones reales.

La estadística se divide en descriptiva e inferencial.

La estadística descriptiva, como lo indica la palabra, se ocupa de describir,


organizar y analizar datos. Esto se puede hacer realizando gráficos, distribuciones
de frecuencias, calculando medidas de tendencia central, dispersión de los datos y
otros, pero sólo utilizando algunas técnicas algebraicas.

La estadística inferencial consiste de procedimientos que sirven para


deducir algo acerca de un conjunto de datos (población) seleccionando un
número menor de ellos (muestra).

Tomemos el siguiente ejemplo:

1
Se desea analizar el tipo de lesión sufrida por los obreros de la construcción
accidentados durante 2004 en Capital Federal. Para ello, se registra, para 120
obreros elegidos al azar, si su lesión fue leve, moderada, grave o mortal.

Aquí hay un cúmulo de conceptos que debemos definir:

-La característica en estudio se denomina una variable.

En nuestro ejemplo la variable (llamémosla X) es el tipo de lesión sufrida por un


obrero de la construcción accidentado durante 2004 en Capital Federal. Como
podemos darnos cuenta, los valores que toma esta variable son atributos, o sea,
nos dice de qué tipo fue la lesión (leve, moderada, etc.). Esto define a la variable
como cualitativa ya que los valores que toma no son números. Si fuera así, la
variable sería cuantitativa.

Los otros conceptos involucrados en el ejemplo son:

-Población de individuos: son todos los obreros de la construcción accidentados


en Capital Federal durante 2004.

-Muestra de individuos: son los 120 obreros a los que efectivamente se les
estudió el tipo de lesión.

-Población de observaciones: es el tipo de lesión de cada uno de los individuos


de la población. Evidentemente, uno no cuenta con toda la población de
observaciones pues, en este caso, sólo ha estudiado 120 individuos.

-Muestra de observaciones: son los 120 tipos de lesiones correspondientes a los


120 individuos de la muestra.

Hemos hablado de dos tipos de variables: cualitativas y cuantitativas.

Veamos algunos ejemplos de cada una de ellas. Son variables cualitativas la


religión, el sexo, el color de ojos, el tipo de auto, el estado civil, etc. Aquello que
constituye un atributo.

Son variables cuantitativas el peso, la altura, el número de hijos en una


familia, saldos en cuentas corrientes, edad, etc. Aquello que se expresa con un
número.

Una variable que puede asumir cualquier valor entre dos valores dados se
llama continua. Por ejemplo, la altura de una serie de individuos. Si no es así, se
llama discreta. Por ejemplo, el número de hijos en una familia.

2
Recordemos una notación que abreviará mucho la escritura de diversas
fórmulas.

Es el símbolo de suma (∑).

Veamos algunos ejemplos:


N

∑X
i =1
i = X1 + X 2 + K + X N

∑ (2 + j ) = (2 + 1) + (2 + 2) + (2 + 3) = 12
j =1

5
3∑ 4k = 3(4.3 + 4.4 + 4.5) = 3(48) = 144
k =3

∑ (−1)
i=1
i
= (−1)1 + (−1) 2 + (−1)3 + (−1) 4 = −1 + 1 − 1 + 1 = 0

DISTRIBUCIONES DE FRECUENCIAS

Una distribución de frecuencias es un agrupamiento de datos en


categorías que muestran el número de observaciones en cada categoría
mutuamente excluyente, es decir, sin superposiciones.

Una distribución de frecuencias indica el número de veces que ocurre cada


valor o dato en cada clase.

Los datos como son tomados aparecen “en bruto”. La primera cosa que uno
debe hacer es organizarlos.

Una vez que los datos han sido clasificados y ordenados, están listos para
ser organizados en forma tabular.

Las normas generales para realizar esto son:

a)La tabla debe ser lo más simple posible. Serán preferibles dos o tres tablas
pequeñas a una única tabla grande que contenga muchos detalles o variables.

b)La tabla debe explicarse por sí misma. Para tal fin:

[Link] se usan claves, abreviaturas o símbolos, deberán detallarse en nota al pie


de página.

3
[Link] fila y cada columna deben ser titulados concisa y claramente.

[Link] ser incluidas las unidades específicas de medida que corresponden a los
datos.

[Link] título de la tabla debe ser claro, conciso y exacto. Un buen título responderá a
la pregunta ¿qué?, ¿cuándo? y ¿dónde?

[Link]án consignarse los totales.

c)Comúnmente el título está separado del cuerpo de la tabla por líneas o espacios.

El número de veces que aparece un valor determinado de una variable se


llama la frecuencia absoluta.

Supongamos ni es la frecuencia absoluta de la modalidad ai o del valor xi.


La suma de todas las frecuencias absolutas será igual al número total de
elementos. Lo llamamos N.

La frecuencia relativa fi será igual a ni/N. Es una proporción de elementos.

Si multiplicamos la frecuencia relativa por 100, obtendremos la frecuencia


porcentual. O sea: si trabajamos con 120 elementos; sabemos que 80 de ellos
cumplen una condición (a1) y 40 cumplen una condición (a2) diremos que:

- la frecuencia absoluta de a1 es 80 y la frecuencia absoluta de a2 es 40.

- la frecuencia relativa de a1 es 80/120=0,666 y la frecuencia relativa de a2 es


40/120=0.333.

O sea:

De 120 elementos------------80 son del tipo a1


De 100 elementos------------ x =100 x (80/120)=100 x f1 =66,6

Es decir, el 66,6% son del tipo a1 y el 33,3% son del tipo a2.

4
Entonces:

Frecuencia absoluta fi= frecuencia


relativa Frecuencia porcentual
a1 80 80/120 (80/120)x100
a2 40 40/120 (40/120)x100
N =120 Total =1 Total =100

También podemos evaluar la frecuencia acumulada. Para ello ordenamos


en sentido creciente o decreciente los valores de una variable. La frecuencia
acumulada es la suma de frecuencias hasta un valor determinado de la variable.

Ejemplo:
Se hizo un censo en 35 casas de un barrio de la Provincia de Buenos Aires
y se preguntó cuánta gente habitaba en cada casa.

Había:
8 casas con 2 personas
12 casas con 3 personas
9 casas con 4 personas
4 casas con 5 personas
2 casas con 6 personas

Ordenamos los datos en una tabla, calculando frecuencias absolutas, relativas,


porcentuales y acumuladas.

Nro. De Frecuencias Frecuencias Frecuencias Frecuencias


personas absolutas relativas porcentuales acumuladas
2 8 8/35=0.228 22.8%~23% 8
3 12 12/35=0.342 34.2%~34% 8+12=20
4 9 9/35=0.257 25.7%~26% 20+9=29
5 4 4/35=0.114 11.4%~11% 29+4=33
6 2 2/35=0.057 5.7%~6% 33+2=35

La interpretación de las frecuencias acumuladas es la siguiente:

-El número de casas que tienen 3 personas o menos es 20.

-Hay 29 casas que tienen 2, 3 o 4 personas.

-Las casas que tienen hasta 5 personas son 33.

-Las casas que tienen hasta 6 personas es el total, o sea, 35. No hay casas con
más de 6 personas.

5
Una forma inmediata de visualizar las distribuciones de frecuencias es
mediante gráficos. Tres de los más usuales cuando los datos no vienen agrupados
son los diagramas circulares, los de barras y los de bastones. Los diagramas
circulares se suelen usar cuando la variable en estudio es cualitativa. Los de
barras y bastones para variables cuantitativas.

En un diagrama circular, se realiza un círculo (o “torta”) que queda dividido


en tantas porciones como valores toma la variable. Cada porción es proporcional
a la frecuencia porcentual del valor en cuestión. Se determina un ángulo que es
una parte proporcional al de 360º y que corresponde a la circunferencia completa.

El diagrama de barras se realiza sobre un sistema de ejes donde los


valores de la variable se colocan sobre uno de los ejes y las frecuencias sobre el
otro. Lo mismo sucede con el diagrama de bastones, los cuales son barras
delgadísimas y se suelen usar para variables discretas. Es así como los bastones
están apoyados directamente sobre el punto que representa el valor de la variable.

Ejemplo
En los hospitales A y B de la Capital Federal se registró, durante una
semana, el lugar de residencia de los pacientes atendidos en el servicio de
cardiología. Los datos obtenidos fueron:

Hospital A Hospital B
Capital Federal 361 250
Prov. De Buenos Aires 95 300
Otros 194 260

Se desea tener el diagrama circular correspondiente a cada distribución.

Hospital A

Otros
30% Capital
Capital Pcia. Bs. As.
55% Otros
Pcia. Bs. As.
15%

Lo mismo haríamos con el Hospital B. El gráfico se obtuvo con el programa Excel.

Ejemplo

6
En un laboratorio de prueba, 20 piezas de un determinado material recibirán
tratamientos de endurecimiento. Hay 2 procedimientos distintos que se aplicarán,
cada uno de ellos, a 10 piezas. Al final del tratamiento se evalúa la dureza
estableciéndose un puntaje. A mayor puntaje, mayor dureza. Los resultados
obtenidos son resumidos a continuación:

Procedimiento A Procedimiento B
Puntaje Frecuencia Puntaje Frecuencia
3 4 3 1
4 1 4 1
5 3 5 2
6 1 6 5
7 1 7 1

El siguiente es un diagrama de barras comparativo para los datos de los


tratamientos A y B.

Gráfico comparativo de dureza

6 5
Frecuencia

4
4 3 Procedimiento A
2
2 1 1 1 1 1 1 Procedimiento B
0
1 2 3 4 5
Puntaje

Otro ejemplo.
Se pidió a cada miembro de una muestra de 120 profesionales que dijeran qué
título universitario habían recibido. Los resultados se muestran en la tabla que
sigue:

Título obtenido Frecuencia


Veterinario 3
Agrónomo 11
Médico 27
Abogado 41
Contador 20
Ingeniero 18

El diagrama de barras correspondiente es el siguiente:

7
Distribución de profesiones

50
40
Cantidad 30
20
10
0
io

o
do

or

er
ar

d
a

ni
ta
rin

og

ge
on
te

Ab

In
C
Ve

Profesión

Agrupación en intervalos de clases.

Agrupar en intervalos de clases implica hacer una ruptura en la escala y


dividir los datos en clases mutuamente excluyentes.

El problema reside en determinar los intervalos. Si éstos son muy grandes,


es muy poca la información que se puede lograr. Si los intervalos son muy
pequeños, se desvirtúa el objetivo del agrupamiento, ya que trabajaríamos casi
con los datos como los hemos medido.

Generalmente se usa el sentido común para determinar la amplitud de los


intervalos y el número de intervalos con los que queremos trabajar. Todos los
datos deben estar en algún intervalo o clase.

Cada clase tiene dos límites: un límite superior y un límite inferior. El límite
inferior de la primera clase suele ser ligeramente inferior que la observación más
baja. Luego, se suelen tomar intervalos de la misma longitud. Para facilitar el
análisis de los datos se acostumbra ordenarlos de menor a mayor. El límite
superior de la última clase debe ser mayor o igual que el mayor de los datos.

Aquí debemos hacer una aclaración. A veces se habla de límites


declarados y de límites verdaderos. Nosotros sólo trabajaremos con estos últimos.
Así, si un intervalo de clase tiene límites 2-4, el siguiente intervalo tendrá como
límite inferior el 4 y tomaremos como regla que si un dato fuera igual a 4 lo
pondríamos en el segundo intervalo. O sea, cada intervalo contiene a su extremo
inferior, pero no a su extremo superior. De esta forma los intervalos no se
superponen, pero tampoco quedan valores intermedios entre límites superior e
inferior de intervalos sucesivos.

8
El tamaño del intervalo de clases puede calcularse, si se ha establecido el
número de clases como:

Valor más alto – valor más bajo


Número de clases

Ejemplo
Se presenta a continuación el registro del octanaje de 40 muestras de
combustible, aproximadas al valor entero superior. Se desea la distribución de
frecuencias agrupadas en 7 intervalos.
La tabla contiene los datos de octanaje.

22 30 46 41
35 38 49 48
48 56 57 34
46 58 35 26
55 27 39 57
32 69 29 53
49 72 50 49
56 55 59 55
25 58 55 64
66 60 47 68

Lo primero que hacemos es ordenar los valores de menor a mayor.

La tabla resultante es:


22 38 49 57
25 39 50 58
26 41 53 58
27 46 55 59
29 46 55 60
30 47 55 64
32 48 55 66
34 48 56 68
35 49 56 69
35 49 57 72

El valor más alto es 72.


El valor más bajo es 22.
El tamaño de clase podemos calcularlo como 72-22 =7.14
7

9
Podemos usar el 7.14, o un número próximo más manejable; por ejemplo, 7.5.

Podemos comenzar el primer intervalo con 21.5. Así, quedaría la siguiente tabla,
contando cuántos valores hay en cada intervalo:

INTERVALO FRECUENCIA
21.5 - 29 5
29 - 36.5 5
36.5 - 44 3
44 - 51.5 9
51.5 - 59 12
59 - 66.5 3
66.5 - 74 3

El punto medio de una clase o marca de clase, se determina localizando la


mitad entre los límites de clase. Se obtiene sumando los límites inferior y superior
del intervalo de clase y dividiendo por 2.

En nuestro ejemplo los puntos medios son:

(21.5 + 29)/2=25.25
(29 + 36.5)/2=32.75
(36.5 + 44)/2=40.25
(44 + 51.5)/2=47.75
(51.5 + 59)/2=55.25
(59 + 66.5)/2=62.75
(66.5 + 74)/2=70.25

Histograma

Es un diagrama de rectángulos cuya altura es proporcional a la frecuencia


de la clase que representa. Los rectángulos son verticales y adyacentes. En el eje
horizontal se marcan los puntos medios de los intervalos. La base de los
rectángulos tiene como medida el tamaño de clase. En nuestro ejemplo, el tamaño
es 7.5, o sea, 3.75 a la izquierda y 3.75 a la derecha del punto medio.

El siguiente diagrama fue realizado con el software Statistix.

10
También podemos construir la poligonal. Para ello se toman los puntos
cuya coordenada x es el punto medio o el límite inferior de la clase y la
coordenada y es la frecuencia de la clase. Uniendo esos puntos se obtiene la
poligonal. La frecuencia sobre la cual se construye la poligonal puede ser, desde
ya, la frecuencia absoluta, relativa, porcentual, acumulada absoluta, relativa o
porcentual.

Veamos en nuestro ejemplo la poligonal para las frecuencias acumuladas


porcentuales.

INTERVALO FRECUENCIA ACUMULADA


21.5 - 29 12.5
29 - 36.5 25
36.5 - 44 32.5
44 - 51.5 55
51.5 - 59 85
59 - 66.5 92.5
66.5 - 74 100

11
Grafico de frecuencias porcentuales acumuladas

100
Frecuencias porcentuales

80

60

40

20

0
25.25 32.75 40.25 47.75 55.25 62.75 70.25
Octanaje

Diagrama de tallo y hojas.

Su obtención requiere separar cada dato en 2 partes: el primer o primeros


dígitos reciben el nombre de tallo. El dígito o dígitos restantes reciben el nombre
de hojas.

Ejemplo: el dato 56 se puede separar en 5(tallo) y 6 (hoja). El dato 561 se


puede separar en 5(tallo) y 61(hojas) o en 56(tallo) y 1(hoja). Eso depende del
problema:

Los pasos a seguir son:

a)Identificar los valores máximos y mínimos observados.

b)Decidir acerca de cuántos dígitos tendrá el tallo.

c)Ordenar los valores de menor a mayor.

d)Listar los tallos distintos en una columna ordenados de forma creciente.

e)Escribir cada hoja junto al tallo que le corresponda, preferiblemente ordenados


según el valor.

12
Para ejemplificar esto trabajemos con el caso anterior. Elegimos el dígito
que ocupa el lugar de la decena como tallo y el restante como hoja.

Tendríamos lo siguiente:

2 25679
3 0245589
4 16678999
5 0355556677889
6 04689
7 2

Tiene similitud con un diagrama de barras. Es un gráfico, pero a la vez muestra los
valores. Se pierde menos información.

MEDIDAS DE TENDENCIA CENTRAL Y DISPERSION

Hasta ahora hemos hecho una descripción de los datos y establecido con
qué frecuencia se presentan.

A veces los datos se acumulan alrededor de un valor central situado entre


dos extremos de la variable que se estudia. Nos interesará saber cuál es ese valor
central y cuán dispersos están los datos respecto de ese valor hallado.

Generalmente leemos datos en los que se nos habla de “promedio”. Esto se


refiere a un tipo de medida de tendencia central y hay varias, como veremos
ahora.

La más usual, y que se asimila a la palabra promedio es la media


aritmética. La media (aritmética) de una muestra se calcula sumando todos los
valores de la muestra y dividiendo por el número de valores de ésta.

Se escribe así:

∑x i
x= i =1

13
Ejemplo:

Se han medido en gramos las determinaciones de albúmina total circulante


en 30 varones normales entre 20 y 29 años de edad. Se desea saber cuál es el
valor medio correspondiente a estos valores.

116 146 136 119 106 118


118 153 143 122 116 139
127 106 145 129 120 122
130 114 146 133 124 141
133 131 144 146 133 141

Para hallar la media hay que sumar todos los valores y dividir por 30.

30

∑x
i =1
i = 3897 g

3897
x= = 129.9 g
30

Esta forma de cálculo sirve cuando se tienen los datos dados directamente
por las observaciones. Pero ya vimos que a veces podría ser que tuviéramos la
distribución de frecuencias de la muestra y que no tuviéramos, o no nos interesa
tanto, cada dato en particular.

En ese caso, la media aritmética se calcula por la fórmula

∑fx i i
x= i =1

donde:

fi es la frecuencia del valor de la variable xi, cuando la distribución de frecuencias


es no agrupada. En caso de ser agrupada, la fórmula es la misma solo que xi
representa la marca de la clase cuya frecuencia es fi .

14
Ejemplo:

Supongamos que los datos del ejemplo anterior vienen organizados en una
tabla de frecuencias como sigue:

x f x f
106 2 130 1
114 1 131 1
116 2 133 3
118 2 136 1
119 1 139 1
120 1 141 2
122 2 143 1
124 1 144 1
127 1 145 1
129 1 146 3
153 1

∑x i f i = 3897

3897
x= = 129.9 g
30

Supongamos ahora que los mismos datos anteriores vienen dados en una
tabla de frecuencias agrupadas en 6 intervalos. Para calcular la media, debemos
calcular la marca de clase o valor medio de cada intervalo y luego aplicar la misma
fórmula anterior.

Albúmina circulante Frecuencia Valor central del


(g) (fi) intervalo
(xi)
99.5 - 109.5 2 104.5
109.5 - 119.5 6 114.5
119.5 - 129.5 6 124.5
129.5 - 139.5 7 134.5
139.5 - 149.5 8 144.5
149.5 - 159.5 1 154.5

3895
x= = 129.8 g
30

15
Uno de los casos en los que resulta inadecuado calcular la media aritmética
como medida de tendencia central es cuando hay valores extremos, ya que la
media es muy afectada por tales valores.

Supongamos, por ejemplo, que estamos midiendo la vida útil, en horas, de


determinado componente sobre una muestra de 5 componentes. Los valores
obtenidos son: 79, 81, 76, 82 y 315. La media es 126.6. Este valor es a todas
vistas engañoso respecto de la duración del componente, ya que sólo uno de los
valores está muy elevado, pero los otros 4 no. Sin embargo, la media tiene un
valor elevado. Esto sucedió porque valores muy altos o muy bajos respecto a los
demás afectan grandemente el valor de la media.

En estos casos se suele utilizar otra medida de tendencia central llamada la


mediana.

La mediana es un valor de posición central cuando los valores están


ordenados de menor a mayor o de mayor a menor. Quiere decir que hay tantos
valores por encima de ella como por debajo de ella. O sea, es un valor que es
superado por la mitad de las observaciones, pero no por la otra mitad.

En el ejemplo de la duración de los componentes, si ordenamos éstos de


menor a mayor resulta la serie:

76 79 81 82 315
y el valor central es 81, pues han quedado 2 valores (76 y 79) por debajo de 81 y
dos valores (82 y 315) por encima de él. Evidentemente, el valor de la mediana es
más representativo de la realidad.

n +1
En general, la mediana ocupa la posición en una serie ordenada de n
2
datos. Si n es par, n + 1 es impar y la mediana se obtiene como promedio del valor
que ocupa la posición anterior y la siguiente. Por ejemplo, si en el caso anterior la
n +1
serie fuera 76 79 81 82 90 315, entonces n = 6 , = 3,5 y la mediana es el
2
promedio entre el valor que ocupa la posición 3 y el valor que ocupa la posición 4.
O sea, la mediana es 81,5.

La mediana puede calcularse también cuando los datos vienen con sus
distribuciones de frecuencia, ya sea agrupados o no. No daremos aquí las
fórmulas de cálculo de la mediana en todos los casos, ya que las fórmulas a usar
tienen alguna complicación y todos los programas utilizables en el área estadística
traen su cálculo entre las opciones de medidas de tendencia central.

16
Otras medidas de localización son los cuartiles y percentiles. Así como la
mediana divide al conjunto de datos en dos grupos de igual cantidad de
elementos, los cuartiles la dividen en 4 partes: los datos por encima del tercer
cuartil son la cuarta parte superior de los datos, el segundo cuartil coincide con la
mediana, y el primer cuartil divide la cuarta parte inferior de las tres cuartas partes
superiores. De forma similar, los percentiles separan el conjunto de datos en 100
partes iguales siendo por ejemplo el percentil 99 el que separa el 1% de los datos
más grandes del 99% restante.

Otra medida que suele usarse es la moda. Es el valor que aparece con
mayor frecuencia y es la medida de tendencia central usada si la variable
analizada es cualitativa, aunque puede también utilizarse con variables
cuantitativas.

a)Si hay un valor que se repite más veces, ese valor es la moda.

b)Si todos los valores tienen la misma frecuencia, la distribución es amodal y no


tiene mucho sentido calcularla.

c)Si hay dos valores con máxima frecuencia, la distribución es bimodal y hay dos
modas. Si éstas son adyacentes se toma la media aritmética entre ambas.
d)Si los valores están agrupados se toma como moda el punto medio del intervalo
con mayor frecuencia.

Ejemplo:
Los primeros 11 productos producidos por una línea de producción recién
inaugurada demandaron la siguiente cantidad de minutos hasta su terminación:

Producto Minutos hasta su terminación


1 29
2 14
3 11
4 24
5 14
6 14
7 28
8 14
9 18
10 22
11 14

Calcular el tiempo medio de demora en la producción en la puesta a punto de la


técnica de fabricación a través de la obtención de la media aritmética, la mediana
y la moda.

17
Media aritmética=(29+14+11+24+14+14+28+14+18+22+14)/11=18.36

Mediana:
11 14 14 14 14 14 18 22 24 28 29

Valor central: 14 (corresponde al último 14 que deja 5 valores a cada uno de sus
lados.

Moda: 14 (es el valor que más se repite en la muestra).

Aqui se nota que la media está afectada por un valor alto. Cuando esto
sucede, se prefiere tomar la mediana, por ejemplo, que es un estimador “robusto” ,
no afectado por los valores extremos.

Medidas de dispersión.

Estudiar una medida de dispersión es evaluar la confiabilidad del valor


medio que se está usando.

Si trabajamos con la media aritmética, por ejemplo, y la dispersión es


pequeña, quiere decir que los datos están acumulados alrededor de la media. Si la
dispersión es grande es que están muy desparramados y que la media obtenida
no es muy confiable.

Veamos un ejemplo. En dos plantas de una fábrica se produce el mismo


producto. Ambas trabajan a un promedio de 50 cajas por día. Sin embargo, la
planta A produce entre 48 y 52 cajas diarias y la planta B entre 40 y 60. Esto
quiere decir que la producción de la planta B es más errática y, por ende, debe
haber alguna falla en el sistema.

Hay varias formas de evaluar la dispersión de una serie de datos, pero los
más usados son la varianza y el desvío o desviación estándar.
La varianza es la media aritmética de los cuadrados de los desvíos respecto
de la media. O sea:

∑ ( x − x)
i
2

σ2 = i =1

El desvío estándar es la raíz cuadrada de la varianza:

∑ ( x − x) i
2

σ= i =1

n
18
Estas fórmulas se aplican a la varianza y desvío estándar poblacional. Si se
trata de una muestra la notación es s 2 y s , respectivamente y el divisor en las
expresiones anteriores es n − 1 .
Si los datos vienen como una distribución de frecuencias, la varianza se
calcula por la fórmula:

∑ f ( x − x)
i i
2

σ2 = i =1

donde fi es la frecuencia del valor xi. La fórmula es la misma si los datos están
agrupados en intervalos, sólo que xi es la marca de clase.

Ejemplo

Calcular medidas de tendencia central y el desvío estándar en el caso


siguiente procesando los datos por computadora.

Consideremos los siguientes 100 datos relacionados con la producción


mensual, en miles de barriles de 42 galones en 2001 en Venezuela, en 100
plantas de almacenaje del petróleo crudo:

2.29 1.95 1.52 1.93 1.59 1.92 2.59 1.92 1.15 1.70
2.67 1.75 1.67 1.65 1.09 2.55 1.35 1.48 1.04 2.27
3.09 1.92 1.40 2.23 2.02 1.61 1.84 1.35 1.18 2.14
2.65 1.92 2.13 1.32 1.16 1.72 1.65 1.21 1.08 1.44
2.52 1.46 1.23 1.75 2.26 1.71 1.68 1.37 1.39 1.89
1.75 1.15 1.83 1.16 2.60 1.65 1.22 1.30 1.44 1.55
2.12 1.70 1.91 1.24 2.76 1.57 1.27 1.24 1.26 2.17
1.54 1.86 1.78 1.32 3.27 1.86 1.25 1.04 1.43 1.88
1.94 1.04 2.10 1.03 2.54 1.15 1.59 1.03 1.40 1.42
1.82 1.06 1.92 1.51 2.14 1.69 1.70 1.13 1.52 2.15

DESCRIPTIVE STATISTICS

N 100
MEAN (media) 1.7040
SD (desvío estándar) 0.4845
VARIANCE (varianza) 0.2348
MINIMUM (valor mínimo) 1.0300
MEDIAN (mediana) 1.6600
MAXIMUM (valor máximo) 3.2700

19
Los datos fueron procesados con el programa Statistix.

Diagrama de caja

Un diagrama de caja puede usarse para describir las características más


destacadas de un conjunto de datos.

Debe tenerse en cuenta que un solo punto atípico o “aberrante” puede afectar de
manera importante los valores de x o de s . Pero un diagrama de caja está
basado en medidas que son más resistentes a la presencia de datos atípicos: la
mediana y una medida de dispersión llamada cuarta dispersión y notada f s .

Si llamamos cuarto inferior a la mediana de las n o n +1 mínimas


22
observaciones y cuarto superior la mediana de las n o n + 1 máximas
2 2
observaciones entonces:

f s = cuarto superior – cuarto inferior

Esto es interesante porque la cuarta dispersión no es afectada por las posiciones


del 25% de las observaciones más pequeñas ni por el 25% de las más grandes.

El diagrama de caja más sencillo se basa, en resumen, en las siguientes


cantidades.

xi mínima cuarto inferior mediana cuarto superior xi máxima

1)Se traza una escala horizontal o vertical.

2)Se pone un rectángulo sobre este eje

3) El borde izquierdo (o inferior) es el cuarto inferior.

4)El borde derecho (o superior) es el cuarto superior. Entonces, el ancho (o largo)


de la caja es f s .

5)Dentro de la caja se identifica, generalmente con un segmento, la mediana. La


ubicación de la mediana respecto de los bordes de la caja da información de la
asimetría en el 50% central de los datos.

20
6)Finalmente se trazan “brazos” o “bigotes” uniendo los bordes izquierdo y
derecho (o inferior y superior) con la observación más chica y la observación más
grande, respectivamente.

Ejemplo

Se usó ultrasonido para reunir los datos adjuntos de corrosión sobre el espesor de
la placa de piso de un tanque elevado para almacenar petróleo crudo. Cada
observación es la máxima profundidad de la picadura de la placa, expresada en
milésimas de pulgada.
Los datos, ya ordenados de menor a mayor son los siguientes:
40 52 55 60 70 75 85 85 90 90 92 94 94 95 98 100 115 125 125

19 + 1
Hay 19 valores. La mediana es el valor que ocupa el lugar = 10 , o sea, es el
2
valor 90.

El cuarto inferior es la mediana de los 10 primeros valores, o sea, el promedio


entre el valor que ocupa la posición 5 y el que ocupa la posición 6. Esto es
70 + 75
= 72,5 .
2

El cuarto superior es la mediana de los 10 últimos valores, o sea el promedio entre


el valor que ocupa la posición 5 y la 6, pero de la segunda mitad, es decir
95 + 98
= 96,5
2

El menor valor es 40; el mayor valor es 125. Por lo tanto, la caja, si es vertical
tiene que tener su límite inferior en 72,5; su límite superior en 96,5. Tiene que
tener una línea adentro señalando la mediana en 90. Tiene que tener un brazo
superior que llegue hasta el 125 y un brazo inferior que llegue hasta el 40.

Una forma de detectar datos atípicos es tomar en cuenta lo siguiente:

Una observación más alejada de 1,5 f s del cuarto más cercano en inusual y si está
alejado más de 3 f s es extremo. En cualquier otro caso, es moderado.

Veamos cómo aparece el diagrama de caja procesando estos datos con el


software NCSS 6.0.

Nota: El NCSS hace los “bigotes” de la siguiente manera: El superior lo lleva hasta
el “valor adyacente superior”, que es: la observación más grande que es menor o

21
igual que la tapa de la caja más 1,5 x f s . El inferior lo lleva hasta el “valor
adyacente inferior”, que es la observación más chica que es mayor o igual que la
base de la caja menos 1,5 x f s . Los valores extremos los dibuja como puntos
aislados. Se observan si superan el bigote superior hacia arriba o inferior hacia
abajo.

Diagrama de caja
140,0
110,0
Profundidad máxima
80,0
50,0
20,0

Profundidad

22

También podría gustarte