En las unidades anteriores hemos trabajado con poblaciones, en la vida diaria es muy
difícil trabajar con ellas, si la poblaciónes grande es muy costoso y es difícil
mantener los datos actualizados, los censos de población para países se realizan cada
10 años por recomendación de la ONU, y cada censo necesita una preparación con un
equipo especializado que puede llevar varios años, también el procesamiento es un
proceso a veces bastante complejo y no se obtienen datos inmediatos.
Otro problema es la imposibilidad de contar toda la población si ésta es infinita como sucede con las
estrellas; otra situación que lleva al muestreo es que para controlar la calidad de un producto éste es
inservible para su venta como en el caso de la duración de una bombilla de bajo consumo. Los estudiosos
de la vida silvestre no pueden contar ni examinar a todos los animales y necesitan de métodos especiales
para poder estudiarlos.
Debido a estas causas se desarrollaron métodos de muestreo, en este curso no se entrará en detalle sobre
los mismos.
Los métodos de muestreo estadístico son:
Muestreo aleatorio simple.
Muestreo aleatorio sistemático.
Muestreo aleatorio estratificado.
Muestreo aleatorio por conglomerados.
Estos métodos nos proporcionan datos muestrales, y siempre llevará un error cualquier estimación que se
realice por el sólo hecho de que no está la población completa. Se comenten otros errores que pueden ser
falsedad de la repuesta, error en la carga de daos, etc., estos errores se conocen como errores no debidos
al muestreo. La estadística inferencial cuantifica el error debido al muestreo.
| Estadística
1/ 11
5.2Teorema central del límite
Este teorema tiene suma importancia en la inferencia estadística por sus diversas
aplicaciones. El teorema central del límite establece que para muestras grandes la
distribución de las medias de todas las muestras posibles se aproxima a la normal con
media µ y variancia s2/n, donde n es el tamaño de muestra.
Este teorema indica que la distribución de la media de todas las muestras posibles tiene
por promedio al promedio de la variable
=µ.
~ N(µ; s2/n) y por lo tanto = Z ~ N(0; 1)
| Estadística
2/ 11
5.3Estimación de parámetros
Las medidas resumen que vimos en estadística descriptiva, en una población son
llamados parámetros, son constantes determinadas para cada población.
Al realizar un muestreo se trabaja con los datos muestrales, el resultado de una fórmula es un
estadístico muestral por ejemplo la suma de los valore al cuadrado. Si se trata de estimar un
parámetro poblacional se llama estimador, sería el caso del promedio muestral, al resultado de
utilizar los datos en el estimador se lo llama estimación.
El siguiente cuadro indica la nomenclatura utilizada
Parámetro Estimador
Promedio: µ
Variancia: s2 S2
Desvío estándar: s S
Proporción: p p
La estimación puntual se refiere a dar un único valor estimado para el parámetro, ejemplo el
promedio de edad es de 27 años.
Un estimador puntual es un estadístico que se calcula a partir de la información de la
muestra y proporciona un único valor para estimar el parámetro poblacional.
Pero en muchos casos es necesario indicar entre qué valores se encuentra la estimación
pedida, en estos casos se llama estimación por intervalos de confianza y para el caso de la
edad diríamos que la edad promedio se encuentra entre 26 y 28 años.
Un intervalo de confianza es un rango de valores creado a partir de la información de
la muestra, de modo que el parámetro poblacional tiene una probabilidad de ocurrir
dentro de ese rango.
En un intervalo de confianza la probabilidad de que contenga al verdadero valor del parámetro
se la llama nivel de confianza 1-a, la probabilidad de error es el nivel de significación o riesgo a.
6.3.1 Estimación por intervalo de la media con variancia conocida
| Estadística
3/ 11
Es cuando se conoce la variancia poblacional por un censo o por datos históricos.
En este caso se utiliza la distribución normal estandarizada. Si se desconoce la variancia pero
es una muestra grande (n mayor o igual a 30) se utiliza el desvío muestral y la distribución
normal.
El intervalo de confianza tiene un límite inferior za /2 y un límite superior z 1-a /2 entonces la
probabilidad de que un valor z se encuentre entre estos límites con una confianza de 1-a es
P(za /2 < z < z1-a /2) = 1- a
Sabiendo que , si tenemos la distribución de la media, por el teorema central del
límite y reemplazando queda
P(za /2 < < z1-a /2) = 1- a
Realizando los despejes necesarios
Donde el límite inferior es Li = , el limite superior es Ls =
La amplitud del intervalo es
A = Ls – Li =
El error es E =
En algunos casos se requiere un error específico, sin modificar el nivel de confianza, en esos
casos se necesita otro tamaño de muestra, despejando de la fórmula del error
| Estadística
4/ 11
Ejemplo
En una empresa de venta de materiales para la construcción, se reciben los pedidos en forma
personal o telefónicamente en el área de Pedidos y luego son enviados al área de preparación
y envío de materiales. Se toma una muestra de 60 pedidos y el tiempo promedio de entrega
es de 6 hs; se sabe que el tiempo de entrega tiene una variancia de media hora.
a) Realice una estimación del tiempo promedio de entrega.
La variable X es tiempo de entrega de un pedido, X ~ N( 6hs; 0,5 hs)
La variable es tiempo promedio de entrega en una muestra de 60 pedidos,
~ N( 6hs; 0,5 hs/60) el desvío estándar es = 0,0913 Por
lo tanto la estimación del tiempo promedio de entrega es 6hs.
b) Entre qué valores se puede estimar el tiempo promedio con una confianza de 95%.
En este ítem se pide un intervalo de confianza.
Vemos que los datos de la fórmula son: = 6hs;
1- a = 0,95 a = 0,05 a /2 = 0,025 1 - a /2 = 0,975 z1- a /2 = z0,975 = 1,96
Remplazando P(6 – 1,96 · 0,0913 < µ < 6 + 1,96 · 0,0913) = 0,95
P(5,82hs < µ < 6,18hs) = 0,95
I.C. = (5,82hs; 6,18hs)
La probabilidad de que el verdadero valor del parámetro se encuentre entre 5,82 hs y 6,18 hs
es de 0,95.
| Estadística
5/ 11
c) Se desea disminuir el error en un 40%, ¿cuántos pedidos deben muestrearse?
El error cometido es E = = 1,96 · 0,0913 = 0,178948
Se pide reducir el error en un 40%, por lo tanto “nos quedamos” con el 60% del error, el nuevo
error pedido es E1 = 0,178948 · 0,6 = 0,1074
El tamaño de muestra pedido es 83,26
Entonos los casos el valor de n se aproxima al entero siguiente, en este caso se necesitan 84
pedidos.
5.3.2 Estimación por intervalo de la media con variancia desconocida
En el caso de no conocer la variancia se utiliza el desvío estándar muestral,
pero si la muestra es pequeña (n menor a 30) no puede usarse el Teorema
central del límite y se utiliza la distribución t de Student, siempre que la
población siga una distribución normal.
La distribución t de Student es una distribución de variable aleatoria continua, que presenta
similitudes con la distribución normal estandarizada, es más “achatada” y pesada en las colas.
La distribución t de Student es una distribución simétrica, tiene como parámetro los grados de
libertad, a medida que aumentan los grados de libertad más se aproxima a la curva de la
normal estándar, la simbología para esta distribución es t grados de libertad; a.
Para realizar una estimación por intervalo de confianza si la población se distribuye
normalmente, la variancia es desconocida y el tamaño de muestra es menor de 30 se utiliza la
distribución t de Student. Los grados de libertad son n – 1.
| Estadística
6/ 11
Donde el límite inferior es Li = , el limite superior es Ls =
La amplitud del intervalo es
A = Ls – Li =
El error es E =
Ejemplo
Se tomó una muestra de 10 empleados y les pregunta la cantidad de días ausentes por
enfermedad, se obtiene los siguientes valores: 5; 7; 4; 6; 7; 8; 5; 6; 9; 5.
a) Hallar una estimación del promedio de días ausentes. Para
hallar el promedio se utiliza = 6,2 días ausentes.
b) Hallar una estimación del promedio de días ausentes con un
riesgo del 10%.
Se pide un intervalo de confianza de 95%
| Estadística
7/ 11
Vemos que los datos de la fórmula son: = 6,2 días ausentes; la variancia muestral se
obtiene con la siguiente fórmula 2,4 días2. El desvío
muestral de la variable X es S = = 1,5492 días. El desvío muestral de la
variable es
1- a = 0,90 a = 0,10 a /2 = 0,05
Los grados de libertad G.L. = n – 1= 10 – 1 = 9 tGL; a /2 = t9; 0,05 =1,833
Remplazando P(6,2 – 1,833 · 0,4899 < µ < 6,2 + 1,833 · 0,4899) = 0,90
P(5,302 días < µ < 7,098 días) = 0,90
I.C. = (5,302 días; 7,098 días)
La probabilidad de que el verdadero valor del parámetro se encuentre entre 5,82 hs y 6,18 hs
es de 0,90.
Hay un 90% de confianza que el intervalo (5,302 días; 7,098 días) cubra al verdadero valor del
parámetro.
5.3.3Estimación por intervalo de la proporción
En los dos casos anteriores vimos como estimar la media aritmética de una
población,otro parámetro
de interéses la proporción,
por ejemplo la
proporción de empleados que llegan tarde, el porcentaje de ventas menores
de $7500.
| Estadística
8/ 11
El parámetro poblacional de la proporción es donde A es la cantidad de casos donde se
da el evento estudiado en la población y N el total de la población; el estimador de p es
donde a es la cantidad de casos donde se da el evento estudiado en la muestra y n el tamaño
de la muestra.
Para muestras grandes la distribución muestral de probabilidad de la proporción se aproxima a
la normal con media n · p, la variancia es n · p · (1 – p) y el desvío estándar es
, bajo el supuesto de que se cumplan dos condiciones: la primera es n·p 5y
la segunda n · (1 – p) 5.
La fórmula para un intervalo de confianza para la proporción es
El límite inferior es Li = , el limite superior es Ls =
La amplitud del intervalo es
A = Ls – Li =
El error es E =
En algunos casos se requiere un error específico, sin modificar el nivel de confianza, en esos
casos se necesita otro tamaño de muestra, despejando de la fórmula del error
| Estadística
9/ 11
Ejemplo:
En una empresa que se dedica a investigación de mercado realiza una encuesta con el fin de
conocer la intensión de los consumidores de renovar el celular cada año, se toma una muestra
de tamaño 200 y 74 de ellos contestaron afirmativamente.
a) Indique una estimación para la proporción de consumidores que tienen intensión de renovar
el celular cada año.
El estimador puntual de la proporción es
b) Halle una estimación para la proporción de consumidores que tienen intensión de renovar el
celular cada año con un riesgo del 5%.
Se necesita hallar un intervalo de confianza del 95%
Los datos necesarios son: p = 0,37; (1 – p) = 0,63; n = 200;
1- a = 0,95 1 – a/2 = 0,975 z1 – a/2 = 1,96
I.C. = (0,3031; 0,4369)
Con una confianza del 95% el intervalo (0,3031; 0,4369) cubre al verdadero valor de la
proporción de consumidores que tienen intensión de renovar el celular cada año.
c) Se quiere reducir el error en un 20% ¿cuál es el tamaño de muestra necesario?
=
El error es E = = 0,0669
| Estadística
10/ 11
Se pide reducir el error en un 20%, por lo tanto “nos quedamos” con el 80% del error, el nuevo
error pedido es E1 = 0,0669 · 0,8 = 0,0535
El tamaño de muestra pedido es
El tamaño de muestra buscado para disminuir el error en un 20% es 313.
| Estadística
11/ 11