0% encontró este documento útil (0 votos)
6 vistas23 páginas

Estadistica Ii

Este documento presenta una revisión de la distribución de muestreo para la media poblacional y la proporción poblacional. Explica que la distribución de muestreo de la media surge al calcular la media de múltiples muestras tomadas de una población y generar una distribución con esas medias muestrales. Esta distribución tenderá a ser normal e indica cómo se pueden hacer inferencias estadísticas sobre parámetros poblacionales a partir de estadísticos muestrales. Luego, presenta un caso
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
6 vistas23 páginas

Estadistica Ii

Este documento presenta una revisión de la distribución de muestreo para la media poblacional y la proporción poblacional. Explica que la distribución de muestreo de la media surge al calcular la media de múltiples muestras tomadas de una población y generar una distribución con esas medias muestrales. Esta distribución tenderá a ser normal e indica cómo se pueden hacer inferencias estadísticas sobre parámetros poblacionales a partir de estadísticos muestrales. Luego, presenta un caso
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

ESTADISTICA II

REVISION DE DISTRIBUCION DE MUESTREO

INTRODUCCION

Comenzamos este curso de Estadística II con una revisión sobre el tema de distribución de muestreo para la media
poblacional y la proporción poblacional. Si recuerdas, puedes observar que estos temas fueron estudiados en el
último módulo de Estadística I. En él, hablábamos de la estadística inferencial.

¿Por qué lo repetimos? Porque este tema nos muestra las bases de la estimación y la razón por la cual se pueden
hacer inferencias desde los estadísticos de la muestra a los parámetros poblacionales correspondientes con
fundamento estadístico. De este tema se nutren todos los contenidos del presente módulo y posteriores.

Antes de iniciar esta lectura, tienes que tener bien consolidados los siguientes temas:

 distribución normal;

 estandarización;

 uso de las distintas tablas de la distribución normal;

 resolución de problemas en los que interviene la distribución normal.

Por eso, como primera tarea, te recomendamos cualquiera de las publicaciones que detallamos a continuación para
que repases los temas indicados.

1. Este texto es básico de la materia. Deberás leer el capítulo 6, “Distribución normal” (páginas 177 a
202). Fuente: Levine, D. M.; Krehbiel, T. C.; y Berenson, M. L. (2014). Estadística para administración (6.a
ed.). México: Pearson.

2. El siguiente texto conforma un elemento básico de Herramientas Matemáticas III. Debes leer el capítulo 6:
“Muestreo y distribuciones de muestreo”. Fuente: Levin, R.; y Rubin, D. (2004). Estadística para
administración y economía (7.a ed.). México: Pearson.

BLOQUE 1: CASO PRODUCTORA DE TE

La productora de té Ackerman e Hijos, oriunda del litoral y con envíos a todo el país, necesita saber cuál es el
porcentaje del consumo de té por hogar en la República Argentina. Considera, de acuerdo con estudios realizados
con anterioridad, que el consumo anual por hogar está normalmente distribuido con una desviación estándar de
1,25 kg, pero desconocen la media µ.

La productora te encarga que realices un estudio estadístico para determinar lo siguiente.

En primer lugar, si se toma una muestra de 36 hogares seleccionados azarosamente y se calcula el promedio del
consumo de té durante un año, ¿cuál es la probabilidad de que la media de esa muestra no difiera respecto del
consumo promedio de toda la población en más de 0,5 kg?

¿Cuál será la probabilidad de que el consumo medio de la muestra supere al consumo promedio poblacional en más
de 0,75 kg?

En segundo lugar, si se conoce que en la población el 60 % de las familias consumen la marca de té de la productora
Ackerman e Hijos, ¿qué probabilidad hay de que en la muestra seleccionada, la media de la proporción de las
familias que consumen su marca de té no difiera de la media poblacional más allá de ± 5 %?
BLOQUE 2. Distribución de muestreo de la media

Conceptos previos

Antes de comenzar, repasemos los conceptos estudiados en Estadística I.

Población y muestra: la población es el conjunto de todas las unidades de estudio (individuos) que cumplen con una
característica o atributo observable que es de interés para la investigación. Pueden ser personas, animales, cosas o
hechos seleccionados según un criterio. Se pueden medir o contar. El criterio de selección está dado por el objetivo
de la investigación.

Ejemplo: si nos interesa estudiar las condiciones laborales de los empleados de una determinada fábrica automotriz,
la población podrá ser la cantidad de personas que trabajan en dicha fábrica o se podría limitar el estudio a un área
determinada de esa fábrica, según el criterio de selección que se utilice para la investigación.

Una muestra estará constituida por una porción de la población. Por lo tanto, es un subconjunto de ella. Cada uno
de los elementos que forman parte de la muestra también se denomina unidad de observación. La muestra debe
representar a la población.

Estadísticos y parámetros: los estudios sobre una muestra permiten determinar valores denominados estimadores o
valores estadísticos. Ellos permiten efectuar una correcta estimación sobre los valores de la población.

Por su parte, los valores en estudio que en la muestra toman el nombre de estadísticos en la población se
denominan parámetros. Si necesitásemos determinar el salario de los docentes del país, deberíamos tomar una
muestra constituida por docentes de distintas escuelas, distintas provincias y distintos niveles. El salario promedio
obtenido en la muestra se denomina estadístico, mientras que el salario promedio de toda la población docente
constituye el parámetro.

Asimismo, se define como bondad al margen de seguridad con el que se realiza la inferencia de acuerdo con los
estudios realizados sobre la o las muestras.

Estadística inferencial:

“Es el conjunto de métodos y técnicas que permiten determinar, de una muestra debidamente representativa de
una población, los valores estadísticos, a fin de poder inferir sobre los parámetros poblacionales con un cierto grado
de bondad” (Berenson et al., 2014, p. 2).

También puede entenderse como el “conjunto de métodos que hacen posible la estimación de una característica de
la población o la toma de una decisión referente a una población basándose solo en los resultados de una muestra”
(Berenson et al., 2014, p. 4).

Definición de distribución de muestreo de la media

 Has estudiado en Estadística I los diferentes tipos de muestreo para extraer la muestra de una población
con el objeto de definir un estadístico y así inferir sobre el parámetro de la población correspondiente. Es
lógico pensar que los estadísticos calculados en cada muestra que se extrae no serán iguales entre sí, por lo
tanto, tampoco podemos esperar que los estadísticos de una muestra sean iguales a los parámetros
poblacionales.

 También, recuerda que los parámetros poblacionales más usuales en la estimación son: a) la media; b) el
desvío estándar; y c) la proporción de los elementos de la población que cumplen con determinada
característica.
Es decir, la media de la muestra nos permite inferir sobre la media poblacional, mientras que el desvío estándar o la
proporción de los elementos con la característica en estudio de la muestra nos permite inferir sobre el
comportamiento de los parámetros poblacionales.

Sin perder de vista que el objetivo nuestro es hacer buenas estimaciones, pasaremos a definir qué es
una distribución de muestreo de la media, ya que es el fundamento de la estimación estadística y a la vez uno de los
temas centrales de esta lectura. Se hace necesario conocerla para resolver la situación problemática planteada.

Ejemplo 1

Supongamos que tomamos muestras de un tipo de arandelas en una producción de autopartes. Las muestras
constan de 10 arandelas cada una. La población se considera infinita por ser un proceso continuo. También
supongamos que deseamos medir el diámetro interior de la arandela. Al calcular la media y la desviación estándar
correspondiente a cada una de estas muestras, veríamos rápidamente que la media y la desviación estándar de cada
muestra son diferentes. Podemos definir entonces lo siguiente.

“Una distribución de probabilidad de todas las medias posibles de las muestras es una distribución de las medias de
las muestras. Los especialistas en estadística la conocen como distribución de muestreo de la media” (Levin y Rubín,
2004, p. 247).

Generalización

Ahora plantearemos un ejemplo teórico, no porque no se encuentre un caso práctico para aplicar, sino porque
habitualmente es tedioso y costoso comprobarlo. Consideremos una población infinita o finita con un N lo
suficientemente grande que implique que una muestra extraída sin reposición no modificará las probabilidades que
tienen otras muestras de ser elegidas.

 La población en estudio tiene una media µ y un desvío estándar σ.

 De esa población se extraen todas las muestras posibles de un mismo tamaño n en cada una de ellas.

De cada muestra se calcula la media ▁x y la desviación estándar s.

La siguiente figura es una esquematización teórica sobre la extracción de todas las posibles muestras del mismo
tamaño de una población. Además, muestra cómo llegar a la distribución de muestreo de la media a partir del
cálculo de la media y la desviación estándar de cada una de las muestras.

Figura 1: Esquema del proceso de obtención de una distribución de muestreo para la media
 Si consideramos ahora las medias de todas esas muestras y generamos con ellas una distribución,
obtendríamos lo que denominaremos una distribución de medias, distribución de muestreo de las medias
o distribución de probabilidad de las medias muestrales. Las tres formas de nombrarla son correctas.

 A cada media muestral, se la considera como variable aleatoria, pues es el resultado numérico de un
experimento aleatorio. El experimento es tomar muestras aleatorias de una población y calcular la media
de cada muestra. Esto nos permite confeccionar una tabla de distribución de frecuencias e incluso un
gráfico con todas las medias de todas las muestras posibles tomadas de la población. Esta distribución se
denomina distribución de muestreo de la media.

 Podrá observarse que la distribución de medias muestrales tendrá una forma aproximadamente normal,
independientemente de la forma original de la población (haya sido normal o no).

 Como toda distribución de variables aleatorias, esta distribución tendrá una media que, en este caso, puede
calcularse como la medida de todas las medias y también un valor esperado. Esta media tiene un
significado importante en la inferencia estadística y la retomaremos en el próximo tema.

 Al desvío estándar de esta distribución de medias muestrales, se lo denomina error muestral


estándar. Cuanto más pequeño sea este valor, menor será el error que se cometa cuando se infiera sobre la
media poblacional a través de la media de una muestra.

De la misma manera, también podemos obtener una distribución de muestreo para la proporción, con base en la
proporción en que una característica se encuentra en todas las muestras posibles tomadas de la población. Este
tema lo estudiaremos más adelante en esta lectura.

Error estándar o error muestral estándar

Ahora ampliaremos el concepto de error muestral estándar. El apartado tiene como objetivo remarcar la
importancia del concepto de error estándar o error muestral estándar.

Podemos decir entonces que la desviación estándar de la distribución de las medias muestrales es lo mismo que el
error estándar de la media. El error estándar de la muestra es distinto a la desviación estándar de la población
(aunque existe una relación entre ellos).

Recuerda que el error estándar indica qué tan dispersas (separadas) están las medias de las muestras entre sí. El
término error estándar se utiliza para explicar que la variabilidad de los estadísticos calculados en las muestras
proviene de un error de muestreo. Este error es debido a la aleatoriedad de las muestras. Tal como mencionamos
anteriormente, hay diferencias tanto entre cada muestra y la población como entre las diversas muestras, debido
únicamente a los elementos que decidimos escoger.

BLOQUE 3:

Características de la distribución de muestreo de la media a partir de un caso

Hasta aquí todo lo visto es para que comprendas qué es una distribución de muestreo de la media. Seguidamente,
analizaremos con más precisión matemática lo que ocurre cuando se aumenta el tamaño de la muestra. En otras
palabras, haremos un análisis, a partir de una población y basándonos en un caso, para extraer conclusiones
matemáticas sobre las distribuciones de muestreo de la media.

En el ejemplo 1, hemos supuesto una población infinita. Ahora la supondremos finita para facilitar los cálculos y
poder explicar matemáticamente a qué conclusiones se llegan. Luego de ver y definir a esas características,
podremos generalizarlas a todo tipo de poblaciones con algunas salvedades.

Ejemplo 2. En este ejemplo, explicaremos paso a paso la variabilidad de los estadísticos a medida que aumenta la
muestra seleccionada. Lo analizaremos por etapas para ir extrayendo conclusiones en cada etapa. El objetivo no es
que memorices estos pasos, sino que pongas atención en los análisis que se realizan y las conclusiones a las que se
arriba.

Comenzaremos con una población pequeña por razones de practicidad en los cálculos y la cantidad de muestras que
pueden tomarse de toda la población. Iremos haciendo salvedades por haber tomado una muestra pequeña y una
variable discreta, pero como dijimos antes, una vez analizados los estadísticos en cada etapa, lo generalizaremos.

Analicemos el siguiente ejemplo que corresponde a una empresa de ventas que cuenta con cinco vendedores a los
que designaremos como A, B, C, D y E. Sus salarios mensuales son $40 000, $40 000, $50 000, $60 000 y $60 000,
respectivamente. Dichos salarios constituirán la población en estudio. En este caso, dicha población es finita y consta
de solo 5 elementos.

Etapa 1: calcular los parámetros de la población

Volcaremos los datos del ejemplo 2 en una tabla y calcularemos los siguientes parámetros: la media poblacional µ, la
varianza poblacional Var(x) o (σ2) y la desviación poblacional σ. La tabla 1 resume los datos de los 5 vendedores de la
empresa del ejemplo con las columnas auxiliares para calcular la varianza y la desviación estándar.

Tabla 1: Tabla de los salarios de los vendedores del ejemplo 2 con los cálculos para la varianza y la desviación
estándar

 El salario promedio será: .

 Varianza: Var(x) = =

 Desviación estándar:

Nota: esta es una situación ideal de una población muy pequeña, por eso, no se considera N-1 en el denominador
para la varianza y la desviación estándar (no se trata de una muestra).

Resumen: μ=$50 000 σ=$8944,27

También, podemos resumir los datos en una tabla de distribución de frecuencias para poder luego ver la forma de la
distribución de la población. Entonces, en la tabla 2 se muestra la distribución de las frecuencias absolutas de la
variable en estudio.
Tabla 2: Tabla de distribución de frecuencias para los
vendedores del ejemplo 2

En la figura 2, se graficó el histograma


correspondiente al ejemplo 2. Se le asoció un
polígono para ver la forma que adopta la
distribución.

Figura 2: Histograma correspondiente a la


tabla 2 del ejemplo 2

Etapa 2: seleccionar de la población todas las muestras posibles de tamaño 2

Consideremos de esta población todas las muestras posibles de dos elementos en cada una de ellas. Tenemos que
formar grupos de 2 personas tomadas de un grupo de 5. No importa si una persona está en más de un grupo. Lo que
diferencia un grupo de otro es que por lo menos hay una persona distinta. Tampoco importa en qué orden se
nombran los grupos. Estamos hablando de las combinaciones de 5 elementos tomados de dos en dos. Por lo tanto,
necesitamos calcular . Como aprendimos a calcular mediante calculadora científica o mediante su fórmula, es igual a
10 grupos de personas.

En la tabla 3, se escriben todos los posibles grupos de vendedores combinándolos de a 2. Se calculan los promedios
de sueldos de cada muestra.

Tabla 3: Muestras de 2 personas tomadas de la


población de 5 en el ejemplo 2 con sus promedios de
sueldo

Etapa 3: distribución de medias muestrales de tamaño 2

Con las medias de todas las muestras podemos generar una nueva
distribución que denominaremos distribución de medias
muestrales de tamaño 2 o distribución de muestreo de la media.
Recuerda que primero se ordenan los valores de la variable de
menor a mayor y luego se cuentan las veces que se repite (fi).

Así, en la tabla 4 se muestra la distribución de las frecuencias


absolutas de la variable aleatoria. En este caso, la variable aleatoria
es el promedio de los 2 sueldos correspondientes a los dos
vendedores que forman cada muestra.

Tabla 4: Tabla de distribución de frecuencias para las muestras de


vendedores del ejemplo 2, tomados de a 2

En la figura 3, se graficó el histograma con las frecuencias respectivas,


correspondientes a la tabla 4. También se le asoció un polígono para ver
la forma que adopta la distribución de medias.

Figura 3: Histograma correspondiente a la tabla 4 del ejemplo 2

Etapa 4: calcular los estadísticos de la distribución de medias muestrales de la etapa 3

Puesto que tenemos una distribución de una variable aleatoria representada por la media de cada una de las
muestras, podemos calcular ahora algunos de sus estadísticos. Los estadísticos convenientes a calcular según el caso
que estamos analizando son los siguientes.

 La media de la distribución muestral: .

 La desviación estándar de las medias muestrales o error estándar.

Varianza: Var(x) =
Desviación estándar:

Además, nos interesa calcular:

 la probabilidad de ocurrencia de las medias muestrales, ya que la probabilidad de ocurrencia de las medias
muestrales viene dada por las frecuencias relativas

Así, la probabilidad de que una muestra de tamaño 2, tomada de esa población, proporcione un promedio salarial de
$50 000 es de P (x = 50 000) = 0,4.

Resumen:

Conclusiones parciales 1
Como conclusión, podemos decir que, si de la población se extraen todas las muestras posibles de tamaño 2 y de
cada una de ellas se determina su media, la distribución generada con las medias de todas las muestras presenta las
siguientes características.
1. La media de la distribución de las medias de todas las muestras posibles de la población de tamaño (n = 2)
es igual a la media de la población (ver etapa 4).

2. El desvío estándar de dicha distribución, también denominado como error muestral estándar, es menor que
el desvío estándar poblacional (ver etapa 4).

3. Mientras que la población presenta un diagrama de frecuencias bimodal, en este caso el correspondiente a
la distribución de las medias muestrales tiende a ser normal (ver figura 3).

Etapa 5: seleccionar de la población todas las muestras posibles de tamaño n = 3

Regresemos a la población y consideremos ahora todas las


muestras posibles de tres elementos en cada una de ellas
(n = 3). El número de muestras posibles estará dado por las
combinaciones de 5 tomadas de 3 en 3. Por lo tanto,
necesitamos calcular: . Ya aprendimos a calcularlo
mediante calculadora científica o mediante su fórmula y es
igual a 10 grupos de personas.

En la tabla 5, se escriben todos los posibles


grupos de vendedores, combinándolos de a 3.
Se calculan los promedios de sueldos de cada
muestra.

Tabla 5: Muestras de 3 personas tomadas de la


población de 5 en el ejemplo 2 con sus
promedios de sueldo

Etapa 6: distribución de medias muestrales de tamaño n = 3

Con las medias de todas las muestras, podemos generar una nueva
distribución que denominaremos distribución de medias
muestrales de tamaño 3 o distribución de muestreo de la media.
Recuerda que primero se ordenan los valores de la variable de menor a
mayor y luego se cuentan las veces que se repite (fi).
En la tabla 6, se muestra la distribución de las frecuencias absolutas de
la variable aleatoria. En este caso, la variable aleatoria es el promedio
de los 3 sueldos correspondientes a los tres vendedores que forman
cada muestra.

Tabla 6: Tabla de distribución de frecuencias para las


muestras de vendedores del ejemplo 2, tomados de a
3

En la figura 4, se graficó el histograma con las frecuencias respectivas, correspondientes a la tabla 6. También se le
asoció un polígono para ver la forma que adopta la distribución de medias.
Figura 4: Histograma correspondiente a la tabla 6 del ejemplo 2

Si en lugar de escribir en el eje vertical las frecuencias absolutas pusiéramos las frecuencias relativas, estaríamos
hablando de una distribución de probabilidades tal como estudiamos en el módulo 3. Si se tratase de una población
más grande que la tomada en el ejemplo 2 y la variable aleatoria fuera continua, el polígono se suaviza. Observamos
que esta curva va tomando forma acampanada. También se cambió la escala del eje vertical por las frecuencias
relativas para observar mejor la distribución de probabilidades.

Etapa 7: calcular los estadísticos de la distribución de medias muestrales de la etapa 6

Ya tenemos una distribución de una variable aleatoria representada por la media de cada una de las muestras, ahora
podremos calcular algunos de sus estadísticos. Los que nos convienen para el ejemplo que estamos analizando son
los siguientes (debes ver la tabla 6 para realizar los cálculos).

 La media de la distribución muestral: .

 La desviación estándar de las medias muestrales o error estándar.

Varianza: Var(x) =

Desviación estándar:

Resume: n

Conclusiones parciales 2

La media de la distribución de las medias de todas las muestras posibles de n = 3 elementos cada una de ellas es
igual a la media de la población, lo que también ocurría en el caso de n = 2.

1. La distribución tiende a adquirir las características propias de una distribución normal.

2. El desvío estándar de la distribución es menor que el desvío estándar poblacional. El desvío estándar de la
distribución muestral de n = 3 es menor que el desvío estándar de la distribución muestral de n = 2, es decir,
a medida que el número de elementos que componen la muestra aumenta, disminuye la dispersión de la
distribución muestral.

Conclusiones generales
En la tabla 7, se resumen los estadísticos media, error estándar y rango de las muestras tomadas según el tamaño, n
= 2 y n = 3.

Tabla 7: Resumen de los estadísticos calculados

Del análisis del ejemplo 2 y la tabla 7, podemos extraer las siguientes conclusiones.

1. La distribución de las medias muestrales para n grande tiene forma normal.

1. Cuando la población es grande y está normalmente distribuida, la distribución de las medias


muestrales será normal.

2. Cuando la población no está distribuida normalmente, la distribución de las medias muestrales se


aproximará a una distribución normal si el tamaño de la muestra es suficientemente grande (30 o
más elementos).

2. La distribución de las medias muestrales tiene una media igual a la media poblacional: x̿ =μ.

3. La desviación estándar de las distribuciones de las medias muestrales, denominado error estándar, está
dado por la expresión: (que probaremos seguidamente).

Las conclusiones extraídas del análisis realizado con las distribuciones de las medias muestrales a medida que se
aumenta el tamaño de la muestra nos llevan al enunciado del teorema fundamental de la estadística inferencial: el
teorema del límite central.

Teorema del límite central

Si de una población de media μ y desviación estándar σ se extraen todas las muestras posibles del mismo número de
elementos n en cada una de ellas y de cada muestra obtenemos su media , la distribución de todas esas medias
tendrá una distribución del tipo normal, independientemente del tipo de distribución que sea la población, con una
media x̿ igual a la media poblacional μ y un desvío estándar menor al desvío estándar poblacional, el cual es

denominado error muestral estándar. Su valor es igual a (cociente entre el desvío estándar poblacional
sobre la raíz cuadrada de n: tamaño de muestra). Entonces, para calcular el error estándar se utiliza la siguiente

fórmula.

Repasa las conclusiones generales del tema anterior y podrás confirmar todas estas afirmaciones.

BLOQUE 4:

Factor de corrección para poblaciones finitas

Poblaciones infinitas y finitas

Ya hablamos de poblaciones infinitas, pero en términos generales se trata de comparar la población con la muestra.
 La población se considera infinita cuando el tamaño de la muestra es menor al 5 % del tamaño de la
población: n < 0,05 N

 Análogamente, la población es finita cuando el tamaño de la muestra es mayor o igual al 5 % del tamaño de
la población: n ≥ 0,05 N

Lo que es lo mismo:

Factor de corrección

Si estamos frente a una población finita, es necesario introducir un factor de corrección para poblaciones finitas.
Para el cálculo del error estándar, sería lo siguiente.

Por lo tanto, la fórmula de cálculo para el error estándar en caso de que la población sea finita es:

Aplicación del teorema del límite central al caso del ejemplo 2

Para n = 2

1. El error estándar a partir de la distribución de medias muestrales, cuando n = 2, nos dio (ver tabla 7):
$5477,23.

2. El error estándar por teorema del límite central, aplicando en este caso el factor de corrección para
poblaciones finitas, sería (ver etapa 1 del ejemplo 2):

Para n = 3

 El error estándar a partir de la distribución de medias muestrales, cuando n=3, nos dio (ver tabla 7):
$3651,48.

 El error estándar por teorema del límite central, aplicando en este caso el factor de corrección, sería:

Como puede comprobarse, los errores estándar en ambos casos dan iguales. Por tanto, el teorema del límite central
nos permite extraer una muestra representativa de una población e inferir a partir de los estadísticos (la media y la
desviación estándar, en este caso) los parámetros poblacionales correspondientes, con un cierto grado de error
manejable.

Resolución del caso de la productora de té, preguntas a) y b)

Por teorema del límite central sabemos lo siguiente. Si se pudieran extraer de la población todas las muestras
posibles de 36 hogares en cada una de ellas y de cada una obtuviéramos el consumo medio anual de té, con las
medias de todas las muestras se generaría una distribución muestral de consumos medios, con forma
aproximadamente normal, pues n > 30.

Por otra parte, la media de dicha distribución de medias coincide con la media poblacional, la cual es desconocida.

Además, la media de la muestra diferirá respecto a la media de la distribución muestral en: .

 Para una distribución normal:

 En el caso de una distribución de medias muestrales: .

 Entonces, , como se observa en la figura 5.

Así, en la figura 5 tenemos la descripción del caso de la productora de té. Se puede observar cómo quedaría la
distribución de medias muestrales con forma acampanada. Además, encontramos media poblacional y la diferencia
entre cualquier media muestral y la media poblacional.

Figura 5: Esquema genérico de la distribución muestral de medias para el caso de la productora de té

Como en la primera pregunta del caso planteado se nos pregunta cuál es la probabilidad de que la diferencia entre la
media de la muestra tomada de 36 familias y la media poblacional no sea mayor a 0,5 kg, planeamos lo siguiente.

en valor absoluto, pues lo que se pretende es que la media muestral no esté más allá de ± 0,5.

También lo podemos interpretar de la siguiente manera. Si la media poblacional es desconocida, podemos plantear

que el intervalo a considerar es el que está dentro .

Se estandariza y se trabaja con la tabla de la distribución normal, tal cual se estudió en Estadística I y se repasó al
comienzo de esta lectura. No obstante, es así si tenemos en cuenta que aquí la variable aleatoria es una media
muestral, la media poblacional es la media de todas las medias muestrales (desconocida en este caso) y la desviación
estándar se llama aquí error estándar y tiene su propia fórmula en función inversa al tamaño de la muestra.

Comencemos a resolver la pregunta a). Aquí nos encontramos con un problema: no tenemos la media de la muestra
ni la media poblacional, pero sí tenemos la diferencia entre ambas. Entonces, tenemos dos casos:
si:

Por otra parte,si

Por último, buscamos en la tabla de la distribución normal acumulada:

Respuesta: la probabilidad que la media muestral esté a 0,5 kg (o menos) de la media poblacional es 0,9826. El
porcentaje es del 98,26 %.

Pregunta b)

Acá se quiere saber cuál será la probabilidad de que el consumo medio de la muestra supere al consumo promedio
poblacional en más de 0,75 kg. Si la media poblacional es desconocida, podemos plantear lo siguiente.

Se quiere averiguar , entonces estandarizamos de la siguiente forma. Como la media


muestral debe ser mayor a la media poblacional en 0,75 (por lo menos), podemos considerar:

La P(z > 3,57) = 0, pues se consideran las desviaciones estándar hasta 3,5 aproximadamente. Más allá de eso, las
probabilidades son prácticamente nulas. Recuerda que la tabla te da P(z<3,57) = 1. Entonces, tienes que restárselo a
1 para obtener la probabilidad buscada: 1 – 1 = 0.

Respuesta: la probabilidad de que la muestra supere a la media poblacional en 0,75 kg es 0. El porcentaje es 0 %.

REPASO: En el caso de la productora de té, si la media poblacional se conoce y es de 300 kg por familia por año con
una desviación estándar poblacional de 82,2 kg, ¿cuál es la probabilidad de que al elegir una muestra aleatoria de 64
familias la media muestral obtenida sea menor a 270 kg?

 La probabilidad de que el consumo medio de las 64 familias sea menor a 270 kg es de 0,0018.

La probabilidad de que el consumo medio de una de las familias de la ciudad sea menor a 270 kg es del
0,0018.

La probabilidad de que el consumo medio de las 64 familias sea menor a 270 kg es 0, pues el error estándar
es menor a la desviación poblacional.

La probabilidad de que el consumo medio de las 64 familias sea menor a 82,2 kg es del 0,0018.

La probabilidad de que el total de consumos de las 64 familias sea menor a 270 kg es del 0,018.

BLOQUE 5: Distribución de muestreo para la proporción.


¿Qué es una distribución muestral para la proporción?

En muchas oportunidades, es necesario determinar una proporción en una población. Por ejemplo:

 porcentaje o proporción de votantes que se estima que votarán en la próxima elección por un cierto
candidato;

 porcentajes de alumnos del nivel primario que no terminan el ciclo;

 porcentaje de enfermos con VIH;

 porcentaje de niños de una determinada edad que estén vacunados contra el sarampión, entre otros
ejemplos.

Se trata ahora de extraer una muestra, calcular la proporción de la característica de interés en dicha muestra y
analizar qué sucede en la población con esa característica, basándonos en los datos muestrales.

La fórmula para calcular la proporción muestral es:

x: número de elementos de la muestra que poseen la característica de interés.


n: tamaño de la muestra.

La proporción muestral es una variable aleatoria y su distribución de probabilidad se conoce como distribución
muestral de .

Características de la distribución muestral de la proporción

Al igual que en la distribución de medias, para determinar cuán cerca está la proporción de una muestra de la
proporción poblacional p, se necesita saber cuáles son las propiedades de la distribución muestral de :

 el valor esperado de ;

 la desviación estándar de ;

 la forma de la distribución muestral de .

☰ Valor esperado o media de la distribución muestral de la proporción .

El valor esperado de es la media de todos los posibles valores de . A su vez, es igual a la proporción poblacional p.

☰ Desviación estándar de la proporción muestral .

También es llamado error estándar de la proporción. Al igual que en la distribución de medias muestrales,
diferenciaremos entre poblaciones infinitas y finitas.

 Error estándar de la proporción para poblaciones infinitas:


p: proporción en que se encuentra la característica en estudio dentro de la población.
q = 1 – p.
n: tamaño de la muestra.
 Error estándar de la proporción para poblaciones finitas:
Solo se le agrega el factor de corrección.

☰ Forma de la distribución muestral de la proporción .

 Conocemos entonces la media y la desviación estándar de la distribución muestral de . Ahora nos queda
por analizar la forma de esa distribución muestral.

 La fórmula para calcular la proporción muestral es , como acabamos de estudiar en esta lectura.

 También sabemos que x es una variable aleatoria binomial que indica el número de los elementos de la
muestra que tienen la característica de interés. Recuerda que la muestra fue tomada en forma aleatoria de
una población grande (ver características de la distribución binomial, tema de Estadística I). Los eventos se
consideran independientes y como n es una constante, la probabilidad de x/n es la misma que la
probabilidad de x, lo que significa que la distribución muestral de también es una distribución de
probabilidad discreta y la probabilidad de cada x/n es la misma que la probabilidad de x.

 Recuerda que una distribución binomial se aproxima mediante una distribución normal, siempre que el
tamaño de la muestra sea lo suficientemente grande para satisfacer las siguientes condiciones.
n.p ≥ 5 y n.q ≥ 5

Podemos afirmar entonces que la distribución muestral de se aproxima mediante una distribución normal siempre
que: n.p ≥ 5 y n.q ≥ 5

Apliquemos estos conceptos al caso de la productora de té

En el caso de la productora de té, el valor esperado o media de la distribución muestral de es 0,60.

Podemos calcular el error estándar de la distribución de la proporción de todas las familias que consumen la marca
de té Ackerman e Hijos. Como se trata de una población infinita frente a la muestra (recuerda que es una muestra
de 36 familias, de entre todas las familias argentinas), no agregaremos el factor de corrección.

El error estándar de la distribución de muestras de la proporción de clientes que consumen la marca de té Ackerman
e Hijos es de 0,0816.

Por otra parte, la proporción poblacional de las familias que consumen el té de la productora Ackerman e Hijos es de
0,60.

Con una muestra aleatoria de n = 36, tenemos:

n.p = 36×0,60 = 21,6 que es > 5

Además, debe cumplirse:

n.q = 36×0,40 = 14,4 que es > 5

Por tanto, la distribución muestral de se calcula mediante la distribución normal.


La proporción y el teorema del límite central

Podemos resumir lo estudiado sobre distribución muestral de la proporción en los siguientes conceptos.

 La proporción se encuentra en una población como un nuevo parámetro, el cual se determinará en la


mayoría de los casos con una inferencia a través del estadístico correspondiente de una muestra.

 El valor práctico de la distribución muestral de es que permite obtener información probabilística acerca de
la diferencia entre la proporción muestral y la proporción poblacional.

Para la obtención y análisis del estadístico tendremos presente que el teorema del límite central puede ser aplicado
para las proporciones. Por lo tanto, si de una población con una proporción p (de los elementos con la característica
en estudio) se extraen todas las muestras posibles del mismo tamaño y de cada muestra se determina la proporción,
con las proporciones de todas las muestras posibles se genera una distribución de proporciones muestrales que será
normal, ajustándose a las pautas ya mencionadas de las medias muestrales. Además, la media de esa distribución de
proporciones será igual a la proporción de la población y el desvío estándar de la distribución de proporciones
muestrales será igual a

Resolución del caso de la productora de té, pregunta c)

De acuerdo con las propiedades descritas anteriormente, podemos ver el caso de la productora de té, en la siguiente
figura. De esta manera, en la figura 6 se muestran las propiedades de una distribución muestral de la proporción:
forma normal, media y error estándar.

Figura 6: Distribución muestral de para el caso de la productora de té

Conocemos la media y el error estándar de la muestra, ahora tenemos que averiguar la proporción de las familias
que consumen la marca del té que no difiera de la media poblacional en más de ± 5 %. Observa que primero
tomamos la muestra, calculamos la proporción de interés, el error estándar y recién entonces comenzamos a sacar
conclusiones sobre la proporción de la población.

Si queremos que el estadístico de la proporción muestral no difiera de la proporción poblacional más allá del 5 %, es
decir, de 0,05, entonces tenemos que calcular la probabilidad de que la proporción poblacional esté dentro del
intervalo: [0,60 - 0,05; 0,60 + 0,05] o [0,55; 0,65]. Dicho de otra forma, ¿cuál es la probabilidad de obtener una
muestra en la que el valor de esté entre 0,55 y 0,65?

Como la forma de la distribución de la muestra de la proporción se puede aproximar a la normal, usamos la


estandarización, aplicada ahora a la proporción muestral:
: es cualquier proporción de la distribución de proporciones de la muestra. En nuestro caso, son los límites del
intervalo p ± 0,05.

p: es la proporción de la población.

: es el error muestral de la distribución de proporciones de la muestra. En nuestro caso, 0,0816.

Comenzamos estandarizando = 0,65:

Ahora estandarizamos =0,55:

En la tabla de probabilidad normal estándar aparece que la probabilidad acumulada que corresponde a z = 0,61 es
0,7291. En la misma tabla y la probabilidad correspondiente a z = -0,61 es 0,2709.

De esta manera, la probabilidad de seleccionar una muestra en la cual el valor de no difiera más de 0,05 de la
proporción poblacional p está dada por 0,7291 - 0,2709 = 0,4582. Como se dice cotidianamente, es del 45,82 %.

Importante

Se puede verificar analizando las fórmulas respectivas que si se aumenta el tamaño de la muestra, el error estándar
de la proporción disminuye y la probabilidad de que la proporción muestral no esté más allá del 5 % de la proporción
de la población aumenta.

Actividades de repaso

Si la proporción poblacional de votantes del partido A en una ciudad es 0,35, calcula el error estándar de la
proporción de votantes del partido para los tamaños de muestra 100 y 700. ¿Qué puedes decir acerca del tamaño
del error estándar a medida que el tamaño de la muestra aumenta? Justifica, calculando los valores involucrados en
el problema.

ESTIMACION Y ESTIMADORES

INTRODUCCION

El hombre permanentemente se encuentra haciendo estimaciones. Estima el gerente de marketing las ventas del
próximo mes, estima el gerente de producción la cantidad de mano de obra necesaria para un período de
producción, el gerente de una entidad bancaria efectúa una estimación sobre el cumplimiento de un cliente para el
otorgamiento de un crédito o un descubierto, estima el ama de casa las cantidades de comestibles necesarios para
que toda la familia sea satisfecha con una comida, entre una infinidad de ejemplos. Es en función de esas
estimaciones que se decide.

Recuerda cómo definíamos la estadística inferencial. Quedaba claro que el objetivo final era el de inferir algo acerca
de una población a partir de la información adquirida de una muestra. La inferencia, entonces, se hace a través
de estimadores. En esta lectura, hablaremos de los estimadores, es decir, la medida que se calcula en la muestra
para inferir esa medida en la población.

Caso: Cámara de Artículos Electrónicos para el Hogar

Debido a los aumentos reiterados de la inflación en el país, la Cámara de Artículos Electrónicos para el Hogar desea
estimar el precio medio de un modelo de hornos a microondas de una conocida marca. Por experiencias anteriores,
la distribución poblacional es normal. Para este análisis, se toma una muestra aleatoria en 35 establecimientos de
ventas al por menor de una misma ciudad con el fin de estimar el precio promedio de venta poblacional de cada
horno y su varianza poblacional. Los resultados obtenidos se muestran en la siguiente tabla.

Tabla 1: Precios de venta de los hornos a microondas

Muestras Precio de venta en pesos

1 17 999

2 17 000

3 18 000

4 16 550

5 17 560

6 16 480

7 17 000

8 18 000

9 16 599

10 23 000

11 22 500

12 20 300

13 19 900

14 19 999

15 18 999

16 18 000
17 17 800

18 18 889

19 18 800

20 17 500

21 18 900

22 17 999

23 16 900

24 18 800

25 17 500

26 18 900

27 17 999

28 16 900

29 22 500

30 20 300

31 18 900

32 17 999

33 16 900

34 16 550

35 17 560

Fuente: elaboración propia.

Además, se quiere estimar qué proporción de la población vende el horno a microondas en más de $20 000. Se te
solicita que determines puntualmente las 3 estimaciones que desea realizar la Cámara de Artículos Electrónicos para
el Hogar.

1-ESTIMACION

¿Qué es la estimación?

Venimos diciendo que la base de la inferencia estadística es la estimación. La mayoría de las aplicaciones actuales de
la estadística se relacionan con la obtención de conclusiones referidas a la población, a partir de la evidencia
recogida en una muestra correspondiente a una pequeña porción de casos. Algunos ejemplos son las siguientes
situaciones:

 analizar la evolución del total de desempleados en las grandes ciudades de un país;

 medir el gasto promedio de las familias en cierto rubro de interés;


 cuantificar la variabilidad de un producto surgido de cierto proceso industrial estandarizado;

 conocer el porcentaje de votantes que prefieren a cierto candidato, con anterioridad a una elección.

Las técnicas correspondientes a la inferencia estadística permiten dar respuesta a estos interrogantes, se utiliza solo
una pequeña porción de casos de la población de interés. Para los objetivos de información propuestos como
ejemplos, podrían tomarse muestras de las poblaciones, respectivamente:

 al seleccionar individuos residentes en las ciudades de interés y registrar su estado ocupacional;

 al obtener por muestreo un conjunto de familias y consultarles sobre el gasto en ese rubro;

 al estudiar por muestreo la característica de análisis de un grupo de productos elaborados en tal sistema;

 al indagar a un conjunto representativo de votantes del lugar en cuestión.

Como primer paso en este estudio de la estadística inferencial, nos detendremos (en esta lectura) en las diferentes
técnicas que permiten dar como plausible un valor de un parámetro poblacional de interés. De estos parámetros a
estimar, los más comunes son:

 la media poblacional;

 la varianza poblacional;

 la proporción poblacional;

 las entre medias o entre proporciones.

Parámetros y estadísticos o estadígrafos

En primer lugar, recordemos la diferencia entre parámetro y estadístico.

 Los parámetros son las medidas de resumen poblacional que permiten describir el conjunto de datos
analizados. Ejemplos de parámetros son la media poblacional, la varianza poblacional, entre otras.

 Los estadísticos son las medidas análogas obtenidas a partir de datos muestrales. Este tipo de medida
incluye la media muestral, la varianza muestral, la proporción muestral, entre otras. Estos valores, también
conocidos como estimadores, se utilizan para proporcionar una idea del valor de la medida poblacional
correspondiente, pero considerando solo datos muestrales.

2- DIFERENCIA ENTRE ESTIMADOR Y ESTIMACION

Por un lado, “un estimador es un estadístico de la muestra utilizado para estimar un parámetro poblacional” (Levin y
Rubín, 2004, p. 275). Por otro lado, “una estimación es un valor específico observado de un estadístico” (Levin y
Rubín, 2004, p. 275).

Algunos estadísticos son mejores estimadores que otros. Gracias a algunos criterios que mencionaremos a
continuación, podremos evaluar cuáles son los que tienen mayor calidad para estimar el parámetro poblacional
correspondiente.

Características de un buen estimador

Los cuatro criterios más destacados son:

1. imparcialidad (insesgada);

2. eficiencia;
3. consistencia;

4. suficiencia.

Algunos autores muestran otras propiedades, todas son importantes, pero como objetivo de esta lectura
definiremos estas cuatro. Aun así, te animo a que profundices el tema con los elementos de lectura que se indican
más adelante. Igualmente, puedes profundizar en las demostraciones de estas propiedades para poder comparar
cuáles de los estimadores son más adecuados que otros.

1. Imparcialidad

Decimos que un estimador es imparcial o insesgado cuando su valor esperado coincide con el parámetro
poblacional que estima. Dicho de otra forma, sucede si la media de la distribución del estimador es igual al
parámetro.

a. Comenzaremos estudiando la media muestral, que es el estimador natural de la media poblacional, y la medida de
tendencia central más utilizada. La media, a su vez, es la medida más adecuada para describir un conjunto de datos
que se distribuye siguiendo el modelo normal.

La media muestral es un estimador imparcial o insesgado de la media poblacional. Esto se demuestra partiendo de la
fórmula de la media muestral, estudiada en el curso anterior de estadística:

Por otro lado, sabemos que la esperanza matemática de la media poblacional es E(x)=μ.

Tenemos que demostrar que , es decir, la esperanza de la media muestral o de la distribución de


medias muestrales es igual a la media poblacional. Esto se demuestra fácilmente a través de algunos pasos
algebraicos, se desarrollan a continuación.

La esperanza o valor esperado de la media muestral se da al sustituir:

La esperanza de n (que es una constante) es la misma constante, por lo que podemos extraerla fuera del paréntesis.

Luego, la esperanza de una suma es igual a la suma de las esperanzas y podemos realizar:

Por su parte, sabemos que la esperanza de la media en una distribución normal es μ y como tenemos la suma
de μ, n veces, nos queda:

Fíjate que partimos de la esperanza de la media muestral y llegamos a la esperanza de la media poblacional que
coincide. Ya sabíamos que el valor esperado en una distribución normal es igual a la media poblacional, por lo que la
media muestral es un estimador insesgado de la media poblacional.

Ejemplo 1. En un proceso de producción de varas de madera, el promedio de las longitudes de todas las varas de
maderas en una corrida de producción es de 2,06 cm. Si después se toman varias muestras de varas de madera de
100 unidades cada muestra, se miden las longitudes de las varas de cada muestra, se extrae el promedio de cada
muestra y luego se confecciona con esos promedios una distribución de medias muestrales, el promedio de todos
los promedios de todas las muestras también dará 2,06 cm. Esto es lo que dice el teorema del límite central, lo cual
demuestra que la media muestral es un estimador insesgado de la media poblacional.
b. La cuasivarianza muestral es un estimador imparcial o insesgado de la varianza poblacional.

La cuasivarianza es la que conociste en el curso anterior de estadística como varianza de una muestra: restando 1 al
tamaño de la muestra. Por lo tanto:

Si no le restásemos 1 al denominador tanto de la varianza como de la desviación estándar de la muestra, no sería un


estimador insesgado sino sesgado. No sería un buen estimador.

Ejemplo 2. Si en el proceso de producción del ejemplo 1, la varianza poblacional es de 0,02 cm, entonces la media de
la distribución de varianzas muestrales (cuasivarianzas) también es 0,02 cm.

c. La mediana muestral es un estimador sesgado o parcial de la mediana poblacional.

Ejemplo 3. Seguimos con el caso de las varas de madera, pero si la mediana son 2 cm, la media de las medianas de
todas las muestras tomadas no necesariamente tiene que dar igual.

2. Eficiencia

Un estimador es eficiente si en promedio se acerca más al parámetro estimado que cualquier otro estimador. La
media muestral cumple este requisito para la media poblacional, ya que tiene la mínima varianza entre los
estimadores de la media poblacional. La eficiencia se refiere al tamaño del error estándar del estadístico.

Ejemplo 4. Si comparásemos dos estadísticos de una muestra del mismo tamaño, por ejemplo, la media de la
muestra y la mediana de la muestra, y confrontásemos el error estándar de la media con el error estándar de la
mediana, decidiríamos que el estimador más eficiente es el que tiene menor error estándar. Generalmente esto
ocurre con la media.

Tiene sentido pensar que un estimador con un error estándar menor (con menos variación) tendrá mayor
oportunidad de producir una estimación más cercana al parámetro poblacional que se está considerando.

3. Consistencia

Decimos que un estimador es consistente si a medida que se aumenta el tamaño de la muestra, el estimador se
aproxima sistemáticamente al valor del parámetro poblacional. Al aumentar el tamaño de la muestra cada vez más,
las diferencias entre la media muestral y la media poblacional se van haciendo más reducidas. El cumplimiento de
estas propiedades hace de la media muestral el mejor estimador de la media poblacional.

Recuerda la relación entre el tamaño de la muestra y el error muestral que repasamos en la lectura. 1. En la fórmula
se ve esta relación que es inversa:

Si un estimador es consistente, se vuelve más confiable al tener tamaños de muestra más grandes. No obstante, hay
un factor de riesgo. Tienes que contemplar la posibilidad que surge al aumentar el tamaño de la muestra, ya que allí
obtendrás mayor información sobre el parámetro poblacional que deseas estimar, pero debes asegurarte de la
consistencia del estadístico o estimador, porque de lo contrario desperdiciarás tiempo y dinero si decides hacer un
muestreo grande, es decir, tomando tamaños grandes de cada muestra.

De esta forma, la media y la cuasivarianza son estimadores consistentes.

4. Suficiencia
“Un estimador es suficiente si utiliza tanta información de la muestra que ningún otro estimador puede extraer
información adicional acerca del parámetro de población que se está estimando” (Levin y Rubín, 2004, p. 276).

Aclaraciones para escoger un buen estimador

Un estadístico de la muestra determinado no siempre es el mejor estimador de su parámetro poblacional. Observa


los siguientes casos.

Si la distribución poblacional es simétrica y, por lo tanto, coinciden los valores de la media y la mediana, sucede lo
descrito a continuación.

 La media de la muestra sería un estimador imparcial o insesgado de la mediana de la población. También


sería un estimador consistente de la mediana de la población, pues al aumentar el tamaño de la muestra, el
valor de la media de la muestra tenderá a acercarse bastante a la mediana de la población. También, la
media de la muestra sería un estimador más eficiente de la mediana de la población –más que la mediana
de la muestra–, ya que para muestras grandes la media de la muestra tiene un error estándar menor que la
de la mediana.

 Recíprocamente, la mediana de la muestra de una población con distribución simétrica sería un estimador
imparcial y consistente de la media de la población, pero no el más eficiente porque en muestras grandes
su error estándar es mayor que el de la media de la muestra.

También podría gustarte