Introducción a la Estadística Inferencial
1.1. Definición de Estadística Inferencial y su Importancia
En el campo de la estadística, existen dos grandes ramas: la descriptiva y la inferencial.
Mientras que la estadística descriptiva se concentra en organizar, resumir y presentar
un conjunto de datos mediante valores numéricos, tablas o gráficos, la estadística
inferencial va un paso más allá. Su objetivo fundamental es generalizar los resultados
obtenidos de un subconjunto de datos (una muestra) para aplicarlos a un conjunto de
datos mucho mayor y completo (la población).
Un ejemplo claro de esta distinción es una encuesta electoral. La estadística
descriptiva nos diría el porcentaje exacto de los encuestados que apoya a un
candidato. En cambio, la estadística inferencial utilizaría ese resultado para estimar el
porcentaje de todos los ciudadanos del país que apoya a dicho candidato, aun sin
haberlos entrevistado a todos.
Para comprender a fondo la estadística inferencial, es crucial dominar dos conceptos
básicos:
• Población: Es el conjunto completo de datos que se desea estudiar. A los
valores numéricos que describen una población se les conoce como
parámetros. Los más importantes son:
o Media poblacional (µ): El promedio de todos los valores de la población.
o Varianza poblacional (σ²): Una medida que indica qué tan dispersos
están los datos con respecto a la media.
o Desviación estándar poblacional (σ): La raíz cuadrada de la varianza,
expresada en las mismas unidades que los datos.
o Proporción poblacional (P): La fracción de elementos de la población
que cumplen con una característica específica. Se calcula como P =
b/N, donde b es el número de elementos que presentan el atributo de
interés (denominados "éxitos").
• Muestra: Es cualquier subconjunto de la población. A los valores numéricos
que describen una muestra se les llama estadísticos.
La importancia estratégica de la estadística inferencial radica en su capacidad para
permitirnos tomar decisiones informadas y sacar conclusiones sobre una población
sin la necesidad de analizarla por completo. Realizar un censo completo es, en la
mayoría de los casos, impracticable por cuestiones de costo, tiempo o logística. La
inferencia estadística nos proporciona las herramientas para obtener conclusiones
fiables a partir de una porción manejable de los datos.
Para que estas generalizaciones sean válidas y confiables, es imprescindible que la
muestra sea seleccionada de manera adecuada. Este proceso de selección, conocido
como muestreo, es el pilar sobre el cual se construye toda la inferencia estadística.
1.2. Muestreo
El muestreo es una técnica fundamental que consiste en seleccionar un subconjunto
representativo de una población para su estudio. Es el primer paso y el más crítico en
cualquier análisis inferencial, ya que la calidad de las conclusiones dependerá
directamente de la calidad del muestreo.
1.2.1. Razones para el Muestreo
La razón principal para recurrir al muestreo es la imposibilidad práctica de realizar un
censo completo, es decir, de recopilar datos de cada individuo u objeto de la
población. Las razones clave incluyen:
1. Imposibilidad Física: En algunos casos, la población es infinita o tan grande
que es físicamente imposible de estudiar en su totalidad.
2. Costo Elevado: Analizar a toda una población puede requerir una cantidad de
recursos económicos prohibitiva.
3. Tiempo Insuficiente: La recolección y análisis de datos de una población
completa puede tomar tanto tiempo que los resultados serían obsoletos para
cuando estuvieran disponibles.
4. Pruebas Destructivas: En áreas como el control de calidad, analizar un
producto (por ejemplo, medir la vida útil de una bombilla o la resistencia de un
cable) implica destruirlo. Estudiar toda la población significaría destruir toda la
producción.
Un muestreo bien ejecutado permite obtener estimaciones precisas de los parámetros
poblacionales de manera eficiente, convirtiéndose en el cimiento para obtener
conclusiones fiables.
1.2.2. Tipos de Muestreo
Los métodos de muestreo se dividen en dos grandes categorías: probabilísticos y no
probabilísticos. En el muestreo probabilístico, cada elemento de la población tiene
una probabilidad conocida y no nula de ser seleccionado. Esto es esencial para que
las inferencias estadísticas sean objetivas y medibles. A continuación, se describen
los principales tipos de muestreo probabilístico.
• Muestreo Aleatorio Simple
o Definición: Es el método que asigna la misma probabilidad de selección
a todas las muestras posibles de un tamaño determinado. En la práctica,
esto equivale a asegurar que cada individuo de la población tenga la
misma probabilidad de ser elegido.
o Características: Es el método más básico y el fundamento de muchos
otros. Sin embargo, puede ser poco práctico si la población es muy
grande y no se dispone de un listado completo de todos sus miembros.
o Ejemplo: Para realizar una encuesta en el Tecnológico de Huatabampo,
se podría asignar un número a cada estudiante y utilizar un programa de
números aleatorios para seleccionar una muestra de 10 estudiantes.
• Muestreo Estratificado
o Definición: Consiste en dividir la población en subgrupos o "estratos"
que son internamente homogéneos con respecto a una característica de
interés. Posteriormente, se realiza un muestreo (generalmente aleatorio
simple) dentro de cada estrato.
o Características: Este método es muy utilizado porque garantiza la
representación de todos los subgrupos importantes en la muestra, lo
que a menudo conduce a estimaciones más precisas y permite una
mejor organización del estudio.
o Ejemplo: Para seleccionar una muestra del 2% de los 12,500
estudiantes de la UPIICSA, se podría dividir la población por carrera
(Administración Industrial, Ingeniería Industrial, etc.). Luego, se
seleccionaría aleatoriamente un 2% de los estudiantes de cada carrera,
asegurando que todas estén representadas proporcionalmente.
• Muestreo Sistemático con Iniciación Aleatoria
o Definición: Este método implica seleccionar un punto de partida al azar
de un listado de la población y, a partir de ahí, elegir elementos a
intervalos regulares.
o Características: Es más sencillo y rápido que el muestreo aleatorio
simple, especialmente con poblaciones grandes. Su principal riesgo es
que exista un patrón o ciclo en el listado que coincida con el intervalo de
muestreo, lo que podría introducir un sesgo.
o Ejemplo: En una línea de producción, se podría seleccionar la primera
unidad al azar y luego inspeccionar una de cada 200 unidades
producidas. Otro ejemplo es realizar encuestas en el metro,
seleccionando al primer usuario al azar y luego a cada décima persona
que pase.
• Muestreo por Conglomerados
o Definición: La población se divide en subpoblaciones o
"conglomerados", que idealmente son heterogéneos internamente, pero
similares entre sí (una especie de "mini-poblaciones"). Se selecciona
una muestra aleatoria de conglomerados y se analizan todos los
elementos dentro de los conglomerados elegidos.
o Características: Es muy útil cuando la población está geográficamente
dispersa y es difícil o costoso obtener un listado completo de todos los
individuos.
o Ejemplo: Para estudiar a los estudiantes de primaria de una ciudad, se
podrían considerar las escuelas como conglomerados (un ejemplo
clásico de este método). Se seleccionaría una muestra aleatoria de
escuelas y se encuestaría a todos los estudiantes de las escuelas
seleccionadas.
1.3. Muestreo Aleatorio y Errores No Muestrales
El Muestreo Aleatorio es la piedra angular de la estadística inferencial. Su principio
fundamental es que la selección de la muestra se basa en el azar, lo que elimina el
sesgo del investigador y permite que las leyes de la probabilidad se apliquen para
generalizar los resultados de la muestra a la población con un grado de confianza que
puede ser medido y cuantificado.
Al realizar inferencias, es inevitable encontrar diferencias entre el valor de un
estadístico muestral y el verdadero parámetro poblacional. Estas diferencias se
clasifican en dos tipos de errores:
• Error de Muestreo: Es la diferencia natural e inevitable que existe entre un
estadístico de la muestra y el parámetro de la población, debida únicamente al
azar de haber seleccionado una muestra en lugar de otra. Este error disminuye
a medida que aumenta el tamaño de la muestra. En las fórmulas para calcular
el tamaño de la muestra, se designa como error muestral permitido (e).
• Error No Muestral: El contexto proporcionado se centra en el error de muestreo
y no detalla los tipos o causas de los errores no muestrales. Estos son errores
que no se deben al proceso de muestreo en sí, sino a otros factores como
errores en la recolección de datos, sesgos en las respuestas de los
encuestados, o errores en el procesamiento de la información.
1.4. Muestreo Probabilístico versus Muestreo No
Probabilístico
• Muestreo Probabilístico: Como se ha mencionado, su característica principal
es que cada unidad de la población tiene una probabilidad conocida y mayor
que cero de ser seleccionada para la muestra. Esto es lo que permite que los
resultados sean generalizables y que se pueda medir el error de muestreo. Los
métodos descritos anteriormente —aleatorio simple, estratificado, sistemático
y por conglomerados— son todos ejemplos de muestreo probabilístico.
• Muestreo No Probabilístico: Los textos de origen se enfocan exclusivamente
en los métodos probabilísticos y no proporcionan definiciones o ejemplos de
técnicas de muestreo no probabilístico. En estos métodos, la selección de la
muestra se basa en el juicio del investigador o en la conveniencia, y no en el
azar. Algunos ejemplos comunes (no mencionados en el texto fuente) son el
muestreo por conveniencia o el muestreo por juicio.
1.5. Diseño Apropiado de la Muestra
Un paso crítico en cualquier estudio estadístico es determinar el tamaño correcto de
la muestra. Una muestra demasiado pequeña puede no ser representativa y llevar a
conclusiones erróneas, mientras que una muestra demasiado grande puede ser un
desperdicio de tiempo y recursos. El tamaño adecuado de la muestra es aquel que
equilibra la precisión deseada en las estimaciones con las limitaciones prácticas.
Las fórmulas para su cálculo varían según se conozca o no el tamaño total de la
población. Las variables clave en estas fórmulas son:
• n: Tamaño de la muestra a calcular.
• N: Tamaño total de la población.
• Z: Valor de la distribución normal estándar asociado al nivel de confianza
deseado.
• e: Error muestral máximo permitido.
• p: Proporción esperada de la característica de interés en la población. Este valor
representa la variabilidad del atributo. Si no se dispone de una estimación
previa (por ejemplo, de un estudio piloto), se utiliza p = 0.5, ya que este valor
maximiza la varianza y, por lo tanto, el tamaño de muestra requerido,
garantizando una estimación conservadora y prudente.
A continuación, se presentan las fórmulas para dos escenarios comunes:
• Caso 1: Cuando no se conoce el tamaño de la población (N) o esta es
infinita. La fórmula para calcular el tamaño de la muestra es:
o Ejemplo de aplicación: Un ingeniero de control de calidad necesita
inspeccionar envases de refresco. Desea una confianza del 96% (Z =
2.054) y un error del 5% (e = 0.05). Si no tiene información previa (p = 0.5),
necesitaría una muestra de 422 envases. Si por experiencia sabe que la
variabilidad positiva es de 0.75, la muestra necesaria se reduce a 317.
• Caso 2: Cuando se conoce el tamaño de la población (N). La fórmula se
ajusta para poblaciones finitas:
o Ejemplo de aplicación: Un ingeniero revisa lotes de 2,000 cinescopios
(N = 2000). Con una confianza del 95% (Z = 1.96) y un error del 8% (e =
0.08), si no tiene información previa (p = 0.5), necesitaría una muestra de
140 cinescopios.
El diseño adecuado de la muestra, incluyendo la determinación de su tamaño, es un
paso fundamental que impacta directamente la validez y fiabilidad de toda la
inferencia estadística.
1.6. Teorema del Límite Central (TLC)
El Teorema del Límite Central (TLC) es uno de los resultados más importantes y
poderosos de la estadística inferencial. Su importancia estratégica radica en que nos
permite hacer inferencias sobre una población sin necesidad de conocer su
distribución de probabilidad original. En la práctica, rara vez conocemos la distribución
real de la población que estudiamos. El TLC nos otorga una "luz verde" para utilizar la
robusta y bien comprendida distribución normal como base para nuestras inferencias,
siempre que nuestra muestra sea lo suficientemente grande.
El teorema establece que si se toman muestras aleatorias de tamaño suficientemente
grande (generalmente n ≥ 30) de cualquier población con una media µ y una varianza
̄ ) será aproximadamente una
finita σ², la distribución de las medias muestrales (X
distribución normal, independientemente de la forma de la distribución de la
población original.
Formalmente, el teorema enuncia que la distribución de la variable estandarizada: Z =
̄ - µ) / (σ / √n) se aproxima a una distribución normal estándar a medida que el tamaño
(X
de la muestra n se hace grande.
Aplicaciones Prácticas del TLC
• Permite realizar inferencias sobre la media poblacional (como construir
intervalos de confianza o realizar pruebas de hipótesis) utilizando la
distribución normal, incluso si la población de origen no es normal.
• Justifica por qué la distribución normal es tan prevalente en la estadística, ya
que muchos fenómenos pueden ser vistos como el resultado de la suma de
múltiples efectos pequeños e independientes.
• Su aplicación se extiende más allá de la media muestral, siendo también la
base para las distribuciones muestrales de la suma de variables, la diferencia
de medias y las proporciones.
En esencia, el TLC es la base teórica que nos permite comprender y utilizar las
distribuciones muestrales de los estadísticos más importantes, que se detallan a
continuación.
1.7. Distribuciones Fundamentales para el Muestreo
Una distribución muestral es la distribución de probabilidad de un estadístico (como
la media o la proporción) calculado a partir de todas las muestras posibles del mismo
tamaño extraídas de una población.
1.7.1. Distribución Muestral de la Media
̄ ) que
Es la distribución de probabilidad de todas las posibles medias muestrales (X
podrían obtenerse de una población.
• Propiedades Clave:
o Media: La media de la distribución de todas las medias muestrales es
̄ ) = µ.
igual a la media de la población. E(X
o Varianza: La varianza de las medias muestrales es la varianza de la
población dividida por el tamaño de la muestra. V(X ̄ ) = σ²/n. Esta
propiedad es fundamental: demuestra matemáticamente por qué
muestras más grandes (n) generan estimaciones más precisas, ya que
las medias muestrales (X ̄ ) varían menos y se agrupan más
estrechamente alrededor de la verdadera media poblacional (µ).
o Forma: La distribución será normal si la población original es normal. Si
la población no es normal, la distribución será aproximadamente normal
para muestras grandes (n ≥ 30), gracias al Teorema del Límite Central.
1.7.2. Distribución Muestral de la Diferencia de Medias
Es la distribución de probabilidad de todas las posibles diferencias entre las medias de
dos muestras independientes (X ̄ ₁-X
̄ ₂), extraídas de dos poblaciones.
• Propiedades:
o ̄ ₁ - ̄X₂) = µ₁ - µ₂.
Media: E(X
o ̄ ₁-X
Varianza: V(X ̄ ₂) = (σ₁²/n₁) + (σ₂²/n₂).
o Forma: Será normal si ambas poblaciones son normales, o
aproximadamente normal si los tamaños de muestra (n₁ y n₂) son
grandes.
1.7.3. Distribución Muestral de una Proporción
La proporción muestral (p
̂ ) es el estadístico que estima la proporción poblacional (P).
Se calcula como el número de "éxitos" en la muestra dividido por el tamaño de la
muestra. Su distribución muestral describe cómo varían las proporciones de una
muestra a otra.
• Propiedades:
o Media: E(p
̂ ) = P.
o Varianza: V(p
̂ ) = (P * (1 - P)) / n.
o Forma: Es aproximadamente normal para tamaños de muestra grandes.
1.7.4. Distribución Muestral de la Diferencia de Proporciones
Es la distribución de probabilidad de todas las posibles diferencias entre las
proporciones de dos muestras independientes (p
̂ ₁-p
̂ ₂).
• Propiedades:
o Media: E(p
̂ ₁-p
̂ ₂) = P₁ - P₂.
o Varianza: V(p
̂ ₁-p
̂ ₂) = [(P₁ * (1 - P₁)) / n₁] + [(P₂ * (1 - P₂)) / n₂].
o Forma: Es aproximadamente normal para tamaños de muestra grandes.
1.7.5. Distribución Muestral de la Varianza
Esta distribución responde a la pregunta de cómo varían las varianzas muestrales (s²)
de una muestra a otra. Su estudio está estrechamente ligado a la distribución Chi-
Cuadrado (χ²).
• Conexión con Chi-Cuadrado: Para una muestra aleatoria de tamaño n extraída
de una población normal con varianza σ², el estadístico (n-1)s² / σ² sigue una
distribución Chi-Cuadrado con n-1 grados de libertad. La distribución Chi-
Cuadrado es una familia de distribuciones asimétricas a la derecha, cuya forma
depende de los grados de libertad.
1.7.6. Distribución Muestral de la Relación de Varianzas
Se utiliza para comparar las varianzas de dos poblaciones independientes. Esta
distribución está vinculada a la distribución F.
• Conexión con la Distribución F: Si se toman dos muestras independientes de
tamaños n₁ y n₂ de dos poblaciones normales con varianzas σ₁² y σ₂², el
estadístico F = (s₁²/σ₁²) / (s₂²/σ₂²) sigue una distribución F con n₁-1 y n₂-1 grados
de libertad (grados de libertad del numerador y del denominador,
respectivamente). La distribución F también es una familia de distribuciones
asimétricas a la derecha.