UNIVERSIDAD LAICA ELOY ALFARO DE MANABÍ
FACULTAD CIENCIAS ADMINISTRATIVAS
ADMINISTRACIÓN DE EMPRESAS
Nombre:
Loor Intriago Branny Ronaldo
Materia:
Estadística Aplicada
Tema:
Análisis de varianza
Docente:
Ana Manuela Palma Avellan
Curso:
3ero “C”
Periodo:
2021(2)
1. Introducción
En esta investigación, analizaremos uno de los objetivos fundamentales de un
estudio estadístico para determinar el nivel mínimo de incertidumbre a partir de conceptos
básicos y la aplicación de pruebas de hipótesis.
Esto se hace para encontrar herramientas útiles para tomar decisiones sobre
sospechas o dudas razonables en un estudio de investigación.
Nuestro interés se centrará entonces en generar estadísticas de prueba
asociadas con una distribución particular y luego compararlas con los valores de la tabla
en una distribución conocida y ver si se rechaza o no una hipótesis de interés particular.
El ANOVA de una vía, ANOVA con un factor o modelo factorial de un solo factor
es el tipo de análisis que se emplea cuando los datos no están pareados y se quiere estudiar
si existen diferencias significativas entre las medias de una variable aleatoria continua en
los diferentes niveles de otra variable cualitativa o factor. Es una extensión de los t-test
independientes para más de dos grupos.
Las hipótesis contrastadas en un ANOVA de un factor son:
• H0: No hay diferencias entre las medias de los diferentes grupos: μ1=μ2...=μk=μ
• H0 : Al menos un par de medias son significativamente distintas la una de la otra.
Otra forma de plantear las hipótesis de un ANOVA es la siguiente. Si se considera μ como
el valor esperado para una observación cualquiera de la población (la media de todas las
observaciones sin tener en cuenta los diferentes niveles), y αi el efecto introducido por el
nivel i. La media de un determinado nivel (μi) se puede definir como:
μi=μ+αi
• H0 : Ningún nivel introduce un efecto sobre la media total: α1=α2=...αk=0
• H0: Al menos un nivel introduce un efecto que desplaza su media: Algún αi≠0
Como se ha mencionado anteriormente, la diferencia entre medias se detecta a través
del estudio de la varianza entre grupos y dentro de grupos. Para lograrlo, el ANOVA
requiere de una descomposición de la varianza basada en la siguiente idea:
Variabilidad total = variabilidad debida a los diferentes niveles del factor + variabilidad
residual lo que es equivalente a: variabilidad explicada por el factor + variabilidad no
explicada por el factor lo que es equivalente a: (varianza entre niveles) + (varianza dentro
de los niveles)
Para poder calcular las diferentes varianzas en primer lugar se tienen que obtener las
Sumas de Cuadrados (SS o Sc):
• Suma de Cuadrados Total o Total Sum of Squares (TSS): mide la variabilidad
total de los datos, se define como la suma de los cuadrados de las diferencias de
cada observación respecto a la media general de todas las observaciones. Los
grados de libertad de la suma de cuadrados totales es igual al número total de
observaciones menos uno (N-1).
• Suma de cuadrados del factor o Sum of Squares due to Treatment (SST):
mide la variabilidad en los datos asociada al efecto del factor sobre la media (la
diferencia de las medias entre los diferentes niveles o grupos). Se obtiene como la
suma de los cuadrados de las desviaciones de la media de cada proveedor respecto
de la media general, ponderando cada diferencia al cuadrado por el número de
observaciones de cada grupo. Los grados de libertad correspondientes son igual
al número niveles del factor menos uno (k-1).
• Suma de cuadrados residual/error o Sum of Squares of Errors (SSE): mide
la variabilidad dentro de cada nivel, es decir, la variabilidad que no es debida a
variable cualitativa o factor. Se calcula como la suma de los cuadrados de las
desviaciones de cada observación respecto a la media del nivel al que pertenece.
Los grados de libertad asignados a la suma de cuadrados residual equivale la
diferencia entre los grados de libertad totales y los grados de libertad del factor, o
lo que es lo mismo (N-k). En estadística se emplea el termino error o residual ya
que se considera que esta es la variabilidad que muestran los datos debido a los
errores de medida. Desde el punto de vista biológico tiene más sentido llamarlo
Suma de cuadrados dentro de grupos ya que se sabe que la variabilidad observada
no solo se debe a errores de medida, si no a los muchos factores que no se
controlan y que afectan a los procesos biológicos.
TSS=SSE+SST
2. Distribución F
La distribución F es un modelo estadístico que se utiliza para estudiar las
varianzas de dos poblaciones independientes. También se usa, principalmente, en el
análisis de varianza, una técnica estadística desarrollada por estadístico inglés Fisher. Al
igual que otras distribuciones, la distribución F presenta características y propiedades
específicas.
Existen varias distribuciones de probabilidad que se aplican en la elaboración de
datos estadísticos y pruebas de hipótesis. Por ejemplo, una de las más conocidas es la
distribución normal estándar, o curva de campana. Además, existen otras
distribuciones, como la distribución F. Es una distribución de probabilidad continua que,
como hemos dicho, se utiliza principalmente en los análisis de varianza.
La distribución F también se conoce como distribución de Fisher-Snedecor, en
honor a los estadísticos Ronald Fisher y George Snedecor. Ambos trabajaron en el
desarrollo del análisis de varianza, a principios del siglo XX, sentando las bases de la
estadística moderna.
La distribución F sirve para demostrar las variaciones de una población. Más
específicamente, se usa una distribución F cuando se busca estudiar la razón de las
varianzas de dos poblaciones distribuidas normalmente. Asimismo, este tipo de
distribución también se utiliza en un análisis de varianza de un factor (ANOVA). El
análisis de varianza se encarga de comparar la variación entre varios grupos o poblaciones
y la variación que hay dentro de cada una de ellas. Para lograrlo, se usa una proporción
de variaciones. La distribución F permite analizar la relación entre las varianzas.
Características de la distribución F.
La distribución F presenta características definidas que la diferencian de otras
distribuciones. Algunas de ellas son:
• Las distribuciones F incluyen varios métodos estadísticos.
• La distribución F particular que se utiliza depende del número de grado de libertad
que tiene la muestra. Esta característica de la distribución F también está presente
en otras distribuciones, como la distribución T y la distribución chi-cuadrado.
• El valor de la distribución F es nulo, es decir, cero o positivo. No tiene valores
negativos.
• La distribución F posee una leve inclinación hacia la derecha. Por lo tanto, se trata
de una distribución de probabilidad que no es simétrica.
Propiedades de la distribución F
Las distribuciones F tienen grados de libertad. Esta es una característica que también
poseen las distribuciones T y chi-cuadrado. En el caso de una distribución T, el número
de grados de libertad es uno menos que el tamaño de muestra.
La distribución F deriva de una relación entre dos poblaciones. Generalmente, se toma
una muestra de ambas poblaciones, por lo tanto, hay dos grados de libertad. Para
determinar los dos números de grados de libertad, debemos restarle uno a ambos tamaños
de muestra. Después, las estadísticas de estas poblaciones se combinan en una fracción.
Tanto el numerador como el denominador tienen grados de libertad. En lugar de combinar
estos dos números en otro número, se conservan ambos. Por lo tanto, el uso de una tabla
de distribución F requiere que haya dos grados de libertad diferentes.
Usos y ejemplos de la distribución F
La distribución F se puede utilizar en diversos estudios de muestras en diferentes
campos, desde la industria hasta el sector educativo, científico o estadístico. Por ejemplo,
si se desean comparar las calificaciones de un maestro con otro, la precisión de un
instrumento con otro, dos máquinas similares, el espesor de dos materiales y cualquier
otra variable de interés.
3. Consideración de dos varianzas poblacionales.
Las varianzas de dos poblaciones normales a través de las varianzas estimadas con
sus muestras. Esta comparación sólo se realizará para poblaciones normales, por lo que
es importante confirmar este aspecto en los datos.
Los resultados que se van a exponer son muy sensibles a esta hipótesis de
normalidad, de forma que sólo podremos estar seguros de su aplicación si estamos muy
seguros de que los datos proceden de poblaciones normales. Esta sensibilidad a pequeñas
desviaciones de la normalidad resta interés a este tipo de análisis de comparación de
varianzas. En muchos casos, el interés en realizar la comparación de varianzas es para
poder realizar un contraste o intervalo de confianza para la igualdad de medias basado en
un estimador común de la varianza, a través de la fórmula (8.7). La inferencia sobre
diferencia de medias sólo precisa la normalidad si tenemos muestras pequeñas, y así
aplicar la distribución t de Student, a través de la propiedad expresada en la fórmula (8.8).
Sin embargo, la propiedad (8.8) aún es válida, aunque los datos se desvíen un poco de la
normalidad. Aún más, la utilización del estimador conjunto ((8.7) sigue dando resultados
satisfactorios incluso con pequeñas diferencias en las varianzas poblacionales σ21 y σ22.
Por esta razón, muchos autores recomiendan la decisión de aplicar (8.7) en la
inferencia sobre la diferencia de medias mediante la comparación directa de las
estimaciones ˆs1 y ˆs2. Es muy popular la utilización de la siguiente regla empírica:
Si la mayor desviación típica estimada no es más del doble que la menor, los
procedimientos de comparación de medias basados en (8.7) siguen siendo
aproximadamente válidos.
Una vez realizadas estas consideraciones, pasemos a ver cómo es la inferencia de
comparación de varianzas en poblaciones normales.
Sea una población X1 ∼ N ¡μ1, σ21¢ de la que se extrae una muestra de tamaño n1 y se
calcula la varianza muestral corregida ˆ S2 1. Y sea una segunda población X2 ∼ N ¡μ2,
σ22 ¢ de la que se extrae una muestra de tamaño n2 y se calcula la varianza muestral
corregida ˆ S2 2.
La comparación de las varianzas σ21 y σ22 a partir de los estimadores ˆ S2 1 y ˆ
S22 se realiza a partir de la siguiente ratio: F =ˆ S2 1 /σ21ˆ S22 /σ22. Este ratio F es una
variable aleatoria, al ser la división de dos variables aleatorias ˆ S2 1 y ˆ S2 2. El carácter
aleatorio de F viene por tanto de los diferentes valores que podrían tomar ˆ S2 1 y ˆ S2 2
si tomásemos muestras diferentes de cada población. En poblaciones normales, la
variable aleatoria F es conocida y se denomina distribución F de Fisher, o también
distribución F de Snedecor, o simplemente distribución F. Es una distribución que está
tabulada y puede encontrarse en la mayoría de los textos de estadística y en los programas
de ordenador como el Statgraphics. La distribución F de Fisher depende de dos
parámetros g1 y g2 denominados grados de libertad. El valor de g1 está relacionado con
el numerador de (8.14) y toma el valor g1 = n1 − 1. Por esta razón, a g1 también se le
denomina grados de libertad del numerador. El valor de g2 está relacionado con el
denominador de (8.14) y toma el valor g2 = n2 −1. Por esta razón, a g2 también se le
denomina grados de libertad del denominador. La notación de esta distribución F es F
g1,g2.
Por tanto, si X1 ∼ N ¡μ1, σ21¢y X2 ∼ N¡μ2, σ22¢,
entonces F =ˆ S21 /σ21ˆ S22 /σ22∼ n1−1,n2−1. (8.15)
La distribución Fg1,g2 es una variable aleatoria continua no negativa, definida en
[0, ∞), y su forma varía dependiendo de los valores g1 y g2. En general, es una
distribución unimodal y asimétrica positiva, disminuyendo la asimetría al aumentar los
valores de g1 y g2. La siguiente figura muestra dos ejemplos de esta distribución: la F5,10
y la F20,20.
4. Suposiciones en el análisis de la varianza ANOVA
Otro uso de la distribución F es el análisis de la técnica de la varianza (ANOVA),
en la cual se comparan tres o más medias poblacionales para determinar si pueden ser
igua- les. Para emplear ANOVA, se supone lo siguiente:
1. Las poblaciones siguen la distribución normal.
2. Las poblaciones tienen desviaciones estándar iguales ( σ ).
3. Las poblaciones son independientes.
Cuando se cumplen estas condiciones, F se emplea como la distribución del
estadístico de prueba. ¿Por qué es necesario estudiar ANOVA? ¿Por qué no sólo se
emplea la prueba de las diferencias en medias poblacionales, como se analizó en el
capítulo anterior? Se puede comparar dos medias poblacionales a la vez. La razón más
importante es la acumulación indeseable del error tipo I. Para ampliar la explicación,
suponga cuatro métodos distintos (A, B, C y D) para capacitar personal para ser
bomberos. La asignación de cada uno de los 40 prospectos en el grupo de este año es
aleatoria para cada uno de los cuatro métodos. Al final del programa de capacitación, a
los cuatro grupos se les administra una prueba común para medir la comprensión de las
técnicas contra incendios. La pregunta es: ¿existe una diferencia en las calificaciones
medias del examen entre los cuatro grupos? La respuesta a esta pregunta permitirá
comparar los cuatro métodos de capacitación. Si emplea la distribución t para comparar
las cuatro medias poblacionales, tendría que efectuar seis pruebas t distintas. Es decir,
necesitaría comparar las calificaciones medias de los cuatro métodos como sigue: A
contra B, A contra C, A contra D, B contra C, B contra D y C contra D. Si determina el
nivel de significancia en 0.05, la probabilidad de una decisión estadística correcta es de
0.95, calculada de 1 – 0.05. Como se realizaron seis pruebas separadas (independientes),
la probabilidad de que no se tome una decisión incorrecta debido al error de muestreo en
cualquiera de las seis pruebas independientes es: P ( ) ( . )( . )( . )( . )
Todas correctas = 0 95 0 95 0 95 0 95 ( . )( . ) . 0 95 0 95 0 735
Para encontrar la probabilidad que al menos tenga un error debido al muestreo,
reste este resultado a 1. Por tanto, la probabilidad de al menos una decisión incorrecta
debida al muestreo es de 1 – 0.735 = 0.265. En resumen, si realiza seis pruebas
independientes con la distribución t , la posibilidad de rechazar una hipótesis nula
verdadera debido al error de muestreo se incrementa de 0.05 a un nivel insatisfactorio de
0.265. Es obvio que necesita un mejor método que realizar seis pruebas t . ANOVA
permitirá comparar las medias de tratamiento de forma simultánea y evitar la acumulación
del error de Tipo I.
5. La prueba de ANOVA
La prueba ANOVA o análisis de varianza es un método estadístico que permite
descubrir si los resultados de una prueba son significativos, es decir, permiten determinar
si es necesario rechazar la hipótesis nula o aceptar la hipótesis alternativa.
El uso apropiado de ANOVA en el análisis de los datos de la encuesta requiere
que se cumplan algunos supuestos, incluyendo la distribución normal de la información,
la independencia de los casos y la igualdad de varianza. Si estas suposiciones no pueden
cumplirse, existen pruebas no paramétricas disponibles que no las requieren.
Tipos de prueba ANOVA
Los tres tipos de prueba ANOVA que es posible realizar son los siguientes:
ANOVA unidireccional: Esta tiene una variable independiente. Este método se
utiliza para comparar dos medias de dos grupos independientes (no relacionados)
utilizando la distribución F. La hipótesis nula para la prueba es que las dos medias sean
iguales. Por lo tanto, un resultado significativo es que las dos medias sean desiguales.
ANOVA bidireccional: Este método es una extensión de la prueba
unidireccional. Sin embargo, La prueba ANOVA bidireccional tiene dos variables
independientes. Generalmente, se utiliza cuando existe una variable de medición, es decir,
una variable cuantitativa y dos variables nominales.
MANOVA: Este método se utiliza cuando existen múltiples variables
independientes. Su propósito es determinar si la variable dependiente se modifica
mediante la manipulación de la variable independiente.
Las preguntas que MANOVA permite resolver son las siguientes:
• ¿Los cambios en las variables independientes tienen efectos estadísticamente
significativos en las variables dependientes?
• ¿Cuáles son las interacciones entre las variables dependientes?
• ¿Cuáles son las interacciones entre las variables independientes?
5.1. Ejemplo 1
Se quiere evaluar la eficacia de distintas dosis de un fármaco contra la hipertensión
arterial, comparándola con la de una dieta sin sal. Para ello se seleccionan al azar 25
hipertensos y se distribuyen aleatoriamente en 5 grupos. Al primero de ellos no se le
suministra ningún tratamiento, al segundo una dieta con un contenido pobre en sal, al
tercero una dieta sin sal, al cuarto el fármaco a una dosis determinada y al quinto el mismo
fármaco a otra dosis. Las presiones arteriales sistólicas de los 25 sujetos al finalizar los
tratamientos son:
Grupo
1 2 3 4 5
180 172 163 158 147
173 158 170 146 152
175 167 158 160 143
182 160 162 171 155
181 175 170 155 160
La tabla de anova es:
Fuente de variación GL SS MS F
Tratamiento 4 2010,64 502,66 11,24
Error 20 894,4 44,72
Total 24 2905,04
Como F0,05(4,20) =2,87 y 11,24>2,87 rechazamos la hipótesis nula y concluimos que los
resultados de los tratamientos son diferentes.
Nota: Para hacerlo con un paquete estadístico, p.e. el SPSS, deberíamos crear un archivo
con 2 variables: Trata (con un código distinto para cada grupo, p.e. de 1 a 5) y Presion
con la presión arterial de cada individuo al acabar el estudio. Para calcular el Anova
desplegamos los menús que se ven en la gráfica:
La tabla de anova que devuelve el programa es
que incluye también el “valor p” asociado al contraste.
6. TRATAMIENTO E INFERENCIA SOBRE PARES DE MEDIAS
Los intervalos de confianza y las pruebas de significación para la media m de una
población normal se basan en la media muestral ¯ x. La media de la distribución de ¯ x
es m. Es decir, ¯ x es un estimador insesgado de la m desconocida. La dispersión de ¯ x
depende del tamaño de la muestra y de la desviación típica poblacional s. En el capítulo
anterior hicimos el supuesto, poco realista, de que conocíamos el valor de s. En la práctica,
s es desconocida. Por tanto, tenemos que estimar s a partir de los datos, incluso si nuestro
principal interés es m. La necesidad de estimar s cambia algunos detalles de las pruebas
de significación y de los intervalos de confianza para m, pero no su interpretación. He
aquí los supuestos de los que partimos al hacer inferencia para la media poblacional.
7. Análisis de varianza de dos direcciones.
Es un diseño de anova que permite estudiar simultáneamente los efectos de dos
fuentes de variación.
En el ejemplo 1, en el que se estudiaban diversos tratamientos para la hipertensión
arterial, se podría plantear que, quizás, la evolución de la misma fuera diferente para los
hombres y las mujeres, en cuyo caso, y si el número de hombres y mujeres en cada
muestra no fuera el mismo, podría ocurrir que una parte del efecto atribuido a los
tratamientos fuera debido al sexo.
En cualquier caso, el investigador puede estar interesado en estudiar si hay, o no,
diferencia en la evolución según el sexo. En un anova de dos vías se clasifica a los
individuos de acuerdo a dos factores (o vías) para estudiar simultáneamente sus efectos.
En este ejemplo se harían cinco grupos de tratamiento para los hombres y otros cinco para
las mujeres, en total diez grupos; en general, si el primer factor tiene a niveles y el segundo
tiene b, se tendrán ab muestras o unidades experimentales, cada una con n individuos o
repeticiones.
Una observación individual se representa como:
El primer subíndice indica el nivel del primer factor, el segundo el nivel del
segundo factor y el tercero la observación dentro de la muestra. Los factores pueden ser
ambos de efectos fijos (se habla entonces de modelo I), de efectos aleatorios (modelo II)
o uno de efectos fijos y el otro de efectos aleatorios (modelo mixto). El modelo
matemático de este análisis es:
modelo I
modelo II
modelo mixto
donde m es la media global, ai o Ai el efecto del nivel i del 1º factor, bj o Bj el efecto del
nivel j del 2º factor y e ijk las desviaciones aleatorias alrededor de las medias, que también
se asume que están normalmente distribuidas, son independientes y tienen media 0 y
varianza s2.
A las condiciones de muestreo aleatorio, normalidad e independencia, este modelo
añade la de aditividad de los efectos de los factores.
A los términos ( ab )ij, (AB)ij, (aB)ij, se les denomina interacción entre ambos
factores y representan el hecho de que el efecto de un determinado nivel de un factor sea
diferente para cada nivel del otro factor.
Para entender mejor este concepto de interacción veamos un ejemplo sencillo
sobre un anova de dos factores, cada uno con dos niveles: supóngase un estudio para
analizar el efecto de un somnífero teniendo en cuenta el sexo de los sujetos. Se eligen al
azar dos grupos de hombres y otros dos de mujeres. A un grupo de hombres y otro de
mujeres se les suministra un placebo y a los otros grupos el somnífero. Se mide el efecto
por el tiempo que los sujetos tardan en dormirse desde el suministro de la píldora.
Se trata de un anova de dos factores (sexo y fármaco) fijos, cada uno con dos
niveles (hombre y mujer para el sexo y somnífero y placebo para el fármaco). Los dos
tipos de resultados posibles se esquematizan en la figura
A B
En la figura A se observa que las mujeres tardan más en dormirse, tanto en el
grupo tratado como en el grupo placebo (hay un efecto del sexo) y que los tratados con
placebo tardan más en dormirse que los tratados con somnífero en ambos sexos (hay un
efecto del tratamiento). Ambos efectos son fácilmente observables.
Sin embargo en la figura B es difícil cuantificar el efecto del somnífero pues es
distinto en ambos sexos y, simétricamente, es difícil cuantificar el efecto del sexo pues es
distinto en ambos grupos de tratamiento. En este caso, se dice que existe interacción.
Podría, incluso, darse el caso de que se invirtieran los efectos de un factor para los
distintos niveles del otro, es decir, que las mujeres se durmieran antes con el somnífero y
los hombres antes con el placebo.
La interacción indica, por tanto, que los efectos de ambos factores no son aditivos:
cuando se dan juntos, su efecto no es la suma de los efectos que tienen cuando están por
separado, por lo que, si en un determinado estudio se encuentra interacción entre dos
factores, no tiene sentido estimar los efectos de los factores por separado. A la interacción
positiva, es decir, cuando el efecto de los factores actuando juntos es mayor que la suma
de efectos actuando por separado, en Biología se le denomina sinergia o potenciación y a
la interacción negativa inhibición. En el ejemplo de la figura B, se diría que el ser mujer
inhibe el efecto del somnífero, o que el ser hombre lo potencia (según el sexo que se tome
como referencia).
8. ANOVA de dos vías o dos direcciones con interacción
Las condiciones necesarias para que un ANOVA de dos vías sea válido, así como
el proceso a seguir para realizarlo son semejantes al ANOVA de una vía. Las únicas
diferencias son: Hipótesis: El ANOVA de dos vías con repeticiones combina 3 hipótesis
nulas, que las medias de las observaciones agrupadas por un factor son iguales, que las
medias de las observaciones agrupadas por el otro factor son iguales; y que no hay
interacción entre los dos factores. Requiere calcular la la Suma de Cuadrados y Cuadrados
Medios para ambos factores. Es frecuente encontrar que a un factor se le llama
“tratamiento” y al otro “bloque o block” Es importante tener en cuenta que el orden en el
que se multiplican los factores no afecta al resultado del ANOVA únicamente si el
tamaño de los grupos es igual (modelo equilibrado) de lo contrario sí importa. Por esta
razón es muy recomendable que el diseño sea equilibrado. El estudio de la interacción de
los dos factores solo es posible si se dispone varias observaciones para cada una de las
combinaciones de los niveles. En R se puede realizar este tipo de ANOVA con las
funciones:
Modelo aditivo: aov(variable_respuesta ~ factor1 + factor2, data)
Modelo con interacción: aov(variable_respuesta ~ factor1 x factor2, data)
Tamaño del efecto
En el caso del ANOVA con dos factores se puede calcular el tamaño del efecto
η2para cada uno de los dos factores, así como para la interacción.
9. Prueba de hipótesis para detectar interacción
Debido a la dificultad de explicar este tema se enfocará un problema basado en un
estudio en una fábrica de llantas. En este problema la fábrica de llantas tiene dos turnos
de operarios, turno de día y turno mixto. Se selecciona una muestra aleatoria de 100
llantas producidas por cada turno para ayudar al gerente a sacar conclusiones de cada una
de las siguientes preguntas:
1.- ¿Es la duración promedio de las llantas producidas en el turno de día igual a 25 000
millas?
2.- ¿Es la duración promedio de las llantas producidas en el turno mixto menor de 25 000
millas?
3.- ¿Se revienta más de un 8% de las llantas producidas por el turno de día antes de las
10 000 millas?
Prueba De Hipótesis Para La Media
En la fábrica de llantas la hipótesis nula y alternativa para el problema se plantearon como
sigue:
Ho: μ = 25 000
H1: μ ≠ 25 000
Si se considera la desviación estándar σ las llantas producidas en el turno de día, entonces,
con base en el teorema de limite central, la distribución en el muestreo de la media
seguiría la distribución normal, y la prueba estadística que esta basada en la diferencia
entre la media de la muestra y la media μ hipotιtica se encontrara como sigue:
Para ver el gráfico seleccione la opción "Descargar" del menú superior
Si el tamaño de la región α de rechazo se estableciera en 5% entonces se podrían
determinar los valores críticos de la distribución. Dado que la región de rechazo esta
dividida en las dos colas de la distribución, el 5% se divide en dos partes iguales de 2.5%.
Dado que ya se tiene la distribución normal, los valores críticos se pueden expresar en
unidades de desviación. Una región de rechazo de 0.25 en cada cola de la distribución
normal, da por resultado un área de .475 entre la media hipotética y el valor crítico. Si se
busca está área en la distribución normal, se encuentra que los valores críticos que dividen
las regiones de rechazo y no rechazo son + 1.96 y - 1.96
Por tanto, la regla para decisión sería:
Rechazar Ho si Z > + 1.96
O si Z < - 1.96
De lo contrario, no rechazar Ho
No obstante, en la mayor parte de los casos se desconoce la desviación estándar de la
población. La desviación estándar se estima al calcular S, la desviación estándar de la
muestra. Si se supone que la población es normal la distribución en el muestreo de la
media seguiría una distribución t con n-1 grados de libertad. En la práctica, se a
encontrado que siempre y cuando el tamaño de la muestra no sea muy pequeño y la
población no este muy sesgada, la distribución t da una buena aproximación a la
distribución de muestra de la media. La prueba estadística para determinar la diferencia
entre la media de la muestra y la media de la población cuando se utiliza la desviación
estándar S de la muestra, se expresa con:
Para una muestra de 100, si se selecciona un nivel de significancía de .05, los valores
críticos de la distribución t con 100-1= 99 grados de libertad se puede obtener como se
indica en la siguiente tabla:
Para ver el gráfico seleccione la opción "Descargar" del menú superior
Como esta prueba de dos colas, la región de rechazo de .05 se vuelve a dividir en dos
partes iguales de .025 cada una. Con el uso de las tablas para t, los valores críticos son –
1.984 y +1.984. la regla para la decisión es:
Rechazar Ho si >+1.984
O si - 1.984
De lo contrario, no rechazar Ho
Los resultados de la muestra para el turno de día fueron =25 430 millas, =4 000
millas y = 100. Puesto que se esta probando si la media es diferente a 25 000 millas,
se tiene con la ecuación
Para ver el gráfico seleccione la opción "Descargar" del menú superior
Dado que = 1.075, se ve que -1.984 < +1.075 < + 1.984, entonces no se rechaza Ho.
Por ello, la de cisión de no rechazar la hipótesis nula Ho. En conclusión, es que la duración
promedio de las llantas es 25 000 millas. A fin de tener en cuenta la posibilidad de un
error de tipo II, este enunciado se puede redactar como "no hay pruebas de que la duración
promedio de las llantas sea diferente a 25 000 millas en las llantas producidas en el turno
de día".
- Análisis
El análisis de varianza (ANOVA) prueba la hipótesis de que las medias de dos o
más poblaciones son iguales. El análisis de varianza evalúa la importancia de uno o más
factores comparando los valores medios de las variables de respuesta en diferentes niveles
de factores. La hipótesis nula determina que todas las medias poblacionales (medias de
los niveles de los factores) son iguales, mientras que la hipótesis alternativa determina
que hay al menos una diferencia.
Para ejecutar ANOVA, debe tener una variable de respuesta continua y al menos
un factor categórico con dos o más niveles. El análisis de varianza requiere que los datos
generales sigan una distribución normal aproximada y que las varianzas entre los niveles
de los factores sean iguales. Sin embargo, incluso cuando se viola el supuesto de
normalidad, el programa de análisis de varianza funciona bien a menos que una o más
distribuciones estén muy sesgadas o tengan varianzas muy diferentes. La conversión del
conjunto de datos original puede corregir estas violaciones. Por ejemplo, diseña un
experimento para evaluar la durabilidad de cuatro productos de alfombra experimentales.
Colocó muestras de cada alfombra en 10 casas y midió su durabilidad después de 60 días.
Debido a que está examinando un factor (tipo de alfombra), está utilizando un análisis de
varianza unidireccional.
Bibliografía
• A.I.D.E.P. Estadísticas y probabilidades. (1971). España. Editorial Reverté.
• Caja Poma, R. Probabilidad y Estadística: Un enfoque teórico y práctico. (2018,
Kindle). España. Ruddy Caja Poma.
• Devore, J. Probabilidad y Estadística para Ingeniería y Ciencias. (2016). España.
Cengage Learning.
• [Link]/documentos/lecciones/L3.2_Prueba_Hipotesis_95.ppt
• [Link]/documentos/lecciones/L3.3_Prueba_Hipotesis_2_pob_95.
ppt