Historia y Métodos del Diseño de Experimentos
Historia y Métodos del Diseño de Experimentos
FACULTAD DE MATEMÁTICAS
DISEÑO DE EXPERIMENTOS
Antecedentes Históricos.
Su método opera con la premisa de que los datos no se ajustan perfectamente a una
distribución normal. Recolectan datos rápida e iterativamente. Los diseños de
Taguchi se aplican en la industria de manufactura. Estos diseños conocidos como
diseños paramétricos robustos reconocen dos tipos de variables en un experimento,
aquéllos que se pueden controlar y que denomina parámetros y aquéllos que no se
pueden controlar y que denomina factores de ruido. Los diseños consisten en
combinar fracciones de diseños factoriales (donde los factores son los parámetros)
con los factores de ruido y se determina la mejor combinación que produzca la
respuesta deseada y con la menor variación. Aquélla combinación que produzca
estas condiciones recibe el nombre de robusto. Y el interés de la metodología de
Taguchi es encontrar aquellas condiciones de un proceso que sea poco sensible a los
cambios ambientales o de ruido. Esta metodología aún despierta controversias por
cuanto a la estrategia experimental y sus métodos presentan problemas.
En 1951 Box y Hunter contribuyen con análisis de diseños compuestos en la
superficie de respuesta.
En 1954 Tukey y Scheffé desarrollan métodos para comparaciones múltiples.
En 1957 Box trabaja con la metodología de superficies de respuesta.
En 1960 se desarrollaron los diseños Box Behnken
En 1961 Box y Hunter trabajan en los diseños fraccionarios de resolución 2k-p.
Otros que han contribuido al desarrollo del DDE son Kempthorne, Cox, Myers etc.
A partir de las controversias que se han generado con la metodología de Taguchi y
con el amplio uso del diseño de experimentos en todo campo se inicia la cuarta era
del desarrollo del diseño de experimentos
Alrededor de 1998 Mikel Harry comenzó a propagar la metodología Seis Sigma,
integrándolo al DE en una secuencia Medición –Análisis- Mejora- Control, cuyo
objetivo es mejorar ambos: manufactura y proceso transaccional o comercial. Hay otra
secuencia para la formulación: Identificar- Diseñar- Optimizar- Verificar que se utiliza
para desarrollar nuevos productos y procesos.
El DE asume ahora el papel de un agente de cambio no sólo en la investigación, sino
también en los negocios.
4
¿Qué es un experimento?
Antes de plantear un experimento es importante responder a la siguiente pregunta ¿para qué
se va a realizar o qué propósito se persigue para realizarlo? Puede llevarse a cabo para
determinar las causas de variación de una variable dependiente o respuesta, para encontrar
las condiciones que dan lugar a una respuesta máxima o mínima, para comparar las
respuestas que se obtienen trabajando las variables independientes a distintos valores o
niveles, o bien para obtener un modelo matemático que permita predecir respuestas en el
futuro. En pocas palabras, los experimentos los realizan los investigadores para descubrir
algo acerca de un proceso o de un sistema en particular.
Cobb G. (1998) en su libro Introduction to Design and Analysis of Experiments recalca que
al diseñar un experimento es importante decidir ¿Qué mediciones hacer? ¿Qué condiciones
estudiar? Y ¿Qué material experimental utilizar? Y que planear un experimento es el
resultado de la formulación de una pregunta. Algo que se desea saber lleva a la formulación
de una pregunta. En general cuando se plantea la pregunta, ésta suele ser muy general y
difícil de responder. Lo primero que hay que hacer es convertirla en una pregunta más
específica que pueda responderse planteando un experimento.
Kelly Acampora está interesada en saber lo que pasa cuando los animales invernan,
específicamente desea estudiar cómo los cambios en el ambiente animal causan que el
animal comience a invernar.
El diseño debe comenzar con decidir las preguntas por responder, pero no debe limitarse a
una pregunta muy general como la que se planteó Kelly. Hay que ser más específico y para
esto Kelly tuvo que enfrentarse a las siguientes preguntas:
Ella sabe que los animales invernan cuando llega esta estación, y sabe que hay más frío y
que el día es más corto (fotoperíodo corto).
5
Hasta aquí Kelly se decidió por tres cosas. Estudiar el efecto de la longitud del día
(tratamientos) para medir la concentración de la enzima Na ATP-asa y usar hámsteres
dorados. Y con estas decisiones una pregunta muy general se convierte en una más
específica.
“Un experimento es una prueba o serie de pruebas en las cuales se hacen cambios sobre las
variables de entrada de un proceso de manera que se puedan observar o identificar las
razones de los cambios en la variable de salida o respuesta”.
En los siguientes ejemplos proporcione mentalmente cuáles son los factores, cuál la
variable respuesta y proponga algunos factores no controlables y controlables que pueden
presentarse en cada experimento.
Es importante señalar que las verdaderas inferencias de causa-efecto sólo pueden obtenerse
de verdaderos experimentos y no tanto de estudios observacionales. Por ejemplo, si en una
fábrica los productos que salen de una máquina comienzan a salir defectuosos, con un
estudio observacional, podría suponerse que se debe a la máquina, al operador o a las
condiciones climáticas del sitio en el que se encuentra ubicada la máquina, pero si se realiza
el experimento de cambiar de máquina, probar con distintos operadores o cambiar de
ubicación la máquina dentro de la misma fábrica, podría llegarse a descubrir la causa de
porqué el producto sale defectuoso.
Es importante señalar que los experimentos que se plantean con regularidad son
comparativos, es decir se interesan en comparar distintos tratamientos y muchas veces es
con el objeto de seleccionar al mejor o al que produce una respuesta dada. Sin embargo,
nuestro objetivo no debe limitarse a buscar al ganador, sino a realmente comparar los
tratamientos observando cuál es el efecto de cada uno de ellos en la respuesta. Un
tratamiento puede producir el mejor rendimiento pero puede ser de muy alto costo o puede
producir el más alto rendimiento, pero también el más variable.
Diseño de experimentos
Diseñar un experimento consiste en PLANEARLO de tal forma que se recolecten los datos
adecuados, los cuales serán analizados por métodos estadísticos que den como resultados
conclusiones válidas y objetivas (Montgomery, 1995).
Se deben planear de modo que las comparaciones estén lejos de un error sistemático, que
sean suficientemente precisos, que las conclusiones tengan un amplio rango de validez, que
el arreglo experimental sea tan simple como sea posible y que la incertidumbre de las
conclusiones sea calculable (Cox, 1958).
8
Cobb (1998) considera que para diseñar un experimento y una vez que se haya definido el
problema con claridad hay que tratar de identificar las fuentes de variabilidad que pudieran
afectar en el experimento:
1. variabilidad debida a las condiciones de interés.
2. variabilidad debida al proceso de medición.
3. variabilidad debida al material experimental y al proceso.
Aparentemente hay diferencia ya que los promedios difieren, y vemos que hay mucha
variabilidad 0.3 y de 0.24. Se necesita estimar cuánto de la diferencia entre promedios es
debido a la longitud del día y cuánto es debido a otras fuentes.
Variabilidad de las condiciones de interés- variación del fotoperíodo.
Es decir la fuente de variación que si se quiere y se estima el efecto del fotoperiodo, para
elegir el órgano donde se medirá la enzima. La concentración de la enzima depende del
órgano que se mida. Kelly decidió estudiar dos órganos: corazón y cerebro. Se preguntó
¿hay diferente en el cerebro y corazón de los hámsteres? Ella sabe que en el cerebro
concentración es mayor. La longitud del fotoperiodo afectará la concentración de la enzima
del mismo modo en el cerebro y en el corazón. Es de esperar que debido a que tienen
distintas funciones, el cerebro y el corazón se comporten distinto cuando están listos para
invernar. Es decir evalúa si existe interacción, ¿el efecto del fotoperíodo depende del
órgano donde se mide la enzima?
Días largos vs. Días cortos.
Cerebros vs. Corazones.
La otra variabilidad es en la respuesta:
Cuando mides dos cosas bajo las mismas condiciones nunca obtienes un número idéntico.
Nuestro experimento debe permitirnos estimar el tamaño de la diferencia debido a tal
variabilidad inevitable en el proceso de medición.
Para determinar la concentración de la enzima, Kelly tuvo que sacrificar al hámster, separar
el tejido y usar una metodología o secuencia de pasos para suspender la enzima en un
líquido y, como paso final, medir la concentración de la enzima usando un
espectrofotómetro para medir la cantidad de luz absorbida por partículas suspendidas. En
cada etapa de todo el experimento habrá cosas que producirán diferencias. Comenzando por
la disección, este es un proceso difícil, particularmente por que se desea el tejido "puro", a
la hora de leer en el equipo, aún calibrándose, en cada corrida de mediciones se introducirá
la variabilidad cada vez que se calibre el espectrofotómetro.
2) Proceso de medición:
- Preparación en suspensión de la enzima.
- Calibración del espectrofotómetro.
10
3) En el material experimental:
Diferencias biológicas entre hámsteres.
Diferencias de ambiente y comportamiento.
que incluye las fuentes de variación no controlables o error. Por tanto, contiene
información de todos los factores y de sus niveles. Los factores se denotan con
letras griegas y sus subíndices corresponden a los niveles.
8. Correr un experimento piloto. El correr un experimento con unas pocas
observaciones, permitirá practicar el procedimiento experimental, identificar los
problemas que pudieran presentarse en el experimento grande, para checar la lista
de pasos a realizar y para calcular el error experimental que servirá en el cálculo del
tamaño de muestra.
9. Evaluación Preliminar del diseño. El investigador desarrollará una tabla con todas
las fuentes de variación, es decir con las etiquetas de los factores, sus errores de
restricción, sus interacciones, grados de libertad , sumas de cuadrados, cuadrados
medios esperados etc. La tabla indicará no sólo los factores a probar sino los
estadísticos de prueba correspondientes. Todo esto debe considerarse antes de
obtener algún dato. Así notará cuáles se pueden probar directamente, la cantidad de
información disponible para estas pruebas y las suposiciones necesarias para hacer
pruebas conservadoras. Asimismo debe ver si tiene sentido en la vida práctica.
10. Rediseñando el experimento. Considerando lo anterior, se planteará un nuevo
diseño y se comparará la tabla anterior con la actual.
11. Recolección de los datos. Una vez que se ha determinado si el diseño es el más
adecuado para el experimento, éste puede llevarse a cabo para finalmente obtener
los datos. Antes de realizarlo es conveniente hacer un experimento piloto para
obtener información de la consistencia del material experimental, para comprobar
el sistema de medición, para tener una idea del error experimental y para revisar la
realización del experimento. Se requiere de un equipo organizado y muchos
observadores. El éxito de la investigación depende de la validez de todos los datos
obtenidos. Una de las mejores maneras de recolectarlos es aquella en la que el
estadístico diseñe una forma de entrada de datos el cual sería llenado por el
inspector y después verificado por una persona que lleve a cabo el experimento. La
forma debe ser fácil de usar, entendible y a prueba de malas interpretaciones.
12. Analizando los resultados. El análisis de los resultados es responsabilidad del
estadístico y deberán emplearse métodos estadísticos que garanticen la objetividad
de las conclusiones. Se servirá de programas de cómputo, pero es su conocimiento
del diseño estadístico empleado el que le servirá para interpretar las salidas de
cómputo. Es importante considerar que en muchos programas hay que especificar si
existe un factor aleatorio porque las pruebas estadísticas cambian si existe uno
aleatorio en el diseño. Actualmente existe la opción de que uno elija los cocientes
de sus pruebas estadísticas, sin tener que especificar que se trata de un factor
aleatorio.
13. Conclusiones. Una vez interpretados los resultados por el estadístico y con la ayuda
de un equipo multidisciplinario se establecen las conclusiones. Montgomery sugiere
realizar corridas de seguimiento o pruebas de comprobación para validar las
conclusiones del experimento.
Ejercicio
Elige un artículo de investigación del área e identifica los siguientes puntos:
a) Problema
b) Hipótesis de investigación
13
inferencia, es decir las unidades y los tratamientos a los que van a aplicarse las
conclusiones. Es importante que el experimento sea descrito con tal detalle que hasta las
posibles fuentes de error sean consideradas de antemano.
5. Resultados. Esta sección nos dice lo que encontró. Expresar los resultados en forma
tabular. Utilizar gráfica si es necesario. Tablas como gráficas deben tener títulos, y las
variables deben expresarse con sus unidades de medición. Discuta todas las fuentes de
error y describa cómo podrían afectar los resultados. Muestre también el proceso de
aleatorización de los tratamientos a las unidades experimentales y del orden de las
corridas experimentales.
6. Análisis de resultados: Esta es la parte más importante a evaluar en esta asignatura.
Presente estadísticos de resumen con su interpretación (análisis exploratorio de los
datos) Realice el análisis de varianza completo desde la formulación del modelo hasta
la potencia de la prueba. Proporcione las interpretaciones en términos del problema.
7. Discusión y Conclusiones. Trate de presentar los principios, relaciones,
generalizaciones que indiquen los resultados; no recapitular resultados. Para hacer
generalizaciones se tiene que tener en cuenta si las unidades experimentales son
representativas de la población, es decir hay que tomar en cuenta el espacio inferencia.
Señale excepciones o faltas de correlación, delimite aspectos no resueltos. Muestre
cómo concuerdan sus resultados con los de la bibliografía consultada o con la hipótesis
que propuso, formule conclusiones lo más claramente posible. Igualmente proporcione
ideas para un estudio futuro con el objeto de mejorar el actual.
8. Referencias. Debe incluir el listado de libros o artículos de revistas. Dentro del texto
Ud. puede emplear el sistema Harvard (Nombre, año) y de las referencias completas en
esta sección como se muestra a continuación:
Fowler, H. W. (1983), Dictionary of Modern English Usage (2nd edition revised by Ernes
Gowers), Oxford University Press, Oxford and New York.
Gowers, Sir Ernest (1973), The Complete Plain Word (2nd edition revised by Sir Bruce
Fraser), Penguin Books, Harmondsworth, Middlesex.
Respecto a la presentación el reporte debe ser atractivo a la vista; debe ser claro y legible.
Trate de usar un procesador de textos.
Factores
Son las variables que se controlan y cuyo efecto se mide, es decir, las variables
independientes. Su efecto se mide sobre las unidades experimentales.
Las variables independientes deben ser manipulables a niveles del interés del investigador.
Los niveles pueden ser: varias clases o tipos (cualitativo) o varias magnitudes o cantidades
(cuantitativos).
También es de interés el rango de la variable independiente a ser incluida en el
experimento, especialmente si se trata de estudiar el efecto de un factor cuantitativo. El
rango debe ser tal que sí se puedan observar cambios en la respuesta al cambiar de nivel.
Debe ser un rango completo de variación así como condiciones intermedias para
proporcionar una idea de la naturaleza de la relación de la variable respuesta y la
independiente. Si es un factor cuantitativo y se quiere saber la relación que guardan las
17
Variable respuesta.
Una vez que hemos propuesto una hipótesis hay que detallar el estudio para
recolectar los datos. Se debe decidir el aspecto particular del fenómeno que observaremos y
qué mediciones se harán, qué mediciones capturan el fenómeno más exactamente. Un
experimento que involucra una simple variable dependiente es un experimento univariado
aunque se esté estudiando más de una variable independiente. Para elegir la variable
respuesta se debe elegir aquélla que sea la más sensible a las condiciones de tratamiento.
La medición, esto es la asignación de etiquetas o números a los atributos de los
objetos o eventos, es un aspecto muy completo. Se supone que es deseable que los valores
de la variable dependiente tengan poca variabilidad de sujeto a sujeto (condiciones
genéticas parecidas en las semillas, por ejemplo). Esto incrementará la precisión en las
estimaciones y contribuirá a la potencia estadística para cualquier tamaño de muestra.
También la variable dependiente se distribuye normalmente ya que muchos procedimientos
estadísticos paramétricos inferenciales suponen normalidad. Es deseable que la variable
respuesta sea cuantitativa y continua.
Variables suplementarias.
Existen otras variables independientes que pueden afectar a la respuesta pero que no son de
interés del investigador, se les llama suplementarias o Nuisance. Es necesario controlar
estas variables para incrementar la precisión con la cual se pueden estimar los efectos de la
variable independiente o para remover el sesgo de esas estimaciones. Hay dos formas de
controlarla: Directamente (experimentalmente, a través del bloqueo), indirectamente (como
covariables) o si no se pueden controlar quedan comprendidas dentro del término de error.
También están incluidas aquéllas que pueden afectar a la respuesta, que no se pueden
controlar a niveles fijos como bloques, ni mediante control indirecto (como covariable),
18
pero sí se pueden mantener a un único valor o nivel; las conclusiones se limitarían a esos
niveles estudiados. Por ejemplo si estamos estudiando el efecto de la dieta en el incremento
de peso de los cochinitos, y se consiguieron unidades experimentales similares (corrales
con cerditos de aproximadamente el mismo peso inicial) y se sabe que la raza puede
afectar, pueden elegirse cerditos de la misma raza y las conclusiones se limitarán a esta
raza, no podrán hacerse extrapolaciones a otras.
Réplica.
Es la repetición del experimento básico. Es decir una réplica contiene todas las
combinaciones de tratamiento del experimento. La réplica permite darnos una idea de que
un tratamiento es diferente a otro. Mead proporciona un ejemplo en el que son dos
productores de cierto cultivo. El agricultor A produce 24.1 y 24.2 kilogramos del cultivo y
el agricultor B produjo 21.4. Gracias a la réplica se puede uno dar cuenta de que existe
diferencia y de que ésta es grande.
Para representar a una población se requiere de réplicas, ya que una unidad no da idea de
cómo es la población. Debido a que no todos los elementos de una población son iguales,
requerimos de réplicas que nos indiquen la variabilidad de la población. Mientras más
variable es la población, se requerirán más réplicas para adecuadamente representarla. No
hay que caer en la tentación de tratar una repetición o una pseudorréplica como verdadera
réplica.
Es importante distinguir entre réplica y repetición, por ejemplo si se asignan 10 plántulas a
cada tipo de fertilizante el resultado consiste en 10 mediciones independientes de la altura
final de plantas sometidas a un fertilizante, esto es son 10 réplicas. Pero si a una planta se le
lee la altura 10 veces entonces son repeticiones de una lectura, son mediciones repetidas y
no son independientes. La variación en las mediciones repetidas refleja la variabilidad en el
proceso de medición y la variación entre réplicas refleja la variabilidad de las unidades
experimentales sometidas al mismo tratamiento.
Algunas veces uno está tentado a partir el campo en réplicas o parcelas más pequeñas, no
confundir. Por ejemplo suponga que se desea evaluar el efecto de ciertas dietas en el
incremento en peso del puerco. Suponga que desea comparar 4 dietas en el incremento en
peso y la unidad experimental a la que se aplicó el tratamiento son los corrales, ya que al
corral completo con sus 5 puerquitos se les da la dieta como a un todo. Suponga que hay 8
corrales de modo que cada dieta se puede aplicar únicamente a dos corrales. De este modo
hay únicamente dos réplicas por tratamiento. La tentación es usar como réplicas a los
puerquitos individuales, así tendríamos 10. Esto sería incorrecto por las siguientes razones.
1) el puerquito no es la unidad experimental, sino que es el corral. De otro modo habría que
alimentar al cochinito en forma individual. 2) La variación entre cochinitos dentro de un
corral es muy similar a la variación en diferentes corrales con el mismo tratamiento. Y no
hay forma de evaluar la variación dentro del corral por lo que no se puede usar para
comparar las dietas.
Las réplicas permiten al experimentador tener una estimación del error experimental.
Esta medición se convierte en la unidad básica de medición para determinar si las
diferencias observadas en los datos son estadísticamente significativas. El uso de réplicas
también permite:ejercer control sobre la varianza del error, aumentar el espacio inferencia
y,mejorar la precisión del experimentoes decir, a medida que el número de repeticiones
aumenta, las estimaciones de las medias son más precisas.
19
Error experimental.
Es una medida de la variación existente entre las unidades experimentales tratadas en forma
similar. Es la variación no controlada – ni como variable independiente, ni como
suplementaria controlada- entre las unidades experimentales sometidas al mismo
tratamiento.
Se pueden distinguir varias fuentes de error:
1. La variabilidad inherente al material experimental al cual se aplican los
tratamientos.
2. La falta de uniformidad en la realización del experimento.
3. La variabilidad debida a la medición de la variable respuesta.
4. No es posible reproducir las condiciones del tratamiento exactamente de una unidad
a otra.
5. Factores externos que puedan influir en las características medidas.
El problema anterior tiene el inconveniente que los grupos si no son parecidos entre sí,
estarán confundidos con los métodos de enseñanza. Una mejor manera de probar ambos
métodos hubiera sido juntar a los dos grupos en uno solo y seleccionar al azar los miembros
de cada grupo, y asignar al azar los métodos a cada grupo.
Bloqueo.
Es una técnica de control estadístico y se usa para incrementar la precisión de un
experimento. Un bloque es una porción de material experimental que es más homogéneo
que la totalidad. La técnica de bloqueo se utiliza cuando existen variables que afectan a la
variable respuesta y que no interesa investigar; se puede controlar a determinados valores
constituyendo los bloques. A cada bloque se le asignan al azar los tratamientos de modo
que es posible averiguar su efecto sin importar esa otra variable que se maneja como bloque
reduciendo así la magnitud del error e incrementando la precisión del experimento. En los
diseños de bloques en muy común utilizar como factor de bloqueo, la proximidad de las
parcelas: parcelas vecinas son similares en fertilidad, tipo de suelo, etc.; las características
físicas de las unidades experimentales: individuos de una misma camada son más similares
entre sí que los de diferente camada.; el tiempo: las determinaciones realizadas en un día
por ejemplo son más similares entre sí que las realizadas en distintos días; los lotes de
materia prima: se puede realizar una réplica del experimento con un solo lote, y abrir un
21
nuevo frasco o lote del reactivo para realizar otra réplica del experimento; el personal que
realiza las determinaciones: cada técnico puede realizar una réplica del experimento y no
cada técnico un solo tratamiento pues si hay diferencias entre tratamientos no se sabrá si
esta diferencia es real o a que los técnicos aunque realizan la misma determinación con la
misma metodología la realizan en forma diferente.
Ortogonalidad
Ortogonalidad de factores: dos factores FI y FJ con I y J niveles, respectivamente, son
ortogonales si en cada nivel i de FI el número de observaciones de los J niveles de FJ están
en las mismas proporciones. Esta propiedad permite separar los efectos simples de los
factores en estudio.
Control local
Se refiere a las acciones que se realizan para controlar o disminuir el error experimental.
Estas acciones incluyen:
Ejercicio
1. Identifique los pasos de una investigación experimental.
2. ¿Cómo le sugeriría al investigador correr su experimento? Proponga un esquema
del diseño con todo y aleatorización.
Modelo Lineal
Describe a una observación y consta de una media y un error. Establece que para valores
fijos de una o más variables independientes se puede expresar la variable dependiente como
una combinación lineal de un conjunto de variables independientes.
Supongamos que µ(.) es una función lineal de la variable x.
( x) o 1x
donde o y 1 son parámetros desconocidos.
x está en un dominio D.
µ(x) es una función lineal de una variable real x
x es una variable no aleatoria observable.
Se supone que para cada valor de x, existe una familia de funciones de distribución
acumulada, de tal modo que la media de la función correspondiente a un valor de x,
digamos xo, es o+1xo.
Las medias de las funciones de distribución (cdf) caen en una línea definida por:
( x) o 1x
Se supone que:
E(yi)=o+1xi
Var (yi)=2
Los modelos son lineales en los parámetros es decir los parámetros están expuestos a la
potencia 1.
i yi o 1xi
Se llama error o residuo a la diferencia de ordenada de un punto muestral y la recta de
regresión correspondiente a la misma abscisa. Nótese que el error es una función de los
parámetros del intercepto y la pendiente. Por lo que un criterio razonable para seleccionar
estimadores para estos parámetros es elegir aquellos que minimicen la suma de cuadrados
del error. Éste es el principio del Método de Mínimos Cuadrados y los estimadores
resultantes reciben el nombre de estimadores mínimos cuadrados.
Este método consiste en minimizar los errores, es decir, las diferencias entre los
valores observados y los de la recta de regresión ajustada, o sea se estimarán aquellos
valores o y 1 de la recta que hagan mínima la diferencia entre dicha recta y los valores
observados.
El método de mínimos cuadrados establece que de todas las rectas de regresión que se
pueden ajustar al conjunto de puntos muestrales dados, la mejor es aquella que tenga la
propiedad de que la suma de los cuadrados de los errores sea mínima.
n
min i2 min ( yi o 1 xi ) 2
i 1
L ( yi o 1 xi ) 2
Para esto se aplicará la condición necesaria conocida para que una función de dos variables
independientes tenga un punto extremo (mínimo en este caso), es decir se igualará a cero
las primeras derivadas parciales de la función, con respecto a cada una de sus variables.
24
L
0
0
L
0
1
L n
2 y ( o 1xi ) 1
o i 1 i
n
2 yi o 1xi
i 1
2 yi no 1 xi 0
nˆo ˆ1 xi yi
L n
2 yi (o 1xi )( xi )
1 I 01
2 ( xi yi o xi 1xi2 )
2 xi yi o xi 1 xi2 0
o xi 1 xi2 xi yi
Agrupando las ecuaciones se obtiene un sistema de dos ecuaciones con dos incógnitas cuya
solución proporciona las estimaciones de los parámetros:
n n ( 1)
n xi yi
i i i 1 i 1
x y
n
̂1 i 1
2
n
xi
i 1
n
i 1
xi
2
n
n n ( 2)
xi yi
n
i 1 i 1
x y i i n
1 i 1
2
n
xi
n
i 1
xi2 i 1
n
ˆ o y ˆ1 x ( 3)
Distribución F de Fisher
Cuando el interés se centra en hacer inferencias respecto a dos varianzas poblacionales y lo
que se desea probar es que éstas son iguales, se comparan sus varianzas muestrales a través
de un cociente. Digamos, s21/s22. Si este cociente es igual a la unidad entonces se diría que
las varianzas son iguales, o que la diferencia entre las varianzas es tan pequeña que puede
atribuirse al azar o no es lo suficientemente grande como para rechazar la hipótesis nula de
igualdad de varianzas.
Dadas s12 y s22 varianzas calculadas a partir de muestras aleatorias independientes
de tamaños n1 y n2 tomadas de poblaciones normalmente distribuidas con varianzas 12 y
22 respectivamente, la variable aleatoria:
s2 2 ( 4)
F 1 1
s
2
2
2
2
s 2
2
2
( 6)
( 8)
( 9)
Forma de la Distribución
La forma de la distribución es asimétrica con sesgo positivo. Su forma es determinada por
los parámetros n1-1 y n2-1.
Igual que para la distribución2 mientras más grande sean los grados de libertad de una o de
las dos varianzas más simétrica es la curva.
26
La tabla de la distribución F debido a que es definida por los parámetros n1-1 y n2-1 y que
ambos ocupan las filas y las columnas, existe una tabla F para cada nivel de significación.
En una tabla F, la columna izquierda indica los grados de libertad del numerador (de la
razón de varianzas) y en la primera fila están los grados de libertad del numerador. En el
cuerpo de la tabla se encuentran los valores críticos F a la derecha de los cuales está en
nivel o probabilidad de cometer el error tipo I (Rechazar Ho dado que es verdadera).
Existen tablas para los más empleados 0.1, 0.05, 0.025 y 0.01. El valor crítico para un
nivel de significación especificado y 1 y 2, grados de libertad se indican como sigue:
Fα; 1 y 2,
Teorema de Cochran
Si Zi se distribuye NID(0, 1) para i=1,2,3,..., y
Z
i 1
i
2
Q1 Q2 ... Qs
y Qj tienen j grados de libertad y j=1,2,...,s, entonces las Qj se distribuyen como 2 si y
sólo si:
1 2 ... s
Así, si la suma de los grados de libertad de las fuentes de variación es igual a N-1, el
número total de grados de libertad, significa que los cocientes SCtrat/2 y SCE/2 son
variables aleatorias independientes que se distribuyen 2. Y el cociente de dos variables ji
cuadradas se distribuye F.
27
Análisis de varianza
El análisis de varianza es un diseño eficiente para cuando se trata de comparar en
forma simultánea más de dos tratamientos.
Es una técnica por medio de la cual la variación total se divide en varias componentes,
en el caso más sencillo en una debido a los tratamientos y otra debida a la variación aleatoria.
Por lo tanto, la intención del análisis de varianza es determinar si las diferencias entre las
medias de las muestras debidas a las variables estudiadas son significativas.
Para la realización de un análisis de varianza se consideran los siguientes pasos:
1.- Establecimiento de un modelo.
El modelo consiste de una representación simbólica de un valor típico tomado de los datos que
se analizan. Por ejemplo el modelo de un análisis de varianza de una vía es el siguiente:
yi j = + i + i j
donde, yij es una observación del experimento, de hecho es la j-ésima observación bajo el i-
ésimo tratamiento del experimento.
es la media global del experimento
i es el efecto del i-ésimo tratamiento
i j es el término de error; es el j-ésimo error bajo el i-ésimo tratamiento. Hay tantos errores
como observaciones.
2.- Todo modelo se fundamente en supuestos, y cuya violación implica no trabajar con el
nivel especificado.
Un ejemplo de supuesto en el que se apoya el análisis de varianza es la distribución normal e
independiente de los errores.
3.- Hipótesis son los enunciados que se quieren probar. Se indican la hipótesis nula y la
hipótesis alternativa. Las conclusiones se dan en términos de la hipótesis nula, es decir se
acepta o se rechaza la hipótesis nula de igualdad de medias.
4.- Cálculos o división de las sumas de cuadrados. La variabilidad de un conjunto de datos es
proporcional a la suma de cuadrados de las desviaciones
n
( yi - y)2 ( 9)
SC =
i=1 n 1
6.- Los intervalos de confianza para las medias de tratamientos dan una idea de la
variabilidad de las observaciones respecto a la media debido a la aleatorización.
7.- Verificación de los supuestos del modelo, lo cual implica checar los supuestos de
normalidad, independencia y homogeneidad de varianza sobre los que se apoya el análisis de
varianza.
8.- Potencia de la prueba. Determinación del tamaño n de la muestra.
del modelo (II) de efectos aleatorios en que los a tratamientos pueden ser una muestra
aleatoria de una población mayor de tratamientos y las conclusiones se generalizan a la
población. En este modelo estamos interesados en la variabilidad de los tratamientos más que
en sus efectos medios, y se le conoce también como modelo de componentes de varianza.
Cuando se diseñan experimentos se procura tener el mismo número de réplicas por
tratamiento, éste es el caso balanceado.
El arreglo de datos para el caso balanceado puede esquematizarse así:
Tratamiento
----------------------------------------------------------------
1 2 ... i ... a
----------------------------------------------------------------
Y11 Y21 Yi1 Ya1
Y12 Y22 Yi2 Ya2
. . . .
. . . .
Y1j Y2j Yij Yaj
. . . .
Y1n Y2n Yin Yan
------------------------------------------------------------------
Y1. Y2. Yi. Ya.
Las filas representan las observaciones y las columnas los tratamientos o bien, los
niveles del factor.
Aquí se empleó el subíndice i para denotar al tratamiento y el subíndice j para denotar
el número de la observación. La notación punto de Yi. -indica que se ha sumado sobre el
segundo suscrito j.
Es importante hacer notar que algunas veces se utilizan los estudios comparativos por
observación. En estos estudios el investigador no puede asignar al azar las unidades a los
tratamientos. Por ejemplo, que se desee evaluar un fertilizante en distintos tipos de campos,
pastizales, henequén y maizales, por ejemplo. Las poblaciones de tratamiento ya están
formadas de modo natural, lo único sería seleccionar al azar sendas muestras de los distintos
tipos de campos y aplicarles el fertilizante. El factor sería CAMPO, y sus niveles, pastizal,
henequén y maíz.
Modelo
Una observación típica del diseño se representa por un modelo que como ya se ha dicho se
compone de una media y un error.
yij i ij
31
A este modelo se le conoce como modelo de medias. Y nos dice que el puntaje de un
tratamiento i tiene dos fuentes de variación, el efecto de la media del i-ésimo tratamiento y el
término de error.
Si consideramos que cada media de tratamiento individual es igual a la gran media más un
término llamado efecto del i-ésimo tratamiento:
i i
i
de la media de tratamiento individual y la gran media i i , por otro lado, i 1
,
de este modo la suma de los desvíos de las medias individuales respecto a la gran media es
cero.
ij es el componente de error aleatorio. Representa todas las fuentes no controladas de
varianza que afectan a las mediciones individuales. Éste es único para cada uno de los
elementos de la población (de ahí que tiene los mismos subíndices) y se supone que es
independiente de los tratamientos.
Este se conoce como modelo reducido y corresponde al modelo cuando la hipótesis nula de
igualdad de medias es cierta.
Resumen: Una observación yij se expresa como la suma de 3 componentes: una componente µ
constante, para todas los tratamientos y todos los elementos. Una componente i constante
para todos los elementos dentro de la población de tratamientos pero que pueden diferir de
tratamiento a tratamiento. Y un componente aleatorio que es independiente de los tratamientos
y se distribuye normalmente como media cero y varianza 2.
Este modelo se apoya en los siguientes supuestos.
Supuestos
32
Puesto que ambas fuentes de variación µ y i son constantes para todas las observaciones
dentro de la i-ésima población, la única fuente de variabilidad de estas mediciones es debida al
error experimental.
Se supone que las a muestras proceden de a poblaciones que se distribuyen normalmente. Se
supone también que son a muestras aleatorias y que por consiguiente son independientes entre
sí y los elementos dentro de cada muestra también son independientes. Se supone que las
poblaciones de las que se extraen las muestras tienen una varianza común o varianza
homogénea.
Si los elementos se asignan al azar a las condiciones de tratamiento se tiene cierta certeza de
que los efectos del error son independientes de los tratamientos, de ahí la importancia de la
aleatorización. Igualmente debido a la aleatorización se supone que los errores se distribuyen
dentro de cada población normalmente distribuida con valor esperado igual a cero y varianza
2. Resumiendo,
iv) i = 0; esto significa que se trata de un modelo de efectos fijos. i es el efecto del i-
ésimo tratamiento y es igual a la diferencia i - . La suma de los efectos de
tratamiento es cero para el caso de efectos fijos. Y esto implica que µ es la media de
las medias µi. En el diseño de efectos fijos, dado que el interés se centra únicamente en
los a tratamientos, la suma de los desvíos o efectos τi es cero, en cambio en los efectos
aleatorios no suman cero debido a que sólo se extrae una muestra aleatoria de “a”
niveles del factor de una población grande de niveles del factor, de modo que no se
conoce la media global y mucho menos la suma de los desvíos es cero.
Hipótesis
El propósito del análisis consiste en probar la igualdad de medias de tratamientos.
Ho: 1 = 2 =...= a = 0
H1: i j para al menos un par i, j
Otra manera de expresarlo es:
Ho: i = j, i j
En palabras, Los efectos de los tratamientos son iguales a cero.
Puede verse que el modelo bajo la hipótesis nula es el modelo reducido, y el modelo completo
es el que corresponde a la hipótesis alternativa. Realmente lo que pretende el investigador es
determinar cuál de los modelos, completo o reducido, caracteriza mejor los datos del
experimento (Kuelh, 2000).
33
Los modelos que corresponden a los diseños experimentales pertenecen a una clase general de
modelos, modelo lineal general, en el que la respuesta está en función lineal de un conjunto de
parámetros: el ejemplo por excelencia es el modelo de regresión lineal, en el que las xj
corresponden a las variables independientes métricas. Igualmente el modelo de un factor
puede expresarse como un modelo lineal general pero la variable independiente que es el
factor puede dar lugar a un conjunto de a variables ficticias (dummy) o indicadoras.
y 1 X1 2 X 2 3 X 3
La variable ficticia indica el grupo de tratamiento al que pertenece la observación, x tendrá el
valor de 1 si pertenece a cierto grupo y de cero si no pertenece a dicho grupo. Por ejemplo
podemos definir para un experimento con tres tratamientos tres variables indicadoras que
toman los valores de 1 y 0 según si pertenecen al i-ésimo grupo o no pertenecen a él.
1 del tratamiento 1
x1
0 de otro tratamiento
1 del tratamiento 2
x2
0 de otro tratamiento
1 del tratamiento 3
x3
0 de otro tratamiento
La ventaja de estos modelos es que se permite incluir a las covariables. De este modo si el
interés se centra en comparar medias de un factor y se toma en cuenta a una covariable el
modelo de medias quedaría así:
yij i 1 X ij ij
el cual corresponde al análisis de covarianza de un factor.
c) Proponga intervalos de confianza para las medias y para las diferencias entre las
medias.
d) Con este número de observaciones ¿qué tan potente es la prueba?
Pregunta de Investigación:
¿Existen diferencias en el rendimiento promedio del trigo (kg/Ha2) con los diferentes
fertilizantes?
Hipótesis de investigación
El fertilizante a base de amonio, particularmente el sulfato de amonio, promueve más
exitosamente el crecimiento de las plantas que los fertilizantes de amida.
Diseño empleado
Para evaluar la hipótesis incluyó al fertilizante sulfato de amonio, la ciamida y la ciamida-
dietanoldiamida. Emplea un diseño completamente aleatorizado y a cada parcela se le asignó
al azar un fertilizante y se sembraron semillas de trigo y que también fueron seleccionadas al
azar. A cada parcela se le roció el fertilizante asignado y en el orden asignado al azar, de
manera independiente. Al cabo de 45 días se determinó el rendimiento (Kg/ha2) El
experimento se realizó en un campo situado en el cono sur del Estado, entre Oxkutzcab y
Yotholin. Las características de las parcelas de tierra son muy similares entre sí, tierra roja,
muy fértil y de una porosidad idónea para el cultivo de trigo. Se controló con exactitud la
frecuencia de riego, calidad del agua, hora de riego. Quedaron fuera del control del
experimentador, las condiciones climáticas y la acción de animales silvestres que atraviesan el
campo y aves.
El investigador comienza por numerar todas las parcelas y de éstas selecciona al azar 30, las
re etiqueta del 1 al 30, asigna al azar las parcelas a los tratamiento y aleatoriza el orden en que
llevará a cabo el experimento.
Parcela Fertilizante Orden de aplicación
3 Sulfato de amonio 2
5 Sulfato de amonio 30
16 Ciamida 29
… … …
27 Ciamida - Dietanoldiamida 12
A continuación se presentan los resultados, y son los rendimientos del trigo cosechados y que
se miden en kg/Ha2.
Observación Sulfato de Amonio Ciamida Dietanoldiamida
1 100 70 80
2 103 69 84
35
3 104 79 81
4 103 79 84
5 102 69 83
6 102 81 82
7 104 78 82
8 103 75 80
9 105 85 87
10 105 60 89
Se propone un análisis de varianza de una vía de efectos fijos donde el factor es el tipo
de fertilizante y los niveles del factor son: Sulfato de Amonio, Ciamida y Dietanoldimida. Y la
variable respuesta, rendimiento del cultivo( kg/ha2).
Modelo
yi j = + i + i j ;i = 1, 2 y 3; j = 1,2,..., 10
donde,
yij es el j-ésimo rendimiento bajo el i-ésimo fertilizante.
µ es el efecto común para todo el experimento o bien la gran media.
i es el efecto del i-ésimo fertilizante y,
ij es el error aleatorio presente en la j-ésima observación bajo el i-ésimo fertilizante.
El modelo lineal puede escribirse como uno de regresión con la variable x = fertilizante.
Debido a que son tres fertilizantes definiremos dos variablesindicadoras.
X1 X2 X3
Sulfato de Amonio 1 0 0
Ciamida 0 1 0
Ciamida-Dietanoldiamida 0 0 1
El modelo sería
y 1 X1 2 X 2 3 X 3
Si la observación pertenece al fertilizante sulfato de amonio, entonces X2 y X3 toman el valor
de 0 y X1 = 1, Y = ß1 + e
β1 corresponde al µ1 del tratamiento Sulfato de amonio.
También podrían haberse creado dos variables Dummy con los siguientes valores:
X1 X2
Sulfato de Amonio 0 0
Ciamida 1 0
Ciamida-Dietanoldiamida 0 1
Supuestos
Los errores se distribuyen normal e independientemente con media cero y varianza ² (ij
~NID(0, ²).
Es un análisis de efectos fijos, por lo que: i= 0. Es decir, estamos interesados únicamente
en estos tres fertilizantes.
36
Hipótesis
Ho: 1= 2= 3.
En palabras, Los tres fertilizantes producen el mismo rendimiento.
H1: i j para al menos un par.
Al menos uno de los fertilizantes produce un rendimiento diferente.
Si la hipótesis nula es cierta, significa que los tres fertilizantes producen en promedio el mismo
rendimiento del trigo; y si se rechaza la hipótesis nula significa que existen diferencias al
menos entre un par de ellos.
Las fórmulas de las sumas de cuadrados se obtienen a partir del modelo. En el modelo de una
vía, y partiendo del conocimiento de los estimadores de los parámetros, a saber:
ˆ y..
ˆi yi. y..
yˆ ij yi.
Partiendo del modelo de una vía y sustituyendo por sus estimadores se tiene:
yij y.. yi. y.. yij yi.
Pasando al lado izquierdo de la ecuación al estimador de la gran media:
yij y.. yi. y.. yij yi.
Elevando al cuadrado y sumando sobre todos los términos se tendría:
37
Se puede notar que el término de la izquierda corresponde a la suma de cuadrados total y que
la parte derecha corresponde a un binomio al cuadrado, por esto, esta suma de cuadrados se
puede expresar en términos de sus componentes:
a n
SCT = [( y i . - y.. )2 + 2( y i . - y..)( yij - y i .) + ( yij - y i . )2 ]
i=1 j=1
y i. y.. y ij y i. y i. y
.. yij yi .
i 1 j 1 i 1 j 1
n
yi .
yij yi. yi. n 0
j 1 n
La primera suma no tiene a j como subíndice por ello puede escribirse como:
a n a
( y . - y.. ) = n ( y . - y.. )
i=1 j=1
i
2
i=1
i
2
de aquí que,
a a n ( 13)
SCT = n ( y i . - y..)+ ( yij - y i . )2
i=1 i=1 j=1
s 2 i1 j 1
a(n 1)
SCE ( 16)
s2
a(n 1)
38
i=1 j=1 an
donde el término de la derecha es el factor de corrección. El término de corrección indica
que como la suma de cuadrados es una medida de variabilidad respecto a la gran media debe
restarse su contribución a y² la cual es la suma de cuadrados sin ajustar.
a
yi.2 ( 18)
SCtrat = - f.c.
i=1 n
Las sumas de cuadradas tienen la propiedad de ser aditivas, por consiguiente la SC del error
puede calcularse de la siguiente manera:
a n
1 a ( 19)
SCE yij2 yi2.
i 1 j 1 n i1
O bien,
SCerror = SCtotal - SCtratamiento ( 20)
Las sumas de cuadrados reflejan el grado en el cual los números de un conjunto varían entre
sí. Cuando no hay variabilidad, o sea cuando los números son parecidos, cada desviación de la
media será o se aproximará a cero y la suma de las desviaciones al cuadrado también será
cero.
Grados de libertad
La cantidad n-1 de la fórmula de varianza de una muestra recibe el nombre de grados
de libertad. El número de grados de libertad de una suma de cuadrados es igual al número de
términos independientes de dicha suma. La SC = (yi-y)² consiste en la suma de cuadrados
de los n elementos: y1-y ,..., yn-y . Estos elementos no son todos independientes ya que
(yi-y) = 0, por lo que sólo n-1 son independientes, y SC tiene n-1 g. l. Para la SC total por
ejemplo el número de grados de libertad es N-1, el 1 representa la contribución de la media.
Los grados de libertad asociados a cada efecto: Los grados de libertad de los tratamientos se
obtienen razonando así: la suma de cuadrados entre tratamientos se calcula de los desvíos de
las medias de los a tratamientos menos la gran media y se sabe que la suma de estos desvíos es
cero, por lo que son a – 1 grados de libertad asociados a los tratamientos:
g. l. de los tratamientos: a-1
g. l. del error: a(n-1) = an-a = N-a
g. l. total: N-1
Cuadrados medios
Los cuadrados medios proporcionan una estimación insesgada de la varianza. Si las
sumas de cuadrados se dividen entre sus grados de libertad correspondientes a cada fuente de
39
Los cuadrados medios esperados de los tratamientos y del error servirán para obtener los
estadísticos de prueba, que en estos diseños se trata de pruebas F o razón de varianzas.
Supuestamente bajo la hipótesis nula de que las medias de los tratamientos son iguales los
valores esperados del cuadrado medio de tratamientos y cuadrado medio de error son
estimaciones insesgadas de la varianza poblacional 2. Sin embargo el valor esperado del
cuadrado medio del error es siempre 2 aún cuando la hipótesis nula sea falsa. Lo que pasa es
que el CME refleja el promedio de las varianzas de los tratamientos por separado y son
independientes de si existe o no diferencia entre las medias. En cambio el valor esperado del
cuadrado medio de tratamientos como depende de la variación de las medias de los
tratamientos y la gran media, pues si es afectada por si la hipótesis nula es verdadera o falsa. Si
la hipótesis nula es verdadera las diferencias de las medias individuales respecto a la gran
media son muy pequeñas y el valor esperado del cuadrado medio de tratamientos es 2. Si por
el contrario, las medias de tratamiento son muy grandes, la diferencia de éstas respecto a la
gran media, será grande, y el valor esperado es igual a 2 más una cantidad que refleje esta
gran variabilidad entre tratamientos. Esto se entiende si conocemos los valores esperados de
los cuadrados medios:
Cuadrado medio de tratamientos
El cuadrado medio de tratamientos resulta de dividir la suma de cuadrados de tratamiento
entre sus respectivos grados de libertad. Cuando las a medias poblacionales son iguales, el
CMtratamientos (CMTrat) se convierte en una estimación insesgada de la varianza común.
y yi
ni
2
ij
j 1
Dentro de cada tratamiento si es una estimación de la varianza dentro del i-
ni 1
ésimo tratamiento y si las varianzas de los a tratamientos son similares, sus estimaciones se
2
esta suma de cuadrados del error (que son las varianzas mancomunadas) entre sus grados de
libertad se obtiene el cuadrado medio del error. (Hicks y Turner, 1999).
Teorema de Cochran:
40
Se puede demostrar que estos cuadrados medios siguen una distribución ². Dado que la suma
de grados de libertad de los tratamientos y del error es igual al número total de grados de
libertad, estos cuadrados medios siguen una distribución ². Y el teorema implica que el
cociente SCtrat/σ2 y el cociente SCE/σ2 son variables aleatorias ji-cuadrada con sus respectivos
grados de libertad. Por lo tanto si la hipótesis nula de igualdad de medias de tratamiento es
verdadera, la razón de varianzas:
Fo = SC trat/(a-1) = CM trat
SC error/(N-a) = CM error
sigue una distribución F con a-1 y N-a grados de libertad (Montgomery, 1995). Con este
estadístico F se prueba la hipótesis:
H0: µ1 = µ2 = µ3.
En el cociente, la varianza cuya significancia se desea probar queda en el numerador y en el
denominador debe quedar aquella varianza o cuadrado medio que sea independiente de si la
hipótesis nula es verdadera o falsa, y éste es el error, por esta razón el denominador es el
cuadrado medio del error.
Si Ho es verdadera, el valor esperado del cuadrado medio de tratamientos es igual al valor
esperado del cuadrado medio del error, pero si es falsa, es mayor que el valor esperado del
cuadrado medio del error lo que conduciría a rechazar Ho.
La región crítica es la cola superior de la distribución F y la hipótesis anterior se rechaza si Fo
> Fα;, a-1,N-a.
En palabras, esto significa que si se hiciera un número infinito de veces el experimento, con
los mismos niveles y el mismo número de réplicas, y en cada experimento se calcula el valor
del CME por ejemplo, entonces en promedio se obtendría el valor de 2. El valor esperado de
los cuadrados medios sirven finalmente para conocer qué razones F son válidas, es decir, si se
quiere probar que una fuente de variación es significativa, los cuadrados medios permiten
conocer que cuadrados medios constituirán el numerador y denominador de la prueba F. Se
dejará en el numerador aquella fuente de variación que se quiere probar y como denominador
aquel cuadrado medio que contenga todos los términos a excepción del que se desea probar.
La utilidad de los valores esperados de los cuadrados medios, se verá cuando se trate las
pruebas F directas, conservadoras y mancomunadas en el capítulo de diseños factoriales. Por
el momento nos limitaremos a obtener el valor esperado del cuadrado medio del error para
tener una noción de cómo se obtienen.
41
yi. yn i.
Entonces,
SCE 1 2
E (CM E ) E E ( yij y )
N a N a i.
1
E ( yij2 2 yij yi. yi2. )
N a
1
E yij2 2yij yi. yi2. )
N a
1 a a
E yij2 2 yi. yi. n yi2. )
N a i 1 i 1
1 y a
E yij2 2 yi. i. n yi2. )
N a n i 1
1 n y a
E yij2 2 yi. i. n yi2. )
N a n n i 1
1 y y a
E yij2 2n i. i. n yi2. )
N a n n i 1
1 a a
E yij2 2n yi2. n yi2. )
N a i 1 i 1
1 a
E yij2 n yi2. )
N a i 1
1 y2
E yij2 n i2. )
N a n
1 1
E yij2 n 2 yi2. )
N a n
1 1
E yij2 yi2. )
N a n
n
elevando al cuadrado las cantidades entre corchetes y tomando su valor esperado se
obtiene:
1 2 a a
ECM E N n 2
N 2
N 2
n i2 a 2 2
N a
i
i 1 i 1
De la misma manera puede obtenerse el valor esperado del cuadrado medio de tratamientos.
42
a
n i2
( 25)
E (CM Trat )
2 i 1
a 1
a 2
i
E (CM Trat ) 2 n i 1
a 1
donde, el segundo término es la varianza de las medias de los tratamientos. El CMTrat estima
una combinación de la varianza del error y la varianza entre las medias de los tratamientos.
Si la hipótesis nula es falsa significa que τi es diferente de cero y que este componente es
grande por lo que no constituye una estimación de la varianza poblacional. Sino que es la
varianza poblacional más los efectos de tratamientos.
En el ejemplo,
SCT 231,616
2608 2 4893 .87
30
f .c. 226,722.13
10312 745 2 832 2
SC fertilizante 226,722.13 4298 .87
10
SCE 231,616
10312 7452 832 2 595.00
10
SCE 4893 .87 4298 .87 595
Fuente de SC G.L. CM F
Variación
Trat. 4,298.87 2 2149.33 97.53
Error 595 27 22.0370
Total 4,893.87 29
F0.05(2,27) = 3.35
43
97.5327>> 3.35 por lo que se rechaza la hipótesis nula de igualdad de medias. Es decir,
existen diferencias altamente significativas entre los tres tipos de fertilizantes.
Las salidas de cómputo vienen con una columna adicional que corresponde al valor p, la
probabilidad de exceder el valor del estadístico de prueba bajo la hipótesis nula, de ahí que
se denote Pr > F. Un valor de 0.000 es la probabilidad de que el estadístico F con los
respectivos grados de libertad del numerador y denominador sea mayor que el FC obtenido
de los cálculos. En el ejemplo existe una probabilidad 0.000 de que el F de la tabla Fα
exceda el valor de 97.5327. Es improbable que el valor F sea mayor que el F calculado. Por
lo que existe evidencia suficiente para rechazar Ho.
Podemos también decir que es la probabilidad asociada al estadístico de prueba (al que
calculamos), una p más pequeña que el nivel de significancia elegido conduce al rechazo de
la hipótesis nula.
A B C D
1.93 2.55 2.40 2.33
2.38 2.72 2.68 2.40
2.20 2.75 2.31 2.28
2.25 2.70 2.28 2.25
Resolviendo,
Sumas de Cuadrados
SCT 92.97
38.41
2
0.76
16
8.76 2 10.72 2 9.67 2 9.26 2
SCTrat 92.21 0.52
4
SCE 0.76 0.52 0.24
F
44
F = CMfábricas/CME
F = 0.17/0.02= 8.53
El estadístico de prueba se compara contra el valor F que corresponde a la región de
rechazo y que consultamos en una tabla F con el nivel de significancia específico.
F0.05;3,12 = 3.49
F0.01;3,12 = 5.95
Como el valor del estadístico de prueba es mayor que el valor de la tabla para 0.05 y aún
más, hasta para un nivel de 0.01, significa que existe diferencia altamente significativa
entre la pérdida de peso promedio de las cuatro fábricas.
Tabla de análisis
Fuente de SC G.L. CM F
Variación
Fábricas 0.52 3 0.17 8.53
Error 0.24 12 0.02
Total 0.76 15
Como el valor de F obtenido es mayor que el de la tabla se puede decir que sí existe efecto
del factor fábricas, en la pérdida de peso. Habría entonces que determinar entre qué medias
se encuentra la diferencia.
Ejercicio Propuesto: (Little y Hills, 1976) Se desean probar tres tipos diferentes de
hormonas, cada una en una dosis única, para determinar sus efectos sobre la capacidad de
aumento de peso de las ovejas. Entonces, incluyendo el control, tenemos cuatros
tratamientos. Los 16 grupos de ovejas asignados al experimento se numeran del 1 al 16.
Empleando la tabla de números aleatorios se asignan al azar los grupos 14, 13, 8 y 9 al
tratamiento A, y así sucesivamente.
Tratamiento Réplicas Totales Medias
A (Control) 47 52 62 51 212 53
B 50 54 67 57 228 57
C 57 53 69 57 236 59
D 54 65 74 59 252 63
¿Existen diferencias en el crecimiento promedio de las ovejas que reciben los 4 tipos de
hormonas?
Antes de proseguir con el análisis para averiguar entre qué par de medias radica la diferencia,
es necesario estimar los parámetros del modelo para verificar si se cumplen los supuestos. Si
éstos no se cumplen y se viola de manera significativa algún supuesto, la validez de la prueba
F es cuestionable y la probabilidad de cometer el error tipo I es mayor que el que se declara,
llegando muchas veces a conclusiones falsas, de ahí la importancia de no proseguir con la
comparación de medias, sino hasta que se esté seguro de la validez de la prueba F. Una vez
que se pruebe que sí se cumplen, ya es posible hacer las comparaciones de medias.
Los valores poblacionales no pueden conocerse a partir de una muestra; antes bien se
proporcionan estimaciones de cada uno de los componentes del modelo, esto se indica con un
circunflejo arriba del símbolo del parámetro: ̂ , ˆ .
El residuo es:
eij yij yˆ ij
eij yij ˆ ˆi
a n
L = ( yij - - i )2
i= j=1
Se trata pues de estimar los valores de los parámetros que minimicen la suma de cuadrados:
Una de las formas de estimarlos es mediante el método de mínimos cuadrados; para
encontrar los estimadores y se deben encontrar los valores que minimicen L.
Los valores serán la solución de a + 1 ecuaciones simultáneas. Estas se originan de derivar e
igualar a cero:
L
= 0
,
L
=0
,
a n
L ij2 ( yij ˆ i
2
i 1 j 1
L
2 yij ˆ i
yij N nˆ1 nˆ2 nˆ3 0
L
2 yij n nˆ1 0
n
1 j 1
L
2 yij n nˆ2 0
n
2 j 1
L
2 yij n nˆ3 0
n
3 j 1
46
n
yij n n 1 0
j 1
n
yij n n 2 0
j 1
n
yij n n 3 0
j 1
Para el ejemplo:
̂ = 2608/30 = 86.9
y1. = 103.1
y2. = 74.5
y3. = 83.2
ˆ1 = 103.1 - 86.9 = 16.2
ˆ2 = 74.5 - 86.9 =-12.4
ˆ3 = 83.2 - 86.9 = -3.7
i = 0
Los efectos de los tratamientos nos dicen qué tanto se alejan las observaciones de la media
global.
Si se observa la magnitud de los efectos parece que el tratamiento 3 es el más distanciado, y
si observamos el signo de los efectos los tratamientos 2 y 3 tienden a disminuir los
rendimientos mientras que el sulfato de amonio produce mayores rendimientos. Al observar
magnitud y signo se puede decir que el que menos se aleja de la gran media es el
tratamiento de dietanoldiamida y el que más se aleja es el sulfato de amonio desviándose
positivamente respecto a la media global.
47
Intervalos de confianza
Proporcionan una idea de la precisión del experimento; reflejan la variabilidad debida
al proceso de muestreo aleatorizado. Asimismo proporcionan una idea de qué tratamientos son
similares y cuáles son diferentes. Puede observarse también cuál es el que produce mayor o
menor respuesta. Se construyen intervalos de confianza por cada media de tratamiento.
Recuérdese que el intervalo de confianza supone que para una muestra distribuida
normalmente con media µ y varianza 2 el intervalo de confianza para la media está dado por:
Y z1 2 n ( 27)
En resumen, si se supone que los errores están normal e independientemente distribuidos con
media 0 y varianza ², las yi . se distribuyen normalmente con media i y varianza ²
CM E ( 28)
yi. t/2,N -a
n
Para verificar los supuestos del análisis de varianza, no es conveniente hacerlo con los datos
crudos porque pueden estar influenciados por los factores de interés y por lo tanto no tendrán
una media común. La verificación se aplica a los residuos ya que éstos no tienen el
inconveniente de ser afectados por los factores, ellos tienen una media común igual a cero.
Los supuestos se checan con observaciones que sean independientes de si la hipótesis nula es
cierta o no, ya que no tiene sentido que la validez de la prueba descanse en si se rechaza o no
la hipótesis nula; los datos crudos tienen el inconveniente de que dependen de su media de
tratamiento individual y esto repercute en las diferencias entre tratamientos. Los residuos por
su parte al tener una media común igual a cero, no dependen de si la hipótesis nula es cierta o
no, de hecho es lo que queda de la variabilidad de los datos no atribuible a los tratamientos,
por esta razón se emplean para verificar los supuestos.
También pueden verificarse con los datos crudos dentro de un mismo tratamiento ya que
tienen una media común yi., con estos datos no se podría checar que las varianzas de las a
poblaciones son homogéneas, de ahí que se empleen los residuos y así es posible verificar
todos los supuestos. Es importante recordar que los residuos son estimadores de los errores, ya
que no es posible conocer al verdadero valor poblacional de las medias de los tratamientos.
A pesar de esto, se pueden presentar, de los datos crudos, los estadísticos descriptivos
siguientes:
Resumen Estadístico para Rendimiento
Fertilizante Frecuencia Media Mediana Varianza Desviación típica
--------------------------------------------------------------------------------------------
1 8 103.375 103.0 1.41071 1.18773
2 10 74.5 76.5 55.1667 7.42743
3 10 83.2 82.5 8.62222 2.93636
14 1 100.0 100.0 0.0 0.0
15 1 104.0 104.0 0.0 0.0
--------------------------------------------------------------------------------------------
Total 30 86.9333 83.5 168.754 12.9905
Se puede observar que las medias y medianas son parecidas por lo que puede decirse que la
distribución no es de asimetría muy significativa.
yij = + i + ij
El valor predicho para este modelo:
yˆ ij ˆ ˆi ( 32)
eij ( 33)
d ij
CME
Estos residuos tienen media cero y varianza 1. Es decir, dij ~N(0,1). Los residuos crudos
estimados que pertenecen a un tratamiento no son independientes entre sí y no tienen la misma
varianza especialmente cuando los tamaños de muestra son desiguales, de ahí que se prefiera
utilizar los residuos estandarizados. Para el examen de los residuos se emplean las gráficas de
residuos que consisten en las que se grafican los residuos estandarizados contra los niveles de
alguna variable tales como: valores predichos, niveles del factor, orden o tiempo.
10
residual
5
-5
-10
-15
1 2 3
fertilizante
Los residuos se distribuyen alrededor del cero y no hay ni muy positivos ni muy negativos,
puede verse que no parece haber problema de ajuste más bien puede notarse que la
dispersión de los residuos del fertilizante ciamida es más grande que la dispersión de losde
los otros fertilizantes. Podría interpretarse como una señal de que la igualdad de varianzas
no se cumple.
Normalidad
La forma más simple para verificar el supuesto de normalidad consiste en hacer un
histograma de los residuos y observar si tienen una distribución normal (simétrica y en forma
de campana , con colas sin límites, unimodal y con un valor de curtosis de 3), sin embargo, no
es útil para tamaños de muestra pequeña además de que manipulando el número de intervalos
de clase puede aproximarse a una distribución normal.
Otra manera de verificar la normalidad es por medio de gráficas de residuos; una de ellas es la
gráfica de probabilidad normal; los residuos se grafican en forma ascendente contra su
probabilidad acumulada: si se observa una línea recta entonces los errores se distribuyen
normalmente; se observan desviaciones más grandes en los extremos de la recta por lo que hay
que prestar más atención a los puntos intermedios que a los extremos.
El papel de probabilidad normal está diseñado de modo que la distribución normal acumulada
se graficará como una línea recta. Para construir la gráfica se siguen los siguientes pasos:
1. Ordenar los residuos de menor a mayor.
2. Calcular las probabilidades acumuladas
Las probabilidades acumuladas se calculan con la siguiente fórmula:
k 0.375
y x100
n 0.25
donde k es el rango o posición de la observación. Otra fórmula empleada es:
k 0.5
y x100
n
Sin embargo se considera menos exacta para muestras pequeñas.
3. Graficar las probabilidades acumuladas contra los residuos. Usualmente si la
distribución es normal queda una recta. Observe los puntos centrales es decir del 33 al
67%. Las desviaciones de la línea recta indican no normalidad.
La desventaja de las gráficas de probabilidad normal es que son subjetivas y requieren
juicios basados en la experiencia. Una línea recta indica que hay poca evidencia para rechazar
el supuesto de normalidad. (Zylstra, 1995). A continuación se presentan una serie de gráficas
de probabilidad normal.
51
niveles del factor; si se observa algún residuo positivo muy grande o uno negativo muy
pequeño, entonces se verifica si realmente son valores extremos o aberrantes mediante algunas
pruebas estadísticas (como la de Dixon, o el Criterio de Chauvenet: y si lo son, se averigua la
causa con el objeto de eliminarlo (en caso de ser error de observación, como por ejemplo un
laboratoriazo) o bien recurrir a algún método estadístico para proporcionar estimaciones de la
media y del valor, una vez eliminado. Un valor atípico puede ser debido a que no se anotó bien
el resultado (laboratoriazo) en cuyo caso la solución es eliminarlo del análisis, o bien, sí ser un
residuo real, ya sea porque los errores no siguen una distribución normal, o porque alguna
varianza difiere o bien porque se especificó un modelo incorrecto.
Una manera sencilla de analizar estos residuos es mediante los residuos estandarizados:
d ij =eij / CM E ( 34)
El 68% debe caer entre ±1, alrededor del 95% entre ±2, y prácticamente todos (99.7%)
deben estar entre ±3. Un residuo a una distancia mayor de 3 o 4 desviaciones estándar del
origen es potencialmente un residuo distanciado.
Si se encuentra un valor atípico se realiza el análisis con y sin el valor, si los resultados son
iguales, se deja el valor, pero si difieren en mucho, se dice que el valor atípico es de influencia.
2
Residuo estandarizado para VAR00001
-1
-2
-3
-4
.5 1.0 1.5 2.0 2.5 3.0 3.5
VAR00002
La gráfica anterior permite detectar valores atípicos, ésta es de residuos estandarizados contra
niveles del factor. Los residuos descansan entre +3 y -3, y sólo uno, -3.09, se pasa ligeramente
por lo que puede considerarse que no es atípico.
Otra manera de verificar la normalidad es haciendo gráficas de los residuos contra los valores
predichos ŷij . La ausencia de algún patrón particular de comportamiento indica distribución
normal de los errores.
Otra manera de checar la distribución normal es demostrar si las medias y varianzas son
independientes. Puede demostrarse matemáticamente que si tomamos muestras al azar de una
población, los promedios y desviaciones estándar de las muestras serán independientes si la
población tiene una distribución normal.
Cuando la varianza es proporcional al promedio del grupo, al cuadrado del promedio del
grupo, al promedio elevado a la cuarta potencia existen transformaciones simples que harán la
varianza independiente del promedio. (Más adelante se verán estas transformaciones).
53
95
80
50
20
5
1
0.1
-15 -10 -5 0 5 10 15
RESIDUALS
Se observa que el supuesto de normalidad se cumple, y el residuo más pequeño no es atípico.
Independencia
Uno de los supuestos del análisis de varianza es el de la independencia. Se supone que
las muestras asignadas a los tratamientos proceden de poblaciones infinitas, y que son
muestras aleatorias de esta población, por esta razón se espera que las observaciones sean
independientes entre sí dentro de cada grupo y entre los grupos. Una de las formas para
verificar este supuesto es graficando los valores de las observaciones (o de los residuos)
54
contra el tiempo o contra el orden en que fueron tomadas y contra cualquier arreglo espacial
de las correspondientes unidades experimentales; cualquier tendencia (rachas altas y rachas
bajas, o rachas alternadas que indican correlación positiva y negativa respectivamente) indica
que quizá no hubo una buena aleatorización y por lo tanto que existe dependencia entre las
observaciones. Otro modo de checar este supuesto es mediante el cálculo de la correlación
serial entre observaciones adyacentes. Si la correlación es diferente de cero, se dice que existe
dependencia entre las observaciones adyacentes. Si ocurre esto los estimadores de mínimos
cuadrados de los parámetros se ven afectados al igual que el cuadrado medio del error. Éste
disminuye y por consiguiente la F aumenta, y se rechazará la hipótesis nula cuando debe
aceptarse (infla el error tipo I).
Existen pruebas para verificar si los errores están o no correlacionados como la prueba
de Durbin-Watson (Hines y Montgomery, 1972).(Consúltese, Dunn,1987). La prueba de
Durbin Watson sólo es aplicable para datos de series de tiempo. Una buena aleatorización es la
que asegura la distribución independiente de los errores.
Para verificar la independencia puede llevarse a cabo una prueba de aleatoriedad que es la
prueba de rachas. Esta se puede definir como una secuencia de observaciones con el mismo
signo (+ o -).
La prueba consiste en ordenar los residuos en el orden en que se obtuvieron los datos
respectivos. Contar el número de corridas r o rachas de resultados positivos (n1) y contar el
número de corridas de residuos negativos (n2). Si N es menor o igual a 20, rechazar la
hipótesis de aleatoriedad si r < rL o si r > rU, donde rL y rU son los valores críticos de la tabla
A30 que se anexa a estas notas. Para tamaños de muestra grandes rechace la hipótesis de
aleatoriedad si z > z/2.
r 0.5 ( 35)
z
2n1n2 ( 36)
1
n1 n2
2n1n2 (2n1n2 n1 n2 ) ( 37)
(n1 n2 )( n1 n2 1)
Homogeneidad de varianzas
La homocedasticidad u homogeneidad de las varianzas es otro de los supuestos del
análisis de varianza que supone que las varianzas de las a muestras tienen varianzas iguales
55
Las varianzas de los tratamientos son distintas. Si esta misma forma se presenta en una gráfica
de residuos contra valores predichos, significa que la varianza está en función de y, es decir,
aumenta con el valor de y, o en forma inversa, disminuye con el valor de y. Otro patrón que se
puede observar es el siguiente:
10
residual
5
-5
-10
-15
74 79 84 89 94 99 104
predicted rendim
Existen pruebas estadísticas para checar la homogeneidad de varianzas, tal como la prueba de
Bartlett el cual es un estadístico con distribución ² con a-1 grados de libertad. Para tamaños
de muestras iguales se emplea la prueba de Cochran que se usa para detectar si una varianza es
mucho mayor que las otras. Estas pruebas tienen la desventaja de que requieren gran número
de réplicas para que tengan potencia. Y la de Bartlett por ejemplo, es muy sensible a la no
normalidad.
La prueba de Cochran se restringe a situaciones donde existen tamaños de muestra
iguales, y se trata de demostrar que una varianza es mucho más grande que las otras. El
estadístico de prueba es el siguiente:
2 ( 38)
G = aS i
Si2 i=1
donde la Si del numerador es la varianza más grande de los a grupos. Se rechaza laHo de
igualdad de varianzas si g > ga. (Tabla A-11, Walpole & Myers, 1990).
donde,
q = (N - a) log S - (ni - 1) log S i2
2
p
( 40)
y,
1 a 1 1 ( 41)
c = 1+ -
3(a - 1) i=1 ( ni - 1) (N - a)
a ( 42)
( ni -1) Si2
i=1
Sp=
N -a
Prueba Fmax
Para a grupos de igual tamaño (n) se calculan las varianzas si2. Encontrar la más grande y la
más pequeña y calcular el estadístico F max
s2 ( 43)
Fmax max2
F ;a ,n1
s min
Si el estadístico es mayor que el valor Fmax de la tabla, rechazar la hipótesis nula de
igualdad de varianzas. Esta prueba también es conocida como de Hartley quien proporciona
la distribución de muestreo del estadístico Fmax. Los parámetros para esta distribución son
el número a de tratamientos y los grados de libertad para cada una de las varianzas de los
tratamientos. En la siguiente página se presenta una porción de la tabla Fmax.
Esta prueba es rápida, y es afectada por la no normalidad, y emplea una tabla que no en
cualquier texto se presenta.
Fmax Distribution
Column values are the number of groups.
Row values are (n-1) in each group.
2 3 4 5 6 7 8 9 10 11 12
.05 39 87.5 142 202 266 333 403 475 550 626 704
2
.01 199 448 729 1036 1362 1705 2063 2432 2813 3204 3605
.05 15.4 27.8 39.2 50.7 62 72.9 83.5 93.9 104 114 124
3
.01 47.5 85 120 151 184 216 249 281 310 337 361
.05 9.6 15.5 20.6 25.2 29.5 33.6 37.5 41.4 44.6 48 51.4
4
.01 23.2 37 49 59 69 79 89 97 106 113 120
.05 7.15 10.8 13.7 16.3 18.7 20.8 22.9 24.7 26.5 28.2 29.9
5
.01 14.9 22 28 33 38 42 46 50 54 57 60
.05 5.82 8.38 10.4 12.1 13.7 15.0 16.3 17.5 18.6 19.7 20.7
6
.01 11.1 15.5 19.1 22 25 27 30 32 34 36 37
.05 4.99 6.94 8.44 9.7 10.8 11.8 12.7 13.5 14.3 15.1 15.8
7
.01 8.89 12.1 14.5 16.5 18.4 20 22 23 24 26 27
.05 4.43 6.0 7.18 8.12 9.03 9.8 10.5 11.1 11.7 12.2 12.7
8
.01 7.5 9.9 11.7 13.2 14.5 15.8 16.9 17.9 18.9 19.8 21
.05 4.03 5.34 6.31 7.11 7.8 8.41 8.95 9.45 9.91 10.3 10.7
9
.01 6.54 8.5 9.9 11.1 12.1 13.1 13.9 14.7 15.3 16 16.6
.05 3.72 4.85 5.67 6.34 6.92 7.42 7.87 8.28 8.66 9.01 9.34
10
.01 5.85 7.4 8.6 9.6 10.4 11.1 11.8 12.4 12.9 13.4 13.9
.05 3.28 4.16 4.79 5.3 5.72 6.09 6.42 6.72 7.0 7.25 7.48
12
.01 4.91 6.1 6.9 7.6 8.2 8.7 9.1 9.5 9.96 10.2 10.6
.05 2.86 3.54 4.01 4.37 4.68 4.95 5.19 5.4 5.59 5.77 5.93
15
.01 4.07 4.9 5.5 6.0 6.4 6.7 7.1 7.3 7.5 7.8 8.0
58
.05 2.46 2.95 3.29 3.54 3.76 3.94 4.1 4.24 4.37 4.49 4.59
20
.01 3.32 3.8 4.3 4.6 4.9 5.1 5.3 5.5 5.6 5.8 5.9
.05 2.07 2.4 2.61 2.78 2.91 3.02 3.12 3.21 3.29 3.36 3.39
30
.01 2.63 3.0 3.3 3.4 3.6 3.7 3.8 3.9 4.0 4.1 4.2
.05 1.67 1.85 1.96 2.04 2.11 2.17 2.22 2.26 2.30 2.33 2.36
60
.01 1.96 2.2 2.3 2.4 2.4 2.5 2.5 2.6 2.6 2.7 2.7
.05 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00
inf
.01 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00
Prueba de Levene.
La hipótesis que se prueba es que las varianzas son iguales contra la alternativa de que al
menos un par es diferente, consiste en realizar un análisis de varianza a las observaciones a
Las que se les ha restado las respectivas medias de los tratamientos. Si la prueba F es
significativa entonces se rechaza H0 de igualdad de varianzas
Una regla práctica que se aplica es comparar la varianza más grande contra la más pequeña, si
2
el valor de s grande s 2pequeña >3, entonces se dice que las varianzas no son iguales, aunque no
necesariamente sea así.
Es importante recalcar que cuando se transforman los datos, los niveles de significancia y las
inferencias se aplican a la escala transformada, pero cuando se presenten las medias es
conveniente retransformarlas a la escala original que es donde tienen sentido. Igualmente los
intervalos de confianza dentro de los que descansan las medias se transforman a la escala
original, téngase en cuenta que cuando los datos se han transformado a logaritmo, al
retransformar a la escala original con antilogaritmo los valores de los intervalos de confianza
no son simétricos respecto a la media.
Transformación logarítmica
60
Elevación al cuadrado
Se usa para estabilizar la varianza si ésta disminuye con la media de Y, para
normalizar la variable dependiente si la distribución de los residuos está negativamente
sesgada y, para linealizar el modelo si la relación original es curvilínea hacia abajo (la
pendiente disminuye consistentemente conforma la variable independiente aumenta).
i2 k i q ( 45)
i2 k i q ( 46)
Si se grafican los ln de las varianzas muestrales contra sus respectivas medias muestrales se
obtiene un diagrama de dispersión cuya pendiente sería el valor aproximado de q.
1-(q/2)
Si q es distinta de 2 entonces y*ij=yij , si q =2 entonces y* = ln y.
Análisis de Varianza
-----------------------------------------------------------------------------
Fuente SC g.l. CM F P-Value
-----------------------------------------------------------------------------
Between groups 4298.87 2 2149.43 97.54 0.0000
Within groups 595.0 27 22.037
-----------------------------------------------------------------------------
Total (Corr.) 4893.87 29
Tabla de Medias para rendimiento por Fertilizante con LSD al 95% de confianza
--------------------------------------------------------------------------------
Stnd. error
fertilizante Cuenta Media s pooled Límite inferior L. superior
--------------------------------------------------------------------------------
1 10 103.1 1.48449 100.946 105.254
64
Varianza Check
Cochran's C test: 0.834454 P-Value = 0.0000646376
Bartlett's test: 2.13183 P-Value = 0.0000589774
Hartley's test: 23.756
102
rendim
92
82
72
1 2 3
fertilizante
Box-and-Whisker P lot
1
fertilizante
60 70 80 90 100 110
rendim
65
10
residual 5
-5
-10
-15
1 2 3
fertilizante
10
residual
-5
-10
-15
74 79 84 89 94 99 104
predicted rendim
10
residual
-5
-1 0
-1 5
0 5 10 15 20 25 30
row number
95
80
50
20
5
1
0.1
-15 -10 -5 0 5 10 15
RESIDUALS
Ejercicio: Proponer la transformación adecuada para estos datos y realizar el análisis con la
escala transformada. Emplee el Statgraphics.
Se puede observar en la gráfica de residuos contra niveles del factor, que las varianzas no
son homogéneas, esto se puede confirmar con la prueba de Bartlett o la de Levene. El valor
p asociado al estadístico de la prueba de Bartlett es de 0.0000589, que si aplicamos el
criterio de Anderson, es candidato a una transformación.
La pregunta ahora es ¿existe una transformación adecuada para este conjunto de datos?. Ya
se ha dicho que si el patrón observado en la gráfica de residuos contra valores predichos es
del tipo de megáfono, entonces sí existe una transformación adecuada para ese conjunto de
datos.
66
Análisis de la Varianza
------------------------------------------------------------------------------
Fuente Sumas de cuad. g.l.. Cuadrado Medio Cociente-F P-Valor
------------------------------------------------------------------------------
Entre grupos 1.35969E8 2 6.79846E7 134.90 0.0000
Intra grupos 1.36069E7 27 503959.0
------------------------------------------------------------------------------
Total (Corr.) 1.49576E8 29
Contraste de Varianza
Contraste C de Cochran: 0.773037 P-valor = 0.000875815
Contraste de Bartlett: 1.65825 P-valor = 0.0014937
Contraste de Hartley: 11.9315
Test de Levene: 6.226 P-valor = 0.00597694
Error Estándar
fertiliz Frec. Media (s agrupada) Límite inf. Límite sup.
--------------------------------------------------------------------------------
1 10 10631.7 224.49 10171.1 11092.3
2 10 5599.9 224.49 5139.28 6060.52
3 10 6930.0 224.49 6469.38 7390.62
--------------------------------------------------------------------------------
Total 30 7720.53
Se puede observar que existe efecto de los fertilizantes sobre el rendimiento 2 del trigo; o
existe diferencia entre fertilizantes cuando el rendimiento se ha transformado elevándolo al
cuadrado.
Se puede ver con las pruebas de varianzas para checar el supuesto de homocedasticidad que
aunque se rechaza la hipótesis de homocedasticidad a un nivel de 0.05, si nos apegamos al
criterio citado por Anderson, tanto la prueba de Bartlett como la de Levene, el nivel de
probabilidad se ha incrementado a un valor mayor que 0.001. Podemos hacer caso incluso a
la prueba de Bartlett ya que la normalidad se cumple como puede verse en la gráfica de
probabilidad normal. El valor del residuo sospechosamente atípico: 1999 puede
estandarizarse o transformarse a un puntaje z ( o residuo estandarizado):
x
z
y ij ˆ i.
z
CM E
eij
z
CM E
1999
z 2.81
503959
para ver si realmente se trata de un valor atípico o no, y como puede verse queda
comprendido entre -3 y +3 como diría la regla empírica y no puede considerarse atípico; los
68
demás puntos de la gráfica de probabilidad normal sí se aproximan a una línea recta por lo
que se cumple la normalidad y por consiguiente también la prueba de Bartlett es válida para
verificar el supuesto de homogeneidad de varianzas.
Gráfico de Residuos para rendim^2
(X 1000)
2
residuo
0
-1
-2
1 2 3
fertiliz
1
residuo
-1
-2
55006500 7500 8500950010500
11500
rendim^2 predicho
80
50
20
5
1
0. 1
-2 -1 0 1 2
(X 1000)
RESIDUALS2
Las pruebas de comparación múltiple arrojan los mismos resultados, es decir existen
diferencias entre todas las medias.
NOTA:
Para decidir finalmente sobre una transformación se puede realizar el análisis con y sin
transformación. Si las conclusiones no cambian entonces los presentamos de la manera en
que sean más interpretables en la vida real, usualmente, la escala original.
Cuando se realiza un experimento debido a que se trabajan con muestras, es posible que si
para una muestra funcionó una determinada transformación, ésta puede no ser la válida al
realizar de nuevo el experimento con otra muestra.
En nuestro ejemplo debido a que con los dos análisis llegamos a las mismas conclusiones
podemos dejar el análisis con los datos originales porque son más fácilmente interpretables,
la prueba de Levene con los datos originales no justifica una transformación de datos y no
69
se tiene una idea de la distribución teórica de este tipo de datos que sugieran una
transformación.
Comparaciones Múltiples
Cuando se realiza un experimento, se está interesado no sólo en saber si existe un efecto
significativo del factor, sino una variedad de cuestiones que pueden resolverse utilizando
pruebas de comparación múltiple: por ejemplo, nos puede interesar averiguar si al incrementar
la dosis de un fármaco, incrementa o no la mejoría de cierto síntoma, o nos interesa comparar
distintas formulaciones presentes en el mercado contra una nueva propuesta, o bien puede
interesarnos en comparar dos dietas bajas en fibras contra tres altas en fibras. Es decir, no
limitarnos meramente a comparar parejas de medias, sino grupos de medias.
Se puede estar interesado en comparar parejas de medias y para ello no es necesario hacer
un análisis de varianza basta con una prueba de hipótesis y la prueba t pertinente. El nivel
de significación da cada comparación (de cada hipótesis) es α o probabilidad de cometer el
error tipo I (Rechazar Ho dado que es verdadera), o decir que las dos medias son distintas
cuando realmente son iguales. Al nivel de significancia α se le llama nivel de significancia
por comparación.
Otra forma de probar las diferencias entre parejas de medias es a través intervalos de
confianza para diferencias de medias, recordemos que si el intervalo contiene al cero,
decimos que esas medias son iguales ya que el 95% de las veces la diferencia entre ellas
puede ser nula. El intervalo de confianza para una diferencia de medias es pues, una
alternativa a la prueba t.
La ventaja de los intervalos es que de acuerdo a los signos (+ o -) nos dice qué medias son
más grandes o más chicas. Asimismo el ancho del intervalo de confianza nos dirá si una
prueba es conservadora y sólo detecta las diferencias grandes, o sensible (potente) si detecta
las muy pequeñas diferencias.
Tasas de Error
Una cuestión muy importante al realizar las comparaciones múltiples es el nivel de
significancia con el que se trabaja.
Cuando se realiza una comparación a priori, se respeta el nivel de significancia de la prueba
individual si se cumplen los supuestos. Pero cuando se realiza más de una prueba con el
mismo conjunto de datos, el nivel con el que se trabaja no es el que corresponde a sino que
es mucho más grande que el nivel establecido para cada prueba.
Si se realizan comparaciones independientes de parejas de medias cada una con un nivel
(error por comparación) la probabilidad de no cometer error en una sola prueba es 1 - , y si se
realizan m comparaciones independientes cada una con su nivel , entonces la probabilidad de
70
O si se trata de una investigación exploratoria donde las comparaciones se eligen una vez
observados los datos.
Cuando las comparaciones son independientes la tasa de error experimental o por familia es
igual a 1 – (1-)m, pero si no son independientes la tasa de error es :
1 – (1-)m.
Suponga que se eligió un nivel de 0.05 y son seis medias. Si las seis medias son iguales la
probabilidad de rechazar incorrectamente una o más comparaciones ortogonales es:
E = 1-(1-0.05)5= 0.23 que es un valor cinco veces más grande que el nivel establecido para
cada prueba. Si uno desea un nivel de 0.05 para el conjunto de los 5 contrastes, el nivel de
cada contraste debe ser: =1-(1-0.05)1/k-1
=1-(1-0.05)0.2=0.01.
La tasa de error por familia es la probabilidad de cometer al menos un error tipo I en las m
comparaciones. Si quisiéramos saber el error total que cometemos al hacer las m
comparaciones bastará con obtener la tasa de error experimental o por experimento que es
igual a (m) (αc). Si por ejemplo con tres tratamientos corremos todas las comparaciones por
parejas posibles, que serían tres, cada una con un nivel de 0.05, terminaremos con un nivel
final (probabilidad de cometer el error tipo I) de 0.15 o 15% de tasa de error experimental.
Se puede comprobar que las tres tasas de error, por comparación, por familia y experimental
guardan la siguiente relación:
αc <FW < PE
Cuando se aplican comparaciones sugeridas por los datos se incluyen más grados de
libertad que el número de grados de libertad de tratamientos, por lo que debe tenerse cuidado
en el procedimiento de prueba.
Los métodos de comparación múltiple sólo nos dicen qué medias o grupos de medias son
iguales o diferentes, pero no nos dicen en qué magnitud son diferentes, de ahí que algunos
procedimientos también ofrecen los intervalos de confianza que ya informan la magnitud de
las diferencias.
Otro concepto importante por considerar es la potencia de una prueba que es una medida de
su capacidad para identificar diferencias. Las pruebas más potentes detectan las más
72
pequeñas diferencias entre medias. Las pruebas más potentes tendrán los intervalos más
pequeños o estrechos.
Las pruebas más conservadoras son Scheffé, Contrastes y Tukey (éstas son exactas), le
siguen Bonferroni, y las más sensibles o potentes son Student Newman Keuls, diferencia
significativa mínima (DSM) y Duncan. Éstas no se recomiendan ya que inflan la
probabilidad de cometer el error tipo I. O se pueden usar bajo ciertas condiciones que se
especificarán cuando se hable de las pruebas. Otras pruebas potentes que se han
desarrollado últimamente y que no inflan la probabilidad del error tipo I son la de Ryan y la
de Peritz.
Algunas pruebas pueden hacerse en un solo paso, es decir sin necesidad de que la F total haya
sido rechazada. No es condición necesaria el rechazo de esta hipótesis total para realizar la
prueba. Pero es costumbre hacerla para obtener una estimación del CME. Éstas son:
Tukey
Tukey Kramer
Dunnett
Scheffé
Bonferroni
Šidák (Shedok)
Un investigador quien debe rechazar la Ho total antes de usar un Método de Comparación
Múltiple (MCM) está usando un procedimiento de dos pasos y puede perder ???un resultado
importante (Rafter, et al, 2002).
Las otras se realizan por pasos, comienzan por probarse la hipótesis total, y si se rechaza
entonces se realiza el segundo paso que es la prueba.
DSM de Fisher
Student-Newman-Keuls (SNK)
Duncan
/m si: tij t N a, / 2m , Donde, m es el número de comparaciones por parejas a ser
probadas. Puede verse que esta prueba controla la tasa de error experimental en α asignándole
un valor αc más pequeño. También se usa a posteriori.
Como es una prueba que se aplica a priori no requiere rechazo de Ho en la tabla de análisis de
varianza es más puede realizarse antes del análisis, pero realmente se hace después porque del
análisis de varianza se toma el CME. Como puede verse el estadístico de prueba es idéntico al
de una prueba t para comparar medias pero el criterio de rechazo cambia, el valor de de esta
prueba es más pequeño que el de una prueba t .
Para cualquier par i, j declaramos que ti es diferente de tj si se satisface la ecuación anterior. La
probabilidad de rechazar alguna de las hipótesis dado que las medias son iguales es igual a
/m. Por lo que la probabilidad de cometer el error tipo I (experimental) cuando son las
medias iguales es a lo mucho .
y y j. ( 50)
tij i.
2CM E
n
Éste estadístico puede comparar todas las parejas de medias sin inflar el error tipo I
controlando el nivel de cada comparación.
Si se trata de otro tipo de comparación o de un contraste el estadístico de prueba es:
k
c y i i
tij i 1
cuando ni = nj
CM E k 2
ci
n i 1
y
k
c y i i
tij i 1 para casos desbalanceados
k c2
CM E i
i 1 ni
Para diseños de un factor, es mejor usar la prueba de Tukey, pero cuando no se aplica, el
método de Bonferroni es la opción. El Statgraphics también grafica los intervalos de confianza
de Bonferroni, que son intervalos para diferencias de medias tal que si un par de medias es
diferente, el intervalo cuantifica qué tan diferentes son.
Ejercicio
Aplique el método de Bonferroni para comparar todos los pares de medias del ejercicio de
los fertilizantes.
103.1 74.5 28.6 28.6
t 13.62
1 1
22.04 2
10
2
4.41 2.10
Este valor se compara con t0.05 2(3),27 2.55 y debido a que todos los estadísticos de prueba
resultaron mayores que 2.55 entonces se rechazan las pruebas de las tres comparaciones
cada una con una probabilidad de 0.017 y el conjunto de las tres comparaciones con un
nivel de probabilidad de 0.05.
. .contraste
10
1 1 2.10
22.04 2 2
Dunn-Šidák
Es ligeramente más potente que la de Bonferroni.
Se emplea:
' 1 1 c
1
2
1
( 52)
En el ejemplo,
2(22.04)
DSM 2.052 4.31
10
1 vs. 2 = 103.1-74.5= 28.6 > DSM
1 vs. 3 = 103.1-83.2= 19.9 > DSM
2 vs. 3 = 74.5 – 83.2= 8.7 > DSM
Para expresar el resultado, es muy común ordenar las medias de menor a mayor y subrayar
aquel par o grupo de medias que son iguales. En el ejemplo, como las tres medias son distintas
no se subraya ninguna de las tres medias.
74.5 83.2 103.1
En algunos casos el investigador puede desear hacer todas las comparaciones entre todos los
pares de medias, es decir a(a-1)/2 comparaciones que es mayor que a-1 comparaciones
independientes. Sea como sea cuando comparamos dos medias o cometemos el error tipo I
diciendo que las medias son iguales cuando no lo son y la tasa en la cual este error se comete o
probabilidad de cometer el error tipo I es y se llama nivel de significancia para la
comparación y el error tipo II, que es el error de decir que son iguales cuando son diferentes y
la tasa del error la da ß. La probabilidad de que el procedimiento de comparación detecte una
diferencia real cuando ésta existe es la potencia de la prueba y es 1 – ß, y se verá después de
76
esta sección. Como ya se ha dicho si se usa DSM para hacer todas las comparaciones posibles
la probabilidad de cometer el error tipo I puede no ser el nivel elegido y se infla por lo que se
recomienda usar una de las pruebas siguientes: DSM protegida, la de Tukey o diferencia
honestamente significativa y la de Student-Newman-Keuls. La DSM protegida emplea la
DSM estándar contra la cual se contrastan las comparaciones por parejas una vez que la
prueba F ha sido declarada significativa, de esta manera se protege contra el error tipo I
Suponga que se emplea correctamente la DSM, se puede observar que en la fórmula se
emplea el CME pues uno de los supuestos del análisis es que se tiene una varianza común.
Recomendaciones:
Cuando a = 3 (hay 3 comparaciones)
DSM protegida
En caso de que a > 3 comparar únicamente las medias adyacentes que se han
ordenado de menor a mayor
Contra un control.
Una vez comparadas las parejas de medias se construyen los intervalos de confianza DSM que
se construyen sumando y restando a cada media el valor DSM/2. Cualquier par de intervalos
que no se superpongan se dice que son diferentes estadísticamente. También pueden
construirse intervalos para diferencias de medias; cualquier intervalo de diferencia de medias
que contenga al cero, significa que esa pareja de medias no presentan diferencia significativa.
Así, si un par de medias se declaró diferente por DSM, se puede conocer entre qué valores
descansa la diferencia que resultó significativa.
Nota: A veces esta prueba conduce al no rechazo de la hipótesis que contrasta las parejas de
medias cuando la F sí condujo al rechazo de Ho. La F prueba todas las comparaciones
posibles no sólo por parejas sino combinaciones lineales de las medias.
Tarea
Construya los Intervalos de Confianza DSM para las medias y para las diferencias entre
medias ¿Qué puede decir de las medias?
donde ci son los pesos o coeficientes del contraste, yi. son los totales
77
a ( 55)
c y .
i=1
i i
De aquí que:
ci i ci yi. y.. ci yi. y.. c c y
i i i.
n c
i=1
i
2
i
Las sumas de cuadrados de los contrastes se distribuyen como ² con un grado de libertad.
78
¿Por qué 1 grado de libertad? Un contraste también puede definirse como una diferencia de
medias o de grupos de medias; si son grupos de medias y se trata de una diferencia,
necesariamente son dos grupos de medias, entonces 2 -1 = 1 grado de libertad para cada
contraste.
Las sumas de cuadrados entre sus respectivos grados de libertad constituyen los cuadrados
medios, por lo que el cuadrado medio de un contraste es igual a la suma de cuadrados del
contraste.
Para probar si este contraste es significativo o no, cada contraste se compara con el cuadrado
medio del error, y como el estadístico de prueba se trata de un cociente de dos variables
aleatorias distribuidas como ² entonces el estadístico se distribuye como una prueba F con sus
respectivos grados de libertad, es decir,
CMc/CMF se distribuye como F (1,N-a).
En el ejemplo:
C1 = y1. - y2.
C1 = 1031-745 = 286
D = y1. + y2. - 2y3.
= 1031 + 745 - 2(832) = 112
Algunos autores prefieren utilizar las medias en lugar de los totales; el utilizar medias o
totales hará que difiera el valor del contraste. Si se calcula el contraste con el valor del total, el
contraste excederá del calculado con las medias, por un factor de n.
Pruebe que la suma de cuadrados del segundo contraste utilizando las medias es igual a la
suma de cuadrados del segundo contraste utilizando los totales.
79
Contrastes Ortogonales
Un caso especial de contrastes son los contrastes ortogonales. Dos contrastes
a ( 58)
C = ci yi.
i=1
Y
a ( 59)
D = d i yi.
i=1
n c d = 0
i=1
i i i
Por ejemplo,
C = y1. - y3.
D = 2y2. - (y1. + y3.)
c1 c2 c3
C 1 0 -1
D -1 2 -1
cidi -1 0 1
cidi =0
luego entonces estos contrastes son ortogonales. El trabajar con estos contrastes le proporciona
fuerza a la prueba por la característica de independencia.
Las ventajas de trabajar con contrastes ortogonales son:
1.- Son independientes, es decir no están correlacionadas las estimaciones de los diferentes
contrastes.
2.- Existen tantos contrastes como grados de libertad entre tratamientos.
3.- Las suma de cuadrados de los contrastes ortogonales es igual a la suma de cuadrados de los
tratamientos.
80
Los contrastes construidos anteriormente, son contrastes ortogonales. Cuando los contrastes
son ortogonales, la variabilidad expresada en la suma de cuadrados de tratamiento está
comprendida por la variabilidad expresada en contrastes ortogonales, por lo que la suma de las
sumas de cuadrados de los contrastes ortogonales es igual a la suma de cuadrados de
tratamiento; de la misma manera, la suma de los grados de libertad de los contrastes es igual a
los grados de libertad de los tratamientos, y esto nos confirma que las comparaciones
ortogonales realmente sí son independientes y no nos dan información redundante (o
correlacionada).
En el ejemplo, pruebe que la suma de las sumas de cuadrados de los contrastes ortogonales
es igual a la suma de cuadrados de fertilizantes.
Existen en los textos tablas con los coeficientes para construir contrastes ortogonales.
Puede suceder que la F total no haya sido significativa pero algunos contrastes sí lo
sean, esto resulta cuando uno o dos de los contrastes son significativos pero los otros no.
Cuando se totalizan las sumas de cuadrados de los efectos los contrastes no significativos
diluyen los significativos produciendo efectos no significativos en la tabla de análisis de
varianza También es posible tener una F total significativa pero que las comparaciones hechas
no lo sean.
4.- Si el contraste C es más grande que el número de Scheffé correspondiente entonces el
contraste es significativo.
En el ejemplo:
Probar Ho: 2 2 = 1 + 3.
El contraste C = 2 2 - 1 - 3
y1.= 103.1
y2.= 74.5
y3.= 83.2
C = -1(103.1) + 2(74.5) -1(83.2)
C = 37.3
2.- Calcular el error estándar del contraste
2 2
22 +(-1) +(-1)
S C = 22.037
10
Sc = 3.6362
3.- Calcular el Número de Scheffé:
SSCH = 3.6362 [(3-1)F2,27]½ = 9.4121
4.- Comparar el contraste contra el número anterior:
37.3 >> 9.4121
Entonces se rechaza Ho. Lo que significa que la suma de los efectos de los tipos de
fertilizantes, sulfato de amonio y dietanolamida son diferentes del efecto de la ciamida.
Nótese que el margen de error depende del número de medias en el experimento y no del
número de contrastes.
Ejercicio:
Obtenga los intervalos de confianza de Scheffé para el contraste anterior.
Por ejemplo, suponga que desea realizar la prueba de Duncan para comparar los
distintos tipos de fertilizante. Se proporcionan las medias:
103.1, 74.5 y 83.2 respectivamente.
1. Ordenando las medias de menor a mayor
74.5 83.2 103.1
2. Calculando el error estándar:
22.04
1.48
10
3. Calculando los valores r27,0.05 y los Rp:
Valores P=2 P=3
rp 2.908 3.058
Rp 4.316 4.54
4. Comparando:
1 y 2= 103.1-74.5= 28.6> 4.54
83
1 y 3= 103.1-83.2= 19.9>4.316
2 y 3= 83.2-74.5=8.7>4.316
Todas las medias son diferentes por lo que se forman 3 grupos de medias:
74.5 83.2 103.1
Para casos desbalanceados:
a ( 65)
r= a
1
i=1 r i
Kp q ( p, f )S yi .. ( 66)
ymax ymin
q
CM E
n
La diferencia necesaria para que se declare significativa varía con el grado de separación de
las medias que se comparan. Las medias separadas por una media requieren diferencias más
pequeñas para significancia que las medias separadas por dos medias.
Al igual que la DSM el análisis de varianza puede conducir al rechazo de Ho pero ninguna
de las comparaciones por parejas en NK resulta una diferencia significativa.
Para aplicarla es recomendable ordenarlas de menor a mayor y comparar la más grande
contra la más pequeña, Si estas medias son diferentes entonces la más chica se contrasta
con la siguiente más grande hasta alcanzar alguna prueba no significativa.
Es aproximada para casos desbalanceados.
Prueba de Tukey
Es muy parecida a la prueba de Diferencia Significativa mínima. Se calcula un solo
valor crítico para comparar todos los pares de medias. La tasa de error es a lo más , por lo
que es conservadora y controla la tasa del error experimental. Emplea un estadístico
llamado rango e, q.
CM E ( 67)
T ti t j q( ,a, f )
n
a es el número de tratamientos y f los grados de libertad del error. Depende del número de
medias y no del número de comparaciones que se realicen. Nótese que depende del número
de tratamientos y no del número de comparaciones como la de Bonferroni. Los intervalos
de confianza se obtienen:
CM E
yi y j q( ,a , f )
n
Nótese que el margen de error es el mismo para cada comparación, por lo que los tamaños
de los intervalos son iguales. Esta prueba es para casos balanceados; cuando los casos son
desbalanceados recibe el nombre de Tukey Kramer
84
La prueba de Tukey también sirve para contrastes. Si los tamaños de muestra son iguales el
intervalo de confianza es
CM E k ci
i i ( ,a, f ) n
c y q
i 1 2
Nota: Se sugiere utilizar preferiblemente para comparaciones por parejas y no contrastes
más complejos.
Prueba de Tukey-Kramer
Si la prueba de Tukey es conservadora y a lo más se comete un error tipo I de , el nivel de
probabilidad de rechazar dado que es verdadera, en esta prueba es ligeramente menor que
.. Es decir no protege tantocomo la de Tukey..
Dos medias son distintas si el valor absoluto de sus diferencias es mayor a este valor
crítico.
1 1 1
T t i t j q( ,a , f ) CME
2 ni n j
En el ejemplo,
1) Se ordenan las medias de mayor a menor
103.1 83.2 74.5
1 3 2
Los intervalos de confianza para comparar una pareja de medias resultan de aplicar la
siguiente fórmula:
yi y j T
El intervalo de confianza para la diferencia de µ1 - µ2 sería:
85
Si los intervalos de confianza para las diferencias de medias contienen al valor cero,
significa que esa pareja de medias no son diferentes.
La prueba de Tukey garantiza que todas las comparaciones tienen una tasa de error a lo más
de .
Se pueden probar la hipótesis de que al menos uno de los tratamientos difiere o bien la
hipótesis de una cola para probar que la diferencia entre las medias de tratamientos y la
media del control es menor o mayor a cero.
H 0 : i c
H1 : i c
H1 : i c 0
H1 : i c 0
El valor crítico para una prueba bilateral es
2CM E
d ;a1, f si el caso es balanceado, o bien
n
1 1
d ;a1, f CM E donde nc es el número de réplicas del control.
ni nc
Tarea: Leer el artículo Rafter John A., Martha L. Abell and James P. Braselton. Multiple
Comparison Methods for Means. (2002). SIAM Review Vol. 44, No. 2, pp. 259-278
Tipos de errores
En la toma de decisiones, al rechazar o no rechazar la hipótesis nula, se pueden
cometer dos tipos de errores. El error tipo I se refiere a la probabilidad de rechazar Ho dado
que es verdadera y el error tipo II que sea la probabilidad de no rechazar Ho dado que Ho es
falsa.
La probabilidad de cometer el error tipo I se denota por α y la probabilidad de cometer
el error tipo II por β. El primero está bajo el control del experimento; el error tipo II puede ser
relativamente grande (0.25 o más) pues si no se rechaza Ho dado que la hipótesis es falsa el
experimento puede repetirse. No rechazar Ho dado que es falsa, equivale a pensar que las
cosas siguen como se ha pensado hasta el momento (a pensar que no cambia nada) y eso no es
tan grave como decir que las cosas han cambiado cuando realmente siguen pasando como
hasta el momento.
En cambio si Ho es verdadera y se rechaza, esto puede ser grave por lo que α debe ser pequeño
(0.01 o menos). Dado que el error tipo II es la probabilidad de no rechazar la hipótesis nula
dado que existe una diferencia entre las medias está entonces relacionado con qué tanta
diferencia esté presente.
1-
n i
2
a 1
F' = CMTrat/CME
h(F') es la función de densidad de F'
a
r i
2
i 1
(a)
2
Nótese que bajo la Ho de que toda i = 0, entonces, = 0. Es lo que ya dijimos que bajo Ho el
cociente CMTrat/CME sigue una distribución F central.
a
r t
2
i 1
a a 2
Cuando = 0 entonces la distribución F' se convierte a una distribución F central.
ß 1-ß
La decisión correcta sería que siendo falsa la hipótesis nula, ésta se rechazara, a esto se le
llama potencia de la prueba.
Estos dos tipos de errores deben minimizarse, pero como guardan una relación inversa entre sí,
no es posible. Cualquier cambio en el tamaño de una región produciría un cambio opuesto en
la otra. Si movemos F central a la derecha, disminuye pero ß se incrementa. Lo mejor es
fijar la probabilidad de algún tipo de error y minimizar la probabilidad de cometer el otro.
Generalmente se fija la probabilidad de cometer el error tipo I, es decir α; se
determinan entonces las condiciones que minimizan la probabilidad de cometer el error tipo
II. Minimizar β equivale a maximizar 1-β, valor que se conoce como potencia de la prueba y
es la probabilidad de detectar una diferencia entre medias del tamaño de . Si se calcula la
probabilidad de rechazar Ho dado que H1 es verdadera para todos los posibles valores de se
obtiene la función de potencia. El poder de la prueba se incrementa cuando se aumenta el
tamaño de la muestra n.
Una curva característica de operación es una gráfica de la probabilidad de cometer
el error tipo II de una prueba estadística para un tamaño de muestra particular contra un
parámetro relacionado con .
Específicamente, igualando (a) y (b)
2 2 a 2
2
2
a 2
a
r i2
i 1
a a 2
Específicamente se indica la probabilidad del error tipo II (ß) contra el parámetro .
a
n i2
2 = i=1
a2 (b)
Entonces,
Se emplea la curva para a-1 = 5 - 1 = 4 y a(n-1) = 5(n-1) g.l. Para n=4 por ejemplo, ²=
1.11(4) = 4.44. Es mucho más fácil aplicar una fórmula en el que se requiere el parámetro D,
que es la cantidad por encima de la cual rechazaría la hipótesis nula con un nivel de confianza
dado y que la proporciona el investigador en función del conocimiento que tenga del
fenómeno.
nD2
2
2a 2
En el ejemplo, suponga que se obtuvo una estimación de la varianza en un estudio piloto y
fue de 15, y que el valor de rendimiento a partir del cual se diría que dos fertilizantes son
diferentes es de 10 kg/ha2 y que se desea obtener una potencia de 0.9.
n(10) 2
2 1.11n
2(3)(15)
Para obtener el tamaño de la muestra necesario para alcanzar dicha potencia, se construye
la siguiente tabla.
n 2 2
3 6 3.33 1.82 0.41 0.59
4 9 4.44 2.10 0.22 0.78
5 12 5.55 2.35 0.13 0.87
6 15 6.66 2.58 0.051 0.95
Es decir, que con un tamaño de muestra de seis se obtiene una potencia de 0.95 o una
probabilidad de 1-0.95 de caer en el error tipo II, es decir, decir que dos medias son iguales
cuando realmente son diferentes.
Caso desbalanceado
Muchas veces no es posible llevar a cabo el experimento con el mismo número de
réplicas para cada tratamiento, éste es el caso desbalanceado. El análisis de varianza es
semejante al del caso balanceado salvo algunas modificaciones en las fórmulas que se
presentan a continuación.
Supuestos
a
r = 0
i=1
i i
Sumas de cuadrados:
Suma de cuadrados de tratamientos:
90
a
yi.2
SCtrat = - f.c.
i=1 ri
Tarea: Obtenga los estimadores de los parámetros para el caso desbalanceado. (1 punto)
tal que,
r i ci = 0
( ci yi. )
i=1
SCc = a
r c
i=1
i i
2
1 1
DSM = t/2,N -a CM E +
ri r j
91
V(yij) = ² + ²T.
Debido a que no se están estudiando todos los tratamientos no se le añade la restricción de que
los τi suman cero.
Ejemplos: Si un científico está interesado en cómo trabaja un fungicida. Selecciona al azar tres
fungicidas de un grupo de fungicidas para estudiar la acción. Los modelos de efectos
aleatorios son comunes en estudios de muestreo.
La hipótesis que desea probarse es que la variabilidad de los tratamientos (o niveles del factor)
es igual a cero contra la alternativa de que es mayor que 0.
Ho: ²T = 0
H1: ²T > 0
Las sumas de cuadrados se calculan de la misma forma que para el modelo de efectos
fijos (modelo I). Pero en la tabla del análisis de varianza se le puede agregar una columna de
los cuadrados medios esperados.
En el modelo de efectos fijos el cuadrado medio del error es un estimador de ² y el cuadrado
medio de tratamientos estima a ² más una función de la suma de cuadrados de los efectos
fijos de tratamientos. Para el modelo de efectos aleatorios el CM de tratamientos estima a: ²
más n ². La FC = CMtrat/CME es una estimación de
² + n ²T/ ²,
que sigue una distribución F solo si ²t = 0. Bajo este modelo Fc es el estadístico de prueba
para probar que la variación entre tratamientos es igual a cero contra la alternativa de que es
mayor que cero.
F. de V. SC g.l. CM CM esperado
Tratam. SCtrat a-1 CMtrat ² + n ²T
92
Por ejemplo si se desea conocer la variabilidad del contenido de cloro residual en los nodos de
la red de agua potable de una colonia de la ciudad, se toman aleatoriamente n nodos y se mide
el cloro residual de las tomas domiciliarias conectadas con ese nodo. Mediante este análisis se
detectaría si existe variabilidad entre los nodos y se obtendría la proporción de variabilidad
debida a los nodos y la debida al error aleatorio.
En laboratorios es muy común utilizar modelos de efectos aleatorios para conocer la
variabilidad que existe entre ellos, específicamente entre analistas, en la determinación de un
analito. Por ejemplo, se puede mandar muestras de agua de la misma fuente a 5 o 6
laboratorios y estos realizan varias determinaciones de un analito. El interés se centra en la
variabilidad entre analistas más que en las lecturas promedio por los 5 o 6 analistas.
Tarea. Resolver el ejercicio 3-8 del libro de Montgomery que se refiere al contenido de calcio
en lotes de materia prima.
EJERCICIOS PROPUESTOS
Un experimentador sometió a 5 grupos de ratones en un laberinto. El grupo 1 tenía solamente
habilidades olfativas y táctiles, el grupo 2 sólo visuales y táctiles, el grupo 3 solo visuales y
olfatorias, el grupo 4, visuales, olfatorias y táctiles y el 5, visuales, olfatorias y táctiles pero se
les aplicaba un choque eléctrico por error que cometieran. Los datos son ensayo y error, bajas
calificaciones indican una buena actuación.
A1 A2 A3 A4 A5
7 5 9 6 19
8 4 11 12 6
5 4 6 8 3
9 6 8 5 12
10 3 7 11 13
a. Realice el análisis, encuentre el valor de p para probar la diferencia entre tratamientos.
b. ¿Qué efecto parece tener cada tratamiento en el aprendizaje?
c. Estime la varianza y la desviación estándar de cada grupo. Comente la validez del
supuesto de homocedasticidad y su efecto en la validez del análisis.
d. ¿Qué transformación podría utilizarse para hacer las varianzas más homogéneas tal
que los valores puedan ser intuitivamente significativos?
93
El comité de gobierno de una supercarretera está interesado en si las carreteras son más
seguras en la actualidad. Se seleccionaron al azar 10 estados y se determinaron de los años
del 68 al 72, las tasas de fatalidad (número de muertes por 100 millones de vehículos).
Año 1968 1969 1970 1971 1972
5 5.4 4.3 5.2 5.0
4.9 3.3 5.1 7.8 5.8
5.9 4.5 4.0 3.0 6.6
5 5.5 6.0 5.0 4.1
7.2 5.0 4.4 5.8 3.8
7 7.6 4.6 4.0 4.5
4.9 7.6 4.8 4.5 3.8
6.4 6.4 6.4 4.4 4.5
6.3 5.3 5.2 4.4 5.3
7.3 7.1 4.3 3.9 3.8
yi. 59.9 57.7 49.1 48.0 47.2
Si2 0.9788 1.9557 0.6077 1.7 0.9040
a) Use cada una de las tres pruebas da homogeneidad de varianzas ¿Se cumple el
supuesto de normalidad?.
b) Corra el análisis de varianza y concluya.
c) Asumiendo un ß 0.10 ¿cuál es la mínima diferencia en la tasa de mortalidad
anual que puede ser detectada con estos datos?
Un fabricante de tabletas desea probar que los tiempos de desintegración de 4 tipos de tabletas
son los mismos.
A B C D
20 42 8 12 50 124 151 178
28 25 10 24 67 72 125 151
36 24 12 10 90 78 180 152
16 31 16 19 103 70 149 161
25 33 9 10 90 76 175 118
a. Realice el análisis de varianza con un nivel de 0.05 y concluya.
b. ¿Se cumplen los supuestos de normalidad y de homogeneidad?
c. Sugiera la transformación más adecuada. Transforme con raíz cuadrada y averigüe si se
remueve la heterogeneidad. Corra la prueba de Bartlett con los datos transformados.
d.Típicamente una transformación que ayuda a corregir la heterogeneidad corrige la no
normalidad. Corra la prueba de Shapiro Wilks a los datos transformados, y emplee la gráfica
necesaria para checar la normalidad con los datos trasformados. Interprete los resultados.
94
Los bloques sirven para eliminar parte de los factores de variación aleatoria, que de otro
modo incrementarían el error experimental.
La variabilidad restante que no se puede controlar y que no se puede remover del campo
pero que en cambio se puede aleatorizar queda dentro del término de error y es la debida a
la falta de uniformidad entre las unidades del mismo bloque y a la falta de uniformidad en
la realización del experimento.
Así pues, si dentro del bloque hay más variación que entre los bloques, no valdrá la
pena bloquear. Y la sensibilidad del experimento disminuiría pues al tener un gran término
de error la prueba F para probar diferencias entre medias de tratamientos se hace menos
sensible a las diferencias.
Al planear un experimento en bloques debe buscarse que los bloques absorban la
mayor heterogeneidad del suelo, y que los bloques sean lo más homogéneos dentro de sí.
En resumen las razones para bloquear son:
1) Número insuficiente de unidades experimentales homogéneas para correr un
experimento completamente aleatorizado.
2) Remover una fuente de variación del error para hacer al diseño más sensible a las
diferencias entre tratamientos.
Antes de introducirnos al modelo, supuestos etc., se verá un concepto que algunos autores
consideran importante y que justifican el por qué no es de interés o adecuado probar el
efecto diferencial de los bloques, y es el de error de restricción. Estas ideas se toman de la
bibliografía de Anderson y de Lorenzen & Anderson.
Suponga que se prueban tres temperaturas: 30,40 y 50°C y cuatro colores: azul (az), rojo
(r), amarillo (am) y verde (v), en la nitidez de una imagen. Se corren dos réplicas (1 y 2).
De modo que se tiene un experimento de dimensión 3 x 4 x 2 = 24 combinaciones
(Temp/Color/réplica).
Una aleatorización completa sería:
Esto tiene el inconveniente de que el cambio constante de temperatura y el tiempo que tarda
un horno en alcanzar las temperaturas echaría a perder el horno o sería muy tardado el
experimento.
El investigador decide que debe elegir al azar una temperatura y que se pinten 8 paneles de
las 8 posibles combinaciones color/réplica. Por ejemplo elige al azar entre las tres
temperaturas y sale 30°C. Se ajusta el horno a esta temperatura y se aleatorizan color y
réplica, como se muestra a continuación:
Una vez corridas estas 8 combinaciones, elige al azar de entre las dos temperaturas
restantes y corre las mismas 8 combinaciones color/réplica, pero en orden aleatorio.
Se puede observar que no hubo aleatorización completa sino que se ha restringido a
cada temperatura, es decir ha habido una aleatorización por temperatura o para cada bloque.
Se sabe que el error de restricción está asociado a la temperatura, decimos que hay
una restricción en la aleatorización asociado con el factor temperatura. Y esta restricción se
dice que está confundida con el bloque.
También decimos que el experimento se corre en bloques donde los bloques están
asociados con la temperatura, o bien, decimos que el experimento está bloqueado en
temperatura, o que la temperatura es un factor de bloqueo.
Ahora considere que sólo hay una pistola de aire para pintar y da mucho trabajo
limpiarla y mezclar un nuevo color. Tiene sentido limpiar la pistola y mezclar un nuevo
color mientras la temperatura del horno está cambiando.
Uno podría elegir una combinación temp/color y pintar y hornear ambas repeticiones antes
de elegir la segunda combinación. No hay necesidad de fijar individualmente cada
temperatura o fijar un color, más bien ambos cambiaron al mismo tiempo.
Las combinaciones se elegirán al azar, una cada vez, y con esta combinación se correrán en
orden aleatorio las dos réplicas.
De las 12 combinaciones:
30az 30v 30am 30r
40az 40v 40am 40r
50az 50v 50am 50r
Se elige al azar una combinación, por ejemplo 40r. Se controla la temperatura del horno a
40°C y la pistola se llena con pintura roja. Se elige al azar que réplica se realizará primero.
Hay una restricción en la aleatorización asociado con cada combinación temp/pintura. El
término de bloqueo es Temp/pintura.
Una restricción en la aleatorización puede asociarse con cualquier término del
modelo. Tal restricción implica que un nivel del término (o una combinación como
temp/pintura) es fijado y todas las combinaciones que contiene ese nivel son aleatorizados
antes de elegir al azar el otro nivel.
¿Qué implicación tiene este error de restricción en el modelo y en las pruebas estadísticas?
de cuadrados ni grados de libertad. Sin embargo, al observar los E(CM) se puede observar
que para probar diferencias entre bloques no puede emplearse el error aleatorio como
denominador de la FC, como puede verse a continuación: (suponiendo los bloques
aleatorios)
b ti 2
E (CM Trat ) 2
a 1
E (CM Bloques ) a 2B a 2
2
E (CM l ( j ) ) 2 a 2
E (CME ) 2
Esto tiene sentido pues para probar CMTratse contrasta con el efecto aleatorio.
Igualmente para probar si los bloques son significativos se probaría contra su error. Lo
interesante en este diseño no es contrastar los distintos bloques, sino más bien los niveles
del factor, y el bloqueo se utiliza para incrementar la precisión del experimento.
Si se probara los bloques contra el error y es significativo no se sabe si existen diferencias
entre bloques o el error de restricción es significativo o ambos son significativos, porque
ambos están confundidos. Se dice que esta F es conservativa porque se prueban
simultáneamente bloque y error de restricción.
Si es no significativa ambos son no significativos.
Puesto que no se puede obtener información de los bloques es sabio diseñar el
experimento de modo que se utilice como factor de bloqueo el que tenga poca importancia
o interés.
Modelo
yij i j l ( j ) ij
donde,
es la gran media, y es constante para todas las observaciones.
i es el efecto del i-ésimo tratamiento.
j es el efecto del j-ésimo bloque
l(j) es el error de restricción dentro del j-ésimo bloque y completamente confundido con el
bloque j. l debe ser igual a 1 pues es el error de restricción único asociado al bloque j. Si
hay tres bloques por ejemplo hay 3 restricciones, una para cada bloque. Como l =1 pues no
tiene grados de libertad (1-1=0), ni suma de cuadrados ni cuadrado medio.
Supuestos
a
= 0
i=1
i
=0
j=1
j
98
ij ~ N(0, 2 )
No existe interacción entre los bloques y tratamientos. El modelo de bloques es aditivo, ésta es
otra forma de decir que no hay interacción de τ con β, que en palabras significa que el efecto
de los tratamientos no depende del bloque: se supone que el efecto que tiene el bloque sobre la
respuesta es independiente del efecto que tiene el tratamiento sobre esta respuesta.
Hipótesis
El interés en este diseño se centra en el factor y no en los bloques; éstos sólo sirven
para incrementar la sensibilidad de la prueba.
Ho: i = j ij
H1: i j para al menos una i y una j.
Sumas de Cuadrados
Los cálculos son iguales al modelo de dos factores sin interacción.
a
y..2
b
SCTotal yij 2
i 1 J 1 N
2
yi.2 y..
a
SCTRAT = -
i=1 b N
y. j 2 y..2
b
SC BLOQ = -
j=1 a N
Ganancia en precisión
La eficiencia relativa mide la efectividad de un diseño respecto a otro, particularmente se
evalúa la precisión de un diseño que se utilizó para un análisis respecto a otro diseño más
sencillo que no se utilizó. Ya sabemos que la varianza es una buena medida para conocer la
precisión de un método. La varianza de la media de un tratamiento
2
2y y el objetivo es disminuir esta varianza; esto puede ser incrementando el número de
r
réplicas o bien disminuyendo la 2 mediante el control por bloqueo.
Si se quieren comparar –en cuanto a precisión- dos modelos, se usan sus respectivas varianzas
de las medias de un tratamiento.
21
2 y1
r1
22
2y
2
r2
Si el primer diseño tiene una varianza igual a 1 y el segundo una varianza de doble del
primero, es decir:
12 1
22 2
22 2 12
De este modo
1
2 y1
r1
2
2y
2
r2
Estas varianzas de las medias son iguales si r2 =2r1, si el segundo diseño tiene el doble de
réplicas que el primero. El diseño 1 es más eficiente que el diseño 2, porque requiere la mitad
de réplicas para tener la misma precisión en la estimación de las medias de tratamiento.
El diseño 2 es menos eficiente que el primero porque requiere el doble de réplicas para tener la
misma precisión en las medias de tratamiento.
Debido a que sólo se tiene la estimación de la varianza en el diseño de bloques y no se cuenta
con la estimación de la varianza en el diseño completamente aleatorizado, ésta tiene que
100
estimarse a partir de los datos de la tabla de análisis de varianza del diseño de bloques. Fisher
calculó una cantidad que llamó información y que implica una corrección por grados de
libertad para la estimación de σ2:
( f 1) 1
I
( f 3) s 2
donde f son los grados de libertad del error y s2 es la estimación de la varianza. Si se conociera
σ2 entonces la cantidad de información sería I = 1/σ2, pero como no se conoce y se estima, se
ajusta esta eficiencia con los grados de libertad. Si s2 disminuye, la cantidad de información se
incrementa.
La eficiencia relativa de dos diseños se define como la razón de la información de los dos
diseños.
( f1 1) 1
I1
( f1 3) s12
f 1 1
I2 2
f 2 3 s22
I1 f1 1 f 2 3 s22
R
I 2 f1 3 f 2 1 s12
([Link]+ 1)([Link]+ 3) 2 c
R= x
([Link]+ 3)([Link]+ 1) 2 b
(b - 1) CM B + b(a - 1) CM EB
̂ 2 =
ab - 1
Un R = 1 significa que la información de los dos diseños es la misma y cada diseño requiere el
mismo número de réplicas para tener la misma varianza en las medias de tratamientos. R > 1
significa que el diseño de bloques es más eficiente que el completamente aleatorizado. Un R =
2 significa que el diseño completamente aleatorizado requiere 2 veces el número de réplicas
que el diseño de bloques para tener la misma varianza en la media del tratamiento. (Kuehl,
2000).
101
Ejemplo:
Se midieron las concentraciones de nitrógeno de nitratos que percolaban de un
campo forestal con lodo de plantas de tratamientos. Los excesos de nitrógeno se convierten
a nitratos una forma que lixivia al agua subterránea. Se quiere comparar las concentraciones
de nitratos en mezclas de lodos con tierra al 25, 50 y 75 %. Los tratamientos se aplicaron en
distintos días (bloques) debido a que no se podía correr el experimento completo con todo y
réplicas en un sólo día. El experimento se realizó durante 10 días y los tratamientos se
asignaron al azar a las distintas parcelas del terreno: además, en cada día se realizaron todos
los tratamientos:
La aleatorización de los tratamientos a las unidades experimentales se presenta a
continuación:
día: 1 2 3 4 5 6 7 8 9 10
A B C C A B A C B B
C A B B B C C B A A
B C A A C A B A C C
Bloque (día) Tratamiento
A B C
1 1.5 4.5 3.4
2 1.3 4.2 3.2
3 2.0 4.0 3.1
4 2.0 4.0 3.0
5 2.0 4.0 3.1
6 1.9 4.2 3.8
7 3.0 4.1 3.7
8 3.0 3.9 3.1
9 2.5 3.1 3.0
10 2.9 4.0 3.1
Modelo
yij i j ij
donde,
µ es la gran media y es común a todas las observaciones
i es el efecto de la i-ésima mezcla lodo-suelo.
ßj es el efecto del j-ésimo día
ij es el componente de error aleatorio
Sumas de Cuadrados
SCT 319.74
94.62 21.43
30
SCmezcla
22.1 40 2 32.52
2
298.31 16.16
10
SCdías
9.4 2 8.7 2 ... 10 2
298.31 1.45
3
SCE 21.43 16.16 1.45 3.82
102
(9)(01616
. ) 10(2)(0.2121)
c 019
.
29
19(30) 019
.
R 0.89
21(28) 0.212
Se necesitan 0.89 veces repetir el diseño completamente aleatorizado para obtener la
misma sensibilidad que el de bloques. Aquí puede confirmarse que no era necesario el
bloqueo para analizar los datos del problema. Lo que se perdió fue sensibilidad en el
modelo.
22. Nuevo-1.69
23 Nuevo-1.78
Se pensó que para llevar a cabo una corrida completa y para llenar la bobina se requería de
1 día. Por lo que se pensó que los días serían considerados como bloques. Se corrió el
experimento como una diseño de bloques completos aleatorizados. Y se presentan a
continuación los resultados.
Tratamiento Día
1 2 3 4 5 6
12 6.0 9.7 7.4 11.5 17.9 11.9
13 6.4 8.3 7.9 8.8 10.1 11.5
14 2.3 3.3 7.3 10.6 7.9 5.5
21 3.3 6.4 4.1 6.9 6.0 7.4
22 3.7 6.4 8.3 3.3 7.8 5.9
23 4.2 4.6 5.0 4.1 5.5 3.2
Pruebe si existen diferencias entre tratamientos.
Comparaciones Múltiples
Si los tratamientos son fijos, el interés también es conocer si existen diferencias entre
medias de tratamientos, para lo cual se emplean las pruebas de comparación múltiple. Las
fórmulas varían en que en lugar de colocar el número de réplicas de un diseño completamente
aleatorizado simbolizado por n o r, ahora es reemplazado por la letra b. También el número de
grados de libertad del error de bloqueo el cual es N – a – b + 1. Igualmente la potencia de la
prueba se aplicaría para determinar si el número de bloques manejados en el experimento es el
adecuado.
Ejercicio
a) Probar que µ1 + µ3 = 2µ2
b) Aplicar la prueba de DHS de Tukey y la prueba de rango múltiple de Duncan.
a) Ho: µ1 + µ3 = 2µ2
SCC
25.42 10.75
10 12 12 (2) 2
que tiene 1 grado de libertad, por lo que el CM tiene el mismo valor.
FC=10.75/0.21= 50.67 que al compararse con el valor F0.05;1,18 = 4.41, se observa que se
rechaza la hipótesis nula, es decir, existe diferencia estadísticamente significativa entre el
contenido de nitratos en los lixiviados de las mezclas 1 y 3 con el de la mezcla 2.
b) Prueba de Tukey.
1) 4 3.25 2.21
2) q0.05(3,18) = 3.61
2
3) Si. 0.21 0.21
10
1
4) t (3.61)(0.21) 0.53
1.4142
Cualquier diferencia mayor a 0.53 es estadísticamente significativa.
5)
1 vs. 2 : 4 – 2.21 = 1.79 > 0.53 **
2 vs 3: 4 - 3.25 = 0.75 > 0.53 **
1 vs. 3: 3.25 - 2.21 = 1.04 > 0.53 **
Esta prueba que es conservativa nos está indicando que todas las mezclas arrojan distintas
cantidades de nitratos en los lixiviados. Y debido a que la 1 es la que arroja menos nitratos,
sería la de elección por su poder menos contaminante.
Tarea. Consultar el libro de Bioestadística. Diseños de Bloques completos al azar con más de
una observación por tratamiento por bloque.
Ejercicios
1. Obtenga E(CMTrat) y E(CMB).
2. Obtenga por mínimos cuadrados los estimadores de los parámetros. Suponga que
ambos, factor y bloque son fijos.
3. Resolver los ejercicios 5-1, 5-2, y 5-5 del libro de Montgomery.
2
1 a b 1 b a
2
y yij yij yij
2 1 2
ij
b i1 j 1 a j 1 i1 ab
L SCE x 2
y ' x y
ij
2
' x y'.. x 2
.j
2
R
ij
b a ab
L 2 y'i. x 2y'. j x 2 y'.. x
2 xij 0
x b a ab
ay' by'. j y'..
x i.
(a 1)(b 1)
106
Método Exacto
Consiste en realizar el análisis de varianza utilizando el procedimiento de la regresión general
que consiste en calcular la reducción en la suma de cuadrados total al ajustar el modelo cuando
todos los parámetros están incluidos y la reducción en la suma de cuadrados cuando el modelo
está restringido por Ho, es decir cuandoi = 0. La diferencia entre ambas reducciones en las
sumas de cuadrados es la suma de cuadrados de tratamiento con la que se conduce Ho.
La metodología consiste en:
1. Obtener las ecuaciones normales para el modelo completo.
2. Determinar la reducción en la suma de cuadrados al ajustar los datos al modelo
(completo).
3. Determinar el número de grados de libertad asociados a esta suma de cuadrados.
4. La variabilidad no explicada es la suma de cuadrados del error SCE, se obtiene por
diferencia.
5. Para encontrar la SCtratamiento, se considera el modelo reducido, es decir bajo Ho.
6. Se obtiene el sistema de ecuaciones normales para este modelo.
7. Obtener la reducción en la suma de cuadrados al ajustar los datos al modelo reducido.
8. Encontrar el número de grados de libertad asociados a esta suma de cuadrados.
9. Completar la tabla de análisis de varianza.
Suponga por ejemplo que se tiene el siguiente diseño de bloques:
Bloques 1 2 Totales
Tratamientos
1 Y11 Y12 Y1.
2 Y21 X Y 2.
3 Y31 Y32 Y 3.
Para obtener el sistema de ecuaciones normales emplee el algoritmo propuesto por
Montgomery y que a continuación se describe:
1) Obtener una ecuación normal por cada parámetro.
2) El miembro derecho de cada ecuación normal es la suma de todas las observaciones
que corresponden a cada parámetro.
3) El miembro izquierdo de cada ecuación es la suma de todos los parámetros del
modelo, cada parámetro multiplicado por el número de veces que aparece en el total
del lado derecho de la ecuación.
4) En el ejemplo,
: 5ˆ 21 2 2 3 3 2 2 y..
1 : 2 21 1 2 2 y1.
2 : 2 1 y2.
3 : 2 2 3 1 2 y3.
1 : 3 1 2 2 31 y.1
2 : 2 1 3 2 2 y. j
Puede observarse que hay dos dependencias lineales, la suma de las tres dan la primera
ecuación y la suma de las dos últimas también dan la primera ecuación.
Añadiendo las restricciones al modelo
107
r 0
i 1
Sb 0 j
La solución a este sistema de ecuaciones es:
µ=y../5
1=1/4(y11)+(7/20)y21 -1/5y21 -1/5y31-3/20y32
2=-2/5y11 + 4/5y21 –2/5y31
3=-1/10y11 –7/10y12 – 2/5y21 +4/5y31 + 3/10 y32
ß1=1/5y11-1/5y12+1/5y31-1/5y32
ß2=-3/10y11 +3/10 y12 –3/10y31 +3/10y32
i 1 j 1
y. j y.. j y. j ..
2 2
a b
y2
yi. yi.
y y
.. ..
ab i 1 ab j 1 ab
yi2. y2 y2
b
. j ..
a ab
El número de grados de libertad asociados a R es igual al número de ecuaciones
linealmente independientes, es decir, 6-2=4. O bien, a+b-1=3+2-1=4
6. La SCE se obtiene por diferencia y es la parte de la variación total no explicada por el
modelo.
SCE yij2 R(ˆ ,ˆ, ˆ )
2
yi2. y y2
yij2 . j ..
b a ab
con N-a-b+1 grados de libertad o bien 5-3-2+1=1
Este CME se empleará como denominador para probar Ho: µi=µj
Para el modelo reducido, que es el que resulta cuando Ho es verdadera o dicho en palabras,
no hay efecto de los tratamientos:
yij j ij
se procede de la misma manera que con el modelo completo.
El sistema de ecuaciones normales sería:
: 5ˆ 3ˆ1 2ˆ2 y..
ˆ1 : 3ˆ 3ˆ1 y.1
2 : 2ˆ 2ˆ2 y.2
con 3-1 grados de libertad, es decir 2 debido a la dependencia lineal.
108
Estos valores estimados sirven para calcular la reducción en la suma de cuadrados del
modelo reducido.
b
Imponiendo la restricción: sb j 0 la solución al sistema de ecuaciones sería:
j 1
1
ˆ y..
5
1 y..
ˆ1 y1.
3 5
1 y..
ˆ2 y2.
2 5
La suma de cuadrados explicada en el modelo reducido sería:
R( ˆ , ˆ ) ˆ y.. ˆ1 y.1 ˆ 2 y.2
y . j y..y . j
y..2 b
ab
y..2 b
y2
y. j y . j ..
ab ab
b y .2j
a
con b grados de libertad.
La suma de cuadrados debida a i después de introducir a µ y ß es:
R(ˆ / ˆ , ˆ ) R( , , ) R( , )
y i2. y.2j y..2 b y2
.j
b a ab a
y i2. y2
..
b ab
con a – 1 grados de libertad. Esta fórmula corresponde a la suma de cuadrados de
tratamiento con a-1 grados de libertad.
Para obtener la suma de cuadrados de los bloques tendríamos que trabajar con otro modelo
reducido:
yij i ij
a
y 2
i.
R(
ˆ ,ˆ)
b
con a grados de libertad.
SCbloques después de ajustar el modelo reducido con µ y ß sería:
109
R ( / , ) R ( , , ) R ( , )
a
y 2
y y
2 2 y 2
i.
i.
.j ..
b a ab b
y2 y2
. j ..
a ab
con a+b-1-a = b-1 grados de libertad.
De este modo la tabla de análisis de varianza sería:
Fuente de Variación SC g.l. CM F
Modelo Completo
T,ß SCcompl. 4-1=3
Error SCE 1 CME
Modelo Reducido
R(µ,ß) SCRed 1 CMB
R(t/µ,ß) SCc-SCred 2 CMTrat CMTrat/CME
En resumen, con el método exacto no se estima el valor, más bien se realiza el análisis
de varianza con el método de la regresión tomando en cuenta a la observación perdida.
Realmente por causas experimentales no deben perderse datos pues eso habla del poco
control y cuidado que se ha tenido al realizar el experimento. Si la pérdida fue inevitable no
importa estimar el dato por el método aproximado de Yates, pero si se pierden más datos
queda en entredicho el que realiza el experimento. Si se pierde más de un dato, por ejemplo
dos, se sugiere un dato, se estima el otro dato; con este dato se estima el que al principio se
había sugerido y así sucesivamente hasta que converjan. Si se pierde más de dos datos, se
recomienda emplear el método exacto.
Ejercicio Propuesto.
1. El siguiente es un diseño de bloques completos aleatorizados.
Bloque a b c d e F
I 16 22 16 y1 18 8
II 28 27 17 20 23 23
III 16 25 16 16 19 16
IV 28 y2 19 18 24 25
Si el y1 fuera la media del bloque o la media del tratamiento, estime y1 y y2.
Inserte los valores estimados y efectúe el análisis de varianza prestando atención a los
grados de libertad del error y totales.
Cuadro latino.
En el diseño de bloques completos al azar se aleatorizan los tratamientos en cada
bloque de manera que en cada bloque se aplica una sola vez cada tratamiento. La
aleatorización está restringida por los bloques. Existen otros experimentos en los cuales se
quiere investigar el efecto de un solo factor y se requiere eliminar el efecto de otras dos
variables; es entonces que se aplican los cuadros latinos. El cuadro latino tiene las
siguientes características:
1) Es un cuadro, tiene igual número de columnas y de filas.
2) Igualmente existe el mismo número de filas, columnas y tratamientos.
3) En cada fila y la columna sólo se presentan los tratamientos una sola vez.
110
Los cuadros latinos más comunes son los de 4 y 8 tratamientos con una sola unidad
experimental por tratamiento en cada fila y columna. Cada hilera o columna constituye una
repetición completa de los tratamientos. El número total de unidades experimentales es
igual a t² (es un cuadrado perfecto). Se supone que incrementa la eficiencia respecto a un
diseño de bloques completos al azar.
Se requiere que no exista interacción entre F, C y T. La desventaja del cuadrado
latino es que el número de unidades experimentales requerido para establecer un
experimento se incrementa notablemente a medida que aumenta el número de tratamientos
en ensaye. Además se requiere que el número de tratamientos debe ser igual al número de
réplicas (filas y columnas). El error se incrementa conforme se incrementa el tamaño del
cuadro latino. Los cuadros latinos pequeños tienen pocos grados de libertad para el error y
no se pueden evaluar las interacciones entre filas , columnas y tratamientos.
El cuadro latino tiene la siguiente forma:
A B C D
B C D A
C D A B
D A B C
Un cuadro latino como el anterior en el que la primera fila y columna están en orden
alfabético recibe el nombre de cuadro latino estándar.
Un cuadro latino estándar cíclico es el que tiene los tratamientos de la primera fila y
primera columna en orden alfabético y si las letras de cada fila se pueden obtener de las
previas corriendo la primera letra de una fila a la última posición de la siguiente fila y
desplazando todas las demás letras de dicha fila.
Aleatorización
Existe un glosario de cuadros latinos estándar de varias dimensiones de hasta 12 x 12 en el
libro de Diseños Experimentales de Cochran o en el libro de Diseños de Experimentos de
R.A. Fisher. Para la aleatorización elija un cuadro latino estándar aleatoriamente. Para
cuadrados latinos de 3 4 o 5, permutar todas las hileras excepto la primero y después
permutar todas las columnas.
Ejemplo, suponga que eligió el cuadro latino de 4 x 4 siguiente:
A B C D
B C D A
C D A B
D A B C
Con una tabla de números aleatorios elija dos secuencias de números, la primera del 2 al 4
(para permutar las tres filas) y una secuencia de 4 números (para permutar las cuatro
columnas).
Suponga que las series fueron: (2,4, 3) y (3,1,4,2)
Cómo quedaría el cuadro?
A B C D C A D B
B C D A D B A C
D A B C ------- B D C A
C D A B A C B D
También puede elegirse al azar un cuadro latino estándar y se aleatorizan todas las filas y
las columnas.
111
Ejemplo:
Un ingeniero químico elabora una salsa casera y piensa que la viscosidad de su producto no
es de la consistencia adecuada. Cree que la concentración de harina y agua determina su
viscosidad, otros factores que también afectan la viscosidad son controlados a niveles fijos.
Desea probar 4 mezclas agua:harina, y son las mezclas 1:1 (1 parte de agua, 1 parte de
harina), 1:2, 1:3 y 1:4. Debido a que la elaboración es tequiosa emplea a 4 químicos para
que cada uno elabore la salsa con las cuatro mezclas. A su vez no se cuenta con 1 batidora
sino que tiene 4 batidoras para la elaboración de las salsas. Las 4 batidoras trabajarán con
las 4 mezclas a fin de que todas las salsas tengan la misma oportunidad de ser batidas por
las 4 batidoras. Debido a que desea eliminar el efecto que pudiera ejercer el químico o la
batidora en la variabilidad de los datos propone un diseño de cuadrado latino con dos
restricciones en la aleatorización: químico y batidora.
¿Cuál sería el modelo, hipótesis y supuestos?
Con los resultados que se presentan abajo construya su tabla de análisis de varianza y
concluya.
Batidoras
C 10 D 14 A7 B8
B7 C 18 D 11 A8
A5 B 10 C 11 D9
D 10 A 10 B 12 C 14
A. Mezcla 1:1
B. Mezcla 1:2
C. Mezcla 1:3
D. Mezcla 1:4
Modelo
yijk = + i + ßj + k + eijk, i= 1,2,...,p, j= 1,2,...,p, k= 1,2,...,p
donde,
es la media total para los p tratamientos usando todas las p² combinaciones de 2 factores.
i es la parte de la media debida a la i-ésima fila.
112
Supuestos:
1) las p2 poblaciones están normalmente distribuidas
2) Tienen varianzas iguales
3) No existe interacción
4) Existe independencia de errores.
Sumas de Cuadrados
p p
y...2
P
SCtotal = y -
2
ijk
i=1 j=1 k=1 N
p
y2. j. y2...
SCTrat = -
j=1 p N
p
yi..2
SCrenglón = - f.c.
i=1 p
y..k 2
p
SCcolumn = - f.c.
k=1 p
Resolviendo el ejemplo:
SCT 1834
164 2 153.0
16
39 2 44 2 35 2 46 2
SCquim 1681 18.5
4
30 2 37 2 532 44 2
SCmezcla 1681 72.5
4
32 2 52 2 412 39 2
SCbatidora 1681 51.5
4
SCE 153 18.5 72.5 51.5 10.5
Fuente de SC G.L. CM FC
Variación
Tratam. 72.5 3 24.17 13.81
Renglón 18.5 3 6.17
Columna 51.5 3 17.17
Error 10.5 6 1.75
Total 153 15
F0.05;3,6=4.76
Como Fc es mayor que el valor de la tabla, entonces rechazamos Ho, es decir, existen
diferencias entre las mezclas.
Estimación de los parámetros del modelo
ˆ y...
i yi.. y...
ˆ j y. j . y...
ˆk y..k y...
utilizados están en el rango de 4 p 10. Para incrementar los grados de libertad del error
se pueden repetir los cuadros .
Los cuadros latinos se pueden duplicar de tres maneras:
i) Repetir el cuadro, los mismos renglones y las mismas columnas
ii) Los mismos renglones o las mismas columnas, pero no ambos.
iii) Repetir el cuadro con diferentes renglones y diferentes columnas.
Cuando se replican los cuadros latinos la aleatorización de cada cuadrado se realiza por
separado
Véanse las fórmulas de cálculo para los tres casos en el libro de Montgomery.
Ejercicio Propuesto (tomado del libro Introduction to Experimental Statistics. C.C. Li.)
El siguiente es un cuadro latino en el que L y P son las dos fuentes de bloqueo, y a, b, c, d,
y e son los tratamientos. Encuentre los valores de los residuos y compruebe que suman cero
para L, para P y para cada tratamiento.
E C A D B Total
20 9 15 36 22 102
C B D E A
14 24 37 23 18 116
A 3 C B D
13 17 10 17 29 86
D A B C E
33 16 21 16 22 108
B D E A C
19 27 14 15 13 88
Totales
99 93 97 107 104 500
R
glEL 1glEB 3 * ˆ B2
glEL 3glEB 1 ˆ L2
Y para determinar la eficiencia del bloqueo de las columnas para el bloque con diseño de
bloques completamente aleatorizado el estimador del error del diseño de bloques sería:
115
CM filas ( p 1)CM E
ˆ B2
p
Y la eficiencia se obtiene:
R
glEL 1glEB 3 ˆ B2
*
glEL 3glEB 1 ˆ L2
A continuación se presenta un conjunto de ejemplos numéricos que el alumno resolverá
aplicando las fórmulas propuestas por el libro de Montgomery.
Diferentes filas y mismas columnas.
A 7.0 B 8.0 C 9.0
B 4.0 C 5.0 A 6.0
C 6.0 A 3.0 B 4.0
Diseños conmutativos
Son diseños en los cuales a los sujetos se les da un número de tratamientos en una
secuencia de tiempo con el objeto de evaluar la diferencia entre tratamientos. Por
consiguiente se requiere la mitad de sujetos que los necesarios para una comparación de los
tratamientos con distintos grupos de individuos. Cada sujeto sirve como su propio control.
Este tipo de diseño es un diseño de bloqueo en el cual cada unidad experimental o sujeto es
un bloque. Este diseño es muy útil cuando hay una considerable variación entre unidades
experimentales. Si hay demasiada diferencia entre las unidades las comparaciones de los
factores pueden ser confundidos por los efectos de grupos de unidades experimentales que
reciben los mismos tratamientos. Como cada sujeto recibe los diferentes tratamientos se
debe tener la seguridad que no hay efecto residual de los tratamientos con el objeto de
poder evaluar el siguiente tratamiento.
Se utiliza generalmente para comparar tratamientos de enfermedades crónicas no agudas ya
que en éstas últimas puede suceder que los individuos sanen al cabo o durante el primer
período de tratamiento.
Debido a su larga duración puede que algunos individuos abandonen el experimento.
También debido a que reciben varios tratamientos la aparición de efectos secundarios
muchas veces obligan al paciente a abandonar el estudio. Si algún paciente abandona el
estudio al comenzar el segundo período se pierde la información de ese paciente.
Para que un diseño conmutativo se aplique correctamente se deben cumplir los siguientes
supuestos:
Existe una gran variación incontrolable entre las unidades experimentales.
Los períodos de tiempo son de suficiente duración para que se manifiesten los
efectos de los factores.
No hay efecto residual de un período al siguiente. Estos efectos también reciben el
nombre de efectos acarreados y se deben a: el efecto de un tratamiento perdura
117
Ejemplo:
Son mediciones de flujo pico expiratorio (PEF) que es una medida de la función pulmonar,
en 14 niños de edades de 7 a 14 con asma moderada a severa, se estudió aplicando un
diseño conmutativo (o crossover) de 2 períodos de tiempo y 2 tratamientos que compara los
efectos de una dosis simple inhalada de 200µg de salbutamol, que es un broncodilatador
bien conocido y 12 µg de formoterol, un broncodilatador reciente. Los niños se
aleatorizaron a uno de dos grupos de secuencia. En un grupo se aplicaba la siguiente
secuencia: dosis formoterol en la mañana, observado por 8 horas en la clínica, fueron a casa
donde sus padres tomaron mediciones de PEF después de 10, 11 y 12 horas de tratamiento.
En una ocasión subsecuente después del lavado (washout) de al menos un día se
presentaron en la clínica y se les administró el salbutamol.
Secuencia Período 1 Washout Período 2
For/Sal Formoterol No tratamiento Salbutamol
Sal/For Salbutamol No tratamiento Formoterol
1 2 3 4 5 6 7
Período 1 310 A 370 B 310 B 310 A 380 B 370 A 410 A
Período 2 270 B 380 A 400 A 260 B 410 A 300 B 390 B
118
8 9 10 11 12 13 14
Período 1 280 B 290 B 250 A 380 A 260 B 90 B 330 A
Período 2 310 A 320 A 210 B 350 B 340 A 220 A 360 B
2 3 5 8 9 12 13
Salbutamol 380 310 380 280 290 260 90
Formoterol 380 400 410 310 320 340 220
El modelo para este diseño sería:
yijk Pi (i ) S j ( j ) Fk ijk
donde,
Pi es el efecto del i-ésimo período
Sj el efecto del j-ésimo sujeto
Tk el efecto del k-ésimo medicamento
SCS
y 2
. j.
f .c
p
y..2k
SCT f .c
np
SCP
yi2.. GT 2
14 28
SCS
y. j. f .c
2
2
y2
SCT ..k f .c
14
de modo que la tabla de Análisis de varianza quedaría así:
Fuente de variación Grados de libertad
119
Ejercicio:
Una industria farmacéutica desea probar dos drogas. Dispone de 12 personas. Se eligieron 6
personas al azar para recibir la droga 1 primero. Las otras 6 recibieron la droga 2 Después
de un período suficiente de limpieza (washout), las 6 quienes recibieron la droga 1,
recibieron ahora la droga 2 y las 6 que primero recibieron la droga 2 recibieron ahora la
droga 1.
Orden 1: Droga 2, Droga 1
D2 51.9 35.1 38.6 36.1 34.6 39.7
D1 58.5 60.4 50.4 58.7 64.8 54.9
Orden 2: Droga 1, Droga 2
D1 50.8 41.1 39.1 35.7 33.7 31.2
D2 62.2 51.4 50.7 51.1 51.4 45.1
Determine si hay diferencia entre las drogas.
CUADRO GRECOLATINO
Este es un diseño en el que se manejan 3 restricciones en la aleatorización y se denota por
letras griegas , , etc. Existen tres fuentes de bloqueo cuyos efectos no se quieren estimar. El
arreglo se presenta a continuación:
120
Columnas
I II III IV
1 A Bß C D
Filas 2 B A D Cß
3 C D A B
4 Dß C B A
Un ejemplo propuesto por Wu y Hamada (2000) puede ser que deseemos comparar tres
aditivos de gasolina probándolos en tres autos con tres automovilistas en tres días. Los aditivos
son los tratamientos asignados con las letra latina A, B y C. Los carros, automovilistas y días
son los factores de bloqueo asignados a las filas, columnas y letras griegas.
Modelo
yijkl = + ßi + j + k + l + ijkl
Este tipo de diseño no se usa con frecuencia ya que rara vez las unidades experimentales
pueden balancearse en los tres tratamientos, (Cochran, 1965). Si en el ejemplo citado en la
sección de bloques completos (ejemplo de lodos de fosa séptica y nitratos en el agua) se cree
que la posición en la que se coloque el lodo puede incrementar el error y se piensa que existen
diferencias entre las posiciones, se puede adicionar como una tercera fuente de bloqueo y
analizarlo mediante un cuadro grecolatino.
Los cuadros son ortogonales, ninguna letra griega aparece más de una vez con cada
letra latina. Cada letra griega se presenta sólo una vez en cada renglón y en cada columna.
La suma de cuadrados debida a la letra griega puede calcularse sumando los totales o
promedios de cada letra griega.
La ventaja principal de utilizar un cuadro grecolatino es que se permite controlar 3 fuentes de
variación. Pero sus desventajas es que el número de unidades experimentales requeridas
aumenta muy rápidamente el aumentar el número de tratamientos a comparar. Si los cuadros
son pequeños el número de grados de libertad del error es pequeño, si se pierden datos se
complica el análisis y es muy difícil un balance entre tres agrupaciones.
Si el cuadro es pequeño los grados del error son muy pequeños:
Si p = 3, los g.l. del error = 0
p = 4, g.l. error = 3.
Para cuadros grecolatinos grandes se requieren muchas unidades experimentales. Por ejemplo
si p = 12 se requieren 144 unidades experimentales.
Ejemplo:
Una medida compuesta de la calidad de la pantalla se tomaron en pantallas que usaron cuatro
concentraciones de laca, cuatro tiempos, cuatro concentraciones del acriloide (A, B, C y D) y
cuatro concentraciones de acetona (. , y ).
Concentración de laca
121
cuadrados
El valor es el número de veces que cualquier par de tratamientos Ai, Aj aparecen juntos.
Por ejemplo en el siguiente diseño:
B1 B2 B3 B4 B5 B6 B7
A1 X X X X
A2 X X X X
A3 X X X X
A4 X X X X
A5 X X X X
A6 X X X X
A7 X X X X
Puede observarse que los tratamientos 1 y 2 aparecen juntos en los bloques 1 y 3. Los
tratamientos 1 y 3 en los bloques 1 y 2; los tratamientos 1 y 4 en los bloques 2 y 6, es decir
el valor de es igual a 2. También puede observarse que el número de veces que aparece
cada tratamiento, o bien r, es igual a 4.
Con k niveles de A pareados con cada nivel de B el nivel Ai estará apareado con k-1 otros
niveles de A dentro de cada nivel de B con el que esté apareado.
Si Ai está apareado con r diferentes niveles de B, entonces el número de veces que parece
Ai combinado con otros niveles de A es r(k-1).
Por otro lado, debido a que cada nivel de A está pareado con cada otro nivel de A veces,
el número de veces que Ai está apareado con cada uno de los otros (a-1) niveles de A debe
ser (a-1) por lo tanto es cierto que:
r(k-1=(a-1) y
Para que sea un diseño de bloques incompletos balanceados debe cubrir tres condiciones:
1) ar = bk
2) r(k-1) = (a-1)
3) b a
Una vez seleccionado el diseño, entonces se aleatorizan los tratamientos a las unidades
experimentales de cada bloque: es decir en dos urnas colocar los tratamientos y en la otra
las unidades experimentales de ese bloque. Hacer una aleatorización diferente por bloque.
Suponga que se quiere comparar 5 tratamientos pero los bloques solo pueden soportar 4
tratamientos.
5
a) Se pueden formar 5 bloques
4
b) Asigne cada uno de las k diferentes combinaciones de tratamientos a los bloques:
1234
1235
1245
1345
2345
c) El número de réplicas es:
124
a 1 4
4 réplicas
k 1 3
d) λ es el número de veces que aparece cada par de tratamientos en los bloques
a 2 5 2
3
k 2 4 2
Hipótesis
Ho: i = j ij
H1: i j para al menos una i y una j
Supuestos
a
=0
i=1
i
=0
j=1
j
125
ij _ N(0, 2 )
Sumas de Cuadrados
a b
SCT y ij2 fc
i 1 j 1
a
k Qi2
i 1
SCTratadj
a
1 b
Qi y i. nij y. j
k j 1
b y.2j
SCBloque fc
j 1 k
Se puede observar que hay un ajuste en la suma de cuadrados de los tratamientos porque cada
tratamiento es representado en un juego diferente de r bloques. Por lo tanto las diferencias
entre totales no ajustados son afectados también por las diferencias entre bloques.
En las fórmulas anteriores los Qi son los totales ajustados para cada tratamiento; nij es 1 ó 0; 1
si el tratamiento aparece en el bloque y 0 si el tratamiento no aparece en el bloque y
1 b
nij y. j es el promedio de los totales de los bloques en los que se aplica el tratamiento i.
k j 1
La suma de los Qi = 0
En el ejemplo:
SCT=2981-(241)2/20=76.95
50 2 54 2 48 2 50 2 39 2
SCAuto 2904 .5 31.2
4
Q1 56 54 48 50 39 8.25
1
4
Q2 51 50 54 50 39 2.75
1
4
Q3 46 50 48 50 39 0.75
1
4
Q4 47 50 54 48 50 3.5
1
4
Q5 41 50 54 48 39 6.75
1
4
SCAdivadj
4 8.25 2 2.75 2 (0.75) 2 (3.5) 2 (6.75) 2
35.73
3(5)
SCE 76.95 31.20 35.73 10.02
Grados de Libertad
Aditivos: a-1 5-1 = 4
Autos: b-1 5-1 = 4
Error: Dif. 11
Total N-1 19
126
Estimación de Parámetros
Eliminando las comparaciones entre bloques sobre los efectos de tratamiento
ˆ y..
kQ
ˆi i
a
Comparaciones Múltiples
Si deseamos probar las siguientes hipótesis:
Ho : 1 2 0
Ho : 3( 1 2 ) 2( 3 4 5 )
Ho: Efecto lineal de 3,4 y 5
Ho: Efecto cuadrático de 3,4 y5
C1: 1(8.25)-1(2.75)=5.5
C2: 3(8.25+2.75)-2(-0.75-3.5-6.75)=-6
C3:-1(-0.75)+0(-3.5)+1(-6.75)=-6
C4:-1(-0.75)+2(-3.5)+1(-6.75)=-13
2
a
k ciQi
SCCi a
a ci2
Si se quisiera aplicar la prueba de Duncan el error estándar para los efectos de tratamientos
ajustados es:
kCM E
S
a
Y lo que se compararía son los efectos de los tratamientos más que las medias. Para la DSM :
2kCM E
S
a
Prueba de Scheffé
El contraste que se quiere probar es:
k
ciˆi a ci Qi
El error estándar de cada contraste se calcula por la fórmula:
a
k
SCC ci2 CM E
I 1 a
Y el valor de Scheffé
S SCH SCc (a 1) F ;a1,bkba1
El error estándar de las medias ajustadas que también puede utilizarse en las comparaciones
múltiples como en los intervalos de confianza y lo que se compara son las medias ajustadas
ˆ ajust ˆ ˆi :
128
k (a 1) 1
CME
a N
2
Ejercicios Sugeridos:
1. ¿Cómo quedaría el análisis si aparte de que es un diseño incompleto se pierde algún dato, en
el ejemplo la observación del aditivo 3 y auto 3?
2. Leer “Recuperación de la información interbloque”.
3. Se utilizó un diseño de bloques incompletos balanceados para estudiar la ganancia en
peso en 3 vacas con cuatro diferentes raciones. Las raciones se dieron en 4 semanas. Los
datos se presentan a continuación. Considere las semanas como los bloques y las raciones
son los tratamientos.
Semanas A B C D
1 2 - 20 7
2 - 32 14 3
3 4 13 31 -
4 0 23 - 11
a) Calcule el valor de
b) Realice el análisis de varianza con los totales de los tratamientos ajustados y
los totales de los bloques ajustados, establezca sus conclusiones.
c) Construya contrastes ortogonales y compare los totales de tratamiento
ajustados
d) Realice la prueba de Duncan.
Este ejemplo se obtuvo del sitio [Link]/~prem/[Link].