0% encontró este documento útil (0 votos)
86 vistas128 páginas

Historia y Métodos del Diseño de Experimentos

El documento proporciona un resumen histórico del desarrollo del diseño de experimentos. Comenzó con investigaciones agrícolas en el siglo XIX y ha evolucionado desde entonces, con contribuciones de figuras clave como Fisher, Box, Taguchi y otros. Actualmente, el diseño de experimentos se utiliza ampliamente no solo en investigación sino también en negocios, con enfoques como Seis Sigma.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
86 vistas128 páginas

Historia y Métodos del Diseño de Experimentos

El documento proporciona un resumen histórico del desarrollo del diseño de experimentos. Comenzó con investigaciones agrícolas en el siglo XIX y ha evolucionado desde entonces, con contribuciones de figuras clave como Fisher, Box, Taguchi y otros. Actualmente, el diseño de experimentos se utiliza ampliamente no solo en investigación sino también en negocios, con enfoques como Seis Sigma.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

UNIVERSIDAD AUTÓNOMA DE YUCATÁN

FACULTAD DE MATEMÁTICAS

Diseño y Análisis de Experimentos

QFB. J. Irene Peniche Ayora, MIA.


2

DISEÑO DE EXPERIMENTOS

Antecedentes Históricos.

 El Diseño de Experimentos (DDE) surge principalmente de las investigaciones


agrícolas. En1812, Gauss había propuesto la Prueba de Hipótesis.
 En 1843, se estableció en Londres la Estación Agrícola Experimental en
Rothamsted.
 En 1908, Gosset propone la prueba t de Student para comparar dos medias a partir
de dos muestras pequeñas.
 En 1915, Ronald Aylmer Fisher demuestra rigurosamente la validez de los métodos
de Gosset y con esto y la revisión de los principios de la herencia se presenta en
Rothamsted.
 En 1919, contrataron a Ronald A. Fisher para ver lo que los nuevos métodos
estadísticos podrían hacer por la agricultura. Permaneció en Rothamsted hasta 1933.
 Fisher contribuye con distribuciones probabilísticas derivadas de la normal, el
análisis de varianza y el diseño de bloques completos al azar.
 En 1926, introduce el concepto de aleatorización de las unidades experimentales a
los tratamientos con lo que se justifica la validez del criterio de prueba. Publica su
artículo El Arreglo en Experimentos de Campo donde habla de la aleatorización, el
control local para reducir el error y la réplica para estimar la varianza del error.
 En 1930 arranca la era industrial con los diseños propuestos por Box y Wilson. En
la industria los experimentos fuera de línea requieren resultados rápidos y que los
resultados de un experimento conduzcan al planteamiento de otro que lleve a la
solución de un problema en la línea de producción. Es durante los siguientes 30
años que los diseños experimentales aplicados a la industria se utilizan y se
profundizan, modifican o proponen nuevos diseños.
 En 1933, Fisher sucede a Karl Pearson como Profesor en la Universidad de
Cambridge.
 Fisher es el autor de dos libros de diseño de experimentos: Statistical Methods for
Research Workers (1925) y The Design of Experiments.
 En 1934 Fisher y Yates estudian los cuadros latinos.
 En 1935 Fisher publica su primera versión del “Diseño de Experimentos”.
 Cuando sale Fisher de Rothamsted contratan a Frank Yates como su sucesor y
contribuye con los diseños balanceados de bloques incompletos en 1936.
 En 1937 contribuye con los diseños factoriales 2k.
 En 1939 Bose y Nair completaron el trabajo de Yates con los diseños parcialmente
balanceados de bloques incompletos.
 En 1945 Finney contribuye con los diseños factoriales fraccionarios. Y en 1946
Plackett y Burman introducen los diseños del mismo nombre. Rao en 1950 escribe
sobre la teoría de éstos.
 Ya en 1950 aparece el Dr. Genichi Taguchi con sus nuevas aproximaciones del
diseño de experimentos que enfatiza su interés en la evaluación de un gran número
de efectos principales más que en las interacciones de los mismos. Las aportaciones
de Taguchi corresponden a la Ingeniería de la Calidad. Lo importante es la calidad
3

del producto, y un producto es de calidad en la medida en que sus valores


funcionales se acercan a valores objetivos. Para asegurar la calidad es necesario el
diseño que incluya la arquitectura del sistema, los valores nominales de los
parámetros y la tolerancia del sistema. Es importante encontrar el sistema más
sencillo que funcione. Sigue entonces determinar los valores de los parámetros del
proceso y los niveles de los factores tales que optimicen la característica funcional
del producto y la hagan menos sensible a factores no controlados. Algunos factores
son controlables y se fijan a voluntad del investigador y deben permanecer
constantes una vez elegidos. Y otros factores son incontrolables y sus valores
pueden cambiar de unidad a unidad, o de un tiempo a otro. Debido a que no se
pueden controlar se debe conocer su campo de variación. Estos son los que forman
el ruido del sistema. En la metodología de Taguchi se eligen los niveles de los
parámetros de control de modo que el producto sea robusto o insensible al ruido. No
se controla el ruido, sino que se minimiza su influencia.

Su método opera con la premisa de que los datos no se ajustan perfectamente a una
distribución normal. Recolectan datos rápida e iterativamente. Los diseños de
Taguchi se aplican en la industria de manufactura. Estos diseños conocidos como
diseños paramétricos robustos reconocen dos tipos de variables en un experimento,
aquéllos que se pueden controlar y que denomina parámetros y aquéllos que no se
pueden controlar y que denomina factores de ruido. Los diseños consisten en
combinar fracciones de diseños factoriales (donde los factores son los parámetros)
con los factores de ruido y se determina la mejor combinación que produzca la
respuesta deseada y con la menor variación. Aquélla combinación que produzca
estas condiciones recibe el nombre de robusto. Y el interés de la metodología de
Taguchi es encontrar aquellas condiciones de un proceso que sea poco sensible a los
cambios ambientales o de ruido. Esta metodología aún despierta controversias por
cuanto a la estrategia experimental y sus métodos presentan problemas.
 En 1951 Box y Hunter contribuyen con análisis de diseños compuestos en la
superficie de respuesta.
 En 1954 Tukey y Scheffé desarrollan métodos para comparaciones múltiples.
 En 1957 Box trabaja con la metodología de superficies de respuesta.
 En 1960 se desarrollaron los diseños Box Behnken
 En 1961 Box y Hunter trabajan en los diseños fraccionarios de resolución 2k-p.
 Otros que han contribuido al desarrollo del DDE son Kempthorne, Cox, Myers etc.
 A partir de las controversias que se han generado con la metodología de Taguchi y
con el amplio uso del diseño de experimentos en todo campo se inicia la cuarta era
del desarrollo del diseño de experimentos
Alrededor de 1998 Mikel Harry comenzó a propagar la metodología Seis Sigma,
integrándolo al DE en una secuencia Medición –Análisis- Mejora- Control, cuyo
objetivo es mejorar ambos: manufactura y proceso transaccional o comercial. Hay otra
secuencia para la formulación: Identificar- Diseñar- Optimizar- Verificar que se utiliza
para desarrollar nuevos productos y procesos.
El DE asume ahora el papel de un agente de cambio no sólo en la investigación, sino
también en los negocios.
4

El Seis Sigma se interesa en mejorar los experimentos en cuanto a cuestiones críticas de


calidad con el 6 Sigma como objetivo de su actuación.
Se interesa en niveles de actuación de acuerdo a las expectativas del cliente, se interesa
no solo en producir calidad sino prevenir defectos en productos como en servicios (Goh
T. N, (2001))
"A pragmatic approach to experimental design in industry" Goh T. N (Journal of
applied statistics, vol 28 No 3-4p.- 391-398.

¿Qué es un experimento?
Antes de plantear un experimento es importante responder a la siguiente pregunta ¿para qué
se va a realizar o qué propósito se persigue para realizarlo? Puede llevarse a cabo para
determinar las causas de variación de una variable dependiente o respuesta, para encontrar
las condiciones que dan lugar a una respuesta máxima o mínima, para comparar las
respuestas que se obtienen trabajando las variables independientes a distintos valores o
niveles, o bien para obtener un modelo matemático que permita predecir respuestas en el
futuro. En pocas palabras, los experimentos los realizan los investigadores para descubrir
algo acerca de un proceso o de un sistema en particular.

Cobb G. (1998) en su libro Introduction to Design and Analysis of Experiments recalca que
al diseñar un experimento es importante decidir ¿Qué mediciones hacer? ¿Qué condiciones
estudiar? Y ¿Qué material experimental utilizar? Y que planear un experimento es el
resultado de la formulación de una pregunta. Algo que se desea saber lleva a la formulación
de una pregunta. En general cuando se plantea la pregunta, ésta suele ser muy general y
difícil de responder. Lo primero que hay que hacer es convertirla en una pregunta más
específica que pueda responderse planteando un experimento.

Kelly Acampora está interesada en saber lo que pasa cuando los animales invernan,
específicamente desea estudiar cómo los cambios en el ambiente animal causan que el
animal comience a invernar.

Al diseñar un experimento se debe decidir:

Qué mediciones hacer La respuesta

¿Qué condiciones estudiar? Los tratamientos

¿Qué material experimental utilizar? Las unidades experimentales

El diseño debe comenzar con decidir las preguntas por responder, pero no debe limitarse a
una pregunta muy general como la que se planteó Kelly. Hay que ser más específico y para
esto Kelly tuvo que enfrentarse a las siguientes preguntas:

 ¿Qué cambios en el ambiente deben estudiarse?

Ella sabe que los animales invernan cuando llega esta estación, y sabe que hay más frío y
que el día es más corto (fotoperíodo corto).
5

Kelly decidió enfocarse a la segunda clase de cambio. Cambios en el fotoperíodo.

 ¿Qué clase de medición hacer con el fin de estudiar el efecto de la duración


del día?
Una posibilidad sería medir algo como el pulso cardíaco o la tasa de respiración puesto que
son más lentos cuando el animal está invernando. En su lugar ella decide estudiar otra
variable relacionada con el nivel de actividad nerviosa, específicamente la concentración de
la enzima Na K ATP-asa de la bomba de sodio. Altas concentraciones indican alta
actividad nerviosa. (No está invernando).

 ¿Qué animal estudiar?


Kelly se decide por los hámsteres dorados y no los osos, por razones obvias.

Hasta aquí Kelly se decidió por tres cosas. Estudiar el efecto de la longitud del día
(tratamientos) para medir la concentración de la enzima Na ATP-asa y usar hámsteres
dorados. Y con estas decisiones una pregunta muy general se convierte en una más
específica.

¿Cuál es el efecto de cambiar la longitud del día (fotoperíodo) en la concentración de la


enzima Na+ K+ ATP-asa en hámsteres dorados?

“Un experimento es una prueba o serie de pruebas en las cuales se hacen cambios sobre las
variables de entrada de un proceso de manera que se puedan observar o identificar las
razones de los cambios en la variable de salida o respuesta”.

Algunos ejemplos son los siguientes:

Un investigador agrícola desea averiguar si un nuevo fertilizante que él ha sintetizado es


mejor que otros dos de amplio uso comercial. Cuenta con un terreno de tres hectáreas y
decide probar los tres fertilizantes. Siembra 10 matitas en una hectárea, 10 en otra y 10 en
otra, les agrega los fertilizantes y al cabo de cierto tiempo evalúa el crecimiento de las
plantas midiéndoles la altura ganada.

Un químico en alimentos desea probar si puede cambiar la formulación de un embutido. El


embutido siempre lo ha elaborado incluyendo en la receta harina de trigo y desea saber si la
harina de maíz y la de soya son igual de efectivas en cuanto al contenido de proteínas.
Elabora 20 salchichas con cada una de las harinas y evalúa el contenido de proteínas de
cada formulación.

Un especialista en docencia desea evaluar cuatro métodos de enseñanza y elabora un


instrumento o examen que aplica a 80 estudiantes pero estos estudiantes proceden de
escuelas particulares y de gobierno. Cuenta con 40 estudiantes de una escuela de gobierno
y 40 de una escuela particular. Desea eliminar el efecto que podría ejercer la procedencia
del alumno para solamente evaluar los cuatro métodos de enseñanza.
6

Un Ingeniero químico desea evaluar el contenido de anhídrido succínico, pH y tiempo de


reacción en la modificación por succionación del almidón nativo de Phaseolus lunatus y
evalúa el porcentaje de grupos succinilos en el almidón. Prueba dos niveles de pH,
dosconcentraciones de anhídrido y dos tiempos de reacción y determina el efecto de estas
variables en el porcentaje de succinilos que tienen 16 porciones de almidón de Phaseolus
lunatus.

En todos los ejemplos distinguimos variable dependiente o respuesta (variable de salida),


variables independientes o factores y cambios a observar. En cuanto a variables respuesta
se tiene la altura de la planta, el contenido de proteínas, la calificación final y el porcentaje
de succinilos. Distinguimos también variables independientes o factores que son los
fertilizantes, el tipo de harina, el método de enseñanza y en el cuarto ejemplo se tienen
varias variables independientes o que están bajo el control del investigador y son
concentración de anhídrido, pH y tiempo de reacción.
También se puede distinguir que se van a observar cambios como son el crecimiento de la
planta, los aspectos nutritivos, el aprovechamiento y la succinación del almidón. En fin se
puede notar que éstos contienen los elementos que definen a un experimento.

En los siguientes ejemplos proporcione mentalmente cuáles son los factores, cuál la
variable respuesta y proponga algunos factores no controlables y controlables que pueden
presentarse en cada experimento.

1. Respuesta de diez selecciones de batata al nemátodo agallador Molidogyne


incognita.
En este experimento se evalúa la respuesta de los clones de batata UCV-2, UCV-4,
UCV-7, UCV-9, UCV-10, UCV-36, Catemaco, Isleña, Santa Catalina y Mariara que
crecen en envases plásticos que contenían suelo arenoso infestado con 6 huevos/cm3 de
M. incognita. El peso de las raíces y de la parte aérea de la mayoría de los clones se
redujo por la infección del nemátodo en comparación con las plantas testigo. Sin
embargo UCV-2, UCV-7 y Catemaco fueron resistentes.

2. Métodos de manejo para producir Amaranthus spp.


Se llevaron a cabo experimentos en campo para determinar el período de tiempo
adecuado para plantar el Amaranto. Los experimentos se condujeron en suelo arenoso,
específicamente: limo fino, suelo silíceo, suelo térmico y Plinthic Paleouult. Se utilizó
el Amaranthus tricolor genotipo RRC 241. Los tratamientos consistieron en diferentes
fechas de plantado los cuales se arreglaron en un diseño de bloques completos
aleatorizados con cuatro réplicas. Las fechas de siembra fueron abril 12, mayo 12,
junio 15, julio 14, agosto 15 y septiembre 14. Cada parcela consistió de cuatro filas de
6.1 longitud espaciadas por 90 cm. Las semillas se plantaron en las seis fechas
indicadas. Los cultivos se cosecharon de 40 a 44 días después de plantarlas y se les
midió el peso seco después de secar la planta a 70° en un horno de aire forzado.

3. Efecto del repaso en la retención de monosílabos.


Se trata de comprobar si el repaso es una variable decisiva para retener una lista de
palabras monosílabas de igual valor asociativo. Se establecen los siguientes niveles de
repaso (variable independiente A): A1 una sola presentación de la lista, A2 dos
7

presentaciones de la lista con idéntica tasa de presentación, A3 Tres presentaciones de la


lista, A4 cuatro presentaciones. Después de las correspondientes lecturas se pasa a una
prueba de retención y se contabiliza la cantidad de palabras recordadas correctamente.

Es importante observar que la aleatorización o asignación aleatoria de los


tratamientos a las unidades experimentales es una característica importante en los estudios
experimentales y que los distingue de los cuasiexperimentos. La investigación experimental
se caracteriza porque el investigador controla variables y la asignación aleatoria, en los
estudios observacionales no existe ni control del investigador sobre las variables ni
asignación aleatoria y en los cuasiexperimentos existe control del investigador pero no
asignación aleatoria. En estudios observacionales puede señalarse la asociación entre las
respuestas y los tratamientos y no se pueden hacer inferencias.

Es importante señalar que las verdaderas inferencias de causa-efecto sólo pueden obtenerse
de verdaderos experimentos y no tanto de estudios observacionales. Por ejemplo, si en una
fábrica los productos que salen de una máquina comienzan a salir defectuosos, con un
estudio observacional, podría suponerse que se debe a la máquina, al operador o a las
condiciones climáticas del sitio en el que se encuentra ubicada la máquina, pero si se realiza
el experimento de cambiar de máquina, probar con distintos operadores o cambiar de
ubicación la máquina dentro de la misma fábrica, podría llegarse a descubrir la causa de
porqué el producto sale defectuoso.

En resumen, Hicks define claramente un experimento como:

Estudio en el cual ciertas variables independientes se manipulan y se determina su efecto


en una o más variables dependientes. Los niveles de las variables independientes se
asignan al azar a las unidades experimentales en estudio.

Es importante señalar que los experimentos que se plantean con regularidad son
comparativos, es decir se interesan en comparar distintos tratamientos y muchas veces es
con el objeto de seleccionar al mejor o al que produce una respuesta dada. Sin embargo,
nuestro objetivo no debe limitarse a buscar al ganador, sino a realmente comparar los
tratamientos observando cuál es el efecto de cada uno de ellos en la respuesta. Un
tratamiento puede producir el mejor rendimiento pero puede ser de muy alto costo o puede
producir el más alto rendimiento, pero también el más variable.

Diseño de experimentos
Diseñar un experimento consiste en PLANEARLO de tal forma que se recolecten los datos
adecuados, los cuales serán analizados por métodos estadísticos que den como resultados
conclusiones válidas y objetivas (Montgomery, 1995).

Se deben planear de modo que las comparaciones estén lejos de un error sistemático, que
sean suficientemente precisos, que las conclusiones tengan un amplio rango de validez, que
el arreglo experimental sea tan simple como sea posible y que la incertidumbre de las
conclusiones sea calculable (Cox, 1958).
8

El papel de la estadística en el diseño experimental ha sido separar las diferencias


observadas en aquéllas causadas por varios factores y aquéllas debidas al azar.

Los objetivos de un experimento son:


1. Caracterizar a un proceso, es decir determinar cuáles variables son las que influyen
más en la respuesta. Construir un modelo matemático que relacione la respuesta con
las variables de entrada. Esto sirve para determinar no sólo cuáles variables influyen
sino también cuantificar los valores de la variable independiente que optimizan la
respuesta.
2. Optimizar. Determinar la región en la cual los factores importantes conducen a la
mejor respuesta posible. Supongamos que estamos interesados en mejorar la
producción de un proceso químico y deseamos saber en qué valores determinados
de tres variables la respuesta es máxima. De manera que no sólo se investigan
valores específicos de las variables, sino también las regiones comprendidas por
estos.
3. Diseñar un producto. Para la elaboración de un producto controlar las variables a
determinados niveles y se realiza el experimento para determinar con cuál
combinación de niveles de obtiene un producto acorde con las especificaciones.
4. Determinar las tolerancias de los componentes y sistemas. Se estudia un proceso
con los niveles altos y bajos de factores críticos en la respuesta y se determina
cuáles componentes tienen tolerancias más críticas.
Nota: Para una profundización leer el artículo “Experimental Design for product and
process design and development” Douglas C. Montgomery. The Statistician (1999). Vol. 48
part 2, pp. 159-177.
Y para profundizar respecto a las diferencias del DDE de Taguchi y el de Fisher leer el
artículo “Methodologies for Experimental Design: A Survey, Comparison and Future
Predicions” Kiang-Meng Tay and Clive Butler. Quality Engineering. 11(3) pp. 343-356.

Cobb (1998) considera que para diseñar un experimento y una vez que se haya definido el
problema con claridad hay que tratar de identificar las fuentes de variabilidad que pudieran
afectar en el experimento:
1. variabilidad debida a las condiciones de interés.
2. variabilidad debida al proceso de medición.
3. variabilidad debida al material experimental y al proceso.

Un buen diseño permitirá estimar la cantidad de variables debida a cada fuente.


En el experimento de Kelly, se utilizaron ocho hámsteres dorados, cuatro recibieron
fotoperiodo largo y cuatro fotoperiodo corto.
Las lecturas de la enzima fueron.

[] (mg/l) en los corazones de 8 hámsteres


Fotoperiodo largo. 1.49 1.53 1.56 1.79 x  1.59 Rango 1.49-1.79
Fotoperiodo corto 1.39 1.49 1.25 1.38 x  1.32 Rango 1.25-1.49
9

Aparentemente hay diferencia ya que los promedios difieren, y vemos que hay mucha
variabilidad 0.3 y de 0.24. Se necesita estimar cuánto de la diferencia entre promedios es
debido a la longitud del día y cuánto es debido a otras fuentes.
Variabilidad de las condiciones de interés- variación del fotoperíodo.
Es decir la fuente de variación que si se quiere y se estima el efecto del fotoperiodo, para
elegir el órgano donde se medirá la enzima. La concentración de la enzima depende del
órgano que se mida. Kelly decidió estudiar dos órganos: corazón y cerebro. Se preguntó
¿hay diferente en el cerebro y corazón de los hámsteres? Ella sabe que en el cerebro
concentración es mayor. La longitud del fotoperiodo afectará la concentración de la enzima
del mismo modo en el cerebro y en el corazón. Es de esperar que debido a que tienen
distintas funciones, el cerebro y el corazón se comporten distinto cuando están listos para
invernar. Es decir evalúa si existe interacción, ¿el efecto del fotoperíodo depende del
órgano donde se mide la enzima?
Días largos vs. Días cortos.
Cerebros vs. Corazones.
La otra variabilidad es en la respuesta:
Cuando mides dos cosas bajo las mismas condiciones nunca obtienes un número idéntico.
Nuestro experimento debe permitirnos estimar el tamaño de la diferencia debido a tal
variabilidad inevitable en el proceso de medición.
Para determinar la concentración de la enzima, Kelly tuvo que sacrificar al hámster, separar
el tejido y usar una metodología o secuencia de pasos para suspender la enzima en un
líquido y, como paso final, medir la concentración de la enzima usando un
espectrofotómetro para medir la cantidad de luz absorbida por partículas suspendidas. En
cada etapa de todo el experimento habrá cosas que producirán diferencias. Comenzando por
la disección, este es un proceso difícil, particularmente por que se desea el tejido "puro", a
la hora de leer en el equipo, aún calibrándose, en cada corrida de mediciones se introducirá
la variabilidad cada vez que se calibre el espectrofotómetro.

3.- Variabilidad en el material experimental.


Es inevitable, difícilmente se encuentran clones de hámster idénticos en todo, incluso en su
genética. Algunos tendrán más concentraciones de la ATP-asa.

En el experimento de Kelly podemos atar algunas fuentes de variabilidad.

1) En las condiciones de interés:


Longitud del día: largo vs. corto.
Órgano: corazón vs. cerebro.
Al decidirse por estos dos órganos se pregunta también ¿hay diferencia de la
concentración de la enzima entre el cerebro y el corazón? Esta pregunta es muy obvia,
Kelly ya sabe que la actividad nerviosa es más alta en el cerebro, pero puede
preguntarse ¿La duración del día puede afectar la concentración de la enzima de la
misma manera en el cerebro y el corazón?

2) Proceso de medición:
- Preparación en suspensión de la enzima.
- Calibración del espectrofotómetro.
10

3) En el material experimental:
Diferencias biológicas entre hámsteres.
Diferencias de ambiente y comportamiento.

Una vez que se ha planeado la medición, las condiciones o tratamientos y el material te


preguntas ¿Cómo asignar los tratamientos a las unidades experimentales?

Guías para una investigación experimental


1. Reconocimiento y planteamiento del problema. Lo primero es reconocer que se
tiene una dificultad. No es fácil darse cuenta de que un problema que requiere
experimentación existe. Es necesario establecer claramente los objetivos del
experimento. Requiere de un equipo multidisciplinario y ya juntos obtener una lista
reducida de posibles causas.
2. Seleccionar la variable respuesta. Especificar la variable a ser medida. Elegir
aquélla en la que es más visible el efecto o la que proporcione información útil
acerca del proceso bajo estudio. Una variable dependiente ideal es continua, fácil y
exactamente medible y directamente relacionada con la capacidad de detección de
las personas. Los resultados del experimento, medidos como la variable respuesta,
son resultados de procesos aleatorios por lo que la variable respuesta es una
verdadera variable aleatoria. Es importante conocer la forma de su distribución pues
esto generalmente dicta qué prueba estadística puede utilizarse para el análisis.
También es importante conocer el instrumento de medición de la variable respuesta
y la precisión del instrumento para hacer las mediciones.
3. Especificar los factores y los niveles. Especificar las variables independientes o que
están bajo el control del investigador, así como los valores de las variables que se
van a estudiar. Los factores a ser utilizados deben se medibles (cuantitativos) o
distinguibles (cualitativos). Los primeros tienen niveles que varían por categoría y
los últimos tienen valores o niveles que corresponden a cantidades o mediciones.
Los factores o variables independientes deben ser controlables. Para elegir los
factores a estudiar puede elaborarse un diagrama de Causa-Efecto o diagrama de
Ishikawa (hueso de pescado). En este diagrama la variable dependiente se escribe a
la derecha con una flecha gruesa señalándola. Cada factor principal se identifica y
tiene una flecha ramificada señalando a la flecha gruesa principal. Los factores que
más influyen tiene flechas pero más delgadas que la principal. Los huesos
principales o ramificaciones principales corresponden a las máquinas, el material, el
método, el hombre y el ambiente. De cada ramificación parten otras que
corresponden a cada categoría. Con este diagrama, el equipo multidisciplinario
descarta y selecciona aquéllas variables independientes que pueden influir en el
cambio que se ha observado de la respuesta. El número de niveles de cada factor o
variable independiente debe determinarlo las necesidades del investigador. Algunas
veces los niveles de un factor son predeterminados y no se pueden cambiar, y en
otras ocasiones el número de niveles es opcional. Todo lo que afecta el valor de la
respuesta es un factor potencial a ser estudiado e incluye aquéllos que pueden
controlarse así como los que están fuera de control, tales como las fluctuaciones
diarias o diferencias en contenido en suelo de parcela a parcela. Los niveles de éstos
no pueden ajustarse a valores específicos. Cada nivel representa un efecto particular
11

del día o de la parcela y se considera aleatorio. Es importante recalcar que para


obtener conclusiones lo más específicas posibles, es necesario un estricto control de
aquellas variables controlables de modo que se minimicen las variaciones aleatorias,
con esto se obtendría precisión en el experimento.
4. Definición del espacio inferencia. El investigador debe tomar decisiones en los
límites de inferencia. Estos límites dentro de los cuales se aplican los resultados se
llama espacio inferencia. Si el factor es fijo, es decir si se estudian determinados
niveles del factor, el espacio se limita a los niveles estudiados, y si el factor es
aleatorio, es decir se toma una muestra de niveles de una población grande para
conocer la variabilidad de niveles, las conclusiones se pueden extrapolar a la
población de niveles de la cual se tomó la muestra.
5. Selección aleatoria de las unidades experimentales. La unidad experimental se
refiere al tipo de material experimental que recibe la aplicación de los varios
factores y que es representativo del espacio inferencia deseado. Una vez que se han
seleccionado las unidades por el experimentador; debe seleccionarse aleatoriamente
un número suficiente de unidades. Es necesaria la selección aleatoria para proteger
contra cualquier sesgo en el experimento. El número de unidades depende del
tamaño del experimento y del previo conocimiento del error estándar de las medias.
Además del número de réplicas y la selección del orden de los ensayos
experimentales, es necesario determinar cómo será la aleatorización de los
tratamientos a las unidades experimentales. La aleatorización permite repartir
homogéneamente entre todas las unidades experimentales todas aquellas variaciones
que no pueden controlarse. También deben seleccionarse aleatoriamente el orden en
el que se llevarán a cabo los ensayos para evitar tendencias que se presenten al
realizar los primeros (con muchas variaciones) y los últimos (realizados con más
precisión).
6. Arreglo o bosquejo del diseño. Idealmente queremos que las unidades
experimentales sean afectadas únicamente por los factores de nuestro interés. Si
existen otros presentes, deseamos minimizar su efecto con el objeto de ver
claramente el efecto de nuestros factores. Esto incluye factores desconocidos por el
experimentador y aquellos no controlados. Incluyen también tendencias sistemáticas
en las unidades experimentales, factores que cambian con el tiempo y el espacio.
Los factores que pueden controlarse por el experimentador deben mantenerse a un
nivel fijo con el espacio inferencia limitado a ese nivel solamente. Para minimizar el
efecto de factores desconocidos hay que asignar aleatoriamente las combinaciones
de tratamiento y aleatorizar el orden o ubicación de los tratamientos. Como
resultado de la aleatorización completa las estimaciones de los parámetros deben
ser insesgados y las pruebas de significancia deben ser válidas. Desafortunadamente
a veces no es posible la completa aleatorización y si la variable se puede controlar a
valores fijos y se desea eliminar su efecto, se usa el control directo a través de un
diseño de bloques y si no un control indirecto manejando a esta variable como
covariable en el análisis de covarianza.
7. Desarrollo de un modelo matemático. Esto se realiza antes de la ejecución del
experimento. El modelo indica la relación que guarda la variable respuesta con
todas las fuentes de variación. El modelo matemático mostrará a la variable
respuesta como una función de los factores que se estudian y también mostrará las
restricciones que se pueden poner a la aleatorización y también contiene el término
12

que incluye las fuentes de variación no controlables o error. Por tanto, contiene
información de todos los factores y de sus niveles. Los factores se denotan con
letras griegas y sus subíndices corresponden a los niveles.
8. Correr un experimento piloto. El correr un experimento con unas pocas
observaciones, permitirá practicar el procedimiento experimental, identificar los
problemas que pudieran presentarse en el experimento grande, para checar la lista
de pasos a realizar y para calcular el error experimental que servirá en el cálculo del
tamaño de muestra.
9. Evaluación Preliminar del diseño. El investigador desarrollará una tabla con todas
las fuentes de variación, es decir con las etiquetas de los factores, sus errores de
restricción, sus interacciones, grados de libertad , sumas de cuadrados, cuadrados
medios esperados etc. La tabla indicará no sólo los factores a probar sino los
estadísticos de prueba correspondientes. Todo esto debe considerarse antes de
obtener algún dato. Así notará cuáles se pueden probar directamente, la cantidad de
información disponible para estas pruebas y las suposiciones necesarias para hacer
pruebas conservadoras. Asimismo debe ver si tiene sentido en la vida práctica.
10. Rediseñando el experimento. Considerando lo anterior, se planteará un nuevo
diseño y se comparará la tabla anterior con la actual.
11. Recolección de los datos. Una vez que se ha determinado si el diseño es el más
adecuado para el experimento, éste puede llevarse a cabo para finalmente obtener
los datos. Antes de realizarlo es conveniente hacer un experimento piloto para
obtener información de la consistencia del material experimental, para comprobar
el sistema de medición, para tener una idea del error experimental y para revisar la
realización del experimento. Se requiere de un equipo organizado y muchos
observadores. El éxito de la investigación depende de la validez de todos los datos
obtenidos. Una de las mejores maneras de recolectarlos es aquella en la que el
estadístico diseñe una forma de entrada de datos el cual sería llenado por el
inspector y después verificado por una persona que lleve a cabo el experimento. La
forma debe ser fácil de usar, entendible y a prueba de malas interpretaciones.
12. Analizando los resultados. El análisis de los resultados es responsabilidad del
estadístico y deberán emplearse métodos estadísticos que garanticen la objetividad
de las conclusiones. Se servirá de programas de cómputo, pero es su conocimiento
del diseño estadístico empleado el que le servirá para interpretar las salidas de
cómputo. Es importante considerar que en muchos programas hay que especificar si
existe un factor aleatorio porque las pruebas estadísticas cambian si existe uno
aleatorio en el diseño. Actualmente existe la opción de que uno elija los cocientes
de sus pruebas estadísticas, sin tener que especificar que se trata de un factor
aleatorio.
13. Conclusiones. Una vez interpretados los resultados por el estadístico y con la ayuda
de un equipo multidisciplinario se establecen las conclusiones. Montgomery sugiere
realizar corridas de seguimiento o pruebas de comprobación para validar las
conclusiones del experimento.

Ejercicio
Elige un artículo de investigación del área e identifica los siguientes puntos:
a) Problema
b) Hipótesis de investigación
13

c) Objetivo del estudio


d) Los tratamientos
e) Las unidades experimentales
f) La variable respuesta
g) La aleatorización y el diseño experimental
h) La hipótesis estadística y los análisis estadísticos
i) Las conclusiones y la confiabilidad.

Reporte técnico de una investigación experimental


Una vez realizada la investigación es importante la comunicación de la misma. A
continuación se presenta una sugerencia de los puntos que debe contener el mismo y que se
emplea en el curso como guía de los trabajos individuales.

El trabajo debe contener:


1. Título del Trabajo. Que contenga el menor número posible de palabras y que describa
adecuadamente el contenido. Tiene que ser lo más específico y claro posible. Escribirlo
en una hoja separada que incluya el nombre del autor y la fecha.
2. Resumen. Un breve resumen que no ocupe más de media cuartilla, debe informar al
lector de que se trata el reporte. No debe usarse símbolos ni números y debe contener el
menor número de palabras técnicas posibles. Debe escribirse en pasado, consiste en la
definición del problema, cómo se analiza y los resultados más importantes encontrados.
3. Introducción. Su fin es suministrar suficientes antecedentes para que quién lo lea pueda
comprender y evaluar los resultados del estudio sin necesidad de consultar
publicaciones anteriores sobre el tema. Debe escribirse en presente y debe: a) exponer
con toda claridad la naturaleza y el alcance del problema investigado, b) revisar las
publicaciones pertinentes para orientar al lector. Es realmente una versión extendida del
resumen. Es importante que no exceda dos cuartillas. La introducción también contiene
la pregunta de investigación y el objetivo del trabajo. Formule una hipótesis o respuesta
tentativa a la pregunta de investigación, si se tienen las bases suficientes para
proponerla, en caso contrario no la formule. Generalmente es una propuesta de la
relación que hay entre las variables independientes y que quedan bajo su control, y la
variable dependiente.
4. Metodología. Debe escribirse de tal modo que la investigación sea repetible. Consiste
en describir con todo detalle a) MATERIAL Y PROCEDIMIENTO: el material y
equipo que se empleó para la realización de la investigación, y el procedimiento en el
laboratorio. Se redacta en tiempo pasado. Y se redacta con tal detalle –paso a paso- que
cualquiera pueda entender y seguir. B) MÉTODO DE ANALISIS ESTADISTICO que
se utiliza y la justificación del método. C) TRATAMIENTOS, NIVELES DE LOS
FACTORES Y VARIABLE RESPUESTA: Defina con sus palabras quiénes son los
tratamientos, los niveles de los factores, la variable respuesta y sus unidades de
medición. D) VARIABLES EXTRAÑAS: especifique las variables extrañas que
pueden contribuir a variaciones en la respuesta y determine cómo minimizará su efecto.
(ya sea manteniéndolas constantes, eliminándolas, etc. Y especifique cuáles de ellas no
va a poder controlar y quedarán dentro del error. E) UNIDADES EXPERIMENTALES:
especificar las unidades experimentales que se utilizarán en el estudio y describir sus
características con detalle. F) ESPACIO INFERENCIA: especifique el espacio
14

inferencia, es decir las unidades y los tratamientos a los que van a aplicarse las
conclusiones. Es importante que el experimento sea descrito con tal detalle que hasta las
posibles fuentes de error sean consideradas de antemano.
5. Resultados. Esta sección nos dice lo que encontró. Expresar los resultados en forma
tabular. Utilizar gráfica si es necesario. Tablas como gráficas deben tener títulos, y las
variables deben expresarse con sus unidades de medición. Discuta todas las fuentes de
error y describa cómo podrían afectar los resultados. Muestre también el proceso de
aleatorización de los tratamientos a las unidades experimentales y del orden de las
corridas experimentales.
6. Análisis de resultados: Esta es la parte más importante a evaluar en esta asignatura.
Presente estadísticos de resumen con su interpretación (análisis exploratorio de los
datos) Realice el análisis de varianza completo desde la formulación del modelo hasta
la potencia de la prueba. Proporcione las interpretaciones en términos del problema.
7. Discusión y Conclusiones. Trate de presentar los principios, relaciones,
generalizaciones que indiquen los resultados; no recapitular resultados. Para hacer
generalizaciones se tiene que tener en cuenta si las unidades experimentales son
representativas de la población, es decir hay que tomar en cuenta el espacio inferencia.
Señale excepciones o faltas de correlación, delimite aspectos no resueltos. Muestre
cómo concuerdan sus resultados con los de la bibliografía consultada o con la hipótesis
que propuso, formule conclusiones lo más claramente posible. Igualmente proporcione
ideas para un estudio futuro con el objeto de mejorar el actual.
8. Referencias. Debe incluir el listado de libros o artículos de revistas. Dentro del texto
Ud. puede emplear el sistema Harvard (Nombre, año) y de las referencias completas en
esta sección como se muestra a continuación:

Chapman, M & Mahon, B (1986), Plain Figures, HMSO, London.

Fowler, H. W. (1983), Dictionary of Modern English Usage (2nd edition revised by Ernes
Gowers), Oxford University Press, Oxford and New York.

Gowers, Sir Ernest (1973), The Complete Plain Word (2nd edition revised by Sir Bruce
Fraser), Penguin Books, Harmondsworth, Middlesex.

Respecto a la presentación el reporte debe ser atractivo a la vista; debe ser claro y legible.
Trate de usar un procesador de textos.

Paginación. Procure numerar todas las páginas.


Secciones. Todas las secciones del programa deben marcarse con negritas. Las gráficas
deben tener título y números. Procure después de cada gráfica que incluya su reporte
interpretar lo más concienzudamente posible. Las escalas deben ser sensibles y deben
indicarse las unidades de cada eje.
Respecto a las tablas también deben numerarse, titularse, Procure que los puntos decimales
queden alineados. Las filas y columnas necesitan etiquetas.
Para la realización del trabajo puede emplearse el paquete estadístico Statgraphics; no caiga
en la tentación de poner en el reporte resultados repetidos, por ejemplo la tabla de análisis
de varianza que Ud. escribió en su procesador de textos no hay que duplicarla con la que
15

proporciona la salida de cómputo. En lugar de escribirla en el procesador puede cortar y


pegar dentro de su texto la salida del programa.
Respecto al estilo se sugiere:
1. Ser breve, usar palabras cortas.
2. Evite hablar en primera persona. Sea impersonal; “se tomó la tabla de números
aleatorios y...”
3. Evite errores de dedo al escribir y por supuesto los errores ortográficos.
4. Trate de escribir oraciones completas, no por ser breves envíe telegramas.

Definiciones y Conceptos Básicos


Tratamiento. Es un conjunto de condiciones bajo las cuales se observa una unidad
experimental para ver su efecto. También puede definirse como una combinación de
variables independientes cuyo efecto se quiere evaluar sobre las unidades a las que se les
aplicó. Ejemplos, la marca de fertilizante, la dosis de un medicamento, el método de
enseñanza, la temperatura de horneado, etc.
Cuando se estudia únicamente el efecto de una variable independiente definiremos
tratamientos a los valores de la variable que se estudia.. A los valores que asumen las
variables independientes se les llama niveles, pero en el caso de un factor, se les llama
tratamientos. En un experimento que consistió en evaluar distintas condiciones de
polinización y autopolinización en el número de yemas vacías de los pinos navideños en el
estado de Hidalgo, los tratamientos consisten en las distintas condiciones de polinización:
sin polinizar y sin protección, autopolinizados y sin protección, polinización libre y sin
protección, polinización controlada y sin protección, sin polinizar y con protección, por
mencionar algunos de los ocho tratamientos.
Cuando se estudia el efecto de más de una variable, un tratamiento es entonces la
combinación de los niveles de los factores. Si se estudia el efecto de la dosis de un
medicamento en las tasas de aprendizaje, si se prueban 5 dosis cada una de ellas es un
nivel de la variable DOSIS y a su vez es un tratamiento. Si se estuviese estudiando el efecto
del tipo de droga y las dosis de las drogas y se está estudiando dos tipos de droga cada una
con 5 dosis, un tratamiento o condición de tratamiento viene definida por una combinación
de una clase particular de droga y una dosis particular. Por lo tanto, las condiciones de
tratamiento son definidas por combinaciones de niveles de las variables independientes.
Con tales diseños es posible evaluar interacciones, es decir es posible evaluar la acción
simultánea de ambas.
En un experimento en el que se compara la tasa de crecimiento de semillas de frijol con
diferentes programas de humedad y luz, los tratamientos consisten en los distintos
programas humedad-luz.
Un experimento que consistió en evaluar distintos niveles de hidratación (-0.60, -0.81, -
1.21, -1.72) y dos variedades de pepinos (Variedad Hatuey y variedad Japonés) los
tratamientos consisten en las combinaciones de los niveles de los dos factores (Sánchez,
Jorge et al, 1997)
En un experimento de punto de ebullición del agua con diferentes concentraciones de sal,
los tratamientos son las diferentes concentraciones.
En un experimento que compara tres diferentes métodos de enseñanza, los tratamientos
consisten en los tres métodos de enseñanza.
16

En un experimento se compara la actuación de los sujetos o unidades


experimentales en las diferentes condiciones de tratamiento e intenta atribuir diferencias en
el comportamiento a las características que son distintos a lo largo de los tratamientos.
Supuestamente lo que se pretende es comparar los tratamientos, de modo que se debe
procurar que los otros factores que pudieran afectar la respuesta pero que no son de nuestro
interés se mantengan a niveles constantes, y aquello imposible de controlar quedará dentro
de la variabilidad aleatoria del experimento y dentro del término de error.

La variable independiente está sujeta al control del experimentador y es


independiente de los sujetos que sirven en el experimento. A las variables independientes
también se les conoce como FACTORES.

Unidad experimental o parcela.


La unidad básica de observación o el objeto de estudio en el experimento es la unidad
experimental. Es la unidad a la cual se aplica el tratamiento y que es representativa del
espacio inferencia deseado. El investigador debe seleccionar aleatoriamente a las unidades
experimentales para evitar sesgos. Ejemplos son: un animal, 10 pollos de corral, media
hora. Las unidades observacionales son aquéllas en las que se realizan las mediciones y
muchas veces las unidades experimentales son las mismas que las observacionales; cuando
distintas parcelas que contienen plantas constituyen las réplicas del diseño, y a las parcelas
se les aplica el tratamiento, las unidades experimentales son las parcelas y las
observacionales son las plantas en las que se realizan las mediciones.
Cuando se toman unidades observacionales que son parte de una unidad experimental como
réplicas, realmente lo que se tiene son pseudorréplicas; éstas no son independientes como
por ejemplo tomar a cada cerdito de un corral como réplica cuando el alimento se le aplicó
al corral y no a cada cerdito de modo individual. Un tipo de pseudorréplica se presenta
cuando a una misma unidad experimental se le mide varias veces a lo largo del tiempo, sus
mediciones no son independientes sino que se autocorrelacionan en el tiempo,
pseudoreplicación temporal.
En experimentos agrícolas generalmente se usa una parcela como unidad experimental. El
tamaño y localización de la parcela puede afectar los hábitats de crecimiento de la planta
particular bajo consideración. ¿Qué tipo de unidad experimental empleará? Depende de la
investigación. ¿Cuántas? Depende de la sensibilidad deseada de la prueba, es decir que tan
potente resulta la prueba para un tamaño de muestra dado.

Factores
Son las variables que se controlan y cuyo efecto se mide, es decir, las variables
independientes. Su efecto se mide sobre las unidades experimentales.
Las variables independientes deben ser manipulables a niveles del interés del investigador.
Los niveles pueden ser: varias clases o tipos (cualitativo) o varias magnitudes o cantidades
(cuantitativos).
También es de interés el rango de la variable independiente a ser incluida en el
experimento, especialmente si se trata de estudiar el efecto de un factor cuantitativo. El
rango debe ser tal que sí se puedan observar cambios en la respuesta al cambiar de nivel.
Debe ser un rango completo de variación así como condiciones intermedias para
proporcionar una idea de la naturaleza de la relación de la variable respuesta y la
independiente. Si es un factor cuantitativo y se quiere saber la relación que guardan las
17

variables dependiente e independiente es importante el espaciamiento entre los niveles de


un factor, para poder evaluar sus efectos lineal, cuadrático etc. Algunos ejemplos de
factores cuantitativos son la cantidad de hidratación, porcentaje de humedad, temperatura,
velocidad del procesador, etc.
Si el factor es cualitativo, se trata de comparar los distintos tipos o valores de la variable.
La manipulación de factores cualitativos se puede ver como una colección de experimentos
pequeños dentro del contexto del gran experimento. Algunos ejemplos de factores
cualitativos son la marca de fertilizante, tipo de procesador, sexo, tipo de caldo de cultivo,
variedad de planta, etc.
También es importante determinar si se trata de factores fijos o de factores aleatorios. Si
son fijos estamos interesados en esos niveles en particular del factor, así como estamos
interesados en diferencias entre medias de tratamientos, y las conclusiones solo podrán
aplicarse a esos niveles particulares solamente. Si son aleatorios estamos interesados en la
variabilidad de los niveles del factor más que en las diferencias entre medias, las
conclusiones podrán extrapolarse a la población de niveles de la que se extrajo la muestra.
Dependiendo de si el factor es fijo o aleatorio, las hipótesis serán respecto a medias o a
varianzas, y si se trata de efectos fijos se pueden proponer hipótesis para comparar medias
particulares o dado que ya se rechazó la hipótesis de igualdad de medias explorar las
posibles comparaciones entre ellas para investigar si son significativas o no. Si el factor es
aleatorio es importante estimar los componentes de varianza y su contribución a la
variabilidad total.

Variable respuesta.
Una vez que hemos propuesto una hipótesis hay que detallar el estudio para
recolectar los datos. Se debe decidir el aspecto particular del fenómeno que observaremos y
qué mediciones se harán, qué mediciones capturan el fenómeno más exactamente. Un
experimento que involucra una simple variable dependiente es un experimento univariado
aunque se esté estudiando más de una variable independiente. Para elegir la variable
respuesta se debe elegir aquélla que sea la más sensible a las condiciones de tratamiento.
La medición, esto es la asignación de etiquetas o números a los atributos de los
objetos o eventos, es un aspecto muy completo. Se supone que es deseable que los valores
de la variable dependiente tengan poca variabilidad de sujeto a sujeto (condiciones
genéticas parecidas en las semillas, por ejemplo). Esto incrementará la precisión en las
estimaciones y contribuirá a la potencia estadística para cualquier tamaño de muestra.
También la variable dependiente se distribuye normalmente ya que muchos procedimientos
estadísticos paramétricos inferenciales suponen normalidad. Es deseable que la variable
respuesta sea cuantitativa y continua.

Variables suplementarias.
Existen otras variables independientes que pueden afectar a la respuesta pero que no son de
interés del investigador, se les llama suplementarias o Nuisance. Es necesario controlar
estas variables para incrementar la precisión con la cual se pueden estimar los efectos de la
variable independiente o para remover el sesgo de esas estimaciones. Hay dos formas de
controlarla: Directamente (experimentalmente, a través del bloqueo), indirectamente (como
covariables) o si no se pueden controlar quedan comprendidas dentro del término de error.
También están incluidas aquéllas que pueden afectar a la respuesta, que no se pueden
controlar a niveles fijos como bloques, ni mediante control indirecto (como covariable),
18

pero sí se pueden mantener a un único valor o nivel; las conclusiones se limitarían a esos
niveles estudiados. Por ejemplo si estamos estudiando el efecto de la dieta en el incremento
de peso de los cochinitos, y se consiguieron unidades experimentales similares (corrales
con cerditos de aproximadamente el mismo peso inicial) y se sabe que la raza puede
afectar, pueden elegirse cerditos de la misma raza y las conclusiones se limitarán a esta
raza, no podrán hacerse extrapolaciones a otras.

Réplica.
Es la repetición del experimento básico. Es decir una réplica contiene todas las
combinaciones de tratamiento del experimento. La réplica permite darnos una idea de que
un tratamiento es diferente a otro. Mead proporciona un ejemplo en el que son dos
productores de cierto cultivo. El agricultor A produce 24.1 y 24.2 kilogramos del cultivo y
el agricultor B produjo 21.4. Gracias a la réplica se puede uno dar cuenta de que existe
diferencia y de que ésta es grande.
Para representar a una población se requiere de réplicas, ya que una unidad no da idea de
cómo es la población. Debido a que no todos los elementos de una población son iguales,
requerimos de réplicas que nos indiquen la variabilidad de la población. Mientras más
variable es la población, se requerirán más réplicas para adecuadamente representarla. No
hay que caer en la tentación de tratar una repetición o una pseudorréplica como verdadera
réplica.
Es importante distinguir entre réplica y repetición, por ejemplo si se asignan 10 plántulas a
cada tipo de fertilizante el resultado consiste en 10 mediciones independientes de la altura
final de plantas sometidas a un fertilizante, esto es son 10 réplicas. Pero si a una planta se le
lee la altura 10 veces entonces son repeticiones de una lectura, son mediciones repetidas y
no son independientes. La variación en las mediciones repetidas refleja la variabilidad en el
proceso de medición y la variación entre réplicas refleja la variabilidad de las unidades
experimentales sometidas al mismo tratamiento.
Algunas veces uno está tentado a partir el campo en réplicas o parcelas más pequeñas, no
confundir. Por ejemplo suponga que se desea evaluar el efecto de ciertas dietas en el
incremento en peso del puerco. Suponga que desea comparar 4 dietas en el incremento en
peso y la unidad experimental a la que se aplicó el tratamiento son los corrales, ya que al
corral completo con sus 5 puerquitos se les da la dieta como a un todo. Suponga que hay 8
corrales de modo que cada dieta se puede aplicar únicamente a dos corrales. De este modo
hay únicamente dos réplicas por tratamiento. La tentación es usar como réplicas a los
puerquitos individuales, así tendríamos 10. Esto sería incorrecto por las siguientes razones.
1) el puerquito no es la unidad experimental, sino que es el corral. De otro modo habría que
alimentar al cochinito en forma individual. 2) La variación entre cochinitos dentro de un
corral es muy similar a la variación en diferentes corrales con el mismo tratamiento. Y no
hay forma de evaluar la variación dentro del corral por lo que no se puede usar para
comparar las dietas.
Las réplicas permiten al experimentador tener una estimación del error experimental.
Esta medición se convierte en la unidad básica de medición para determinar si las
diferencias observadas en los datos son estadísticamente significativas. El uso de réplicas
también permite:ejercer control sobre la varianza del error, aumentar el espacio inferencia
y,mejorar la precisión del experimentoes decir, a medida que el número de repeticiones
aumenta, las estimaciones de las medias son más precisas.
19

Error experimental.
Es una medida de la variación existente entre las unidades experimentales tratadas en forma
similar. Es la variación no controlada – ni como variable independiente, ni como
suplementaria controlada- entre las unidades experimentales sometidas al mismo
tratamiento.
Se pueden distinguir varias fuentes de error:
1. La variabilidad inherente al material experimental al cual se aplican los
tratamientos.
2. La falta de uniformidad en la realización del experimento.
3. La variabilidad debida a la medición de la variable respuesta.
4. No es posible reproducir las condiciones del tratamiento exactamente de una unidad
a otra.
5. Factores externos que puedan influir en las características medidas.

¿Cómo controlar el error?


a. Aumentar la magnitud del experimento, ya sea más unidades experimentales o más
tratamientos.
b. Refinar la técnica experimental.
c. Usar material experimental más homogéneo.

Un investigador en problemas educativos intenta probar la efectividad de un método para la


identificación verbal de palabras escritas para enseñar a niños de primer grado. A tal efecto
planificó un diseño de dos grupos para comparar el nuevo método de enseñanza (A1) con
uno mucho más tradicional (A2). El investigador probó ambos métodos en dos aulas
distintas, de modo que a un primer grupo le aplicó el método A1 y al otro grupo el A2. Al
término del curso aplicó una prueba a los niños de ambos grupos para determinar su
eficiencia en la identificación verbal de las palabras escritas.

El problema anterior tiene el inconveniente que los grupos si no son parecidos entre sí,
estarán confundidos con los métodos de enseñanza. Una mejor manera de probar ambos
métodos hubiera sido juntar a los dos grupos en uno solo y seleccionar al azar los miembros
de cada grupo, y asignar al azar los métodos a cada grupo.

Otro ejemplo aplicado en educación (Arnau Grass) se pretende estudiar la efectividad de


tres métodos de enseñanza sobre el aprendizaje de las matemáticas. Después de haber
aplicado los tres métodos se pasa a cada uno de los sujetos una serie de diez problemas por
resolver. Esto constituye una medida de ejecución para estimar la efectividad de los
métodos de enseñanza. Ahora bien. Se considera que una de las posibles variables extrañas
capaz de contaminar dichos resultados es el nivel intelectual de los sujetos. Con objeto de
controlar dicha variable, mediante el diseño se aplica un diseño de bloques donde los
bloques lo constituyen grupos con distintos CI (de 94, 96, 98, 100 y 112).

Principios básicos del diseño de experimentos.


Aleatorización.
20

Es la piedra angular del diseño de experimentos. Entendemos por aleatorización la


ubicación o asignación aleatoria de las unidades experimentales y el orden en el cual
ocurren los ensayos individuales.
La aleatorización permite minimizar las variaciones debidas a espacio, tiempo, entre
diferentes unidades experimentales de manera que aseguren que cualquier patrón de
variación que pueda existir en el material experimental no cause error sistemático en las
comparaciones de los tratamientos. Todas las variaciones que no se puedan controlar ni
medir y que proceden de distintas fuentes quedan incluidas en el término de error y la
aleatorización permite que esos errores se distribuyan uniformemente o imparcialmente de
manera que influyen poco en el error.
La aleatorización permite que se cumpla el supuesto de independencia. Por ejemplo, al
aleatorizar el orden de las corridas puede contrarrestarse el efecto que puede ejercer el
cansancio o la experiencia en la realización del experimento.
Nelson Lloyd (1996) proporciona algunas consideraciones importantes de la aleatorización
en la experimentación:
i. Si se va a llevar a cabo una prueba estadística en un experimento, tal como la F o la
t, es importante saber que los valores críticos de esa prueba vienen de distribuciones
que derivan de las leyes de probabilidad. Estas leyes están basadas en la suposición
de que el error experimental es el resultado de un proceso aleatorio. Esta suposición
puede asegurarse aleatorizando el orden de los ensayos.
j. Generalmente se supone que los errores en un experimento son independientes uno
de otro. Pero es común que exista correlación entre errores cuando hay tendencias
en el tiempo y en el espacio. Cuando se emplea el estadístico t de Student se supone
que los errores son independientes. La aleatorización viene a rescatar aquí
rompiendo la correlación entre los errores, de manera que uno puede proceder con
la consideración de que se cumple la independencia.
k. Finalmente, en cualquier experimento hay siempre factores que pueden afectar el
resultado pero que no están incluidos en el diseño porque o son muy difíciles de
controlar o porque son desconocidos. Tales factores producen sesgo. Por supuesto
este sesgo es desconocido en magnitud y en signo. Al introducir la aleatorización en
el experimento los factores bajo estudio pueden protegerse de estos sesgos. La
aleatorización permite pues que estos sesgos sean parte del error experimental.

Bloqueo.
Es una técnica de control estadístico y se usa para incrementar la precisión de un
experimento. Un bloque es una porción de material experimental que es más homogéneo
que la totalidad. La técnica de bloqueo se utiliza cuando existen variables que afectan a la
variable respuesta y que no interesa investigar; se puede controlar a determinados valores
constituyendo los bloques. A cada bloque se le asignan al azar los tratamientos de modo
que es posible averiguar su efecto sin importar esa otra variable que se maneja como bloque
reduciendo así la magnitud del error e incrementando la precisión del experimento. En los
diseños de bloques en muy común utilizar como factor de bloqueo, la proximidad de las
parcelas: parcelas vecinas son similares en fertilidad, tipo de suelo, etc.; las características
físicas de las unidades experimentales: individuos de una misma camada son más similares
entre sí que los de diferente camada.; el tiempo: las determinaciones realizadas en un día
por ejemplo son más similares entre sí que las realizadas en distintos días; los lotes de
materia prima: se puede realizar una réplica del experimento con un solo lote, y abrir un
21

nuevo frasco o lote del reactivo para realizar otra réplica del experimento; el personal que
realiza las determinaciones: cada técnico puede realizar una réplica del experimento y no
cada técnico un solo tratamiento pues si hay diferencias entre tratamientos no se sabrá si
esta diferencia es real o a que los técnicos aunque realizan la misma determinación con la
misma metodología la realizan en forma diferente.

Diseño equilibrado o balanceado: es el diseño en el que todos los tratamientos son


asignados a un número igual de unidades experimentales.

Ortogonalidad
Ortogonalidad de factores: dos factores FI y FJ con I y J niveles, respectivamente, son
ortogonales si en cada nivel i de FI el número de observaciones de los J niveles de FJ están
en las mismas proporciones. Esta propiedad permite separar los efectos simples de los
factores en estudio.

Control local
Se refiere a las acciones que se realizan para controlar o disminuir el error experimental.
Estas acciones incluyen:

 El refinamiento de la técnica. Se refiere a que antes de correr un


experimento es necesario elegir aquel método que produzca las
observaciones más precisas y exactas. Es importante estandarizar el método
y asegurarse de que los equipos estén bien calibrados, el personal técnico
que realice el experimento esté calificado para esa tarea, evitar en lo posible
variaciones ajenas al experimento. Es responsabilidad del investigador
minimizar en lo posible la variabilidad en los resultados controlando la
técnica.
 Selección de unidades experimentales. Si se encuentra el número suficiente
de unidades experimentales lo más homogéneas posible, se puede realizar
una aleatorización completa. Al decir que sean lo más homogéneas posibles
nos referimos por supuesto que si se trata de ratones, sean de la misma
especie, procedan de la misma camada, tengan un peso inicial muy similar si
se trata de evaluar el efecto de una dieta o de ciertos medicamentos. No se
trata de que las unidades sean idénticas o clones porque se limitaría el
espacio inferencia y las conclusiones se limitarían a únicamente ese tipo de
unidades. Se acepta cierta variabilidad entre las unidades experimentales que
en la vida natural se presentan, y de lo que se trata es de evitar la mucha
heterogeneidad, en el ejemplo de ratones no se vale comparar el efecto de
cuatro dietas en ratones de distintas razas o distintos tamaños iniciales.
 La formación de bloques. Mediante los que se controle alguna variable
extraña y que se asegure que todos los bloques tendrán la oportunidad de
combinarse con los tratamientos.
Problemas
1. Un experimento se condujo por muchos diferentes años en cierta sección de la
supercarretera. Describa el espacio inferencia para este experimento. Si los
resultados del experimento se aplicaran a toda la supercarretera ¿qué lo haría
diferente?
22

2. Etiquete cuatro unidades del 1 al 4. ¿Cómo usaría su tabla de números aleatorios


para asignar las 4 unidades a 2 tratamientos A y B de modo que cada tratamiento se
aplique a 2 unidades?
3. Etiquete los tratamientos 1 y 2. Explique cómo usaría la tabla para asignar
aleatoriamente los tratamientos a las 4 unidades.
4. Explique cómo determinaría aleatoriamente el orden de un experimento de 12
unidades experimentales asignándolas a 4 tratamientos.

Ejercicio
1. Identifique los pasos de una investigación experimental.
2. ¿Cómo le sugeriría al investigador correr su experimento? Proponga un esquema
del diseño con todo y aleatorización.

Modelo Lineal
Describe a una observación y consta de una media y un error. Establece que para valores
fijos de una o más variables independientes se puede expresar la variable dependiente como
una combinación lineal de un conjunto de variables independientes.
Supongamos que µ(.) es una función lineal de la variable x.
 ( x)  o  1x
donde o y 1 son parámetros desconocidos.
x está en un dominio D.
µ(x) es una función lineal de una variable real x
x es una variable no aleatoria observable.
Se supone que para cada valor de x, existe una familia de funciones de distribución
acumulada, de tal modo que la media de la función correspondiente a un valor de x,
digamos xo, es o+1xo.
Las medias de las funciones de distribución (cdf) caen en una línea definida por:
 ( x)  o  1x

El objetivo es muestrear alguna cdf y con base en el muestreo inferir a la población. El


muestreo se realiza así:
1) Un conjunto n de observaciones de x se observan en el dominio D y son x1,
x2,...,xn. Éstas no son variables aleatorias, se pueden seleccionar a propósito o bien
al azar.
2) Cada xi determina una cdf., cuya media es  ( xi )  o  1 xi y su varianza es 2.
3) Para esta x se selecciona un valor al azar y se denota como yi (no necesariamente se
obtiene el valor esperado µx).
Por lo tanto se tiene un conjunto de n parejas de observaciones que se denotan como (yi, xi).
23

Se supone que:

E(yi)=o+1xi
Var (yi)=2

Pero como lo que observamos es un valor de yi de la cdf, y no su valor esperado, se tiene


también en el modelo a otra variable aleatoria que es el Error i para cada pareja (yi, xi). El
modelo se convierte en:
yi  o  1 xi   i
Este es el modelo probabilístico a diferencia del determinístico en el cual no hay término de
error y en el que se supone que todos los valores de y observados son sus valores esperados,
es decir, todos caen sobre la línea recta.

Los modelos son lineales en los parámetros es decir los parámetros están expuestos a la
potencia 1.

En resumen, el modelo describe a la observación, consta de una media y un error, y los


parámetros del modelo están expuestos a la potencia 1, es decir, son lineales en cuanto a
parámetros se refiere. Asimismo, puede decirse que los modelos son aditivos.

Método de mínimos cuadrados


Si del modelo anterior despejamos el error:

 i  yi  o  1xi
Se llama error o residuo a la diferencia de ordenada de un punto muestral y la recta de
regresión correspondiente a la misma abscisa. Nótese que el error es una función de los
parámetros del intercepto y la pendiente. Por lo que un criterio razonable para seleccionar
estimadores para estos parámetros es elegir aquellos que minimicen la suma de cuadrados
del error. Éste es el principio del Método de Mínimos Cuadrados y los estimadores
resultantes reciben el nombre de estimadores mínimos cuadrados.
Este método consiste en minimizar los errores, es decir, las diferencias entre los
valores observados y los de la recta de regresión ajustada, o sea se estimarán aquellos
valores o y 1 de la recta que hagan mínima la diferencia entre dicha recta y los valores
observados.
El método de mínimos cuadrados establece que de todas las rectas de regresión que se
pueden ajustar al conjunto de puntos muestrales dados, la mejor es aquella que tenga la
propiedad de que la suma de los cuadrados de los errores sea mínima.

n
min   i2  min  ( yi   o  1 xi ) 2
i 1

L   ( yi   o  1 xi ) 2
Para esto se aplicará la condición necesaria conocida para que una función de dos variables
independientes tenga un punto extremo (mínimo en este caso), es decir se igualará a cero
las primeras derivadas parciales de la función, con respecto a cada una de sus variables.
24

L
0
0
L
0
1
L n
  2 y  ( o  1xi ) 1
o i 1 i
n
 2  yi  o  1xi 
i 1


 2  yi  no  1  xi  0 
 nˆo  ˆ1  xi   yi
L n
  2 yi  (o  1xi )( xi )
1 I 01
 2 ( xi yi  o xi  1xi2 )
 
 2  xi yi  o  xi  1  xi2  0
 o  xi  1  xi2   xi yi

Agrupando las ecuaciones se obtiene un sistema de dos ecuaciones con dos incógnitas cuya
solución proporciona las estimaciones de los parámetros:
 n  n  ( 1)
n   xi   yi 
 i i  i 1  i 1 
x y 
n
̂1  i 1
2
 n 
  xi 
 i 1 
n


i 1
xi
2

n

 n  n  ( 2)
  xi    yi 
n
 i 1   i 1 
x y  i i n
 1  i 1
2
 n

  xi 
n
 

i 1
xi2  i 1
n
ˆ o  y  ˆ1 x ( 3)

Estos valores sustituidos en la recta de regresión proporcionan la ecuación de la recta de y


sobre x. Por medio de ella pueden estimarse o predecirse valores de y dados valores de x.
25

Teorema de Gauss Markov.


En un modelo lineal, los estimadores de mínimos cuadrados son los mejores estimadores
lineales; entre todos los estimadores, éstos son los que tienen mínima varianza.

Distribución F de Fisher
Cuando el interés se centra en hacer inferencias respecto a dos varianzas poblacionales y lo
que se desea probar es que éstas son iguales, se comparan sus varianzas muestrales a través
de un cociente. Digamos, s21/s22. Si este cociente es igual a la unidad entonces se diría que
las varianzas son iguales, o que la diferencia entre las varianzas es tan pequeña que puede
atribuirse al azar o no es lo suficientemente grande como para rechazar la hipótesis nula de
igualdad de varianzas.
Dadas s12 y s22 varianzas calculadas a partir de muestras aleatorias independientes
de tamaños n1 y n2 tomadas de poblaciones normalmente distribuidas con varianzas 12 y
22 respectivamente, la variable aleatoria:
s2  2 ( 4)
F 1 1
s 
2
2
2
2

sigue una distribución F con n1-1 y n2-1 grados de libertad.


Si suponemos que las dos muestras independientes de las dos poblaciones están
normalmente distribuidas y tienen la misma varianza podemos rescribir la ecuación como:
s2  2 ( 5)
F 1

s 2
2
2

( 6)

con n1-1 y n2-1 grados de libertad.


( 7)

( 8)

( 9)

Forma de la Distribución
La forma de la distribución es asimétrica con sesgo positivo. Su forma es determinada por
los parámetros n1-1 y n2-1.
Igual que para la distribución2 mientras más grande sean los grados de libertad de una o de
las dos varianzas más simétrica es la curva.
26

La tabla de la distribución F debido a que es definida por los parámetros n1-1 y n2-1 y que
ambos ocupan las filas y las columnas, existe una tabla F para cada nivel de significación.
En una tabla F, la columna izquierda indica los grados de libertad del numerador (de la
razón de varianzas) y en la primera fila están los grados de libertad del numerador. En el
cuerpo de la tabla se encuentran los valores críticos F a la derecha de los cuales está en
nivel  o probabilidad de cometer el error tipo I (Rechazar Ho dado que es verdadera).
Existen tablas para los  más empleados 0.1, 0.05, 0.025 y 0.01. El valor crítico para un
nivel de significación especificado y 1 y 2, grados de libertad se indican como sigue:

Fα; 1 y 2,

Teorema de Cochran
Si Zi se distribuye NID(0, 1) para i=1,2,3,..., y

Z
i 1
i
2
 Q1  Q2  ...  Qs
y Qj tienen j grados de libertad y j=1,2,...,s, entonces las Qj se distribuyen como 2 si y
sólo si:
  1   2  ...   s
Así, si la suma de los grados de libertad de las fuentes de variación es igual a N-1, el
número total de grados de libertad, significa que los cocientes SCtrat/2 y SCE/2 son
variables aleatorias independientes que se distribuyen 2. Y el cociente de dos variables ji
cuadradas se distribuye F.
27

Análisis de varianza
El análisis de varianza es un diseño eficiente para cuando se trata de comparar en
forma simultánea más de dos tratamientos.
Es una técnica por medio de la cual la variación total se divide en varias componentes,
en el caso más sencillo en una debido a los tratamientos y otra debida a la variación aleatoria.
Por lo tanto, la intención del análisis de varianza es determinar si las diferencias entre las
medias de las muestras debidas a las variables estudiadas son significativas.
Para la realización de un análisis de varianza se consideran los siguientes pasos:
1.- Establecimiento de un modelo.
El modelo consiste de una representación simbólica de un valor típico tomado de los datos que
se analizan. Por ejemplo el modelo de un análisis de varianza de una vía es el siguiente:
yi j =  +  i +  i j
donde, yij es una observación del experimento, de hecho es la j-ésima observación bajo el i-
ésimo tratamiento del experimento.
 es la media global del experimento
 i es el efecto del i-ésimo tratamiento
 i j es el término de error; es el j-ésimo error bajo el i-ésimo tratamiento. Hay tantos errores
como observaciones.
2.- Todo modelo se fundamente en supuestos, y cuya violación implica no trabajar con el
nivel  especificado.
Un ejemplo de supuesto en el que se apoya el análisis de varianza es la distribución normal e
independiente de los errores.
3.- Hipótesis son los enunciados que se quieren probar. Se indican la hipótesis nula y la
hipótesis alternativa. Las conclusiones se dan en términos de la hipótesis nula, es decir se
acepta o se rechaza la hipótesis nula de igualdad de medias.
4.- Cálculos o división de las sumas de cuadrados. La variabilidad de un conjunto de datos es
proporcional a la suma de cuadrados de las desviaciones
n
( yi - y)2 ( 9)
SC = 
i=1 n  1

y esta cantidad se utiliza para calcular la varianza muestral.


El análisis de varianza divide a la suma de cuadrados llamada suma de cuadrados total en
partes cada una de las cuales se atribuye a una de las variables independientes en el
experimento más un residuo que se asocia a un error aleatorio.
4.- Una tabla de análisis de varianza en donde se resumen los resultados de los cálculos
aritméticos, que incluyen las sumas de cuadrados, los grados de libertad, los cuadrados medios
(varianzas) y la F calculada.
5.- Estimación de los parámetros del modelo. No pueden conocerse los valores poblacionales
de los componentes del modelo, es decir, de  ,  i; pero sí se pueden estimar mediante
métodos como el de mínimos cuadrados; esto sirve para verificar los supuestos del análisis.
28

6.- Los intervalos de confianza para las medias de tratamientos dan una idea de la
variabilidad de las observaciones respecto a la media debido a la aleatorización.
7.- Verificación de los supuestos del modelo, lo cual implica checar los supuestos de
normalidad, independencia y homogeneidad de varianza sobre los que se apoya el análisis de
varianza.
8.- Potencia de la prueba. Determinación del tamaño n de la muestra.

ANÁLISIS DE VARIANZA DE UNA VÍA


"Diseño Completamente Aleatorizado"

R. Ramchun (2000) desea evaluar el efecto en la digestibilidad y crecimiento de bloques


multinutrientes como suplemento alimenticio en conejos. Los alimentos a base de cereales son
costosos para usarlos como suplementos y actualmente se utilizan bloques multinutrientes
MNB para rumiantes y se quiere probar el efecto en el crecimiento de conejos. Se emplearon
18 conejos progenie de 12 hembras conejo de 45 días de edad que se colocaron en jaulas de
50 x 30 x 30 arregladas en tres filas. El experimento consistió de tres tratamientos:
Control: Pellets comercial para conejos.
MNB15: 15 gr/día de MNB + pellets ad libitum
MNB30:30 g/día de MNB + Pellets ad libitum
Divide el estudio en dos partes y una le sirve para estudiar el efecto sobre la digestibilidad y
otra para estudiar el efecto en el crecimiento de los conejos, la primera la mide utilizando
variables como digestibilidad de materia seca y la materia orgánica, entre otras variables; y la
segunda como el peso del conejo a lo largo de un período de 55 días. La digestibilidad se
midió pasados 11 días del inicio del experimento.
Ejercicio
Especifique quiénes son las unidades experimentales, los o el factor, los niveles de los
factores, el espacio inferencia, la variable respuesta. ¿Qué otras variables podrían influir en la
respuesta? ¿Cuáles se pueden controlar a un solo nivel y cuáles a varios niveles? ¿Cuáles de
éstas no pueden controlarse pero sí pueden medirse para tomar en cuenta su efecto? ¿Cuáles
de ellas no se pueden controlar y es inevitable que sean la causa del error? Especifique el
espacio inferencia. Sugiera cómo sería la aleatorización. Proponga el arreglo experimental.

En este estudio el interés se centra en la comparación de 3 dietas y se compara la digestibilidad


de los tres tratamientos (se toman muestras del alimento y de las heces fecales y se le analizan
peso seco, materia orgánica, proteína, extracto etéreo, fibra, calcio, fósforo y energía). Esto
podría sugerir utilizar una prueba de hipótesis para comparar el control contra MNB15, otra
para comparar el control con MNB30, y otra para comparar MNB15 con MNB30. Si se
estipula correr una probabilidad de 0.05 por prueba, resulta que la probabilidad de cometer el
error tipo I (rechazar H0 H0 es verdadera) se infla a un valor de (0.95)3 = 0.8573 y realmente
la probabilidad de cometer este error en todas las pruebas es de 1 – 0.8573 = 0.1427. Es decir
si se realizan las tres comparaciones se puede cometer un 14.27 % de error. El investigador
emplea para analizar sus datos una técnica que le permite hacer todas las comparaciones en
una sola prueba y emplea análisis de varianza de una clasificación.

Un ejemplo aplicado a la Educación:


Viciana J et. Al. (2003) estudió el efecto de la retroalimentación en alumnos de secundaria
sobre el clima ego-tarea percibido, la valoración de las clases de educación física y la
29

preferencia en la complejidad de las tareas de clase. La motivación es muy importante


respecto al desenvolvimiento del alumno y su postura frente al deporte. Distingue dos tipos de
climas motivacionales: aquéllos entornos en los que se fomenta la competencia interpersonal,
la evaluación pública y la retroalimentación normativa sobre el desempeño de las tareas
promueven la aparición de un estado de implicación al ego, Y los entornos que enfatizan el
proceso de aprendizaje, la participación, el dominio de la tarea individualizado y la resolución
de problemas tienden a fomentar la aparición de la implicación a la tarea. Los individuos que
implican a la tarea serán persistentes ante las dificultades, creen que la motivación y el
esfuerzo son las cusas del éxito, prefieren tareas desafiantes y la satisfacción. La
retroalimentación que reciben los muchachos cuando están en su clase de educación física
puede ejercer un efecto en: la percepción clima de implicación, en la percepción clima de
implicación al ego, en la valoración de las clases de educación física, en la preferencia por las
tareas fáciles y en la preferencia por las tareas difíciles. Para el estudio se contó con un grupo
21 estudiantes, 12 muchachos y 9 muchachas entre 14 y 16 años. Se les dividió en tres grupos
1, 2 y control, El primero recibió retroalimentación negativa, el segundo retroalimentación
positiva y el último, (la misma cantidad de retroalimentación positiva y negativa). Previo a la
realización del experimento se realizó un análisis de varianza de una vía para comparar estos
tres grupos en cuanto a las 5 variables respuesta y se observó que no había diferencia entre los
tres grupos por lo que se utilizó un diseño completamente aleatorizado para realizar el análisis
una vez que se aplicaron los tres tipos de retroalimentación a los grupos formados. Para medir
las variables respuesta se utilizó un instrumento con varios ítems que correspondían a las
variables respuesta y que fueron medidas en escala Likert.
Cuando se desean comparar más de dos poblaciones, no es adecuado aplicar pruebas t
consecutivas entre cada par pues el nivel de significancia con el que se pretende trabajar se
incrementa. Por ejemplo si se tienen 4 tratamientos o medias se tendrían que realizar 6
comparaciones por parejas. Si decimos que estamos trabajando con un 95% de confianza y
corremos un 5% de probabilidad de cometer el error tipo I, en realidad estamos trabajando con
(0.95)6 de confianza y con 1-(0.95)6 de significación. El error tipo I se ha incrementado de
0.05 a 0.2649 y esto sería el caso de que las seis comparaciones fueran independientes lo que
no siempre sucede. Como esto no siempre es cierto (independencia de las comparaciones) la
probabilidad de cometer el error tipo I es mayor que 0.05 pero no se sabe a cuanto asciende.
Por esta razón R. A. Fisher propone una prueba que considera más de dos poblaciones y que
es el análisis de varianza.
En el análisis de varianza de una vía se investiga un factor o variable y se averigua si
existen diferencias entre los "a" niveles del factor" o si existe efecto de tal factor sobre la
variable respuesta. El diseño recibe el nombre de completamente aleatorizado porque no se
aplica ninguna restricción en la aleatorización como lo hace el bloqueo, es decir, los
tratamientos se aplican aleatoriamente a las unidades experimentales; éstas tienen las mismas
probabilidades de ser asignadas a los tratamientos por lo que se espera que las unidades
experimentales sean lo más homogéneas posibles.
Efecto de los tratamientos. Los a tratamientos pueden ser seleccionados
específicamente por el experimentador. En esta situación se desea probar la hipótesis sobre las
medias de los tratamientos y sólo se aplican a los niveles del factor considerado en el análisis.
Las conclusiones no pueden hacerse extensivas a tratamientos similares que no se hayan
considerado dentro del modelo. En este modelo se supone que las a muestras son
independientes, cada una tiene una distribución normal y, finalmente, que las varianzas de las
a poblaciones son iguales. A este modelo se le llama de efectos fijos (Modelo I) a diferencia
30

del modelo (II) de efectos aleatorios en que los a tratamientos pueden ser una muestra
aleatoria de una población mayor de tratamientos y las conclusiones se generalizan a la
población. En este modelo estamos interesados en la variabilidad de los tratamientos más que
en sus efectos medios, y se le conoce también como modelo de componentes de varianza.
Cuando se diseñan experimentos se procura tener el mismo número de réplicas por
tratamiento, éste es el caso balanceado.
El arreglo de datos para el caso balanceado puede esquematizarse así:
Tratamiento
----------------------------------------------------------------
1 2 ... i ... a
----------------------------------------------------------------
Y11 Y21 Yi1 Ya1
Y12 Y22 Yi2 Ya2
. . . .
. . . .
Y1j Y2j Yij Yaj
. . . .
Y1n Y2n Yin Yan
------------------------------------------------------------------
Y1. Y2. Yi. Ya.

Las filas representan las observaciones y las columnas los tratamientos o bien, los
niveles del factor.
Aquí se empleó el subíndice i para denotar al tratamiento y el subíndice j para denotar
el número de la observación. La notación punto de Yi. -indica que se ha sumado sobre el
segundo suscrito j.
Es importante hacer notar que algunas veces se utilizan los estudios comparativos por
observación. En estos estudios el investigador no puede asignar al azar las unidades a los
tratamientos. Por ejemplo, que se desee evaluar un fertilizante en distintos tipos de campos,
pastizales, henequén y maizales, por ejemplo. Las poblaciones de tratamiento ya están
formadas de modo natural, lo único sería seleccionar al azar sendas muestras de los distintos
tipos de campos y aplicarles el fertilizante. El factor sería CAMPO, y sus niveles, pastizal,
henequén y maíz.

Modelo
Una observación típica del diseño se representa por un modelo que como ya se ha dicho se
compone de una media y un error.

La observación procedente de un tratamiento, digamos la observación 1 del tratamiento 1-


y11- , por ejemplo, es igual al efecto de su media más un error que es la diferencia entre esa
observación y el valor predicho por el modelo. Esto se expresa así:

yij   i   ij
31

A este modelo se le conoce como modelo de medias. Y nos dice que el puntaje de un
tratamiento i tiene dos fuentes de variación, el efecto de la media del i-ésimo tratamiento y el
término de error.

Si consideramos que cada media de tratamiento individual es igual a la gran media más un
término llamado efecto del i-ésimo tratamiento:

i     i

entonces el modelo de medias se convierte en:

yij =  +  i +  ij i= 1, 2,..., a; j= 1, 2,..., n


denominado modelo de efectos, en donde,
yi j es la j-ésima observación bajo el i-ésimo tratamiento.
 es la media global o un parámetro común a todos los tratamientos Es constante para todas
las mediciones en todas las poblaciones de tratamiento.
 i es el efecto del i-ésimo tratamiento y se define como la diferencia entre la media del i-
ésimo tratamiento y la gran media. i es un parámetro que mide el grado con el cual la media
del tratamiento i difiere de la media de todas las medias, de ahí que las sumas de las
desviación respecto a su media es cero.  i es constante para todas las mediciones dentro de la
población i, pero es distinto de los otros tratamientos. Es decir  I se define como la diferencia
a

 i
de la media de tratamiento individual y la gran media  i  i   , por otro lado,   i 1
,

de este modo la suma de los desvíos de las medias individuales respecto a la gran media es
cero.
 ij es el componente de error aleatorio. Representa todas las fuentes no controladas de
varianza que afectan a las mediciones individuales. Éste es único para cada uno de los
elementos de la población (de ahí que tiene los mismos subíndices) y se supone que es
independiente de los tratamientos.

los tratamientos son iguales el modelo se reduce a:


yij =  +  ij

Este se conoce como modelo reducido y corresponde al modelo cuando la hipótesis nula de
igualdad de medias es cierta.

Resumen: Una observación yij se expresa como la suma de 3 componentes: una componente µ
constante, para todas los tratamientos y todos los elementos. Una componente  i constante
para todos los elementos dentro de la población de tratamientos pero que pueden diferir de
tratamiento a tratamiento. Y un componente aleatorio que es independiente de los tratamientos
y se distribuye normalmente como media cero y varianza 2.
Este modelo se apoya en los siguientes supuestos.

Supuestos
32

Puesto que ambas fuentes de variación µ y  i son constantes para todas las observaciones
dentro de la i-ésima población, la única fuente de variabilidad de estas mediciones es debida al
error experimental.
Se supone que las a muestras proceden de a poblaciones que se distribuyen normalmente. Se
supone también que son a muestras aleatorias y que por consiguiente son independientes entre
sí y los elementos dentro de cada muestra también son independientes. Se supone que las
poblaciones de las que se extraen las muestras tienen una varianza común o varianza
homogénea.
Si los elementos se asignan al azar a las condiciones de tratamiento se tiene cierta certeza de
que los efectos del error son independientes de los tratamientos, de ahí la importancia de la
aleatorización. Igualmente debido a la aleatorización se supone que los errores se distribuyen
dentro de cada población normalmente distribuida con valor esperado igual a cero y varianza
2. Resumiendo,

i) Los a conjuntos de datos observados constituyen a muestras aleatorias independientes.


ii) Cada una de estas a poblaciones está normalmente distribuida con medias µi y varianza  ².
iii) Cada una de las a poblaciones tiene varianza común y las  i son constantes desconocidas.

iv)  i = 0; esto significa que se trata de un modelo de efectos fijos.  i es el efecto del i-
ésimo tratamiento y es igual a la diferencia  i -  . La suma de los efectos de
tratamiento es cero para el caso de efectos fijos. Y esto implica que µ es la media de
las medias µi. En el diseño de efectos fijos, dado que el interés se centra únicamente en
los a tratamientos, la suma de los desvíos o efectos τi es cero, en cambio en los efectos
aleatorios no suman cero debido a que sólo se extrae una muestra aleatoria de “a”
niveles del factor de una población grande de niveles del factor, de modo que no se
conoce la media global y mucho menos la suma de los desvíos es cero.

Hipótesis
El propósito del análisis consiste en probar la igualdad de medias de tratamientos.
Ho:  1 =  2 =...=  a = 0
H1:  i  j para al menos un par i, j
Otra manera de expresarlo es:
Ho:  i =  j,  i j
En palabras, Los efectos de los tratamientos son iguales a cero.

H1:  i   j para al menos un par i, j


Al menos un efecto de tratamiento es diferente de cero.

Si Ho es verdadero, no existen efectos de tratamiento, es decir la media de la j-ésima población


es µ y cada observación es resultado de la media poblacional y su error aleatorio.

Puede verse que el modelo bajo la hipótesis nula es el modelo reducido, y el modelo completo
es el que corresponde a la hipótesis alternativa. Realmente lo que pretende el investigador es
determinar cuál de los modelos, completo o reducido, caracteriza mejor los datos del
experimento (Kuelh, 2000).
33

Los modelos que corresponden a los diseños experimentales pertenecen a una clase general de
modelos, modelo lineal general, en el que la respuesta está en función lineal de un conjunto de
parámetros: el ejemplo por excelencia es el modelo de regresión lineal, en el que las xj
corresponden a las variables independientes métricas. Igualmente el modelo de un factor
puede expresarse como un modelo lineal general pero la variable independiente que es el
factor puede dar lugar a un conjunto de a variables ficticias (dummy) o indicadoras.
y  1 X1  2 X 2  3 X 3  
La variable ficticia indica el grupo de tratamiento al que pertenece la observación, x tendrá el
valor de 1 si pertenece a cierto grupo y de cero si no pertenece a dicho grupo. Por ejemplo
podemos definir para un experimento con tres tratamientos tres variables indicadoras que
toman los valores de 1 y 0 según si pertenecen al i-ésimo grupo o no pertenecen a él.

 1 del tratamiento 1
x1  
0 de otro tratamiento
 1 del tratamiento 2
x2  
0 de otro tratamiento
 1 del tratamiento 3
x3  
0 de otro tratamiento

La ventaja de estos modelos es que se permite incluir a las covariables. De este modo si el
interés se centra en comparar medias de un factor y se toma en cuenta a una covariable el
modelo de medias quedaría así:
yij  i  1 X ij   ij
el cual corresponde al análisis de covarianza de un factor.

Ejemplo: Un ingeniero agrónomo desea evaluar el efecto de 3 fertilizantes nitrogenados en el


rendimiento del trigo (kg/Ha2). Piensa que el amonio es un fertilizante excelente aún cuando
se estén usando actualmente ciamida y sus derivados. Divide su terreno en 30 parcelas. A cada
10 parcelas le aplicará un fertilizante: sulfato de amonio, ciamida, ciamida-dietanoldiamida.
Desea averiguar cuál de ellos produce los mayores rendimientos
1. Responda las siguientes preguntas.
a. ¿Cuál es el objetivo del estudio?
b. Identifique al factor y sus niveles.
c. Identifique la variable respuesta.
d. Determine el espacio inferencia.
e. Proponga el arreglo del diseño. Incluya la aleatorización completa.
f. Proponga al ingeniero agrónomo cómo correr su experimento. Mencione las
variables que pueden quedar bajo el control del ingeniero y las que queden
bajo el término de error. ¿Será sensible el análisis a los efectos de los
desinfectantes o es necesario proponer un nuevo diseño?
2. Con los resultados que se presentan a continuación responda las siguientes preguntas.
Emplee los cálculos necesarios e interprete los resultados dentro del contexto del problema.
a) ¿existe diferencia entre los fertilizantes?
b) Si es así, ¿entre qué parejas de medias está la diferencia?
34

c) Proponga intervalos de confianza para las medias y para las diferencias entre las
medias.
d) Con este número de observaciones ¿qué tan potente es la prueba?

Pregunta de Investigación:
¿Existen diferencias en el rendimiento promedio del trigo (kg/Ha2) con los diferentes
fertilizantes?

Hipótesis de investigación
El fertilizante a base de amonio, particularmente el sulfato de amonio, promueve más
exitosamente el crecimiento de las plantas que los fertilizantes de amida.

Diseño empleado
Para evaluar la hipótesis incluyó al fertilizante sulfato de amonio, la ciamida y la ciamida-
dietanoldiamida. Emplea un diseño completamente aleatorizado y a cada parcela se le asignó
al azar un fertilizante y se sembraron semillas de trigo y que también fueron seleccionadas al
azar. A cada parcela se le roció el fertilizante asignado y en el orden asignado al azar, de
manera independiente. Al cabo de 45 días se determinó el rendimiento (Kg/ha2) El
experimento se realizó en un campo situado en el cono sur del Estado, entre Oxkutzcab y
Yotholin. Las características de las parcelas de tierra son muy similares entre sí, tierra roja,
muy fértil y de una porosidad idónea para el cultivo de trigo. Se controló con exactitud la
frecuencia de riego, calidad del agua, hora de riego. Quedaron fuera del control del
experimentador, las condiciones climáticas y la acción de animales silvestres que atraviesan el
campo y aves.

El investigador comienza por numerar todas las parcelas y de éstas selecciona al azar 30, las
re etiqueta del 1 al 30, asigna al azar las parcelas a los tratamiento y aleatoriza el orden en que
llevará a cabo el experimento.
Parcela Fertilizante Orden de aplicación
3 Sulfato de amonio 2
5 Sulfato de amonio 30
16 Ciamida 29
… … …
27 Ciamida - Dietanoldiamida 12

La primera columna corresponde al número de parcela, la segunda columna es el fertilizante


asignado al azar a cada una y la tercera corresponde al orden en que se aplicaron los
fertilizantes. Se aplican los tratamientos y pasado el tiempo previamente especificado (llegado
el tiempo de la cosecha), se recolecta y se pesa el trigo recogido en cada parcela del
experimento anotándose el rendimiento.

A continuación se presentan los resultados, y son los rendimientos del trigo cosechados y que
se miden en kg/Ha2.
Observación Sulfato de Amonio Ciamida Dietanoldiamida
1 100 70 80
2 103 69 84
35

3 104 79 81
4 103 79 84
5 102 69 83
6 102 81 82
7 104 78 82
8 103 75 80
9 105 85 87
10 105 60 89

Se propone un análisis de varianza de una vía de efectos fijos donde el factor es el tipo
de fertilizante y los niveles del factor son: Sulfato de Amonio, Ciamida y Dietanoldimida. Y la
variable respuesta, rendimiento del cultivo( kg/ha2).

Modelo
yi j =  +  i +  i j ;i = 1, 2 y 3; j = 1,2,..., 10
donde,
yij es el j-ésimo rendimiento bajo el i-ésimo fertilizante.
µ es el efecto común para todo el experimento o bien la gran media.
i es el efecto del i-ésimo fertilizante y,
ij es el error aleatorio presente en la j-ésima observación bajo el i-ésimo fertilizante.

El modelo lineal puede escribirse como uno de regresión con la variable x = fertilizante.
Debido a que son tres fertilizantes definiremos dos variablesindicadoras.
X1 X2 X3
Sulfato de Amonio 1 0 0
Ciamida 0 1 0
Ciamida-Dietanoldiamida 0 0 1
El modelo sería
y  1 X1  2 X 2  3 X 3  
Si la observación pertenece al fertilizante sulfato de amonio, entonces X2 y X3 toman el valor
de 0 y X1 = 1, Y = ß1 + e
β1 corresponde al µ1 del tratamiento Sulfato de amonio.

También podrían haberse creado dos variables Dummy con los siguientes valores:
X1 X2
Sulfato de Amonio 0 0
Ciamida 1 0
Ciamida-Dietanoldiamida 0 1

Supuestos
Los errores se distribuyen normal e independientemente con media cero y varianza  ² (ij
~NID(0,  ²).
Es un análisis de efectos fijos, por lo que:  i= 0. Es decir, estamos interesados únicamente
en estos tres fertilizantes.
36

Hipótesis
Ho:  1=  2=  3.
En palabras, Los tres fertilizantes producen el mismo rendimiento.
H1:  i   j para al menos un par.
Al menos uno de los fertilizantes produce un rendimiento diferente.

Si la hipótesis nula es cierta, significa que los tres fertilizantes producen en promedio el mismo
rendimiento del trigo; y si se rechaza la hipótesis nula significa que existen diferencias al
menos entre un par de ellos.

División de la suma de cuadrados


La suma de cuadrados total se divide en dos tipos de sumas de cuadrados, la suma de
cuadrados debida a los efectos y la debida al error.
Antes de proporcionar las fórmulas para el cálculo de las sumas de cuadrados, a
continuación se da una introducción a la notación punto que se emplea en estas fórmulas:
a n
( 10)
y..=  yij
i=1 j=1

que representa el gran total.


El punto implica la suma sobre el subíndice que reemplaza, es decir y.. es la suma en todos los
niveles de a, y en todas las n réplicas.
n ( 11)
yi. =  yij
j=1

es el total del i-ésimo tratamiento.


y..= y../N Gran media
y.= yi./n i-ésima media del factor principal

El análisis de varianza resulta de descomponer la variabilidad total de los datos en sus


componentes.
a n ( 12)
SCT =  ( yij - y.. )2
i=1 j=1

Las fórmulas de las sumas de cuadrados se obtienen a partir del modelo. En el modelo de una
vía, y partiendo del conocimiento de los estimadores de los parámetros, a saber:
ˆ  y..
ˆi  yi.  y..
yˆ ij  yi.

Partiendo del modelo de una vía y sustituyendo por sus estimadores se tiene:
yij  y..   yi.  y..   yij  yi. 
Pasando al lado izquierdo de la ecuación al estimador de la gran media:
yij  y..   yi.  y..   yij  yi. 
Elevando al cuadrado y sumando sobre todos los términos se tendría:
37

 y  y..     y  y..   yij  yi.  


a n a n
2 2
ij i.
i 1 j 1 i 1 j 1

Se puede notar que el término de la izquierda corresponde a la suma de cuadrados total y que
la parte derecha corresponde a un binomio al cuadrado, por esto, esta suma de cuadrados se
puede expresar en términos de sus componentes:
a n
SCT =   [( y i . - y.. )2 + 2( y i . - y..)( yij - y i .) + ( yij - y i . )2 ]
i=1 j=1

se puede demostrar que el término intermedio es igual a cero.


n 
   
a n a

  y i.  y..  y ij  y i.    y i.  y 
..  yij  yi . 
i 1 j 1 i 1  j 1 
 
 
n
yi .
 yij  yi.   yi.  n 0
 j 1  n
La primera suma no tiene a j como subíndice por ello puede escribirse como:
a n a

  ( y . - y.. ) = n  ( y . - y.. )
i=1 j=1
i
2

i=1
i
2

de aquí que,
a a n ( 13)
SCT = n  ( y i . - y..)+   ( yij - y i . )2
i=1 i=1 j=1

La variabilidad total medida por la suma total de cuadrados corregidas se descompone


en la suma de cuadrados de las diferencias entre los promedios de los tratamientos y el
promedio general y en la suma de cuadrados de la diferencias entre las observaciones dentro
del tratamiento y el promedio del mismo (Montgomery, 1991). También puede observarse que
la suma de cuadrados del error es la suma para todos los tratamientos- de los cuadrados dentro
de cada tratamiento. La varianza dentro de cada grupo sería:
n ( 14)
 ( yij - y i . )2
si2  j=1
n 1

Y es una estimación de σ2 y si se supone que es homogénea o es la misma para todos los


grupos de tratamiento, entonces
 
a n ( 15)
 yij  yi.
2

s 2  i1 j 1
a(n  1)
SCE ( 16)
s2 
a(n  1)
38

SCtotal = SCtratamientos + SCerror

Las fórmulas condensadas de cálculo quedan de la siguiente forma:


a n y..2 ( 17)
SCT =   yij -
2

i=1 j=1 an
donde el término de la derecha es el factor de corrección. El término de corrección indica
que como la suma de cuadrados es una medida de variabilidad respecto a la gran media debe
restarse su contribución a y² la cual es la suma de cuadrados sin ajustar.
a
yi.2 ( 18)
SCtrat =  - f.c.
i=1 n

Las sumas de cuadradas tienen la propiedad de ser aditivas, por consiguiente la SC del error
puede calcularse de la siguiente manera:
a n
1 a ( 19)
SCE   yij2   yi2.
i 1 j 1 n i1

O bien,
SCerror = SCtotal - SCtratamiento ( 20)

Las sumas de cuadrados reflejan el grado en el cual los números de un conjunto varían entre
sí. Cuando no hay variabilidad, o sea cuando los números son parecidos, cada desviación de la
media será o se aproximará a cero y la suma de las desviaciones al cuadrado también será
cero.

Grados de libertad
La cantidad n-1 de la fórmula de varianza de una muestra recibe el nombre de grados
de libertad. El número de grados de libertad de una suma de cuadrados es igual al número de
términos independientes de dicha suma. La SC =  (yi-y)² consiste en la suma de cuadrados
de los n elementos: y1-y ,..., yn-y . Estos elementos no son todos independientes ya que
 (yi-y) = 0, por lo que sólo n-1 son independientes, y SC tiene n-1 g. l. Para la SC total por
ejemplo el número de grados de libertad es N-1, el 1 representa la contribución de la media.
Los grados de libertad asociados a cada efecto: Los grados de libertad de los tratamientos se
obtienen razonando así: la suma de cuadrados entre tratamientos se calcula de los desvíos de
las medias de los a tratamientos menos la gran media y se sabe que la suma de estos desvíos es
cero, por lo que son a – 1 grados de libertad asociados a los tratamientos:
g. l. de los tratamientos: a-1
g. l. del error: a(n-1) = an-a = N-a
g. l. total: N-1

Cuadrados medios
Los cuadrados medios proporcionan una estimación insesgada de la varianza. Si las
sumas de cuadrados se dividen entre sus grados de libertad correspondientes a cada fuente de
39

variación, entonces se obtienen las fórmulas de los cuadrados medios o estimaciones de la


varianza:
CMTrat = SCtrat/(a-1) ( 21)

CMerror = Serror/(an-a) ( 22)

Los cuadrados medios esperados de los tratamientos y del error servirán para obtener los
estadísticos de prueba, que en estos diseños se trata de pruebas F o razón de varianzas.
Supuestamente bajo la hipótesis nula de que las medias de los tratamientos son iguales los
valores esperados del cuadrado medio de tratamientos y cuadrado medio de error son
estimaciones insesgadas de la varianza poblacional 2. Sin embargo el valor esperado del
cuadrado medio del error es siempre 2 aún cuando la hipótesis nula sea falsa. Lo que pasa es
que el CME refleja el promedio de las varianzas de los tratamientos por separado y son
independientes de si existe o no diferencia entre las medias. En cambio el valor esperado del
cuadrado medio de tratamientos como depende de la variación de las medias de los
tratamientos y la gran media, pues si es afectada por si la hipótesis nula es verdadera o falsa. Si
la hipótesis nula es verdadera las diferencias de las medias individuales respecto a la gran
media son muy pequeñas y el valor esperado del cuadrado medio de tratamientos es 2. Si por
el contrario, las medias de tratamiento son muy grandes, la diferencia de éstas respecto a la
gran media, será grande, y el valor esperado es igual a 2 más una cantidad que refleje esta
gran variabilidad entre tratamientos. Esto se entiende si conocemos los valores esperados de
los cuadrados medios:
Cuadrado medio de tratamientos
El cuadrado medio de tratamientos resulta de dividir la suma de cuadrados de tratamiento
entre sus respectivos grados de libertad. Cuando las a medias poblacionales son iguales, el
CMtratamientos (CMTrat) se convierte en una estimación insesgada de la varianza común.

Cuadrado medio del error


Obtengamos una estimación del cuadrado medio del error, que es una estimación insesgada de
la varianza mancomunada.

 y  yi 
ni
2
ij
j 1
Dentro de cada tratamiento si es una estimación de la varianza dentro del i-
ni  1
ésimo tratamiento y si las varianzas de los a tratamientos son similares, sus estimaciones se
2

 y  yi  con la suma de los ni-1 grados de


a ni
pueden combinar o mancomunar para dar ij
i 1 j
a
libertad de los a tratamientos, es decir con  ni 1
i  1  N  a grados de libertad. Dividiendo

esta suma de cuadrados del error (que son las varianzas mancomunadas) entre sus grados de
libertad se obtiene el cuadrado medio del error. (Hicks y Turner, 1999).

Teorema de Cochran:
40

Se puede demostrar que estos cuadrados medios siguen una distribución  ². Dado que la suma
de grados de libertad de los tratamientos y del error es igual al número total de grados de
libertad, estos cuadrados medios siguen una distribución  ². Y el teorema implica que el
cociente SCtrat/σ2 y el cociente SCE/σ2 son variables aleatorias ji-cuadrada con sus respectivos
grados de libertad. Por lo tanto si la hipótesis nula de igualdad de medias de tratamiento es
verdadera, la razón de varianzas:
Fo = SC trat/(a-1) = CM trat
SC error/(N-a) = CM error

sigue una distribución F con a-1 y N-a grados de libertad (Montgomery, 1995). Con este
estadístico F se prueba la hipótesis:
H0: µ1 = µ2 = µ3.
En el cociente, la varianza cuya significancia se desea probar queda en el numerador y en el
denominador debe quedar aquella varianza o cuadrado medio que sea independiente de si la
hipótesis nula es verdadera o falsa, y éste es el error, por esta razón el denominador es el
cuadrado medio del error.
Si Ho es verdadera, el valor esperado del cuadrado medio de tratamientos es igual al valor
esperado del cuadrado medio del error, pero si es falsa, es mayor que el valor esperado del
cuadrado medio del error lo que conduciría a rechazar Ho.
La región crítica es la cola superior de la distribución F y la hipótesis anterior se rechaza si Fo
> Fα;, a-1,N-a.

¿Qué significa el valor esperado? Es un promedio ponderado de las observaciones que se


esperan en el futuro y en el análisis de varianza cada fuente de variación, tales como el factor y
el error, tienen un valor esperado. El valor esperado del factor es:
a
( 23)
n i2
E (CM trat )   2  i 1
a 1
Y el valor esperado del cuadrado medio del error es:
E(CM E )   2 ( 24)

En palabras, esto significa que si se hiciera un número infinito de veces el experimento, con
los mismos niveles y el mismo número de réplicas, y en cada experimento se calcula el valor
del CME por ejemplo, entonces en promedio se obtendría el valor de 2. El valor esperado de
los cuadrados medios sirven finalmente para conocer qué razones F son válidas, es decir, si se
quiere probar que una fuente de variación es significativa, los cuadrados medios permiten
conocer que cuadrados medios constituirán el numerador y denominador de la prueba F. Se
dejará en el numerador aquella fuente de variación que se quiere probar y como denominador
aquel cuadrado medio que contenga todos los términos a excepción del que se desea probar.
La utilidad de los valores esperados de los cuadrados medios, se verá cuando se trate las
pruebas F directas, conservadoras y mancomunadas en el capítulo de diseños factoriales. Por
el momento nos limitaremos a obtener el valor esperado del cuadrado medio del error para
tener una noción de cómo se obtienen.
41

Matemáticamente se puede obtener el cuadrado medio del error como se presenta a


n
yi.   yij
j 1
continuación:Si se sabe que,

yi.  yn i.

Entonces,
 SCE  1   2

E (CM E )  E   E  ( yij  y ) 
 N  a  N  a  i.

1
 E  ( yij2  2 yij yi.  yi2. ) 
N a 
1
 E  yij2   2yij yi.   yi2. ) 
N a 
1  a a

 E  yij2  2 yi. yi.  n yi2. ) 
N a  i 1 i 1 
1  y a

 E  yij2  2 yi. i.  n yi2. ) 
N a  n i 1 
1  n y a

 E  yij2  2 yi. i.  n yi2. ) 
N a  n n i 1 
1  y y a

 E  yij2  2n i. i.  n yi2. ) 
N a  n n i 1 
1  a a

 E  yij2  2n yi2.  n yi2. ) 
N a  i 1 i 1 
1  a

 E  yij2  n yi2. ) 
N a  i 1 
1  y2 
 E  yij2  n i2. ) 
N a  n 
1  1 
 E  yij2  n 2  yi2. ) 
N  a  n 
1  1 
 E  yij2   yi2. ) 
N  a  n 

Sustituyendo el modelo, en la ecuación anterior se obtiene:


ECM E  
1 
N a  
2 1
(    i   ij )       i   ij   2

n 
elevando al cuadrado las cantidades entre corchetes y tomando su valor esperado se
obtiene:
1  2 a a

ECM E    N  n   2
 N 2
 N 2
 n   i2  a 2    2
N a 
i
i 1 i 1 

De la misma manera puede obtenerse el valor esperado del cuadrado medio de tratamientos.
42

a
n i2
( 25)
E (CM Trat )   
2 i 1
a 1
a 2

 i   
E (CM Trat )   2  n i 1
a 1

donde, el segundo término es la varianza de las medias de los tratamientos. El CMTrat estima
una combinación de la varianza del error y la varianza entre las medias de los tratamientos.
Si la hipótesis nula es falsa significa que τi es diferente de cero y que este componente es
grande por lo que no constituye una estimación de la varianza poblacional. Sino que es la
varianza poblacional más los efectos de tratamientos.

Tabla de análisis de varianza


La división de las desviaciones básicas de las sumas de cuadrados se resume
generalmente en una tabla de análisis de varianza. En la primera columna se escribe la fuente
de variación, es decir el título que dice cual suma de cuadrados se lista en cada fila, la segunda
columna contiene las sumas de cuadrados, la tercera los grados de libertad asociados a cada
fuente de variación. Los grados de libertad son números entre los que se dividen las sumas de
cuadrados para obtener los cuadrados medios. Y la siguiente columna es el valor calculado de
F.

Fuente de Variación Sumas de Grados de Cuadrados Fcalc


Cuadrados (SC) libertad (G.L.) Medios (CM) (FC)
Tratamiento SCtrat a-1 CMTrat Fc
Error SCE N-a CME
Totales SCT N-1

En el ejemplo,
SCT  231,616 
2608 2  4893 .87
30
f .c.  226,722.13
10312  745 2  832 2
SC fertilizante   226,722.13  4298 .87
10
SCE  231,616 
10312  7452  832 2   595.00
10
SCE  4893 .87  4298 .87  595
Fuente de SC G.L. CM F
Variación
Trat. 4,298.87 2 2149.33 97.53
Error 595 27 22.0370
Total 4,893.87 29
F0.05(2,27) = 3.35
43

97.5327>> 3.35 por lo que se rechaza la hipótesis nula de igualdad de medias. Es decir,
existen diferencias altamente significativas entre los tres tipos de fertilizantes.

Las salidas de cómputo vienen con una columna adicional que corresponde al valor p, la
probabilidad de exceder el valor del estadístico de prueba bajo la hipótesis nula, de ahí que
se denote Pr > F. Un valor de 0.000 es la probabilidad de que el estadístico F con los
respectivos grados de libertad del numerador y denominador sea mayor que el FC obtenido
de los cálculos. En el ejemplo existe una probabilidad 0.000 de que el F de la tabla Fα
exceda el valor de 97.5327. Es improbable que el valor F sea mayor que el F calculado. Por
lo que existe evidencia suficiente para rechazar Ho.
Podemos también decir que es la probabilidad asociada al estadístico de prueba (al que
calculamos), una p más pequeña que el nivel de significancia elegido conduce al rechazo de
la hipótesis nula.

Resolvamos simultáneamente un ejemplo propuesto y resuelto por Hicks y Turner (1999).


En la manufactura de ropa se utiliza una máquina de prueba para medir la resistencia a la
abrasión de diferentes fábricas. La variable dependiente da la pérdida de peso del material
en gramos después de un número especificado de ciclos. El problema consiste en
determinar si hay diferencia en la pérdida promedio entre cuatro fábricas competentes. Las
fábricas se denotan como A, B., C y D: fábrica es una variable cualitativa y de niveles
fijos, es decir estamos interesados únicamente en estas cuatro fábricas.

A B C D
1.93 2.55 2.40 2.33
2.38 2.72 2.68 2.40
2.20 2.75 2.31 2.28
2.25 2.70 2.28 2.25

Resolviendo,
Sumas de Cuadrados
SCT  92.97 
38.41
2
 0.76
16
8.76 2  10.72 2  9.67 2  9.26 2
SCTrat   92.21  0.52
4
SCE  0.76  0.52  0.24

Los grados de libertad para las fuentes de variación son:Fábricas 4-1 = 3


Error 4(4-1) = 12
Total 16-1 = 15

Cuadrados medios:CMfábricas = 0.52/3 = 0.17


CME = 0.24/12 = 0.02

F
44

F = CMfábricas/CME
F = 0.17/0.02= 8.53
El estadístico de prueba se compara contra el valor F que corresponde a la región de
rechazo y que consultamos en una tabla F con el nivel de significancia específico.
F0.05;3,12 = 3.49
F0.01;3,12 = 5.95
Como el valor del estadístico de prueba es mayor que el valor de la tabla para 0.05 y aún
más, hasta para un nivel de 0.01, significa que existe diferencia altamente significativa
entre la pérdida de peso promedio de las cuatro fábricas.

Tabla de análisis
Fuente de SC G.L. CM F
Variación
Fábricas 0.52 3 0.17 8.53
Error 0.24 12 0.02
Total 0.76 15
Como el valor de F obtenido es mayor que el de la tabla se puede decir que sí existe efecto
del factor fábricas, en la pérdida de peso. Habría entonces que determinar entre qué medias
se encuentra la diferencia.

Ejercicio Propuesto: (Little y Hills, 1976) Se desean probar tres tipos diferentes de
hormonas, cada una en una dosis única, para determinar sus efectos sobre la capacidad de
aumento de peso de las ovejas. Entonces, incluyendo el control, tenemos cuatros
tratamientos. Los 16 grupos de ovejas asignados al experimento se numeran del 1 al 16.
Empleando la tabla de números aleatorios se asignan al azar los grupos 14, 13, 8 y 9 al
tratamiento A, y así sucesivamente.
Tratamiento Réplicas Totales Medias
A (Control) 47 52 62 51 212 53
B 50 54 67 57 228 57
C 57 53 69 57 236 59
D 54 65 74 59 252 63
¿Existen diferencias en el crecimiento promedio de las ovejas que reciben los 4 tipos de
hormonas?

Antes de proseguir con el análisis para averiguar entre qué par de medias radica la diferencia,
es necesario estimar los parámetros del modelo para verificar si se cumplen los supuestos. Si
éstos no se cumplen y se viola de manera significativa algún supuesto, la validez de la prueba
F es cuestionable y la probabilidad de cometer el error tipo I es mayor que el que se declara,
llegando muchas veces a conclusiones falsas, de ahí la importancia de no proseguir con la
comparación de medias, sino hasta que se esté seguro de la validez de la prueba F. Una vez
que se pruebe que sí se cumplen, ya es posible hacer las comparaciones de medias.

Estimación de los parámetros del modelo


Bajo el modelo I o de efectos fijos la ecuación del modelo es:
yij =  +  i +  ij
45

Los valores poblacionales no pueden conocerse a partir de una muestra; antes bien se
proporcionan estimaciones de cada uno de los componentes del modelo, esto se indica con un
circunflejo arriba del símbolo del parámetro: ̂ , ˆ .
El residuo es:
eij  yij  yˆ ij
eij  yij  ˆ  ˆi

a n
L =  ( yij -  -  i )2
i= j=1

Se trata pues de estimar los valores de los parámetros que minimicen la suma de cuadrados:
Una de las formas de estimarlos es mediante el método de mínimos cuadrados; para
encontrar los estimadores y se deben encontrar los valores que minimicen L.
Los valores serán la solución de a + 1 ecuaciones simultáneas. Estas se originan de derivar e
igualar a cero:

 L 
  = 0
   ,

 L 
  =0
    ,

 
a n
L    ij2  ( yij  ˆ   i
2

i 1 j 1

L


 2 yij  ˆ   i 
  yij  N  nˆ1  nˆ2  nˆ3  0

L
 2 yij  n  nˆ1   0
n

 1 j 1

L
 2 yij  n  nˆ2   0
n

 2 j 1

L
 2 yij  n  nˆ3   0
n

 3 j 1
46

n
  yij  n  n 1  0
j 1
n
  yij  n  n 2  0
j 1
n
  yij  n  n 3  0
j 1

N + n11 + n22 + n33 = y..


n + n11 = y1.
n + n2 = y2.
n + n3 = y3.
Debido a que hay más incógnitas que ecuaciones, el sistema tiene infinidad de soluciones.
Como las ecuaciones no son independientes (puede verse que la primera resulta de sumar las
otras tres) por lo que no hay una solución única. Se utiliza como otra ecuación:
a
( 26)
 = 0
i=1
i

Al resolver este sistema de ecuaciones lineales se obtienen los estimadores mínimos


cuadrados:
̂ =y..
ˆi =yi. -y..
Éstos son los mejores estimadores lineales insesgados (BLUE)

Para el ejemplo:
̂ = 2608/30 = 86.9
y1. = 103.1
y2. = 74.5
y3. = 83.2
ˆ1 = 103.1 - 86.9 = 16.2
ˆ2 = 74.5 - 86.9 =-12.4
ˆ3 = 83.2 - 86.9 = -3.7
 i = 0

Los efectos de los tratamientos nos dicen qué tanto se alejan las observaciones de la media
global.
Si se observa la magnitud de los efectos parece que el tratamiento 3 es el más distanciado, y
si observamos el signo de los efectos los tratamientos 2 y 3 tienden a disminuir los
rendimientos mientras que el sulfato de amonio produce mayores rendimientos. Al observar
magnitud y signo se puede decir que el que menos se aleja de la gran media es el
tratamiento de dietanoldiamida y el que más se aleja es el sulfato de amonio desviándose
positivamente respecto a la media global.
47

Intervalos de confianza
Proporcionan una idea de la precisión del experimento; reflejan la variabilidad debida
al proceso de muestreo aleatorizado. Asimismo proporcionan una idea de qué tratamientos son
similares y cuáles son diferentes. Puede observarse también cuál es el que produce mayor o
menor respuesta. Se construyen intervalos de confianza por cada media de tratamiento.
Recuérdese que el intervalo de confianza supone que para una muestra distribuida
normalmente con media µ y varianza 2 el intervalo de confianza para la media está dado por:


Y  z1 2  n  ( 27)

donde z es el valor acumulado de la distribución normal estándar, que para un 95% de


confianza es igual a 1.96. No conocemos  pero suponemos una varianza común. Cuando el
valor de  se desconoce, el valor de z se reemplaza por el valor t de Student con el número de
grados de libertad usados para estimar la desviación estándar de la muestra; en cada
tratamiento equivales a n-1, pero como son a tratamientos, entonces los grados de libertad de
la t equivalen a a(n-1) que corresponden al error.

En resumen, si se supone que los errores están normal e independientemente distribuidos con
media 0 y varianza  ², las yi . se distribuyen normalmente con media i y varianza  ²
CM E ( 28)
yi.  t/2,N -a
n

Para el ejemplo, los intervalos de confianza son los siguientes:


 1: [99.95, 106.0]
 2: [71.45, 77.55]
 2: [80.15, 86.25]
Esto significa que el 95% de las veces el valor medio de rendimiento con el sulfato de
amonio caerá entre 99.95 y 106.05, el valor medio del rendimiento con la ciamida caerá entre
71.45 y 77.55 y entre 80.15 y 86.25 para la dietanolamida.
También pueden obtenerse intervalos de confianza para diferencias entre medias; se
calcula así:
2CM E ( 29)
yi - y j  t(N -a),/2
n

para tamaños de muestra iguales. Y para cuando ni es diferente de nj entonces se aplica:


1 1 ( 30)
yi - y j  t(N -a),/2 CM E  + 
 ni n j 

Si cualquiera de los intervalos de parejas de medias contiene al cero significa que


estadísticamente son iguales.
48

Verificación de los supuestos del modelo


Los modelos estadísticos trabajan bajo ciertos supuestos. Se supone que en el modelo
completamente aleatorizado la observación yij se distribuye normalmente con media µ + i y
con varianza, 2.
Para verificar los supuestos Dean y Voss (1999) sugieren seguir los siguientes pasos:
1) Checar la forma del modelo, es decir averiguar si E(Yij) = µ + i.
2) Checar los valores atípicos
3) Checar la independencia
4) Checar la homogeneidad
5) Checar la normalidad

Para verificar los supuestos del análisis de varianza, no es conveniente hacerlo con los datos
crudos porque pueden estar influenciados por los factores de interés y por lo tanto no tendrán
una media común. La verificación se aplica a los residuos ya que éstos no tienen el
inconveniente de ser afectados por los factores, ellos tienen una media común igual a cero.
Los supuestos se checan con observaciones que sean independientes de si la hipótesis nula es
cierta o no, ya que no tiene sentido que la validez de la prueba descanse en si se rechaza o no
la hipótesis nula; los datos crudos tienen el inconveniente de que dependen de su media de
tratamiento individual y esto repercute en las diferencias entre tratamientos. Los residuos por
su parte al tener una media común igual a cero, no dependen de si la hipótesis nula es cierta o
no, de hecho es lo que queda de la variabilidad de los datos no atribuible a los tratamientos,
por esta razón se emplean para verificar los supuestos.

También pueden verificarse con los datos crudos dentro de un mismo tratamiento ya que
tienen una media común yi., con estos datos no se podría checar que las varianzas de las a
poblaciones son homogéneas, de ahí que se empleen los residuos y así es posible verificar
todos los supuestos. Es importante recordar que los residuos son estimadores de los errores, ya
que no es posible conocer al verdadero valor poblacional de las medias de los tratamientos.

A pesar de esto, se pueden presentar, de los datos crudos, los estadísticos descriptivos
siguientes:
Resumen Estadístico para Rendimiento
Fertilizante Frecuencia Media Mediana Varianza Desviación típica
--------------------------------------------------------------------------------------------
1 8 103.375 103.0 1.41071 1.18773
2 10 74.5 76.5 55.1667 7.42743
3 10 83.2 82.5 8.62222 2.93636
14 1 100.0 100.0 0.0 0.0
15 1 104.0 104.0 0.0 0.0
--------------------------------------------------------------------------------------------
Total 30 86.9333 83.5 168.754 12.9905

Se puede observar que las medias y medianas son parecidas por lo que puede decirse que la
distribución no es de asimetría muy significativa.

El residuo se define como la diferencia entre el valor observado y el valor predicho.


eˆij  yij  yˆ ij ( 31)

En el análisis de varianza cada observación se describe por el modelo:


49

yij =  +  i +  ij
El valor predicho para este modelo:
yˆ ij  ˆ  ˆi ( 32)

Sustituyendo por sus estimadores de mínimos cuadrados:


yˆ ij  y..   yi.  y.. 
yˆ ij  yi.
Luego entonces, en el modelo de una vía, el valor del residuo es:
eˆij  yij  yi.

Se supone que en este modelo los errores se distribuyen normal e independientemente


con media cero y varianza  ².
Para obtener conclusiones válidas se recomienda verificar los supuestos de:
normalidad, independencia y homogeneidad de varianzas (Homocedasticidad). La violación
de uno o más de estos supuestos puede afectar el nivel de significancia así como la
sensibilidad de la prueba F a las discrepancias respecto a la hipótesis nula.
Los valores de los residuos crudos no son precisamente los idóneos para analizar los
supuestos, sino que son más convenientes los residuos estandarizados que permitirán localizar
fácilmente los valores no usuales o atípicos.

eij ( 33)
d ij 
CME
Estos residuos tienen media cero y varianza 1. Es decir, dij ~N(0,1). Los residuos crudos
estimados que pertenecen a un tratamiento no son independientes entre sí y no tienen la misma
varianza especialmente cuando los tamaños de muestra son desiguales, de ahí que se prefiera
utilizar los residuos estandarizados. Para el examen de los residuos se emplean las gráficas de
residuos que consisten en las que se grafican los residuos estandarizados contra los niveles de
alguna variable tales como: valores predichos, niveles del factor, orden o tiempo.

Ajuste del modelo


Si la respuesta media del modelo no se ajusta adecuadamente a los datos, se dice que existe
falta de ajuste. Para verificar el ajuste del modelo, se grafican los residuos contra los
niveles de las variables independientes (tratamientos, bloques y/o covariable) En el caso del
diseño que nos ocupa, contra los niveles del factor o tratamientos. Si el modelo se ajusta
adecuadamente a los datos, entonces la gráfica presenta un patrón aleatorio alrededor del
cero, si hay un predominio de residuos positivos para un tratamiento o de residuos
negativos para otro, nos indicaría que hay falta de ajuste.
50

Residual Plot for rendim


15

10

residual
5

-5

-10

-15
1 2 3

fertilizante

Los residuos se distribuyen alrededor del cero y no hay ni muy positivos ni muy negativos,
puede verse que no parece haber problema de ajuste más bien puede notarse que la
dispersión de los residuos del fertilizante ciamida es más grande que la dispersión de losde
los otros fertilizantes. Podría interpretarse como una señal de que la igualdad de varianzas
no se cumple.

Normalidad
La forma más simple para verificar el supuesto de normalidad consiste en hacer un
histograma de los residuos y observar si tienen una distribución normal (simétrica y en forma
de campana , con colas sin límites, unimodal y con un valor de curtosis de 3), sin embargo, no
es útil para tamaños de muestra pequeña además de que manipulando el número de intervalos
de clase puede aproximarse a una distribución normal.
Otra manera de verificar la normalidad es por medio de gráficas de residuos; una de ellas es la
gráfica de probabilidad normal; los residuos se grafican en forma ascendente contra su
probabilidad acumulada: si se observa una línea recta entonces los errores se distribuyen
normalmente; se observan desviaciones más grandes en los extremos de la recta por lo que hay
que prestar más atención a los puntos intermedios que a los extremos.
El papel de probabilidad normal está diseñado de modo que la distribución normal acumulada
se graficará como una línea recta. Para construir la gráfica se siguen los siguientes pasos:
1. Ordenar los residuos de menor a mayor.
2. Calcular las probabilidades acumuladas
Las probabilidades acumuladas se calculan con la siguiente fórmula:
k  0.375
y x100
n  0.25
donde k es el rango o posición de la observación. Otra fórmula empleada es:
k  0.5
y x100
n
Sin embargo se considera menos exacta para muestras pequeñas.
3. Graficar las probabilidades acumuladas contra los residuos. Usualmente si la
distribución es normal queda una recta. Observe los puntos centrales es decir del 33 al
67%. Las desviaciones de la línea recta indican no normalidad.
La desventaja de las gráficas de probabilidad normal es que son subjetivas y requieren
juicios basados en la experiencia. Una línea recta indica que hay poca evidencia para rechazar
el supuesto de normalidad. (Zylstra, 1995). A continuación se presentan una serie de gráficas
de probabilidad normal.
51

Distribución de colas pesada Distribución de cola ligera

Distribución sesgada a la derecha Distribución sesgada a la izquierda

Ver ejemplos de gráficas de probabilidad normal en:


[Link]

Estas gráficas permiten ver la forma de la distribución.


Una violación que distorsiona la forma de la distribución es la presencia de datos atípicos o
“outliers”. Si se observan residuos muy distanciados, llamados residuos inusitados o
extremos, se infla la estimación de la varianza del error e influye en la estimación de la media
del tratamiento” (Kuelh,2000). Éstos pueden detectarse en la gráfica de residuos contra los
52

niveles del factor; si se observa algún residuo positivo muy grande o uno negativo muy
pequeño, entonces se verifica si realmente son valores extremos o aberrantes mediante algunas
pruebas estadísticas (como la de Dixon, o el Criterio de Chauvenet: y si lo son, se averigua la
causa con el objeto de eliminarlo (en caso de ser error de observación, como por ejemplo un
laboratoriazo) o bien recurrir a algún método estadístico para proporcionar estimaciones de la
media y del valor, una vez eliminado. Un valor atípico puede ser debido a que no se anotó bien
el resultado (laboratoriazo) en cuyo caso la solución es eliminarlo del análisis, o bien, sí ser un
residuo real, ya sea porque los errores no siguen una distribución normal, o porque alguna
varianza difiere o bien porque se especificó un modelo incorrecto.

Una manera sencilla de analizar estos residuos es mediante los residuos estandarizados:
d ij =eij / CM E ( 34)

El 68% debe caer entre ±1, alrededor del 95% entre ±2, y prácticamente todos (99.7%)
deben estar entre ±3. Un residuo a una distancia mayor de 3 o 4 desviaciones estándar del
origen es potencialmente un residuo distanciado.
Si se encuentra un valor atípico se realiza el análisis con y sin el valor, si los resultados son
iguales, se deja el valor, pero si difieren en mucho, se dice que el valor atípico es de influencia.

2
Residuo estandarizado para VAR00001

-1

-2

-3

-4
.5 1.0 1.5 2.0 2.5 3.0 3.5

VAR00002

La gráfica anterior permite detectar valores atípicos, ésta es de residuos estandarizados contra
niveles del factor. Los residuos descansan entre +3 y -3, y sólo uno, -3.09, se pasa ligeramente
por lo que puede considerarse que no es atípico.

Otra manera de verificar la normalidad es haciendo gráficas de los residuos contra los valores
predichos ŷij . La ausencia de algún patrón particular de comportamiento indica distribución
normal de los errores.
Otra manera de checar la distribución normal es demostrar si las medias y varianzas son
independientes. Puede demostrarse matemáticamente que si tomamos muestras al azar de una
población, los promedios y desviaciones estándar de las muestras serán independientes si la
población tiene una distribución normal.
Cuando la varianza es proporcional al promedio del grupo, al cuadrado del promedio del
grupo, al promedio elevado a la cuarta potencia existen transformaciones simples que harán la
varianza independiente del promedio. (Más adelante se verán estas transformaciones).
53

Se utiliza el coeficiente de correlación para probar esta independencia y a su vez normalidad.


Sin embargo Fang y Case (1996) han demostrado que con el coeficiente de correlación, y por
consiguiente la prueba de normalidad, prueba más bien simetría que normalidad, y no toda
distribución simétrica corresponde a la normal.
¿Qué sucede si no se cumple el supuesto de normalidad?
El estadístico F es robusto a la no normalidad moderada, en especial si se trabaja con
diseños balanceados. Cuando la violación del supuesto tiene muy poco efecto en la
distribución del estadístico de prueba y por consiguiente en las tasas de error tipo I y II, se dice
que el estadístico es robusto respecto a la violación de dicho supuesto. Las distribuciones
sesgadas tienen muy poco efecto sobre  y en la potencia de la prueba. Si la distribución es
simétrica pero no normal también la F resulta ser una prueba robusta. Si es asimétrica se
recomienda cambiar el nivel de significación de 0.05 a 0.025 o 0.01.
Cuando se trabaja con modelos aleatorios, aunque estén balanceados, la violación a la
normalidad sí afecta en las estimaciones de los componentes de varianza.
Si los errores no se distribuyen normalmente el valor  es mayor que el aparente, esto
conduce a rechazar Ho cuando realmente es verdadera, es decir se dice que hay diferencias
cuando realmente no existen (Infla el error tipo I).
Cuando hay outliers los niveles de confianza son más bajos que los nominales, o dicho en
términos de significancia, los niveles son más altos que los nominales ( p > α).
¿Qué hacer en caso de presentarse cualquiera de estas violaciones a la normalidad?
Si se trata de diseños balanceados, realizar el análisis de varianza como es costumbre. Si la
distribución de los datos es asimétrica cambiar el nivel de 0.05 a uno menor. Si se viola mucho
el supuesto de normalidad a veces con una transformación de los valores se corrige la no
normalidad; si no ocurre de esta manera entonces se procede a trabajar con pruebas que no
hagan supuestos acerca de la distribución de las observaciones, es decir, pruebas de
distribución libre o no paramétricas. Si se trata de un valor atípico eliminarlo si es incorrecto y
trabajar el análisis de varianza como caso desbalanceado, si la observación es real transformar
los datos ya que borrarlo mejoraría el ajuste pero es peligroso porque da una idea falsa de
precisión en la estimación o en la predicción.
Normal Probability Plot for RESIDUALS
99.9
99
percentage

95
80
50
20
5
1
0.1
-15 -10 -5 0 5 10 15

RESIDUALS
Se observa que el supuesto de normalidad se cumple, y el residuo más pequeño no es atípico.

Independencia
Uno de los supuestos del análisis de varianza es el de la independencia. Se supone que
las muestras asignadas a los tratamientos proceden de poblaciones infinitas, y que son
muestras aleatorias de esta población, por esta razón se espera que las observaciones sean
independientes entre sí dentro de cada grupo y entre los grupos. Una de las formas para
verificar este supuesto es graficando los valores de las observaciones (o de los residuos)
54

contra el tiempo o contra el orden en que fueron tomadas y contra cualquier arreglo espacial
de las correspondientes unidades experimentales; cualquier tendencia (rachas altas y rachas
bajas, o rachas alternadas que indican correlación positiva y negativa respectivamente) indica
que quizá no hubo una buena aleatorización y por lo tanto que existe dependencia entre las
observaciones. Otro modo de checar este supuesto es mediante el cálculo de la correlación
serial entre observaciones adyacentes. Si la correlación es diferente de cero, se dice que existe
dependencia entre las observaciones adyacentes. Si ocurre esto los estimadores de mínimos
cuadrados de los parámetros se ven afectados al igual que el cuadrado medio del error. Éste
disminuye y por consiguiente la F aumenta, y se rechazará la hipótesis nula cuando debe
aceptarse (infla el error tipo I).
Existen pruebas para verificar si los errores están o no correlacionados como la prueba
de Durbin-Watson (Hines y Montgomery, 1972).(Consúltese, Dunn,1987). La prueba de
Durbin Watson sólo es aplicable para datos de series de tiempo. Una buena aleatorización es la
que asegura la distribución independiente de los errores.
Para verificar la independencia puede llevarse a cabo una prueba de aleatoriedad que es la
prueba de rachas. Esta se puede definir como una secuencia de observaciones con el mismo
signo (+ o -).
La prueba consiste en ordenar los residuos en el orden en que se obtuvieron los datos
respectivos. Contar el número de corridas r o rachas de resultados positivos (n1) y contar el
número de corridas de residuos negativos (n2). Si N es menor o igual a 20, rechazar la
hipótesis de aleatoriedad si r < rL o si r > rU, donde rL y rU son los valores críticos de la tabla
A30 que se anexa a estas notas. Para tamaños de muestra grandes rechace la hipótesis de
aleatoriedad si z > z/2.
r    0.5 ( 35)
z

2n1n2 ( 36)
  1
n1  n2
2n1n2 (2n1n2  n1  n2 ) ( 37)

(n1  n2 )( n1  n2  1)

De esta manera se puede verificar si se cumple el supuesto de independencia.


Si se conduce el análisis bajo el supuesto de independencia cuando realmente no la hay, los
verdaderos niveles de significancia pueden ser más altos del que se había propuesto y la
potencia ser menor de lo esperado. Si se dice que se tiene una probabilidad de 0.05 de cometer
el error tipo I, si hay dependencia temporal o espacial, el valor de la probabilidad será > 0.05,
lo que conduciría incrementar la probabilidad de rechazar Ho dado que es verdadera. Una
buena aleatorización es la que evita la violación a este supuesto. Si se observa alguna
tendencia en la gráfica de residuos por ganancia en experiencia o por cansancio, dicha
tendencia lineal pude manejarse introduciendo al modelo términos que representen el efecto
del tiempo o del espacio. Entonces el modelo se convertiría de un diseño de un factor o
dirección en uno de covarianza con un solo factor, donde el tiempo es la covariable.

Homogeneidad de varianzas
La homocedasticidad u homogeneidad de las varianzas es otro de los supuestos del
análisis de varianza que supone que las varianzas de las a muestras tienen varianzas iguales
55

pues proceden de la misma población infinita. La heterogeneidad de las varianzas no afecta


tanto en el modelo de efectos fijos y balanceado, pero sí lo hace en el de efectos aleatorios y en
el caso desbalanceado.
Una manera de checar la homocedasticidad es mediante gráficas de residuos contra los niveles
del factor, o bien de los residuos contra los valores predichos. Si las varianzas son iguales se
espera encontrar una banda.

Algunas violaciones a la homocedasticidad se presentan en las siguientes gráficas


.

Las varianzas de los tratamientos son distintas. Si esta misma forma se presenta en una gráfica
de residuos contra valores predichos, significa que la varianza está en función de y, es decir,
aumenta con el valor de y, o en forma inversa, disminuye con el valor de y. Otro patrón que se
puede observar es el siguiente:

Este doble megáfono es evidencia de que el tratamiento 2 tiene mucha variabilidad en


contraposición al 1 y 3.
En el ejemplo, la gráfica de residuos contra valores predichos exhibe un patrón sistemático ya
que la varianza disminuye conforme se incrementa la media (o valor predicho). Note que el
rango de variación de los residuos del fertilizante a base de amonio duplica o quizá triplica el
rango de variación del fertilizante a base de dietanoldiamida.
Cuando no existe una variación sistemática de los residuos- es decir, la varianza no aumenta o
disminuye conforme aumenta la media- es muy útil la gráfica de residuos contra niveles del
factor ya que permite ver cuál tratamiento exhibe una mayor varianza de los residuos y cuál
exhibe la menor variabilidad. En esta última gráfica no pueden verse patrones sistemáticos de
los residuos ya que no están ordenados los tratamientos.
56

Residual Plot for rendim


15

10
residual
5

-5

-10

-15
74 79 84 89 94 99 104
predicted rendim

Existen pruebas estadísticas para checar la homogeneidad de varianzas, tal como la prueba de
Bartlett el cual es un estadístico con distribución ² con a-1 grados de libertad. Para tamaños
de muestras iguales se emplea la prueba de Cochran que se usa para detectar si una varianza es
mucho mayor que las otras. Estas pruebas tienen la desventaja de que requieren gran número
de réplicas para que tengan potencia. Y la de Bartlett por ejemplo, es muy sensible a la no
normalidad.
La prueba de Cochran se restringe a situaciones donde existen tamaños de muestra
iguales, y se trata de demostrar que una varianza es mucho más grande que las otras. El
estadístico de prueba es el siguiente:
2 ( 38)
G = aS i
 Si2 i=1

donde la Si del numerador es la varianza más grande de los a grupos. Se rechaza laHo de
igualdad de varianzas si g > ga. (Tabla A-11, Walpole & Myers, 1990).

La prueba de Bartlett también se utiliza para probar:


Ho = j2  i, j.
Y se puede utilizar cuando los tamaños de muestra no son iguales. El estadístico de Bartlett se
distribuye como una  ² con a-1 g. l.
² = q/c, ( 39)

donde,
q = (N - a) log S - (ni - 1) log S i2
2
p
( 40)

y,
1  a 1 1  ( 41)
c = 1+   - 
3(a - 1)  i=1 ( ni - 1) (N - a) 
a ( 42)
 ( ni -1) Si2
i=1
Sp=
N -a

Se rechaza Ho si ²o >²a, a-1 .


57

Existen también estadísticos que prueban que la varianza más pequeña es


significativamente diferente del resto (Nelson, 1993).

Prueba Fmax
Para a grupos de igual tamaño (n) se calculan las varianzas si2. Encontrar la más grande y la
más pequeña y calcular el estadístico F max
s2 ( 43)
Fmax  max2
 F ;a ,n1
s min
Si el estadístico es mayor que el valor Fmax de la tabla, rechazar la hipótesis nula de
igualdad de varianzas. Esta prueba también es conocida como de Hartley quien proporciona
la distribución de muestreo del estadístico Fmax. Los parámetros para esta distribución son
el número a de tratamientos y los grados de libertad para cada una de las varianzas de los
tratamientos. En la siguiente página se presenta una porción de la tabla Fmax.
Esta prueba es rápida, y es afectada por la no normalidad, y emplea una tabla que no en
cualquier texto se presenta.

Fmax Distribution
 Column values are the number of groups.
 Row values are (n-1) in each group.
2 3 4 5 6 7 8 9 10 11 12
.05 39 87.5 142 202 266 333 403 475 550 626 704
2
.01 199 448 729 1036 1362 1705 2063 2432 2813 3204 3605
.05 15.4 27.8 39.2 50.7 62 72.9 83.5 93.9 104 114 124
3
.01 47.5 85 120 151 184 216 249 281 310 337 361
.05 9.6 15.5 20.6 25.2 29.5 33.6 37.5 41.4 44.6 48 51.4
4
.01 23.2 37 49 59 69 79 89 97 106 113 120
.05 7.15 10.8 13.7 16.3 18.7 20.8 22.9 24.7 26.5 28.2 29.9
5
.01 14.9 22 28 33 38 42 46 50 54 57 60
.05 5.82 8.38 10.4 12.1 13.7 15.0 16.3 17.5 18.6 19.7 20.7
6
.01 11.1 15.5 19.1 22 25 27 30 32 34 36 37
.05 4.99 6.94 8.44 9.7 10.8 11.8 12.7 13.5 14.3 15.1 15.8
7
.01 8.89 12.1 14.5 16.5 18.4 20 22 23 24 26 27
.05 4.43 6.0 7.18 8.12 9.03 9.8 10.5 11.1 11.7 12.2 12.7
8
.01 7.5 9.9 11.7 13.2 14.5 15.8 16.9 17.9 18.9 19.8 21
.05 4.03 5.34 6.31 7.11 7.8 8.41 8.95 9.45 9.91 10.3 10.7
9
.01 6.54 8.5 9.9 11.1 12.1 13.1 13.9 14.7 15.3 16 16.6
.05 3.72 4.85 5.67 6.34 6.92 7.42 7.87 8.28 8.66 9.01 9.34
10
.01 5.85 7.4 8.6 9.6 10.4 11.1 11.8 12.4 12.9 13.4 13.9
.05 3.28 4.16 4.79 5.3 5.72 6.09 6.42 6.72 7.0 7.25 7.48
12
.01 4.91 6.1 6.9 7.6 8.2 8.7 9.1 9.5 9.96 10.2 10.6
.05 2.86 3.54 4.01 4.37 4.68 4.95 5.19 5.4 5.59 5.77 5.93
15
.01 4.07 4.9 5.5 6.0 6.4 6.7 7.1 7.3 7.5 7.8 8.0
58

.05 2.46 2.95 3.29 3.54 3.76 3.94 4.1 4.24 4.37 4.49 4.59
20
.01 3.32 3.8 4.3 4.6 4.9 5.1 5.3 5.5 5.6 5.8 5.9
.05 2.07 2.4 2.61 2.78 2.91 3.02 3.12 3.21 3.29 3.36 3.39
30
.01 2.63 3.0 3.3 3.4 3.6 3.7 3.8 3.9 4.0 4.1 4.2
.05 1.67 1.85 1.96 2.04 2.11 2.17 2.22 2.26 2.30 2.33 2.36
60
.01 1.96 2.2 2.3 2.4 2.4 2.5 2.5 2.6 2.6 2.7 2.7
.05 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00
inf
.01 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00 1.00

Prueba de Levene.
La hipótesis que se prueba es que las varianzas son iguales contra la alternativa de que al
menos un par es diferente, consiste en realizar un análisis de varianza a las observaciones a
Las que se les ha restado las respectivas medias de los tratamientos. Si la prueba F es
significativa entonces se rechaza H0 de igualdad de varianzas

Prueba Modificada de Levene o Levene (Med)


Esta prueba no es tan sensible a la no normalidad como lo es la de Bartlett, la Fmax u la de
Cochran y consiste en restar a cada valor yij el valor de la mediana ~ yi. y con los valores
absolutos de estas diferencias se lleva a cabo un análisis de varianza. Si la hipótesis nula se
rechaza significa que las varianzas son distintas.

Una regla práctica que se aplica es comparar la varianza más grande contra la más pequeña, si
2
el valor de s grande s 2pequeña >3, entonces se dice que las varianzas no son iguales, aunque no
necesariamente sea así.

¿Qué ocurre si se viola el supuesto de homocedasticidad?


Si se trata de un diseño balanceado y una de las varianzas es considerablemente mayor que las
otras, los niveles de significancia varían sólo ligeramente con respecto a los verdaderos
valores. Es decir, cuando se trata de diseños balanceados la heterocedasticidad afecta
ligeramente el nivel . Pero si se trata de diseños desbalanceados, el  real parece verse
incrementado sobre el nominal, especialmente si las muestras más pequeñas presentan las
varianzas mayores. Si las muestras grandes tienen las varianzas mayores la prueba F es
conservadora, es decir, los niveles de significancia son similares a los reales. Pero para casos
desbalanceados se infla la probabilidad de cometer el error tipo I, es decir, que si se eligió
trabajar con un nivel nominal de 0.05 el nivel se incrementa por ejemplo a 0.058 lo que
conduciría a rechazar dado que es verdadera. Si el estadístico tiene una probabilidad de 0.049,
yo rechazo, pero realmente debía haber aceptado por que el nivel de probabilidad real es de
0.058 y no 0.05.
Si hay desigualdad de varianzas pero las gráficas de residuos contra valores predichos no son
de tipo megáfono, no existe alguna transformación adecuada, en cuyo caso se puede utilizar un
método de análisis de datos diseñado para cuando las varianzas no son iguales y que es la
59

aproximación de Satterwaite que viene explicada en el libro de diseño de experimentos de


Dean y Voss (1999).
Cuando las varianzas no son homogéneas las comparaciones múltiples y por parejas son más
fuertemente afectadas que el análisis de varianza.

¿Qué hacer si el supuesto de homogeneidad de varianzas no se cumple?


Cuando el supuesto de homocedasticidad no se cumple, las varianzas pueden
homogeneizarse mediante transformaciones de los datos originales, y dar las interpretaciones
en función de los datos transformados o retransformarlos a la escala original. Es importante
notar que las conclusiones se aplican a las poblaciones transformadas.
Anderson (1974) proporciona una serie de reglas básicas para la realización de
transformaciones.
i) Si la prueba de homogeneidad se acepta a un nivel a 0.01, no transformar.
ii) Si la prueba de homogeneidad se rechaza a nivel a 0.001, entonces transformar.
iii) Si los resultados de la prueba de homogeneidad está entre 0.01 y 0.001, tratar de
encontrar la distribución teórica de la distribución. Si existe una razón práctica para
transformar, hacerlo. De otra manera, se recomienda no transformar. Probar con los
programas estadísticos las diversas transformaciones y las pruebas de homogeneidad
de varianzas y seleccionar aquél que estuviera mejor en la región de aceptación. Es
importante que pueda ser transformado y que esta transformación tenga sentido.
Otra forma de checar si son necesarias las transformaciones y averiguar cuál es la más
adecuada, es haciendo una serie de gráficas de las medias de los a grupos contra sus varianzas
o desviaciones estándar; si se observa independencia entre las medias y desviaciones no es
necesaria ninguna transformación y la distribución que siguen los datos es normal.

Es importante recalcar que cuando se transforman los datos, los niveles de significancia y las
inferencias se aplican a la escala transformada, pero cuando se presenten las medias es
conveniente retransformarlas a la escala original que es donde tienen sentido. Igualmente los
intervalos de confianza dentro de los que descansan las medias se transforman a la escala
original, téngase en cuenta que cuando los datos se han transformado a logaritmo, al
retransformar a la escala original con antilogaritmo los valores de los intervalos de confianza
no son simétricos respecto a la media.

Las transformaciones de potencia del tipo X = Yp consisten en las siguientes transformaciones:


Potencia Yp Nombre
2 Y2 Elevación al cuadrado
1 Y Dato crudo
½ √Y Raíz cuadrada
0 Ln(Y) Logaritmo natural
-1/2 1/√Y Recíproco de raíz cuadrada
-1 1/y Recíproco

Se puede comenzar con la raíz cuadrada y progresivamente aumentando la potencia hasta


llegar al recíproca.

Transformación logarítmica
60

Se emplea para estabilizar la varianza de Y si ésta aumenta marcadamente conforme


se incrementa o dicho de otro modo cuando el cambio en la respuesta es de tipo
multiplicativo y no aditivo (ejemplo cuando trabajamos con bacterias la trasformación
adecuada es la logarítmica pues su curva de crecimiento es tipo exponencial); también se
emplea, para normalizar la variable dependiente si la distribución de los residuos de Y está
sesgada positivamente (es decir hay algunos valores muy grandes) y, para linealizar un
modelo de regresión si la relación de Y con x sugiere un modelo con una pendiente
consistentemente en ascenso. (Modelo exponencial).

Modelo de regresión con pendiente aumentando consistentemente

La varianza de los residuos se incrementa al aumentar la media

Distribución con sesgo positivo

Transformación raíz cuadrada


Se utiliza para estabilizar la varianza si ésta es proporcional a la media de Y. Esto es
apropiado cuando la variable tiene una distribución de Poisson (Conteos). El número de
colonias de bacterias encontradas en las placas, o el número de defectos o accidentes por
unidad de tiempo siguen una distribución de Poisson porque la probabilidad de éxito es
muy pequeña.
En la distribución de Poisson la media es igual a la varianza. Al obtener la raíz cuadrada de
las observaciones, esta transformación tendrá una varianza constante de 0.25 para todos los
valores de las medias. Si las muestras son grandes no es necesaria la transformación
(Kuehl, 2001).
Transformación recíproca
Se utiliza para estabilizar la varianza si ésta es proporcional a la cuarta potencia de
la media de Y, lo cual indica que hay un gigantesco incremento de la varianza arriba de
algún valor límite de Y. Esta transformación minimiza el efecto de valores grandes de Y.
61

Elevación al cuadrado
Se usa para estabilizar la varianza si ésta disminuye con la media de Y, para
normalizar la variable dependiente si la distribución de los residuos está negativamente
sesgada y, para linealizar el modelo si la relación original es curvilínea hacia abajo (la
pendiente disminuye consistentemente conforma la variable independiente aumenta).

Relación curvilínea hacia abajo, la pendiente disminuye cuando aumenta X

La varianza aumenta con la media Y

Distribución con sesgo negativo


Transformación arco seno
Se emplea para estabilizar la varianza si Y es una tasa o proporción. O de conteos de
una variable aleatoria binomial. Las observaciones de número de éxitos en n pruebas
independientes siguen una distribución binomial. Por ejemplo, la proporción de artículos
defectuosos o proporción de plantas que florecen en una sección.

En esta distribución la probabilidad estimada es ̂  y n y es el número de éxitos en n


pruebas.
Media   
 1   
Varianza  2 
n
La transformación arco seno es:
arcseno( ˆ )  sen 1 ˆ
62

Si n es pequeño se sustituye ̂ por (y + 3/8)/(n+3/4)


1 ( 44)
y 3  2
1  8
x  sen  
 n  4 
3

es aproximadamente normal con media µ=sen-1 y desviación estándar 1/2n.???


+---------------------------------------------+
| Potencia Transformación Re-expresión |
|---------------------------------------------|
| 3 Cubo x 3 |
| | Corrigen asimetría negativa
| 2 Cuadrado x 2 |
| |
| 1 NINGUNA x |
| |
| 1/2 Raíz cuadrada raíz x |
| | Corrigen asimetría positiva
| 0 Log log10 x |
| |
| -1/2 raíz del recíproco -1/(raíz x) |
| |
| -1 Recíproco -1 / x |
+---------------------------------------------+
Esta familia de transformaciones (“escalera de Tukey”) tiene importantes propiedades:
1. Preservan el orden de los valores; es decir, los valores mayores de la escala original
seguirán siendo los valores mayores en la escala transformada.
2. Modifican la distancia entre los valores. Con potencias p<1 (raíz (x) o log (x) se
comprimen los datos en la parte superior de la distribución en relación a los valores
menores; Con potencias p>1 (como el cuadrado de x) se tiene el efecto contrario.
3. El efecto sobre la forma de la distribución cambia sistemáticamente con p. Si raíz (x)
hace menos pronunciada la asimetría positiva de una distribución, el log (x) provocará
que la distribución resultante sea aún menos asimétrica positiva (en relación a raíz (x).
Las transformaciones de potencia pueden hacer que la variable transformada tenga menos
asimetría. ¿Por qué es eso importante?
– Las distribuciones que muestran una clara asimetría son difíciles de estudiar.
– Los valores originales aparentemente atípicos se encontrarán más cercanos al grueso de
los datos.
– Los métodos estadísticos suelen emplear la media aritmética; pero la media de una
distribución asimétrica no es un buen índice del grueso de los datos.
Un modo muy empírico de averiguar qué tipo de transformación es la más adecuada
involucra encontrar una función de los datos h(yij) de modo que el modelo:
h( yij )   *   i*   ij
cumpla con los supuestos.
Se supone que en este modelo transformado los errores ya cumplen con los supuestos de
normalidad, independencia y homogeneidad de varianzas.
Si la relación entre las varianzas de los a grupos y sus medias es clara, puede encontrarse
un tipo de transformación adecuada. Si la varianza aumenta al aumentar la media (forma de
megáfono) o si la relación es inversa, la relación entre la varianza y la media es:
Las desviaciones estándar son proporcionales a alguna potencia de la media, como puede
verse en la siguiente ecuación.
63

 i2  k i q ( 45)

 i2  k    i q ( 46)

donde, k y q son constantes.


La cuestión está en encontrar el valor de q. Y para encontrarla, se obtiene los logaritmos de
ambos lados de la ecuación.
 
ln si2  ln k  q ln  yi.  ( 47)

Si se grafican los ln de las varianzas muestrales contra sus respectivas medias muestrales se
obtiene un diagrama de dispersión cuya pendiente sería el valor aproximado de q.
1-(q/2)
Si q es distinta de 2 entonces y*ij=yij , si q =2 entonces y* = ln y.

Si se supone distribución normal, entonces es realmente una aproximación a la Poisson, así,


la varianza sería igual a la media y q =1, y la transformación de raíz cuadrada sería la
apropiada.

Salida de Cómputo. Statgraphics.


Summary Statistics for rendim
Fertilizante Cuenta Promedio
------------------------------------------------------------
1 10 103.1
2 10 74.5
3 10 83.2
------------------------------------------------------------
Total 30 86.9333

fertilizante Varianza Desviación estándar


------------------------------------------------------------
1 2.32222 1.52388
2 55.1667 7.42743
3 8.62222 2.93636
------------------------------------------------------------
Total 168.754 12.9905

Análisis de Varianza
-----------------------------------------------------------------------------
Fuente SC g.l. CM F P-Value
-----------------------------------------------------------------------------
Between groups 4298.87 2 2149.43 97.54 0.0000
Within groups 595.0 27 22.037
-----------------------------------------------------------------------------
Total (Corr.) 4893.87 29

Tabla de Medias para rendimiento por Fertilizante con LSD al 95% de confianza
--------------------------------------------------------------------------------
Stnd. error
fertilizante Cuenta Media s pooled Límite inferior L. superior
--------------------------------------------------------------------------------
1 10 103.1 1.48449 100.946 105.254
64

2 10 74.5 1.48449 72.3462 76.6538


3 10 83.2 1.48449 81.0462 85.3538
--------------------------------------------------------------------------------
Total 30 86.9333

Multiple Range Tests for rendim by fertilizante


-------------------------------------------------------------------------------
Method: 95.0 percent LSD
fertilizante Cuenta Media Grupos homogéneos
--------------------------------------------------------------------------------
2 10 74.5 X
3 10 83.2 X
1 10 103.1 X
--------------------------------------------------------------------------------

Contraste Diferencia +/- Límites


--------------------------------------------------------------------------------
1-2 *28.6 4.30759
1-3 *19.9 4.30759
2-3 *-8.7 4.30759
--------------------------------------------------------------------------------
* denota una diferencia estadísticamente significativa

Varianza Check
Cochran's C test: 0.834454 P-Value = 0.0000646376
Bartlett's test: 2.13183 P-Value = 0.0000589774
Hartley's test: 23.756

Means and 95 .0 Percent LSD Intervals


112

102
rendim

92

82

72
1 2 3

fertilizante

Box-and-Whisker P lot

1
fertilizante

60 70 80 90 100 110

rendim
65

Residual Plot for rendim


15

10
residual 5

-5

-10

-15
1 2 3

fertilizante

Residual Plot for rendim


15

10
residual

-5

-10

-15
74 79 84 89 94 99 104
predicted rendim

Residual Plot for rendim


15

10
residual

-5

-1 0

-1 5
0 5 10 15 20 25 30

row number

Normal Probability Plot for RESIDUALS


99.9
99
percentage

95
80
50
20
5
1
0.1
-15 -10 -5 0 5 10 15

RESIDUALS

Ejercicio: Proponer la transformación adecuada para estos datos y realizar el análisis con la
escala transformada. Emplee el Statgraphics.

Se puede observar en la gráfica de residuos contra niveles del factor, que las varianzas no
son homogéneas, esto se puede confirmar con la prueba de Bartlett o la de Levene. El valor
p asociado al estadístico de la prueba de Bartlett es de 0.0000589, que si aplicamos el
criterio de Anderson, es candidato a una transformación.
La pregunta ahora es ¿existe una transformación adecuada para este conjunto de datos?. Ya
se ha dicho que si el patrón observado en la gráfica de residuos contra valores predichos es
del tipo de megáfono, entonces sí existe una transformación adecuada para ese conjunto de
datos.
66

Se pueden probar distintas transformaciones que incluyan: logaritmo, raíz cuadrada,


elevación al cuadrado o arco seno; la elección de cuál sería la más adecuada se hace
basándonos en:
1) El tipo de datos de que se trate: si son porcentajes, tasas, conteos.
2) Patrón de comportamiento de la varianza respecto a la media, es decir observando la
gráfica de residuos contra el valor predicho.
3) Si la respuesta es resultado del efecto multiplicativo o aditivo de otros factores,
4) La simetría o asimetría de la distribución
5) En regresión, la relación que guardan la variable dependiente y la independiente.

Si observamos la gráfica de residuos contra valores predichos (medias de los tratamientos,


en este caso), se puede ver que la varianza disminuye conforme se incrementa la media. Es
decir es un megáfono con la parte más angosta en el lado derecho: la elevación al cuadrado
estabiliza la varianza cuando ésta disminuye con la media y normaliza cuando la
distribución de residuos está negativamente sesgado.

Probemos pues transformar la variable elevando al cuadrado los valores de y. A


continuación presentamos la salida del Statgraphics.

Análisis de la Varianza
------------------------------------------------------------------------------
Fuente Sumas de cuad. g.l.. Cuadrado Medio Cociente-F P-Valor
------------------------------------------------------------------------------
Entre grupos 1.35969E8 2 6.79846E7 134.90 0.0000
Intra grupos 1.36069E7 27 503959.0
------------------------------------------------------------------------------
Total (Corr.) 1.49576E8 29

Contraste de Varianza
Contraste C de Cochran: 0.773037 P-valor = 0.000875815
Contraste de Bartlett: 1.65825 P-valor = 0.0014937
Contraste de Hartley: 11.9315
Test de Levene: 6.226 P-valor = 0.00597694

Tabla de Medias para rendim^2 según fertiliz


con 95.0 intervalos de confianza
--------------------------------------------------------------------------------
67

Error Estándar
fertiliz Frec. Media (s agrupada) Límite inf. Límite sup.
--------------------------------------------------------------------------------
1 10 10631.7 224.49 10171.1 11092.3
2 10 5599.9 224.49 5139.28 6060.52
3 10 6930.0 224.49 6469.38 7390.62
--------------------------------------------------------------------------------
Total 30 7720.53

Contraste Múltiple de Rango para rendim^2 según fertiliz


--------------------------------------------------------------------------------
Método: 95.0 porcentaje LSD
fertiliz Frec. Media Grupos homogéneos
--------------------------------------------------------------------------------
2 10 5599.9 X
3 10 6930.0 X
1 10 10631.7 X
--------------------------------------------------------------------------------
Contraste Diferencias +/- Límites
--------------------------------------------------------------------------------
1-2 *5031.8 651.411
1-3 *3701.7 651.411
2-3 *-1330.1 651.411
--------------------------------------------------------------------------------
* indica una diferencia significativa.

Se puede observar que existe efecto de los fertilizantes sobre el rendimiento 2 del trigo; o
existe diferencia entre fertilizantes cuando el rendimiento se ha transformado elevándolo al
cuadrado.

Se puede ver con las pruebas de varianzas para checar el supuesto de homocedasticidad que
aunque se rechaza la hipótesis de homocedasticidad a un nivel de 0.05, si nos apegamos al
criterio citado por Anderson, tanto la prueba de Bartlett como la de Levene, el nivel de
probabilidad se ha incrementado a un valor mayor que 0.001. Podemos hacer caso incluso a
la prueba de Bartlett ya que la normalidad se cumple como puede verse en la gráfica de
probabilidad normal. El valor del residuo sospechosamente atípico: 1999 puede
estandarizarse o transformarse a un puntaje z ( o residuo estandarizado):

x
z

y ij  ˆ i.
z
CM E
eij
z
CM E
1999
z  2.81
503959

para ver si realmente se trata de un valor atípico o no, y como puede verse queda
comprendido entre -3 y +3 como diría la regla empírica y no puede considerarse atípico; los
68

demás puntos de la gráfica de probabilidad normal sí se aproximan a una línea recta por lo
que se cumple la normalidad y por consiguiente también la prueba de Bartlett es válida para
verificar el supuesto de homogeneidad de varianzas.
Gráfico de Residuos para rendim^2
(X 1000)
2

residuo
0

-1

-2
1 2 3
fertiliz

Gráfico de Residuos para rendim^2


(X 1000)
2

1
residuo

-1

-2
55006500 7500 8500950010500
11500
rendim^2 predicho

Gráfico de Probabilidad Normal


99.9
99
95
porcentaje

80
50
20
5
1
0. 1
-2 -1 0 1 2
(X 1000)
RESIDUALS2

Las pruebas de comparación múltiple arrojan los mismos resultados, es decir existen
diferencias entre todas las medias.

NOTA:
Para decidir finalmente sobre una transformación se puede realizar el análisis con y sin
transformación. Si las conclusiones no cambian entonces los presentamos de la manera en
que sean más interpretables en la vida real, usualmente, la escala original.

Cuando se realiza un experimento debido a que se trabajan con muestras, es posible que si
para una muestra funcionó una determinada transformación, ésta puede no ser la válida al
realizar de nuevo el experimento con otra muestra.

En nuestro ejemplo debido a que con los dos análisis llegamos a las mismas conclusiones
podemos dejar el análisis con los datos originales porque son más fácilmente interpretables,
la prueba de Levene con los datos originales no justifica una transformación de datos y no
69

se tiene una idea de la distribución teórica de este tipo de datos que sugieran una
transformación.

Comparaciones Múltiples
Cuando se realiza un experimento, se está interesado no sólo en saber si existe un efecto
significativo del factor, sino una variedad de cuestiones que pueden resolverse utilizando
pruebas de comparación múltiple: por ejemplo, nos puede interesar averiguar si al incrementar
la dosis de un fármaco, incrementa o no la mejoría de cierto síntoma, o nos interesa comparar
distintas formulaciones presentes en el mercado contra una nueva propuesta, o bien puede
interesarnos en comparar dos dietas bajas en fibras contra tres altas en fibras. Es decir, no
limitarnos meramente a comparar parejas de medias, sino grupos de medias.

Existen dos formas principales, a priori cuando el investigador se interesa en averiguar si


existe diferencia entre tratamientos elegidos por él y el análisis de varianza sólo le sirve para
tener una estimación del error, o bien a posteriori que puede ser averiguando si existen
diferencias entre aquéllas medias sugeridas por los datos, o bien comparando todos los
posibles pares de medias una vez que se ha rechazado la hipótesis nula.

Se puede estar interesado en comparar parejas de medias y para ello no es necesario hacer
un análisis de varianza basta con una prueba de hipótesis y la prueba t pertinente. El nivel
de significación da cada comparación (de cada hipótesis) es α o probabilidad de cometer el
error tipo I (Rechazar Ho dado que es verdadera), o decir que las dos medias son distintas
cuando realmente son iguales. Al nivel de significancia α se le llama nivel de significancia
por comparación.

Otra forma de probar las diferencias entre parejas de medias es a través intervalos de
confianza para diferencias de medias, recordemos que si el intervalo contiene al cero,
decimos que esas medias son iguales ya que el 95% de las veces la diferencia entre ellas
puede ser nula. El intervalo de confianza para una diferencia de medias es pues, una
alternativa a la prueba t.
La ventaja de los intervalos es que de acuerdo a los signos (+ o -) nos dice qué medias son
más grandes o más chicas. Asimismo el ancho del intervalo de confianza nos dirá si una
prueba es conservadora y sólo detecta las diferencias grandes, o sensible (potente) si detecta
las muy pequeñas diferencias.

Tasas de Error
Una cuestión muy importante al realizar las comparaciones múltiples es el nivel de
significancia con el que se trabaja.
Cuando se realiza una comparación a priori, se respeta el nivel de significancia de la prueba
individual si se cumplen los supuestos. Pero cuando se realiza más de una prueba con el
mismo conjunto de datos, el nivel con el que se trabaja no es el que corresponde a  sino que
es mucho más grande que el nivel establecido para cada prueba.
Si se realizan comparaciones independientes de parejas de medias cada una con un nivel 
(error por comparación) la probabilidad de no cometer error en una sola prueba es 1 - , y si se
realizan m comparaciones independientes cada una con su nivel , entonces la probabilidad de
70

no cometer error en ninguna de las comparaciones es (1-)m. La probabilidad de cometer al


menos un error tipo 1 es 1 - (1-)m.
Bajo Ho, es decir cuando las medias de tratamiento son iguales, y al hacerse una familia de
comparaciones no planeadas entre parejas de medias, la probabilidad de declarar al menos un
par de tratamientos diferente la proporciona la tasa de error experimental o error del
experimento.
Bajo H0 la probabilidad de cometer el error tipo I para cualquier prueba es  y la probabilidad
de concluir correctamente es (1-). Cuando se tienen k tratamientos y se realizan
 k  k k  1
comparaciones por parejas, existen     m comparaciones posibles. Por lo que se
 2 2
pueden cometer x errores tipo I (donde x = 0, 1, 2, 3, 4, 5 o 6). La probabilidad de cometer x
errores tipo I:
( 48)
P x    x 1   nx
n!
x!(n  x)!

La probabilidad de no cometer el error tipo I es P(0)


( 49)
P0   x 1   n  x  1   n  x
n!
x!(n  x)!

La probabilidad de cometer al menos un error tipo I en el conjunto de comparaciones es


P(x1) = 1 – P(X=0)
P( x  1)  1  1   
n x

En resumen, si se está trabajando con k medias y se contrastan k-1 contrastes independientes


(ortogonales) la tasa de error para cada uno de estos contrastes es:
E = 1-(1-)k-1
k-1= m .
donde E es la probabilidad de cometer el error tipo I en el experimento completo y  es la
probabilidad de cometer el error tipo I en una comparación y k-1 es el número de
comparaciones independientes u ortogonales.

Esta tasa de error se incrementa con el número de comparaciones a hacer, m. También se le


conoce como tasa de error familiar y se aplica este término cuando sólo un subconjunto del
experimento entero se analiza, en términos de m pruebas y el experimentador desea controlar
la tasa de error para ese subconjunto de pruebas, en este caso se refiere a la probabilidad de
cometer el error tipo I para la familia de interés.
La familia es una colección de inferencias para los cuales es significativo tomar en cuenta la
medición total del error. Por ejemplo la colección de todas las comparaciones por parejas es
una familia, donde la medición del error total es la probabilidad de encontrar al menos un error
tipo I. (Rafter et al, 2002).
¿Qué familias de comparación se eligen para analizar? Depende del tipo de investigación, si es
confirmatoria, en la cual se especifican un número finito de comparaciones antes del estudio.
71

O si se trata de una investigación exploratoria donde las comparaciones se eligen una vez
observados los datos.

Cuando las comparaciones son independientes la tasa de error experimental o por familia es
igual a 1 – (1-)m, pero si no son independientes la tasa de error es :
 1 – (1-)m.
Suponga que se eligió un nivel de 0.05 y son seis medias. Si las seis medias son iguales la
probabilidad de rechazar incorrectamente una o más comparaciones ortogonales es:
E = 1-(1-0.05)5= 0.23 que es un valor cinco veces más grande que el nivel establecido para
cada prueba. Si uno desea un nivel de 0.05 para el conjunto de los 5 contrastes, el nivel de
cada contraste debe ser: =1-(1-0.05)1/k-1
=1-(1-0.05)0.2=0.01.
La tasa de error por familia es la probabilidad de cometer al menos un error tipo I en las m
comparaciones. Si quisiéramos saber el error total que cometemos al hacer las m
comparaciones bastará con obtener la tasa de error experimental o por experimento que es
igual a (m) (αc). Si por ejemplo con tres tratamientos corremos todas las comparaciones por
parejas posibles, que serían tres, cada una con un nivel de 0.05, terminaremos con un nivel
final (probabilidad de cometer el error tipo I) de 0.15 o 15% de tasa de error experimental.
Se puede comprobar que las tres tasas de error, por comparación, por familia y experimental
guardan la siguiente relación:

αc <FW < PE

Existen métodos de comparación múltiple que controlan la tasa de error experimental: el


método de Bonferroni y el de Tukey. Otras pruebas como la DSM, la de Duncan y la de
Newman Keuls no controlan la tasa de error experimental. Por otro lado cuando la
comparación es planeada se supone que se respeta el nivel  con el que se trabaja y por tanto
sí se controla la tasa del error experimental.

Los métodos de comparación múltiple que mantienen la probabilidad  para el conjunto de


comparaciones que se realiza, independientemente del número de comparaciones, son pruebas
exactas o conservadoras y son la Scheffé, la de Tukey y Contrastes. No inflan la probabilidad
del error tipo I.

Cuando se aplican comparaciones sugeridas por los datos se incluyen más grados de
libertad que el número de grados de libertad de tratamientos, por lo que debe tenerse cuidado
en el procedimiento de prueba.

Los métodos de comparación múltiple sólo nos dicen qué medias o grupos de medias son
iguales o diferentes, pero no nos dicen en qué magnitud son diferentes, de ahí que algunos
procedimientos también ofrecen los intervalos de confianza que ya informan la magnitud de
las diferencias.

Otro concepto importante por considerar es la potencia de una prueba que es una medida de
su capacidad para identificar diferencias. Las pruebas más potentes detectan las más
72

pequeñas diferencias entre medias. Las pruebas más potentes tendrán los intervalos más
pequeños o estrechos.

Las pruebas más conservadoras son Scheffé, Contrastes y Tukey (éstas son exactas), le
siguen Bonferroni, y las más sensibles o potentes son Student Newman Keuls, diferencia
significativa mínima (DSM) y Duncan. Éstas no se recomiendan ya que inflan la
probabilidad de cometer el error tipo I. O se pueden usar bajo ciertas condiciones que se
especificarán cuando se hable de las pruebas. Otras pruebas potentes que se han
desarrollado últimamente y que no inflan la probabilidad del error tipo I son la de Ryan y la
de Peritz.

Cuando se eligen pruebas de comparación es importante investigar su potencia o capacidad


para detectar diferencias entre medias o conjuntos de medias.

Algunas pruebas pueden hacerse en un solo paso, es decir sin necesidad de que la F total haya
sido rechazada. No es condición necesaria el rechazo de esta hipótesis total para realizar la
prueba. Pero es costumbre hacerla para obtener una estimación del CME. Éstas son:
 Tukey
 Tukey Kramer
 Dunnett
 Scheffé
 Bonferroni
 Šidák (Shedok)
Un investigador quien debe rechazar la Ho total antes de usar un Método de Comparación
Múltiple (MCM) está usando un procedimiento de dos pasos y puede perder ???un resultado
importante (Rafter, et al, 2002).
Las otras se realizan por pasos, comienzan por probarse la hipótesis total, y si se rechaza
entonces se realiza el segundo paso que es la prueba.
 DSM de Fisher
 Student-Newman-Keuls (SNK)
 Duncan

Los MCM también pueden clasificarse de acuerdo al número de medias o combinaciones de


medias que se contrastan.
Comparaciones por parejas: Que consiste en contrastar parejas de medias, ya sea que se
k 
comparen todas   parejas o sólo un subconjunto de ellas. Cuando se comparan todas las
 2
parejas de medias la más conveniente es la de Tukey por ser exacta o conservadora.
Todas las comparaciones: Tukey
Subconjunto de comparaciones: GT2, Dunn Šidák, Bonferroni.

Comparaciones de grupos de medias


Método de Bonferroni
Este método se emplea para probar diferencias planeadas (a priori) entre parejas de medias o
combinaciones lineales de medias y declara que un par de medias es diferente con un nivel
73

/m si: tij  t N  a, / 2m , Donde, m es el número de comparaciones por parejas a ser
probadas. Puede verse que esta prueba controla la tasa de error experimental en α asignándole
un valor αc más pequeño. También se usa a posteriori.
Como es una prueba que se aplica a priori no requiere rechazo de Ho en la tabla de análisis de
varianza es más puede realizarse antes del análisis, pero realmente se hace después porque del
análisis de varianza se toma el CME. Como puede verse el estadístico de prueba es idéntico al
de una prueba t para comparar medias pero el criterio de rechazo cambia, el valor de  de esta
prueba es más pequeño que el de una prueba t .
Para cualquier par i, j declaramos que ti es diferente de tj si se satisface la ecuación anterior. La
probabilidad de rechazar alguna de las hipótesis dado que las medias son iguales es igual a
/m. Por lo que la probabilidad de cometer el error tipo I (experimental) cuando son las
medias iguales es a lo mucho .
y  y j. ( 50)
tij  i.
2CM E
n

Éste estadístico puede comparar todas las parejas de medias sin inflar el error tipo I
controlando el nivel de cada comparación.
Si se trata de otro tipo de comparación o de un contraste el estadístico de prueba es:
k

c y i i
tij  i 1
cuando ni = nj
CM E  k 2 
  ci 
n  i 1 
y
k

c y i i
tij  i 1 para casos desbalanceados
 k c2 
CM E   i 
 i 1 ni 

Aplicando la prueba de Bonferroni para comparar todas las parejas de medias


Esta prueba debe usarse cuando el número de comparaciones excede al número de grados de
libertad entre tratamientos.

Para diseños de un factor, es mejor usar la prueba de Tukey, pero cuando no se aplica, el
método de Bonferroni es la opción. El Statgraphics también grafica los intervalos de confianza
de Bonferroni, que son intervalos para diferencias de medias tal que si un par de medias es
diferente, el intervalo cuantifica qué tan diferentes son.

Si se hacen todas las comparaciones pareadas la prueba de Tukey es superior al de Bonferroni


conduciendo a intervalos más estrechos. Si no se hacen todas las comparaciones pareadas, el
procedimiento de Bonferroni es mejor. Se utiliza para casos balanceados como para
desbalanceados.
74

El margen de error depende del número de comparaciones y no del número de tratamientos.

Ejercicio
Aplique el método de Bonferroni para comparar todos los pares de medias del ejercicio de
los fertilizantes.
103.1  74.5 28.6 28.6
t    13.62

1   1
22.04 2
10
2
4.41 2.10

103.1  83.2 19.9


t   9.48

1   1
22.04 2
10
2

2.10

83.2  74.5 8.7


t   4.14

1   1
22.04 2
10
2

2.10

Este valor se compara con t0.05 2(3),27  2.55 y debido a que todos los estadísticos de prueba
resultaron mayores que 2.55 entonces se rechazan las pruebas de las tres comparaciones
cada una con una probabilidad de 0.017 y el conjunto de las tres comparaciones con un
nivel de probabilidad de 0.05.

Los intervalos de confianza de Bonferroni en el ejemplo se obtienen con el error estándar


del contraste:
CM E  k 2  ( 51)
 . .contraste   ci
n  i1 

cuando los tamaños son iguales. Aplicando en el ejemplo:

 . .contraste 
10
 
1   1  2.10
22.04 2 2

1 vs 2 : 28.6  2.55(2.10)  23.25, 33.95


1 vs 3 : 19.9  2.55(2.10)  114.55, 25.25
2 vs. 3 : 8.7  2.55(2.10)  3.35,14.05
Se recomienda para pruebas a priori más que a posteriori, es muy conservadora ya que a lo
más se corre el riesgo de cometer el error tipo I de . Es poco sensible a las diferencias
pequeñas o tiene poco poder.

Dunn-Šidák
Es ligeramente más potente que la de Bonferroni.
Se emplea:

 '  1  1    c
1
2
1
 ( 52)

El intervalo es más estrecho que el de Bonferroni.


75

Diferencia Significativa Mínima (D.S.M)


El método de DSM es una prueba t de Student que utiliza una varianza mancomunada
del error. Se basa en la comparación de las diferencias entre medias contra un valor crítico
llamado DSM, diferencia significativa mínima:
2CM E ( 53)
t( /2,N -a)
n
si el valor absoluto de la diferencia entre algún par de medias es mayor que esta DSM
entonces se dice que la diferencia es significativa.

En el ejemplo,
2(22.04)
DSM  2.052  4.31
10
1 vs. 2 = 103.1-74.5= 28.6 > DSM
1 vs. 3 = 103.1-83.2= 19.9 > DSM
2 vs. 3 = 74.5 – 83.2= 8.7 > DSM
Para expresar el resultado, es muy común ordenar las medias de menor a mayor y subrayar
aquel par o grupo de medias que son iguales. En el ejemplo, como las tres medias son distintas
no se subraya ninguna de las tres medias.
74.5 83.2 103.1

El punto crítico en las comparaciones múltiples es el nivel de significación , aunque


se haga pequeña la probabilidad  de rechazar Ho verdadera para la prueba como un todo, la
probabilidad de rechazar por lo menos una Ho verdadera cuando se prueban parejas de medias
es mayor que . Por esto la prueba DSM infla el error tipo I (probabilidad de rechazar Ho dado
que Ho es verdadera), y se aplica mejor cuando se realiza a posteriori, es decir una vez que se
ha descubierto diferencia significativa en el análisis de varianza, esta es una manera de
protegerse contra este error tipo I. En dos situaciones puede emplearse DSM en las que el
nivel de significancia se sostiene: cuando se aplica a priori, por ejemplo si se quiere comparar
un tratamiento con un control, y cuando se comparan las medias –ordenadas- adyacentes. Y
hay dos situaciones donde el uso de DSM no es legal desde el punto de vista teórico: cuando
se hacen comparaciones sugeridas por los datos, por ejemplo cuando comparamos la media
más grande con la más pequeña y cuando se hacen todas las comparaciones posibles de
medias. En resumen, se puede aplicar correctamente si cada media se compara contra un
control porque así se planeó, o bien, se ordenan las medias y se comparan las adyacentes, es
decir, la segunda más grande contra la primera, la tercera contra la segunda, la cuarta contra la
tercera. En cualquiera de estos casos el número máximo de comparaciones legítimas está
limitado al número de grados de libertad de los tratamientos y así el nivel alfa se respeta.

En algunos casos el investigador puede desear hacer todas las comparaciones entre todos los
pares de medias, es decir a(a-1)/2 comparaciones que es mayor que a-1 comparaciones
independientes. Sea como sea cuando comparamos dos medias o cometemos el error tipo I
diciendo que las medias son iguales cuando no lo son y la tasa en la cual este error se comete o
probabilidad de cometer el error tipo I es  y se llama nivel de significancia para la
comparación y el error tipo II, que es el error de decir que son iguales cuando son diferentes y
la tasa del error la da ß. La probabilidad de que el procedimiento de comparación detecte una
diferencia real cuando ésta existe es la potencia de la prueba y es 1 – ß, y se verá después de
76

esta sección. Como ya se ha dicho si se usa DSM para hacer todas las comparaciones posibles
la probabilidad de cometer el error tipo I puede no ser el nivel elegido y se infla por lo que se
recomienda usar una de las pruebas siguientes: DSM protegida, la de Tukey o diferencia
honestamente significativa y la de Student-Newman-Keuls. La DSM protegida emplea la
DSM estándar contra la cual se contrastan las comparaciones por parejas una vez que la
prueba F ha sido declarada significativa, de esta manera se protege contra el error tipo I
Suponga que se emplea correctamente la DSM, se puede observar que en la fórmula se
emplea el CME pues uno de los supuestos del análisis es que se tiene una varianza común.

Recomendaciones:
 Cuando a = 3 (hay 3 comparaciones)
 DSM protegida
 En caso de que a > 3 comparar únicamente las medias adyacentes que se han
ordenado de menor a mayor
 Contra un control.

Una vez comparadas las parejas de medias se construyen los intervalos de confianza DSM que
se construyen sumando y restando a cada media el valor DSM/2. Cualquier par de intervalos
que no se superpongan se dice que son diferentes estadísticamente. También pueden
construirse intervalos para diferencias de medias; cualquier intervalo de diferencia de medias
que contenga al cero, significa que esa pareja de medias no presentan diferencia significativa.
Así, si un par de medias se declaró diferente por DSM, se puede conocer entre qué valores
descansa la diferencia que resultó significativa.

Nota: A veces esta prueba conduce al no rechazo de la hipótesis que contrasta las parejas de
medias cuando la F sí condujo al rechazo de Ho. La F prueba todas las comparaciones
posibles no sólo por parejas sino combinaciones lineales de las medias.

Tarea
Construya los Intervalos de Confianza DSM para las medias y para las diferencias entre
medias ¿Qué puede decir de las medias?

Cuando las comparaciones se planean antes de realizar el experimento, el nivel  o


probabilidad de cometer el error tipo I es el que corresponde al  elegida pues se respeta la
aleatoriedad; en el caso contrario todavía se pueden hacer comparaciones, sin embargo este
valor  se altera debido a que tales decisiones no se toman al azar. El mejor caso es el primero,
es decir planear las comparaciones y asegurarnos del nivel  o probabilidad de cometer el
error tipo I.
Se recomienda utilizar estos contrastes cuando su número no exceda a a-1 y si el número de
contrastes excede a este valor entonces es preferible la prueba de Bonferroni.
Uno de estos métodos hace uso de los Contrastes. Un contraste es una combinación
lineal de totales o medias de tratamiento que reflejan las comparaciones que se quieren
realizar.
C = c1y1. + c2y2.+ ... + cjyi. ( 54)

donde ci son los pesos o coeficientes del contraste, yi. son los totales
77

a ( 55)
c y .
i=1
i i

con la condición de que  ci = 0


Realmente un contraste se define como una combinación lineal de los efectos de los a
tratamientos con tal que la suma de los coeficientes da cero.
Es decir,
a
   ci i
i 1

De aquí que:
 ci i   ci  yi.  y..    ci yi.  y..  c    c y
i i i.

Los contrastes simples consisten en comparaciones de parejas, en contraposición a contrastes


complejos que involucran comparar grupos de medias o grupos de medias contra medias
simples. Pero cuando el tamaño de muestra es igual, es mejor trabajar con totales que con
promedios.

En el ejemplo de los fertilizantes, suponga que el investigador antes de iniciar su experimento


se formula estas dos preguntas:
¿Difiere el sulfato de amonio de la ciamida?
¿Difiere el sulfato de amonio y la ciamida de la dietanolamida?
Responder la primera cuestión es otra forma de decir que se quieren comparar las medias 1 y
2. Expresando lo anterior a modo de contraste:
C = y1. - y2. + 0 y3.
C = y1..-y2.
se observa que ci= 1 -1 + 0 = 0, luego entonces es un contraste.
Para responder la segunda cuestión es otro modo de decir que se desea comparar los totales
del sulfato de amonio y la ciamida contra el total del fertilizante dietanolamida, entonces el
tercer tratamiento se pondera con un factor de 2 con el objeto de balancear el contraste.
D = 1y1. + 1y2. - 2y3.
ci = 1 + 1 - 2 = 0
El primer paso consiste en calcular el valor de los contrastes y luego, a cada contraste se le
asocia una suma de cuadrados con 1 grado de libertad.
a ( 56)
(  ci yi.. )2
i=1
SCC = a
n  ci2
i=1

para diseños no balanceados:


a ( 57)
(  ci yi.. )2
i=1
SCC = a

n c
i=1
i
2
i

Las sumas de cuadrados de los contrastes se distribuyen como ² con un grado de libertad.
78

¿Por qué 1 grado de libertad? Un contraste también puede definirse como una diferencia de
medias o de grupos de medias; si son grupos de medias y se trata de una diferencia,
necesariamente son dos grupos de medias, entonces 2 -1 = 1 grado de libertad para cada
contraste.
Las sumas de cuadrados entre sus respectivos grados de libertad constituyen los cuadrados
medios, por lo que el cuadrado medio de un contraste es igual a la suma de cuadrados del
contraste.
Para probar si este contraste es significativo o no, cada contraste se compara con el cuadrado
medio del error, y como el estadístico de prueba se trata de un cociente de dos variables
aleatorias distribuidas como ² entonces el estadístico se distribuye como una prueba F con sus
respectivos grados de libertad, es decir,
CMc/CMF se distribuye como F (1,N-a).

En el ejemplo:
C1 = y1. - y2.
C1 = 1031-745 = 286
D = y1. + y2. - 2y3.
= 1031 + 745 - 2(832) = 112

Las sumas de cuadrados:


SCC = (286)²/10(2) = 4089.8
SCD = 112²/ 10(6) = 209.067

Para averiguar si estos contrastes son significativos entonces:


FC = (4089.8/1)/22.04 = 185.5878
FD = (209.067/1)/22.04 = 9.48
Si se comparan con F0.05.(1, 27) = 4.21
Ambos contrastes son significativos, en especial el contraste C, es decir existen diferencias
entre el tratamiento 1 y el 2.

Algunos autores prefieren utilizar las medias en lugar de los totales; el utilizar medias o
totales hará que difiera el valor del contraste. Si se calcula el contraste con el valor del total, el
contraste excederá del calculado con las medias, por un factor de n.

En nuestro ejemplo, el contraste C utilizando medias es igual a 28.6 y el contraste utilizando


totales es igual a (10) 28.6, es decir, 286.
La suma de cuadrados utilizando las medias sería igual a:
ncontraste 
2
(10)28.6 2
SC  a
  4089 .8
 ci2 2
i 1
que es la misma que se obtuvo cuando se calcularon las SC del contraste del total.

Pruebe que la suma de cuadrados del segundo contraste utilizando las medias es igual a la
suma de cuadrados del segundo contraste utilizando los totales.
79

La desventaja de construir muchos contrastes es que muchos de ellos serán redundantes o


estarán correlacionados. Lo ideal es construir contrastes independientes, es decir que
uno no se relacione con otro: se puede probar cada contraste como pruebas independientes del
cuadrado medio del contraste con el cuadrado medio del error; se dice entonces que los
contrastes son ortogonales.

Contrastes Ortogonales
Un caso especial de contrastes son los contrastes ortogonales. Dos contrastes
a ( 58)
C =  ci yi.
i=1
Y
a ( 59)
D =  d i yi.
i=1

son ortogonales si y sólo si:


a ( 60)
 ci d i = 0
i=1
o en el caso desbalanceado
a

n c d = 0
i=1
i i i

El número de contrastes ortogonales en una prueba es igual a a-1 contrastes, es decir es


igual al número de grados de libertad entre tratamientos (número de términos independientes).
Por lo tanto, las pruebas de contrastes ortogonales son independientes.

Por ejemplo,
C = y1. - y3.
D = 2y2. - (y1. + y3.)

c1 c2 c3
C 1 0 -1
D -1 2 -1
cidi -1 0 1
cidi =0
luego entonces estos contrastes son ortogonales. El trabajar con estos contrastes le proporciona
fuerza a la prueba por la característica de independencia.
Las ventajas de trabajar con contrastes ortogonales son:
1.- Son independientes, es decir no están correlacionadas las estimaciones de los diferentes
contrastes.
2.- Existen tantos contrastes como grados de libertad entre tratamientos.
3.- Las suma de cuadrados de los contrastes ortogonales es igual a la suma de cuadrados de los
tratamientos.
80

Los contrastes construidos anteriormente, son contrastes ortogonales. Cuando los contrastes
son ortogonales, la variabilidad expresada en la suma de cuadrados de tratamiento está
comprendida por la variabilidad expresada en contrastes ortogonales, por lo que la suma de las
sumas de cuadrados de los contrastes ortogonales es igual a la suma de cuadrados de
tratamiento; de la misma manera, la suma de los grados de libertad de los contrastes es igual a
los grados de libertad de los tratamientos, y esto nos confirma que las comparaciones
ortogonales realmente sí son independientes y no nos dan información redundante (o
correlacionada).

En el ejemplo, pruebe que la suma de las sumas de cuadrados de los contrastes ortogonales
es igual a la suma de cuadrados de fertilizantes.

Existen en los textos tablas con los coeficientes para construir contrastes ortogonales.

Puede suceder que la F total no haya sido significativa pero algunos contrastes sí lo
sean, esto resulta cuando uno o dos de los contrastes son significativos pero los otros no.
Cuando se totalizan las sumas de cuadrados de los efectos los contrastes no significativos
diluyen los significativos produciendo efectos no significativos en la tabla de análisis de
varianza También es posible tener una F total significativa pero que las comparaciones hechas
no lo sean.

Prueba de Scheffé (A posteriori)


Esta prueba emplea contrastes y puede usarse tanto para comparaciones planeadas
como para después del análisis de varianza o no planeadas y que son sugeridas por los datos.
 Cuando son muchos contrastes que se proponen a priori.
 Cuando son contrastes sugeridos por los datos y los contrastes son complejos.
Generalmente se aplica a posteriori (sugeridas por los datos). Se utiliza a priori cuando el
número de comparaciones es grande. Puesto que el método de Scheffé puede emplearse para
un juego grande de contrastes – no necesariamente ortogonales-, se requiere que la diferencia
esté muy marcada para que ésta pueda detectarse; por eso se dice que la prueba es
conservadora. Por esta misma razón protege contra el error tipo I ya que a lo más se trabaja
como máximo con  de nivel de significancia (en especial cuando las comparaciones se
sugieren con los datos). Es decir, el valor de alfa elegido es el nivel de significancia total.
Debido a que solo detecta las diferencias grandes entre medias puede accidentalmente no
rechazarla y declarar dos medias o grupos de medias iguales cuando realmente son diferentes.
Se puede utilizar para comparar todas las parejas de medias pero tiene intervalos de confianza
más anchos que los de Tukey, por lo que la prueba de Scheffé es más conservadora que la de
Tukey.
La prueba consiste en:
1.- Construir los contrastes que se quieren probar
2.- Calcular el error estándar correspondiente a cada contraste.
a 2 ( 61)
SCC = CM E 
ci
i=1 ni

3.- Calcular el valor de Scheffé contra el cual debe compararse.


( 62)
S SCH = SCC (a - 1) F  ,a-1,N -a
81

4.- Si el contraste C es más grande que el número de Scheffé correspondiente entonces el
contraste es significativo.

En el ejemplo:
Probar Ho: 2  2 =  1 +  3.
El contraste C = 2  2 -  1 -  3
y1.= 103.1
y2.= 74.5
y3.= 83.2
C = -1(103.1) + 2(74.5) -1(83.2)
C = 37.3
2.- Calcular el error estándar del contraste
2 2
22 +(-1) +(-1)
S C = 22.037
10

Sc = 3.6362
3.- Calcular el Número de Scheffé:
SSCH = 3.6362 [(3-1)F2,27]½ = 9.4121
4.- Comparar el contraste contra el número anterior:
37.3 >> 9.4121
Entonces se rechaza Ho. Lo que significa que la suma de los efectos de los tipos de
fertilizantes, sulfato de amonio y dietanolamida son diferentes del efecto de la ciamida.

El intervalo de confianza de Scheffé se obtiene con:


k a 2 ( 63)
 c y
i i  a  1F ;a 1, N a CM E 
ci
i 1 i=1 ni

Nótese que el margen de error depende del número de medias en el experimento y no del
número de contrastes.

Ejercicio:
Obtenga los intervalos de confianza de Scheffé para el contraste anterior.

Ejercicio (Castaño y Domínguez, 2001)


En un proceso industrial se usan las maltodextrinas como sustituto de grasas en la
elaboración de galletas o en harinas preparadas. Un ingeniero bioquímico produce
maltodextrinas a partir de semillas de amaranto, tiene interés en comparar las proteínas que
se obtienen de su producto con otros tres productos d maltodextrina que generan los
siguientes procedimientos; 1) comerciales, 2) almidón de maíz y 3) almidón de yuca.
1) ¿Tiene mayor contenido de proteína la maltodextrina elaborada con semilla de amaranto
con referencia a las otras tres?
2) ¿La maltodextrina producida con semilla de amaranto contiene mayor proteína que la
comercial?
82

3) ¿La proteína contenida en la maltodextrina elaborada con semilla de amaranto es mayor


que la producida con los almidones?
Tratamiento Amaranto Comercial a. maíz a. yuca
Media 34.5 30.0 34.0 27.0
varianza 3.3 9.0 7.0 7.0

La tabla de análisis de varianza se presenta a continuación:


Fuente de Variación Grados de Suma de Cuadrados FC
libertad cuadrados medios
Tratamiento 3 113.06 37.69 5.74
Error 8 52.5 6.56
Total 11 165.56

La prueba de Scheffé es la prueba más conservadora o menos poderosa. Pero es más


potente que la prueba de Tukey para contrastes más complejos (cuando se trata de caso
balanceado). Se sugiere emplear para contrastes complejos y para contrastes por parejas
con distintos números de réplicas.
Prueba de Rango Múltiple de Duncan
Esta es una prueba que se aplica bien a posteriori. Se aplica una vez que se ha
rechazado la hipótesis nula de igualdad de medias; no es tan conservadora como la de
Scheffé; y es de las más potentes pues detecta diferencias menores entre tratamientos.
Esta prueba consiste en:
1) Ordenar las medias en forma ascendente
2) Determinar el error estándar que corresponde a cada promedio.
CM E ( 64)
S yi.. =
n
3) Obtener los valores r (p,f) en la tabla de Duncan, donde p = 2,3,...,a y f son los
grados de libertad del error. Estos valores r(p,f) son valores críticos con p medias
ordenadas o pasos entre medias y f grados de libertad.
4) Se calcular entonces los valores Rp = r(p,f)Syi..
5) Se comparan entonces las diferencias entre medias contra los valores Rp.

Por ejemplo, suponga que desea realizar la prueba de Duncan para comparar los
distintos tipos de fertilizante. Se proporcionan las medias:
103.1, 74.5 y 83.2 respectivamente.
1. Ordenando las medias de menor a mayor
74.5 83.2 103.1
2. Calculando el error estándar:
22.04
 1.48
10
3. Calculando los valores r27,0.05 y los Rp:
Valores P=2 P=3
rp 2.908 3.058
Rp 4.316 4.54
4. Comparando:
1 y 2= 103.1-74.5= 28.6> 4.54
83

1 y 3= 103.1-83.2= 19.9>4.316
2 y 3= 83.2-74.5=8.7>4.316
Todas las medias son diferentes por lo que se forman 3 grupos de medias:
74.5 83.2 103.1
Para casos desbalanceados:
a ( 65)
r= a
 1
  
i=1  r i 

Prueba de Newman-Keuls (NK)


Es un poco más conservadora que la prueba de Duncan, es decir, protege del error
tipo I es menos potente y más poderosa que la de Tukey y la de Bonferroni..
Operativamente es igual que la de Duncan pero se calcula con otra tabla de valores, q (p,f)
Sy...

Kp  q ( p, f )S yi .. ( 66)

ymax  ymin
q
CM E
n
La diferencia necesaria para que se declare significativa varía con el grado de separación de
las medias que se comparan. Las medias separadas por una media requieren diferencias más
pequeñas para significancia que las medias separadas por dos medias.
Al igual que la DSM el análisis de varianza puede conducir al rechazo de Ho pero ninguna
de las comparaciones por parejas en NK resulta una diferencia significativa.
Para aplicarla es recomendable ordenarlas de menor a mayor y comparar la más grande
contra la más pequeña, Si estas medias son diferentes entonces la más chica se contrasta
con la siguiente más grande hasta alcanzar alguna prueba no significativa.
Es aproximada para casos desbalanceados.

Prueba de Tukey
Es muy parecida a la prueba de Diferencia Significativa mínima. Se calcula un solo
valor crítico para comparar todos los pares de medias. La tasa de error es a lo más , por lo
que es conservadora y controla la tasa del error experimental. Emplea un estadístico
llamado rango e, q.
CM E ( 67)
T  ti  t j  q( ,a, f )
n
a es el número de tratamientos y f los grados de libertad del error. Depende del número de
medias y no del número de comparaciones que se realicen. Nótese que depende del número
de tratamientos y no del número de comparaciones como la de Bonferroni. Los intervalos
de confianza se obtienen:
CM E
yi  y j  q( ,a , f )
n
Nótese que el margen de error es el mismo para cada comparación, por lo que los tamaños
de los intervalos son iguales. Esta prueba es para casos balanceados; cuando los casos son
desbalanceados recibe el nombre de Tukey Kramer
84

La prueba de Tukey también sirve para contrastes. Si los tamaños de muestra son iguales el
intervalo de confianza es
CM E k ci
 i i ( ,a, f ) n 
c y  q
i 1 2
Nota: Se sugiere utilizar preferiblemente para comparaciones por parejas y no contrastes
más complejos.

Prueba de Tukey-Kramer
Si la prueba de Tukey es conservadora y a lo más se comete un error tipo I de , el nivel de
probabilidad de rechazar dado que es verdadera, en esta prueba es ligeramente menor que
.. Es decir no protege tantocomo la de Tukey..
Dos medias son distintas si el valor absoluto de sus diferencias es mayor a este valor
crítico.
1 1 1
T  t i  t j  q( ,a , f ) CME  
2  ni n j 
 

donde q es el cuartil superior de la distribución de rango estudentizado con parámetros a


(k) y f (N-a, N-k) grados de libertad del error.

Los intervalos de confianza se obtienen:


1 1 1
T  yi  y j  q( ,a , f ) CME  
2  ni n j 
 

En el ejemplo,
1) Se ordenan las medias de mayor a menor
103.1 83.2 74.5
1 3 2

2) El valor del rango estudentizado es:


q 0.05,(3,27)= 3.5
22.04
3.5  5.20
10
Cualquier diferencia absoluta mayor que 5.20 es significativa.

1 vs. 2 = 28.6 > 5.20


1 vs. 3 = 19.9 > 5.20
3 vs. 2 = 8.7 > 5.20

Los intervalos de confianza para comparar una pareja de medias resultan de aplicar la
siguiente fórmula:
yi  y j  T
El intervalo de confianza para la diferencia de µ1 - µ2 sería:
85

28.6  5.20 = [23.4, 33.8]


Como este intervalo de diferencia de medias no contiene al cero, entonces estas medias no
son iguales.
Nota: Se puede observar que es ligeramente más estrecho que el intervalo de Bonferroni.

Si los intervalos de confianza para las diferencias de medias contienen al valor cero,
significa que esa pareja de medias no son diferentes.
La prueba de Tukey garantiza que todas las comparaciones tienen una tasa de error a lo más
de .

Es el método conservador más efectivo entre los métodos conservadores para el


análisis de varianza de una vía, el error tipo II es el más pequeño ( o su intervalo de
confianza es el más estrecho) y se recomienda utilizar, a menos que el valor crítico no esté
en la tabla de rangos estudentizados. Comparado con el método de Bonferroni este último
es más conservador que el de Tukey y los intervalos de confianza simultáneos de Tukey
son más estrechos. A un nivel de 0.05 los dos métodos arrojan resultados muy similares.

La prueba de Tukey y la de Tukey-Kramer pueden generalizarse para probar contrastes de k


medias.

Prueba de Comparación de los tratamientos (k-1) contra un control. Prueba de


Dunnett.
Se emplea para comparar los tratamientos con un control. Debido a que el control tiene
mayor importancia el número de réplicas del control se recomienda que sea mayor,
aproximadamente n k  1 donde n es el número de réplicas de los tratamientos cuando se
n
trata de diseño balanceado o bien i k  1 si se trata de caso desbalanceado.
k

Se pueden probar la hipótesis de que al menos uno de los tratamientos difiere o bien la
hipótesis de una cola para probar que la diferencia entre las medias de tratamientos y la
media del control es menor o mayor a cero.
H 0 : i  c
H1 : i   c
H1 : i   c  0
H1 : i   c  0
El valor crítico para una prueba bilateral es
2CM E
d ;a1, f si el caso es balanceado, o bien
n

1 1
d ;a1, f CM E    donde nc es el número de réplicas del control.
 ni nc 

Tarea: Investigue el método de comparación de k-1 tratamientos contra el mejor


tratamiento. Prueba de Hsu.
86

¿Cuál prueba emplear?


Carmer y Swanson en experimentos de simulación de Montecarlo concluyeron que
la prueba DSM es muy eficiente para detectar diferencias si se aplica hasta después de la
prueba F (95%) ha sido significativa. La prueba de Duncan es muy potente para detectar
diferencias reales entre medias (Montgomery, 1991). Si se desean pruebas conservadoras
porque son pruebas en las que no se quiere fallar porque se tratan de vida, enfermedad,
entonces Tukey y Bonferroni son las pruebas de elección, siendo la prueba de Bonferroni la
más conservadora.

Tarea: Leer el artículo Rafter John A., Martha L. Abell and James P. Braselton. Multiple
Comparison Methods for Means. (2002). SIAM Review Vol. 44, No. 2, pp. 259-278

Potencia de la Prueba. Tamaño de la muestra


El tamaño de la muestra se relaciona con la probabilidad de cometer errores en la prueba de
hipótesis. En general tiene sentido pensar que si se espera que existan grandes diferencias
entre tratamientos, se requerirán pocas réplicas para detectar estas diferencias; también si se
espera una gran variación dentro de cada tratamiento, se espera que se requiera un gran
número de réplicas. Debido a que el tamaño de muestra depende en gran parte a las diferencias
que se quieran detectar y éstas se relacionan con uno de los errores (el tipo II) a continuación
se recordará en qué consiste cada error.

Tipos de errores
En la toma de decisiones, al rechazar o no rechazar la hipótesis nula, se pueden
cometer dos tipos de errores. El error tipo I se refiere a la probabilidad de rechazar Ho dado
que es verdadera y el error tipo II que sea la probabilidad de no rechazar Ho dado que Ho es
falsa.
La probabilidad de cometer el error tipo I se denota por α y la probabilidad de cometer
el error tipo II por β. El primero está bajo el control del experimento; el error tipo II puede ser
relativamente grande (0.25 o más) pues si no se rechaza Ho dado que la hipótesis es falsa el
experimento puede repetirse. No rechazar Ho dado que es falsa, equivale a pensar que las
cosas siguen como se ha pensado hasta el momento (a pensar que no cambia nada) y eso no es
tan grave como decir que las cosas han cambiado cuando realmente siguen pasando como
hasta el momento.
En cambio si Ho es verdadera y se rechaza, esto puede ser grave por lo que α debe ser pequeño
(0.01 o menos). Dado que el error tipo II es la probabilidad de no rechazar la hipótesis nula
dado que existe una diferencia entre las medias está entonces relacionado con qué tanta
diferencia esté presente.

Potencia de la prueba ()


La potencia de la prueba es la probabilidad de rechazar Ho dado que es falsa.
Decisión del experimentador Ho falsa Ho verdadera
Rechazar Ho = 1- ß 
Decisión correcta
No rechazar Ho ß Decisión correcta
( 1- )
87

Bajo Ho verdadera, el criterio de decisión FC = CMTrat/CME se distribuye como una F central


con a-1, N-a grados de libertad, y se rechaza Ho cuando FC > Fα

Si el investigador rechaza Ho dado que es verdadera entonces comete el error tipo I.


P (cometer error tipo I) = P ( FC > Fα) = α.
La decisión correcta, es decir, no rechazar Ho dado que es verdadera está dado por 1-α.

1- 

Bajo H1 verdadera entonces el cociente FC = CMTrat/CME sigue una distribución F no central


con a-1, N-a grados de libertad y un parámetro de descentralización  > 0. Cuando la
hipótesis nula es falsa significa que existe diferencia entre tratamientos o los efectos de los
tratamientos son significativos, entonces el cociente se distribuye como una F no central con
un parámetro de descentralización relacionado directamente con la magnitud de la diferencia.

 n i
2
a 1
F' = CMTrat/CME
h(F') es la función de densidad de F'

a
r  i
2

 i 1
(a)
2
Nótese que bajo la Ho de que toda i = 0, entonces,  = 0. Es lo que ya dijimos que bajo Ho el
cociente CMTrat/CME sigue una distribución F central.
a
r  t
2


  i 1
a a 2
Cuando  = 0 entonces la distribución F' se convierte a una distribución F central.

ß 1-ß

Si no se rechaza Ho dado que es falsa entonces se comete el error tipo II.

P(error tipo II)= P(FC < F') =β.


88

La decisión correcta sería que siendo falsa la hipótesis nula, ésta se rechazara, a esto se le
llama potencia de la prueba.
Estos dos tipos de errores deben minimizarse, pero como guardan una relación inversa entre sí,
no es posible. Cualquier cambio en el tamaño de una región produciría un cambio opuesto en
la otra. Si movemos F central a la derecha, disminuye  pero ß se incrementa. Lo mejor es
fijar la probabilidad de algún tipo de error y minimizar la probabilidad de cometer el otro.
Generalmente se fija la probabilidad de cometer el error tipo I, es decir α; se
determinan entonces las condiciones que minimizan la probabilidad de cometer el error tipo
II. Minimizar β equivale a maximizar 1-β, valor que se conoce como potencia de la prueba y
es la probabilidad de detectar una diferencia entre medias del tamaño de  . Si se calcula la
probabilidad de rechazar Ho dado que H1 es verdadera para todos los posibles valores de  se
obtiene la función de potencia. El poder de la prueba se incrementa cuando se aumenta el
tamaño de la muestra n.
Una curva característica de operación es una gráfica de la probabilidad de cometer
el error tipo II de una prueba estadística para un tamaño de muestra particular contra un
parámetro  relacionado con  .
Específicamente, igualando (a) y (b)
 2   2 a 2
 2
2 
a 2
a
r  i2

  i 1
a a 2
Específicamente se indica la probabilidad del error tipo II (ß) contra el parámetro  .
a
n  i2
2 = i=1
a2 (b)

Determinación del tamaño de la muestra


Para determinar n se requiere especificar los siguientes puntos:
1) El nivel de significancia  .
2) El tamaño mínimo  i ²/  ² que se desea detectar, es decir la diferencia entre medias
para los cuales se desea rechazar Ho con seguridad o probabilidad alta. El valor i= µi -
 =µi-1/a  µi.
3) La curva característica de operación proporciona la probabilidad de no rechazar Ho
dado que H1 es verdadera, β para distintos valores de n tal que β sea aceptablemente
pequeña.
En las gráficas se indica β contra  ² que se relaciona con  (parámetro de
descentralización).

Ejemplo, suponga que  i = 50 y que el investigador cree que  ² no excede de  = 3.


89

Entonces,

Se emplea la curva para a-1 = 5 - 1 = 4 y a(n-1) = 5(n-1) g.l. Para n=4 por ejemplo,  ²=
1.11(4) = 4.44. Es mucho más fácil aplicar una fórmula en el que se requiere el parámetro D,
que es la cantidad por encima de la cual rechazaría la hipótesis nula con un nivel de confianza
dado y que la proporciona el investigador en función del conocimiento que tenga del
fenómeno.
nD2
 
2

2a 2
En el ejemplo, suponga que se obtuvo una estimación de la varianza en un estudio piloto y
fue de 15, y que el valor de rendimiento a partir del cual se diría que dos fertilizantes son
diferentes es de 10 kg/ha2 y que se desea obtener una potencia de 0.9.
n(10) 2
2   1.11n
2(3)(15)
Para obtener el tamaño de la muestra necesario para alcanzar dicha potencia, se construye
la siguiente tabla.
n 2 2   
3 6 3.33 1.82 0.41 0.59
4 9 4.44 2.10 0.22 0.78
5 12 5.55 2.35 0.13 0.87
6 15 6.66 2.58 0.051 0.95
Es decir, que con un tamaño de muestra de seis se obtiene una potencia de 0.95 o una
probabilidad de 1-0.95 de caer en el error tipo II, es decir, decir que dos medias son iguales
cuando realmente son diferentes.

Caso desbalanceado
Muchas veces no es posible llevar a cabo el experimento con el mismo número de
réplicas para cada tratamiento, éste es el caso desbalanceado. El análisis de varianza es
semejante al del caso balanceado salvo algunas modificaciones en las fórmulas que se
presentan a continuación.
Supuestos
a

r  = 0
i=1
i i

Sumas de cuadrados:
Suma de cuadrados de tratamientos:
90

a
yi.2
SCtrat =  - f.c.
i=1 ri

También tiene a - 1 grados de libertad.

Tarea: Obtenga los estimadores de los parámetros para el caso desbalanceado. (1 punto)

Intervalos de Confianza: Las gráficas de intervalos de confianza tendrán diferentes


magnitudes por los distintos números de réplicas.
CM E
yi.  t 2
ri
Comparaciones múltiples:
Contraste
a
C =  ci yi.
i=1

tal que,

 r i ci = 0

La suma de cuadrados del contraste es:


a 2

(  ci yi. )
i=1
SCc = a

r c
i=1
i i
2

Pruebas de rango múltiple


El error estándar para la media de una muestra variará de media a media y será:
CME
syi 
ri

Diferencia Significativa Mínima

1 1
DSM = t/2,N -a CM E  + 
 ri r j 
91

Tarea. Resuelva el ejercicio 3-3 del libro de Montgomery.

Modelo de efectos aleatorios (modelo II)


El modelo de efectos aleatorios se emplea cuando el número de tratamientos es muy grande y
no es posible compararlos todos, o cuando el objetivo es conocer la cantidad de variación que
se puede atribuir al factor (debido a la infinidad de niveles), entonces se toma una muestra
aleatoria de a niveles y se obtienen conclusiones referentes a la variación y las inferencias se
extienden a toda la población. Realmente se quiere saber qué tanto de la varianza del
experimento podría ser atribuible a verdaderas diferencias entre tratamientos y que tanto
podría ser debido al error aleatorio alrededor de estas medias.
Ahora estamos interesados en  ²T y  ²e. ¿ qué tanto de la variación del experimento
se puede atribuir a las diferencias en las medias de tratamiento y qué tanto al error aleatorio?.
A este modelo se le conoce también como el de componentes de varianza.
ti y eij son variables aleatorias.
El modelo es el mismo que el de efectos fijos pero ti, se refiere a un efecto aleatorio asociado
con el i-ésimo tratamiento.
Los errores y los tratamientos se distribuyen normalmente con media cero y varianzas
² y ²T respectivamente. Ambas variables son independientes por lo que:

V(yij) =  ² +  ²T.

Debido a que no se están estudiando todos los tratamientos no se le añade la restricción de que
los τi suman cero.
Ejemplos: Si un científico está interesado en cómo trabaja un fungicida. Selecciona al azar tres
fungicidas de un grupo de fungicidas para estudiar la acción. Los modelos de efectos
aleatorios son comunes en estudios de muestreo.

La hipótesis que desea probarse es que la variabilidad de los tratamientos (o niveles del factor)
es igual a cero contra la alternativa de que es mayor que 0.

Ho:  ²T = 0
H1:  ²T > 0
Las sumas de cuadrados se calculan de la misma forma que para el modelo de efectos
fijos (modelo I). Pero en la tabla del análisis de varianza se le puede agregar una columna de
los cuadrados medios esperados.
En el modelo de efectos fijos el cuadrado medio del error es un estimador de  ² y el cuadrado
medio de tratamientos estima a  ² más una función de la suma de cuadrados de los efectos
fijos de tratamientos. Para el modelo de efectos aleatorios el CM de tratamientos estima a:  ²
más n  ². La FC = CMtrat/CME es una estimación de
 ² + n  ²T/  ²,
que sigue una distribución F solo si  ²t = 0. Bajo este modelo Fc es el estadístico de prueba
para probar que la variación entre tratamientos es igual a cero contra la alternativa de que es
mayor que cero.
F. de V. SC g.l. CM CM esperado
Tratam. SCtrat a-1 CMtrat  ² + n  ²T
92

Error SCE a(n-1) CME ²


Si Ho es verdadera, o sea si ²T = 0 entonces el numerador y el denominador de:

FC= CMtrat/CME = (  ² + n  ²T)/  2


ambos son estimadores insesgados de  ². Si H0 se rechaza el estimador del CMtrat es mayor
que el denominador. ˆ ² = CME
ˆ ²T = (CMtrat - CME)/n

Por ejemplo si se desea conocer la variabilidad del contenido de cloro residual en los nodos de
la red de agua potable de una colonia de la ciudad, se toman aleatoriamente n nodos y se mide
el cloro residual de las tomas domiciliarias conectadas con ese nodo. Mediante este análisis se
detectaría si existe variabilidad entre los nodos y se obtendría la proporción de variabilidad
debida a los nodos y la debida al error aleatorio.
En laboratorios es muy común utilizar modelos de efectos aleatorios para conocer la
variabilidad que existe entre ellos, específicamente entre analistas, en la determinación de un
analito. Por ejemplo, se puede mandar muestras de agua de la misma fuente a 5 o 6
laboratorios y estos realizan varias determinaciones de un analito. El interés se centra en la
variabilidad entre analistas más que en las lecturas promedio por los 5 o 6 analistas.

Para el modelo de efectos aleatorios también se requiere que se cumpla el supuesto de


normalidad. Y con respecto a que la variable i se distribuye normalmente, no se verifica
debido a que el número de niveles que se toman al azar para el estudio son insuficientes.

Tarea. Resolver el ejercicio 3-8 del libro de Montgomery que se refiere al contenido de calcio
en lotes de materia prima.

EJERCICIOS PROPUESTOS
Un experimentador sometió a 5 grupos de ratones en un laberinto. El grupo 1 tenía solamente
habilidades olfativas y táctiles, el grupo 2 sólo visuales y táctiles, el grupo 3 solo visuales y
olfatorias, el grupo 4, visuales, olfatorias y táctiles y el 5, visuales, olfatorias y táctiles pero se
les aplicaba un choque eléctrico por error que cometieran. Los datos son ensayo y error, bajas
calificaciones indican una buena actuación.

A1 A2 A3 A4 A5
7 5 9 6 19
8 4 11 12 6
5 4 6 8 3
9 6 8 5 12
10 3 7 11 13
a. Realice el análisis, encuentre el valor de p para probar la diferencia entre tratamientos.
b. ¿Qué efecto parece tener cada tratamiento en el aprendizaje?
c. Estime la varianza y la desviación estándar de cada grupo. Comente la validez del
supuesto de homocedasticidad y su efecto en la validez del análisis.
d. ¿Qué transformación podría utilizarse para hacer las varianzas más homogéneas tal
que los valores puedan ser intuitivamente significativos?
93

e. Haga la transformación necesaria y el análisis en los datos transformados. Compare los


resultados del análisis y el supuesto de homocedasticidad.
f. ¿Cómo interpretaría los resultados? ¿Qué tendría que retransformar a la escala original
y cómo se haría?

El comité de gobierno de una supercarretera está interesado en si las carreteras son más
seguras en la actualidad. Se seleccionaron al azar 10 estados y se determinaron de los años
del 68 al 72, las tasas de fatalidad (número de muertes por 100 millones de vehículos).
Año 1968 1969 1970 1971 1972
5 5.4 4.3 5.2 5.0
4.9 3.3 5.1 7.8 5.8
5.9 4.5 4.0 3.0 6.6
5 5.5 6.0 5.0 4.1
7.2 5.0 4.4 5.8 3.8
7 7.6 4.6 4.0 4.5
4.9 7.6 4.8 4.5 3.8
6.4 6.4 6.4 4.4 4.5
6.3 5.3 5.2 4.4 5.3
7.3 7.1 4.3 3.9 3.8
yi. 59.9 57.7 49.1 48.0 47.2
Si2 0.9788 1.9557 0.6077 1.7 0.9040

a) Use cada una de las tres pruebas da homogeneidad de varianzas ¿Se cumple el
supuesto de normalidad?.
b) Corra el análisis de varianza y concluya.
c) Asumiendo un ß 0.10 ¿cuál es la mínima diferencia en la tasa de mortalidad
anual que puede ser detectada con estos datos?

Un fabricante de tabletas desea probar que los tiempos de desintegración de 4 tipos de tabletas
son los mismos.
A B C D
20 42 8 12 50 124 151 178
28 25 10 24 67 72 125 151
36 24 12 10 90 78 180 152
16 31 16 19 103 70 149 161
25 33 9 10 90 76 175 118
a. Realice el análisis de varianza con un nivel de 0.05 y concluya.
b. ¿Se cumplen los supuestos de normalidad y de homogeneidad?
c. Sugiera la transformación más adecuada. Transforme con raíz cuadrada y averigüe si se
remueve la heterogeneidad. Corra la prueba de Bartlett con los datos transformados.
d.Típicamente una transformación que ayuda a corregir la heterogeneidad corrige la no
normalidad. Corra la prueba de Shapiro Wilks a los datos transformados, y emplee la gráfica
necesaria para checar la normalidad con los datos trasformados. Interprete los resultados.
94

Diseños con restricción en la aleatorización


Existen diseños en los que no es posible la aleatorización completa porque no se
cuenta con suficientes unidades experimentales homogéneas que permitan esta
aleatorización completa de los tratamientos a las unidades experimentales. En lugar de
aleatorizar completamente, las unidades experimentales homogéneas se agrupan en lo que
llamamos bloques, y se realiza una aleatorización de tratamientos dentro de cada bloque., es
decir una aleatorización por separado para cada bloque.
Algunas veces estas aleatorizaciones separadas ocurren naturalmente en factores
como parcelas, días, etc., y se usan para hacer el experimento más rápido y fácil de correr.
La idea de “bloques” inicia con R.A. Fisher. Fisher consideró acertadamente que
entre los factores de variabilidad aleatoria ajenos a los tratamientos sobresalía por su
importancia la falta de uniformidad del suelo. Considerando que grupos de parcelas vecinas
tienden a la uniformidad en su fertilidad, y que difieren de parcelas que se encuentran a
cierta distancia y que también son homogéneas entre ellas, introdujo en los diseños la idea
de formar grupos o bloques de unidades experimentales (parcelas) homogéneas dentro de
cada grupo o bloque e ideó un modelo que pudiera eliminar del error la variación entre los
bloques.
Fisher propuso que se hiciera de modo que todos los tratamientos aparecieran una vez en
cada bloque, para asegurar que todos los tratamientos tuvieran la oportunidad de demostrar
su efecto en las varias condiciones del suelo que constituyen los bloques o grupos, de ahí el
nombre de diseño de bloques completos al azar (dentro de cada bloque se aplican todos los
tratamientos).

Los bloques sirven para eliminar parte de los factores de variación aleatoria, que de otro
modo incrementarían el error experimental.

La variabilidad restante que no se puede controlar y que no se puede remover del campo
pero que en cambio se puede aleatorizar queda dentro del término de error y es la debida a
la falta de uniformidad entre las unidades del mismo bloque y a la falta de uniformidad en
la realización del experimento.
Así pues, si dentro del bloque hay más variación que entre los bloques, no valdrá la
pena bloquear. Y la sensibilidad del experimento disminuiría pues al tener un gran término
de error la prueba F para probar diferencias entre medias de tratamientos se hace menos
sensible a las diferencias.
Al planear un experimento en bloques debe buscarse que los bloques absorban la
mayor heterogeneidad del suelo, y que los bloques sean lo más homogéneos dentro de sí.
En resumen las razones para bloquear son:
1) Número insuficiente de unidades experimentales homogéneas para correr un
experimento completamente aleatorizado.
2) Remover una fuente de variación del error para hacer al diseño más sensible a las
diferencias entre tratamientos.

Algunos ejemplos en los cuales es ideal aplicar este diseño son:


1) En agricultura las diferencias en fertilidad del suelo, o bien el talud o pendiente del
suelo puede hacer que las parcelas de un lado del campo difieran de las parcelas del
lado opuesto o sitios intermedios.
95

2) En experimentos de cultivos perennes como los árboles frutales, las unidades


experimentales ubicadas en ciertas partes del terreno difieran a los de otras partes del
terreno.
3) En experimentos con plantas en macetas de invernadero o laboratorios donde se aplican
diferentes tratamientos a diferentes macetas serán útiles bloques de macetas
similarmente situadas en el invernadero, aquéllas cercanas a la puerta, o a las ventanas,
es decir aquéllas situadas similarmente geográficamente.
4) Cuando las unidades experimentales son animales, los bloques pueden formarse con
base en su similitud genética, dejando como bloques por ejemplo, los animales
pertenecientes a una misma camada, o agrupar a los animales por grupos de edad o
peso.
5) En estudios médicos donde las unidades experimentales son personas, se pueden
formar grupos por edades, sexo, clase social, historia clínica, raza, etc.
6) En industrias hay solamente tiempo para correr una réplica del experimento por día. En
tal experimento uno podría bloquear en tiempo y el número de días en que se lleva a
cabo el experimento es el número de bloques (Lorenzen y Anderson, 1993).
Los bloques deben ser lo más homogéneos en su interior y diferir lo más posible entre ellos.
Dentro de cada bloque se aleatorizan todos los tratamientos y los tratamientos son
asignados aleatoriamente a las unidades experimentales dentro de cada bloque por lo que
cada bloque representa una sola réplica. No debe existir interacción entre el factor y el
bloque pues no se sabría si las diferencias se deben al factor o al bloque.

Antes de introducirnos al modelo, supuestos etc., se verá un concepto que algunos autores
consideran importante y que justifican el por qué no es de interés o adecuado probar el
efecto diferencial de los bloques, y es el de error de restricción. Estas ideas se toman de la
bibliografía de Anderson y de Lorenzen & Anderson.

Suponga que se prueban tres temperaturas: 30,40 y 50°C y cuatro colores: azul (az), rojo
(r), amarillo (am) y verde (v), en la nitidez de una imagen. Se corren dos réplicas (1 y 2).
De modo que se tiene un experimento de dimensión 3 x 4 x 2 = 24 combinaciones
(Temp/Color/réplica).
Una aleatorización completa sería:

(30°C-az-1 50°C-v-2 40°C-am-1 30°C-v-2 30°C-az-2


… hasta completar 24 combinaciones (temp/color/réplica.).

Esto tiene el inconveniente de que el cambio constante de temperatura y el tiempo que tarda
un horno en alcanzar las temperaturas echaría a perder el horno o sería muy tardado el
experimento.
El investigador decide que debe elegir al azar una temperatura y que se pinten 8 paneles de
las 8 posibles combinaciones color/réplica. Por ejemplo elige al azar entre las tres
temperaturas y sale 30°C. Se ajusta el horno a esta temperatura y se aleatorizan color y
réplica, como se muestra a continuación:

30°C: v-1 az-1 az-2 r-2 v-2 am-2 am-1 r-1


96

Una vez corridas estas 8 combinaciones, elige al azar de entre las dos temperaturas
restantes y corre las mismas 8 combinaciones color/réplica, pero en orden aleatorio.
Se puede observar que no hubo aleatorización completa sino que se ha restringido a
cada temperatura, es decir ha habido una aleatorización por temperatura o para cada bloque.
Se sabe que el error de restricción está asociado a la temperatura, decimos que hay
una restricción en la aleatorización asociado con el factor temperatura. Y esta restricción se
dice que está confundida con el bloque.
También decimos que el experimento se corre en bloques donde los bloques están
asociados con la temperatura, o bien, decimos que el experimento está bloqueado en
temperatura, o que la temperatura es un factor de bloqueo.

Ahora considere que sólo hay una pistola de aire para pintar y da mucho trabajo
limpiarla y mezclar un nuevo color. Tiene sentido limpiar la pistola y mezclar un nuevo
color mientras la temperatura del horno está cambiando.
Uno podría elegir una combinación temp/color y pintar y hornear ambas repeticiones antes
de elegir la segunda combinación. No hay necesidad de fijar individualmente cada
temperatura o fijar un color, más bien ambos cambiaron al mismo tiempo.
Las combinaciones se elegirán al azar, una cada vez, y con esta combinación se correrán en
orden aleatorio las dos réplicas.
De las 12 combinaciones:
30az 30v 30am 30r
40az 40v 40am 40r
50az 50v 50am 50r
Se elige al azar una combinación, por ejemplo 40r. Se controla la temperatura del horno a
40°C y la pistola se llena con pintura roja. Se elige al azar que réplica se realizará primero.
Hay una restricción en la aleatorización asociado con cada combinación temp/pintura. El
término de bloqueo es Temp/pintura.
Una restricción en la aleatorización puede asociarse con cualquier término del
modelo. Tal restricción implica que un nivel del término (o una combinación como
temp/pintura) es fijado y todas las combinaciones que contiene ese nivel son aleatorizados
antes de elegir al azar el otro nivel.

¿Qué implicación tiene este error de restricción en el modelo y en las pruebas estadísticas?

El error de restricción asociado con el término de bloqueo se le añade al modelo


inmediatamente después del término de bloqueo y con una letra griega. En un diseño de
bloques completos al azar el modelo quedaría así:
yij     i   j   l ( j )   ij
donde el término después del efecto del bloque es el error de restricción dentro del j-ésimo
bloque y completamente confundido con el bloque j. l debe ser igual a 1 pues es el error de
restricción único asociado al bloque j. El error de restricción mide la variabilidad de las
mediciones realizadas dentro del mismo bloque, o error del bloque. Si hay tres bloques por
ejemplo hay 3 restricciones, una para cada bloque. Como l =1 pues no tiene grados de
libertad (1-1=0), ni suma de cuadrados ni cuadrado medio.
l =1, este representa las características aleatorias del bloque (la aleatorización dentro del
bloque). Este valor no se puede estimar pues está confundido con los bloques, ni tiene suma
97

de cuadrados ni grados de libertad. Sin embargo, al observar los E(CM) se puede observar
que para probar diferencias entre bloques no puede emplearse el error aleatorio como
denominador de la FC, como puede verse a continuación: (suponiendo los bloques
aleatorios)
b  ti 2
E (CM Trat )   2

a 1
E (CM Bloques )    a 2B  a 2
2

E (CM l ( j ) )   2  a 2
E (CME )   2
Esto tiene sentido pues para probar CMTratse contrasta con el efecto aleatorio.
Igualmente para probar si los bloques son significativos se probaría contra su error. Lo
interesante en este diseño no es contrastar los distintos bloques, sino más bien los niveles
del factor, y el bloqueo se utiliza para incrementar la precisión del experimento.
Si se probara los bloques contra el error y es significativo no se sabe si existen diferencias
entre bloques o el error de restricción es significativo o ambos son significativos, porque
ambos están confundidos. Se dice que esta F es conservativa porque se prueban
simultáneamente bloque y error de restricción.
Si es no significativa ambos son no significativos.
Puesto que no se puede obtener información de los bloques es sabio diseñar el
experimento de modo que se utilice como factor de bloqueo el que tenga poca importancia
o interés.

Modelo
yij     i   j   l ( j )   ij
donde,
 es la gran media, y es constante para todas las observaciones.
i es el efecto del i-ésimo tratamiento.
j es el efecto del j-ésimo bloque
l(j) es el error de restricción dentro del j-ésimo bloque y completamente confundido con el
bloque j. l debe ser igual a 1 pues es el error de restricción único asociado al bloque j. Si
hay tres bloques por ejemplo hay 3 restricciones, una para cada bloque. Como l =1 pues no
tiene grados de libertad (1-1=0), ni suma de cuadrados ni cuadrado medio.

Supuestos
a

 = 0
i=1
i

  =0
j=1
j
98

 ij ~ N(0, 2 )

No existe interacción entre los bloques y tratamientos. El modelo de bloques es aditivo, ésta es
otra forma de decir que no hay interacción de τ con β, que en palabras significa que el efecto
de los tratamientos no depende del bloque: se supone que el efecto que tiene el bloque sobre la
respuesta es independiente del efecto que tiene el tratamiento sobre esta respuesta.

Hipótesis
El interés en este diseño se centra en el factor y no en los bloques; éstos sólo sirven
para incrementar la sensibilidad de la prueba.
Ho: i = j  ij
H1: i  j para al menos una i y una j.

Sumas de Cuadrados
Los cálculos son iguales al modelo de dos factores sin interacción.
a
y..2
b
SCTotal    yij  2

i 1 J 1 N

2
yi.2 y..
a
SCTRAT =  -
i=1 b N

y. j 2 y..2
b
SC BLOQ =  -
j=1 a N

La Suma de cuadrados del error se obtiene por diferencia.

Tabla de análisis de varianza


Fuente de SC G.L. CM FC
Variación
Tratam. SCtrat a-1 SCtrat/(a-1) CMtrat/CME
Bloques SCB b-1 SCB/(b-1)
Error SCE (a-1)(b-1) SCE/(a-1)(b-
1)
Total SCtotal N-1

Ventajas y desventajas del bloqueo:


99

1) Permite eliminar o controlar la variabilidad sistemática de algún factor extraño.


2) Fácil de organizar.
3) El análisis no es demasiado sensible a datos faltantes.
La desventaja es que puede existir interacción entre tratamientos y bloques y no podría
medirse si la interacción tiene sentido. Si los bloques son muy grandes quizá pierdan la
homogeneidad dentro de ellos. Si el experimento es grande, se pierden grados de libertad
del error (lo cual es equivalente a disminuir el tamaño de la muestra).

Ganancia en precisión
La eficiencia relativa mide la efectividad de un diseño respecto a otro, particularmente se
evalúa la precisión de un diseño que se utilizó para un análisis respecto a otro diseño más
sencillo que no se utilizó. Ya sabemos que la varianza es una buena medida para conocer la
precisión de un método. La varianza de la media de un tratamiento
2
 2y  y el objetivo es disminuir esta varianza; esto puede ser incrementando el número de
r
réplicas o bien disminuyendo la 2 mediante el control por bloqueo.
Si se quieren comparar –en cuanto a precisión- dos modelos, se usan sus respectivas varianzas
de las medias de un tratamiento.
 21
 2 y1 
r1
 22
 2y 
2
r2

Si el primer diseño tiene una varianza igual a 1 y el segundo una varianza de doble del
primero, es decir:

 12  1
 22  2
 22  2 12

De este modo
1
 2 y1 
r1
2
 2y 
2
r2

Estas varianzas de las medias son iguales si r2 =2r1, si el segundo diseño tiene el doble de
réplicas que el primero. El diseño 1 es más eficiente que el diseño 2, porque requiere la mitad
de réplicas para tener la misma precisión en la estimación de las medias de tratamiento.
El diseño 2 es menos eficiente que el primero porque requiere el doble de réplicas para tener la
misma precisión en las medias de tratamiento.
Debido a que sólo se tiene la estimación de la varianza en el diseño de bloques y no se cuenta
con la estimación de la varianza en el diseño completamente aleatorizado, ésta tiene que
100

estimarse a partir de los datos de la tabla de análisis de varianza del diseño de bloques. Fisher
calculó una cantidad que llamó información y que implica una corrección por grados de
libertad para la estimación de σ2:
( f  1) 1
I
( f  3) s 2
donde f son los grados de libertad del error y s2 es la estimación de la varianza. Si se conociera
σ2 entonces la cantidad de información sería I = 1/σ2, pero como no se conoce y se estima, se
ajusta esta eficiencia con los grados de libertad. Si s2 disminuye, la cantidad de información se
incrementa.
La eficiencia relativa de dos diseños se define como la razón de la información de los dos
diseños.
( f1  1) 1
I1 
( f1  3) s12
 f  1 1
I2  2
 f 2  3 s22

I1  f1  1 f 2  3 s22
R 
I 2  f1  3 f 2  1 s12

Se puede estimar la eficiencia del bloqueo con respecto al diseño completamente


aleatorizado.

([Link]+ 1)([Link]+ 3)  2 c
R= x
([Link]+ 3)([Link]+ 1)  2 b

Este estadístico significa el número de réplicas necesarias para que el diseño


completamente aleatorizado pueda ser utilizado en lugar de un diseño de bloques,
manteniendo la misma sensibilidad en ambos diseños.
g.l. EB son los grados de libertad del error de bloques
g. l. EC grados de libertad del error del completamente aleatorizado
²c varianza del completamente al azar
²b varianza de bloques.
Como no se sabe el CME para el diseño completamente al azar se emplea la siguiente
fórmula:

(b - 1) CM B + b(a - 1) CM EB
̂ 2 =
ab - 1

Un R = 1 significa que la información de los dos diseños es la misma y cada diseño requiere el
mismo número de réplicas para tener la misma varianza en las medias de tratamientos. R > 1
significa que el diseño de bloques es más eficiente que el completamente aleatorizado. Un R =
2 significa que el diseño completamente aleatorizado requiere 2 veces el número de réplicas
que el diseño de bloques para tener la misma varianza en la media del tratamiento. (Kuehl,
2000).
101

Ejemplo:
Se midieron las concentraciones de nitrógeno de nitratos que percolaban de un
campo forestal con lodo de plantas de tratamientos. Los excesos de nitrógeno se convierten
a nitratos una forma que lixivia al agua subterránea. Se quiere comparar las concentraciones
de nitratos en mezclas de lodos con tierra al 25, 50 y 75 %. Los tratamientos se aplicaron en
distintos días (bloques) debido a que no se podía correr el experimento completo con todo y
réplicas en un sólo día. El experimento se realizó durante 10 días y los tratamientos se
asignaron al azar a las distintas parcelas del terreno: además, en cada día se realizaron todos
los tratamientos:
La aleatorización de los tratamientos a las unidades experimentales se presenta a
continuación:
día: 1 2 3 4 5 6 7 8 9 10
A B C C A B A C B B
C A B B B C C B A A
B C A A C A B A C C
Bloque (día) Tratamiento
A B C
1 1.5 4.5 3.4
2 1.3 4.2 3.2
3 2.0 4.0 3.1
4 2.0 4.0 3.0
5 2.0 4.0 3.1
6 1.9 4.2 3.8
7 3.0 4.1 3.7
8 3.0 3.9 3.1
9 2.5 3.1 3.0
10 2.9 4.0 3.1

Modelo
yij     i   j   ij
donde,
µ es la gran media y es común a todas las observaciones
i es el efecto de la i-ésima mezcla lodo-suelo.
ßj es el efecto del j-ésimo día
ij es el componente de error aleatorio

Sumas de Cuadrados

SCT  319.74 
94.62  21.43
30
SCmezcla 

22.1  40 2  32.52
2
  298.31  16.16
10
SCdías 
 
9.4 2  8.7 2  ...  10 2
 298.31  1.45
3
SCE  21.43  16.16  1.45  3.82
102

Tabla de Análisis de Varianza


Fuente de SC G.L. CM FC p
Variación
Mezcla 16.16 2 8.08 38.08 0.0000
Día 1.45 9
Error 3.82 18 0.21
Total 21.43 29
La FC que se obtuvo del bloque (día) sólo proporciona una idea de si el bloqueo
tuvo sentido. Como resultó no significativo, el modelo completamente aleatorizado hubiera
sido más eficiente ya que el número de grados de libertad del error sería mayor. Al trabajar
con el modelo de bloques se han sacrificado b-1 grados de libertad y la prueba se ha hecho
menos sensible innecesariamente.

Para el problema la ganancia en precisión sería:

(9)(01616
. )  10(2)(0.2121)
 c   019
.
29
19(30) 019
.
R  0.89
21(28) 0.212
Se necesitan 0.89 veces repetir el diseño completamente aleatorizado para obtener la
misma sensibilidad que el de bloques. Aquí puede confirmarse que no era necesario el
bloqueo para analizar los datos del problema. Lo que se perdió fue sensibilidad en el
modelo.

Los tratamientos no necesariamente corresponden a los niveles de un factor, sino que


también pueden ser combinaciones de niveles de tratamientos de un diseño factorial. Un
ejemplo lo proporciona Dean y Voss y se presenta a continuación.
Ejercicio (tomado del libro Design and Analysis of Experiments. Angela Dean and Daniel
Voss)
Este experimento se reportó en Noviembre de 1953 en la Journal of Applied Statistics por
Robert Peaje.
En una etapa intermedia del proceso de hilado de algodón, una hebra de algodón resultó
más gruesa que el hilo final producido. La hebra se entreteje justo antes de enrollarla en la
bobina. El entretejido se realiza por medio de una guía rotatoria llamada volante. El
propósito del experimento es investigar la forma en la cual distintos grados de entretejido
(medidos en vueltas por pulgada) afecta la tasa de ruptura de la hebra, y comparar el
volante ordinario contra un nuevo volante.
Los factores son: Tipo de volante y grado de enrollamiento, el primero con dos niveles:
ordinario y nuevo, y el segundo factor con 4 niveles: 1.63, 1.69, 1.78 y 1.90. De modo que
pueden definirse 8 tratamientos de los cuales dos se eliminaron por no ejercer ningún efecto
en la variable respuesta:
12. Ordinario-1.69
14. Ordinario-1.78
15. Ordinario-1.90
21. Nuevo-1.63
103

22. Nuevo-1.69
23 Nuevo-1.78
Se pensó que para llevar a cabo una corrida completa y para llenar la bobina se requería de
1 día. Por lo que se pensó que los días serían considerados como bloques. Se corrió el
experimento como una diseño de bloques completos aleatorizados. Y se presentan a
continuación los resultados.

Tratamiento Día
1 2 3 4 5 6
12 6.0 9.7 7.4 11.5 17.9 11.9
13 6.4 8.3 7.9 8.8 10.1 11.5
14 2.3 3.3 7.3 10.6 7.9 5.5
21 3.3 6.4 4.1 6.9 6.0 7.4
22 3.7 6.4 8.3 3.3 7.8 5.9
23 4.2 4.6 5.0 4.1 5.5 3.2
Pruebe si existen diferencias entre tratamientos.

Estimación de los parámetros del modelo


ˆ  y..
ˆi  yi.  y..
ˆ j  y. j  y..
yˆ ij  yi.  y. j  y..
ˆij  yij  yi.  y. j  y..

Comparaciones Múltiples
Si los tratamientos son fijos, el interés también es conocer si existen diferencias entre
medias de tratamientos, para lo cual se emplean las pruebas de comparación múltiple. Las
fórmulas varían en que en lugar de colocar el número de réplicas de un diseño completamente
aleatorizado simbolizado por n o r, ahora es reemplazado por la letra b. También el número de
grados de libertad del error de bloqueo el cual es N – a – b + 1. Igualmente la potencia de la
prueba se aplicaría para determinar si el número de bloques manejados en el experimento es el
adecuado.

Ejercicio
a) Probar que µ1 + µ3 = 2µ2
b) Aplicar la prueba de DHS de Tukey y la prueba de rango múltiple de Duncan.

a) Ho: µ1 + µ3 = 2µ2

Construimos el contraste que llamaremos C.


C = 22.1 + 32.5 – 2(40) = -25.4

Ahora calculamos la suma de cuadrados del contraste.


104

SCC 
 25.42  10.75
 
10 12  12  (2) 2
que tiene 1 grado de libertad, por lo que el CM tiene el mismo valor.
FC=10.75/0.21= 50.67 que al compararse con el valor F0.05;1,18 = 4.41, se observa que se
rechaza la hipótesis nula, es decir, existe diferencia estadísticamente significativa entre el
contenido de nitratos en los lixiviados de las mezclas 1 y 3 con el de la mezcla 2.

b) Prueba de Tukey.
1) 4 3.25 2.21
2) q0.05(3,18) = 3.61
2
3) Si.  0.21   0.21
 10 
1
4) t  (3.61)(0.21)  0.53
1.4142
Cualquier diferencia mayor a 0.53 es estadísticamente significativa.
5)
1 vs. 2 : 4 – 2.21 = 1.79 > 0.53 **
2 vs 3: 4 - 3.25 = 0.75 > 0.53 **
1 vs. 3: 3.25 - 2.21 = 1.04 > 0.53 **
Esta prueba que es conservativa nos está indicando que todas las mezclas arrojan distintas
cantidades de nitratos en los lixiviados. Y debido a que la 1 es la que arroja menos nitratos,
sería la de elección por su poder menos contaminante.

c) Prueba de rango múltiple de Duncan.


1) 2.21 3.25 4.0
CM E 0.21
2) S yi .    0.15
b 10
3)
p
2 3
r 2.97 3.12
Rp 0.4327 0.4546

4) 2 vs 1: 4 – 2.21 = 1.79 > 0.4546 **


2 vs 3: 4 – 3.25 = 0.75 > 0.4327 **
1 vs. 3 = 3.25 – 2.21 = 1.04 **
Con esta prueba que es muy sensible se detectan las diferencias entre las medias; nótese que
los valores críticos contra los que se comparan las diferencias de medias son más pequeñas
que el valor estudentizado que se empleó en la prueba de Tukey, lo que nos dice que la prueba
de Duncan es más sensible. En este problema se puede observar que sí existen diferencias y
que éstas son tan significativas que aún con la prueba conservadora de Tukey fueron
detectadas.
105

Tarea. Consultar el libro de Bioestadística. Diseños de Bloques completos al azar con más de
una observación por tratamiento por bloque.
Ejercicios
1. Obtenga E(CMTrat) y E(CMB).
2. Obtenga por mínimos cuadrados los estimadores de los parámetros. Suponga que
ambos, factor y bloque son fijos.
3. Resolver los ejercicios 5-1, 5-2, y 5-5 del libro de Montgomery.

Estimación de datos faltantes


Cuando realizamos un experimento, algunas veces se pierde alguna observación ya sea por
daño a la unidad experimental o por falta de cuidado. En un diseño de bloques completos esto
introduce un problema de no ortogonalidad de los tratamientos a los bloques, es decir, no
todos los tratamientos están en todos los bloques.
Este dato puede estimarse por el método aproximado de Yates o bien puede realizarse el
análisis de varianza con el método exacto.

Método aproximado de Yates


Cuando hay una observación faltante este dato es fácil de estimar algebraicamente de
modo que el residuo para el valor perdido sea cero. La suma de cuadrados del error se expresa
como una función cuadrática del valor perdido x y los valores observados. El valor de x se
estima de modo que se minimice la suma de cuadrados del error. Si el análisis de varianza se
realiza, los cálculos se hacen con el nuevo valor estimado de x pero teniendo cuidado de
restarle un grado de libertad a la SCE y a la SCT por dato estimado.
 Suponga las observaciones yij.
 Denote por x la parcela faltante
 es el gran total con la observación faltante
 Es el total del i-ésimo tratamiento que contiene a la parcela faltante
 es el total del j-ésimo bloque que contiene a la parcela faltante.
SCE   yij  yi.  y. j  y.. 
2

2
1 a  b  1 b  a
2

  y     yij      yij    yij 
2 1 2
ij
b i1  j 1  a j 1  i1  ab

  y    yi.    y. j    y.. 


1 a 2 2 1 b 2 1 2
ij
b i1 a j 1 ab

L  SCE  x 2

y ' x  y
ij
2
' x   y'..  x 2
.j

2

R
ij
b a ab
L 2 y'i.  x  2y'. j  x  2 y'.. x 
 2 xij    0
x b a ab
ay' by'. j  y'..
x  i.
(a  1)(b  1)
106

Método Exacto
Consiste en realizar el análisis de varianza utilizando el procedimiento de la regresión general
que consiste en calcular la reducción en la suma de cuadrados total al ajustar el modelo cuando
todos los parámetros están incluidos y la reducción en la suma de cuadrados cuando el modelo
está restringido por Ho, es decir cuandoi = 0. La diferencia entre ambas reducciones en las
sumas de cuadrados es la suma de cuadrados de tratamiento con la que se conduce Ho.
La metodología consiste en:
1. Obtener las ecuaciones normales para el modelo completo.
2. Determinar la reducción en la suma de cuadrados al ajustar los datos al modelo
(completo).
3. Determinar el número de grados de libertad asociados a esta suma de cuadrados.
4. La variabilidad no explicada es la suma de cuadrados del error SCE, se obtiene por
diferencia.
5. Para encontrar la SCtratamiento, se considera el modelo reducido, es decir bajo Ho.
6. Se obtiene el sistema de ecuaciones normales para este modelo.
7. Obtener la reducción en la suma de cuadrados al ajustar los datos al modelo reducido.
8. Encontrar el número de grados de libertad asociados a esta suma de cuadrados.
9. Completar la tabla de análisis de varianza.
Suponga por ejemplo que se tiene el siguiente diseño de bloques:
Bloques 1 2 Totales
Tratamientos
1 Y11 Y12 Y1.
2 Y21 X Y 2.
3 Y31 Y32 Y 3.
Para obtener el sistema de ecuaciones normales emplee el algoritmo propuesto por
Montgomery y que a continuación se describe:
1) Obtener una ecuación normal por cada parámetro.
2) El miembro derecho de cada ecuación normal es la suma de todas las observaciones
que corresponden a cada parámetro.
3) El miembro izquierdo de cada ecuación es la suma de todos los parámetros del
modelo, cada parámetro multiplicado por el número de veces que aparece en el total
del lado derecho de la ecuación.
4) En el ejemplo,
 : 5ˆ  21   2  2 3  3  2  2  y..
1 : 2  21  1  2  2  y1.
 2 :    2  1  y2.
 3 : 2  2 3  1   2  y3.
1 : 3  1   2   2  31  y.1
 2 : 2  1   3  2  2  y. j
Puede observarse que hay dos dependencias lineales, la suma de las tres  dan la primera
ecuación y la suma de las dos últimas también dan la primera ecuación.
Añadiendo las restricciones al modelo
107

 r  0
i 1

 Sb  0 j
La solución a este sistema de ecuaciones es:
µ=y../5
1=1/4(y11)+(7/20)y21 -1/5y21 -1/5y31-3/20y32
2=-2/5y11 + 4/5y21 –2/5y31
3=-1/10y11 –7/10y12 – 2/5y21 +4/5y31 + 3/10 y32
ß1=1/5y11-1/5y12+1/5y31-1/5y32
ß2=-3/10y11 +3/10 y12 –3/10y31 +3/10y32

Cuando ajustamos un modelo explicamos algo de la variabilidad de los datos, es decir


reducimos la variabilidad total no explicada por alguna cantidad.
5. Determinar la reducción en la suma de cuadrados para el modelo completo. Esta
reducción es siempre igual a la suma de los parámetros estimados por mínimos
cuadrados (estos valores estimados sirven para calcular la reducción en la suma de
cuadrados del modelo completo) cada uno multiplicado por el lado derecho de su
ecuación normal, es decir por su total.
R( ˆ ,ˆ, ˆ )  ˆ y..  i 1 i yi.    j y. j

 y..y..    yi. y..) yi.    y. j  y..) y. j 


a b

i 1 j 1

   y. j y.. j y. j  ..
2 2
a b
y2
   yi. yi.  
y y
 .. ..
ab i 1 ab j 1 ab
yi2. y2 y2
  b
  . j  ..
a ab
El número de grados de libertad asociados a R es igual al número de ecuaciones
linealmente independientes, es decir, 6-2=4. O bien, a+b-1=3+2-1=4
6. La SCE se obtiene por diferencia y es la parte de la variación total no explicada por el
modelo.
SCE   yij2  R(ˆ ,ˆ, ˆ )
2
yi2. y y2
  yij2     . j  ..
b a ab
con N-a-b+1 grados de libertad o bien 5-3-2+1=1
Este CME se empleará como denominador para probar Ho: µi=µj
Para el modelo reducido, que es el que resulta cuando Ho es verdadera o dicho en palabras,
no hay efecto de los tratamientos:
yij     j   ij
se procede de la misma manera que con el modelo completo.
El sistema de ecuaciones normales sería:
 : 5ˆ  3ˆ1  2ˆ2  y..
ˆ1 : 3ˆ  3ˆ1  y.1
 2 : 2ˆ  2ˆ2  y.2
con 3-1 grados de libertad, es decir 2 debido a la dependencia lineal.
108

Estos valores estimados sirven para calcular la reducción en la suma de cuadrados del
modelo reducido.
b
Imponiendo la restricción:  sb  j  0 la solución al sistema de ecuaciones sería:
j 1

1
ˆ  y..
5
1 y..
ˆ1  y1. 
3 5
1 y..
ˆ2  y2. 
2 5
La suma de cuadrados explicada en el modelo reducido sería:
R( ˆ , ˆ )  ˆ y..  ˆ1 y.1  ˆ 2 y.2

   y . j  y..y . j
y..2 b

ab
y..2 b
y2
   y. j y . j  ..
ab ab
b y .2j

a
con b grados de libertad.
La suma de cuadrados debida a i después de introducir a µ y ß es:

R(ˆ / ˆ , ˆ )  R(  ,  ,  )  R(  ,  )
y i2. y.2j y..2 b y2
   
.j

b a ab a
y i2. y2
  ..
b ab
con a – 1 grados de libertad. Esta fórmula corresponde a la suma de cuadrados de
tratamiento con a-1 grados de libertad.

Para obtener la suma de cuadrados de los bloques tendríamos que trabajar con otro modelo
reducido:
yij     i   ij
a

y 2
i.

R( 
ˆ ,ˆ) 
b
con a grados de libertad.
SCbloques después de ajustar el modelo reducido con µ y ß sería:
109

R (  /  ,  )  R (  , ,  )  R (  , )
a

y 2
y y
2 2 y 2
i.

    i.
 .j ..
b a ab b
y2 y2
  . j  ..
a ab
con a+b-1-a = b-1 grados de libertad.
De este modo la tabla de análisis de varianza sería:
Fuente de Variación SC g.l. CM F
Modelo Completo
T,ß SCcompl. 4-1=3
Error SCE 1 CME
Modelo Reducido
R(µ,ß) SCRed 1 CMB
R(t/µ,ß) SCc-SCred 2 CMTrat CMTrat/CME

En resumen, con el método exacto no se estima el valor, más bien se realiza el análisis
de varianza con el método de la regresión tomando en cuenta a la observación perdida.
Realmente por causas experimentales no deben perderse datos pues eso habla del poco
control y cuidado que se ha tenido al realizar el experimento. Si la pérdida fue inevitable no
importa estimar el dato por el método aproximado de Yates, pero si se pierden más datos
queda en entredicho el que realiza el experimento. Si se pierde más de un dato, por ejemplo
dos, se sugiere un dato, se estima el otro dato; con este dato se estima el que al principio se
había sugerido y así sucesivamente hasta que converjan. Si se pierde más de dos datos, se
recomienda emplear el método exacto.

Ejercicio Propuesto.
1. El siguiente es un diseño de bloques completos aleatorizados.
Bloque a b c d e F
I 16 22 16 y1 18 8
II 28 27 17 20 23 23
III 16 25 16 16 19 16
IV 28 y2 19 18 24 25
Si el y1 fuera la media del bloque o la media del tratamiento, estime y1 y y2.
Inserte los valores estimados y efectúe el análisis de varianza prestando atención a los
grados de libertad del error y totales.

Cuadro latino.
En el diseño de bloques completos al azar se aleatorizan los tratamientos en cada
bloque de manera que en cada bloque se aplica una sola vez cada tratamiento. La
aleatorización está restringida por los bloques. Existen otros experimentos en los cuales se
quiere investigar el efecto de un solo factor y se requiere eliminar el efecto de otras dos
variables; es entonces que se aplican los cuadros latinos. El cuadro latino tiene las
siguientes características:
1) Es un cuadro, tiene igual número de columnas y de filas.
2) Igualmente existe el mismo número de filas, columnas y tratamientos.
3) En cada fila y la columna sólo se presentan los tratamientos una sola vez.
110

Los cuadros latinos más comunes son los de 4 y 8 tratamientos con una sola unidad
experimental por tratamiento en cada fila y columna. Cada hilera o columna constituye una
repetición completa de los tratamientos. El número total de unidades experimentales es
igual a t² (es un cuadrado perfecto). Se supone que incrementa la eficiencia respecto a un
diseño de bloques completos al azar.
Se requiere que no exista interacción entre F, C y T. La desventaja del cuadrado
latino es que el número de unidades experimentales requerido para establecer un
experimento se incrementa notablemente a medida que aumenta el número de tratamientos
en ensaye. Además se requiere que el número de tratamientos debe ser igual al número de
réplicas (filas y columnas). El error se incrementa conforme se incrementa el tamaño del
cuadro latino. Los cuadros latinos pequeños tienen pocos grados de libertad para el error y
no se pueden evaluar las interacciones entre filas , columnas y tratamientos.
El cuadro latino tiene la siguiente forma:
A B C D
B C D A
C D A B
D A B C
Un cuadro latino como el anterior en el que la primera fila y columna están en orden
alfabético recibe el nombre de cuadro latino estándar.
Un cuadro latino estándar cíclico es el que tiene los tratamientos de la primera fila y
primera columna en orden alfabético y si las letras de cada fila se pueden obtener de las
previas corriendo la primera letra de una fila a la última posición de la siguiente fila y
desplazando todas las demás letras de dicha fila.

Aleatorización
Existe un glosario de cuadros latinos estándar de varias dimensiones de hasta 12 x 12 en el
libro de Diseños Experimentales de Cochran o en el libro de Diseños de Experimentos de
R.A. Fisher. Para la aleatorización elija un cuadro latino estándar aleatoriamente. Para
cuadrados latinos de 3 4 o 5, permutar todas las hileras excepto la primero y después
permutar todas las columnas.
Ejemplo, suponga que eligió el cuadro latino de 4 x 4 siguiente:
A B C D
B C D A
C D A B
D A B C
Con una tabla de números aleatorios elija dos secuencias de números, la primera del 2 al 4
(para permutar las tres filas) y una secuencia de 4 números (para permutar las cuatro
columnas).
Suponga que las series fueron: (2,4, 3) y (3,1,4,2)
Cómo quedaría el cuadro?
A B C D C A D B
B C D A D B A C
D A B C ------- B D C A
C D A B A C B D
También puede elegirse al azar un cuadro latino estándar y se aleatorizan todas las filas y
las columnas.
111

¿Cuántos cuadros latinos pueden existir?


A partir de el único cuadro latino estándar 3 x 3 se pueden formar 3¡2¡=12 cuadros latinos,
incluyendo al estándar.
Existen 4 cuadros latinos de 4 x 4 y a partir de cada uno se pueden formar 4¡3¡=144
cuadros latinos incluyendo al estándar. Debido a que son 4 c. l. estándar entonces habrá un
total de 576 cuadros latinos de 4 x 4, 4 de los cuales son estándar.
Para cuadros latinos de 5 x 5, existen 56 cuadros latinos estándar. Y a partir de cada uno se
pueden formar 5¡4¡= 2880 x 56= 161,280.

Ejemplo:
Un ingeniero químico elabora una salsa casera y piensa que la viscosidad de su producto no
es de la consistencia adecuada. Cree que la concentración de harina y agua determina su
viscosidad, otros factores que también afectan la viscosidad son controlados a niveles fijos.
Desea probar 4 mezclas agua:harina, y son las mezclas 1:1 (1 parte de agua, 1 parte de
harina), 1:2, 1:3 y 1:4. Debido a que la elaboración es tequiosa emplea a 4 químicos para
que cada uno elabore la salsa con las cuatro mezclas. A su vez no se cuenta con 1 batidora
sino que tiene 4 batidoras para la elaboración de las salsas. Las 4 batidoras trabajarán con
las 4 mezclas a fin de que todas las salsas tengan la misma oportunidad de ser batidas por
las 4 batidoras. Debido a que desea eliminar el efecto que pudiera ejercer el químico o la
batidora en la variabilidad de los datos propone un diseño de cuadrado latino con dos
restricciones en la aleatorización: químico y batidora.
¿Cuál sería el modelo, hipótesis y supuestos?
Con los resultados que se presentan abajo construya su tabla de análisis de varianza y
concluya.
Batidoras
C 10 D 14 A7 B8
B7 C 18 D 11 A8
A5 B 10 C 11 D9
D 10 A 10 B 12 C 14

A. Mezcla 1:1
B. Mezcla 1:2
C. Mezcla 1:3
D. Mezcla 1:4

Las filas son los químicos y las columnas las batidoras.


C 10 D 14 A 7 B 8
B 7 C 18 D 11 A 8
A 5 B 10 C 11 D 9
D 10 A 10 B 12 C 14

Modelo
yijk =  + i + ßj + k + eijk, i= 1,2,...,p, j= 1,2,...,p, k= 1,2,...,p
donde,
 es la media total para los p tratamientos usando todas las p² combinaciones de 2 factores.
i es la parte de la media debida a la i-ésima fila.
112

ßj es la parte de la media que se atribuye al j-ésimo tratamiento


k es la parte debida a la k-ésima columna.

Supuestos:
1) las p2 poblaciones están normalmente distribuidas
2) Tienen varianzas iguales
3) No existe interacción
4) Existe independencia de errores.

Sumas de Cuadrados
p p
y...2
P
SCtotal =  y -
2
ijk
i=1 j=1 k=1 N

p
y2. j. y2...
SCTrat =  -
j=1 p N

p
yi..2
SCrenglón =  - f.c.
i=1 p

y..k 2
p

SCcolumn =  - f.c.
k=1 p

SCerror = SC total - SC trat - SC renglón - SC columna.

Grados de libertad y cuadrados medios


Los grados de libertad asociados a cada fuente de variación corresponden a p-1. Y
los cuadrados medios el resultado de dividir las sumas de cuadrados entre los grados de
libertad.
g.l. del error = (p-2)(p-1)
g.l. totales = p²-1.

Tabla de análisis de varianza


Las sumas de cuadrados, grados de libertad y cuadrados medios quedan resumidos en la
tabla de análisis de varianza que se presenta a continuación.
Fuente de SC G.L. CM FC
Variación
113

Tratam. SCtrat p-1 SCtrat/(p-1) CMtrat/CME


Renglón SCrenglón p-1 SCreng/(p-1)
Columna SCcolumna p-1 SCcol/(p-1)
Error SCE (p-2)(p-1) SCE/(p-2)(p-1)
Total p²-1

Resolviendo el ejemplo:
SCT  1834 
164 2  153.0
16
39 2  44 2  35 2  46 2
SCquim   1681  18.5
4
30 2  37 2  532  44 2
SCmezcla   1681  72.5
4
32 2  52 2  412  39 2
SCbatidora   1681  51.5
4
SCE  153  18.5  72.5  51.5  10.5
Fuente de SC G.L. CM FC
Variación
Tratam. 72.5 3 24.17 13.81
Renglón 18.5 3 6.17
Columna 51.5 3 17.17
Error 10.5 6 1.75
Total 153 15
F0.05;3,6=4.76
Como Fc es mayor que el valor de la tabla, entonces rechazamos Ho, es decir, existen
diferencias entre las mezclas.
Estimación de los parámetros del modelo
ˆ  y...
 i  yi..  y...
ˆ j  y. j .  y...
ˆk  y..k  y...

La desventaja de los cuadros latinos es que como existen 2 fuentes de bloqueo el


número de grados de libertad se reduce. Los cuadrados latinos de grandes dimensiones son
muy difíciles de aplicar pues es raro que se presenten las dos fuentes de bloqueo en un
número grande e igual de niveles, e iguales al número de tratamientos. Otra desventaja es
que requiere un número grande de unidades experimentales, particularmente si p > 10. Si se
tiene un cuadro latino de p tratamientos se requieren p2 unidades experimentales, por lo que
si se tienen 10 tratamientos se requieren 100 unidades experimentales. Los cuadrados
latinos pequeños tienen la desventaja de que son pocos los grados de libertad del error , por
ejemplo, para un cuadrado latino de 3 x 3 son 2 grados de libertad, para uno de 4 x 4 son 6
grados de libertad, para uno de 5 x 5 son 12 grados de libertad. Sin embargo es lógico que
cuadros latinos de estas dimensiones sean más aplicables. Los cuadros latinos más
114

utilizados están en el rango de 4  p  10. Para incrementar los grados de libertad del error
se pueden repetir los cuadros .
Los cuadros latinos se pueden duplicar de tres maneras:
i) Repetir el cuadro, los mismos renglones y las mismas columnas
ii) Los mismos renglones o las mismas columnas, pero no ambos.
iii) Repetir el cuadro con diferentes renglones y diferentes columnas.
Cuando se replican los cuadros latinos la aleatorización de cada cuadrado se realiza por
separado
Véanse las fórmulas de cálculo para los tres casos en el libro de Montgomery.

Cómo estimaría un dato faltante empleando el método aproximado de Yates?

Ejercicio Propuesto (tomado del libro Introduction to Experimental Statistics. C.C. Li.)
El siguiente es un cuadro latino en el que L y P son las dos fuentes de bloqueo, y a, b, c, d,
y e son los tratamientos. Encuentre los valores de los residuos y compruebe que suman cero
para L, para P y para cada tratamiento.

E C A D B Total
20 9 15 36 22 102
C B D E A
14 24 37 23 18 116
A 3 C B D
13 17 10 17 29 86
D A B C E
33 16 21 16 22 108
B D E A C
19 27 14 15 13 88
Totales
99 93 97 107 104 500

Potencia de la prueba, comparaciones múltiples y eficiencia del cuadrado latino. Véase en


Applied Linear Statistical Models Setter, Kutner, Nachtsheim y Wasserman (1996). P.
1219.

Eficiencia relativa del bloque por columna.


Si sólo se utiliza el criterio de bloque de los renglones con un diseño de bloques completos
al azar la estimación del CME es
CM columnas  ( p  1)CM E
ˆ B2 
p

R
glEL  1glEB  3 * ˆ B2
glEL  3glEB  1 ˆ L2
Y para determinar la eficiencia del bloqueo de las columnas para el bloque con diseño de
bloques completamente aleatorizado el estimador del error del diseño de bloques sería:
115

CM filas  ( p  1)CM E
ˆ B2 
p
Y la eficiencia se obtiene:
R
 glEL  1glEB  3 ˆ B2
*
glEL  3glEB  1 ˆ L2
A continuación se presenta un conjunto de ejemplos numéricos que el alumno resolverá
aplicando las fórmulas propuestas por el libro de Montgomery.
Diferentes filas y mismas columnas.
A 7.0 B 8.0 C 9.0
B 4.0 C 5.0 A 6.0
C 6.0 A 3.0 B 4.0

C 8.0 B 4.0 A 7.0


B 6.0 A 3.0 C 6.0
A. 5.0 C 8.0 B 7.0
116

Diseños conmutativos
Son diseños en los cuales a los sujetos se les da un número de tratamientos en una
secuencia de tiempo con el objeto de evaluar la diferencia entre tratamientos. Por
consiguiente se requiere la mitad de sujetos que los necesarios para una comparación de los
tratamientos con distintos grupos de individuos. Cada sujeto sirve como su propio control.
Este tipo de diseño es un diseño de bloqueo en el cual cada unidad experimental o sujeto es
un bloque. Este diseño es muy útil cuando hay una considerable variación entre unidades
experimentales. Si hay demasiada diferencia entre las unidades las comparaciones de los
factores pueden ser confundidos por los efectos de grupos de unidades experimentales que
reciben los mismos tratamientos. Como cada sujeto recibe los diferentes tratamientos se
debe tener la seguridad que no hay efecto residual de los tratamientos con el objeto de
poder evaluar el siguiente tratamiento.
Se utiliza generalmente para comparar tratamientos de enfermedades crónicas no agudas ya
que en éstas últimas puede suceder que los individuos sanen al cabo o durante el primer
período de tratamiento.
Debido a su larga duración puede que algunos individuos abandonen el experimento.
También debido a que reciben varios tratamientos la aparición de efectos secundarios
muchas veces obligan al paciente a abandonar el estudio. Si algún paciente abandona el
estudio al comenzar el segundo período se pierde la información de ese paciente.
Para que un diseño conmutativo se aplique correctamente se deben cumplir los siguientes
supuestos:
 Existe una gran variación incontrolable entre las unidades experimentales.
 Los períodos de tiempo son de suficiente duración para que se manifiesten los
efectos de los factores.
 No hay efecto residual de un período al siguiente. Estos efectos también reciben el
nombre de efectos acarreados y se deben a: el efecto de un tratamiento perdura
117

tiempo después de su aplicación, o también la condición del enfermo puede cambiar


durante el primer período.
 Los efectos de los factores, si hay, no cambian en el tiempo, es decir no hay
interacción del tiempo y los factores.
 La enfermedad debe tener una intensidad constante durante todos los períodos de
tiempo.
Cuando se estudia el efecto de pocos factores, se utilizan secuencias de cuadros latinos
como diseños conmutativos. El más común es aquél en el cual se estudian dos tratamientos
en dos períodos con un período de limpieza o descanso entre ambos. A estos diseños se les
conoce como AB/BA, es decir la mitad de los sujetos reciben la secuencia A B y la otra
mitad BA, y después del período de lavado la primera mitad recibe BA y la otra AB.
El más común es uno en el cual la mitad de los pacientes o individuos reciben un
tratamiento activo y en ocasión subsecuente un tratamiento imaginario o placebo, mientras
que el resto de los pacientes reciben primero el placebo y en una ocasión subsecuente el
tratamiento activo. Cuando se supone que no hay efectos acarreados recibe el nombre de
enfoque clásico y es el que se trata en esta sección. Se puede considerar como series de
cuadros latinos de 2 x 2. En este diseño hay p tratamientos y p períodos de tiempo y hay np
unidades experimentales y np2 observaciones. Por ejemplo, suponga 20 sujetos que reciben
el tratamiento A y el placebo B, 10 sujetos primero reciben A y después B y la otra mitad a
la inversa.
Es recomendable que al inicio del experimento exista un período de estabilización o de
adaptación para premonitorear los signos y síntomas relevantes de la enfermedad.
Períodos 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20
1 A B B A B A A B A B B A B A A B B A A B
2 B AA B A B B A B A A B A B B A A B B A
Son 10 réplicas de cuadros latinos 2 x 2.
Filas 2
Columnas 2

Ejemplo:
Son mediciones de flujo pico expiratorio (PEF) que es una medida de la función pulmonar,
en 14 niños de edades de 7 a 14 con asma moderada a severa, se estudió aplicando un
diseño conmutativo (o crossover) de 2 períodos de tiempo y 2 tratamientos que compara los
efectos de una dosis simple inhalada de 200µg de salbutamol, que es un broncodilatador
bien conocido y 12 µg de formoterol, un broncodilatador reciente. Los niños se
aleatorizaron a uno de dos grupos de secuencia. En un grupo se aplicaba la siguiente
secuencia: dosis formoterol en la mañana, observado por 8 horas en la clínica, fueron a casa
donde sus padres tomaron mediciones de PEF después de 10, 11 y 12 horas de tratamiento.
En una ocasión subsecuente después del lavado (washout) de al menos un día se
presentaron en la clínica y se les administró el salbutamol.
Secuencia Período 1 Washout Período 2
For/Sal Formoterol No tratamiento Salbutamol
Sal/For Salbutamol No tratamiento Formoterol
1 2 3 4 5 6 7
Período 1 310 A 370 B 310 B 310 A 380 B 370 A 410 A
Período 2 270 B 380 A 400 A 260 B 410 A 300 B 390 B
118

8 9 10 11 12 13 14
Período 1 280 B 290 B 250 A 380 A 260 B 90 B 330 A
Período 2 310 A 320 A 210 B 350 B 340 A 220 A 360 B

Que también pudo haberse presentado de la siguiente manera:


1 4 6 7 10 11 14
Formoterol 310 310 370 410 250 380 330
Salbutamol 270 260 300 390 210 350 360

2 3 5 8 9 12 13
Salbutamol 380 310 380 280 290 260 90
Formoterol 380 400 410 310 320 340 220
El modelo para este diseño sería:
yijk    Pi   (i )  S j  ( j )  Fk   ijk
donde,
Pi es el efecto del i-ésimo período
Sj el efecto del j-ésimo sujeto
Tk el efecto del k-ésimo medicamento

Hay p tratamientos, np unidades experimentales y p períodos. Son n cuadros latinos p x p, y


están anidados para formar un rectángulo de p x np.
Cada unidad recibe cada tratamiento en un período.
En cada período, cada tratamiento se usa en n unidades.
Note que aparecen dos letras griegas que corresponden a los errores de restricción de las dos
fuentes de bloqueo que son el período de tiempo y los sujetos.
SCP 
 yi2.. GT 2
 2
np np

SCS 
y 2
. j.
 f .c
p
y..2k
SCT    f .c
np

SCP 

yi2.. GT 2

14 28

SCS 
 y. j.  f .c
2

2
y2
SCT   ..k  f .c
14
de modo que la tabla de Análisis de varianza quedaría así:
Fuente de variación Grados de libertad
119

Sujetos (Columnas) np-1


Períodos (filas) p-1
Tratamiento p-1
Error np2-(n+2)p+2
Total np2-1

En nuestro ejemplo n = 7 y p = 2. np = 14 y np2 = 28

Tabla de análisis de varianza


Fuente de SC G.L. CM FC
Variación
Sujetos 1153.43 13
Período 11.57 1
Tratamiento 137.28 1 137.29 19.12
Error 86.14 12 7.18
Totales 1388.43 27
F 0.05;1,12= 4.74
F 0.01;1,12=9.33, por lo que sí existe una diferencia altamente significativa entre los dos
tratamientos.

¿Cómo sería un diseño conmutativo en el que se prueben 3 tratamientos?


Se emplearían secuencias de cuadros latinos de 3 x 3 y un esquema podría ser el siguiente:
Sujeto 1 2 3 4 5 6 7 8 9
Período
Inicio A C B A B C C B A
Intermedio B A A C C A B A C
Final C B C B A B A C B

Ejercicio:
Una industria farmacéutica desea probar dos drogas. Dispone de 12 personas. Se eligieron 6
personas al azar para recibir la droga 1 primero. Las otras 6 recibieron la droga 2 Después
de un período suficiente de limpieza (washout), las 6 quienes recibieron la droga 1,
recibieron ahora la droga 2 y las 6 que primero recibieron la droga 2 recibieron ahora la
droga 1.
Orden 1: Droga 2, Droga 1
D2 51.9 35.1 38.6 36.1 34.6 39.7
D1 58.5 60.4 50.4 58.7 64.8 54.9
Orden 2: Droga 1, Droga 2
D1 50.8 41.1 39.1 35.7 33.7 31.2
D2 62.2 51.4 50.7 51.1 51.4 45.1
Determine si hay diferencia entre las drogas.

CUADRO GRECOLATINO
Este es un diseño en el que se manejan 3 restricciones en la aleatorización y se denota por
letras griegas , , etc. Existen tres fuentes de bloqueo cuyos efectos no se quieren estimar. El
arreglo se presenta a continuación:
120

Columnas
I II III IV
1 A Bß C D
Filas 2 B A D Cß
3 C D A B
4 Dß C B A

Un ejemplo propuesto por Wu y Hamada (2000) puede ser que deseemos comparar tres
aditivos de gasolina probándolos en tres autos con tres automovilistas en tres días. Los aditivos
son los tratamientos asignados con las letra latina A, B y C. Los carros, automovilistas y días
son los factores de bloqueo asignados a las filas, columnas y letras griegas.

Modelo
yijkl =  + ßi + j + k + l + ijkl
Este tipo de diseño no se usa con frecuencia ya que rara vez las unidades experimentales
pueden balancearse en los tres tratamientos, (Cochran, 1965). Si en el ejemplo citado en la
sección de bloques completos (ejemplo de lodos de fosa séptica y nitratos en el agua) se cree
que la posición en la que se coloque el lodo puede incrementar el error y se piensa que existen
diferencias entre las posiciones, se puede adicionar como una tercera fuente de bloqueo y
analizarlo mediante un cuadro grecolatino.
Los cuadros son ortogonales, ninguna letra griega aparece más de una vez con cada
letra latina. Cada letra griega se presenta sólo una vez en cada renglón y en cada columna.
La suma de cuadrados debida a la letra griega puede calcularse sumando los totales o
promedios de cada letra griega.
La ventaja principal de utilizar un cuadro grecolatino es que se permite controlar 3 fuentes de
variación. Pero sus desventajas es que el número de unidades experimentales requeridas
aumenta muy rápidamente el aumentar el número de tratamientos a comparar. Si los cuadros
son pequeños el número de grados de libertad del error es pequeño, si se pierden datos se
complica el análisis y es muy difícil un balance entre tres agrupaciones.
Si el cuadro es pequeño los grados del error son muy pequeños:
Si p = 3, los g.l. del error = 0
p = 4, g.l. error = 3.
Para cuadros grecolatinos grandes se requieren muchas unidades experimentales. Por ejemplo
si p = 12 se requieren 144 unidades experimentales.

Ejemplo:
Una medida compuesta de la calidad de la pantalla se tomaron en pantallas que usaron cuatro
concentraciones de laca, cuatro tiempos, cuatro concentraciones del acriloide (A, B, C y D) y
cuatro concentraciones de acetona (. , y ).

Concentración de laca
121

Tiempos 0.5 1 1.5 2


30 Cß = 16 B = 12 D = 17 A = 11
20 B = 15 C = 14 A =15 Dß = 14
10 A = 12 D = 6 Bß = 14 C = 13
5 D = 9 Aß = 9 C = 8 B = 8
Realice el análisis completo de estos datos.

Se conduce un experimento para comparar cuatro aditivos de gasolina y se prueban en cuatro


coches con cuatro conductores en un período de cuatro días. Sólo cuatro corridas se pueden
llevar a cabo cada día. La respuesta es la cantidad de emisión del automóvil.
Los tratamientos son: aditivos A, B, C y D
Los conductores son las filas, los días las columnas y las letras griegas los automóviles.

Obtener la tabla de Análisis de varianza aplicando las siguientes fórmulas de sumas de

cuadrados

Bloques incompletos balanceados


Este diseño se emplea cuando no se pueden aplicar todos los tratamientos dentro de cada
bloque. Es decir, no todos los tratamientos están en todos los bloques. A estos también se
les conoce como diseños de bloques incompletos aleatorizados. Cuando todos los
tratamientos son igual de importantes, los tratamientos usados dentro de cada bloque deben
seleccionarse de modo balanceado o sea que cualquier par de tratamientos se presenten
juntos el mismo número de veces.
El número de tratamientos es a y el número de tratamientos dentro de cada bloque es k (k <
a).
122

Se puede construir un diseño de bloques incompletos balanceados tomando las


a
combinaciones   bloques y asignando una combinación diferente de tratamiento a cada
k 
bloque.
Por ejemplo, si a = 5 y se cuenta con 5 bloques sería un diseño de bloques completos.
Si se trata de 5 tratamientos y 4 se pueden aplicar dentro de cada bloque, entonces existen
5!/4!1!=5 bloques con cuatro tratamientos cada uno.
También 5!/3!2!=10 bloques con tres tratamientos cada uno.
En un diseño de bloques incompletos balanceados existen a tratamientos, b bloques, k
tratamientos por bloque y cada tratamiento ocurre r veces.
N= ar =bk

El valor  es el número de veces que cualquier par de tratamientos Ai, Aj aparecen juntos.
Por ejemplo en el siguiente diseño:
B1 B2 B3 B4 B5 B6 B7
A1 X X X X
A2 X X X X
A3 X X X X
A4 X X X X
A5 X X X X
A6 X X X X
A7 X X X X
Puede observarse que los tratamientos 1 y 2 aparecen juntos en los bloques 1 y 3. Los
tratamientos 1 y 3 en los bloques 1 y 2; los tratamientos 1 y 4 en los bloques 2 y 6, es decir
el valor de  es igual a 2. También puede observarse que el número de veces que aparece
cada tratamiento, o bien r, es igual a 4.
Con k niveles de A pareados con cada nivel de B el nivel Ai estará apareado con k-1 otros
niveles de A dentro de cada nivel de B con el que esté apareado.
Si Ai está apareado con r diferentes niveles de B, entonces el número de veces que parece
Ai combinado con otros niveles de A es r(k-1).
Por otro lado, debido a que cada nivel de A está pareado con cada otro nivel de A  veces,
el número de veces que Ai está apareado con cada uno de los otros (a-1) niveles de A debe
ser (a-1) por lo tanto es cierto que:
r(k-1=(a-1) y

En este ejemplo a = 7, b =7, r =4 y k = 4 de modo que


r (k  1) 4(3)
  2
a 1 6
El parámetro  debe ser un entero.
Las características de un diseño de bloques incompletos balanceados pueden enumerarse:
1. El número de tratamientos excede al tamaño del bloque
2. Cada tratamiento se repite igualmente.
3. Cada par de tratamientos ocurre en exactamente  bloques
4. Se tiene la misma precisión para todas las medias y para todas las comparaciones de
medias.
123

Para que sea un diseño de bloques incompletos balanceados debe cubrir tres condiciones:
1) ar = bk
2) r(k-1) = (a-1)
3) b  a

En el libro Statistical Design and Analysis of Experiments with applications to Engineering


and Science (1989) de Robert L. Mason, Richard F. Gunst and James L. Hess, se presentan
listados los diseños de bloques incompletes balanceados.

Si se trata de un diseño en el que quieren compararse siete tratamientos y se tienen 7


bloques pero sólo se pueden probar 4 tratamientos por bloque y cada tratamiento ocurre 4
veces, vemos que se trata del diseño número 13.

La aleatorización de un diseño de bloques incompletos consiste en seleccionar un diseño


con los valores elegidos de los parámetros.

En el ejemplo, se trata del diseño 13 que se describe a continuación:


Diseño 13.
a=7 k=4 r=4 b=7 =2
Bloque
(1) 3 5 6 7
(2) 1 4 6 7
(3) 1 2 5 7
(4) 1 2 3 6
(5) 2 3 4 7
(6) 1 3 4 5
(7) 2 4 5 6

Una vez seleccionado el diseño, entonces se aleatorizan los tratamientos a las unidades
experimentales de cada bloque: es decir en dos urnas colocar los tratamientos y en la otra
las unidades experimentales de ese bloque. Hacer una aleatorización diferente por bloque.

Suponga que se quiere comparar 5 tratamientos pero los bloques solo pueden soportar 4
tratamientos.
5
a) Se pueden formar    5 bloques
 4
b) Asigne cada uno de las k diferentes combinaciones de tratamientos a los bloques:
1234
1235
1245
1345
2345
c) El número de réplicas es:
124

 a  1  4 
      4 réplicas
 k  1  3 
d) λ es el número de veces que aparece cada par de tratamientos en los bloques
 a  2  5  2 
        3
 k  2  4  2

Ejemplo: Un ingeniero estudia las características de 5 tipos de aditivos de gasolina, para


esto observa el kilometraje obtenido al utilizar cada uno de los aditivos. En la prueba de
carretera se utilizan autos como bloques pero a causa de limitaciones en el tiempo se usa el
diseño de bloques incompletos balanceados.
En este ejemplo a son los aditivos =5, b son los automóviles = 5, r es el número de veces
que aparece cada aditivo o número de niveles de B apareados con cada nivel Ai y es igual a
4, y k es el número de tratamientos por bloque o número de niveles de A apareados con
cada bloque Bj. = 4.
4(3)
 3
4
Consultando el apéndice se observa que se trata del diseño 5.
Diseño 5
(1) 1 2 3 4
(2) 1 2 3 5
(3) 1 2 4 5
(4) 1 3 4 5
(5) 2 3 4 5
Automóviles
1 2 3 4 5 Yi.
1 17 14 13 12 56
2 14 14 13 10 51
3 12 13 12 9 46
4 13 11 11 12 47
5 11 12 10 8 41
y.j 50 54 48 50 39 241
Los diseños de bloques incompletos balanceados son balanceados en el sentido de que cada
nivel del factor ocurre en exactamente r bloques y cada par de tratamientos ocurren juntos
exactamente  veces.
El modelo es el mismo que el de bloques completos aleatorizados.

Hipótesis
Ho: i = j  ij
H1: i  j para al menos una i y una j
Supuestos
a

  =0
i=1
i

  =0
j=1
j
125

 ij _ N(0, 2 )
Sumas de Cuadrados
a b
SCT   y ij2  fc
i 1 j 1
a
k  Qi2
i 1
SCTratadj 
a
1 b
Qi  y i.   nij y. j
k j 1
b y.2j
SCBloque    fc
j 1 k
Se puede observar que hay un ajuste en la suma de cuadrados de los tratamientos porque cada
tratamiento es representado en un juego diferente de r bloques. Por lo tanto las diferencias
entre totales no ajustados son afectados también por las diferencias entre bloques.
En las fórmulas anteriores los Qi son los totales ajustados para cada tratamiento; nij es 1 ó 0; 1
si el tratamiento aparece en el bloque y 0 si el tratamiento no aparece en el bloque y
1 b
 nij y. j es el promedio de los totales de los bloques en los que se aplica el tratamiento i.
k j 1
La suma de los Qi = 0

En el ejemplo:
SCT=2981-(241)2/20=76.95
50 2  54 2  48 2  50 2  39 2
SCAuto   2904 .5  31.2
4
Q1  56  54  48  50  39   8.25
1
4
Q2  51  50  54  50  39   2.75
1
4
Q3  46  50  48  50  39   0.75
1
4
Q4  47  50  54  48  50   3.5
1
4
Q5  41  50  54  48  39   6.75
1
4
SCAdivadj 

4 8.25 2  2.75 2  (0.75) 2  (3.5) 2  (6.75) 2
 35.73

3(5)
SCE  76.95  31.20  35.73  10.02
Grados de Libertad
Aditivos: a-1 5-1 = 4
Autos: b-1 5-1 = 4
Error: Dif. 11
Total N-1 19
126

De modo que la tabla de análisis de varianza quedaría así:


Fuente de SC G.L. CM Fc
Variación
Aditivos 35.733 4 8.93 9.8
Autos 31.2 4 7.8
Error 10.02 11 0.91
Total 76.95 19
F0.05;4,11=3.36
Decisión: Como 9.8 es mayor que3.36 se rechaza Ho lo que en términos del problema significa
que sí hay diferencia entre aditivos.

Estimación de Parámetros
Eliminando las comparaciones entre bloques sobre los efectos de tratamiento
ˆ  y..
kQ
ˆi  i
a

En el ejemplo se puede comprobar que:


ˆ 1=2.2
ˆ 2=0.73
ˆ 3=-0.2
ˆ 4=-0.93
ˆ 5=-1.8

Comparaciones Múltiples
Si deseamos probar las siguientes hipótesis:
Ho : 1  2  0
Ho : 3( 1  2 )  2( 3  4  5 )
Ho: Efecto lineal de 3,4 y 5
Ho: Efecto cuadrático de 3,4 y5

Los contrastes serían:

C1: 1(8.25)-1(2.75)=5.5
C2: 3(8.25+2.75)-2(-0.75-3.5-6.75)=-6
C3:-1(-0.75)+0(-3.5)+1(-6.75)=-6
C4:-1(-0.75)+2(-3.5)+1(-6.75)=-13

Las sumas de cuadrados de los contrastes se calcularían así:


127

2
 a 
k   ciQi 
SCCi   a 
a ci2

de este modo las sumas de cuadrados de los contrastes serían:


SCc1=4.03
SCc2=26.89
SCc3=4.8
SC4c4=7.51
Para ver si son o no significativos los contrastes, cada suma de cuadrados tiene 1 grado de
libertad, se compararía contra el CME.
Y se tiene que F1=4.43
F2=29.52
F3=5.27
F4=8.24
Comparando contra una F de 1 y 11 grados de libertad 4.84. No hay diferencia entre los
aditivos 1 y 2. Pero todos los demás contrastes sí son significativos.

Si se quisiera aplicar la prueba de Duncan el error estándar para los efectos de tratamientos
ajustados es:
kCM E
S
a
Y lo que se compararía son los efectos de los tratamientos más que las medias. Para la DSM :
2kCM E
S
a

Prueba de Scheffé
El contraste que se quiere probar es:
k
 ciˆi  a  ci Qi
El error estándar de cada contraste se calcula por la fórmula:
a
 k 
SCC   ci2  CM E
I 1  a 
Y el valor de Scheffé
S SCH  SCc (a  1) F ;a1,bkba1

El error estándar de las medias ajustadas que también puede utilizarse en las comparaciones
múltiples como en los intervalos de confianza y lo que se compara son las medias ajustadas
ˆ ajust  ˆ  ˆi :
128

 k (a  1) 1 
CME  
 a N
2

Tarea: Aplique la prueba de Duncan en el ejemplo anterior.

Ejercicios Sugeridos:
1. ¿Cómo quedaría el análisis si aparte de que es un diseño incompleto se pierde algún dato, en
el ejemplo la observación del aditivo 3 y auto 3?
2. Leer “Recuperación de la información interbloque”.
3. Se utilizó un diseño de bloques incompletos balanceados para estudiar la ganancia en
peso en 3 vacas con cuatro diferentes raciones. Las raciones se dieron en 4 semanas. Los
datos se presentan a continuación. Considere las semanas como los bloques y las raciones
son los tratamientos.
Semanas A B C D
1 2 - 20 7
2 - 32 14 3
3 4 13 31 -
4 0 23 - 11
a) Calcule el valor de 
b) Realice el análisis de varianza con los totales de los tratamientos ajustados y
los totales de los bloques ajustados, establezca sus conclusiones.
c) Construya contrastes ortogonales y compare los totales de tratamiento
ajustados
d) Realice la prueba de Duncan.
Este ejemplo se obtuvo del sitio [Link]/~prem/[Link].

También podría gustarte