1.6.6 Experimentación de los resultados.
Como lo explica Montgomery en su libro de diseño de experimentos [1], para
utilizar un enfoque estadístico en el diseño y análisis de un experimento es
necesario que todas las personas involucradas en el proceso entiendan de
qué se trata el problema, qué es lo que exactamente se va a estudiar, cómo
se recolectarán los datos y tener una idea del análisis cuantitativo que se
llevará a cabo.
Lo mismo ocurriría en un estudio de simulación; lo más importante que hay
que definir es qué se va a medir (variable(s) respuesta(s)) y en función de
qué (factores y bloques). Montgomery [1] presenta en la tabla 1-1 de la página
14 una guía sencilla para diseñar un experimento. La tabla consiste en los
siguientes siete pasos: 1) planteamiento del problema, 2) selección de la(s)
variable(s) respuesta, 3) elección de factores y niveles, 4) elección del diseño
experimental o tipo de experimento, 5) desarrollo del experimento, 6) análisis
estadístico de los datos, y 7) conclusiones y recomendaciones.
Obsérvese que el planteamiento del problema lleva a deducir cuáles variables
respuesta serán medidas, y a su vez, según la escala de estas variables, qué
tipo de análisis elegir. Los factores y sus niveles, tienen que ver también con
el planteamiento del problema ya que de éstos van a depender las variables
respuesta. La idea general es observar el comportamiento de la(s) variable(s)
respuesta en función de los factores y estimar el efecto de estos últimos sobre
la respuesta. Puede ser útil añadir a la lista de Montgomery [1] las variables
controlables y las incontrolables. Ambas hacen referencia a variables que
estarán presentes y que probablemente afectarán a las variables respuesta.
Las primeras, también llamadas covariables, son controlables porque son
plenamente identificables y se pueden bien sea fijar (dejar constantes durante
el experimento) o medir. Las segundas son aquellas variables que no se
pueden ni fijar ni medir y que se sabe harán parte del error o sesgo. En los
estudios de simulación es fácil averiguar cuáles podrían ser las variables
respuesta, los factores y las covariables. Variables respuesta en muchos
estudios de simulación podrían ser por ejemplo el sesgo relativo, una media,
una medida de dispersión o una proporción de aciertos. Como factores se
tomarían aquellas variables para las cuales se desea ver el efecto sobre la
respuesta. Ejemplos de factores podrían ser el tipo de distribución, el tamaño
de muestra, etc. En cuanto al tipo de experimento, en términos generales se
piensa en un experimento multifactorial de efectos fijos. Es muy probable que
el recurso más importante en los estudios de simulación sea el tiempo
invertido en las corridas de las simulaciones y que esto lleve a pensar en
diseños experimentales de efectos fijos más especiales como lo son los
diseños , y los diseños
fraccionados; por supuesto
que esto dependería del
criterio del investigador. En
cualquier caso, es útil
presentar la caja o esquema del
diseño del estudio como se
muestra en la Figura 1.
Figura 1. Esquema general de un estudio de simulación. Adaptación del
esquema de un diseño experimental presentado en Montgomery [1]
Una vez estén estos aspectos claros, se procede a correr las simulaciones.
Al término de éstas se construye una base de datos con los resultados y se
procede al análisis estadístico. Éste comenzaría con los gráficos de cajas y
bigotes y en general con el uso de todas las herramientas descriptivas que
ayuden a formular posibles hipótesis que serán probadas posteriormente por
medio del análisis de varianza, el análisis de regresión o las comparaciones
múltiples, siempre y cuando se cumplan los tres supuestos o requisitos: 1)
normalidad, 2) homocedasticidad e 3) independencia de los residuales. En
caso de que alguno(s) de estos no se cumplan, habrá que pensar en una
prueba o análisis no paramétrico equivalente.
ESTUDIO DE SIMULACIÓN
A continuación, se presenta el planteamiento del problema, la metodología y
los resultados del estudio de simulación: Robustez de un modelo de Markov
de tres estados bajo distintas especificaciones distribucionales de los tiempos
de transición [5].
Una cadena de Marvok es un proceso evolutivo que consiste de un número
finito de estados en cual la probabilidad de que ocurra un evento depende
solamente del evento inmediatamente anterior con unas probabilidades que
están fijas. Para motivar este concepto exploremos el siguiente ejemplo:
Ejemplo: Supongamos que hay tres centros principales de camiones de
una empresa. Cada mes, la mitad de los que están en Boston y en Los
Angeles, van a Chicago, la otra mitad permanece donde está y los
camiones de Chicago se dividen igualmente entre Boston y L.A. Lo anterior
se puede resumir con la siguiente figura:
Si inicialmente la compañía tenía 100,200 y 300 camiones en Boston,
Chicago y L.A. respectivamente, encontrar las distribuciones de camiones
después de un mes y después de dos meses en las tres ciudades.
Solución: Denotemos por ak, bk y ck la cantidad de camiones en Boston,
Chicago y L.A. respectivamente, después de k-meses. Utilizando la
información dada se tiene que después de un mes, la distribución de los
camiones será:
Y después de 2 meses,
vemos que la distribución será:
Los cálculos de este ejemplo se pueden realizar de manera más conveniente
si utilizamos notación matricial. Para ver esto, denotemos por xk al vector de
probabilidades en el k-ésimo mes, es decir, denotemos
El cálculo realizado para el primer mes se puede realizar de la siguiente
manera:
En otras palabras
entonces la anterior ecuación se
puede escribir de la forma x1=Px0. De manera similar, x2=Px1=P2x0. En
general, después de k-meses la distribución satisface que
xk=Pxk−1=P2xk−2=⋯Pkx0.
En general una cadena de Markov finita es un proceso evolutivo que consiste
de un número finito de estados que usualmente se denotan como estado 1,
estado 2, ..., estado n. En cada paso o punto en el tiempo el proceso puede
estar en cualquiera de los estados o puede cambiar de estado mediante unas
probabilidades fijas llamadas probabilidades de transición.
Para cada tiempo k definamos el vector xk como el vector de probabilidades
de estar en los distintos estados en el tiempo k.
3.1 Planteamiento del problema.
Los modelos markovianos pueden jugar un papel muy importante en los
estudios que involucran datos longitudinales bien sea de manera prospectiva
o retrospectiva [6]. Se sabe que en este tipo de estudios se realizan varias
mediciones en un determinado periodo de tiempo o espacio a un conjunto de
individuos o elementos muestrales. Se sabe también que las medidas u
observaciones repetidas que se tienen de un mismo elemento no son
independientes entre sí, que existe una estructura de correlación la cual debe
ser tenida en cuenta en el ajuste del modelo. Entre las posibles formas de
modelar dichas estructuras de correlación se encuentran: componentes de
varianza CV, simetría compuesta CS, unstructured UN (sin estructura), AR1
(autorregresivo de orden uno), markoviana de primer orden, entre otras. Lo
que hace sencilla la estimación de los parámetros cuando se utilizan los
modelos markovianos es la propiedad de Markov, la que en palabras dice que
el futuro depende del pasado sólo a través del presente. Esta propiedad se
debe a la pérdida de memoria de la distribución Exponencial de los tiempos
de transición, lo que en la realidad muchas veces no sucede debido a que los
tiempos de transición se pueden distribuir de maneras distintas a la
Exponencial.
El objetivo de este estudio de simulación fue estudiar el comportamiento de
las estimaciones de los parámetros de las funciones de intensidad en un
modelo de Markov de tres estados en presencia de datos longitudinales,
como el modelo enfermedad-muerte propuesto por Harezlak et al. [7], con
una estructura de correlación markoviana de primer orden [8], cuando se viola
el supuesto de exponencialidad de los tiempos de transición y se varía el
tamaño muestral y máximo número de visitas. El problema se basa en un
modelo como el que se presenta en la Figura 2 con funciones de intensidad
dadas por
(1)
donde representa la función de intensidad no especificada
paramétricamente cuando no se tienen en cuenta covariables. La función
especifica la forma en que la función de intensidad cambia en
función de las covariables . En realidad, especifica el efecto de la
variable continua, y el efecto de la variable dicótoma.
Figura 2. Modelo de tres estados con un estado absorbente (estado 3).
Los experimentos en este caso consisten en la estimación de los parámetros
del modelo presentado en (1) después de generar los posibles escenarios o
tratamientos vía simulación. Para estimar dichos parámetros se usó el
método de máxima verosimilitud conjuntamente con el sistema de ecuaciones
hacia adelante de Kolmogorov [8]. La maximización de la función de
verosimilitud se llevó a cabo por medio del Algoritmo Simplex de Nelder y
Mead [9].
3.2.1 Factores.
Se declararon los siguientes tres factores. 1) Distribución. Se utilizaron cinco
distribuciones continuas y positivas para los tiempos de transición:
Exponencial, Gamma, Weibull, Lognormal y Pareto. 2) Tamaño de muestra.
Se consideraron seis tamaños muestrales: 100, 200, 400, 800, 1000 y 1500.
3) Máximo número de visitas. Los niveles de este factor fueron dos: 4 y 6. En
total son 5´6´2=60 tratamientos, para cada uno de los cuales se corrieron
1000 simulaciones.
3.2.2 Variables respuestas.
Para estudiar los efectos de la distribución de los tiempos de transición, el
tamaño muestral y el máximo número de visitas sobre la estimación de los
parámetros del modelo, se declaró como variable respuesta el sesgo relativo
cuadrático. En cada tratamiento se obtienen las estimaciones puntuales de
los tres parámetros del modelo. Dichas estimaciones corresponden a la
media aritmética de las mil simulaciones. Posteriormente se calculó el sesgo
relativo de la forma
(2)
donde puede ser , ó . Valores cercanos a cero, indican que la
estimación es buena. Cuando el sesgo relativo es mayor que cero, se dice
que el parámetro fue sobreestimado, lo cual no es bueno; de lo contrario, se
dice que fue subestimado, lo cual tampoco es bueno. Luego, tanto valores
altos como bajos del sesgo relativo indican que las estimaciones de los
parámetros no son buenas. Una manera de mejorar la interpretación de esta
variable es elevándola al cuadrado; así, valores pequeños (cercanos a cero)
del sesgo relativo al cuadrado es indicador de buenas estimaciones, y valores
altos (alejados del cero) del sesgo relativo al cuadrado es indicador de malas
estimaciones. En la Figura 3 estudio se ilustra el diseño del estudio.
Figura 3. Diseño del estudio de simulación. Efectos fijos de tres factores y
dos bloques.
3.2.3 Análisis estadístico.
El efecto de los factores sobre la variable respuesta sesgo relativo al
cuadrado, se evaluó utilizando un modelo de regresión lineal múltiple y el
análisis de varianza, controlando por los bloques tipo de parámetro y tipo de
transición. El modelo de efectos fijos a ajustar para el análisis de los
resultados es de la forma
(3)
donde representa la media global del sesgo relativo al cuadrado, el efecto
del factor distribución (con i = Exponencial, Gamma, Weibull, Lognormal y
Pareto), el efecto del tamaño de muestra (con j = 100, 200, 400, 800, 1000
y 1500), el efecto del máximo número de visitas (con k = 2 y 6); ,
, y corresponden a las interacciones entre los tres factores; y
representan el efecto de los bloques tipo de parámetro y tipo de transición,
respectivamente (con l = , y , y m = 1-2, 1-3 y 2-3, respectivamente);
finalmente, representa la interacción entre los bloques, y el
componente de error. Para todas las pruebas se consideró un nivel de
significancia de 0.05. Las simulaciones fueron realizadas utilizando el
software SAS/IML [10], y para el análisis de los datos se usó el paquete
estadístico de dominio público R [11].
3.3 Resultados.
Con el fin de simetrizar la distribución del sesgo relativo al cuadrado y
homogeneizar la varianza, se utilizó la transformación logaritmo natural. Por
medio de las pruebas de Bartlett y Levene [12] se probó el supuesto de
homogeneidad de varianza; asimismo, la prueba Shapiro-Wilk fue utilizada
para probar el supuesto de normalidad.
Como se mencionó previamente, un resultado del sesgo relativo cuadrático
que tienda a cero es un indicador de buenas estimaciones de los parámetros
de (1). Después de emplear el algoritmo paso a paso (hacia adelante y hacia
atrás), se realizó un análisis de varianza el cual se presenta en la Tabla 1. En
este caso, el intercepto representa los niveles referencia de las categorías
distribución Exponencial, máximo número de visitas 4, parámetro , y
transición 1 a 2. Luego, los signos de las categorías restantes se interpretan
tomando en cuenta tales referencias. Del análisis de varianza se puede
apreciar que, de los tres factores del estudio de simulación, sólo la
distribución del tiempo de transición y el número máximo de visitas resultaron
significativos (P<<0.01). Por otro lado, el bloque tipo de parámetro resultó ser
significativo explicando gran cantidad de variabilidad (P<<0.01). Mientras
tanto, pese a que el bloque tipo de transición no es significativo (P=0.1), su
interacción con el bloque tipo de parámetro sí lo es (P<<0.01).
Tabla 1. Análisis de varianza del modelo de efectos del sesgo relativo
cuadrático (3)
Table 1. Analysis of variance for the quadratic relative bias effect model (3)
El hecho de que bloque tipo de parámetro resultara significativo, implica que
el sesgo relativo cuadrado difiere en la estimación de por lo menos uno de los
tres parámetros del modelo (1). La misma interpretación se haría para los
factores distribución y máximo número de visitas, en la Tabla 2 se presentan
los valores P de los niveles de los factores y de los bloques que resultaron
significativos.
Tabla 2. Significancia de los factores y de los bloques obre el sesgo relativo
cuadrático
Al estudiar el efecto de la distribución sobre el sesgo relativo cuadrático, se
aprecia claramente que es la distribución Weibull la que aporta la significancia
sobre la variable respuesta. En este caso, tanto de la Figura 4 como del
modelo (ver Tabla 2), se observa que el sesgo relativo fue en promedio mayor
en tal distribución (P<<0.0001). En cuanto a las distribuciones restantes, el
comportamiento del sesgo fue similar. De la Figura 5, se observa la
disminución del sesgo relativo cuadrático cuando el máximo número de
visitas es seis. Según el modelo, tal diferencia es significativa (P=0.0001). De
la Figura 6 se aprecia el comportamiento del sesgo relativo a diferentes
tamaños muestrales, donde no se percibe diferencia alguna.
Figura 4. Efecto del factor distribución de los tiempos de transición sobre el
sesgo relativo cuadrático
Figura 5. Efecto del factor máximo número de visitas sobre el sesgo relativo
cuadrático
Figura 6. Efecto del factor tamaño de muestra sobre el sesgo relativo
cuadrático
En cuanto al efecto de los bloques, se aprecian diferencias entre el tipo de
parámetro a estimar. El caso más desfavorable fue para la estimación del
parámetro , cuyo sesgo relativo fue significativamente mayor al del
parámetro referencia (P<<0.0001) y al del parámetro , según el gráfico de
la Figura 7 donde se pueden observar claramente tales diferencias.
Figura 7. Efecto del bloque tipo de parámetro sobre el sesgo relativo
cuadrático
En cambio, el comportamiento del parámetro fue el mejor, dado que el
sesgo relativo cuadrático cometido en esta estimación fue significativamente
menor (P<<0.0001). En cuanto al factor tipo de transición, se observó que el
comportamiento del sesgo relativo cuadrático fue similar en las tres
transiciones (Figura 8). Sin embargo, de la Figura 9 se puede observar el
efecto de la interacción entre los bloques tipo de parámetro y tipo de
transición donde se aprecia que tal efecto es aportado por el parámetro en
las transiciones 1-3 y 2-3, cuyo comportamiento fue diferente en los otros dos
parámetros.
Figura 8. Efecto del bloque tipo de transición sobre el sesgo relativo
cuadrático
Figura 9. Efecto de la interacción entre los bloques tipo de parámetro y tipo
de transición.
En resumen, se destaca el efecto desfavorable sobre el sesgo relativo de la
distribución Weibull, el efecto favorable de realizar máximo 6 visitas, y las
diferencias en media del sesgo relativo cuadrático entre las estimaciones de
los tres parámetros del modelo (1).