0% encontró este documento útil (0 votos)
28 vistas10 páginas

Estimación Bayesiana con Modelo Beta-Binomial

Este documento describe el modelo beta-binomial para la estimación bayesiana y predicción en situaciones donde variables binarias son medidas repetidamente en individuos. El modelo asume que la probabilidad de éxito varía entre individuos y sigue una distribución beta. Esto permite que la distribución marginal de los datos siga una distribución beta-binomial en lugar de una simple binomial. Se presentan las funciones de probabilidad y verosimilitud del modelo así como métodos para estimar sus parámetros.
Derechos de autor
© Attribution Non-Commercial (BY-NC)
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
28 vistas10 páginas

Estimación Bayesiana con Modelo Beta-Binomial

Este documento describe el modelo beta-binomial para la estimación bayesiana y predicción en situaciones donde variables binarias son medidas repetidamente en individuos. El modelo asume que la probabilidad de éxito varía entre individuos y sigue una distribución beta. Esto permite que la distribución marginal de los datos siga una distribución beta-binomial en lugar de una simple binomial. Se presentan las funciones de probabilidad y verosimilitud del modelo así como métodos para estimar sus parámetros.
Derechos de autor
© Attribution Non-Commercial (BY-NC)
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

ESTIMACIN Y PREDICCIN BAYESIANA.

EL MODELO
BETA-BINOMIAL

AUTORES
Miguel ngel Fajardo Caldera, fajardo@[Link] & Lidia Andrades Caldito, andrades@[Link] &
Nuria Corrales Dios, nucdios@[Link] & Jess Prez Mayo, jperez@[Link]
Departamento de Economa Aplicada y Organizacin de Empresas
Universidad de Extremadura


RESUMEN

En muchos estudios, preguntas de tipo binario [(1 (xito), 0 (fracaso)] son realizadas a un
conjunto de individuos y repetidas un nmero finito de veces. Parece razonable suponer que este
hecho puede explicarse a travs de una distribucin binomial de parmetro (probabilidad de
xito). Con frecuencia suele suceder en la practica que la distribucin binomial no ajusta bien a los
datos observados, lo que nos hace sospechar que el parmetro no es homogneo para todos los
individuos, es decir, que cambia de individuo a individuo y esta informacin puede ser
representada a travs de la especificacin de una distribucin a priori sobre dicho parmetro. La
aproximacin Bayesiana nos acerca a la resolucin del problema del ajuste a los datos observados,
mediante la construccin de una distribucin a posteriori (beta- binomial). Una aplicacin al
anlisis de la fuerza laboral holandesa ser realizada como aplicacin.


Descriptores: Distribucin Binomial. Analisis Bayesiano. Distribucin Beta- Binomial.
Ocupados y parados.

1. INTRODUCCIN.
Variables aleatorias empricamente discretas, con escalas de tipo Likert, son utilizadas
frecuentemente en investigaciones de tipo social y especialmente en el anlisis de
comportamiento de los individuos. Por ejemplo, si un conjunto de m tareas con igual dificultad,
las cuales miden el mismo rasgo latente, son expuestas a un individuo i, el cual resuelve cada
uno de estos items independientemente con probabilidad pi de xito, entonces, el nmero k de
tareas resueltas favorablemente (xito) seguir una distribucin binomial para este individuo.
Sin embargo, el histograma correspondiente a una muestra de observaciones basadas en
diferentes individuos, raramente corresponde a una distribucin binomial. Una probable razn
de que este hecho ocurra es la posible heterogeneidad de la muestra, en el sentido de que las
probabilidades pi varan entre los individuos. Esto puede indicarnos que estas diferencias en el
comportamiento de los individuos, medidas por las probabilidades de xito, pueden formularse
en trminos probabilsticos mediante una distribucin de mixtura binomial, expresada mediante
una variable aleatoria local Y (es decir, para cada individuo) distribuida binomialmente con
parmetros m y pi; la cul es en si misma una realizacin de una variable aleatoria latente X. A
la distribucin marginal de Y se la conoce con el nombre de distribucin de mixtura binomial..
Mixturas binomiales con varianza no cero de la variable mixtura X no son nunca iguales a una
distribucin binomial simple. Esto explica por qu los histogramas muestrales no pueden ser
descritos adecuadamente por modelos binomiales simples, aunque cada individuo genera
probablemente xitos que estn distribuidos binomialmente; por tanto, en orden a encontrar un
ajuste adecuado a los datos ser necesario tener en cuenta las mixturas binomiales.

2. PLANTEAMIENTO TERICO DEL PROBLEMA.
Sea la variable aleatoria condicional Y/(=) que denota el nmero de veces que ha
estado ocupado de las m observaciones realizadas a lo largo del tiempo, dado que el individuo
tiene una probabilidad de estar ocupado en cualquier momento observado. Asumiendo
independencia entre los periodos observados, entonces se tiene que la funcin de probabilidad
f
Y/
(
.
/) de Y/(=) para y = 0,1,.....,m sigue una distribucin binomial

[ ]
y m y m
y
y Y P

) 1 ( ) ( /
y=0,1,....,m [1]
denotada por Y/(=) Bin (m,).
La variable aleatoria inobservable describe la variacin de las probabilidades de estar
ocupados de los individuos entre los individuos de la poblacin en estudio. Asumimos que
Beta(,), es decir, que la funcin de densidad f

(
.
) de sobre los individuos de la poblacin es
dada por la distribucin beta con parmetros y

0 , 1, 0 con
) , (
1
) 1 (
1
) ( > < <

Beta
f
[2]
donde Beta (,) es la funcin beta con argumentos y . La hiptesis dada en [2] no
es muy restrictiva, puesto que la distribucin beta es extremadamente flexible y admite un
amplio nmero de curvas para valores diferentes de y .
La esperanza matemtica y la varianza de la variable aleatoria vienen dadas
por :
E[] = /+ y Var [] = /(+)
2
(++1) [3]

[Link] marginal de Y.
De los supuestos formulados en [1] y [2], es decir Y/(=) Bin (m,). y Beta (, ),
por el teorema de la probabilidad total tenemos que Y, el nmero de veces que ha estado
ocupado cuando se ha observado m veces, tiene una distribucin beta binomial con ndice m y
parmetros y , que denotaremos por Y BB(m,, ). La funcin de probabilidad f
Y
(
.
) de la
variable aleatoria marginal (no condicional) Y viene dada por:
P[Y=y]= ) (
m
y
Beta ( + y, +m y) / Beta (, ); y=0,1,...,m ,> 0 [4]
Observemos que nicamente los parmetros poblacionales y afectan a esta
distribucin. Entonces [4] describe la poblacin bajo estudio y no esta relacionada con los
comportamientos individuales. Pero el nivel poblacional (o marginal) Y es observable y la
distribucin resultante [4] puede ser ajustada con datos transversales de cada observacin
realizada, mientras que el supuesto [1] y el supuesto nivel poblacional [2] no pueden ser
directamente verificados.
Las principales caractersticas de esta distribucin son:
E[Y] = m/+ y Var[Y] = m(m++)/(++1)(+)
2
[5]

2.2Reparametrizacin de la marginal de la variable Y.
Mediante las funciones gamma y beta y considerando como nuevos parmetros a (,)
dados por las relaciones:
=/+ y =1/+

podemos rescribir la funcin de probabilidad marginal de Y dada en [4] como:

[ ]

+ + +
1
0
1 1
) 1 ( ) 1 ( ) ( ) (
y
r
y m
o r
m
o r
r r r
m
y
y Y p
[6]
con y = 0, 1,2,.....,m ; 0<<1 y 0.
Las respectivas caractersticas dadas en [5] se convierten ahora en

E[Y] = m y Var [Y] = m(1)(1+m)/(1+ ) [7]

Obsrvese que el parmetro = E[] y representa la variacin de . Si =0, el
modelo beta - binomial se reduce a un modelo binomial.

[Link] de verosimilitud.
Consideremos una muestra aleatoria de n individuos de una poblacin, tal que cada
individuo sigue una distribucin beta binomial con funcin de densidad dada en [6].
Entonces, la funcin de verosimilitud de la muestra
viene dada por:

+ + + + +


n
i
i
y
o r
i
y m
r
m
r
r r r
m
i
y
n
i
i
y f l
n
y y y f
1
1 1
0
1
0
) 1 ln( ) 1 ln( ) ln( ) ln(
1
) ( ln ) , ( ) ..,
, 2
,
1
( ln


[8]

derivando con respecto a los parmetros y tenemos las ecuaciones siguientes:

'

+
+
+

'

n
i
y
r
y m
r
m
r
n
i
y
o r
y m
r
i i
i i
r
r
r
r
r
r l
r r
l
1
1
0
1
0
1
0
1
1 1
0
1 1
) , (
1
1 1 ) , (




[9]

al igualar a cero las ecuaciones dadas en [9], el sistema de ecuaciones generadas no son
lineales con respecto a y , por lo que no puede obtenerse una solucin explicita. El mtodo
de Newton Raphson puede utilizarse para obtener una aproximacin numrica a la solucin
del sistema de ecuaciones con respecto a y .
Una vez obtenidas las estimaciones de los parmetros
) , (


y por tanto las de
) , (


, podemos obtener la probabilidad marginal dada en [4] 0 [6], las cuales multiplicadas
por el nmero total de individuos en la muestra n nos dan las frecuencias esperadas que
podemos comparar con las observadas mediante los estadsticos
2
o la razn de verosimilitud
para analizar la bondad del ajuste.
Otra forma de definir la funcin de verosimilitud es la considerada por Jack. C. Lee &
[Link]; la cual viene definida por las siguientes consideraciones:
Para un nmero fijo de pruebas m, tomamos una muestra de tamao n de la distribucin
beta- binomial. Los datos u observaciones consisten en el nmero de xitos y
i
obtenidos en las
m pruebas obtenidos para cada individuo de la muestra, los cuales pueden ser resumidos como
{n
y
: y =0,1,....,m}, donde n
y
representa el nmero de individuos que en m pruebas han
obtenido y xitos con n = n
y
.
Entonces:
[ ]
y
n
m
o y
y Y P
y
n m L

[ ) , / , ( [10]
y tomando logaritmos en la expresin anterior [10], tenemos:

[ ]


m
o y
y Y P
y
n
y
n m l ln ) , / , ( [11]
y sustituyendo la probabilidad P[Y=y] dada en [4], tendramos la funcin de
verosimilitud en funcin de los estadsticos n
y
.
Estimaciones de los parmetros de la distribucin beta binomial univariante estn
descritos en la literatura estadstica. El logaritmo de la verosimilitud y las ecuaciones de
verosimilitud dadas anteriormente son las utilizadas generalmente para la obtencin de las
estimaciones de los parmetros y su resolucin puede verse en y por tanto no sern
repetidas aqu.




2.4. Distribucin final o a posteriori.
Aunque la propensin a estar ocupado no es directamente observable es fcil obtener
la distribucin condicional de , dado el nmero de veces observados que el individuo ha
estado en situacin de ocupado Y=y. Denotemos por f
/
(
.
/y). La interpretacin de esta funcin
de densidad f
/
(
.
/y) es expresar la funcin de densidad de la propensin a estar en situacin de
ocupado en la muestra habiendo observado el nmero de veces y de las m veces que ha sido
observado. Mediante el teorema de Bayes y teniendo en cuenta [1], [2] y [4] podemos obtener
la funcin de densidad condicionada f(
.
/y)

) , (
) 1 (
1
) / (
y m y Beta
y m y
y f
+ +
+

[12]
es decir, /Y=y Beta ( + y, +m- y) para y=0,1,.......,m. Consecuentemente con
ello, tenemos que
E[/Y=y] = +y/++m [13]
y por tanto, la regresin de sobre y es una funcin lineal de y.
Generalizando lo anterior para n individuos y teniendo en cuenta el nmero yi de xitos
obtenidos, tenemos que:
/(y
1,
y
2
, ...,y
n
) Beta ( + y
i
, +n m - y
i
) [14]
Una estimacin a posteriori del parmetro a partir de los valores obtenidos por una
muestra aleatoria de n individuos puede obtenerse de la esperanza matemtica de la
distribucin dada en [12] y que viene dada por:

nm
i
y
n
y y y
E
+ +
+

1
]
1

) ,...,
2
,
1
(
[15]
con yi =0,1,...,m para i=(1,2,......,n).

2.5. Probabilidad predictiva.
Esta probabilidad predictiva se utiliza cuando queremos predecir la probabilidad de
observar el suceso Y=y en un nuevo individuo de la poblacin conociendo los resultados
obtenidos en la muestra; as tenemos que
+ +
+ + + +

1
]
1

) , (
) , (
) (
) ,.....,
1
(
i
y nm
i
y Beta
y m
i
y nm y
i
y Beta
m
y
n
y y
y Y
P


[16]
con y= 0,1...,m.

APLICACIN DEL MODELO BETA BINOMIAL.
Consideremos los datos contenidos en el articulo de los autores F. Van de Pol & R.
Langeheine Mixed Markov models, Mover Stayer models and the EM algorithm sobre
una aplicacin al mercado de trabajo con datos obtenidos del Netherlands Socio Economic
Panel survey (SEP) del Netherlands Central Bureau of Statistic.
Una muestra de 4.767 holandeses fue extrada aleatoriamente de la Poblacin
Holandesa de 17,5 aos o ms de edad y preguntados en cinco ocasiones (abril 1985, octubre
1985, abril 1986, octubre 1986, abril 1987) sobre la siguiente cuestin Tiene Vd. un trabajo
pagado en una empresa o en una institucin en este momento, o est Vd. autoempleado?. La
distribucin del nmero de individuos que han respondido con 0 veces, 1 vez, etc; podemos
observarla en el grfico1, donde los valores extremos concentran una mayor frecuencia del
nmero de individuos que en los otros valores, por lo que un ajuste de los datos a una
distribucin binomial no sera el ms adecuado.
Grfico1
Fuente: F. Van de Pol & R. Langeheine Mixed Markov models, Mover Stayer models and the EM
algorithm. MULTIWAY DATA ANALYSIS. R. Coppi and S. Bolasco (Editors). Elsevier Science Publishers
B.V.(North Holland). 1989.

A partir de la funcin de verosimilitud dada en [11] o [12], obtenemos mediante un
algoritmo de estimacin de los parmetros y desarrollado por Edgar Erdefelder (
BINOMIX ) que con un criterio de convergencia de E-008, las estimaciones de los parmetros
fueron:
002 36758 . 8 y . 002 09684 . 8

E E [17]
Distribucin del nmero de individuos, segn el nmero de veces que han estado
ocupados en el periodo abril 1985 - abril 1987.
0
500
1000
1500
2000
2500
0 1 2 3 4 5
Nmero de veces que estaba ocupado
N

m
e
r
o

d
e

i
n
d
i
v
i
d
u
o
s
Para medir el ajuste, realizamos una comparacin entre las frecuencias observadas y las
frecuencias esperados bajo el modelo beta binomial, las cuales son dadas en el siguiente
cuadro:
CUADRO 1


2
de Pearson =1,2237 ; con g.l. =3 ; y P[
2
>1,2237]=0,7473. y el test ratio de
verosimilitud z= 1,2288
con g.l.=3 y P[Z >1,2288]=0,7461.
Observando el valor de los estadsticos de ajuste as como los residuos estandarizados
tenemos que concluir que los datos sobre la ocupacin laboral dados en la cuadro 1 siguen un
modelo definido por una distribucin beta binomial.
Como indicbamos anteriormente, la distribucin del parmetro segua una
distribucin Beta (,), que despus de estimada tiene una funcin de probabilidad y de
distribucin como se indica en el cuadro 2.
CUADRO 2

Funcin de distribucin y funcin de probabilidad inicial o a priori asociada al
parmetro .
Nmero de
xitos
Probabilidad
Terica
Frecuencia
esperada
Frecuencia
observada
Residuos
estandarizados
0 0,43493 2073,32 2072 -0,03
1 0,04312 205,54 215 0,66
2 0,03023 144,10 148 0,32
3 0,03019 143,92 142 -0,16
4 0,04292 204,58 193 -0,81
5 0,41862 1995,54 1997 0,03
Funcin de distribucin y de probabilidad inicial
0,0000
0,1000
0,2000
0,3000
0,4000
0,5000
0,6000
0,7000
0,1 0,2 0,3 0,4 0,5 0,6 0,7 0,8 0,9
p
r
o
b
a
b
i
l
i
d
a
d
e
s
Probabilidad
Acumulada
Si atendemos a las medias y desviaciones tpicas de la distribucin condicional a
posteriori de las probabilidades de xito, se obtienen los siguientes resultados:

xitos median de P(xito) desviacin tpica de P(xito)
0 0,1508 0,1252
1 0.3047 0,1588
2 0,4393 0,1732
3 0,5695 0,1732
4 0,7091 0,1589
5 0,8487 0,1253

La esperanza matemtica de la probabilidad de xito va creciendo con respecto al
nmero de ellos obtenidos en la realizacin de las cinco pruebas.
Por tanto, la media de las probabilidades de estar empleado cuando el individuo ha
estado desempleado a lo largo de las cinco observaciones es de 15,08% frente al caso de aquel
que siempre ha estado ocupado o empleado en las cinco observaciones que es de 84,87%.

BIBLIOGRAFA
- Chih Chien Yang, Bengt O. Muthn and Chih Chiang Yang (1999). Finite
Mixture Multivariate generalized Linear Models Using Gibbs Sampling and E M
Algorithme. Proc. Natl. Counc. ROC (A). Vol 23, n 6, pp 695-702.
- Erdfelder, E. (1989). Maximum likelihood analysis of binomial mixtures: a manual
for users of Binomix (Berichte aus dem Psychologischen Institut der Universitt Bonn. Vol
15, n 2). Bonn: Psychologisches Institut der Universitt Bonn.
- Griffiths, D. A. (1973). maximum likelihood estimation for a beta binomial
distribution ans a application to the household distribution of the total number of cases of a
disease: Biometrics 29, 637 648.
- Jack C. Lee and [Link] . A note on Bayesian Estimation and Prediction for the Beta
Binomial model.
- Lee, J. C. And Sabavala, D. J. (1987). Bayesian Estimation and Prediction for the
Beta Binomial Model. Journal of Bussines & Economic Statistics 5, 357 367.
- Morel, J. G. and Nagaraj N. K. (1993). A finite mixture distribution for modelling
multinomial extra variation. Biometrika, 80, 363 371.
- Vicent Fortin & ric Parent & Bernard Bobe (2001). Posterior previsions for the
parameter of a binomial model via natural extensin of a finite number of judgments. 2
nd

International Symposium on Imprecise Probabilities and Their Applications, Ithaca, New
York.

También podría gustarte