0% encontró este documento útil (0 votos)
10 vistas34 páginas

Estimadores Suficientes y UMVUE

Este documento discute conceptos relacionados con la inferencia estadística como el riesgo y nociones de optimalidad de estimadores. Introduce las nociones de riesgo de un estimador, error cuadrático medio y estimadores insesgados. Luego presenta la cota de Cramér-Rao para la varianza de estimadores y define el estimador de varianza mínima no sesgado uniforme (UMVUE). Finalmente, introduce brevemente los conceptos de estimadores minimax.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
10 vistas34 páginas

Estimadores Suficientes y UMVUE

Este documento discute conceptos relacionados con la inferencia estadística como el riesgo y nociones de optimalidad de estimadores. Introduce las nociones de riesgo de un estimador, error cuadrático medio y estimadores insesgados. Luego presenta la cota de Cramér-Rao para la varianza de estimadores y define el estimador de varianza mínima no sesgado uniforme (UMVUE). Finalmente, introduce brevemente los conceptos de estimadores minimax.
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Inferencia Estadı́stica

Riesgo y Nociones de Optimalidad

Gabriel Martos Venturini


gmartos@[Link]

UTDT

UTDT Riesgo y Estimadores UMVUE 1 / 34


Un estimador puntual es un estadı́stico con el que tı́picamente
pretendemos inferir el parámetro desconocido del modelo.

Idealmente, la distribución de probabilidad del estimador deberı́a estar


concentrada en torno del verdadero valor del parámetro.
La que sigue es una discusión sobre cómo cuantificar esta
caracterı́stica deseable de un estimador. La noción de riesgo permite
definir estimadores en algún sentido óptimos.
I No es necesario circunscribir la discusión al caso de los estimadores de
momentos o los estimadores máximo verosı́miles; por este motivo
denotaremos con Wn al estimador de interés (función de una muestra
aleatoria de tamaño n) de cierto modelo estadı́stico de referencia.

UTDT Riesgo y Estimadores UMVUE 2 / 34


Agenda

1 Riesgo: Error Cuadrático Medio

2 Mejores estimadores insesgados

3 Estimadores minimax

4 Apéndice

UTDT Riesgo y Estimadores UMVUE 3 / 34


Riesgo de un estimador
iid
X = {X1 , . . . , Xn } ∼ f (x; θ) con X ∈ X y X ∼ fX (x; θ).

Wn (X ) ≡ Wn es un estimador de θ ∈ Θ.
Consideramos una función de pérdida l : X × Θ → R.
I Pérdida cuadrática: l(Wn , θ) = (Wn − θ)2 (descomposición).
I Pérdida absoluta: l(Wn , θ) = |Wn − θ|.
I Debe reflejar las consecuencias del error en la estimación.

El riesgo del estimador Wn se define como:


Z
R(Wn , θ) = E (l(Wn , θ)) = l(wn (x), θ)fX (x; θ)dx.
X

Representa la pérdida esperada (en la métrica l) al estimar θ con Wn .

Elementos de “Teorı́a de la Decisión” (CB: § 10).

UTDT Riesgo y Estimadores UMVUE 4 / 34


Error Cuadrático Medio
ECM(Wn , θ) = E [(Wn − θ)2 ] ≡ [E (Wn ) − θ]2 + E [(Wn − E (Wn ))2 ].
| {z } | {z }
Sesgo2θ (Wn ) Varθ (Wn )

Demostración ( Intuición ).

ECM(Wn , θ) = E [(Wn − E (Wn ) + E (Wn ) − θ)2 ]


= E [(Wn − E (Wn ))2 + (E (Wn ) − θ)2 + 2(Wn − E (Wn ))(E (Wn ) − θ)]
= E [(Wn − E (Wn ))2 ] + E [(E (Wn ) − θ)2 ] +2 E [(Wn − E (Wn ))(E (Wn ) − θ)]
| {z } | {z }
E (cte)=cte (E (Wn )−E (Wn ))(E (Wn )−θ)=0

Wn es insesgado si ECM(Wn , θ) = Varθ (Wn ) (para todo n y θ ∈ Θ).


ECM de los estimadores máximo verosı́miles cuando X ∼ N(µ, σ 2 ).
I bn2 vs el del estimador insesgado Sn2 .
Compara el ECM de σ

UTDT Riesgo y Estimadores UMVUE 5 / 34


Nota: Los estimadores insesgados no siempre son los de menor riesgo.

Figure: En algunos contextos especı́ficos puede convenir asumir algo de


sesgo a cambio de reducciones contundentes en la varianza del estimador.

I En regresión: Ridge y Lasso (intercambiamos sesgo por varianza).

¿Existe Wn : R(Wn , θ) ≤ R(Wn0 , θ), para todo θ ∈ Θ y n > 0?


UTDT Riesgo y Estimadores UMVUE 6 / 34
Contraejemplo
iid
{X1 , . . . , Xn } ∼ N(θ, σ 2 = 1): θb1 = X n vs. θb2 = 3.
σ2
n = 1 : ECM(θb1 , θ) = Var(θb1 ) = = 1, y ECM(θb2 , θ) = Sesgo2 (θb2 ) = (θ − 3)2
n

En general no existe un estimador uniformemente mejor (sobre Θ). C2

UTDT Riesgo y Estimadores UMVUE 7 / 34


Para establecer criterios de optimalidad hay dos caminos:
1 Acotamos el conjunto de potenciales estimadores:
I Estimadores insesgados.
I Dentro de este (sub)conjunto (o clase), el mejor estimador (menor
ECM) será aquel que tenga la menor varianza (mayor eficiencia).

2 Identificamos la curva de riesgo con un número, de forma de poder


ordenar a los estimadores en base a esta cantidad.
I Mini–max: Minimizan el máximo riesgo (criterio conservador).

UTDT Riesgo y Estimadores UMVUE 8 / 34


Agenda

1 Riesgo: Error Cuadrático Medio

2 Mejores estimadores insesgados


Definiciones y cota de Cramér–Rao
Rao–Blackwell y Lehmann–Scheffé

3 Estimadores minimax

4 Apéndice

UTDT Riesgo y Estimadores UMVUE 9 / 34


Agenda

1 Riesgo: Error Cuadrático Medio

2 Mejores estimadores insesgados


Definiciones y cota de Cramér–Rao
Rao–Blackwell y Lehmann–Scheffé

3 Estimadores minimax

4 Apéndice

UTDT Riesgo y Estimadores UMVUE 10 / 34


Para X ∼ f (x; θ)
Denotaremos Cθ al conjunto de todos los estimadores insesgados de θ:

Cθ = {Wn | E (Wn ) = θ para todo n > 0 y θ ∈ Θ}.

Si Wn ∈ Cθ , luego ECM(Wn , θ) = Var(Wn ).

Definition (Estimador UMVUE)


Wn∗ ∈ Cθ es el mejor estimador insesgado de θ (UMVUE) si se cumple
que Var(Wn∗ ) ≤ Var(Wn ) para todo n ≥ 1, Wn ∈ Cθ y θ ∈ Θ.

UMVUE: Uniform Minimum Variance Umbiased Estimator.


No siempre existen y encontrar estos estimadores no es trivial.
I Ejemplo: X n y Sn2 para λ en modelo Poisson.

Estrategia: Hallar cota inferior para la varianza de los estimadores de


θ, y si un estimador insesgado alcanza la cota entonces es UMVUE.
UTDT Riesgo y Estimadores UMVUE 11 / 34
Condiciones de regularidad (BackUp Slide)

Se cumplen, en general, en los modelos de la familia exponencial.

H1 ) f (x; θ) es suficientemente suave como función de θ, de forma que:


Z Z
∂ ∂
f (x; θ)dx = f (x; θ)dx.
∂θ ∂θ
Esta condición no suele cumplirse en los modelos cuyos soportes
dependen de los parámetros (por ejemplo el modelo Uniforme).

H2 ) Le pedimos al conjunto de estimadores de θ que estemos considerando


que sus esperanzas sean funciones diferenciables respecto de θ.

Llamemos mW (θ) = E (Wn ), luego pedimos que mW (θ) exista.
∂θ

UTDT Riesgo y Estimadores UMVUE 12 / 34


Resultado general
Teorema (Cota de Cramér–Rao)
Sea X = {X1 , . . . , Xn } una muestra (no necesariamente iid) tal que
X ∼ fX (x; θ) verifica H1 y sea Wn cualquier estimador de θ que verifica H2 :
 2

∂θ E (Wn )
V (Wn ) ≥  2  .

E ∂θ log fX (X ; θ)

Proof: CB § 7.3.1 pp 309 (Cauchy–Schwarz).


Si adicionalmente asumimos que
iid
I {X1 , . . . , Xn } ∼ f (x; θ).
I Wn ∈ Cθ ,

La cota tiene una expresión más simple.

UTDT Riesgo y Estimadores UMVUE 13 / 34


∂ ∂
Si Wn ∈ Cθ entonces ∂θ E (Wn ) = ∂θ θ = 1.
iid
Si {X1 , . . . , Xn } ∼ f (x; θ), luego:
∂ 2  i ∂ 2  id ∂ 2 
E log fX (X ; θ) =E log Πni=1 f (Xi ; θ) = nE log f (X ; θ) .
∂θ ∂θ | {z } | ∂θ {z }
`(θ|X)
i(θ)

Información de Fisher: I (θ) = ni(θ) (no depende del estimador).

Theorem (Cramér–Rao (iid + Wn ∈ Cθ ))


iid
Sea {X1 , . . . , Xn } ∼ f (x; θ) y Wn ∈ Cθ (satisfacen H1 y H2 ), luego:

1
 = I (θ) −1 .
 
V (Wn ) ≥ 
2


nE ∂θ log f (X ; θ)

Ejemplo: Modelo Poisson (λ


bn = X n alcanza la cota).

UTDT Riesgo y Estimadores UMVUE 14 / 34


In (θ) ≡ ni(θ) (depende del tamaño de la muestra).

En el ejemplo Poisson i(λ) = 1/λ. Si λ es pequeño, la media y


varianza de X es pequeña, tendremos poca incertidumbre en la
estimación del parámetro λ (mucha información = cota baja).

Figure: Información de Fisher para X ∼ Pois(λ): En la lı́nea continua (—) n = 10


y en lı́nea punteada (- -) n = 50. A medida que λ → 0, In (λ) → ∞ para todo n.

UTDT Riesgo y Estimadores UMVUE 15 / 34




Se puede demostrar que: I (θ) = Var ∂θ `(θ; X )

Figure: La información de Fisher cuantifica la concavidad de ` en torno a θ∗ .


En la slide anterior ocurre que: In (λ = 1) > In (λ = 10).
UTDT Riesgo y Estimadores UMVUE 16 / 34
Familias exponenciales

Los modelos de la familia exponencial, verifican que:


h ∂ i2   ∂2 
E log f (X ; θ) = −E log f (X ; θ) .
∂θ ∂θ2
Luego:
 ∂2   ∂2 
iid
I (θ) = −nE log f (X ; θ) = −E `(θ|X ) .
∂θ2 ∂θ2
∂2
Simplificando cálculo de la cota, en particular cuando: ∂θ2
`(θ|X ) = c.

Revisitando el calculo de la cota de varianza para estimadores


insesgados en el contexto del modelo Poisson / Exponencial.

UTDT Riesgo y Estimadores UMVUE 17 / 34


Caso multiparámetro (familias exponenciales)
iid
X = {X1 , . . . , Xn } ∼ f (x; θ), con θ ∈ Θ ⊆ Rd .

Consideramos estimadores W insesgados para θ (E (W) = θ).

Ahora I(θ) será una matriz de d × d:

 ∂  ∂ 
[I(θ)]ij = E log fX (X ; θ) log fX (X ; θ)
∂θi ∂θj
 ∂2 
(fam. exp.) = −E `(θ|X ) ,
∂θi ∂θj
 ∂2 
(iid) = −nE log f (X ; θ)
∂θi ∂θj

La cota de CR será [I(θ)]−1 , y por tanto se verifica que:

Var(W) ≥ [I(θ)]−1 .

UTDT Riesgo y Estimadores UMVUE 18 / 34


’Algoritmo’ para encontrar un UMVUE:
1) Check: Insesgadez y computo de varianza de tu estimador.

2) Construye la log-verosimilitud asociada al modelo.

3) Computa la derivada segunda de la log-verosimilitud.

4) Calcular esperanza en (3).

5) Utiliza (4) para calcular la información Fisher.

6) Compara la varianza de tu estimador contra la cota CR.

Otro ejemplo (alumnes lo resuelven en clase):


Pn Xi θ(1−θ)
X ∼ Bern(θ) y consideramos θb = i=1 n (insesgado y Var(θ)
b =
n ).
I Insesgado + varianza alcanza la cota de CR ⇒ UMVUE.

UTDT Riesgo y Estimadores UMVUE 19 / 34


Condición para alcanzar la cota
Teorema (Alcance de la cota)
Asumiendo que el modelo estadı́stico cumple H1 y Wn ∈ Cθ , luego Wn
alcanza la cota de CR si y solo si existe una función a(θ) que verifica:

a(θ)[wn − θ] = `(θ).
∂θ
(proof: CB § 7.3.2)
iid
Ejemplo: {X1 , . . . , Xn } ∼ N(µ0 , σ 2 ) con µ0 conocida. Existe un
estimador que alcanza la cota y es σ bn2 ya que:
n
∂ 2 n h1 X 2 2
i
`(σ | µ 0 , x) = (xi − µ 0 ) − σ = a(σ 2 )[b
σn2 − σ 2 ].
∂σ 2 2σ 4 n
i=1

bn2 es UMVUE: Insesgado + alcanza cota (cuando µ es conocida).


σ

UTDT Riesgo y Estimadores UMVUE 20 / 34


Agenda

1 Riesgo: Error Cuadrático Medio

2 Mejores estimadores insesgados


Definiciones y cota de Cramér–Rao
Rao–Blackwell y Lehmann–Scheffé

3 Estimadores minimax

4 Apéndice

UTDT Riesgo y Estimadores UMVUE 21 / 34


En nuestra discusión en torno a los UMVUE no utilizamos el concepto
de suficiencia. Existen dos resultados teóricos relevantes a destacar:
I Rao–Blackwell: Un estimador insesgado de θ se puede “mejorar”
(reducir su varianza) si es condicionado por un estadı́stico suficiente.
F Corolario: En nuestra búsqueda de estimadores UMVUE debemos
considerar solo aquellos que resultan funciones de el/los estadı́stico/s
suficientes para el/los parámetro/s de interés.
F Los EMV en familias exponenciales son suficientes y completos :)

I Lehmann–Scheffé: Si existe estimador insesgado de θ que sea función


de un estadı́stico suficiente y completo, éste es el único estimador
UMVUE de θ.

UTDT Riesgo y Estimadores UMVUE 22 / 34


“Rao–Blackwellización” de estimadores
Theorem (Rao–Blackwell)
Si Wn ∈ Cθ y T es suficiente para θ; φ(T ) = E (Wn |T ) es preferible a Wn :

a) φ(T ) es insesgado: E (φ(T )) = θ, (esperanza total) y

b) V (φ(T )) ≤ V (Wn ) (varianza total).

c) La distribución de φ(T ) es independiente de θ (suficiencia).


(proof: CB § 7: pp–342)

Si Wn ∈ Cθ pero no es función de un estadı́stico suficiente:


I ECM(φ(T ), θ) ≤ ECM(Wn , θ) para todo θ ∈ Θ y n ≥ 1.

COROLARIO: Un estimador insesgado que no es función de un


estadı́stico suficiente será peor (mayor ECM) que otro que si lo es.
I bn = X n vs la Mediana cuando X ∼ N(µ, σ 2 ).
Ejemplo: µ

UTDT Riesgo y Estimadores UMVUE 23 / 34


Unicidad
En el contexto de un modelo X ∼ f (x; θ).

Theorem (Lehmann–Scheffé)
Sea T un estadı́stico suficiente y completo para θ y φ una función
cualquiera de T ; luego φ(T ) es el único estimador UMVUE de E (φ(T )).

Si logramos encontrar una función φ del estadı́stico suficiente y


completo T tal que E (φ(T )) = θ (centramos correctamente a T ),
entonces φ(T ) es el único estimador UMVUE de θ.
I Ideal para modelos
Pnde la familia Exponencial ya que sabemos que el
estadı́stico T = i=1 t(Xi ) es completo y suficiente para θ.
I Ejemplos: φ(T ) = T /n = X n resulta insesgado para los parámetros de
los modelos Poisson, Exponencial y Bernoulli. Luego como T es
suficiente y completo (modelos de la familia exponencial), entonces X n
es el único estimador UMVUE de dichos parámetros.

UTDT Riesgo y Estimadores UMVUE 24 / 34


Agenda

1 Riesgo: Error Cuadrático Medio

2 Mejores estimadores insesgados

3 Estimadores minimax

4 Apéndice

UTDT Riesgo y Estimadores UMVUE 25 / 34


Admisibilidad de un estimador

Dada una función de riesgo R y un estimador Wn de θ ∈ Θ, decimos


que Wn es inadmisible si existe otro estimador Wn0 tal que:
I R(Wn0 , θ) ≤ R(Wn , θ) para todo θ ∈ Θ, y
I R(Wn0 , θ) < R(Wn , θ) para al menos algún θ ∈ Θ.

Un estimador es admisible si no es inadmisible.

La admisibilidad es la ausencia de una propiedad negativa.


¿Existen estimadores admisibles? ¿Cómo los construimos?
I Estimadores minimax.
I Estimadores Bayesianos.

UTDT Riesgo y Estimadores UMVUE 26 / 34


Estimadores minimax
Como lo sugiere su nombre, los estimadores minimax buscan
minimizar una cota máxima para el riesgo.

Wn se dice estimador mini–max de θ si para cualquier otro estimador


Wn0 (en una clase W) y una función de riesgo R ocurre que:

sup R(Wn , θ) ≤ sup R(Wn0 , θ).


θ∈Θ θ∈Θ

Criterio conservador para definir optimalidad: Podrı́amos estar


descartando estimadores Wn0 que tienen poco riesgo en casi todo Θ
excepto quizá en regiones pequeñas de Θ.
I En este curso no vamos a abordar este criterio de optimalidad.

Este tipo de aproximaciones conservadores son más simples de abordar


desde el paradigma Bayesiano, dando como resultado estimadores de
“regla bayesiana” que verifican también el principio de admisibilidad.

UTDT Riesgo y Estimadores UMVUE 27 / 34


Optimalidad Bayesiana
W es un estimador que sigue la regla (criterio) Bayesiana(o) si
minimiza un promedio ponderado del riesgo Bayesiano r (π, Wn ).
Dicha función se define, para una prior π de θ, como:
Z
r (π, Wn ) = Eπ [R(Wn , θ)] = R(Wn , θ)π(θ)dθ.
Θ
Wn se dice una regla de estimación Bayesiana de θ con respecto a
una prior π, si para cualquier otro estimador Wn0 ocurre que:
r (Wn , π) ≤ r (Wn0 , π).
Bajo ciertas condiciones de regularidad para el modelo estadı́stico
subyacente, se puede demostrar que la regla Bayesiana existe y es
única; sin embargo depende de la prior π.
Prior menos favorable.
Dependiendo de como eliges R, los estimadores Bayesianos serán la
media, la mediana, etc de la distribución a–posteriori.
UTDT Riesgo y Estimadores UMVUE 28 / 34
Agenda

1 Riesgo: Error Cuadrático Medio

2 Mejores estimadores insesgados

3 Estimadores minimax

4 Apéndice

UTDT Riesgo y Estimadores UMVUE 29 / 34


Figure: ¿Cómo será el ECM en cada caso? volver

UTDT Riesgo y Estimadores UMVUE 30 / 34


Reforzando el mensaje:

Si Wn tiene sesgo y varianza pequeños, entonces tiene un ECM bajo.


I En otras palabras, la distribución de probabilidad de Wn está
concentrada en torno de θ, o lo que es lo mismo
I Con alta probabilidad el estimador Wn tomará valores cercanos al
parámetro desconocido θ (garantiza que estimo razonablemente bien).

COROLARIO: Si tengo dos estimadores Wn y Wn0 y (por ejemplo)


ECM(Wn , θ) < ECM(Wn0 , θ) para todo posible valor de θ en la
población, entonces prefiero Wn a Wn0 como estimador de θ.

Desafortunadamente, encontrar estimadores uniformemente mejores


no es posible en general (ver otro contraejemplo en las próximas
slides).

UTDT Riesgo y Estimadores UMVUE 31 / 34


Estimar el parámetro de una Bernoulli
iid
{X1 , . . . , Xn } ∼ Bern(p) y comparamos dos estimadores pb1 y pb2 :

pb1 la media muestral:


pb1 = X n .
pb2 agrega 2 fracasos y 2 éxitos artificiales a la muestra:
Pn
Xi + 2
pb2 = i=1 .
n+4

Calculemos primero el ECM de pb1 . Sabemos que:

p(1 − p)
E (b
p1 ) = p, y Var (b
p1 ) =
n
h i
p(1−p)
Entonces el ECM(b p1 − p)2 =
p1 , p) = E (b n .

UTDT Riesgo y Estimadores UMVUE 32 / 34


Sesgo y varianza de pb2 (notar que ni=1 Xi = T ∼ Bin(n, p)).
P

 
T +2 E (T + 2) np + 2 2(1 − 2p)
E −p = −p = −p = .
n+4 n+4 n+4 n+4

El sesgo no es cero, salvo cuando p = 0.5. Sin embargo converge a cero


cuando n → ∞.
 
T +2 Var (T + 2) Var (T ) np(1 − p)
Var = 2
= 2
= .
n+4 (n + 4) (n + 4) (n + 4)2

Entonces:
 2
2
 2(1 − 2p) np(1 − p)
ECM(b p2 − p)
p2 , p) = E (b = + .
n+4 (n + 4)2

¿Cuál es mejor?

UTDT Riesgo y Estimadores UMVUE 33 / 34


n=10 n=100

0.0025
0.025

0.0020
0.020

0.0015
0.015
ECM

ECM

0.0010
0.010

0.0005
0.005

0.0000
0.000

0.0 0.2 0.4 0.6 0.8 1.0 0.0 0.2 0.4 0.6 0.8 1.0

p p

Figure: Error cuadrático medio para pb1 (naranja) y pb2 (azul). volver

UTDT Riesgo y Estimadores UMVUE 34 / 34

También podría gustarte