Inferencia Estadística: Métodos y Problemas
Inferencia Estadística: Métodos y Problemas
SOLUCIONES
λx − λ
Aplicando la ecuación de Poisson: P (X = x ) = e
x!
Para X = 30:
P(X = 30) = (2030 • e-20) / 30! = 0,00834.
Apartado A
En las tablas de la chi-cuadrado podemos encontrar Χ 02,90;5 que es la
intersección correspondiente a la fila n=5 con la columna α=0,90, en este caso:
Χ 02,90;5 = 1,61 . Realizamos el mismo proceso para el resto de puntos críticos:
Apartado B
En las tablas encontramos directamente: P ( Χ 82 ≥ 3,49) =0,90
Para calcular la siguiente probabilidad:
P ( Χ 82 ≤ 15,51) = 1 − P ( Χ 82 ≥ 15,51) = 1 − 0,05 = 0,95
TEST 1
Pregunta 16
Si vamos a la tabla de t de Student y entramos con t0.95 y el grado de libertad
igual a 16, veremos que el valor obtenido es 1,75.
TEST 2
Pregunta 16
En este caso entrando con la misma t0,95; pero con el grado de libertad igual a
27, el resultado obtenido 1,70
TEST 3
Pregunta 16
En este caso, el resultado es 1,645. Debemos ir a la zona en donde pone
“infinito” ya que para este valor no está en la tabla.
TEST 4
58. BIBLIOGRAFÍA
[Link]
GUÍA DE LA UNIDAD DIDÁCTICA 4
Tema 1
Tema 2
Matemática elemental
Problemas de estimación
Inferencia paramétrica
Inferencia no paramétrica
Para que lo entiendas este teorema significa que si tomamos una muestra lo
suficientemente grande nos puede proporcionar información prácticamente
exacta sobre la función de distribución de la población. Pero para que la
inferencia sea valida, como nos muestre este teorema deben cumplirse dos
condiciones:
Muestra aleatoria.
Muestra suficientemente grande.
68.1. Introducción
Supongamos que queremos estudiar la variable X de una población. Seguro
que estaremos interesados en conocer parámetros tales como su media, su
varianza…
¿Cómo se realiza la estimación de un parámetro? En primer lugar, debemos
obtener una muestra de n objetos de la población y medir en ellos la variable
que nos interesa, y a partir de los resultados que obtenemos, deberemos
calcular el valor de alguna función que nos dé un valor que se aproxime de
alguna forma al valor del parámetro deseado.
Esta función recibe el nombre de estimador, y caracteriza al parámetro. El
valor tomado por dicho estimador en cada caso recibe el nombre de
estimación. Tenemos que realizar tres observaciones importantes:
Sesgo
E[ X ] = µ
La varianza muestral es un estimador sesgado de la varianza poblacional
(
ECM [θˆ] = Sesgo θˆ ( ))
2
()
+ Var θˆ
Es especialmente cuando tenemos muchos estimadores del mismo parámetro
con sesgo y varianza bastantes diferentes. Por lo que puede ser mucho más
útil un estimador un poco sesgado y con una varianza muy pequeñita, que uno
centrado y con una varianza alta.
Consistencia de un estimador
lim P(θˆ − θ
n →∞
)
≤ ε = 1 → ∀ε > 0
Eficiencia de un estimador
Suficiencia
Ejemplo 58.2.1
El peso en kilos de ventiladores de tiro forzado por una empresa sigue una
distribución normal con DT igual a 2 y peso medio desconocido. Si sabe que el
peos medio de los ventiladores es mayor a 5 y se toman muestras aleatorias
simples de tamaño 4 para estimar α. ¿cuál de los dos estimadores siguientes
es mejor desde el punto de vista de la insesgadez?
Para saber cual es mejor calculamos sus esperanzas:
X1 + X 2 + X 3 * X1 + X 2
α1* = α2 =
4 2
Por lo que el estimador 1 es sesgado y su sesgo es –α/4.
X + X2 + X3 1 3 1
E (α1*) = E 1 = [ E ( X 1 ) + E ( X 2 ) + E ( X 3 )] = α = α − α
4 4 4 4
Hacemos lo mismo para el estimador 2:
X + X2 1 2
E (α1*) = E 1 = [ E ( X 1 ) + E ( X 2 )] = α = α
2 2 2
El estimador 2 es insesgado, por lo que es preferible este.
x1 x 2 x k
En donde A no depende de p.
Si tomamos logaritmos:
∑x
∑ x ·(1 − p) = p·(kn − ∑ x ); ∑ x = knp; pˆ =
i
i i i
kn
∑ xi
1 1 1 1 − i =1
L( x1 ,...xn ,α ) = f ( x1 ,α )· f ( x2 ,α )... f ( xn ,α ) = e −x1 / α · e − x2 / α ... e −xn / α = n e α
α α α a
Aplicamos logaritmos neperianos:
n
∑ xi
ln L( x1 ,...x n , α ) = ln(1) − n ln(α ) − i =1
α
Derivando respecto a α e igualando a 0 para obtener el máximo:
n n
∂ ln L( x1 , x 2 ...x n , α ) n ∑ xi ∑ xi
= − + i =1 2 = 0 → αˆ = i =1 = x
∂α α α n
Con lo que el estimador más verosímil es la media muestral, para comprobar
que es el estimador máximo podemos realizar la segunda derivada, en caso de
que dé negativo, el estimador es el de máxima verosimilitud:
APARTADO2
Para obtener la estimación máximo verosímil de la duración media sin fallos del
componente electrónico, a partir de la muestra dada, basta calcular la duración
media de dicha muestra:
3520 + 3500 + 3750 + 3640 + 3670 + 3580 + 3690 + 3700 + 3710 + 3685
x= = 3644,5horas
10
Problema propuesto sobre el Teorema de Verosimilitud [Link]
σ X −µ
X ≈ N µ , ⇒ ≈ N (0,1)
n σ n
(n − 1) S 2 1 n r 2
σ2
≈ Chi n2−1 Donde: S2 = ∑ i )
n − 1 i =1
( X − X
69.1.C Distribución de la media muestral cuando NO se conoce la varianza
poblacional σ 2
X −µ
≈ t n −1
S/ n
S12 S 22 S12
= ≈ Fn1 −1, n2 −1
σ 12 σ 22 S 22
σ 12 σ 22 ( X 1 − X 2 ) − (µ1 − µ 2 )
X 1 − X 2 ≈ N µ1 − µ 2 , + ⇒ ≈ N (0,1)
n n σ 2
σ 2
1 2 1
+ 2
n1 n2
(X − X 2 ) − (µ1 − µ 2 )
≈ t n1 + n2 − 2
( n1 − 1) S12 + ( n2 − 1) S 22
Donde: S p =
1
1 1 n1 + n 2 − 2
Sp +
n1 n2
2
S12 S 22
+
(X 1 − X 2 ) − (µ 1 − µ 2 )
≈ tn n= n1 n2
Donde: 2 2
S12 S 212 S12 1 S 22 1
+ +
n1 n2 n1 n1 − 1 n2 n2 − 1
D −δ
≈ t n −1 Donde: S D = ∑
n
(D i− D)
=∑
n2
(( X 1i − X 2i ) − (X 1 − X 2 )) 2
SD / n i =1 n −1 i =1 n −1
69.2 Distribuciones muestrales asociadas a variables NO normales
σ X −µ
Si n > 30 ⇒ X ≈ N µ , ⇒ ≅ N (0,1)
n σ n
S X −µ
Si n > 60 ⇒ X ≈ N µ , ⇒ ≅ N (0,1)
n S n
p (1 − p )
pˆ ≅ p,
N
n
n →∞
pˆ (1 − pˆ )
Como en la práctica solemos desconocer p: pˆ ≅ N p,
n
Gracias a la estimación por intervalo podremos afirmar con una seguridad del
que 100(1 − α )% vale como mínimo θ1 ( x) y como máximo θ 2 ( x) , esto nos da
una idea aproximada de la precisión conseguida en la estimación.
θ1 ( x )
y θ 2 ( x) son variables aleatorias que tomarán valores diversos
según le muestra que hayamos seleccionado.
Como de entrada, antes de tomar la muestra, no vamos a saber cuánto
valdrán θ1 ( x) y θ 2 ( x) tiene sentido hablar de la probabilidad de que
θ ∈ [θ1 ( X ),θ 2 ( X )] .
Una vez que tomemos la muestra, θ1 ( x) y θ 2 ( x) toman valores concretos y
o pertenece o no pertenece a este intervalo por lo que ya no tiene lógica
hablar de la probabilidad anterior.
De forma que: P (τ 1 (α ) ≤ T (θ , X ) ≤ τ S (α ) ) = 1 − α
Si además ocurre que la función T( θ ,X) es monótona en θ siempre podremos
obtener los valores de θ que resuelven las siguientes ecuaciones:
T( θ ,X)= τ 1 (α )
T( θ ,X)= τ S (α )
Donde las soluciones de estas ecuaciones θ1 ( X , α ) y θ s ( X , α ) cumplen:
P (θ1 ( X , α ) ≤ θ ≤ θ s ( X , α ) ) = 1 − α
σ
X ± zα / 2
n
S
X ± t n−1,α / 2
n
n − 1) S 2 n − 1) S 2
, 2
Χ2
n −1,α / 2 Χ n −1,1−α / 2
σ 22 S 22 / S12 S 22 / S12
∈ ,
σ 12 Fn −1, n −1,α / 2 Fn −1,n −1,1−α / 2
2 1 2 1
σ 12 σ 22
(X − X ) m z +
α /2
1 2
n1 n2
1
(X 1 − X 2 ) m t n + n −2,α / 2 s p
1
+
1 2
n n
1 2
[Link].C. Muestras independientes: varianzas desconocidas distintas
s12 s 22
(X − X ) m t s +
n ,α / 2 p
1 2
n n2
1
s
(X 1 − X 2 ) m t n −1 ,α / 2 d
n
σ
n > 30 ⇒ X ± zα / 2
n
S
n > 60 ⇒ X ± zα / 2
n
nE (n E + 1) F2
,
(n − n E + 1) F1 + n E (n − n E ) + (n E + 1) F2
pˆ 1 (1 − pˆ 1 ) pˆ 2 (1 − pˆ 2 ) 1 1 1
pˆ 1 − pˆ 2 ± zα / 2 + + +
n1 n2 4 n1 n 2
70.3. Ejemplos, problemas resueltos y problemas propuestos
Solución
Apartado A
0,8 = 1 − α ⇒ α = 0,2 ⇒ t n−1,α / 2 = t 8, 0,1 = 1,397
S 2,1
X ± t n−1,α / 2 = 24 ± 1,397 = 24 ± 0,978
N 9
Apartado B
0,9 = 1 − α ⇒ α = 0,1 ⇒ t n −1,α / 2 = t 8,0,1 = 1,86
S 2,1
X ± t n −1,α / 2 = 24 ± 1,86 = 24 ± 1,302
N 9
70.3.3 Problema resuelto intervalo de confianza (MEDIA)
Se desea saber que contenido de aceite pude extraerse de una cierta cantidad
de almendras, a tal fin se prueban 20 muestras escogidas al azar de marcas
diferentes y se encuentran los siguientes datos maestrales para el contenido de
aceite:
xo = 22 mg
s o = 4 mg (corregida )
Encontrar el intervalo de confianza del 90% para el contenido medio de aceite.
Las soluciones posibles son:
20,25 ± 26,65
Para 90% 20,45 ± 23,55
22,15 ± 26,35
s
La expresión que debemos utilizar es la siguiente: x ± t
n
Debemos entrar a la tabla de t de Student y lo haremos con los grados de
libertad, que en este caso es de 19, y con la t 0,95. Pues bien, el valor obtenido
es de 1,73. Sustituyendo en la expresión anterior, tenemos que:
s 4
x ±t = 22 ± 1,73 ⇒ 20,45 < 22 < 23,55
n 20
[X ]
2
0 , 025 15 = 6,26 ⇒ X 0, 025 = 6,26 = 2,50
Sustituyendo en la ecuación:
s N s N 2,40 16 2,40 16
≤σ ≤ = ≤σ ≤ ⇒ 1,83 ≤ σ ≤ 3,84
x0,975 x0, 025 5,24 2,50
70.3.5Problema propuesto intervalo de confianza (MEDIA)
σ A2 σ B2 120 2 80 2
x A − xB ± zc + = 1400 − 1200 ± 1,96 + = 200 ± 22,17
NA NB 150 200
70.3.9 Problema resuelto intervalo de confianza (PROPORCIONES)
[2] La fuerza electromotriz media (fem) de las baterías producidas por una
empresa es de 4,5 voltios y su desviación típica es 0,04 V. si se conectan en
serie cuatro de ellas, hallar el nivel de confianza al 95%
Si E1, E2, E3, y E4 representa la fem de las cuatro baterías, tenemos que:
Para que puedas comprobar si has entendido esta unidad didáctica y cual ha
sido tu grado de compresión de la misma, te presentamos 1 autoevaluación y
1 autoexámen tipo test. Las soluciones de los mismos se encuentran en el
apartado de soluciones. Como los tests cuentan de 10 preguntas para
aprobarlos debes responder correctamente al 70% de las preguntas, es decir,
debes acertar 7 preguntas.
¡¡ Que tengas mucha suerte!!
AUTOEVALUACIÓN
TEST 1
( ( )) + Var (θˆ)
a) ECM [θˆ] = Sesgo θˆ
2
n
b) L(θ ) = ∏ f ( xi )
i =1
dln(L(θ ))
c) =0
dθ
TEST 2
3. Llamamos sesgo a:
a) Sesgo(θˆ) = E[θˆ] − θ
b) Sesgo(θˆ) = λ − θ
c) Sesgo(θˆ) = E[θˆ] − λ
7. [2]En una muestra aleatoria de 400 adultos y 600 jóvenes qe vieron un cierto
programa de televisión, 100 adultos y 300 jóvenes reconocieron que les había
gustado. Determinar los límites de confianza al 95% para la diferencia de
proporciones de todos los adultos y jóvenes que vieron con agrado el
programa.
a) 0,25 ± 0,06
b) 0,25 ± 0,6
c) 0,6 ± ,25
.
.8. [2] La fuerza electromotriz media (fem) de las baterías producidas por una
empresa es de 4,5 voltios y su desviación típica es 0,04 V. si se conectan en
serie cuatro de ellas, hallar el nivel de confianza al 99%.
a) 180,4 ± 0,21
b) 184,0 ± 21
c) Ambas incorrectas.
Sabiendo que las 10 piezas extraídas al azar sólo una fue defectuosa, la
verosimilitud de que el porcentaje de defectos sea p=0,15 será:
10
L(l d p = 0,15) = ·0,15·0,85 9 = 0,3474 (turno mañana )
1
Para el empleado de turno de tarde:
10
L(l d p = 0,08) = ·0,08·0,92 9 = 0,3777 (turno tarde)
1
∑ xi ∑x 2
i
α1 = x = i =1
y α2 = i =1
n n
Igualando los momentos muestrales y poblacionales obtenemos:
n
∑ xi
α 1 = a1 αˆ = x = i =1
n
α = a n n
2 2
∑ x 2
i ∑ x 2i
σ 2 + α 2 = i =1 ; σ 2 = i =1 −α 2
n n
2
n
n
∑x 2
i ∑x i
Sustituimos α̂ en la segunda ecuación: σ = 2 i =1
− i =1
n n
70.3.5Problema propuesto intervalo de confianza (MEDIA)
α
Sabemos que: 0,95 = 1 − α ⇒ α = 0,05 ⇒ = 0,025 ⇒ z α = z 0, 025 = 1,96
2 2
5
El intervalo será: 70 ± 1,96 = 70 ± 1,96·1,25 = 70 ± 2,45
16
Cuando los grados de libertad son mayores que 30, debemos recurrir a la
siguiente expresión: 2 X 2 p − 2ν − 1
Al distribuirse normalmente, se puede poner:
2 X 2 p − 2ν − 1 = z p ⇒ X P2 =
1
2
(z p + 2ν − 1 )
2
X 02,975 =
1
2
(
z 0,975 + 2·199 − 1 )2
=
1
2
(1,96 + 19,92 )2
= 239
X 02, 025 =
1
2
(
z 0, 025 + 2·199 − 1 ) 2
= 161
σ A2 σ B2 120 2 80 2
x A − xB ± zc + = 1400 − 1200 ± 2,58 + = 200 ± 29,19
NA NB 150 200
Test 2
Pregunta 5
P(1 − P ) 55 P(1 − P )
P ± zc = ± 0,50 z c ⇒ N = 384,2 ≅ 385 vo tan tes
N 100 N
Pregunta 6
Se trata de una población de tamaño finito, en la cual Np = 200 y N = 50.
Sabemos que para un nivel de confianza del 95%, la zc = 1,96. Tenemos que la
expresión que debemos utilizar es la siguiente:
pq Np − N
x ± zc
N N p −1
pq Np − N 10 200 − 50
x ± zc = 75 ± 1,96 ⇒ 75 ± 2,4
N N p −1 50 200 − 1
¿Cuál es el nivel de confianza que permite afirmar que la media de las 200
calificaciones es de 75 ± 1 ?
pq Np − N 10 200 − 50
zc = 1 → zc = 1 ⇒ z c = 0,81
N N p −1 50 200 − 1
Pregunta 7
Los límites de confianza para las diferencias en proporciones de los dos grupos
vienen dados por:
p1 q1 p 2 q 2
P1 − P2 = ± zc +
N1 N2
Donde los subíndices 1 y 2 se refieren a jóvenes y adultos respectivamente.
p1 q1 p 2 q 2 0,50·0,50 0,25·0,75
P1 − P2 = ± zc + = 0,50 − 0,25 ± 1,96 + = 0,25 ± 0,06
N1 N2 600 400
Luego tenemos que 95% de confianza de que la verdadera diferencia en
proporciones está entre 0,19 y 0,31.
Pregunta 8
El límite de confianza es 180,4 ± 2,58(0,08) = 180,4 ± 0,21V
74. BIBLIOGRAFÍA