0% encontró este documento útil (0 votos)
13 vistas22 páginas

Modelo de Regresión Lineal Múltiple

Este documento describe el modelo de regresión lineal múltiple, incluyendo sus hipótesis básicas, el método de estimación de parámetros por mínimos cuadrados, y las propiedades de los estimadores. El modelo asume que la variable dependiente es una combinación lineal de variables independientes más un término de error, y que este error sigue una distribución normal. El método de estimación minimiza la suma de los cuadrados de los residuos para obtener estimaciones de los parámetros del modelo.

Cargado por

Marc Pastor Pou
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
13 vistas22 páginas

Modelo de Regresión Lineal Múltiple

Este documento describe el modelo de regresión lineal múltiple, incluyendo sus hipótesis básicas, el método de estimación de parámetros por mínimos cuadrados, y las propiedades de los estimadores. El modelo asume que la variable dependiente es una combinación lineal de variables independientes más un término de error, y que este error sigue una distribución normal. El método de estimación minimiza la suma de los cuadrados de los residuos para obtener estimaciones de los parámetros del modelo.

Cargado por

Marc Pastor Pou
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como PDF, TXT o lee en línea desde Scribd

Universidad Carlos III de Madrid

Métodos de Regresión

Tema 3: El modelo de Regresión Lineal


Múltiple

Marc Pastor

November 12, 2021


Contents

1 Hipótesis básicas 2

2 Estimación de parámetros 4

3 Propiedades de los estimadores 12

3.1 Propiedades de los β̂j . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12

3.2 Propiedades de la varianza residual . . . . . . . . . . . . . . . . . . . . . . . 14

4 Predicción 15

4.1 Estimación de las medias condicionadas . . . . . . . . . . . . . . . . . . . . 16

4.2 Predicción de una nueva observación (pronóstico) . . . . . . . . . . . . . . . 18

4.3 Extrapolación oculta y predicción . . . . . . . . . . . . . . . . . . . . . . . . 19

1
1 Hipótesis básicas
El modelo de regresión lineal múltiple mide el efecto de las variables más impor-
tantes (x1 , x2 , . . . , xk ) sobre la variable respuesta y, y representa el efecto de las variables
restantes mediante una variable aleatoria que llamaremos perturbación del modelo:

y = f (x1 , x2 , . . . , xk ) + g(xk−1 , . . . , xp ) .
| {z }
=u

Supondremos que en el rango de valores de interés, la función f admite una aproxi-


mación lineal, con lo que resulta el modelo de regresión lineal múltiple:

y = β0 + β1 x1 + β2 x2 + . . . + βk xk + u.

Supondremos que se quieren explicar los valores de una v.a. y a partir de un conjunto de k
variables explicativas x1 , x2 , . . . , xk , que sobre los individuos de la muestra toman valores
predeterminados y conocidos.

La v.a. y recibe el nombre de variable explicada, endógena, respuesta o dependiente.


Mientras que, x1 , x2 , . . . , xk son las variables explicativas, exógenas, regresores o inde-
pendientes. (Lo mismo se aplica para la regresión lineal simple).

Admitiremos que en cada individuo de la muestra se tiene la relación:

yi = β0 + β1 x1i + β2 x2i + . . . + βk xki + ui , para i = 1, 2, . . . , n,

ˆ yi es el valor de la respuesta del individuo i-esimo,

ˆ βj mide el efecto marginal que produce un aumento unitario en xj cuando el resto


de variables permanecen constantes (j = 1, 2, . . . , k),

ˆ ui mide el efecto que producen sobre la respuesta las variables que no están incluidas
en el modelo. Es el término de error o perturbación.

Supondremos que la perturbación aleatoria ui verifica las hipótesis habituales:

h1) Su esperanza es cero: E(ui ) = 0,

h2) Su varianza es constante: V ar(ui ) = σ 2 ,

h3) Son independientes dos a dos: Cov(ui , uj ) = 0, ∀i ̸= j,

h4) La distibución de ui es normal.

2
Si llamamos u = (u1 , u2 , . . . , un )′ al vector n×1 que contiene las perturbaciones aleatorias,
h1-h4 se resumen diciendo que u es un vector aleatorio con ley normal multivariante
con vector de esperanzas E(u) = 0 = (0, . . . , 0)′ y matriz de covarianzas V ar(u) = σ 2 I,
es decir,
u ∼ N Mn (0, σ 2 I),

donde 0 es el vector n × 1 de ceros, I es la matriz identidad n × n.

Además de las condiciones h1-h4 sobre la perturbación aleatoria, deben añadirse dos
hipótesis más para poder estimar el modelo sin ambigüedad:

h5) El tamaño muestral debe ser mayor que el número de parámetros a estimar, n > k+1
(de lo contrario, existen infinitas soluciones),

h6) Las variables explicativas x1 , x2 , . . . , xk deben ser linealmente independientes,


es decir, la matriz  
1 x11 x21 · · · xk1
 
 1 x12 x22 · · · xk2 
X=
 
.. .. .. .. .. 

 . . . . . 

1 x1n x2n · · · xkn
debe ser de rango máximo, rang(X) = k+1 (de lo contrario, existirı́a alguna variable
explicativa que se puede expresar como combinación lineal del resto y obtendrı́amos
infinitas soluciones (multicolinealidad)).

Igual que ocurrı́a en el modelo de regresión lineal simple, las hipótesis h1-h4 pueden
escribirse en términos de la variable respuesta:

h1’) Para valores fijos de las xj ’s, la distribución de yi tiene media:

E(yi | {(x1 , . . . , xk ) = (x1i , . . . , xki )}) = β0 + β1 x1i + . . . + βk xki ,

h2’) La varianza de la variable respuesta es constante y no depende de los valores de las


xj ’s: V ar(yi ) = σ 2 ,

h3’) Las yi son independientes dos a dos: Cov(yi , yj ) = 0, ∀i ̸= j,

h4’) Para valores fijos de las xj ’s, las yi tienen ley normal:

yi |(x1 ,...,xk )=(x1i ,...,xki ) ∼ N (β0 + β1 x1i + . . . + βk xki , σ 2 ),

pero no son idénticamente distribuidas (al igual que pasaba en regresión lineal simple,
cada yi , para cada valor de i, tiene media distinta).

3
Modelo en notación matricial

y = Xβ + u donde u ∼ N Mn (0, σ 2 I)
      
y1 1 x11 x21 · · · xk1 β0 u1
      
 y2   1 x12 x22 · · · xk2   β1   u2 
= .  . + .
      
 ..   .. .. .. .. ..  . ..

 .   . . . .  . 
 
 
 . 

yn 1 x1n x2n · · · xkn βn un

Además, puesto que u ∼ N Mn (0, σ 2 I) ⇒ y ∼ N Mn (m, σ 2 I), donde:


 
β0 + β1 x11 + β2 x21 + · · · + βk xk1
 
 β0 + β1 x12 + β2 x22 + · · · + βk xk2 
m=  = Xβ.
 
..

 . 

β0 + β1 x1n + β2 x2n + · · · + βk xkn

2 Estimación de parámetros
Al ser la distribución de la variable respuesta (y) normal (condición h4’), el método de
estimación por máxima verosimilitud coincide con el método de estimación por mı́nimos
cuadrados. Ası́, la función a minimizar es:
n
X n
X
2
M= (yi − ŷi ) = e2i ,
i=1 i=1

donde ŷi = β0 + β1 x1i + β1 x2i + . . . + βk xki son los valores ajustados y ei los residuos del
modelo (i = 1, 2, . . . , n).

Por tanto, la función a minimizar es:


n
X n
X
2
M= (yi − ŷi ) = (yi − β0 − β1 x1i − β2 x2i − . . . − βk xki )2 .
i=1 i=1

Buscamos β0 , β1 , . . . , βk tales que M sea mı́nimo. Para ello, debemos derivar parcialmente
M respecto de los parámetros β0 , β1 , . . . , βk . Obtenemos ası́ k + 1 ecuaciones normales:
n n
∂M X X
=2 (yi − β0 − β1 x1i − β2 x2i − . . . − βk xki )(−1) = 0⇒ ei = 0,
∂β0
i=1 i=1

n n
∂M X X
=2 (yi − β0 − β1 x1i − β2 x2i − . . . − βk xki )(−xji ) = 0⇒ ei xji = 0, ∀j = 1, . . . , k.
∂βj
i=1 i=1

4
Las ecuaciones normales dan lugar a un sistema de k + 1 ecuaciones con k + 1 incógnitas,
implicando que:

a) Los residuos deben tener media cero,

b) Los residuos no deben estar relacionados con ninguna de las variables explicativas.
Esto garantiza que en la descomposición básica yi = ŷi + ei toda la información de la
relación entre y y las xj ’s quede recogida en ŷi , mientras que el residuo ei contendrá
la parte de y que no está relacionada con las xj ’s.

El sistema de k + 1 ecuaciones con k + 1 incógnitas se escribe como:


n
X n
X n
X
yi = nβ0 + β1 x1i + . . . + βk xki
i=1 i=1 i=1

n
X n
X n
X n
X
yi x1i = β0 x1i + β1 x21i + . . . + βk xki x1i
i=1 i=1 i=1 i=1
n
X n
X n
X n
X
yi x2i = β0 x2i + β1 x1i x2i + . . . + βk xki x2i
i=1 i=1 i=1 i=1
..
.
n
X n
X X n n
X
yi xki = β0 xki + β1 x1i xki + . . . + βk x2ki
i=1 i=1 i=1 i=1

El sistema anterior, se puede excribir matricialmente como:


      
1 1 ··· 1 y1 1 1 ··· 1 1 x11 ··· xk1 β0
      
 x11 x12 ··· x1n    x11
y2 x12 ··· x1n  1 x12 ··· xk2  β1 
= .
      
 . .. .. .. .. .. .. .. .. .. .. .. ..
 ..   ..
   
 . . . 
  . . . . 
 . . . . 
 . 

xk1 xk2 ··· xkn yn xk1 xk2 ··· xkn 1 x1n ··· xkn βk
| {z } | {z }| {z }
y X β

En notación matricial reducida, el sistema de ecuaciones anterior se escribe como:

X′ y = X′ Xβ,

de donde se obtiene la estimación del vector de parámetros:

β̂ = (X′ X)−1 X′ y.

5
Tenemos entonces que:
β̂ = (X′ X)−1 X′ y.

Observaciones:

1. La condición h6 (rang(X) = k + 1) implica que rang(X′ X) = k + 1 y, por tanto,


que existe la inversa de X′ X. Esto garantiza la unicidad de la solución β̂.

2. Cuando X′ X sea casi singular (det(X′ X) ≈ 0) tendremos problemas para estimar β̂


y V ar(β̂).

Planteamiento del modelo:

y = Xβ + u, donde u ∼ N Mn (0, σ 2 I).

Hiperplano de regresión:

ŷ = Xβ̂, donde β̂ = (X′ X)−1 X′ y,

ŷ = X(X′ X)−1 X′ y = Hy.


| {z }
H

La matriz H recibe el nombre de proyector ortogonal (o hat matrix) y es simétrica


(H′ = H), idenmpotente (H2 = H) y de rango k + 1.

Los residuos del modelo son:

e = y − ŷ= y − Hy= (I − H)y.

La matriz I−H se denomina proyector ortogonal complementario y es una matriz simétrica,


idempotente y de rango n − k − 1.

El proyector I − H define un espacio ortogonal al definido por el proyector H. Por tanto,


el producto escalar entre elementos de sendos espacios será cero. En particular, ŷ′ e = 0,
puesto que ŷ = Hy, mientras que e = (I − H)y.

6
Interpretación geométrica del modelo

Teorema de Pitágoras:
∥ŷ∥2 + ∥e∥2 = ∥y∥2

V E + V NE = V T

7
Ejercicio 1

Demostrar que en el modelo de regresión lineal múltiple:

y = Xβ + u, donde u ∼ N Mn (0, σ 2 I)

se cumple que:

a) e′ ŷ = 0, X′ ŷ = X′ y donde e es el vector n × 1 de residuos del modelo.

b) El proyector ortogonal H = X(X′ X)−1 X′ es una matriz simétrica e idempotente.

Empecemos pues con el apartado a). Se nos pide en primer lugar demostrar que e′ ŷ = 0.
Por teorı́a, sabemos que ŷ = Xβ̂ = X(X′ X)−1 X′ y= Hy.
| {z }
H

Entonces:

e′ ŷ= (y − ŷ)′ ŷ= (y − Hy)′ Hy= (y′ − y′ H′ )Hy= y′ Hy − y′ H′ Hy=

= (H es simétrica) = y′ Hy − y′ H2 y= (H es idempotente : H2 = H) = y′ Hy − y′ Hy = 0

Por otro lado, nos piden demostrar que X′ ŷ = X′ y, veámoslo:

X′ ŷ = X′ Hy= X′ X(X′ X)−1 X′ y= X′ y


| {z }
Ik+1

8
En el apartado b) se nos pide demostrar lo que sabemos por teorı́a y que de hecho hemos
usado en el apartado a): demostrar que H es simétrica e idempotente. Vamos a verlo:

Empecemos viendo que es simétrica, es decir, que H′ = H:

H′ = (X(X′ X)−1 X)′ = X(X′ X)−1 X′ = H

Veamos ahora que es idempotente, es decir, que H2 = H:

H2 = HH= X (X′ X)−1 X′ X(X′ X)−1 X′ = X(X′ X)−1 X′ = H


| {z }
Ik+1

9
Ejemplo 3.1 El Informe de 2010 de Eurostat sobre Renta y Condiciones de Vida en
Europa pone de manifiesto la nueva composición de los hogares en Europa. Esta nueva
composición se explica en base a dos factores: “familia extendida” y “estabilidad de las
relaciones”.

El fichero “Renta CV [Link]” contiene el primer factor y =“familia extendida”,


junto con algunas de las variables de este informe (x1 = “porcentaje de jóvenes entre 18
y 28 años que viven solos”, x2 = “porcentaje de parejas de entre 30 y 39 años que viven
juntas y sin niños”, x3 = “porcentaje de personas de 65 o más años, que viven solas o en
pareja, pero sin hijos”, x4 = “tamaño del hogar, calculado como la media de personas que
lo forman”), para n = 24 paises europeos.

Ajustar un modelo de regresión lineal múltiple que explique y en función de x1 , x2 , x3 y


x4 .

[h]

10
Modelo estimado:

ŷi = 4.265 + 0.031x1i + 0.031x2i + 0.147x3i − 2.931x4i

La matriz de correlaciones entre las variables explicativas es:


 
1.000. 0.6448 0.5790 −0.7745
 
 0.6448 1.0000 0.3968 −0.6150 
r=
 

 0.5790
 0.3968 1.0000 −0.7827 

−0.7745 −0.6150 −0.7827 1.0000

Observad que algunos pares de variables presentan correlaciones moderadas, por ejemplo,
los pares (x3 , x4 ) y (x1 , x4 ).

Es posible que el incluir las cuatro variables explicativas en el modelo de lugar a un


problema de multicolinealidad.

Retomaremos este ejemplo cuando estudiemos cómo detectar la multicolinealidad.

11
3 Propiedades de los estimadores

3.1 Propiedades de los β̂j

Proposición 3.1: Bajo las hipótesis h1-h6 del modelo de regresión, se cumple que los
estimadores
β̂j ∼ N (βj , σ 2 qjj ), para j = 0, 1, . . . , k,

donde (q00 , q11 , . . . , qkk )′ = diag((X′ X)−1 )

Demostración:

Normalidad del estimador: El estimador mı́nimo cuadrático se ha obtenido como combi-


nación lineal de las yi (que por las hipópetsis h1-h4 tenı́an ley normal). Es decir,

β̂ = (X′ X)−1 X′ y = Cy, C matriz de constantes.


| {z }
C

Recordemos que el modelo es y = Xβ + u con u ∼ N Mn (0, σ 2 I).

Esperanza del estimador:

E(β̂) = E((X′ X)−1 X′ y) = E((X′ X)−1 X′ (Xβ + u)) =

= E((X ′ X)−1 X ′ X β) + E((X ′ X)−1 X ′ u) = β + C E(u) = β.


| {z } | {z } | {z }
Ik+1 C =0

La matriz de covarianzas del estimador se define como:


h i
V ar(β̂) = E (β̂ − E(β̂))(β̂ − E(β̂))′ .

Antes de operar, veamos que β̂ = β + Cu, siendo C = (X′ X)−1 X′ :

β̂ = (X′ X)−1 X′ y= C(Xβ + u)= CXβ + Cu=


| {z }
C

= (X′ X)−1 X′ X β + Cu =β + Cu.


| {z }
Ik+1

12
Por lo anterior, β̂ − β = Cu. Operando en la matriz de covarianzas, tenemos que:
h i
V ar(β̂) = E (β̂ − E(β̂))(β̂ − E(β̂))′ = E[(β̂ − β) (β̂ − β)′ ]= E(Cuu′ C′ )=
| {z } | {z }
Cu (Cu)′

= C E(uu′ ) C′ = σ 2 CC′ = σ 2 (X′ X)−1 X′ X(X′ X)−1 = σ 2 (X′ X)−1


| {z } | {z }
σ 2 In Ik+1

Donde se ha utilizado que al ser E(u = 0) ⇒ V ar(u) = E(uu′ ) = σ 2 In .

Observad que es imprescindible que X′ X sea no singular (⇔ rang(X) = k + 1).

Si llamamos qij a los elementos de la matriz (X′ X)−1 :


 
q00 q01 · · · q0k
 
 q10 q11 · · · q1k 
(X′ X)−1 =  . , con qij = qji ∀i ̸= j.
 
 .. .. .. .. 
 . . .  
qk0 qk1 · · · qkk

Entonces:
V ar(β̂j ) = σ 2 qjj , para j = 0, 1, . . . , k

Cov(β̂j , β̂l ) = σ 2 qjl , para j, l = 0, 1, . . . , k, con j ̸= l.

En general, σ 2 será desconocida y en su lugar utilizaremos la varianza residual (más


adelante veremos cómo estimarla). Entonces, s2R qjj será un estimador de la varianza de
β̂j .

Observación: En general, la matriz X′ X no será una matriz diagonal, por lo que su


inversa tampoco lo será. Esto implica que Cov(β̂j , β̂l ) ̸= 0, por tanto, los estimadores β̂j
no serán v.a. independientes.

13
3.2 Propiedades de la varianza residual

El estimador por máxima verosimilitud para la varianza de la perturbación aleatoria σ 2


es la varianza residual:∗
n
1 X 1
s2R = e2i = e′ e,
n−k−1 n−k−1
i=1

donde e = y − ŷ = (I − H)y es el vector n × 1 que contiene los residuos. Otra forma más
conveniente para calcular s2R es:

(n − k − 1)s2R = e′ e= y′ (I − H)′ (I − H)y= y′ (I − H)y= y′ y − y′ Hy=


1 ′
y′ y − y′ X(X′ X)−1 X′ y= y′ y − β̂X′ y⇒ s2R = (y′ y − β̂ X′ y).
| {z } n−k−1
β̂
∗ Recordemos que las k + 1 ecuaciones normales establecen k + 1 restricciones sobre los
residuos y, por tanto, solamente quedan n − k − 1 grados de libertad.

Proposición 3.2: Bajo las hipótesis h1-h6, se cumple que:

n−k−1 2 1 2σ 4
2
sR = 2 e′ e ∼ χ2n−k−1 , E(s2R ) = σ 2 , V ar(s2R ) = .
σ σ n−k−1

Demostración:

Necesitamos el siguiente resultado de Análisis Multivariante: Sea z ∼ N Mn (0, I) y A una


matriz n × n no aleatoria. La forma cuadrática z′ Az tiene ley χ2r si y solo si A es una
matriz idempotente de rango r.
1 ′
Veamos que podemos escribir e e como una forma cuadrática del vector u ∼ N Mn (0, σ 2 I)
σ2
y de una matriz idempotente.

e = (I − H)y= (I − H)(Xβ + u)= Xβ + u − HXβ − Hu=

= Xβ + u − X (X′ X)−1 X′ X β − Hu= u − Hu= (I − H)u.


| {z }
Ik+1

Por tanto,
e′ e= u′ (I − H)′ (I − H)u= u′ (I − H)u

es una forma cuadrática de v.a. N (0, σ 2 ) independientes, siendo la matriz I − H idempo-


tente y simétrica.
1 ′
Luego e e tiene ley χ2 con grados de libertad igual al rango de (I − H.
σ2

14
Al ser I − H una matriz idempotente, se tiene que:

rang(I − H) = tr(I − H)= tr(I) −tr(H)= n − tr(X(X′ X)−1 X′ ) = n − k − 1.


| {z } | {z }
=n =tr((X′ X)−1 X′ X)=tr(Ik+1 )

La esperanza y la varianza del estimador s2R se deducen a partir de la ley chi-cuadrado.∗

∗ La esperanza y varianza de una ley χ2r son: E(χ2r ) = r, Var(χ2r ) = 2r.

4 Predicción
Un modelo de regresión múltiple permite:

1. Estimar las medias condicionadas: Estimar las medias de las distribuciones de y


para cada valor de x,

2. Realizar pronósticos: Prever futuros valores de la variable respuesta y.

La estimación puntual de la media condicionada y del pronóstico de y se obtienen susti-


tuyendo en la ecuación del hiperplano de regresión, es decir, dado un valor concreto de
x = xh = (1, x1h , x1h , . . . , xkh )′ , se obtiene:

ŷh = x′h β̂.

Sin embargo, la precisión de la estimación es distinta si se trata una media condicionada


o de un pronóstico, y por tanto, los intervalos de confianza serán distintos.

15
4.1 Estimación de las medias condicionadas

Modelo: y = Xβ + u donde u ∼ N Mn (0, σ 2 I).

El nuevo parámetro que se quiere estimar es la media de y condicionada a que las variables
explicativas xj ’s tomen un valor concreto x′h = (1, x1h , x2h , . . . , xkh ), es decir:

E(y | x = xh )= E(x′h β + u)= x′h β= mh .

Proposición 3.3:

a) El estimador puntual de mh es:

ŷh = x′h β̂ ∼ N (mh , σ 2 vhh ), donde vhh = x′h (X′ X)−1 xh .

b) El intervalo de confianza para mh al (1 − α)100% es:


sR
I.C.(mh ) = ŷh ∓ t1−α/2 √ ,
n̂h
donde t1−α/2 es el percentil (1 − α/2)100 de la ley t de Student con n − k − 1 grados
1
de libertad y n̂h = .
vhh

Demostración:

a) El estimador puntual ŷh = x′h β̂ tiene ley normal al ser combinación lineal de leyes
normales:
ŷh = x′h β = x′h (Xˆ′ X)−1 X′ y, siendo y ∼ N M (m, σ 2 I).

Su esperanza y varianza son:


E(ŷh ) = E(x′h β̂)= x′h β= mh ,

V ar(ŷh ) = E[(ŷh − E(ŷh ))2 ]= E[(ŷh − E(ŷh ))(ŷh − E(ŷh ))′ ]= E[(x′h β̂ − x′h β)(x′h β̂ − x′h β)′ ]=

= E[x′h (β̂ − β)(x′h (β̂ − β))′ ]= E[x′h (β̂ − β)(β̂ − β)′ xh ]= x′h E[(β̂ − β)(β̂ − β)′ ] xh =
| {z }
V ar(β̂)
= x′h V ar(β̂) xh = σ 2 x′h (X′ X)−1 xh = σ 2 vhh .
| {z } | {z }
σ2 vhh

b) El I.C.(mh ) se deduce a partir de la ley de ŷh :


ŷh − mh
ŷh ∼ N (mh , σ 2 vhh ) ⇒ √ ∼ N (0, 1).
σ 2 vhh
Como siempre que σ 2 es desconocida, ésta se estima mediante s2R y entonces:
ŷh − mh
√ ∼ tn−k−1 .
sR vhh

16
b) (Continuación) Finalmente, imponiendo que
 
ŷm − mh
P −t1−α/2 ≤ √ ≤ t1−α/2 = 1 − α,
sR vhh

se obtiene el intervalo de confianza para la media condicionada mh :


 
 √  sR
mh ∈ ŷh ∓ t1−α/2 sR vhh = ŷh ∓ t1−α/2 √ ,
n̂h
1 1
donde n̂h = = ′ .
vhh xh (X′ X)−1 xh

Observaciones:

1. vhh = x′h (X′ X)−1 xh es el elemento h-ésimo de la diagonal del proyector H.

2. Puede demostrarse que (Apéndice 12, Peña II):


 
1
vhh = x′h (X′ X)−1 xh = 1 + (x̃h − x̄)′ S−1
x (x̃h − x̄) ,

n | {z }
dist. Mahalanobis

donde x̃h = (x1h , x2h , . . . , xkh ), de manera que xh = (1, x1h , x2h , . . . , xkh ), x̄ es el
vector de medias de las k variables explicativas y Sx es su matriz de covarianzas.

3. vhh es una medida de distancia del punto x̃h al centro de gravedad x̄. Además,
1 σ2
si x̃h = x̄ ⇒ vhh = ⇒ V ar(ŷh ) = ,
n n
1 σ2
si x̃h ̸= x̄ ⇒ vhh > ⇒ V ar(ŷh ) > .
n n
Cuanto más alejado esté x̃h de x̄, mayor será la varianza V ar(ŷh ) y, por tanto,
menor será la precisión de la estimación.
1
4. Se define n̂h = como el número equivalente de observaciones para estimar
vhh
σ2
mh . Utilizando esta cantidad, V ar(ŷh ) = .
n̂h

17
4.2 Predicción de una nueva observación (pronóstico)

Se quiere prever el valor futuro de la variable respuesta cuando x = xh . Por tanto, se tiene
una nueva v.a. yh = x′h β + uh , donde uh ∼ N (0, σ 2 ), independiente de u1 , u2 , . . . , un . La
estimación puntual (pronóstico) de y cuando x = xh es:

ŷh = x′h β.

Sin embargo, la estimación por intervalo se obtiene a través del intervalo de valores
probables ∗ para la nueva v.a. yh :
 r 
1 1 1
yh ∈ ŷh ∓ t1−α/2 sR 1 + , donde n̂h = = ′
n̂h vhh xh (X′ X)−1 xh
y t1−α/2 es el percentil (1 − α/2)100 de la ley t-Student con n − k − 1 g.l.

∗ El intervalo de los valores futuros de y, aunque se sigue denominando intervalo de


predicción o de pronóstico, en realidad, no es un intervalo de confianza porque no se está
estimando ningún parámetro.

Deducción del intervalo de valores probables:

Se considera el residuo h-ésimo, eh = yh − ŷh , que es una v.a. con ley normal al ser
σ2
combinación lineal de normales (recordad que ŷh ∼ N (mh , )).
n̂h
Su esperanza y varianza son:

Su esperanza y varianza son:

E(eh ) = E(yh − ŷh )= E(x′h β + uh − ŷh )= x′h β + E(uh ) − E(ŷh )= 0,


|{z} | {z } | {z }
=mh =0 =mh

σ2
 
2 2 1
V ar(eh ) = V ar(yh − ŷh )= V ar(yh ) + V ar(ŷh )= σ + =σ 1+ ,
n̂h n̂h

donde la varianza se ha obtenido como una suma de varianzas porque yh , ŷh son v.a.
independientes al serlo uh de u1 , u2 , . . . , un

Por tanto, se tiene que:


  
2 1 yh − ŷh
eh = yh − ŷh ∼ N 0, σ 1 + ⇒ r ∼ N (0, 1).
n̂h 1
σ 1+
n̂h

Como antes, al ser σ 2 desconocida, ésta se estimará mediante s2R y entonces:


yh − ŷh
r ∼ tn−k−1 .
1
sR 1 +
n̂h

18
Finalmente, imponiendo que:
yh − ŷh
P (−t1−α/2 ≤ r ≤ t1−α/2 ) = 1 − α,
1
sR 1 +
n̂h

se obtiene el intervalo de predicción para la respuesta concreta yh :


 r 
1 1 1
yh ∈ ŷ ∓ t1−α/2 sR 1 + , donde n̂h = = ′ .
n̂h vhh xh (X′ X)−1 xh

4.3 Extrapolación oculta y predicción

En la estimación de la respuesta media o la predicción de nuevas respuestas en un punto


concreto x = xh , debemos ser extremadamente cautos con la extrapolación.

ˆ Si solo se tiene en cuenta el producto cartesiano, es fácil considerar la predicción


para un punto que puede estar fuera de la nube de puntos con la que se ha calculado
el hiperplano de regresión (¡Extrapolación oculta!)

ˆ Para evitar este problema, debemos ceñirnos al casco convexo (o convex hull ) de
las variables regresoras: el menor conjunto convexo que contiene a los n puntos
originales.

Ejemplo de casco convexo

19
En general, cuando el número de variables regresoras es k > 2, el casco convexo es difı́cil
de calcular. Sin embargo, el siguiente elipsoide contiene al casco convexo:

x ∈ Rk+1 tal que x′ (X′ X)−1 x ≤ vmax ,

donde vmax = max1≤h≤n {vhh } = max(diag(H)).

Este elipsoide no es el menor de los elipsoides que contienen al casco convexo, pero sı́ el
más sencillo de calcular.

Para evitar en lo posible la extrapolación, solo será adecuado realizar la predicción o


pronóstico de la respuesta para un punto concreto x = xh , si se cumple que:

x′h (X′ X)−1 xh ≤ vmax .

Ejemplo 3.3

Dada una matriz de regresores X, n × k, y un vector de respuestas y, n × 1, escribir una


función en R para determinar si un punto xh = (x1h , x2h , . . . , xkh )′ está dentro del casco
convexo. En caso afirmativo, obtener la predicción ŷh .

En el Ejemplo 3.1 se disponı́a de cuatro variables explicativas (x1 = “porcentaje de jóvenes


entre 18 y 28 años que viven solos”, x2 = “porcentaje de parejas de entre 30 y 39 años que
viven juntas y sin niños”, x3 = “porcentaje de personas de 65 o más años, que viven solas
o en pareja, pero sin hijos”, x4 = tamaño del hogar, calculado como la media de personas
que lo forman) y una variable regresora (y = “familia extendida”) medidas sobre n = 24
paises que formaban parte de la Europa de los 25.

a) Bielorrusia es un paı́s vecino de Polonia, Lituania y Letonia, pero que no está en la


Europa de los 25. Aún ası́, suponiendo que para Bielorrusia x1 = 7, x2 = 30, x3 =
22 y x4 = 3.3, obtener el valor esperado para y, siempre que se considere adecuado.

20
b) Obtener también intervalos de pronóstico al 95% y al 99% para esta predicción.

Llamamos X a la matriz que contiene los cuatro regresores en columna, y al vector columna
con la variable respuesta y xh = (7, 30, 22, 3.3)′ . Utilizando el programa anterior, obten-
emos:

21

También podría gustarte