0% encontró este documento útil (0 votos)
18 vistas33 páginas

Modelo de Regresión Lineal en Econometría

Este documento presenta un grupo de estudiantes que realizó un informe sobre el modelo de regresión lineal. Describe las partes del informe entregadas por cada estudiante y presenta un capítulo que explica la introducción al modelo de regresión lineal con algunos ejemplos ilustrativos.

Cargado por

Luz Montecinos
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd
0% encontró este documento útil (0 votos)
18 vistas33 páginas

Modelo de Regresión Lineal en Econometría

Este documento presenta un grupo de estudiantes que realizó un informe sobre el modelo de regresión lineal. Describe las partes del informe entregadas por cada estudiante y presenta un capítulo que explica la introducción al modelo de regresión lineal con algunos ejemplos ilustrativos.

Cargado por

Luz Montecinos
Derechos de autor
© All Rights Reserved
Nos tomamos en serio los derechos de los contenidos. Si sospechas que se trata de tu contenido, reclámalo aquí.
Formatos disponibles
Descarga como DOCX, PDF, TXT o lee en línea desde Scribd

GRUPO N°2: MODELO DE

REGRESION LINEAL
Estudiantes:
1. Alvarez Espinoza Jose Luis
2. Cardenas Pereira Karen
3. Choque Perez Josue
4. Jorge Lopez Deymar
5. Gonzales Loza Edson
6. Montecinos Rebozo Luz Gabriela
7. Perez Mayta Jose David
8. Rosales Condori Alberto
9. Vasquez Padilla Talia Ana
[Link] Enriquez Jose Luis
Docente: Lic. Evert A. Feraudy Alandia.
Asignatura: Econometría
Semestre: Quinto
Fecha: 23 / 06 / 2022
INFORME

Entrega de partes:
1) Alvarez Espinoza Jose Luis (teoría y práctica)
2) Cardenas Pereira Karen (teoría y práctica)
3) Choque Perez Josue (teoría y práctica)
4) Jorge Lopez Deymar (teoría y práctica)
5) Gonzales Loza Edson (no hizo nada)
6) Montecinos Rebozo Luz Gabriela (teoría y práctica)
7) Perez Mayta Jose David (teoría y practica)
8) Rosales Condori Alberto (teoría y práctica)
9) Vasquez Padilla Talia Ana (teoría y práctica)
10) Zurita Enriquez Jose Luis (práctica)
CAPITULO 2

MODELO DE REGRESION LINEAL

2.1 INTRODUCCION

El termino regresión fue introducido por Francis Galton en su libro "Natural Inheritance"
(1889); partiendo de los análisis estadísticos de Karl Pearson. Su trabajo se centró en la
descripción de los rasgos físicos de los descendientes (variable A). A partir de los de sus padres
(variable B) Estudiando la altura de padres e hijos a partir de más de mil registros de grupos
familiares, llego a la conclusión de que los padres muy altos tenían tendencia a tener hijos que
heredaban parte de esa altura y los padres de baja estatura, tenían la tendencia a tener hijos
de baja estatura, pero que en ambos casos relevaban una tendencia a "regresar" a la estatura
media de la población.

La ley de la regresión lineal de Galton fue confirmada por Karl Pearson y generalizo esta
tendencia de: "Cada particularidad en un hombre es compartida por sus descendientes, pero
en media, en un grado menor". En palabras de Galton, se trataba de una regresión a la
mediocridad.

El análisis de regresión trata del estudio de la dependencia de la variable independiente


respecto a una o más variables independientes (variables explicativas), con el objetivo de
estimar o predecir la media o el valor promedio poblacional de la primera con base en los
valores conocidos o fijados de las ultimas.
La dependencia de la variable respecto a otra lo vemos en el siguiente ejemplo.

Ejemplo 2.1

1. Se desea saber la forma como se obtiene la función de demanda de un determinado


producto, conocido el precio y la cantidad producida de una mercancía. Un estudio de este
tipo será de gran ayuda para averiguar la variación de las cantidades demandadas, es decir, el
cambio porcentual en la demanda del producto en respuesta a un cambio de una unidad
monetaria en el precio. Esta referencia puede ser útil para determinar la demanda respecto al
precio, cuya relación fundamental es:

D= f (p)

Donde D es la cantidad producida y p es el precio, reflejada en la tabla y en la figura que se


muestra a continuación:

X Y
Precio Cantidad
10 200
12 160
15 150
18 120
20 100
25 80
30 30
Grafica de Dispersion
250

200
Precio de Venta

150

100

50

0
5 10 15 20 25 30 35
Cantidad

2. El propietario de una compañía desea saber la forma como se relaciona las ventas del
producto de su compañía con el gasto de publicidad. Un estudio de este tipo será de gran
ayuda para averiguar la variación de las ventas en proporción a los gastos de publicidad, es
decir, el cambio porcentual en las ventas en respuesta a un cambio de uno por cierto (1%) en
el gasto de publicidad. Esta referencia puede ser útil para determinar el presupuesto óptimo
de publicidad para la siguiente gestión.

La relación funcional estaría dada de la manera siguiente:

Ventas= f (Publicidad)
Y= f(X)

Publicidad Ventas
10 9
20 11
30 13
35 12
40 15
50 16
55 18
60 21
70 24
80 28
Modelo de Regresion Lineal
30
28
25 24
20 21
18
16
Ventas

15 15
13 12
10 11
9
5

0
0 10 20 30 40 50 60 70 80 90
Publicidad

3. Suponiendo que un economista esté interesado en estudiar la dependencia del gasto de


consumo personal en el ingreso personal neto disponible (después de impuestos). Este tipo de
análisis puede ser útil para estimar la propensión marginal a consumir (pmc), esto es, cambio
promedio en el gasto de consumo ante un cambio de un dólar. En consecuencia la relación
funcional estaría dada de la manera siguiente:

Consumo= f (Ingreso)

Y= f (X)

Donde C es el gasto de consumo personal y Y es el ingreso personal disponible, reflejada en la


tabla siguiente:

Tabla de distribución condicional


Ingreso Familiar por Semana
Y/X 20 40 60 80 100 120 140 160 180 200
50 60 80 85 90 100 110 120 130 140
familiar por Semana

60 70 85 90 105 110 120 130 140 150


Gastos de consumo

70 80 100 95 115 120 130 140 150 170


80 90 95 105 120 125 140 145 155 180
90 100 110 115 125 130 145 150 160 180
  90   110 120 130   160 170 185
      115       130   190
Total 350 490 470 715 675 715 645 975 905 1195
Medi 70 82 94 102 113 119 129 139 151 171
a

De este ejemplo podemos indicar que para un ingreso de 20 dólares existen 5 familias cuyos
gastos de consumo semanales oscilan entre 50 a 90 dólares. También se puede obtener la
media condicional que es igual al valor esperado de C dado Y.

Un valor esperado es la media o valor promedio o valor promedio de la población, que en


términos generales se representa de la forma siguiente:
E (Y/X)= ∑ Y, ln
La tabla anterior la reflejamos en la siguiente figura:

12

Series1
10
Series2

8 Series3

Series4
CONSUMO

12
6
Series1
Series5
10
4 Series2
Series6

8 Series3
Series7
2
CONSUMO

Series4
Series8
6
0
Series5
0 2 4 6 8 10 12
4
INGRESO Series6

2 Series7

Series8
0
0 2 4 6 8 10 12 Linear
(Series8)
INGRESO

A su vez graficamos una línea de dispersión, que es el lugar geométrico de las medias
condicionales o expectativas de la variable dependiente para los valores fijos de las variables
explicativas. En consecuencia, para cada X, existen ciertos valores poblacionales de Y y una
media condicional correspondiente que se refleja a continuación en la figura y además se
muestra la línea o curva de regresión que atraviesa estas medias condicionales.

2.2 Función de Regresión Poblacional y Muestra

La línea de regresión E(Y/X)= B1+B2X1, es la unión de los puntos que representan los valores
esperados de variable independiente Y dado los valores de las variables independientes X's.
Esta línea se puede construir a partir del diagrama de dispersión conformado por los datos
poblacionales; en este caso la línea de regresión se conoce.

Como la función de regresión poblacional. A continuación, se presenta una gráfica de la línea


de regresión poblacional cuando los gastos de consumo de un hogar se desean explicar por el
ingreso.
200
180
160
140
C1
120
C2
Consumo

100 C3
80 C4
C5
60
C6
40 C7
20
0
0 20 40 60 80 100 120 140 160 180 200 220

Ingreso

La función de regresión poblacional E(Y/X i) es una función lineal de Xi, es decir, E(Y/Xi)=ƒ(Xi),
cuya expresión es del siguiente tipo E(Y/Xi)=ß1+ß₂Xi, donde ß1 y ß₂ son parámetros
desconocidos pero fijos, que se conoce con el nombre de coeficientes de regresión, el primero
es el intercepto y el segundo es la pendiente. De otro lado, el modelo de regresión, conocido
como ecuación de regresión (sinónimos) se la expresa de la manera siguiente:

Yi=ß1+ß₂Xi

Por tanto, Yi=E (Y/Xi)

De la figura anterior, se observa que para un nivel de ingreso dado Xi, el gasto de consumo de
una familia está concentrado alrededor del consumo promedio de todas las familias para ese
mismo Xi, esto es, alrededor de su media condicional. Por consiguiente, se puede expresar la
desviación de un Yi individual alrededor de su valor esperado de la forma siguiente.

ui=Yi–E(Y/Xi)

Despejando Yi: Yi=E(Y/Xi)+ui

Por tanto, Yi=ß1+ß₂Xi+ui

Donde ui es una variable aleatoria, no observable, que puede tomar valores positivos o
negativos. Técnicamente se conoce como la perturbación estocástica o término del error
estadístico; también se considera como una variable sustitutiva de todas las variables omitidas
que pueden afectar a la variable dependiente Y, pero que por una u otra razón no pueden
incluirse en el modelo de regresión.

Si tomamos el valor esperado en ambos lados del modelo de regresión:

Yi=E(Y/Xi)+ui

E(Y/Xi)=E[E(Y/Xi)]+E(u/Xi)

Donde el valor esperado de una constante es igual a la constante misma.


E(Y/Xi)=E(Y/Xi)+E(u/Xi)

E(u/Xi)=0

El supuesto de que la línea de regresión pase por las medias condicionales de Y, implica que los
valores medios condicionales de ui son iguales a cero.

Cuando la línea de regresión es construida con los datos muestrales recibe el nombre de
función de regresión muestral (FRM). Como todo procedimiento de inferencia estadística, lo
que se pretende es que la muestra sea una buena representación de la población.

En este sentido, la función de regresión muestral constituye una representación de la función


de regresión poblacional. A sí mismo, en la práctica, las muestras de variables aleatorias son
empleadas para inferir sobre las características de la población.

En la tabla se presenta dos variables, publicidad y ventas como muestra de una población, que
permita obtener dos líneas de regresión muestral para las ventas semanales versus los gastos
en publicidad.

Publicidad Venta 1 Venta 2


10 6 11
20 9 12
30 11 13
35 13 14
40 15 15
50 17 16
55 19 17
60 21 18
70 24 19
80 28 20

Indica que además del ingreso hay otras variables que afectan el gasto de consumo y que el
gasto de consumo de una familia no puede ser totalmente explicado solo por la o las variables
incluidas en el modelo de regresión.

30

25 FRM1

20
FRM2
Ventas

15

10

0
0 10 20 30 40 50 60 70 80 90
Gastos en Publicdad
Estas dos rectas se aproximan a la verdadera regresión poblacional. Ahora en forma análoga a
la función de regresion poblacional, se puede desarrollar el concepto de función de regresión
muestral (FRM) para representar la recta de regresión muestral mediante la siguiente ecuación
matemática:

^ se lee “ Y –gorro” o “Y –sombrero”


Donde Y

Y^i = estimador de E(Y/ X i )


^
β 1 = estimador de β 1
^
β 2 = estimador de β 2

En la forma estocástica la función de regresión muestral se puede expresar de la


manera siguiente:

γ i= β^ 1 + ^β 2 X i

Donde e i denota el término residual (maestral). Conceptualmente es análogo a ui y


puede ser considerado como un estimular de ui .

En síntesis, el objetivo principal, hacer análisis de regresión consiste en estimar la


función de regresión poblacional.
Y i=β 1 + β 2 X i+u i

Con base en la función de regresión muestral.

Y i= β^ 1 + ^β 2 X i+ ei

En la FR
Y M

FR
P
(Y/ E(Y/
A

0 X

figura que se muestra en continuación, Y^ i sobreestima la verdadera E(Y/ X i ) para una


X i dada. De la misma manera, para cualquier X, a la izquierda del punto A, la FRM
subestimara la verdadera FRP. La sobrestimación o subestimación del modelo
poblacional es inevitable debido a las fluctuaciones muestrales. La pregunta critica es
ahora: dado la FRM es apenas una aproximación de la FRP ¿ se puede diseñar una regla
o método que haga que esta aproximación sea lo más ajustada posible?, dicho de otra
manera, ¿Cómo se debe construir la FRM para que ^β 1 y ^β 2 estén tan cerca de los
verdaderos β 1 y β 2 como sea posible aun cuando nunca se llegue a conocer los
verdaderos β 1y β 2?. Estas interrogantes se despejaran más adelante.

2.2.1. Supuestos del modelo de regresión


Los supuestos del modelo junto con los métodos de estimación caracterizan los
resultados obtenidos de la regresión (coeficientes, pruebas de hipótesis, intervalos de
confianza, predicción, etc.). En particular, los supuestos más importantes del modelo
recaen sobre el término del error. Teniendo en cuenta que la función de regresión
poblacional puede expresarse también de la forma Y i=β 1 + β 2 X i+u i, el modelo de
regresión lineal cuenta con los siguientes supuestos:

Supuesto 1: El modelo de regresión lineal en los parámetros: Y i=β 1 + β 2 X i+u i

Supuesto 2: Los valores de X son fijos en muestreo repetitivo. Técnicamente esto


consiste en que X se supone no estocástica.

Supuesto 3: El valor medio de la perturbación ui es igual a cero: E(ui / X i )=0

EJEMPLOS DE EJERCICIOS:
3. La junta de estudiantes de una universidad desea determinar si el precio de
admisión a la sala de juegos del centro estudiantil ejerce algún efecto sobre el número
de estudiantes que utilizan las instalaciones, El precio de admisión y el número de
estudiantes que entran al recinto durante 8 noches de viernes sucesivos se indican en
la tabla. Determinar la ecuación de regresión.
X Y
Número de
Precio ($us) X*Y X²
estradas
1.25 95 118.75 1.56
1.50 83 124.50 2.25
1.75 75 131.25 3.06
2.00 72 144.00 4.00
1.50 69 103.50 2.25
2.00 101 202.00 4.00
2.50 98 245.00 6.25
n=8 1.50 85 127.50 2.25
14.00 678 1196.50 25.63
X = 1.75

Y = 84.75
n ∑ XiYi−∑ Xi ∑ Yi
^B2=
n ∑ 2−¿ ¿
Xi

^B = 8∗1196.50−14∗678 ^B = 8.8496
2 2
8∗25.63−(14)²
^B1=Y - ^B2(X)

^B = 84.75-8.8496*(14) ^B = 39.14
1 1

Yi=−39.14 +(8.8496)* Xi

Anna Sheehan (Gerente de la cadena de supermercados Spendwise) desea pronosticar


las ventas semanales de los libros de bolsillo, para ello se basa en la cantidad de
espacio en las repisas (en m) que se le proporciona. Anna reúne una muestra de 5
semanas:
Libros Espacio en
Semana X*Y X² ¿)² ¿)²
vendidos(Y) repisa (X)  
1 275 6.8 1870.00 46.24 4.67 5715.36
2 142 3.3 468.60 10.89 1.80 3294.76
3 168 4.1 688.80 16.81 0.29 985.96
4 197 4.2 827.40 17.64 0.19 5.76
5 215 4.8 1032.00 23.04 0.03 243.36
n=
5   997 23.2 4886.80 114.62 6.97 10245.20

Determine la ecuación de regresión y los residuales. Además, grafique.

n ∑ XiYi−∑ Xi ∑ Yi
^B =
2 n ∑ 2−¿ ¿
Xi

B 5∗4886.8−23.2∗997
2=¿ ¿
5∗114.62−(23.2)2

B₂= 37.40
^B =Y - ^B (X) B1=¿199.4 ¿-37.40*(23.2)
1 2
B1= -668.17
Y = 199.4
X = 4.64

LOS RESIDUALES:

∑ ei²=∑ ¿¿)²- B2 ² ∑ ¿ ¿)²


∑ ei²=10245.20-(37.40)²∗(6.97)
∑ ei²= 95.84

o 2=
∑ ei ² o 2=
495.84 ²
n−2 5−2

2
o = 81952.44

ERROR:

ee ¿)=√
∑ xi ² * 2
o
n∑ ¿¿¿

114.62
ee ¿)=√ * 81952.44
5∗6.97

ee ¿)= 148624.6002

Supermercados Spendwise
1000
900 1
800
Libros vendidos (Y)

700 2
600
500 3
400
300 4
200
100 5
0
0 3 6 9 12 15 18 21 24
Espacio en repisa (X)
Ejemplo 2.2.
1. El consumo familiar por semana y el ingreso familiar por semana esta expresada en la tabla
siguiente:
Ingreso Consumo
20 50
40 70
60 85
80 90
100 105
120 110
140 130
160 145
180 150
200 180
a) Hallar el modelo de regresión lineal estimada
b) Estimar el consumo para un ingreso de 220 dólares
c) Representar gráficamente la dispersión de datos y la recta de regresión.
Solución.

a) Efectuamos los distintos cálculos para las ecuaciones de la normal .

{ ∑ y i=n β^ 1 + ^β 2 Σ X i ( 1 )
Σ X 1 Y i= β^ 1 Σ X i + β^ 2 Σ X 2i ( 2 ) Xi Yi XiYi Xi^2
20 50 1000 400
40 70 2800 1600
60 85 5100 3600
80 90 7200 6400
100 105 10500 10000
120 110 13200 14400
140 130 18200 9600
160 145 23200 25600

{1115=10 ^β 1+ 1100 β^ 2 ( 1 )(−110 ) 180 150 27000 32400


200 180 36000 40000
144200=1100 ^β i+154000 β^ 2 (2 )
1100 1115 144200 154000
−122650=−1100 β^ 1−121000 ^β 2
144200=1100 ^β1 +154000 ^β 2

21550=33000 β^ 2
^β 2=0,653 ( 3 )

R , ( 3 ) en ( 1 )
^β =39,670
1
^ =39.670+ 0,653 x
El modelo es: Y i i

^ =39,670+ 0,653(220)
b) Y i

Y^ i=183.33 Dólares los gastos en consumo

c) La representación de la gráfica es:

200
180
160 f(x) = 0.653030303030303 x + 39.6666666666667
140
120
CONSUMO

100
80
60
40
20
0
0 20 40 60 80 100 120 140 160 180 200 220

INGRESO

2. La fábrica ABC produce anualmente calculadoras científicas, que se refleja en la tabla


siguiente:

Años Producción
miles de un.
2000 36
2001 39
2002 45
2003 49
2004 55
2005 60
2006 63

a) Hallar el modelo de regresión lineal estimada,


b) Estimar la producción de calculadoras para el año 2010
c) Representar gráficamente la dispersión de datos y la 'recta de regresión
Solución.

a) Para realizar los cálculos, consideramos lo siguiente: Xi = Años, Yi = Producción. A su vez


para representar los años realizamos el arreglo de las unidades del tiempo para calcular los
parámetros a partir de las ecuaciones de la normal siguiente:

∑ yi =n ^β 1+ β^ 2 Σ X i ( 1 )
Σ X 1 Y i = ^β1 Σ X i+ ^β2 Σ X i ( 2 )
2

X Yi XiY Xi^
i i 2
1 36 36 1
2 39 78 4
3 45 135 9
4 49 196 16
5 55 275 25
6 60 360 36
7 63 441 49
28 347 1521 140

347= ^β 1−28 ^β 2 ( 1 ) (−4)


1521=28 ^β 1 +140 ^β2 (2)

−1388=−28 ^β1−112 ^β 2
1521=28 β^ 1 +140 ^β 2

133=28 ^β2
^β =4,75 ( 3 )
2

R , ( 3 ) en ( 1 )
^β 1=30,571

^ =30,571+ 4,75 x
El modelo es: Y i i
^ =30,571+ 4,75(11)
b) Y i

Y^ i=82,821 Mil unidades de calculadoras

c) La representación de la grafica es:

70

60 f(x) = 4.75 x + 30.5714285714286

50

40
AÑOS

30

20

10

0
0 1 2 3 4 5 6 7 8
PRODUCCION

3. Los envíos para el mercado nacional de tractores agrícolas en el periodo 2000-2007 por la
empresa Máquinas y herramientas figuran en la siguiente tabla:

Años Tractores
miles de un.
2000 115
2001 105
2002 100
2003 90
2004 85
2005 70
2006 65
2007 50

a) Hallar el modelo de regresión lineal estimada.


b) Estimar él envió de tractores para el año 2010.
c) Representar gráficamente la dispersión de datos y la recta de regresión.
Solución.

a) Para realizar los cálculos, consideramos lo siguiente: Xi = Años, Yi = Producción. A su vez


para representar los años realizamos el arreglo de las unidades del tiempo para calcular los
parámetros a partir de las ecuaciones de la normal siguiente:

∑ yi =n ^β 1+ β^ 2 Σ X i ( 1 )
Σ X 1 Y i = ^β1 Σ X i+ ^β2 Σ X 2i ( 2 )

Xi Yi Xi Yi Xi2
1 115 115 1
2 105 210 4
3 100 300 9
4 90 360 16
5 85 425 25
6 70 420 36
7 65 455 49
8 50 400 64
36 680 2685 204

680= 8β1 + 36β2 (1) (-4,5)

2685= 36β1 + 204β2 (2)

-3060= -36β1 - 162β2

2685= 36β1 + 204β2

-375= 42β2

β2= -8,9286

R / (3) en (1)

Β1 =125,18

El modelo es: Yi 125,18-8,9286Xi

b) Yi = 125,18-8,9286(11)

Yi =26,96 mil unidades de tractores.


140

120
f(x) = − 8.92857142857143 x + 125.178571428571
100 R² = 0.984768907563025

TRACTORES 80

60

40

20

0
0 1 2 3 4 5 6 7 8 9
AÑO

Otra manera de obtener los estimadores, es aplicando los desvíos de cada una de las variables.

x i=X i −X ⇒ X i =xi + X (3)

y i=Y I −Y ⇒ Y i= y i +Y (4) 

n ∑ X i Y i−∑ X i ∑ Y i
Ambos desvíos sustituimos en : ^β 2=
n ∑ X i ²−( ∑ X i )²

n ∑ ( x i+ X ) ( y i +Y )−∑ ( x i+ X ) ∑ ( y i +Y )
^β =
2 2 2
n ∑ ( x i + X ) −[ ∑ ( x i + X ) ]

n ∑ ( x i y i + x i Y + y i Y + X Y ) −( ∑ x i +n X )( ∑ y i+ n Y )
^β =
2 2
n ∑ ( x i +2 xi X + X )−
2 2
[ (∑ x +n X ) ] i

n ∑ x i y i +n Y ∑ xi + nY ∑ y i +n2 X Y −( ∑ x i+ n X )( ∑ y i +n Y )
^β =
2 2
n ∑ x 2i +2 n X ∑ x i +n 2 X 2 −( ∑ x i+ n X )

n ∑ x i y i +n Y ∑ xi + nY ∑ y i +n X Y −( ∑ x i +n X )( ∑ y i +n Y )
0 0 2 0 0

^β =
2 2
n ∑ xi +2 n X ∑ X i + n X −(∑ xi +n X )
2 0 2 2 0

^β 2= n ∑ x i y i +n X Y − n X n Y
2
( )( )
2
∑ x 2i + n2 X 2−( n X )
^β = n ∑ x i y i +n X Y −n X Y
2 2

2
∑ x 2i + n2 X 2−¿ n2 X 2 ¿
^β 2= n ∑ x i y i +n X Y −n X Y
2 2

∑ x 2i + n2 X 2−¿ n2 X 2 ¿
n∑ xi yi
^β 2=
n ∑ xi
2

^β = ∑ x i y i
2
∑ x 2i

También se escribe como:

^β = ∑
( X i−X )(Y i−Y )
2
∑ ( X i ¿− X)² ¿
^β =Y − ^β X
1 2

Y^ = ^β1 + ^β 2 X 1
Estos estimadores previamente se conoce los estimadores de cuadrados mínimos. Sus
características son.

1) Están expresados únicamente en términos de cantidades observables.

2) son estimadores puntuales, es decir, que dada la muestra, cada estimador proporcionara un
solo valor parámetro poblacional relevante

Una vez obtenidos los estimadores de los cuadrados mínimos a partir de los datos que se
tengan a mano es muy fácil ajustar la línea de regresión muestral.

Este nuevo procedimiento aplicaremos para el último ejemplo para determinar los
parámetros.

Xi Yi xi yi xi yi xi2
1 115 -3,5 30 -105 12,25
2 105 -2,5 20 -50,5 6,25
3 100 -1,5 15 -22,5 2,25
4 90 -0,5 5 -2,5 0,25
5 85 0,5 0 0 0,25
6 70 1,5 -15 -22,5 2,25
7 65 2,5 -20 -50,5 6,25
8 50 3,5 -35 -122,5 12,25
36 680 0 0 -376 42

^β = ∑
xi yi
2
∑ x 2i
^β = −375 =−8,9286
2
42
^β =−8,9286
2
^β =Y − ^β X X =4,5Y =85
1 2

^β =85−(−8,9286)( 4,5)
1

^β =125,18
1

Modelo: Y^i= β^ 1 + ^β 2 X i

Y^i=125,18−8,9286 X i

Como se puede advertir, los resultados son los mismos con este método.

2.4. varianza y errores estándar de los estimadores

Así como existen mediadas de dispersión para las variables también las hay para los
estimadores, en consecuencia, es necesario presentar una medida de precisión de los
estimadores de los parámetros del modelo. Esta medida es el error estándar e indica la
confiabilidad de los estimadores.

La principal utilidad de los errores estándar de los estimadores es la construcción de intervalos


de confianza y la prueba de hipótesis. A continuación se presenta la forma de calcular la
varianza y error estándar de cada estimador del modelo de regresión lineal simple:

var ( ^β 1) =

 
∑ X 2i σ 2
n ∑ ( X i−X )
ee ( ^β 1 )=
√[ ∑ X 2i
n ∑ ( X i− X)
2
] σ

2
σ σ
var ( ^β 2) = ee ( ^β 2 )=
∑ ( X i−X )
2
√∑ ( X −X )
i
2

Donde var=¿ varianza; ee=¿ error estándar y σ 2 es la constante o variaza homoscedastica


de ui es:

σ =σ^ =
2 2 ∑ ei
2

n−2

Donde σ^2 es el estimador de cuadrados mínimos ordinarios del parámetro σ 2 verdadero


pero desconocido, donde n−2 se conoce con el nombre de numero de grados de libertad (g
de I) y donde ∑ ei es la suma de los residuos al cuadrado.
2

Una vez que se conoce la SRC, σ 2 puede calcularse fácilmente. A su vez SRC es :

 
∑ e2i =∑ y 2i − ^β 22 ∑ x 2i
El termino número de grados de libertad es igual al número total de observaciones en la
muestra menos el número de restricciones (lineales) impuesto en ellas.

Por ejemplo, antes de que la suma de los residuos al cuadrado pueda ser calculada, B^1 y B^2
deben computarse. Estos dos estimados ponen por lo tanto dos restricciones sobre la SRC; así
entonces, hay n-2 y no n observaciones independientes para calcular la SRC.

Siguiendo esta lógica en una regresión con tres variables, la SRC tendrá n-3 g de l, y para el
modelo con k variables, se tendrán n-k g de l.

La regla general es g de l igual numero de observaciones menos número de parámetros


estimados: g de l = n-k.

Ejemplo:
INGRESO CONSUMO
El consumo familiar por semana 20 60 y el ingreso familiar por semana
en un país “X” expresada en 40 70 miles de dólares se presenta en
la tabla siguiente: 60 80
80 90
100 115
120 120
140 130
160 160
180 170
200 190

a) Hallar el modelo de regresión lineal estimada


b) Hallar los errores estándar de los estimadores
c) Representar gráficamente la dispersión de datos y la recta de regresión

Solución.

a) Efectuamos los distintos cálculos en la tabla para determinar los coeficientes de


regresión, los errores estándar de cada parámetro.

Xi Yi Xi Yi Xi² (Xi - )² (Yi - )²


20 60 1200 400 8100 3422,25
40 70 2800 1600 4900 2352,25
60 80 4800 3600 2500 1482,25
80 90 7200 6400 900 812,25
100 115 11500 10000 100 12,25
120 120 14400 14400 100 2,25
140 130 18200 19600 900 132,25
160 160 25600 25600 2500 1722,25
180 170 30600 32400 4900 2652,25
200 190 38000 40000 8100 5112,25
1100 1185 154300 154000 33000 17702,50

2 n ∑ XiYi−∑ Xi ∑ Yi
B= 2
n ∑ Xi −(∑ Xi)²
B^2=10(154300)-1100(1185) =239500

10(154000) -(1100) ² 330000

B^2=0,7258

B^1=-B^2 

=1185=118,5 =1100 =110

10 10

B^1=118,5-0,7258(110)

B^1=38,662

El modelo es: Y^1=38,662+0,7258X1


b) Determinamos los errores estándar
ó²=∑ei²

n-2
∑ei²=∑yi²-B^²∑xi², pero también la SRC es:

∑ei²=∑(Yi-) ²-B^²∑(Xi-) ²

∑ ei²=17702,50-0,7258(33000)
∑ ei²=318,5739
o²=318,5739
10-2
o²=39,8217
var(B^1) =∑Xi² o²
n∑(Xi-) ²
var(B^1) =154000 (39,8217) =18,5835
10(33000)
Var(B^1) =18,5835

ee(B^1) = ∑Xi² O
n∑(Xi-) ²

ee(B^1) =√15400 (6,3104) =4,3109

10(33000)

ee(B^1) =4,3109

Otra manera de calcular el error estándar es:


ee(B^1) =√var(B^1)

ee(B^1) =√18,5835

ee(B^1) =4,3109

var(B^2) = o²

∑(Xi-) ²

var(B^2) = 39,8217 =0,0012067


33000
var(B^2) =0,0012067
ee(B^2) =√var(B^2)
ee(B^2) =0,03474

2.5. Intervalos de confianza


En estadística es común efectuar inferencias basadas en estimaciones puntuales y en
intervalos. Estas ultimas son menos riesgosas debido a que se encuentren dentro de
un rango con cierto margen de confiabilidad. En particular, pueden construirse
intervalos de confianza para los parámetros del modelo de regresión, así como para las
predicciones.
Un intervalo de confianza para el parámetro B2 puede obtenerse de la forma
siguiente:
t =B^2-B2

ee(B^2)

El proceso de obtener es:


P⊏-tα/2≤t≤t α/2]=1- α

P⊏tα/2≤ B^2-B2≤t α/2]=1- α


ee(B^2)
P [-t α/2ee(B^2) ≤B^2-B2≤t α/2ee(B^2)]=1- α
P [-B^2-t α/2ee(B^2) ≤B^2-B2-B^2≤- B^2+ t α/2ee(B^2)]=1- α
P [-B^2-t α/2ee(B^2) ≤B2≤- B^2+ t α/2ee(B^2)]= 1- α multip. por (-1)
P [-B^2+ t α/2ee(B^2) ≥B2≥ B^2-t α/2ee(B^2)]= 1- α Reordenando
P [B^2- t α/2ee(B^2) ≤B2≤- B^2+ t α/2ee(B^2)]= 1- α
Donde α (0< α<1) es el nivel de significancia y ee(B^2) es el error estándar de B2 100(1- α) es
el nivel porcentual de confianza del intervalo. Una versión abreviada de esta expresión es:
B^2±t α/2ee(B^2)

Análogamente se obtiene para B1:


P [B^1- t α/2ee(B^1) ≤B1≤- B^1+ t α/2ee(B^1)]= 1- α
Si por ejemplo α es 0,05 la interpretación del intervalo de confianza para B2 es: dado
un nivel de confianza del 95% (en 95 de cada 100 casos) en el largo plazo, el intervalo
[B^2- t α/2ee(B^2), B^2+ t α/2ee(B^2)] contendrá el verdadero valor de B2.
Los supuestos del modelo junto con los métodos de estimación caracterizan los resultados
obtenidos de la regresión (coeficientes, pruebas de hipótesis, intervalos de confianza,
predicción, etc.). En particular, los supuestos más importantes del modelo recaen sobre el
término del error. Teniendo en cuenta que la función de regresión poblacional puede
expresarse también de la forma Y = B,+B,X, +, el modelo de regresión lineal cuenta con los
siguientes

Supuesto 1: El modelo de regresión es lineal en los parámetros: Y = B₁ + B₂ X₁ + u i

Supuesto 2: Los valores de X son fijos en muestreo repetitivo. Técnicamente esto consiste en
que X se supone no estocástica

Supuesto 3: El valor medio de la perturbación u, es igual a cero: E(u , IX)=0

Por lo tanto los factores que no están incluidos en el modelo y que por consiguiente, están
incorporados en ui, no afectan sistemáticamente el valor de la media de Y.

Supuesto 4: Homoscedasticidad2 o igual varianza de ui. Dado el valor de Xi la varianza de ui es la


misma para todas las observaciones. Esto es, las varianzas condicionales de u i son idénticas.

var(ui/Xi)=E{(ui-E(ui))/Xi}

var(ui/ Xi)= E[ui2 /Xi]

var(ui / Xi)=๙ 2

Donde var significa varianza.

La anterior ecuación, establece que la varianza de u i para cada Xi es algún número positivo
constante igual a d'. Este supuesto implica que las varianzas condicionales de Y i también son
homoscedásticas. Esto es:

var(Yi / Xi)=o2

En contraste, si la varianza condicional de la población Y varia con X,esta situación se conoce


como Heteroscedasticidad", lo cual puede escribirse como:
var(ui / Xi)=oi2

Obsérvese el subíndice sobre c` en esta expresión indica que la variaanza de la población


Yahora no es constante.

Supuesto 5: No existe autocorrelación entre las perturbaciones. Dados dos valores cualquiera
de Xi, por ejemplo Xi y XJ (i= j), la correlación entre ui y uJ cualquiera (i = j) es cero.

cov(ui‚uj | Xi‚Xj) = E {[ui − E(ui)]/ Xi} {[uj− E(uj)] / Xj}

cov(ui ‚ui/ Xi ‚Xj) = E[ui / Xi][uj/ Xj]

cov(ui ‚uj/ Xi, Xj) = 0

donde i y j son dos observaciones diferentes y donde cor significa covarianza.

Este es también llamado supuesto de no correlación serial. Supóngase que en la función de


regresión poblacional Yt =B1 + B₂Xi +ut , ut y ut-1 y están correlacionados
positivamente. Entonces Yt depende no solamente de Xt sino también de ,,, puesto que
determina en cierta medida a Ut.

Supuesto 6: La covarianza entre ui y Xi es cero, o E[ui, Xi]=0.

cov(ui, Xi) = E[ui – E(ui)][Xi – E(Xi)]

cov(ui , Xi) = E[ui (Xi - E(Xi))], E(ui) = 0

cov(ui ,Xi)= E[ui Xi]- E(Xi)E(ui) E(Xi) no estocástica

cov(ui ,Xi)= E[ui Xi] E(ui) = 0

cov(ui ,Xi)=0

Supuesto7: El número de observaciones n debe ser mayor que el número de parámetros por
estimar.

Supuesto 8: Variabilidad en los valores de X. Se requiere que no todos los valores de Xen una
muestra dada sean iguales. Así la var(X) es un número finito positivo.

Supuesto 9: El modelo de regresión esta correctamente especificado. La omisión de variables


importantes del modelo o la selección de una forma funcional equivocada afectan la validez de
la interpretación de la regresión estimada.
Supuesto 10: No hay correlación lineal perfecta entre variables explicativas.

Cuando el modelo de regresión cumple con los anteriores supuestos se le conoce como
modelo de regresión clásico y tiene las siguientes propiedades: los estimadores son MELI
(Mejores Estimadores Lineales Insesgados). Si se agrega el supuesto de normalidad de los
errores, los estimadores son MEI(Mejores Estimadores Insesgados) y por lo tanto seguirán
distribución normal. Con ello, los intervalos de confianza,las predicciones y las pruebas de
hipótesis tienen validez estadística.

2.3. Método de estimación de mínimos cuadrados ordinarios

El objetivo principal de la etapa de estimación es encontrar los valores de los parámetros


muestrales. El método de estimación más popular recibe el nombre de minimos cuadrados
ordinarios (MCO). El criterio de este método consiste en proporcionar estimadores de los
parámetros que minimicen la suma de los cuadrados de los errores. Operativamente el
proceso es construir una función objetivo en términos de la suma de los cuadrados de los
errores y mediante optimización (condiciones de primer orden - C.P.O., y condiciones de
segundo orden - C.S.O.) obtener las fórmulas de cálculo de los estimadores

Debido a que la función de regresión poblacional no se puede observar directamente, los


estimadores de mínimos cuadrados ordinarios se obtienen a partir de la función de regresión
muestral (FRM). La FRM es:

Yi =B1+B2Xi+ei

Yi=Yi+ei

La suma del cuadrado de los errores puede expresarse como sigue:

ei=Yi-Yi

Σei2 =Σ (Yi -Yi)2

De acuerdo con el principio de mínimos cuadrados ordinarios:

Σe i2=Σ (Y i -B 1-B 2x i) 2, hacemos minimo la suma de los residuos:

Derivando la anterior expresión con respecto a β 1 y B 2 e igualando a cero, respectivamente, y


resolviendo las ecuaciones normales, se encuentran los estimadores de los parámetros de la
regresión:

oΣe i2 =2Σ(Yi-B 1-B 2X i)(-1)=0 Dividiendo a ambos miembros por -2


oβ 1

Σ(Y i-B 1-B 2x i)=0

ΣY i =nβ 1+B 2Σx i (1)

oΣe i2 =2Σ(Yi-B 1-B 2X i)(-X i)=0 Dividiendo a ambos miembros por -2


oβ 2

Σ(Xi Yi - B 1X i - B 2X i )=0

ΣXi Yi = B 1 ΣX i - B 2 ΣX i2

En resumen las ecuaciones normales son:


ΣYi=nB₁ + B₂ΣXi

Otra forma de obtener los parámetros es:

ΣY=nB1 +B₂ΣXi Despejando B

Ηβ1 - ΣΥi –β2ΣΧi Dividiendo a ambos miembros por n

βi =(ΣΥi /n) –(β2 ΣΧ/n)

B₁ =Y-B₂X

ΣYi = nB₁ + B₂ΣXi (1) – ΣΧi

Σxiyi = β1 Σxi + β2 Xi2 (2)n

-ΣΧiΣΥi =- nB1ΣΧi-β2(ΣXi)2

nΣΥiΣXi =nβ ΣΧi-nβ2(ΣΧi2


d) graficamos el modelo de regresión lineal

TC PIB (%)
6

4
TC PIB

0
1992 1994 1996 1998 2000 2002 2004 2006 2008
AÑOS
2 808317,92
r=
820769,64
2
r =0,98483
r = 0,99238
el coeficiente de correlacion entre ambas variables es 0,99238 y es muy alta.

*Eemplear la formula: r =nΣ x 1 y 1−(∑ x 1 )¿ ¿ para calcular el coeficiente de correlacion.

c) Graficando la dispercion de datos y la linea estimada.

1400

1200

1000

800
IMPUESTOS

600

400

200

0
2000 3000 4000 5000 6000 7000 8000 9000 10000 11000 12000
PRODUCTO INTERNO BRUTO

2.10. Predicción
Una aplicación del, modelo de regresión es la predicción o el pronóstico de la variable
dependiente, de acuerdo con valores datos de las variables independientes. Hay dos
tipos de predicciones: la predicción media y la predicción individual. A continuación, se
Presentan estos dos casos:
▪Predicción media: es la predicción al valor medio condicional de Y, correspondiente a
un determinado valor de x , denotado como y 0, el cual representa un punto sobre la
línea de regresión poblacional.

Si desea predecir E ( y ¿ x0 ) , la estimación puntual de la predicción media

[ ]
2
2 1 ( x0 −x )
es ^y 0= ^β1 + ^β 2 x 0 y la varianza de ^y 0 : var ( ^y 0 )= σ +
2 ∑ ( x 1−x )2

▪Predicción individual: es la predicción de un valor individual de Y, correspondiente a


un determinado valor de X. Si se desea predecir y 0 ∕ x 0, de igual forma que en la
predicción media, la estimación puntual es ^y 0= ^β1 + ^β 2 x 0 sin embargo, la manera de

[ ]
2
1 ( x 0−x )
2
calcular la varianza de y 0 es: var ( ^y 0 )= σ 1+ +
n ∑ ( x 1−x )2

Ejemplo 2 - 8.
1. el ingreso nacional Bruto (I.N.B.) de un país desde el año 2000 al año 2008 se refleja
en cuadro siguiente:

AÑO I.N.B.
2000 3
2001 5
2002 3
2003 8
2004 6
2005 10
2006 8
2007 12
2008 14

a) Encontrar la ecuación de tendencia y la proyección del Ingreso Nacional Bruto


para los próximos cinco años.
b) Grafique la dispersión de datos, la línea estimada y el coeficiente de
determinación y correlación.

Solución
a) Realizamos los siguientes cálculos en la tabla siguiente
n ∑ t i ∈B i−∑t i ∑ N B i
^β =
2 2 2
n ∑t i −( ∑t i)

^β 2= 9 ( 422 )−45(69) = 693


9 ( 285 )−( 45 )
2
540
^β = 1,28333
2

^β = INB− ^β t
2 2

69 45
INB= =7,67 t= =5
9 9
^β 1=7,67−(1,28333)(5)

^β =1,25333
1

^ B=1,25333+1,28333 t
El modelo es: I N i

^ B = 1,25333+1,28333(10) =14,087
IN 2009

^ B =1,25333+1,28333(11) =15,370
IN 2010

^ B =1,25333+1,28333(12) =16,653
IN 2011

^ B2012=1,25333+1,28333(13) =17,937
IN

b) Graficando la dispersión de datos, la línea estimada y el coeficiente de


determinación y correlación.
16

14

12 f(x) = 1.28333333333333 x − 2564.13333333333


R² = 0.837429378531073
10

8
INB

0
1999 2000 2001 2002 2003 2004 2005 2006 2007 2008 2009
AÑOS

∑(I ^
2
2 N Bi−INB )
r= 2
∑ ( ¿ B i−INB )

2 98,816
r= =0,8374
118
2
r =¿0,8374
El 83,74% del Ingreso Nacional Bruto se explica por los años.

r =√ 0,8374
r =0,9151
Existe una alta correlación entre ambas variables.

También podría gustarte