Modelo de Regresión Lineal en Econometría
Modelo de Regresión Lineal en Econometría
REGRESION LINEAL
Estudiantes:
1. Alvarez Espinoza Jose Luis
2. Cardenas Pereira Karen
3. Choque Perez Josue
4. Jorge Lopez Deymar
5. Gonzales Loza Edson
6. Montecinos Rebozo Luz Gabriela
7. Perez Mayta Jose David
8. Rosales Condori Alberto
9. Vasquez Padilla Talia Ana
[Link] Enriquez Jose Luis
Docente: Lic. Evert A. Feraudy Alandia.
Asignatura: Econometría
Semestre: Quinto
Fecha: 23 / 06 / 2022
INFORME
Entrega de partes:
1) Alvarez Espinoza Jose Luis (teoría y práctica)
2) Cardenas Pereira Karen (teoría y práctica)
3) Choque Perez Josue (teoría y práctica)
4) Jorge Lopez Deymar (teoría y práctica)
5) Gonzales Loza Edson (no hizo nada)
6) Montecinos Rebozo Luz Gabriela (teoría y práctica)
7) Perez Mayta Jose David (teoría y practica)
8) Rosales Condori Alberto (teoría y práctica)
9) Vasquez Padilla Talia Ana (teoría y práctica)
10) Zurita Enriquez Jose Luis (práctica)
CAPITULO 2
2.1 INTRODUCCION
El termino regresión fue introducido por Francis Galton en su libro "Natural Inheritance"
(1889); partiendo de los análisis estadísticos de Karl Pearson. Su trabajo se centró en la
descripción de los rasgos físicos de los descendientes (variable A). A partir de los de sus padres
(variable B) Estudiando la altura de padres e hijos a partir de más de mil registros de grupos
familiares, llego a la conclusión de que los padres muy altos tenían tendencia a tener hijos que
heredaban parte de esa altura y los padres de baja estatura, tenían la tendencia a tener hijos
de baja estatura, pero que en ambos casos relevaban una tendencia a "regresar" a la estatura
media de la población.
La ley de la regresión lineal de Galton fue confirmada por Karl Pearson y generalizo esta
tendencia de: "Cada particularidad en un hombre es compartida por sus descendientes, pero
en media, en un grado menor". En palabras de Galton, se trataba de una regresión a la
mediocridad.
Ejemplo 2.1
D= f (p)
X Y
Precio Cantidad
10 200
12 160
15 150
18 120
20 100
25 80
30 30
Grafica de Dispersion
250
200
Precio de Venta
150
100
50
0
5 10 15 20 25 30 35
Cantidad
2. El propietario de una compañía desea saber la forma como se relaciona las ventas del
producto de su compañía con el gasto de publicidad. Un estudio de este tipo será de gran
ayuda para averiguar la variación de las ventas en proporción a los gastos de publicidad, es
decir, el cambio porcentual en las ventas en respuesta a un cambio de uno por cierto (1%) en
el gasto de publicidad. Esta referencia puede ser útil para determinar el presupuesto óptimo
de publicidad para la siguiente gestión.
Ventas= f (Publicidad)
Y= f(X)
Publicidad Ventas
10 9
20 11
30 13
35 12
40 15
50 16
55 18
60 21
70 24
80 28
Modelo de Regresion Lineal
30
28
25 24
20 21
18
16
Ventas
15 15
13 12
10 11
9
5
0
0 10 20 30 40 50 60 70 80 90
Publicidad
Consumo= f (Ingreso)
Y= f (X)
De este ejemplo podemos indicar que para un ingreso de 20 dólares existen 5 familias cuyos
gastos de consumo semanales oscilan entre 50 a 90 dólares. También se puede obtener la
media condicional que es igual al valor esperado de C dado Y.
12
Series1
10
Series2
8 Series3
Series4
CONSUMO
12
6
Series1
Series5
10
4 Series2
Series6
8 Series3
Series7
2
CONSUMO
Series4
Series8
6
0
Series5
0 2 4 6 8 10 12
4
INGRESO Series6
2 Series7
Series8
0
0 2 4 6 8 10 12 Linear
(Series8)
INGRESO
A su vez graficamos una línea de dispersión, que es el lugar geométrico de las medias
condicionales o expectativas de la variable dependiente para los valores fijos de las variables
explicativas. En consecuencia, para cada X, existen ciertos valores poblacionales de Y y una
media condicional correspondiente que se refleja a continuación en la figura y además se
muestra la línea o curva de regresión que atraviesa estas medias condicionales.
La línea de regresión E(Y/X)= B1+B2X1, es la unión de los puntos que representan los valores
esperados de variable independiente Y dado los valores de las variables independientes X's.
Esta línea se puede construir a partir del diagrama de dispersión conformado por los datos
poblacionales; en este caso la línea de regresión se conoce.
100 C3
80 C4
C5
60
C6
40 C7
20
0
0 20 40 60 80 100 120 140 160 180 200 220
Ingreso
La función de regresión poblacional E(Y/X i) es una función lineal de Xi, es decir, E(Y/Xi)=ƒ(Xi),
cuya expresión es del siguiente tipo E(Y/Xi)=ß1+ß₂Xi, donde ß1 y ß₂ son parámetros
desconocidos pero fijos, que se conoce con el nombre de coeficientes de regresión, el primero
es el intercepto y el segundo es la pendiente. De otro lado, el modelo de regresión, conocido
como ecuación de regresión (sinónimos) se la expresa de la manera siguiente:
Yi=ß1+ß₂Xi
De la figura anterior, se observa que para un nivel de ingreso dado Xi, el gasto de consumo de
una familia está concentrado alrededor del consumo promedio de todas las familias para ese
mismo Xi, esto es, alrededor de su media condicional. Por consiguiente, se puede expresar la
desviación de un Yi individual alrededor de su valor esperado de la forma siguiente.
ui=Yi–E(Y/Xi)
Donde ui es una variable aleatoria, no observable, que puede tomar valores positivos o
negativos. Técnicamente se conoce como la perturbación estocástica o término del error
estadístico; también se considera como una variable sustitutiva de todas las variables omitidas
que pueden afectar a la variable dependiente Y, pero que por una u otra razón no pueden
incluirse en el modelo de regresión.
Yi=E(Y/Xi)+ui
E(Y/Xi)=E[E(Y/Xi)]+E(u/Xi)
E(u/Xi)=0
El supuesto de que la línea de regresión pase por las medias condicionales de Y, implica que los
valores medios condicionales de ui son iguales a cero.
Cuando la línea de regresión es construida con los datos muestrales recibe el nombre de
función de regresión muestral (FRM). Como todo procedimiento de inferencia estadística, lo
que se pretende es que la muestra sea una buena representación de la población.
En la tabla se presenta dos variables, publicidad y ventas como muestra de una población, que
permita obtener dos líneas de regresión muestral para las ventas semanales versus los gastos
en publicidad.
Indica que además del ingreso hay otras variables que afectan el gasto de consumo y que el
gasto de consumo de una familia no puede ser totalmente explicado solo por la o las variables
incluidas en el modelo de regresión.
30
25 FRM1
20
FRM2
Ventas
15
10
0
0 10 20 30 40 50 60 70 80 90
Gastos en Publicdad
Estas dos rectas se aproximan a la verdadera regresión poblacional. Ahora en forma análoga a
la función de regresion poblacional, se puede desarrollar el concepto de función de regresión
muestral (FRM) para representar la recta de regresión muestral mediante la siguiente ecuación
matemática:
γ i= β^ 1 + ^β 2 X i
Y i= β^ 1 + ^β 2 X i+ ei
En la FR
Y M
FR
P
(Y/ E(Y/
A
0 X
EJEMPLOS DE EJERCICIOS:
3. La junta de estudiantes de una universidad desea determinar si el precio de
admisión a la sala de juegos del centro estudiantil ejerce algún efecto sobre el número
de estudiantes que utilizan las instalaciones, El precio de admisión y el número de
estudiantes que entran al recinto durante 8 noches de viernes sucesivos se indican en
la tabla. Determinar la ecuación de regresión.
X Y
Número de
Precio ($us) X*Y X²
estradas
1.25 95 118.75 1.56
1.50 83 124.50 2.25
1.75 75 131.25 3.06
2.00 72 144.00 4.00
1.50 69 103.50 2.25
2.00 101 202.00 4.00
2.50 98 245.00 6.25
n=8 1.50 85 127.50 2.25
14.00 678 1196.50 25.63
X = 1.75
Y = 84.75
n ∑ XiYi−∑ Xi ∑ Yi
^B2=
n ∑ 2−¿ ¿
Xi
^B = 8∗1196.50−14∗678 ^B = 8.8496
2 2
8∗25.63−(14)²
^B1=Y - ^B2(X)
^B = 84.75-8.8496*(14) ^B = 39.14
1 1
Yi=−39.14 +(8.8496)* Xi
n ∑ XiYi−∑ Xi ∑ Yi
^B =
2 n ∑ 2−¿ ¿
Xi
B 5∗4886.8−23.2∗997
2=¿ ¿
5∗114.62−(23.2)2
B₂= 37.40
^B =Y - ^B (X) B1=¿199.4 ¿-37.40*(23.2)
1 2
B1= -668.17
Y = 199.4
X = 4.64
LOS RESIDUALES:
o 2=
∑ ei ² o 2=
495.84 ²
n−2 5−2
2
o = 81952.44
ERROR:
ee ¿)=√
∑ xi ² * 2
o
n∑ ¿¿¿
114.62
ee ¿)=√ * 81952.44
5∗6.97
ee ¿)= 148624.6002
Supermercados Spendwise
1000
900 1
800
Libros vendidos (Y)
700 2
600
500 3
400
300 4
200
100 5
0
0 3 6 9 12 15 18 21 24
Espacio en repisa (X)
Ejemplo 2.2.
1. El consumo familiar por semana y el ingreso familiar por semana esta expresada en la tabla
siguiente:
Ingreso Consumo
20 50
40 70
60 85
80 90
100 105
120 110
140 130
160 145
180 150
200 180
a) Hallar el modelo de regresión lineal estimada
b) Estimar el consumo para un ingreso de 220 dólares
c) Representar gráficamente la dispersión de datos y la recta de regresión.
Solución.
{ ∑ y i=n β^ 1 + ^β 2 Σ X i ( 1 )
Σ X 1 Y i= β^ 1 Σ X i + β^ 2 Σ X 2i ( 2 ) Xi Yi XiYi Xi^2
20 50 1000 400
40 70 2800 1600
60 85 5100 3600
80 90 7200 6400
100 105 10500 10000
120 110 13200 14400
140 130 18200 9600
160 145 23200 25600
21550=33000 β^ 2
^β 2=0,653 ( 3 )
R , ( 3 ) en ( 1 )
^β =39,670
1
^ =39.670+ 0,653 x
El modelo es: Y i i
^ =39,670+ 0,653(220)
b) Y i
200
180
160 f(x) = 0.653030303030303 x + 39.6666666666667
140
120
CONSUMO
100
80
60
40
20
0
0 20 40 60 80 100 120 140 160 180 200 220
INGRESO
Años Producción
miles de un.
2000 36
2001 39
2002 45
2003 49
2004 55
2005 60
2006 63
∑ yi =n ^β 1+ β^ 2 Σ X i ( 1 )
Σ X 1 Y i = ^β1 Σ X i+ ^β2 Σ X i ( 2 )
2
X Yi XiY Xi^
i i 2
1 36 36 1
2 39 78 4
3 45 135 9
4 49 196 16
5 55 275 25
6 60 360 36
7 63 441 49
28 347 1521 140
−1388=−28 ^β1−112 ^β 2
1521=28 β^ 1 +140 ^β 2
133=28 ^β2
^β =4,75 ( 3 )
2
R , ( 3 ) en ( 1 )
^β 1=30,571
^ =30,571+ 4,75 x
El modelo es: Y i i
^ =30,571+ 4,75(11)
b) Y i
70
50
40
AÑOS
30
20
10
0
0 1 2 3 4 5 6 7 8
PRODUCCION
3. Los envíos para el mercado nacional de tractores agrícolas en el periodo 2000-2007 por la
empresa Máquinas y herramientas figuran en la siguiente tabla:
Años Tractores
miles de un.
2000 115
2001 105
2002 100
2003 90
2004 85
2005 70
2006 65
2007 50
∑ yi =n ^β 1+ β^ 2 Σ X i ( 1 )
Σ X 1 Y i = ^β1 Σ X i+ ^β2 Σ X 2i ( 2 )
Xi Yi Xi Yi Xi2
1 115 115 1
2 105 210 4
3 100 300 9
4 90 360 16
5 85 425 25
6 70 420 36
7 65 455 49
8 50 400 64
36 680 2685 204
-375= 42β2
β2= -8,9286
R / (3) en (1)
Β1 =125,18
b) Yi = 125,18-8,9286(11)
120
f(x) = − 8.92857142857143 x + 125.178571428571
100 R² = 0.984768907563025
TRACTORES 80
60
40
20
0
0 1 2 3 4 5 6 7 8 9
AÑO
Otra manera de obtener los estimadores, es aplicando los desvíos de cada una de las variables.
y i=Y I −Y ⇒ Y i= y i +Y (4)
n ∑ X i Y i−∑ X i ∑ Y i
Ambos desvíos sustituimos en : ^β 2=
n ∑ X i ²−( ∑ X i )²
n ∑ ( x i+ X ) ( y i +Y )−∑ ( x i+ X ) ∑ ( y i +Y )
^β =
2 2 2
n ∑ ( x i + X ) −[ ∑ ( x i + X ) ]
n ∑ ( x i y i + x i Y + y i Y + X Y ) −( ∑ x i +n X )( ∑ y i+ n Y )
^β =
2 2
n ∑ ( x i +2 xi X + X )−
2 2
[ (∑ x +n X ) ] i
n ∑ x i y i +n Y ∑ xi + nY ∑ y i +n2 X Y −( ∑ x i+ n X )( ∑ y i +n Y )
^β =
2 2
n ∑ x 2i +2 n X ∑ x i +n 2 X 2 −( ∑ x i+ n X )
n ∑ x i y i +n Y ∑ xi + nY ∑ y i +n X Y −( ∑ x i +n X )( ∑ y i +n Y )
0 0 2 0 0
^β =
2 2
n ∑ xi +2 n X ∑ X i + n X −(∑ xi +n X )
2 0 2 2 0
^β 2= n ∑ x i y i +n X Y − n X n Y
2
( )( )
2
∑ x 2i + n2 X 2−( n X )
^β = n ∑ x i y i +n X Y −n X Y
2 2
2
∑ x 2i + n2 X 2−¿ n2 X 2 ¿
^β 2= n ∑ x i y i +n X Y −n X Y
2 2
∑ x 2i + n2 X 2−¿ n2 X 2 ¿
n∑ xi yi
^β 2=
n ∑ xi
2
^β = ∑ x i y i
2
∑ x 2i
^β = ∑
( X i−X )(Y i−Y )
2
∑ ( X i ¿− X)² ¿
^β =Y − ^β X
1 2
Y^ = ^β1 + ^β 2 X 1
Estos estimadores previamente se conoce los estimadores de cuadrados mínimos. Sus
características son.
2) son estimadores puntuales, es decir, que dada la muestra, cada estimador proporcionara un
solo valor parámetro poblacional relevante
Una vez obtenidos los estimadores de los cuadrados mínimos a partir de los datos que se
tengan a mano es muy fácil ajustar la línea de regresión muestral.
Este nuevo procedimiento aplicaremos para el último ejemplo para determinar los
parámetros.
Xi Yi xi yi xi yi xi2
1 115 -3,5 30 -105 12,25
2 105 -2,5 20 -50,5 6,25
3 100 -1,5 15 -22,5 2,25
4 90 -0,5 5 -2,5 0,25
5 85 0,5 0 0 0,25
6 70 1,5 -15 -22,5 2,25
7 65 2,5 -20 -50,5 6,25
8 50 3,5 -35 -122,5 12,25
36 680 0 0 -376 42
^β = ∑
xi yi
2
∑ x 2i
^β = −375 =−8,9286
2
42
^β =−8,9286
2
^β =Y − ^β X X =4,5Y =85
1 2
^β =85−(−8,9286)( 4,5)
1
^β =125,18
1
Modelo: Y^i= β^ 1 + ^β 2 X i
Y^i=125,18−8,9286 X i
Como se puede advertir, los resultados son los mismos con este método.
Así como existen mediadas de dispersión para las variables también las hay para los
estimadores, en consecuencia, es necesario presentar una medida de precisión de los
estimadores de los parámetros del modelo. Esta medida es el error estándar e indica la
confiabilidad de los estimadores.
var ( ^β 1) =
∑ X 2i σ 2
n ∑ ( X i−X )
ee ( ^β 1 )=
√[ ∑ X 2i
n ∑ ( X i− X)
2
] σ
2
σ σ
var ( ^β 2) = ee ( ^β 2 )=
∑ ( X i−X )
2
√∑ ( X −X )
i
2
σ =σ^ =
2 2 ∑ ei
2
n−2
Una vez que se conoce la SRC, σ 2 puede calcularse fácilmente. A su vez SRC es :
∑ e2i =∑ y 2i − ^β 22 ∑ x 2i
El termino número de grados de libertad es igual al número total de observaciones en la
muestra menos el número de restricciones (lineales) impuesto en ellas.
Por ejemplo, antes de que la suma de los residuos al cuadrado pueda ser calculada, B^1 y B^2
deben computarse. Estos dos estimados ponen por lo tanto dos restricciones sobre la SRC; así
entonces, hay n-2 y no n observaciones independientes para calcular la SRC.
Siguiendo esta lógica en una regresión con tres variables, la SRC tendrá n-3 g de l, y para el
modelo con k variables, se tendrán n-k g de l.
Ejemplo:
INGRESO CONSUMO
El consumo familiar por semana 20 60 y el ingreso familiar por semana
en un país “X” expresada en 40 70 miles de dólares se presenta en
la tabla siguiente: 60 80
80 90
100 115
120 120
140 130
160 160
180 170
200 190
Solución.
2 n ∑ XiYi−∑ Xi ∑ Yi
B= 2
n ∑ Xi −(∑ Xi)²
B^2=10(154300)-1100(1185) =239500
B^2=0,7258
B^1=-B^2
10 10
B^1=118,5-0,7258(110)
B^1=38,662
n-2
∑ei²=∑yi²-B^²∑xi², pero también la SRC es:
∑ei²=∑(Yi-) ²-B^²∑(Xi-) ²
∑ ei²=17702,50-0,7258(33000)
∑ ei²=318,5739
o²=318,5739
10-2
o²=39,8217
var(B^1) =∑Xi² o²
n∑(Xi-) ²
var(B^1) =154000 (39,8217) =18,5835
10(33000)
Var(B^1) =18,5835
ee(B^1) = ∑Xi² O
n∑(Xi-) ²
10(33000)
ee(B^1) =4,3109
ee(B^1) =√18,5835
ee(B^1) =4,3109
var(B^2) = o²
∑(Xi-) ²
ee(B^2)
Supuesto 2: Los valores de X son fijos en muestreo repetitivo. Técnicamente esto consiste en
que X se supone no estocástica
Por lo tanto los factores que no están incluidos en el modelo y que por consiguiente, están
incorporados en ui, no afectan sistemáticamente el valor de la media de Y.
var(ui/Xi)=E{(ui-E(ui))/Xi}
var(ui / Xi)=๙ 2
La anterior ecuación, establece que la varianza de u i para cada Xi es algún número positivo
constante igual a d'. Este supuesto implica que las varianzas condicionales de Y i también son
homoscedásticas. Esto es:
var(Yi / Xi)=o2
Supuesto 5: No existe autocorrelación entre las perturbaciones. Dados dos valores cualquiera
de Xi, por ejemplo Xi y XJ (i= j), la correlación entre ui y uJ cualquiera (i = j) es cero.
cov(ui ,Xi)=0
Supuesto7: El número de observaciones n debe ser mayor que el número de parámetros por
estimar.
Supuesto 8: Variabilidad en los valores de X. Se requiere que no todos los valores de Xen una
muestra dada sean iguales. Así la var(X) es un número finito positivo.
Cuando el modelo de regresión cumple con los anteriores supuestos se le conoce como
modelo de regresión clásico y tiene las siguientes propiedades: los estimadores son MELI
(Mejores Estimadores Lineales Insesgados). Si se agrega el supuesto de normalidad de los
errores, los estimadores son MEI(Mejores Estimadores Insesgados) y por lo tanto seguirán
distribución normal. Con ello, los intervalos de confianza,las predicciones y las pruebas de
hipótesis tienen validez estadística.
Yi =B1+B2Xi+ei
Yi=Yi+ei
ei=Yi-Yi
Σ(Xi Yi - B 1X i - B 2X i )=0
ΣXi Yi = B 1 ΣX i - B 2 ΣX i2
B₁ =Y-B₂X
-ΣΧiΣΥi =- nB1ΣΧi-β2(ΣXi)2
TC PIB (%)
6
4
TC PIB
0
1992 1994 1996 1998 2000 2002 2004 2006 2008
AÑOS
2 808317,92
r=
820769,64
2
r =0,98483
r = 0,99238
el coeficiente de correlacion entre ambas variables es 0,99238 y es muy alta.
1400
1200
1000
800
IMPUESTOS
600
400
200
0
2000 3000 4000 5000 6000 7000 8000 9000 10000 11000 12000
PRODUCTO INTERNO BRUTO
2.10. Predicción
Una aplicación del, modelo de regresión es la predicción o el pronóstico de la variable
dependiente, de acuerdo con valores datos de las variables independientes. Hay dos
tipos de predicciones: la predicción media y la predicción individual. A continuación, se
Presentan estos dos casos:
▪Predicción media: es la predicción al valor medio condicional de Y, correspondiente a
un determinado valor de x , denotado como y 0, el cual representa un punto sobre la
línea de regresión poblacional.
[ ]
2
2 1 ( x0 −x )
es ^y 0= ^β1 + ^β 2 x 0 y la varianza de ^y 0 : var ( ^y 0 )= σ +
2 ∑ ( x 1−x )2
[ ]
2
1 ( x 0−x )
2
calcular la varianza de y 0 es: var ( ^y 0 )= σ 1+ +
n ∑ ( x 1−x )2
Ejemplo 2 - 8.
1. el ingreso nacional Bruto (I.N.B.) de un país desde el año 2000 al año 2008 se refleja
en cuadro siguiente:
AÑO I.N.B.
2000 3
2001 5
2002 3
2003 8
2004 6
2005 10
2006 8
2007 12
2008 14
Solución
a) Realizamos los siguientes cálculos en la tabla siguiente
n ∑ t i ∈B i−∑t i ∑ N B i
^β =
2 2 2
n ∑t i −( ∑t i)
^β = INB− ^β t
2 2
69 45
INB= =7,67 t= =5
9 9
^β 1=7,67−(1,28333)(5)
^β =1,25333
1
^ B=1,25333+1,28333 t
El modelo es: I N i
^ B = 1,25333+1,28333(10) =14,087
IN 2009
^ B =1,25333+1,28333(11) =15,370
IN 2010
^ B =1,25333+1,28333(12) =16,653
IN 2011
^ B2012=1,25333+1,28333(13) =17,937
IN
14
8
INB
0
1999 2000 2001 2002 2003 2004 2005 2006 2007 2008 2009
AÑOS
∑(I ^
2
2 N Bi−INB )
r= 2
∑ ( ¿ B i−INB )
2 98,816
r= =0,8374
118
2
r =¿0,8374
El 83,74% del Ingreso Nacional Bruto se explica por los años.
r =√ 0,8374
r =0,9151
Existe una alta correlación entre ambas variables.