0% acharam este documento útil (0 voto)
7 visualizações24 páginas

Regressão Simples: Conceitos e Exemplos

O documento aborda o modelo de regressão linear simples, explicando como relacionar uma variável dependente com uma variável independente. Ele detalha a estimativa de coeficientes utilizando o método de Mínimos Quadrados Ordinários (MQO) e fornece exemplos práticos de aplicação em R. Além disso, discute conceitos como resíduos, intervalos de confiança e viés da variável omitida.
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
7 visualizações24 páginas

Regressão Simples: Conceitos e Exemplos

O documento aborda o modelo de regressão linear simples, explicando como relacionar uma variável dependente com uma variável independente. Ele detalha a estimativa de coeficientes utilizando o método de Mínimos Quadrados Ordinários (MQO) e fornece exemplos práticos de aplicação em R. Além disso, discute conceitos como resíduos, intervalos de confiança e viés da variável omitida.
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

Estatística &

Econometria

MÓDULO 3

Regressão Simples

Iana Ferrão
[Link]ão@[Link]
+55 (11) 3383 3453
1
1. Modelo de Regressão simples ............................................ 3

2. Estimando coeficientes ...................................................... 7


SUMÁRIO 3. Modelo de Regressão simples – exemplo prático no R........ 9

4. Modelo de Regressão simples – o “beta” de uma ação..... 13

5. Hipóteses para inferência causal ...................................... 15

6. Distribuição dos estimadores............................................ 16

7. Teste de hipóteses............................................................. 17

8. Intervalos de confiança..................................................... 19

Módulo 3 9. Medidas de ajuste do modelo amostral ........................... 20

10. X é binária....................................................................... 21

11. Viés da variável omitida................................................. 23


2
1. Modelo de Regressão simples

O modelo de regressão linear simples relaciona uma variável (y) com base em modificações em outra variável (x).

onde Yi é variável dependente ou variável explicada ou regressando;


𝒀𝒊 = 𝜷𝟎 + 𝜷𝟏𝑿𝒊 + 𝒖i Xi é variável independente ou variável explicativa ou regressor e ui é o termo de erro.

Reta de regressão da população. É a relação válida entre


X e Y em média na população. Conhecendo o valor de X,
de acordo com essa reta de regressão, prevemos que o
Y 60

valor de Y é 𝜷𝟎 + 𝜷𝟏𝑿.
50
𝒀 = 𝜷 𝟎 + 𝜷 𝟏𝑿
(𝑿𝟏 , 𝒀𝟏)
consumo (y)
Despesa de

40

𝑢1 𝜷𝟏 (inclinação da reta de regressão):


30

é o efeito de uma variação de 1 unidade em X sobre Y


20

𝜷𝟏
𝜷𝟎 10

∆𝒀
𝜷𝟏 =
∆𝑿
0

Renda (x1)
1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1

X
𝜷𝟎 é o intercepto do reta de regressão da população.
3
1. Modelo de Regressão simples
Exemplos

Produção de Soja e Fertilizantes. Suponha que a produção de soja seja determinada pelo modelo:

𝒑𝒓𝒐𝒅𝒖çã𝒐 = 𝜷𝒐 + 𝜷𝟏 𝒇𝒆𝒓𝒕𝒊𝒍𝒊𝒛𝒂𝒏𝒕𝒆 + 𝒖, ∆𝒑𝒓𝒐𝒅𝒖çã𝒐 = 𝜷𝟏 ∆𝒇𝒆𝒓𝒕𝒊𝒍𝒊𝒛𝒂𝒏𝒕𝒆

Educação e Salário. Um modelo que relaciona o salário de uma Dispersão entre educação e salário
pessoa à educação e outros fatores não observados pode ser
representado pela seguinte equação:
𝜷 𝟎 + 𝜷 𝟏𝑿
12000
(𝑿𝟏 , 𝒀𝟏)
10000
𝛽1
𝒔𝒂𝒍á𝒓𝒊𝒐 = 𝜷𝒐 + 𝜷𝟏 𝒆𝒅𝒖𝒄 + 𝒖 𝑢1
8000

Salário (R$)
6000

Se 𝑠𝑎𝑙á𝑟𝑖𝑜 é medido em reais por mês e 𝑒𝑑𝑢𝑐 corresponde a anos 4000 𝑢2

de educação formal, 𝛽1 indica a mudança no salário quando se


2000
aumenta em 1 unidade os anos de educação, mantendo todos os
outros fatores fixos. 0
12 14 16 19 23
Anos de educação
1. Modelo de Regressão simples
Medidas de ajuste do modelo amostral

• Dados 𝛽መ0 e 𝛽መ1 , podemos obter o valor ajustado 𝑦ො𝑖


para cada observação (dado 𝑦ො𝑖 = 𝛽መ0 + 𝛽መ1 𝑥𝑖 ). Por
definição, cada valor ajustado de 𝑦ො𝑖 está na linha
de regressão de MQO.

• O resíduo de MQO associado à observação i, 𝑢ො 𝑖 , é a


diferença entre 𝑦𝑖 e seu valor ajustado (𝑢ො 𝑖 = 𝑦𝑖 −
𝑦ො𝑖 = 𝑦𝑖 − 𝛽መ0 − 𝛽መ1 𝑥𝑖 ).

• Se 𝑢ො 𝑖 for positivo, a linha subestima 𝑦𝑖 ; se 𝑢ො 𝑖 for


negativo, a linha superestima 𝑦𝑖 .

• O caso ideal para a observação i é quando 𝑢ො 𝑖 = 0,


mas na maioria dos casos, todo resíduo não é igual
a zero. Em outras palavras, nenhum dos pontos de
dados deve realmente estar na linha MQO.

5
1. Modelo de Regressão simples
Exemplo

Dispersão entre consumo e renda (US$)


Consumo

300

250 𝐶𝑡 = 𝜷𝟎 + 𝜷𝟏𝑌𝑡

200 𝑢𝑖

150
𝐶𝑡 : despesas pessoais de consumo e
𝑌𝑡 = Renda
100

50

0
500 550 600 650 700 750 800

Renda
2. Estimando coeficientes
Método de Mínimos Quadrados Ordinários (MQO)

• Para estimação de β0 e β1 é preciso considerar uma amostra da população: { 𝑋𝑖, 𝑌𝑖 : 𝑖 = 1, … , 𝑛}

• Equação do modelo de regressão simples: 𝒀𝒊 = 𝜷𝟎 + 𝜷𝟏𝑿𝒊 + 𝒖𝒊

• Sejam 𝑏0 e 𝑏1 alguns estimadores de 𝜷𝟎 e 𝜷𝟏. Assim, o erro de previsão ui é dado por 𝑌𝑖 − 𝑏0 − 𝑏1𝑋𝑖

• A soma dos quadrados dos erros de previsão para todas as n observações é


𝑛

෍ 𝑌𝑖 − 𝑏0 − 𝑏1𝑋𝑖 2

𝑖=1

• Ao minimizarmos a expressão acima, encontramos um único par de estimadores para 𝜷𝟎 e 𝜷𝟏, que são chamados de
estimadores de Mínimos Quadrados Ordinários e representados por 𝛽መ0 e 𝛽መ1 .

σ𝒏𝒊=𝟏(𝑿𝒊 − 𝑿
ഥ )(𝒀𝒊 − 𝒀
ഥ ) 𝒄𝒐𝒗𝒂𝒓𝒊â𝒏𝒄𝒊𝒂 𝒂𝒎𝒐𝒔𝒕𝒓𝒂𝒍 𝒆𝒏𝒕𝒓𝒆 𝒙 𝒆 𝒚
෡𝟏 =
𝜷 = ෡𝟎 = 𝒀
𝜷 ෡ 𝟏𝑿
ഥ−𝜷 ഥ
ഥ) ²
σ𝒏𝒊=𝟏(𝑿𝒊 − 𝑿 𝒗𝒂𝒓𝒊â𝒏𝒄𝒊𝒂 𝒂𝒎𝒐𝒔𝒕𝒓𝒂𝒍 𝒅𝒆 𝒙
7
2. Estimando coeficientes
Exemplo
Considere o seguinte exemplo:
Dispersão entre salary e roe

𝒔𝒂𝒍𝒂𝒓𝒚 = 𝜷𝟎 + 𝜷𝟏 𝒓𝒐𝒆 + 𝒖

෢𝟎 = 𝟗𝟔𝟑, 𝟏𝟗𝟏
𝜷
𝜷෢𝟏 = 𝟏𝟖, 𝟓𝟎𝟏

෣ = 963,191 + 18,501 ∗ 𝑟𝑜𝑒


𝒔𝒂𝒍𝒂𝒓𝒚

onde salary é o salário anual de CEO em milhares de dólares e


roe é o retorno médio sobre o patrimônio em percentual.

Temos um gráfico de dispersão com 209 observações. A inclinação da reta estimada é uma estimativa para o impacto de
variações o retorno médio sobre o patrimônio sobre o salário do CEO . 𝜷𝟎 e 𝜷𝟏 que minimizam a soma dos quadrados
dos erros de estimação são: -963,191 e 18,501 respectivamente. Implicando que para um roe = 0, teremos um salário
previsto de 963,19 Ademais, se Δroe = 1, então Δ salary = 18,5
3. Modelo de Regressão simples
Exemplo prático - R

• O R é um software livre que pode ser baixado gratuitamente através do site [Link]

• O R trabalha com pacotes. Os pacotes contém funções que facilitam a execução das análises e a realização da
programação. Para instalar os pacotes, a primeira coisa a se fazer é escolher de qual CRAN os pacotes serão baixados
(“servidor”). Clique em Pacotes → Escolher espelho CRAN → Brazil (SP1). A partir daí clique em Pacotes → Instalar
pacote(S) → Escolher o pacote Rcmdr, que irá instalar o pacote “R Commander”, que é uma interface gráfica para facilitar
o uso do R. É importante lembrar que toda vez que se for utilizar um pacote precisa "chamá-lo“, i.e., usar o comando
“library()” ou “Carregar pacote”

• A título de exemplo, vamos importar a base de dados ceosal1, pertencente ao livro “Introdução a Econometria – Uma
abordagem moderna” de J. Wooldridge. O R lê quase todas as extensões de base de dados (.csv, .xsl, .table,...). Neste caso,
nosso arquivo é .csv. Para o R ler nossa base e identificar os dados, usamos os comandos:

➢ ceosal1 <- [Link]("diretório/[Link]", header=FALSE, dec=",", sep=";")


➢ names(ceosal1) <- c("salary", "pcsalary", "sales", "roe", "pcroe", "ros", "indus", "nance", "consprod", "utility",
"lsalary", "lsales")

9
3. Modelo de Regressão simples
Exemplo prático - R

Estimando uma regressão simples por MQO


• Utilizando o banco de dados cesoal1, estimamos a regressão no R por meio do comando:
➢ [Link] <- lm(ceosal1$salary~ceosal1$roe)
➢ summary([Link])

• Tal que:
✓ lm(y~x) é o comando da função de regressão de y (salário) em x (retorno médio sobre o patrimônio em percentual),
ou seja: 𝒔𝒂𝒍𝒂𝒓𝒚 = 𝜷𝟎 + 𝜷𝟏 𝒓𝒐𝒆 + 𝒖
✓ [Link] é um objeto que armazenará todos os resultados dessa regressão. Assim, todas as vezes que nos reportarmos
aos resultados desta regressão, não é necessário estimá-la novamente
✓ summary() é o comando para que sejam visualizados os resultados da regressão

• No console deverá aparecer:


Call: Call: informações sobre função criada, mostra as variáveis que foram utilizadas.
lm(formula = ceosal1$salary ~ ceosal1$roe)
Residuals: informações sobre os resíduos do modelo, mostra o resíduo mínimo,
máximo, 1º quartil, 3º quartil e a mediana. O resíduo é a diferença entre o valor
Residuals: previsto e o valor real, um modelo adequado possui resíduos com distribuição
Min 1Q Median 3Q Max normal e média dos resíduos próximo de zero.
-1160.2 -526.0 -254.0 138.8 13499.9
10
3. Modelo de Regressão simples
Exemplo prático - R

Estimando uma regressão simples por MQO


• No console deverá aparecer (continuação): Coeficients: A coluna Estimate contém os coeficientes que
formam a equação gerada pelo modelo onde:
Coefficients: ✓ Intercept: ponto onde a reta de regressão cruza o eixo y (𝜷𝟎 )
Estimate Std. Error t value Pr(>|t|)
(Intercept) 963.19 213.24 4.517 1.05e-05 *** ✓ ceosal1$roe: coeficiente de inclinação da regressão (𝜷𝟏 )
ceosal1$roe 18.50 11.12 1.663 0.0978 .
--- ✓ A coluna Std. Error é o erro padrão, uma medida de
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 variabilidade na estimativa de 𝜷𝟏 , idealmente este valor deve
ser menor que o do coeficiente.
Residual standard error: 1367 on 207 degrees of freedom ✓ A coluna t value possui valores que são usados para calcular o
Multiple R-squared: 0.01319, Adjusted R-squared: 0.008421 p-valor e os níveis de significância, eles definem a
F-statistic: 2.767 on 1 and 207 DF, p-value: 0.09777 significância do coeficiente da variável considerada.

✓ A coluna Pr(>|t|) é o valor p do teste t, o valor p representa a


probabilidade que a variável não seja relevante para o
modelo, normalmente: 𝑣𝑎𝑙𝑜𝑟 𝑝 < 0,05 ⇒
𝑐𝑜𝑟𝑟𝑒𝑙𝑎çã𝑜 𝑒𝑛𝑡𝑟𝑒 𝑎𝑠 𝑑𝑢𝑎𝑠 𝑣𝑎𝑟𝑖á𝑣𝑒𝑖𝑠 é 𝑠𝑖𝑔𝑛𝑖𝑓𝑖𝑐𝑎𝑡𝑖𝑣𝑎
3. Modelo de Regressão simples
Exemplo prático - R

Estimando uma regressão simples por MQO


Os símbolos apresentados do lado direito do p-valor e detalhados
• No console deverá aparecer (continuação): na linha Signif. codes mostram para qual significância os
coeficientes são significativos, quanto mais asteriscos, maior a
significância de acordo com o p-valor, ou seja, maior a
Coefficients: probabilidade de existir correlação entre as variáveis.
Estimate Std. Error t value Pr(>|t|)
(Intercept) 963.19 213.24 4.517 1.05e-05 *** Residual Standar Error: representa o desvio padrão dos resíduos.
ceosal1$roe 18.50 11.12 1.663 0.0978 .
--- Degrees of Freddom: diferença entre o número de observações da
Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 amostra e o número de variáveis no modelo.

Multiple R-squared e Adjusted R-squared: definem a


Residual standard error: 1367 on 207 degrees of freedom
representatividade da variável x para prever a variável y, quanto
Multiple R-squared: 0.01319, Adjusted R-squared: 0.008421 maior melhor.
F-statistic: 2.767 on 1 and 207 DF, p-value: 0.09777
F-statistics: É um teste que compara o desempenho de um modelo
com mais parâmetros (X’s) com um modelo com menos
parâmetros. O p-valor será alto (baixo) se o modelo com menos
(mais) parâmetros tiver desempenho melhor que um modelo com
mais (menos) parâmetros
4. Modelo de Regressão simples
O “Beta” de uma ação

Uma ideia fundamental de finanças é a de que um investidor precisa de incentivo financeiro para assumir um risco. Dito de outra
forma, o retorno esperado de um investimento com risco, R, deve superar o retorno de um ativo sem risco, Rf. Então, R - Rf deve ser
positivo.

A princípio pode parecer que o risco de uma ação deve ser medido por sua variância. No entanto, muito desse risco pode ser
reduzido diversificando seus ativos financeiros. Isso significa que a forma certa de medir o risco de uma ação não é por sua
variância, mas sim por sua covariância com o mercado.

O Modelo de Precificação de Ativos de Capital (CAPM ) formaliza essa ideia. Segundo o CAPM, o excesso de retorno esperado de um
ativo é proporcional ao excesso de retorno esperado de uma carteira com todos os ativos disponíveis (a “carteira do mercado”):
onde 𝑹𝒎 é o retorno esperado da carteira de mercado e 𝜷 é o
𝑹 − 𝑹𝒇 = 𝜷 (𝑹𝒎 − 𝑹𝒇 ), coeficiente da regressão da população de 𝑅 − 𝑅𝑓 sobre 𝑅𝑚 − 𝑅𝑓 .

De acordo com o CAPM, uma ação com 𝛽 < 1 oferece menos risco do a que a carteira do mercado e, portanto, possui um excesso de
retorno esperado mais baixo do que a carteira do mercado. Uma ação com 𝛽 > 1 oferece mais risco do que a carteira de mercado e,
dessa forma, exige um excesso de retorno esperado mais alto. Esses 𝛽′s de ações são normalmente estimados por regressão de
MQO dessa equação: 𝑹 − 𝑹𝒇 = 𝜷 (𝑹𝒎 − 𝑹𝒇 ).

13
Os “Beta” de algumas das principais empresas brasileiras

Empresa β estimado
Vale 0,58
Petr4 1,50
Bpac 1,52
Magazine Luiza 1,08
Loja Americanas 1,14
Banco do Brasil 1,34
Localiza 1,23
Gol 2,23
Eletrobras 1,42
Gerdau 1,08
14
Fonte: [Link]
5. Hipóteses para inferência causal

Hipóteses de Mínimos Quadrados


1. Média condicional de ui dado Xi é igual a zero: 𝐸 𝑢𝑖 𝑋𝑖 = 𝐸 𝑢𝑖 = 0, isto é, para todo 𝑋, a média dos fatores não
observáveis é a mesma e igual ao valor médio de ui na população que, por sua vez, é igual a zero. Essa hipótese afirma
que os outros fatores não observáveis, contidos em ui não têm relação com Xi.
𝐸 𝑢𝑖 𝑋𝑖 = 𝐸 𝑢𝑖 = 0 ⇒ 𝑐𝑜𝑟𝑟 𝑋𝑖, 𝑢𝑖 = 0
→ Se algum xi for correlacionado com u, dizemos que xi é endógena → problemas: variável omitida, erro de medida, simultaneidade.

2. (Xi,Yi), com i=1, ..., n são seleções independente e identicamente distribuídas (i.i.d.) ao longo das observações.

3. (Xi,ui) têm quartos momentos finitos e diferentes de zero: 0 < 𝐸 𝑋𝑖4 < ∞ e 0 < 𝐸 𝑢𝑖4 < ∞.

Essa hipótese limita a probabilidade de que seja selecionada uma observação com valores extremamente altos de Xi ou ui.
Essa hipótese é uma condição técnica que é comumente válida na prática.

Se essas hipóteses são válidas, os estimadores de MQO possuem distribuições amostrais que são normais. Por sua vez, a
distribuição normal de amostra grande permite desenvolver métodos para teste de hipótese e construção de intervalos
de confiança utilizando os estimadores de MQO.
15
6. Distribuição dos estimadores
෡𝟎 e 𝜷
Distribuições de 𝜷 ෡ 𝟏 para amostras grandes

෡𝟎 e 𝜷
Se essas hipóteses de mínimos quadrados do slide anterior são válidas, então, para amostras grandes, 𝜷 ෡𝟏
possuem uma distribuição amostral normal conjunta.

෡ 𝟏 para amostras grandes é N(𝛽1, 𝜎෡2 ), onde 𝜎෡2 é:


A distribuição normal de 𝜷 𝛽 1 𝛽 1

1 𝑣𝑎𝑟[(𝑋𝑖 − 𝜇𝑋 )𝜇𝑖
𝜎𝛽21 =
𝑛 [𝑣𝑎𝑟 𝑋𝑖 ]2

෡ 𝟎 para amostras grandes é N(𝛽0, 𝜎෡2 ), onde 𝜎෡2 é:


A distribuição normal de 𝜷 𝛽 0 𝛽 0

1 𝑣𝑎𝑟(𝐻𝑖 𝜇𝑖 ) 𝜇𝑋
𝜎𝛽20 = , 𝑠𝑒𝑛𝑑𝑜 𝑞𝑢𝑒 𝐻𝑖 = 1 − 𝑋
𝑛 [𝐸 𝐻𝑖2 ]2 𝐸(𝑋𝑖2 ) 𝑖

16
7. Teste de hipóteses

Teste de hipóteses sobre 𝜷𝟏


• Suponha que se deseje testar a hipótese de que a inclinação é igual a uma constante representada por 𝛽1 . As hipóteses
apropriadas são:

𝑯𝟎: 𝜷𝟏 = 𝜷𝟏,𝟎

𝑯𝟏 : 𝜷𝟏 ≠ 𝜷𝟏,𝟎 (hipótese alternativa bicaudal)

• A estatística 𝑡 tem distribuição t-Student com n-2 graus de liberdade sob H0. Rejeita-se H0 se: 𝑡𝑒𝑓 > 𝑡𝛼 . Ao nível de significân
2
de 5%, 𝑡5% = ±1,96.
2

95%
෡ 𝟏 − 𝜷𝟏
𝜷 𝟏 𝒏 ഥ 𝟐 𝒖ෝ𝒊𝟐
𝟏 𝒏−𝟐 σ𝒊=𝟏 𝑿𝒊 −𝑿
𝒕= onde EP(𝛽መ1 ) =
𝑬𝑷(𝜷 ෡ 𝟏) 𝒏 𝟏 σ𝒏 (𝑿𝒊 −𝑿
𝒏 𝒊=𝟏
ഥ )² 𝟐

−1,96 0 +1,96

𝑅𝑒𝑔𝑖ã𝑜 crítica (de rejeição de H0) 17


7. Teste de hipóteses
Exemplo

𝐶𝑡 = −𝜷𝟎 + 𝜷𝟏𝑌𝑡
෢𝟎 = −𝟐𝟗𝟗, 𝟓𝟗𝟏𝟑; 𝜷
𝜷 ෢𝟎 = 𝟎, 𝟕𝟐𝟏𝟖
𝑪෡𝒕 = 299.5913 + 0.7218𝑌𝑡
O p-valor é bem baixo, então podemos rejeitar a hipótese nula de que 𝜷𝟏 é igual a zero.

18
8. Intervalo de confiança

Intervalo de confiança para 𝛽1

• Um intervalo de confiança bicaudal de 95% para 𝛽1 , é um intervalo que contém o valor verdadeiro de 𝛽1 , com uma
probabilidade de 95%, isto é, contém o valor verdadeiro de 𝛽1 em 95% de todas as amostras possíveis selecionadas
aleatoriamente.

• De modo equivalente, ele é também o conjunto de todos os valores de 𝛽1 que não podem ser rejeitados por um teste
de hipótese bicaudal ao nível de significância de 5 por cento.

• Quando o tamanho da amostra é grande, o intervalo de confiança é construído como:

෢𝟏 − 𝟏, 𝟗𝟔 𝑬𝑷(𝜷
Intervalo de confiança de 95% para 𝛽1= 𝜷 ෢𝟏 ), 𝜷
෢𝟏 + 𝟏, 𝟗𝟔 𝑬𝑷(𝜷
෢𝟏 )

19
9. Medidas de ajuste do modelo amostral

O passo seguinte à estimação do modelo de regressão linear é investigar o quão bem a linha de regressão descreve os
dados. Trata-se de verificar o ajuste do modelo ou se o regressor explica muito ou pouco da variação na variável
dependente.

Uma medida fundamental para entender o ajuste de uma regressão é o R².

O R² varia entre 0 e 1 e mede qual a fração da variância de Y é explicada por X.

Um R2 próximo de 1 indica que o regressor é bom na previsão de Yi, ao passo que um R2 próximo de zero indica que o
regressor não é muito bom na previsão de Yi.

20
10. X é binária

As variáveis binárias ou variáveis dummy ou variáveis dicotômicas são formas de agregar informações qualitativas em
modelos de regressão estatística. Uma variável binária pode representar dois estados possíveis:
Igual a 0, ausência da característica de interesse (fracasso)
X
Igual a 1, presença da característica de interesse (sucesso)
Podemos, assim, estimar a influência de variáveis explicativas (independentes) nominais ou ordinais em modelos de
regressão, da mesma maneira que fazemos com variáveis quantitativas de escala intervalar ou de razão.

Exemplos de variáveis binárias

• D1 = 1, se mulher (sexo feminino); D1 = 0, caso contrário.


• D2 = 1, se homem (sexo masculino); D2 = 0, caso contrário.
• D1 = 1, se Republicano; D1 = 0, caso contrário.
• D1 = 1, se negro; D1 = 0, caso contrário.
• D2 = 1, se branco; D2 = 0, caso contrário.
.
.
.
21
10. X é binária
Tipos de equação
2 ou mais variáveis dummy linear
1 dummy linear:
𝒀𝒊 = 𝜶 + 𝜷𝟏 𝑿𝒊 + 𝜷𝟐 𝑫𝟏,𝒊 + 𝜷𝟑 𝑫𝟐,𝒊 + 𝒆𝒊
𝒀𝒊 = 𝜶 + 𝜷𝟏 𝑿𝒊 + 𝜷𝟐 𝑫𝒊 + 𝒆𝒊
O coeficiente 𝛽2 indicaria quanto Y seria, em média, maior
O coeficiente da dummy (𝛽2 ) indica quanto y seria, em
para a categoria A (D1=1) que a categoria de referência C
média, maior (ou menor) para a categoria A (D=1) que
(D1=0 e D2=0), independente do valor de X. O coeficiente 𝛽3
a categoria de referência B (D=0), independente do
indicaria quanto Y seria, em média, maior para a categoria B
valor de X.
(D2=1) que a categoria de referência C. Pois teríamos:

22
11. Viés de variável omitida

O viés de omissão de variáveis é um viés do estimador de MQO que surge quando o regressor, X, está correlacionado
com uma variável omitida. Duas condições devem ser verdadeira paras que ocorra um viés de omissão de variáveis:

(i) X deve estar correlacionado com a variável omitida; e


(ii) a variável omitida deve ser um determinante da variável dependente, Y.

O viés de omissão de variáveis indica que a primeira hipótese dos mínimos quadrados, de que E(ui|Xi), =0, está
incorreta. Isso porque o termo ui no modelo de regressão linear com um único regressor representa todos os fatores,
exceto Xi, que são determinantes de Yi. Se um desses fatores está correlacionado com Xi, isso significa que o termo de
erro (que contém esse fator) está correlacionado com Xi). Em outras palavras, se uma variável omitida é um
determinante de Yi, ela está no termo de erro e, se está correlacionada com Xi, o termo de erro também está
correlacionado com Xi. Como ui e Xi estão correlacionados, a média condicional de ui dado Xi, E(ui|Xi), é diferente de
zero. Essa correlação, portanto, viola a primeira hipótese dos mínimos quadrados e o estimador de MQO é viesado e
inconsistente.

23
24

Você também pode gostar