0% acharam este documento útil (0 voto)
4 visualizações42 páginas

Modelos de Regressão Linear Explicados

O documento aborda a análise de dados multivariados por meio de modelos de regressão, destacando a diferença entre regressão e correlação. Ele explora modelos de regressão linear simples e múltipla, incluindo pressupostos, estimação e validação. O objetivo principal é analisar a relação entre variáveis dependentes e independentes, oferecendo técnicas para previsão e interpretação dos resultados.

Enviado por

João Barbosa
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd
0% acharam este documento útil (0 voto)
4 visualizações42 páginas

Modelos de Regressão Linear Explicados

O documento aborda a análise de dados multivariados por meio de modelos de regressão, destacando a diferença entre regressão e correlação. Ele explora modelos de regressão linear simples e múltipla, incluindo pressupostos, estimação e validação. O objetivo principal é analisar a relação entre variáveis dependentes e independentes, oferecendo técnicas para previsão e interpretação dos resultados.

Enviado por

João Barbosa
Direitos autorais
© All Rights Reserved
Levamos muito a sério os direitos de conteúdo. Se você suspeita que este conteúdo é seu, reivindique-o aqui.
Formatos disponíveis
Baixe no formato PDF, TXT ou leia on-line no Scribd

ANÁLISE DE DADOS MULTIVARIADOS:

MODELOS DE REGRESSÃO

Instituto Universitário de Lisboa


Graça Trindade
2021/2022
Modelos de regressão

ÍNDICE
Modelos de regressão 1
1. Modelos de Regressão Linear 1
Regressão vs Correlação 1
Análise de Regressão Linear 2
1.1 Modelo de Regressão Simples (MRLS) 3
1.1.1 Pressupostos do MRLS 3
1.1.2 Estimação do MRLS 3
1.1.3 Validação dos pressupostos do modelo 12
1.1.4 Reestimação do MRLS para a variável dependente sem outliers 19
1.2 Modelo de regressão linear múltiplo 20
1.2.1 Modelo 2 20
1.2.2 Hipóteses e validação das hipóteses 21
1.2.3 Estimação do modelo 2 26
1.2.4 Modelo 3 27
1.2.5 Modelo 4 31
1.3 Previsão 32
1.3.1 Previsão pontual 32
1.3.2 Previsão intervalar 33
1.4 Considerações finais 34
2. Modelos de regressão linear múltipla com efeitos de interação 36
2.1 Efeitos de moderação entre variáveis explicativas quantitativas 36
4.2 Efeitos de moderação entre variáveis explicativas qualitativas 38
Modelos de regressão

ÍNDICE DE FIGURAS
Figura 1: Relação entre duas variáveis quantitativas ...................................................................... 1
Figura 2: Desvios entre os valores observados e os estimados ....................................................... 4
Figura 3 - Decomposição da variação total de S ............................................................................. 6
Figura 4 - Presença ou não da hipótese da homoscedastcidade .................................................... 14
Figura 5 – Exemplos de autocorrelação positiva (a) e negativa (b) .............................................. 16
Figura 6 – Exemplo de um modelo aditivo para modelar um ruído branco.................................. 17
Figura 7: Relação entre o Tempo de leitura do semanário e os Escalões etários dos leitores ...... 22
Figura 8: Relações entre o Tempo de leitura do semanário e cada um dos atributos Caraterísticas
físicas e Qualidade de informação ................................................................................................ 28
Figura 9 – Modelo de interação..................................................................................................... 36
Figura 10 – Modelo teórico simplificado ...................................................................................... 37
Figura 11 - Visualização dos efeitos de interação das iniciativas ambientais individuais na relação
entre a percepção das práticas ambientais da organização e o valor ambiental das práticas
ambientais das empresas ............................................................................................................... 37
Figura 12 – Visualização dos efeitos de interação do montante máximo que se está disposto(a) a
pagar na compra de produtos de luxo de 2ª mão na relação entre os benefícios da compra oneline
e a compra de produtos de luxo em 2ª mão (lojas físicas e oneline) ............................................. 39

ÍNDICE DE TABELAS

Tabela 1: Terminologia e notação ................................................................................................... 2


Tabela 2: Modelos de regressão linear ............................................................................................ 2
Tabela 3: Guia de interpretação da qualidade do ajustamento ........................................................ 7
Tabela 4: Tratamento dos outliers no MRLS ................................................................................ 12
Tabela 5: Valores críticos para o teste de Durbin-Watson ............................................................ 18
Tabela 6: Comparação das estimativas obtidas por diferentes métodos ....................................... 35
Modelos de regressão

Os modelos de regressão constituem uma técnica preditiva de análise multivariada que tem como
objetivos:

 Analisar a relação entre uma variável dependente e várias variáveis independentes através de um
modelo de regressão;
 Fornecer técnicas para a confirmação de teorias;
 Interpretar os resultados da regressão e fazer previsões a partir desses resultados.

1. Modelos de Regressão Linear

O modelo de regressão linear múltiplo (MRLM) é uma técnica preditiva de análise multivariada
usada para modelar relações entre variáveis e predizer o valor de uma variável dependente
quantitativa a partir de várias independentes.

Regressão vs Correlação

“A regressão tem como resultado uma equação funcional que descreve o relacionamento das
variáveis”, enquanto que a correlação mede o grau da relação linear entre as variáveis, sem
indicar qual das variáveis é a dependente. Ou seja, na correlação linear entre variáveis
quantitativas não há causalidade entre as variáveis. A Figura 1 apresenta diferentes tipos de
relação e uma situação em que não existe qualquer relação linear ou não linear (c).

(a) Relação linear positiva e (b) Relação linear negativa e (c) Ausência de relação (d) Relação, mas não linear
forte moderada
Fonte: Doane e Seward (2008: 491)

Figura 1: Relação entre duas variáveis quantitativas

Exemplos de relações causais:

 Um empresário pretende estimar a quantidade vendida de um determinado produto que


comercializa que terá no próximo mês de determinado produto que comercializa com base no
preço do mesmo.
 Um economista pretende prever para o próximo ano o consumo de fuel, em milhares de toneladas,
em Portugal em função do parque automóvel, em milhares de unidades e das entradas de
automóveis estrangeiros, em milhares de unidades.
 (...)

©ISCTE-Instituto Universitário de Lisboa 1


Modelos de regressão

Tabela 1: Terminologia e notação


𝒀 𝑿
Variável dependente Variável independente
Variável explicada Variável explicativa
Variável endógena Variável exógena
Variável preditiva Variável preditora

Classificação dos modelos:

Modelo cronológico – é um modelo cujo domínio é composto por um conjunto de períodos de


tempo relativamente a certa entidade (variável)  Dados temporais
Modelo seccional – é um modelo com domínio constituído por várias entidades (variáveis),
sendo cada variável observável uma só vez ao longo do tempo  Dados seccionais
Modelos mistos – é um modelo cujo domínio abarca várias entidades (variáveis) e vários
períodos de tempo  Dados de painel ou longitudinais

Análise de Regressão Linear

No modelo de regressão o termo variável dependente traduz uma relação do tipo causa e efeito.
Analise-se o caso em que a relação entre as variáveis pode ser descrito apropriadamente por uma
relação linear. Considere-se o seguinte modelo:

Tabela 2: Modelos de regressão linear


Modelos teóricos Modelos estimados
Modelo de regressão
linear simples
𝑌 = 𝛽 +𝛽 𝑋 +𝜀 𝑌 =𝛽 +𝛽 𝑋
Modelo de regressão
linear múltiplo
𝑌 = 𝛽 + 𝛽 𝑋 +⋯+ 𝛽 𝑋 + 𝜀 𝑌 = 𝛽 + 𝛽 𝑋 + 𝛽 𝑋 +⋯+ 𝛽 𝑋

Os coeficientes 𝛽 são designados por coeficientes (ou parâmetros) da regressão e 𝜀 representa


os erros ou resíduos aleatórios do modelo teórico, 𝛽 é a ordenada na origem e corresponde ao
valor de S quando 𝑥 = 0, 𝑗 = 1, … , 𝑘. Os 𝛽 representam os declives parciais que mais não são
medidas de influência de 𝑋 em 𝑌 por unidade de variação de 𝑋 .

Caso exista apenas uma variável independente, o modelo de regressão linear simplifica-se e é
designado por Modelo de Regressão Linear Simples:

𝑌 =𝛽 +𝛽 𝑋 +𝜀 𝑖 = 1, … , 𝑛
Caso existam várias variáveis explicativas, o modelo de regressão é designado por Modelo de
Regressão Linear Múltiplo:

𝑌 = 𝛽 + 𝛽 𝑋 + ⋯+𝛽 𝑋 +𝜀 𝑖 = 1, … , 𝑛

©ISCTE-Instituto Universitário de Lisboa 2


Modelos de regressão

𝑌  componente determinística  componente aleatória


Interpretação do erro aleatório:

 O erro surge por esta técnica ser uma simplificação da realidade e, assim, este erro contém toda a
informação que não foi explicitada pelo modelo. Portanto, nesta componente vão estar incluídas
todas as variáveis omitidas no modelo.
 O erro surge porque as relações humanas são imprevisíveis. Neste sentido, o erro traduzirá
mudanças de atitude que induzem os consumidores a gastarem mais ou menos do que usualmente
fazem.
 O erro pode ainda surgir como erro de medição.
 (...)

1.1 Modelo de Regressão Simples (MRLS)

1.1.1 Pressupostos do MRLS

 Linearidade do fenómeno em estudo


 Normalidade do erro aleatório
 A média do erro aleatório é nula
 A variância do erro aleatório é constante
 Independência entre os erros aleatórios referentes a períodos diferentes

1.1.2 Estimação do MRLS

Pretende-se analisar se o Tempo de leitura do semanário preferido (em minutos) pode ser
explicado a partir da concordância dos leitores ao atributo desejável Leitura Aprazível dos
semanários. Os dados constam da base de dados usada nas aulas práticas.

Exemplo 1:

Será que a variável Tempo de leitura dos semanários, em minutos, é explicado pela
concordância que os leitores atribuem à Leitura aprazível?

[Link] O método de mínimos quadrados


(𝑚𝑖𝑛 ∑ 𝑒 )

Numa relação linear, o método dos mínimos quadrados permite o ajustamento de uma reta de
regressão (a reta ajustada) aos dados observados de tal forma que é minimizado a soma do
quadrado dos desvios entre os valores observados e a recta ajustada. Estes desvios são distâncias
medidas na vertical e correspondem às diferenças entre os valores observados e os ajustados. Os
desvios entre os valores observados e os estimados são identificados por 𝑒 = 𝑌 − 𝑌 .

©ISCTE-Instituto Universitário de Lisboa 3


Modelos de regressão

𝒚𝒊
𝒆𝒊
𝒚

𝑌 =𝛽 +𝛽 𝑋

Figura 2: Desvios entre os valores observados e os estimados

Pretende-se minimizar a soma dos quadrados dos desvios (resíduos) através do método OrdinarS
Least Squares (OLS) e os estimadores obtidos, designados por estimadores OLS são, na classe
dos estimadores não enviesados, os que têm variância mínima, isto é, são BLUE (best linear
unbiasedness estimators).

Está-se perante um problema de optimização e como há dois parâmetros a estimar, é necessário


resolver o sistema de duas equações:

⎧ ∑ 𝑒 = 0 ⎧ ∑ 𝑒 > 0
⎪ 𝛽 ⎪ 𝛽
𝑒
⎨ ∑ 𝑒 = 0 ⎨ ∑ 𝑒 > 0
⎪ 𝛽 ⎪ 𝛽
⎩ ⎩
A solução conduz às seguintes fórmulas para a ordenada na origem (𝛽 ) e o declive da recta (𝛽 ):

𝛽 = 𝑌 − 𝛽𝑋
𝑛∑𝑋 𝑌 −∑𝑋 ∑𝑌 𝑛∑𝑋 𝑌 − 𝑌∑𝑋 ∑ 𝑋 𝑌 − 𝑛𝑋𝑌 ∑(𝑋 − 𝑋)(𝑌 − 𝑌)
𝛽 = = = =
𝑛 ∑ 𝑋 − (∑ 𝑋 ) ∑𝑋 − 𝑌∑𝑋 ∑ 𝑋 − 𝑛𝑋 ∑(𝑋 − 𝑋)

[Link] Estimação1 dos coeficientes do MRLS com recurso ao SPSS Statistics


Estime-se o modelo (pressupondo que as outras hipóteses estão validadas).

Analyze, Regression, Linear: S→ Dependent: Tempo de leitura do semanário (min)


X → Independent: Leitura Aprazível
Statistics: Regression coefficients
Estimates; Confidence
intervals

1
A estimação do modelo deve ser feita após se ter validado as hipóteses do mesmo.
©ISCTE-Instituto Universitário de Lisboa 4
Modelos de regressão

Output: ___________________________________________________________________________

Coefficientsa
Unstandardized Standardized
Coefficients Coefficients 95% Confidence Interval for B
Model B Std. Error Beta t Sig. Lower Bound Upper Bound
1 (Constant) 132,325 12,301 10,757 ,000 107,844 156,805
Leitura aprazível -15,890 3,310 -,473 -4,800 ,000 -22,478 -9,302
a. Dependent Variable: Tempo de leitura do semanário (minutos)

𝛽 = 132,325  mesmo que a concordância com o atributo Leitura Aprazível fosse hipoteticamente nula,
estima-se que os tempos de leitura do semanário preferido fossem aproximadamente de
132,325 minutos por mês ( tempo de leitura máxima e hipotética)
𝛽 = −15,89  por cada variação unitária na concordância, estima-se que os tempos de leitura dos
semanários diminuam de cerca de ¼ de hora (15,89 minutos). Significa que um aumento
de um nível na concordância com este atributo provoca uma redução estimada de 15,89
minutos no Tempo de leitura do semanário.

𝐼𝐶 , = ]−22,478; −9,302[  Com 95% de confiança, estima-se que o verdadeiro valor de 𝛽 se
encontre neste intervalo estimado porque é assim na maioria das vezes
(95 em 100).

[Link] Propriedades da equação ajustada


As propriedades da equação ajustada são:

 A equação ajustada passa pelo par de valores (𝑋 ; 𝑌 )

 A média dos valores ajustados 𝑌 é igual à média dos valores observados (𝑌 )

 A soma dos erros estimados é nulo ∑ ε = 0


 Os erros estimados não estão correlacionados com X , (∑ ε X = 0)

 Os erros estimados não estão correlacionados com Y , ∑ ε Y = 0

©ISCTE-Instituto Universitário de Lisboa 5


Modelos de regressão

[Link] Qualidade do ajustamento com recurso ao SPSS Statistics


Considerando-se os seguintes desvios, é possível explicar a relação entre eles:
 (𝑌 − 𝑌 ) – desvio entre o valor observado e a média da variável dependente = Variação total

 𝑌 − 𝑌 – desvio entre o valor estimado usando-se o modelo de regressão e a média da variável


dependente = é o desvio explicado pela regressão
 𝑌 − 𝑌 – desvio entre o valor observado e o valor estimado pela regressão = é o desvio não
explicado ou desvio devido ao erro

Desvio total = Desvio explicado + Desvio não explicado


𝑌 −𝑌 = 𝑌 −𝑌 + 𝑌 −𝑌

Figura 3 - Decomposição da variação total de S

A variância total é decomposta em duas partes:

(𝑌 − 𝑌) = 𝑌 −𝑌 + 𝑌 −𝑌

VARIAÇÃO TOTAL DE S VARIAÇÃO EXPLICADA DE S VARIAÇÃO RESIDUAL DE S


= = =
TOTAL SUM OF SQUARES = REGRESSION SUM OF SQUARES + ERROR SUM OF SQUARES
(TSS) (RSS) (ESS)

TSS = RSS + ESS

Dividindo ambas os membros da equação por ∑(𝑌 − 𝑌) , obtém-se o coeficiente de


determinação.

∑ 𝑌 −𝑌 ∑ 𝑌 −𝑌
1= +
∑(𝑌 − 𝑌) ∑(𝑌 − 𝑌)

∑ 𝑌 −𝑌 𝑅𝑆𝑆 𝐸𝑆𝑆
𝑅 = = =1− with 𝑅 ∈ [0 , 1]
∑(𝑌 − 𝑌) 𝑇𝑆𝑆 𝑇𝑆𝑆

©ISCTE-Instituto Universitário de Lisboa 6


Modelos de regressão

É a proporção da variação da variável dependente explicada por variações da independente.


Quanto mais próximo de um estiver 𝑅 , melhor o ajustamento do modelo.

Tabela 3: Guia de interpretação da qualidade do ajustamento


1 Ajustamento perfeito
0.8 – 0.9 Muito bom ajustamento
0.6 – 0.8 Bom ajustamento
0.4 – 0.6 Ajustamento mediano
0.2 – 0.4 Ajustamento fraco
0.1 – 0.2 Ajustamento muito fraco
0 Ausência de relação linear entre as variáveis

Outputs2: _____________________________________________________________________

Variables Entered/Removeda
Variables
Model Variables Entered Removed Method
1 Leitura aprazívelb . Enter
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. All requested variables entered.

Model SummarSb
Mede a dispersão dos
Adjusted R Std. Error of the resíduos relativamente ao
Model R R Square Square Estimate
modelo estimado; quanto
1 ,473a ,224 ,214 27,172 menor o seu valor, maior a
a. Predictors: (Constant), Leitura aprazível precisão nas estimativas
b. Dependent Variable: Tempo de leitura do semanário (minutos)

ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 17010,956 1 17010,956 23,041 ,000b
Residual 59063,739 80 738,297
Total 76074,695 81
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), Leitura aprazível

𝑆𝑆𝑅 = 17010,956 𝑆𝑢𝑚 𝑜𝑓 𝑆𝑞𝑢𝑎𝑟𝑒𝑠 − 𝑅𝑒𝑔𝑟𝑒𝑠𝑠𝑖𝑜𝑛


𝑆𝑆𝐸 = 59063,739 𝑆𝑢𝑚 𝑜𝑓 𝑆𝑞𝑢𝑎𝑟𝑒𝑠 − 𝑅𝑒𝑠𝑖𝑑𝑢𝑎𝑙𝑠
𝑆𝑆𝑅 𝑆𝑆𝑅 17010,956
𝑅 = = = ≈ 0,223609 ≈ 0,224
𝑆𝑆𝑅 + 𝑆𝑆𝐸 𝑆𝑆𝑇 76074,695

Coeficiente de Determinação: cerca de 22,4% da variação em S é explicada por esta variável


independente.
Coeficiente de Determinação Ajustado: é o coeficiente de determinação ajustado ao número de
parâmetros do modelo e à dimensão amostral.
𝑛−1 81 81
𝑅 =1− (1 − 𝑅 ) ≈ 1 − (1 − 0,224) = 1 − (0,776) ≈ 0,2143 ≈ 0,214
𝑛−𝑘−1 82 − 1 − 1 80

em que n é a dimensão amostral e k é o número de variáveis explicativas.

2
Depois de se terem eliminado os outliers severos ou influentes.
©ISCTE-Instituto Universitário de Lisboa 7
Modelos de regressão

Coeficiente de Correlação linear: é igual a 𝑟 , = ±√𝑅 ≈ −√0,224 ≈ −0,4733 ≈ −0,473, ou seja,


no MRLS, o sinal do coeficiente de correlação linear é igual ao
sinal do 𝛽 .

[Link] Validade do modelo


A validade do modelo é feita a partir do teste da ANOVA:

𝐻 :𝑅 çã =0
𝐻 :𝑅 çã ≠0

/
Estatística do teste: 𝐹 = /( )
∩ 𝐹( ; )

ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 17010,956 1 17010,956 23,041 ,000b
Residual 59063,739 80 738,297
Total 76074,695 81
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), Leitura aprazível

Decisão: 𝐹( ; ) = 23,041; 𝑆𝑖𝑔 = 0,000, rejeita-se a hipótese nula. Logo, o modelo é válido porque
a única variável independente é significativa a explicar variações da dependente.

[Link] Capacidade explicativa da variável independente


A capacidade explicativa da variável independente é feita a partir do teste t-Student:

𝐻 :𝛽 =0
𝐻 :𝛽 ≠0

Estatística do teste: 𝑡 = ∩ 𝑡( )

Coefficientsa
Unstandardized Standardized
Coefficients Coefficients
Model B Std. Error Beta t Sig.
1 (Constant) 132,325 12,301 10,757 ,000
Leitura aprazível -15,890 3,310 -,473 -4,800 ,000
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Decisão: como 𝑡 = −4,800; 𝑆𝑖𝑔 = 0,000, rejeita-se a hipótese nula, ou seja, a variável Leitura
Aprazível contribui significativamente para a explicação da variação dos tempos de
leitura do semanário (min).

[Link] Aplicação do modelo estimado: Previsão


Se por hipótese se admitir que a estrutura do passado se vai manter num futuro próximo, não se
pode usar este modelo estimado para previsão porque a qualidade do ajustamento é fraca

©ISCTE-Instituto Universitário de Lisboa 8


Modelos de regressão

(𝑅 = 0,224). Mas, em termos académicos e para exemplificar este ponto, vai-se estimar o tempo
de leitura do semanário se a concordância com a leitura aprazível for de 4,5 no período de
previsão.

𝑌 = 132,325 − 15,890 × 4,5 = 60,82 𝑚𝑖𝑛

[Link] Problema com outliers severos e/ou influentes


5) [Link].1 Detecção de outliers influentes
Outliers influentes são os que geram situações do seguinte tipo:

O ponto B é um valor influente, que corresponde a um valor extremo de X


e Y, cujo efeito é visível na direção do declive da reta que passa de positiva
a negativa.

Analyze, Regression, Linear, Dependent:Tempo de leitura dos semanários (minutos) (p2)


Independent(s): Concordância com a Leitura aprazível
Save: Studentized deleted residual
Continue, Ok

Proceda-se a uma análise dos resíduos.

Para isso convém no comando Save pedir-se Studentized deleted residual. A vantagem é que os
resíduos estudentizados detectam casos influentes de outliers.

Output:
____________________________________________________________________________________________
___________

©ISCTE-Instituto Universitário de Lisboa 9


Modelos de regressão

Residuals Statisticsa
Minimum Maximum Mean Std. Deviation N
Predicted Value 66,35 127,58 88,70 13,831 100
Std. Predicted Value -1,616 2,811 ,000 1,000 100
Standard Error of Predicted Value 4,321 12,936 5,817 1,859 100
Adjusted Predicted Value 64,90 137,20 88,83 14,118 100
Residual -97,576 105,688 ,000 42,946 100
Std. Residual -2,261 2,448 ,000 ,995 100
Stud. Residual -2,369 2,461 -,002 1,005 100
Deleted Residual -107,204 106,757 -,134 43,815 100
Stud. Deleted Residual -2,428 2,528 ,002 1,015 100
Mahal. Distance ,002 7,901 ,990 1,438 100
Cook's Distance ,000 ,277 ,010 ,029 100
Centered Leverage Value ,000 ,080 ,010 ,015 100
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Interpretação: deste output, que apresentam algumas estatísticas descritivas dos resíduos, temos a
indicação sobre a possível presença de outliers e/ou casos influentes. “Olhando” para o
valor mínimo e máximo do Studentized Deleted Residual, parece existirem outliers uma
vez que o valor mínimo é de (−2,428) e um valor máximo de (2,528), o que equivale a
dizer que estes valores estão a cerca de 2,5 desvios padrão da média (0,000).

ZRE_1 SRE_1 SDR_1


-1,21095 -1,2355 -1,23886
-0,67908 -0,68251 -0,68063
0,71094 0,71453 0,71274
1,74638 1,76716 1,78682
-1,37409 -1,38102 -1,38753
0,00178 0,00183 0,00182
-0,33865 -0,34268 -0,34113
1,40596 1,41305 1,42037
1,22866 1,23711 1,24051
0,71094 0,71453 0,71274
-2,26055 -2,36945 -2,4279
0,53365 0,53732 0,53536
2,10097 2,11157 2,15026
0,01593 0,01601 0,01593
-0,67908 -0,68251 -0,68063
2,44847 2,46083 2,52758
-0,86345 -0,88095 -0,87993
-0,67908 -0,68251 -0,68063
0,88824 0,89389 0,89297
-0,50886 -0,51236 -0,51042
... ... ...
0,01593 0,01601 0,01593
0,01593 0,01601 0,01593

Identificação dos outliers influentes

A identificação destes outliers severos e/ou influentes é feita através de um teste paramétrico
uma vez que cada resíduo studentized deleted segue distribuição t-Student com (𝑛 − 𝑝 − 1) graus
de liberdade, em que p é o número de variáveis independentes.

©ISCTE-Instituto Universitário de Lisboa 10


Modelos de regressão

Hipóteses:

H0: o resíduo i não é outlier


Ha: o resíduo i é outlier

Acedendo-se aos comandos SPSS Statistics, a identificação dos resíduos outliers é feita através
de (1 − 𝐶𝐷𝐹. 𝑇(𝑎𝑏𝑠(𝑆𝐷𝑅 ), 983)) ∗ 2 para se obter os percentis da distribuição t-Student para cada
um dos valores absolutos de SDR_1.

Output: ___________________________________________________________________________

Decisão: todos os casos em que o 𝑝 − 𝑣𝑎𝑙𝑢𝑒 ≤ 0,1 devem ser eliminados. Os casos 4, 11, 13, 16,
23, 28, 30, 35, 39, 40, e 42 devem ser eliminados simultaneamente.

6) [Link].2 Tratamento de outliers


Eliminem-se estas 11 observações.

3 (𝑛 − 𝑘) em que k é o número de parâmetros a estimar.


©ISCTE-Instituto Universitário de Lisboa 11
Modelos de regressão

Tabela 4: Tratamento dos outliers no MRLS


1 0,22 20 0,61 39 0,03 62 0,85 81 0,88 100 0,99
2 0,50 21 0,29 40 0,08 63 0,36 82 0,84
3 0,48 22 1,00 41 0,59 64 0,16 83 0,84
4 0,08 23 0,03 42 0,05 65 0,39 84 0,23
5 0,17 24 0,74 43 0,16 66 0,14 85 0,62
6 1,00 25 0,39 44 0,48 67 0,12 86 0,85
7 0,73 26 0,72 45 0,59 68 0,30 87 0,62
8 0,16 27 1,00 46 0,59 69 0,36 88 0,23
9 0,22 28 0,05 47 0,87 70 0,88 89 0,58
10 0,48 29 0,47 48 0,48 71 0,50 90 0,30
11 0,02 30 0,08 49 0,85 72 0,74 91 0,50
12 0,59 31 0,48 50 0,88 73 0,50 92 0,31
13 0,03 32 0,38 51 0,50 74 0,71 93 0,40
14 0,99 33 0,48 52 0,30 75 0,70 94 0,62
15 0,50 34 0,72 57 0,84 76 0,50 95 0,62
16 0,01 35 0,01 58 0,20 77 0,62 96 0,88
17 0,38 36 0,73 59 0,40 78 0,39 97 0,88
18 0,50 37 0,62 60 0,73 79 0,62 98 0,31
19 0,37 38 0,11 61 0,62 80 0,40 99 0,99

Regresse-se novamente o modelo mas com a variável dependente corrigida destes outliers e teste-
se a hipótese da normalidade dos resíduos.

1.1.3 Validação dos pressupostos do modelo

7) Linearidade do fenómeno em estudo


Esta hipótese valida-se a partir da representação gráfica entre a variável independente (Leitura
Aprazível em XX’) e a variável dependente (Tempo de leitura do semanário em YY’) já sem
outliers influentes. Obtenha-se o gráfico com as restantes observações para cada uma das
variáveis, através dos comandos

Graphs, Chart Builder, Gallery: Scatter/Dot

Decisão: O ajustamento não é o melhor mas existe uma relação causal e linear de sinal negativo (o
declive da reta é decrescente). É visível nesta figura que a relação linear entre estas variáveis é
fraca mas existe (𝑅 = −0,473) e que as variáveis variam em direções opostas.

©ISCTE-Instituto Universitário de Lisboa 12


Modelos de regressão

Normalidade dos erros aleatórios


A partir dos comandos do SPSS Statistics

Analyze, Regression, Linear, Statistics, Save, Residuals, Standardized

obtém-se uma nova variável identificada na base de dados por ZRE_1 já sem as onze observações
que foram eliminadas. Depois, pede-se para esta nova variável o Normality Tests with Plots no
menu do Explore, ou seja

Analyze, Descriptive Statistics, Explore, Plots, NormalitS plots with tests, Both

Outputs: _________________________________________________________________________

Descriptives
Statistic Std. Error
Standardized Mean ,0000000 ,10539580
Residual 5% Trimmed Mean -,0262694
Median -,1754023
Variance ,989
Std. Deviation ,99430195
Minimum -1,83222
Maximum 2,42305
Range 4,25527
Interquartile Range 1,50775
Skewness ,352 ,255
Kurtosis -,571 ,506

Tests of Normality
Kolmogorov-Smirnova Shapiro-Wilk
Statistic df Sig. Statistic df Sig.
Standardized Residual ,100 89 ,029 ,975 89 ,079
a. Lilliefors Significance Correction

©ISCTE-Instituto Universitário de Lisboa 13


Modelos de regressão

Decisão: rejeita-se a hipótese da normalidade dos erros aleatórios se o nível de significância for de
0,05 ou 0,1. Assim, proceda-se a uma análise do coeficiente de assimetria:

, ]−1,96; +1,96[ para um 𝜆 = 0,95 (𝛼 = 0,05).


𝐶𝑜𝑒𝑓𝑖𝑐𝑖𝑒𝑛𝑡𝑒 𝑑𝑒 𝑎𝑠𝑠𝑖𝑚𝑒𝑡𝑟𝑖𝑎 = ≈ 1,38 ∈
, ]−1,645; +1,645[ para um 𝜆 = 0,9 (𝛼 = 0,1).

Conclusão: os erros aleatórios não seguem distribuição normal. Mas, como o coeficiente de assimetria
pertence ao intervalo de confiança quer para um 𝜆 = 0,95 quer para 𝜆 = 0,9, pode concluir-
se que a violação deste pressuposto não é grave e que os erros aleatórios seguem
aproximadamente distribuição normal.

A média dos erros aleatórios é nula


Esta hipótese está sempre verificada uma vez que é validada internamente aquando da estimação
pedida e visível no output Residual Statistics.
Residuals Statisticsa
Minimum Maximum Mean Std. Deviation N
Predicted Value 57,23 111,73 79,10 14,029 89
Residual -58,374 77,197 ,000 31,678 89
Std. Residual -1,832 2,423 ,000 ,994 89
Stud. Residual -1,847 2,440 ,000 1,005 89
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Homocedasticidade ou variância do erro aleatório constante4


Existe homocedasticidade (homogeneidade de variâncias) se os erros estimados se mantiverem
a uma distância aproximadamente constante relativamente ao zero do eixo das abcissas.
Regression Standardazied

Regression Standardazied

Regression Standardazied
Residual

Residual

Residual

Regression Standardized Preditcted Regression Standardized Preditcted Regression Standardized Preditcted


Value Value Value
(a) Homoscedasticidade (b) Heteroscedasticidade (c) Heteroscedasticidade e
não-linearidade

Figura 4 - Presença ou não da hipótese da homoscedastcidade

Em (a), os pontos observados estão dispersos aleatoriamente em torno de zero; em (b) os pontos
observados seguem um padrão em forma de funil, mostrando que os dados violam a hipótese de
homoscedasticidade; em (c), os pontos observados identificam heteroscedasticidade e uma
relação não linear. O teste de White é um dos testes mais usados para a deteção da hipótese da
homoscedasticidade ou heteroscedasticidade.

4
O teste de White é uma opção para validar ou não este pressuposto.
©ISCTE-Instituto Universitário de Lisboa 14
Modelos de regressão

Teste de White
As hipóteses deste teste são

𝐻 : 𝐴𝑠 𝑣𝑎𝑟𝑖â𝑛𝑐𝑖𝑎𝑠 𝑑𝑜𝑠 𝑟𝑒𝑠í𝑑𝑢𝑜𝑠 𝑠ã𝑜 ℎ𝑜𝑚𝑜𝑔é𝑛𝑒𝑎𝑠


𝐻 : 𝐴𝑠 𝑣𝑎𝑟𝑖â𝑛𝑐𝑖𝑎𝑠 𝑑𝑜𝑠 𝑟𝑒𝑠í𝑑𝑢𝑜𝑠 𝑛ã𝑜 𝑠ã𝑜 ℎ𝑜𝑚𝑜𝑔é𝑛𝑒𝑎𝑠
A estatística do teste é
𝑇 = 𝑛𝑅 ~𝜒 ( )

onde n é a dimensão da amostra e 𝑅 é o coeficiente de determinação de um novo modelo onde

a variável dependente é o quadrado dos erros do modelo inicial (𝑒 ) e as variáveis independentes


são a variável independente (Concordância com a Leitura aprazível), os produtos cruzados das
variáveis independentes duas a duas (que só existem no modelo de regressão linear múltiplo,
como, por exemplo, 𝑋 𝑋 , 𝑋 𝑋 ) e o quadrado de cada uma das variáveis independentes (que
neste caso só é 𝑋 ).
𝑒 =𝛼 +𝛼 𝑋 +𝛼 𝑋 +𝑣

Model Summaryb
Adjusted Std. Error of
Model R R Square R Square the Estimate
1 ,078a ,006 -,018 29,39728537
a. Predictors: (Constant), LeituraAprazível_2, Leitura aprazível
b. Dependent Variable: Unstandardized Residual

Decisão: o 𝑅 é igual a 0,006. Como a estatística do teste (0,516 < 11,07) pertence à região de
aceitação, não se rejeita a hipótese nula e conclui-se que se está perante a
homoscedasticidade dos resíduos.
𝑇 = 86 × 0,006 = 0,516 ~𝜒( ) ↔ 𝑣𝑎𝑙𝑜𝑟 𝑐𝑟í𝑡𝑖𝑐𝑜( ; , ) = 11,07

No IBM SPSS, esta hipótese é validada ou não através de um gráfico através dos seguintes
comandos:
Analyze, Regression, Linear, Plots

Output: _________________________________________________________________________

©ISCTE-Instituto Universitário de Lisboa 15


Modelos de regressão

Decisão: Como os círculos estão ± distribuídos aleatoriamente em relação a zero, pode dizer-se
que esta hipótese está validada visualmente.

8) Independência entre os erros aleatórios referentes a períodos diferentes


Só se valida esta hipótese quando os dados são temporais o que não é o caso. Contudo, para séries
temporais, a validação desta hipótese passa pelo valor da estatística Durbin-Watson.

Figura 5 – Exemplos de autocorrelação positiva (a) e negativa (b)

Alguns padrões de autocorrelação

Podem-se destacar os seguintes padrões:

 Processo auto-regressivo de 1ª ordem [𝐴𝑅(1)]: 𝜀 = 𝜌 𝜀 +𝑢


 Processo auto-regressivo de 2ª ordem [AR(2)]: 𝜀 = 𝜌 𝜀 +𝜌 𝜀 +u
 Processo auto-regressivo de p ordem [AR(𝑝)]: 𝜀 = 𝜌 𝜀 +𝜌 𝜀 +⋯+ 𝜌 𝜀 +u
 Processo de média móvel de 1ª ordem [𝑀𝐴(1)]: 𝜀 = 𝑢 − 𝜃 𝜀
 Processo de média móvel de 1ª ordem [𝑀𝐴(1)]: 𝜀 = 𝑢 − 𝜃 𝜀
 Processo de média móvel de 2ª ordem [𝑀𝐴(2)]: 𝜀 = 𝑢 − 𝜃 𝜀 −𝜃 𝜀
 Processo de média móvel de q ordem [𝑀𝐴(𝑞)]: 𝜀 = 𝑢 − 𝜃 𝜀 −𝜃 𝜀 ⋯− 𝜃 𝜀
 Processo auto-regressivo de 1ª ordem e de média móvel de 1ª ordem [𝐴𝑅𝑀𝐴(1,1)]: 𝜀 = 𝜌 𝜀 +
𝑢 −𝜃 𝜀
 Processo auto-regressivo de p ordem e de média móvel de q ordem [𝐴𝑅𝑀𝐴(𝑝, 𝑞)]: 𝜀 = 𝜌 𝜀 +
𝜌 𝜀 +⋯+ 𝜌 𝜀 +u −𝜃 𝜀 −𝜃 𝜀 ⋯− 𝜃 𝜀

©ISCTE-Instituto Universitário de Lisboa 16


Modelos de regressão

Mas, o processo mais comum em séries temporais é o processo autoregressivo de primeira ordem
𝐴𝑅(1).

Teste de Durbin-Watson
O teste de Durbin-Watson é um dos mais populares testes para testar ‘serial correlation’. Envolve
o cálculo da estatística do teste que se baseia nos resíduos obtidos através da estimação usando
o procedimento Ordinary Least Squares (OLS). Seja o modelo de regressão linear

𝑌 = 𝛽 +𝛽 𝑋 +⋯+𝛽 X +𝜀
A estatística é igual a

∑ 𝜀̂ − 𝜀̂
𝐷𝑊 =
∑ 𝜀̂
Assume-se que:
 O processo gerador dos erros é um 𝐴𝑅(1) do tipo 𝜀 = 𝜌 𝜀 + 𝑢 onde |𝜌| < 1 𝑒 𝑢 é um
ruído branco5.

Figura 6 – Exemplo de um modelo aditivo para modelar um ruído branco

 Os coeficientes estimados do modelo sao consistentes6.


 O modelo de regressão inclui o termo da constante.
 As variáveis explicativas são determinísticas.

 Um valor de DW inferior a d , conduz à rejeição da hipótese nula de não se estar perante erros
correlacionados.
 Um valor de DW maior que d conduz à decisão de não se rejeitar a hipótese nula.
 O intervalo entre d e d ou entre [(4 − d )𝑒 (4 − d )] conduz a um valor que pertence a uma

5
Para modelar o ruído branco, temos os modelos aditivos em torno de um dado nível e modelos multiplicativos em
que a variação aleatório é proporcional a um dado nível.
6
Implica que não se possa incluir como variáveis explicaticvas lags da variável dependente.
©ISCTE-Instituto Universitário de Lisboa 17
Modelos de regressão

decisão inconclusiva (por ser possível que a correlação entre os erros seja devida à autocorrelação
entre as variáveis independentes em vez de ser devida à autocorrelação dos erros).
Região de rejeição = [𝟎; 𝒅𝑳 [  [𝟒 − 𝒅𝑳 ; 𝟒[
Região inconclusiva = [𝒅𝑳 ; 𝒅𝑼 [  [𝟒 − 𝒅𝑼 ; 𝟒 − 𝒅𝑳 [
Região de aceitação = [𝒅𝑼 ; 𝟒 − 𝒅𝑼 [
The values of (𝑑 ) and (𝑑 ) are obtained from the following table where n is the sample
dimension and p is the number of independent variables:

Tabela 5: Valores críticos para o teste de Durbin-Watson


𝑝 1 2 3 4 5 10 15
𝑛 𝑑𝐿 𝑑𝑈 𝑑𝐿 𝑑𝑈 𝑑𝐿 𝑑𝑈 𝑑𝐿 𝑑𝑈 𝑑𝐿 𝑑𝑈 𝑑𝐿 𝑑𝑈 𝑑𝐿 𝑑𝑈
6 0.61 1.40
10 0.88 1.32 0.70 1.64 0.53 2.02 0.38 2.41 0.24 2.82
20 1.20 1.41 1.10 1.54 1.00 1.68 0.89 1.83 0.79 1.99 0.34 2.89 0.06 3.68
30 1.35 1.49 1.28 1.57 1.21 1.65 1.14 1.74 1.07 1.83 0.71 2.36 0.39 2.94
40 1.44 1.54 1.39 1.60 1.34 1.66 1.29 1.72 1.23 1.79 0.95 2.15 0.68 2.56
50 1.50 1.59 1.46 1.63 1.42 1.67 1.38 1.72 1.34 1.77 1.11 2.05 0.88 2.35
60 1.55 1.62 1.51 1.65 1.48 1.69 1.44 1.73 1.41 1.77 1.22 1.98 1.03 2.28
70 1.58 1.64 1.55 1.67 1.53 1.70 1.49 1.74 1.46 1.77 1.31 1.95 1.14 2.15
80 1.61 1.66 1.59 1.69 1.56 1.72 1.53 1.74 1.51 1.77 1.37 1.93 1.22 2.09
90 1.64 1.68 1.61 1.70 1.59 1.73 1.57 1.75 1.54 1.78 1.42 1.91 1.29 2.06
100 1.65 1.69 1.63 1.72 1.61 1.74 1.59 1.76 1.57 1.78 1.46 1.90 1.35 2.03
200 1.76 1.78 1.75 1.79 1.74 1.80 1.73 1.81 1.72 1.82 1.67 1.87 1.61 1.93

A autocorrelação pode ser positiva ou negativa. Se os dados revelam um padrão ascendente ou


descendente, a série exibe autocorrelação positiva; se os dados revelam um padrão ascendente e
descendente então a série exibe uma autocorrelação negativa.

Regra prática:
 Se (𝜌 ≈ 0), 𝑑 ≈ 2, os erros não estão correlacionados;
 If (𝜌 ≈ +1), 𝑑 ≈ 0, os erros estão positivamente correlacionados;
 If (𝜌 ≈ −1), 𝑑 ≈ 4, os erros estão negativamente correlacionados.

Um problema associado a este teste é a presença de duas regiões inconclusivas.


Na presença de violações destas hipóteses para modelos autoregressivos (moving average
models), a estatística Durbin-Watson subestima a autocorrelação.
Teste h de Durbin
Mas, para grandes amostras, a estatística Durbin's h-test ou Durbin-Watson h-statistic, que segue
distribuição normal, deve ser usada e é calculada como

1 𝑛
ℎ = 1− 𝑑
2 1 − 𝑛 𝑉𝑎𝑟 𝛽

onde 𝑑 é a estatística Durbin-Watson, 𝛽 é o coeficiente estimado da variável dependente


desfazada (lagged), e 𝑛 é o número de observações.

©ISCTE-Instituto Universitário de Lisboa 18


Modelos de regressão

Teste de Breusch-Godfrey (BG)


O teste BG contempla a possibilidade de erros do tipo ARMA(p,q) e aplica-se a casos onde
possamos ter termos desfasados como variáveis explicativas. Suponhamos que

𝑌 = 𝛽 + 𝛽 𝑋 + ⋯+ 𝛽 X +𝑒
Onde 𝑒 é ruído branco. Se 𝜀 = 𝑒 , não há o problema de autocorrelação.

A estatística deste teste baseia-se na seguinte equação auxiliar:

𝑒 = 𝛼 + 𝛼 𝑋 + ⋯+ 𝛼 X +𝜏 𝑒 +𝜏 𝑒 + ⋯+ 𝜏 𝑒 +𝑣
Reduziu-se o número de observações para (𝑛 − 𝑝) devido aos termos autoregressivos. O 𝑅 desta
última equação é usado para calcular a estatística deste teste:
BG = 𝑛𝑅 ~ 𝜒( )

Se a estatística deste teste é superior ao valor crítico para um determinado nível de significância,
rjeita-se a hipótese nula (de não existência de autocorrelação).

No IBM SPSS, usam-se os seguintes comandos para ativar o teste Durbin-Watson.

Analyze, Regression, Linear, Statistics

1.1.4 Reestimação do MRLS para a variável dependente sem outliers

O modelo final estimado conduz aos seguintes outputs:


Model Summary
Adjusted R Std. Error of
Model R R Square Square the Estimate
1 ,405a ,164 ,154 31,860
a. Predictors: (Constant), Leitura aprazível

ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 17320,477 1 17320,477 17,064 <,001b
Residual 88307,612 87 1015,030
Total 105628,090 88
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), Leitura aprazível

©ISCTE-Instituto Universitário de Lisboa 19


Modelos de regressão

Coefficientsa
Unstandardized Standardized
Coefficients Coefficients
Model B Std. Error Beta t Sig.
1 (Constant) 135,087 13,967 9,672 <,001
Leitura aprazível -15,571 3,769 -,405 -4,131 <,001
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Resumindo, a equação estimada é

𝑌 = Tempo de leitura do semanário (minutos) para o sujeito i


𝑋 = Leitura Aprazível para o sujeito i

𝑌 = 135,087 − 15,571 𝑋 𝑅 = 0,164; 𝑅 = 0.154


(0,000) (0,000)

Os valores entre parênteses curvos são os p-values.

1.2 Modelo de regressão linear múltiplo

Será que o modelo anteriormente estimado pode ser melhorado?

1.2.1 Modelo 2

Exemplo 2:

Acredita-se que o Tempo de leitura dos semanários, em minutos, também é explicado pelas
Escalões etários dos leitores. Será que esta expectativa se pode comprovar?

Esta nova variável independente7 está codificada como uma variável nominal com duas
categorias, assumindo os valores:
0 Escalão_etário ≤ 30 anos
1 Escalão_etário = de 30 a 39 anos
2 Escalão_etário ≥ 40 anos

Para uma variável independente com p categorias são necessárias (𝑝 − 1) variáveis dummy que
são variáveis binárias com zeros e uns: o zero quando se estiver perante a ausência do atributo e
um significa a presença do atributo. Seja a categoria Ensino médio ou superior, codificada com
1, a variável de referência. Quando a variável nominal tem mais de duas categorias é necessário
criar (𝑝 − 1) variáveis dummy. Os comandos do SPSS Statistics são:

Transform, Create Dummy Variable for

7
Recodificada em 1 (até aos 30 anos), a categoria de referência, 2 (31-39), e 3 (Mais de 40 anos).
©ISCTE-Instituto Universitário de Lisboa 20
Modelos de regressão

1.2.2 Hipóteses e validação das hipóteses

[Link] Hipóteses do MRLM


Os pressupostos do MRLM são os mesmos do MRLS e mais um pressuposto: o da independência
entre as variáveis independentes do modelo. Assim, os pressupostos são a linearidade do
fenómeno em estudo, a normalidade do erro aleatório, a média do erro aleatório é nula, a
variância do erro aleatório é constante, a independência entre os erros aleatórios8 e

 Independência entre as variáveis independentes (não há multicolinearidade entre as variáveis


independentes)

[Link] Validação das hipóteses relativas ao modelo 2

Linearidade do fenómeno em estudo

8
Que não se valida neste estudo por não se estar perante uma série cronológica.
©ISCTE-Instituto Universitário de Lisboa 21
Modelos de regressão

Obtendo-se o gráfico de dispersão entre as variáveis em estudo, verifica-se que a relação entre o
Tempo de leitura do semanário e os escalões etários dos leitores existe na amostra.

Figura 7: Relação entre o Tempo de leitura do semanário e os Escalões etários dos leitores

A relação linear entre a variável dependente e escalões etários dos leitores pode ser estudada
acedendo-se aos comandos SPSS Statistics

Analyze, Compare Means, Means, Options

Output: __________________________________________________________________________

Report
Tempo de leitura do semanário (minutos)
Escalão etário Mean N Std. Deviation
< 30 anos 66,96 23 39,160
de 30 a 39 anos 76,94 36 28,114
>=40 anos 93,75 16 29,749
Total 77,47 75 33,180

ANOVA Table
Sum of Squares df Mean Square F Sig.
Tempo de leitura do Between (Combined) 6792,821 2 3396,411 3,275 ,044
semanário (minutos) Groups Linearity 6578,715 1 6578,715 6,343 ,014
* Escalão etário
Deviation from Linearity 214,106 1 214,106 ,206 ,651
Within Groups 74675,845 72 1037,165
Total 81468,667 74

©ISCTE-Instituto Universitário de Lisboa 22


Modelos de regressão

Measures of Association
R R Squared Eta Eta Squared
Tempo de leitura do semanário (minutos) * Escalão etário ,284 ,0811 ,289 ,0832
, ,
Notas: (1) ; (2) .
, ,

O teste para a linearidade tem uma significância inferior a 0,05 (𝑆𝑖𝑔 = 0,014) o que indica que
há uma relação linear entre as variáveis; O teste dos desvios da linearidade tem uma significância
superior a 0,05 (𝑆𝑖𝑔 = 0,651) o que significa que não há uma relação não linear significativa
entre as variáveis além da componente linear, mas contribuindo para a existência de uma relação
combinada (𝑆𝑖𝑔 = 0,044) entre a componente linear e a componente não linear.

Interpretação: Contudo, pelos outputs pode-se concluir que os quadrados das respetivas associações são
muito próximas de zero (𝑅 = 0,081 𝑒 𝐸𝑡𝑎 = 0,083). Significa assim, que esta
variável independente explica somente cerca de 8% das variações da variação da
dependente patente no Figura 7.

Normalidade do erro aleatório

Regresse-se o modelo com as duas variáveis independentes e guardem-se os standardized


residuals para se validar o pressuposto da normalidade dos resíduos.

Outputs: ______________________________________________________________________

Case Processing Summary


Cases
Valid Missing Total
N Percent N Percent N Percent
Standardized Residual 75 87,2% 11 12,8% 86 100,0%

Tests of Normality
Kolmogorov-Smirnova Shapiro-Wilk
Statistic df Sig. Statistic df Sig.
Standardized Residual ,092 75 ,183 ,960 75 ,019
a. Lilliefors Significance Correction

Decisão: o pressuposto da normalidade dos resíduos está validado (𝐾𝑆(75) = 0,092; 𝑆𝑖𝑔 = 0,183).

A média do erro aleatório é nula

Este hipótese está sempre verificada uma vez que é validada internamente aquando da estimação
do modelo.

A variância do erro aleatório é constante

Obtenha-se o respetivo gráfico em que assenta a validação desta hipótese.

©ISCTE-Instituto Universitário de Lisboa 23


Modelos de regressão

Decisão: como os círculos estão ± aleatoriamente distribuídos em relação a zero, esta hipótese
está validada.

Independência entre os erros aleatórios referentes a períodos diferentes

Só se valida esta hipótese quando os dados são temporais (modelos cronológicos).

Independência entre as variáveis explicativas

Uma das hipóteses do modelo é que as variáveis explicativas sejam independentes, isto é, que
nenhuma variável independente esteja perfeitamente correlacionada com as outras, condição
necessária para que os parâmetros sejam estimados. A multicolinearidade elevada produz
variâncias elevadas associadas às estimativas dos parâmetros que deixam de ser credíveis.

Multicolinearidade: diagnóstico

O diagnóstico da multicolinearidade pode ser feita pela correlação elevada entre as variáveis
explicativas (duas a duas), mas quando mais de duas variáveis independentes quantitativas forem
colineares, a matriz das correlações já não deve ser usada. Assim, o diagnóstico da
multicolinearidade pode ser feita pelo Variance Inflation factor (VIF). O VIF relaciona-se com o
coeficiente de determinação do modelo entre uma variável independente (tratada como
dependente) e as outras independentes. Valores de VIF superiores a 10 indicam a presença deste
problema (Sheather, 20099 ou Kutner et al., 2005) e valores de VIF superiores a 5 podem ser
problemáticos10.
1
𝑉𝐼𝐹 =
1−𝑅

Um outro indicador usado para a deteção da multicolinearidade é o Condition index. Baseia-se


nos valores próprios11 (eigenvalues) da matriz das correlações entre as variáveis independentes.
Valores próprios próximos de zero indicam que as variáveis estão fortemente correlacionadas; se

9
Sheather, Simon (2009). A modern approach to regression with R. New Sork, NS: Springer.
10
Devem ser analisados no output seguinte (Condition index).
11
Valores próprios são as raízes características da matriz .
©ISCTE-Instituto Universitário de Lisboa 24
Modelos de regressão

forem próximos de 1, as variáveis independentes são ortogonais. Condition index maior que 15
indica um possível problema com colinearidade; maior que 30, um problema sério. Na presença
de um caso grave de multicolinearidade sugere-se que se reestime a regressão usando os valores
das variáveis independentes estandardizados (z scores).

Sinais de multicolinearidade numa análise de regressão são os seguintes:

 Grandes desvios padrão das estimativas são responsáveis por estimativas instáveis e baixos
valores
 As estimativas dos parâmetros variam consideravelmente de amostra para amostra
 Sinal errado para a estimativa de um parâmetro que é inesperado (da teoria) e conlusões erráticas
das significâncias das estimativas dos coeficientes
 Fortes correlações entre pares de variáveis

Obtenham-se estes coeficientes através dos comandos do SPSS Statistics

Analyze, Regression, Linear, Statistics, Collinearity diagnostics

Outputs: ______________________________________________________________________

Unstandardized Standardized Collinearity


Coefficients Coefficients Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) 121,575 14,954 8,130 <,001
Leitura aprazível -14,779 3,693 -,415 -4,002 <,001 ,982 1,019
EscalãoEtário: de 30 a 39 anos 7,712 7,841 ,117 ,984 ,329 ,746 1,341
EscalãoEtário: >=40 anos 21,593 9,625 ,268 2,243 ,028 ,736 1,359

Interpretação: não se detecta a existência do problema de multicolinearidade entre as variáveis


Leitura Aprazível e as Habilitações uma vez que o VIF entre elas é próximo de 1.
(O coeficiente TOL é a % da variância de uma dada variável independente que não
é explicada por outras variáveis independentes. Quando TOL é perto de zero, a
multicolinearidade é elevada, o que não é o caso neste exemplo).

Collinearity Diagnosticsa
Variance Proportions
Condition Leitura EscalãoEtário= EscalãoEtário=
Model Dimension Eigenvalue Index (Constant) aprazível de 30 a 39 anos >=40 anos
1 1 2,730 1,000 ,01 ,01 ,03 ,02
2 1,000 1,652 ,00 ,00 ,11 ,41
3 ,241 3,366 ,02 ,06 ,78 ,48
4 ,029 9,682 ,97 ,93 ,08 ,09
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Interpretação: este output revela que não há problemas de multicoliearidade uma vez que as
associações são fortes entre uma das variáveis independentes e a constante.

©ISCTE-Instituto Universitário de Lisboa 25


Modelos de regressão

Solução

A solução do problema de multicolinearidade entre as variáveis independentes passa por

 Aumentar-se a dimensão amostral


 Eliminar-se a variável mais correlacionada com as demais
 Centrarem-se as variáveis independentes
 (...)

1.2.3 Estimação do modelo 2

Depois da validação dos pressupostos do modelo terem sido validados, passa-se para a etapa
seguinte que consiste na estimação final do modelo conduz aos seguintes outputs:

Outputs: ______________________________________________________________________

Model Summaryb
2
Adjusted R Std. Error of O R Ajustado (𝑅 ) é corrigido
Model R R Square Square the Estimate
segundo o número de variáveis
1 ,502a ,252 ,220 29,295 independentes e a dimensão da
a. Predictors: (Constant), EscalãoEtário=>=40 anos, Leitura aprazível, amostra.
EscalãoEtário=de 30 a 39 anos
b. Dependent Variable: Tempo de leitura do semanário (minutos)

Unstandardized Standardized Collinearity


Coefficients Coefficients Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) 121,575 14,954 8,130 <,001
Leitura aprazível -14,779 3,693 -,415 -4,002 <,001 ,982 1,019
EscalãoEtário=de 30 a 39 anos 7,712 7,841 ,117 ,984 ,329 ,746 1,341
EscalãoEtário=>=40 anos 21,593 9,625 ,268 2,243 ,028 ,736 1,359

[𝐀] [𝐁] [𝐂]

[𝐀] – Coeficientes de regressão parciais: a partir das estimativas dos coeficientes associadas às
variáveis independentes, fica-se a conhecer a contribuição de cada uma destas variáveis na
explicação da variável dependente, se o efeito da(s) outra(s) variável(eis) estiver controlado;
[𝐁] - Coeficientes de regressão parciais com base nos valores estandardizados: as respectivas
estimativas são usadas para comparar o efeito das variáveis independentes em Y quando as
variáveis estão medidas em unidades diferentes. Permite dizer que a variável independente que
mais contribui para explicar variações do Tempo de leitura do semanário é a concordância com o
índice Leitura Aprazível (-0,415):
[𝐂] – Variance Inflation factor: para diagnosticar a presença ou não de multicolinearidade.

©ISCTE-Instituto Universitário de Lisboa 26


Modelos de regressão

Resumindo as estimações efetuadas são:

Modelo 𝑌 = 133,508 − 15,831 𝑋 𝑅 = 0,198


1 (0,000) (0,000) 𝑅 = 0,166
𝑅 = 0,260
𝑅 = 0,243
Modelo 𝑌 = 121,575 − 14,779 𝑋 + 7,712 𝐷𝑢𝑚𝑚𝑦 + 21,593 𝐷𝑢𝑚𝑚𝑦 𝑉𝐼𝐹 = 1,019
2 (0,000) (0,000) (0,329) (0,028)
𝑉𝐼𝐹 = 1,341
𝑉𝐼𝐹 = 1,359
Nota: os valores entre parênteses são os p-values.

onde 𝑌 = 𝑇𝑒𝑚𝑝𝑜 𝑑𝑒 𝑙𝑒𝑖𝑡𝑢𝑟𝑎 𝑑𝑜 𝑠𝑒𝑚𝑎𝑛á𝑟𝑖𝑜 (𝑠𝑒𝑚 𝑜𝑢𝑡𝑙𝑖𝑒𝑟𝑠 𝑖𝑛𝑓𝑙𝑢𝑒𝑛𝑡𝑒𝑠) para o sujeito i; 𝑋 =


𝐿𝑒𝑖𝑡𝑢𝑟𝑎 𝐴𝑝𝑟𝑎𝑧í𝑣𝑒𝑙 para o sujeito i; 𝐷𝑢𝑚𝑚𝑦 = 𝐸𝑠𝑐𝑎𝑙ã𝑜 etário dos que têm entre 30 e 39 anos;
𝐷𝑢𝑚𝑚𝑦 = 𝐸𝑠𝑐𝑎𝑙ã𝑜 etário dos que têm 40 anos ou mais; a categoria de referência é ser mais jovem, i. e.,
ter menos de 30 anos; e 𝜀 é o erro aleatório para o sujeito i.

Conclusão: a inclusão da variável Habilitações literárias melhorou a capacidade explicativa da


concordância média com a Leitura Aprazível e das Habilitações dos leitores de
semanários (𝑅 passa de 0,166 para 0,243).

Interpretação: 𝛽 = −14,779  mantendo-se constante as dummies, por um aumento de um nível


de concordância da Leitura Aprazível, estima-se que o Tempo de
leitura do semanário diminua em média 14,779 minutos;

𝛽 = 21,593  mantendo-se constante 𝑋 , para um leitor pertencente ao nível


etário igual ou superior a 40 anos quando comparado com os que
têm no máximo 29 anos, estima-se que o Tempo de leitura do
semanário (em minutos) aumente 21,593 minutos, em média. Ou
seja, a estimação do termo independente passa de 121,575 para
143,168 min.

1.2.4 Modelo 3

Exemplo 3:

Acredita-se ainda que o Tempo de leitura dos semanários, em minutos, também é explicado
pelos atributos Caraterísticas físicas e Qualidade de informação. Será que estas expetativas
se podem comprovar?

[Link] Validação das hipóteses relativas ao modelo 3

Linearidade das relações

Obtendo-se os gráficos de dispersão entre as variáveis em estudo, verifica-se que a relação linear
entre o Tempo de leitura do semanário e as Caraterísticas físicas é fraca. Assim, adicione-se

©ISCTE-Instituto Universitário de Lisboa 27


Modelos de regressão

somente o índice qualidade de informação ao modelo como nova variável independente.

Figura 8: Relações entre o Tempo de leitura do semanário e cada um dos atributos


Caraterísticas físicas e Qualidade de informação

Normalidade do erro aleatório

Regresse-se o modelo com mais esta variável independente e guardem-se os standardized


residuals para se validar o pressuposto da normalidade dos resíduos.

Output: ______________________________________________________________________

Tests of Normality
Kolmogorov-Smirnova Shapiro-Wilk
Statistic df Sig. Statistic df Sig.
Standardized Residual ,079 75 ,200* ,963 75 ,029
*. This is a lower bound of the true significance.
a. Lilliefors Significance Correction

Decisão: o pressuposto da normalidade dos resíduos está validado.

A média do erro aleatório é nula

Este hipótese está sempre verificada uma vez que é validada internamente aquando da estimação
do modelo.

A variância do erro aleatório é constante

Obtenha-se o respetivo gráfico em que assenta a validação desta hipótese.

©ISCTE-Instituto Universitário de Lisboa 28


Modelos de regressão

Decisão: esta hipótese parece estar validada.

Independência entre os erros aleatórios referentes a períodos diferentes

Só se valida esta hipótese quando os dados são temporais (modelos cronológicos).

Independência entre as variáveis explicativas

Para a validação desta hipótese é necessário aceder-se ao comando Collinearity diagnostics do


SPSS Statistics.
Coefficientsa
Unstandardized Standardized Collinearity
Coefficients Coefficients Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) 146,409 22,635 6,468 <,001
Leitura aprazível -14,375 3,675 -,403 -3,911 <,001 ,976 1,024
EscalãoEtário=de 30 a 39 anos 8,553 7,802 ,130 1,096 ,277 ,742 1,348
EscalãoEtário=>=40 anos 23,043 9,603 ,286 2,400 ,019 ,728 1,374
I1_QualidadeInformação -6,534 4,497 -,149 -1,453 ,151 ,985 1,015
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Decisão: não se detecta a existência do problema de multicolinearidade entre as variáveis


independentes uma vez que o VIF entre elas é próximo de 1.

[Link] Estimação do modelo 3


Pretende-se estimar o modelo

𝑌 = 𝛽 + 𝛽 𝑋 + 𝛽 𝐷𝑢𝑚𝑚𝑦 + 𝛽 𝐷𝑢𝑚𝑚𝑦 + 𝛽 𝑋 + 𝛽 𝑋 𝜀
onde 𝑋 = 𝑄𝑢𝑎𝑙𝑖𝑑𝑎𝑑𝑒 𝑑𝑎 𝑖𝑛𝑓𝑜𝑟𝑚𝑎çã𝑜 para o sujeito i e 𝑋 = Características físicas para o
mesmo sujeito i.
Outputs______________________________________________________________________
Model Summaryb À medida que são adicionadas novas
Adjusted R Std. Error of variáveis independentes, o erro padrão da
Model R R Square Square the Estimate regressão vai decrescendo, o que indica que
1 ,552a ,305 ,254 28,651 as estimativas são mais credíveis.
a. Predictors: (Constant), I2_CaracterísticasFísicas, EscalãoEtário=>=40
anos, Leitura aprazível, I1_QualidadeInformação, EscalãoEtário=de 30 a 𝑂 𝑒𝑟𝑟𝑜 𝑝𝑎𝑑𝑟ã𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 = 29,310
39 anos
𝑂 𝑒𝑟𝑟𝑜 𝑝𝑎𝑑𝑟ã𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 = 29,295
b. Dependent Variable: Tempo de leitura do semanário (minutos)
𝑂 𝑒𝑟𝑟𝑜 𝑝𝑎𝑑𝑟ã𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 = 28,651

©ISCTE-Instituto Universitário de Lisboa 29


Modelos de regressão

ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 24826,522 5 4965,304 6,049 <,001b
Residual 56642,145 69 820,901
Total 81468,667 74
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), I2_CaracterísticasFísicas, EscalãoEtário=>=40 anos,
Leitura aprazível, I1_QualidadeInformação, EscalãoEtário=de 30 a 39 anos

Coefficientsa
Unstandardized Standardized Collinearity
Coefficients Coefficients Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) 122,968 26,031 4,724 <,001
I3 Leitura aprazível -14,794 3,630 -,415 -4,075 <,001 ,972 1,029
EscalãoEtário=de 30 a 39 anos 10,382 7,760 ,157 1,338 ,185 ,728 1,373
EscalãoEtário=>=40 anos 23,265 9,466 ,289 2,458 ,016 ,728 1,374
I1_QualidadeInformação -8,541 4,579 -,195 -1,865 ,066 ,923 1,084
I2_CaracterísticasFísicas 7,966 4,557 ,184 1,748 ,085 ,913 1,095
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Conclusão: a variável, das variáveis quantitativas, que mais contribui para a capacidade explicativa
do modelo é o índice Leitura Aprazível (-0,415) e a que menos contribui é é o índice
Caraterísticas físicas (0,184). A inclusão das duas últimas variáveis são significativas
para um nível de significância de 0,1.

Resumindo, as estimações efetuadas são:

Modelo 𝑌 = 133,508 − 15,831 𝑋 𝑅 = 0,198


1 (0,000) (0,000) 𝑅 = 0,166
Modelo 𝑌 = 121,575 − 14,779 𝑋 + 7,712 𝐷 + 21,593 𝐷 𝑅 = 0,260
2 (0,000) (0,000) (0,329) (0,028) 𝑅 = 0,243
𝑉𝐼𝐹 = 1,019
𝑉𝐼𝐹 = 1,341
𝑉𝐼𝐹 = 1,359
Modelo 𝑌 = 122,968 − 14,794 𝑋 + 10,382 𝐷 +23,265 𝐷 − 8,541 𝑋 + 7,966 𝑋 𝑅 = 0,305
3 (0,000) (0,000) (0,185) (0,016) (0,066) (0,085) 𝑅 = 0,254
𝑉𝐼𝐹 = 1,029
𝑉𝐼𝐹 = 1,373
𝑉𝐼𝐹 = 1,374
𝑉𝐼𝐹 = 1,084
𝑉𝐼𝐹 = 1,095

Notas: X é a Qualidade da informação para o sujeito i e X são as Características físicas para o mesmo sujeito.

Conclusão: a inclusão das variáveis Caraterísticas físicas e Qualidade da informação melhorou a


capacidade explicativa do modelo (𝑅 passa de 0,243 para 0,254). A variável que mais
contribui para a capacidade explicativa do modelo é a Leitura Aprazível (-0,415) e a
que menos contribui é o Escalão Etário dos que têm entre 30 e 39 anos (0,157 com um
𝑆𝑖g = 0,185).

©ISCTE-Instituto Universitário de Lisboa 30


Modelos de regressão

Exemplo 4:

Acredita-se ainda que o nível educacional do leitor pode explicar o Tempo de leitura dos
semanários, em minutos. Será que esta expectativa se pode comprovar?

Após se ter validado as hipóteses do MRL do modelo 4, apresentam-se os resultados das


respetivas estimativas.

1.2.5 Modelo 4

Pretende-se estimar o modelo

𝑌 = 𝛽 +𝛽 𝑋 +𝛽 𝐷 +𝛽 𝐷 +𝛽 𝑋 +𝛽 𝑋 +𝛽 𝑋 +𝛽 𝐷 çã , +𝜀

onde
𝐷 çã , = 𝐸𝑛𝑠𝑖𝑛𝑜 𝑚é𝑑𝑖𝑜 𝑜𝑢 𝑠𝑢𝑝𝑒𝑟𝑖𝑜𝑟
para o leitor i (sendo a categoria de referência os que têm níveis educacionais até ao ensino
secundário.
Após se ter validado as hipóteses do MRL do modelo 4, apresentam-se os resultados das
respetivas estimativas.

Outputs: ______________________________________________________________________

Model Summaryb
Adjusted R Std. Error of the
Model R R Square Square Estimate
1 ,594a ,352 ,294 28,243
a. Predictors: (Constant), habilit=ensino médio e superior, EscalãoEtário=de 30 a 39
anos, I1_QualidadeInformação, Leitura aprazível, I2_CaracterísticasFísicas,
EscalãoEtário=>=40 anos
b. Dependent Variable: Tempo de leitura do semanário (minutos)

ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 28657,475 6 4776,246 5,988 <,001b
Residual 52646,635 66 797,676
Total 81304,110 72
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), habilit=ensino médio e superior, EscalãoEtário=de 30 a 39 anos,
I1_QualidadeInformação, Leitura aprazível, I2_CaracterísticasFísicas, EscalãoEtário=>=40
anos

©ISCTE-Instituto Universitário de Lisboa 31


Modelos de regressão

Coefficientsa
Unstandardized Standardized Collinearity
Coefficients Coefficients Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) 111,065 26,693 4,161 <,001
I1 Leitura aprazível -16,346 3,662 -,458 -4,463 <,001 ,931 1,074
EscalãoEtário=de 30 a 39 anos 10,942 7,813 ,164 1,400 ,166 ,717 1,394
EscalãoEtário=>=40 anos 24,347 9,419 ,302 2,585 ,012 ,720 1,390
I2_CaracterísticasFísicas 9,151 4,569 ,209 2,003 ,049 ,902 1,109
I1_QualidadeInformação -7,415 4,569 -,168 -1,623 ,109 ,918 1,090
Habilit=ensino médio e superior 14,443 6,880 ,216 2,099 ,040 ,924 1,083
a. Dependent Variable: Tempo de leitura do semanário (minutos)

Conclusão: a inclusão da variável Nivel educacional para a categoria ensino médio ou superior
igual a 1 aumentou a capacidade explicativa do modelo (𝑅 = 0,294) quando no
modelo anterior é de 0,254; a variável que mais contribui para a capacidade explicativa
deste modelo continua a ser a Leitura aprazível (-0,458) e a que menos contribui é a
dummy Escalão etário dos que têm idades entre os 30 e os 39 anos (0,164).

Resumindo, as estimações efetuadas são:

1 𝑌 = 133,508 − 15,831 𝑋 𝑅 = 0,198


(0,000) (0,000) 𝑅 = 0,166

2 𝑌 = 121,575 − 14,779 𝑋 + 7,712 𝐷𝑢𝑚𝑚𝑦 + 21,593 𝐷𝑢𝑚𝑚𝑦 𝑅 = 0,260


(0,000) (0,000) (0,329) (0,028) 𝑅 = 0,243
3 𝑌 = 122,968 − 14,794 𝑋 + 10,382 𝐷 +23,265 𝐷 − 8,541 𝑋 + 7,966 𝑋 𝑅 = 0,305
(0,000) (0,000) (0,185) (0,016) (0,066) (0,085) 𝑅 = 0,254

4 𝑌 = 111,065 − 16,346 𝑋 + 10,942 𝐷 +24,347 𝐷 + 9,151 𝑋 − 7,415 𝑋 + 14,443 𝐷 , 𝑅 = 0,305


(0,000) (0,001) (0,166) (0,012) (0,049) (0,109) (0,040) 𝑅 = 0,254

1.3 Previsão

Um bom modelo pode ser usado para previsão. Apesar da qualidade do Modelo 4 não ser boa,
utilize-se este modelo, modelo completo, para fornecer previsões para o Tempo de leitura do
semanário por razões pedagógicas.

1.3.1 Previsão pontual

Se por hipótese se admitir que a estrutura do passado se vai manter num futuro próximo,
assumindo-se que o modelo estimado é um bom modelo, pode-se usar este modelo estimado para
previsão:

©ISCTE-Instituto Universitário de Lisboa 32


Modelos de regressão

Exemplo 5:

Se um sujeito com id 110 atribuir concordâncias de 4,2 à Leitura aprazível, 3,75 às


Caraterísticas físicas dos semanários, 3,91 à Qualidade de informação e tiver 48 anos de
idade e licenciatura, qual o valor esperado para o Tempo de leitura do semanário
(minutos)?

A previsão média de Y dado um determinado valor de X significa estimar a média de 𝑌|𝑋 ∗ =


𝐸[𝑌|𝑋 ∗ ], ou seja,

𝑌 , = 111,065 − 16,346 × 4,2 + 10,942 × 0 + 24,347 × 1 + 9,151 × 3,75 − 7,415 × 3,91


+14,443 ≈ 86,5267 min

Interpretação: esse leitor com id 110 levará em média cerca de 86,5267 minutos a ler o semanário
preferido. Mais interessante que a estimação pontual para uma previsão de um valor
da variável dependente é a estimação intervalar de previsão.

1.3.2 Previsão intervalar

Para se estimar um intervalo de confiança com um determinado nível de confiança (𝜆) para uma
ponderação de 4,2 à leitura aprazível, usa-se a seguinte expressão:
1 (𝑋 − 𝑋)
𝜎 =𝜎 1+ +
𝑛 ∑(𝑋 − 𝑋)

O intervalo aleatório a ser estimado é igual a: 𝑌 − 𝑡( ; . )𝜎 ; 𝑌 + 𝑡( ; . )𝜎 .

No exemplo considerado no último modelo,


Residuals Statisticsa
Std.
Minimum Maximum Mean Deviation N
Predicted Value 23,68 122,41 77,33 19,950 73
Residual -44,722 60,693 ,000 27,041 73 𝜎 = 27,041 = 577,969681
Std. Predicted Value -2,689 2,260 ,000 1,000 73
Std. Residual -1,583 2,149 ,000 ,957 73
a. Dependent Variable: Tempo de leitura do semanário (minutos)

id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋)
1 2 2,56 12 3,5 0,01 23 3 0,36 34 3 0,36
2 3,5 0,01 13 4 0,16 24 3,5 0,01 35 4 0,16
3 3,5 0,01 14 3 0,36 25 2,5 1,21 36 3,5 0,01
4 3,5 0,01 15 2,5 1,21 26 2,5 1,21 37 3,5 0,01
5 1,5 4,41 16 1,5 4,41 27 4 0,16 38 3,5 0,01
6 2,5 1,21 17 3,5 0,01 28 4 0,16 39 3,5 0,01
7 3,5 0,01 18 3 0,36 29 3,5 0,01 40 4 0,16
8 3 0,36 19 3,5 0,01 30 4 0,16 41 4,5 0,81
9 3,5 0,01 20 1,5 4,41 31 3 0,36 42 5 1,96
10 3,5 0,01 21 1,5 4,41 32 3 0,36 43 2,5 1,21
11 2 2,56 22 2,5 1,21 33 3,5 0,01 44 4 0,16

©ISCTE-Instituto Universitário de Lisboa 33


Modelos de regressão

id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋)
45 3 0,36 56 3,5 0,01 67 5 1,96 78 4 0,16
46 5 1,96 57 4,5 0,81 68 4 0,16 79 4 0,16
47 2,5 1,21 58 5 1,96 69 4 0,16 80 5 1,96
48 5 1,96 59 4,5 0,81 70 4 0,16 81 5 1,96
49 2 2,56 60 5 1,96 71 5 1,96 82 4,5 0,81
50 3 0,36 61 3 0,36 72 4 0,16 83 3,5 0,01
51 3,5 0,01 62 4 0,16 73 5 1,96 84 3,5 0,01
52 3,5 0,01 63 4 0,16 74 3,5 0,01 85 3,6 0
53 4 0,16 64 5 1,96 75 4,5 0,81 86 5 1,96
54 3,5 0,01 65 5 1,96 76 4,5 0,81 87 4 0,16
55 4,5 0,81 66 5 1,96 77 4 0,16 88 4 0,16

id 𝑋 (𝑋 − 𝑋)
89 4 0,16
90 5 1,96
91 4 0,16
92 5 1,96
93 3,5 0,01
94 4,5 0,81
95 4,5 0,81
96 4 0,16

1 (4,2 − 3,6)2
𝜎 = 577,969681 1 + + = 588,8218 ↔ 𝜎 ≈ 24,255665
73 70,9

𝑡( ; . ) = 2,00
Para 𝜆 = 0,95 ↔ 𝑡( ; . ) =
𝑡(
→ 𝑡( ; . ) ≈ 1,992
; . ) = 1,984

𝑌 = 86,5267

𝑌 − 𝑡( ; . )𝜎 ; 𝑌 + 𝑡( ; . )𝜎 ≈
]86,5267 − 1,992 × 24,255665 ; 86,5267 + 1,992 × 24,255665[ ≈ ]38,250 ; 134,844[

Prevê-se, com 95% de confiança que o tempo médio de leitura do semanáro preferido esteja entre
38,25 min e 134,84 min.

1.4 Considerações finais

Quando a análise dos resíduos sugere relações não lineares, a regressão linear não deve ser
utilizada sem previamente se linearizarem essas relações, por exemplo, com recurso ao uso de
logaritmos (naturais).

A omissão de uma variável independente importante pode conduzir a problemas de especificação


do modelo que se deve evitar. Mas, se um modelo estiver sobre-ajustado, i. e., se um modelo for
muito complexo para o conjunto dos dados de que se dispõe (muitos parâmetros e poucas
observações), se o tamanho da amostra não for suficientemente grande, o modelo ajustado não
se aproximará do modelo verdadeiro. Na presença de multicolinearidade, mais observações serão
necessárias.

©ISCTE-Instituto Universitário de Lisboa 34


Modelos de regressão

O método utilizado nestas estimações foi o método ENTER em que todas as variáveis entram
numa única iteração. Mas, na presença de muitas variáveis independentes é aconselhado utilizar-
se um dos três métodos sequenciais:

MÉTODO FORWARD – o modelo inicial inclui apenas a constante. A primeira variável


independente a ser adicionada é a que tiver uma maior correlação (positiva ou negativa) com a
variável dependente. Esta variável é adicionada ao modelo se conduzir ao maior valor da
estatística F da Anova; a segunda variável independente a ser adicionada é a que apresentar a
maior correlação com a variável dependente depois de ajustados os efeitos de 𝑋 sobre Y, etc. O
procedimento pára quando não há variáveis candidatas que satisfaçam o critério de entrada.

MÉTODO BACKWARD – o modelo é iniciado com todas as variáveis independentes e para cada uma

delas são calculadas estatísticas F; a variável com menor valor de F 𝐹 é comparada com
um valor crítico (𝐹 ) e se o valor da 𝐹 <𝐹 , essa variável é removida do
modelo; e etc. O procedimento pára quando não há variáveis que satisfaçam o critério removal.

MÉTODO STEPWISE – é uma mistura dos dois anteriores. Inicia-se só com uma variável
independente. Este método é adequado quando existem correlações relevantes entre as variáveis
independentes.

Exemplo 6:

Comparar as estimativas do modelo completo por diferentes métodos de seleção.

As estimativas obtidas constam da tabela seguinte.

Tabela 6: Comparação das estimativas obtidas por diferentes métodos

Método 𝑌 = 101,174 − 18,666 𝐿𝐴𝑝𝑟𝑎𝑧í𝑣𝑒𝑙 + 18,305 𝐻𝑎𝑏𝑖𝑙𝑖𝑡𝑎çõ𝑒𝑠 + 8,517 𝐺𝑟𝑎𝑓𝑖𝑠𝑚𝑜 𝑅 = 0,280


Enter (0,000) (0,000) (0,006) (0,071) 𝑅 = 0,254

Método 𝑌 = 133,219 − 17,880 𝐿𝐴𝑝𝑟𝑎𝑧í𝑣𝑒𝑙 + 18,239 𝐻𝑎𝑏𝑖𝑙𝑖𝑡𝑎çõ𝑒𝑠 𝑅 = 0,251


Stepwise (0,000) (0,000) (0,007) 𝑅 = 0,232

Interpretação: As estimativas dadas pelos dois métodos são diferentes.

©ISCTE-Instituto Universitário de Lisboa 35


Modelos de regressão

2. Modelos de regressão linear múltipla com efeitos de interação

Uma variável é considerada uma variável moderada se alterar a direção ou força da relação entre
a variável independente e a dependente. Há uma interação no sentido de que o efeito de uma
variável independente na variável dependente depende do nível de uma outra.

2.1 Efeitos de moderação entre variáveis explicativas quantitativas

Se as duas variáveis explicativas forem quantitativas, os efeitos de interação são modelados pela
identificação de um termo multiplicativo, o termo de interação (𝑋 𝑋 ), no MRLM:

𝑌𝒊 = 𝛽 + 𝛽 𝑋 + 𝛽 𝑀 + 𝛽 𝑋 × 𝑀 + 𝜀

Se o coeficiente 𝛽 for significativamente diferente de zero, i. e., se for significativo, pode-se


concluir que o efeito de 𝑋 em 𝑌 é moderado por 𝑋 (ou vice-versa), e, deste modo, conclui-se
que há um efeito de interação entre as variáveis independentes.

É assim expectável que a relação entre o efeito principal 𝑋 e Y se altere devido ao efeito da
variável moderadora nesta relação.

𝑋 𝑌

Figura 9 – Modelo de interação

No entanto, a inclusão desse termo multiplicativo pode levar à correlação entre as variáveis
independentes. Uma possibilidade para se evitar a potencial multicolinearidade entre as variáveis
independentes é usar os respetivos valores das variáveis centradas (𝑋 − 𝑋). Outra solução é
especificar no modelo teórico a variável independente (𝑋 ) e o termo de interação (𝑋 × 𝑀 ) e
omitir o termo com a variável moderadora.

Exemplo 7:

Estimar se o comportamento individual dos colaboradores é uma variável moderadora na


relação entre as práticas ambientais das empresas e a atração dessas organizações para
potenciais colaboradores, tendo em conta a base de dados Atratividade das [Link]

©ISCTE-Instituto Universitário de Lisboa 36


Modelos de regressão

Figura 10 – Modelo teórico simplificado

Coefficientsa
Unstandardized Standardized
Coefficients Coefficients Collinearity Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) -,036 ,063 -,581 ,562
D2 ,580 ,089 ,588 6,498 <,001 ,447 2,238
D2D13 ,116 ,033 ,321 3,535 <,001 ,444 2,253
D13 ,154 ,075 ,153 2,053 ,041 ,663 1,509
a. Dependent Variable: Atract_Valor Ambiental

Há um efeito de interação significativo entre a percepção das práticas ambientais da organização


e o valor ambiental enquanto fator de atratividade da empresa devido ao efeito da variável
moderadora iniciativas individuais ambientais no âmbito do trabalho desempenhado.

Figura 11 - Visualização dos efeitos de interação das iniciativas ambientais individuais na


relação entre a percepção das práticas ambientais da organização e o valor ambiental das
práticas ambientais das empresas12

Como a figura sugere, à medida que a percepção das práticas ambientais da organização aumenta,
o valor ambiental das práticas da organização também aumenta de acordo com o aumento dos
níveis das iniciativas ambientais dos colaboradores, mas convergindo para uma interseçção.

12
O gráfico obtido nao está relacionado com as estimativas obtidas na Figura 10.
©ISCTE-Instituto Universitário de Lisboa 37
Modelos de regressão

4.2 Efeitos de moderação entre variáveis explicativas qualitativas

Se a variável moderadora for qualitativa nominal (ou tratada como tal) com 𝑘 categorias, os
níveis referem-se a cada um dos (𝑘 − 1) dummies mais a categoria que serve de referência
(baseline level).

Desta forma, obtém-se (𝑚 − 1) colunas binárias na base de dados, preenchidas com 0’s e 1’s.
Para uma variável de moderação qualitativa com 3 categorias, uma delas é a categoria de
referência e, portanto, deve ficar omissa do modelo que é assim identificado:

𝑌𝒊 = 𝛽 + 𝛽 𝑋 + 𝛽 𝐷𝑢𝑚𝑚𝑦1 + 𝛽 𝐷𝑢𝑚𝑚𝑦2 + 𝛽 𝑋 × 𝐷𝑢𝑚𝑚𝑦1 + 𝛽 𝑋 × 𝐷𝑢𝑚𝑚𝑦2

+𝜀𝑖
Se o coeficiente 𝛽 e/ou 𝛽 forem significativamente diferentes de zero, pode-se concluir que o
efeito de 𝑋 em 𝑌 é moderado por esta variável qualitativa. Deste modo, conclui-se que há um
efeito de interação entre a variável independente e a variável dependente.

Exemplo 8:

Estimar se o montante máximo que está disposto a pagar para comprar um produto de luxo
em 2ª mão é uma variável moderadora entre os benefícios de compra de um produto de
luxo em segunda mão online e as razão de compra de um produto de luxo em 2ª mão com
edição limitada (seja online seja em loja física), tendo em conta a base de dados [Link]

A variável moderadora, o montante máximo que está disposto(a) a comprar um produto de luxo
de 2ª mão?, é uma variável qualitativa ordinal passível de ser tratada como nominal (se não
atendermos à ordem) com três níveis: 200€ - 600€; 601€ - 1000€; e, a partir de 1001€. A
categoria de referência é a primeira.

Dummy 1 Dummy 2 Dummy 3


200€ - 600€ 1 0 0
601€ - 1000€ 0 1 0
≥ 1001€ 0 0 1

©ISCTE-Instituto Universitário de Lisboa 38


Modelos de regressão

Se a categoria de referência for a primeira, só as 2 últimas categorias é que vêm especificadas na


seguinte a equação a estimar:

𝑌𝟒𝒊 = 𝛽 + 𝛽 𝑋 + 𝛽 𝐷𝑢𝑚𝑚𝑦2 + 𝛽 𝐷𝑢𝑚𝑚𝑦3 + 𝛽 𝑋 × 𝐷𝑢𝑚𝑚𝑦2 + 𝛽 𝑋 × 𝐷𝑢𝑚𝑚𝑦3 +


+𝜀𝑖

Tabela 7: Estimativos do modelo quando a variável dependente é o Investimento como razão de


compra de produtos de luxo em 2ª mão e a independente é Os benefícios da compra online
Unstandardized Standardized Collinearity
Coefficients Coefficients Statistics

Model B Std. Error Beta t Sig. Tolerance VIF


1 (Constant) ,135 ,132 1,029 ,305
Benefits of online ,173 ,129 ,173 1,339 ,183 ,462 2,164
shopping (CP1)
Dummy2 -,056 ,199 -,027 -,283 ,777 ,852 1,174
Dummy3 -,289 ,230 -,121 -1,258 ,211 ,833 1,201
CP1*Dummy2 -,440 ,206 -,243 -2,136 ,035 ,597 1,675
CP1*Dummy3 -,176 ,223 -,087 -,791 ,431 ,636 1,573
a. Dependent Variable: Investimento como razão de compra de produtos de luxo em 2ª mão.
Investimento como razão de compra de produtos de luxo em
2ªmão

Figura 12 – Visualização dos efeitos de interação do montante máximo que se está disposto(a) a
pagar na compra de produtos de luxo de 2ª mão na relação entre os benefícios da compra
oneline e a compra de produtos de luxo em 2ª mão (lojas físicas e online)13

É visível que para níveis elevados dos benefícios de compra online, a compra de produtos de
luxo em 2ª mão é também elevada quando o montante máximo que se está disposto(a) a pagar
corresponde ao intervalo intermédio de valores (entre 601 e 1000 euros mensais) face à categoria
de referência (200 – 600 euros); à medida que os benefícios da compra online vão aumentando,
a compra de produtos de luxo em 2ª mão vai também aumentando para montantes superiores a
1000 euros mas não tão substancialmente face à categoria anterior e à categoria de referência.

13
O gráfico não foi construído tendo por base as estimativas apresentadas na Tabela 7.
©ISCTE-Instituto Universitário de Lisboa 39

Você também pode gostar