Modelos de Regressão Linear Explicados
Modelos de Regressão Linear Explicados
MODELOS DE REGRESSÃO
ÍNDICE
Modelos de regressão 1
1. Modelos de Regressão Linear 1
Regressão vs Correlação 1
Análise de Regressão Linear 2
1.1 Modelo de Regressão Simples (MRLS) 3
1.1.1 Pressupostos do MRLS 3
1.1.2 Estimação do MRLS 3
1.1.3 Validação dos pressupostos do modelo 12
1.1.4 Reestimação do MRLS para a variável dependente sem outliers 19
1.2 Modelo de regressão linear múltiplo 20
1.2.1 Modelo 2 20
1.2.2 Hipóteses e validação das hipóteses 21
1.2.3 Estimação do modelo 2 26
1.2.4 Modelo 3 27
1.2.5 Modelo 4 31
1.3 Previsão 32
1.3.1 Previsão pontual 32
1.3.2 Previsão intervalar 33
1.4 Considerações finais 34
2. Modelos de regressão linear múltipla com efeitos de interação 36
2.1 Efeitos de moderação entre variáveis explicativas quantitativas 36
4.2 Efeitos de moderação entre variáveis explicativas qualitativas 38
Modelos de regressão
ÍNDICE DE FIGURAS
Figura 1: Relação entre duas variáveis quantitativas ...................................................................... 1
Figura 2: Desvios entre os valores observados e os estimados ....................................................... 4
Figura 3 - Decomposição da variação total de S ............................................................................. 6
Figura 4 - Presença ou não da hipótese da homoscedastcidade .................................................... 14
Figura 5 – Exemplos de autocorrelação positiva (a) e negativa (b) .............................................. 16
Figura 6 – Exemplo de um modelo aditivo para modelar um ruído branco.................................. 17
Figura 7: Relação entre o Tempo de leitura do semanário e os Escalões etários dos leitores ...... 22
Figura 8: Relações entre o Tempo de leitura do semanário e cada um dos atributos Caraterísticas
físicas e Qualidade de informação ................................................................................................ 28
Figura 9 – Modelo de interação..................................................................................................... 36
Figura 10 – Modelo teórico simplificado ...................................................................................... 37
Figura 11 - Visualização dos efeitos de interação das iniciativas ambientais individuais na relação
entre a percepção das práticas ambientais da organização e o valor ambiental das práticas
ambientais das empresas ............................................................................................................... 37
Figura 12 – Visualização dos efeitos de interação do montante máximo que se está disposto(a) a
pagar na compra de produtos de luxo de 2ª mão na relação entre os benefícios da compra oneline
e a compra de produtos de luxo em 2ª mão (lojas físicas e oneline) ............................................. 39
ÍNDICE DE TABELAS
Os modelos de regressão constituem uma técnica preditiva de análise multivariada que tem como
objetivos:
Analisar a relação entre uma variável dependente e várias variáveis independentes através de um
modelo de regressão;
Fornecer técnicas para a confirmação de teorias;
Interpretar os resultados da regressão e fazer previsões a partir desses resultados.
O modelo de regressão linear múltiplo (MRLM) é uma técnica preditiva de análise multivariada
usada para modelar relações entre variáveis e predizer o valor de uma variável dependente
quantitativa a partir de várias independentes.
Regressão vs Correlação
“A regressão tem como resultado uma equação funcional que descreve o relacionamento das
variáveis”, enquanto que a correlação mede o grau da relação linear entre as variáveis, sem
indicar qual das variáveis é a dependente. Ou seja, na correlação linear entre variáveis
quantitativas não há causalidade entre as variáveis. A Figura 1 apresenta diferentes tipos de
relação e uma situação em que não existe qualquer relação linear ou não linear (c).
(a) Relação linear positiva e (b) Relação linear negativa e (c) Ausência de relação (d) Relação, mas não linear
forte moderada
Fonte: Doane e Seward (2008: 491)
No modelo de regressão o termo variável dependente traduz uma relação do tipo causa e efeito.
Analise-se o caso em que a relação entre as variáveis pode ser descrito apropriadamente por uma
relação linear. Considere-se o seguinte modelo:
Caso exista apenas uma variável independente, o modelo de regressão linear simplifica-se e é
designado por Modelo de Regressão Linear Simples:
𝑌 =𝛽 +𝛽 𝑋 +𝜀 𝑖 = 1, … , 𝑛
Caso existam várias variáveis explicativas, o modelo de regressão é designado por Modelo de
Regressão Linear Múltiplo:
𝑌 = 𝛽 + 𝛽 𝑋 + ⋯+𝛽 𝑋 +𝜀 𝑖 = 1, … , 𝑛
O erro surge por esta técnica ser uma simplificação da realidade e, assim, este erro contém toda a
informação que não foi explicitada pelo modelo. Portanto, nesta componente vão estar incluídas
todas as variáveis omitidas no modelo.
O erro surge porque as relações humanas são imprevisíveis. Neste sentido, o erro traduzirá
mudanças de atitude que induzem os consumidores a gastarem mais ou menos do que usualmente
fazem.
O erro pode ainda surgir como erro de medição.
(...)
Pretende-se analisar se o Tempo de leitura do semanário preferido (em minutos) pode ser
explicado a partir da concordância dos leitores ao atributo desejável Leitura Aprazível dos
semanários. Os dados constam da base de dados usada nas aulas práticas.
Exemplo 1:
Será que a variável Tempo de leitura dos semanários, em minutos, é explicado pela
concordância que os leitores atribuem à Leitura aprazível?
Numa relação linear, o método dos mínimos quadrados permite o ajustamento de uma reta de
regressão (a reta ajustada) aos dados observados de tal forma que é minimizado a soma do
quadrado dos desvios entre os valores observados e a recta ajustada. Estes desvios são distâncias
medidas na vertical e correspondem às diferenças entre os valores observados e os ajustados. Os
desvios entre os valores observados e os estimados são identificados por 𝑒 = 𝑌 − 𝑌 .
𝒚𝒊
𝒆𝒊
𝒚
𝑌 =𝛽 +𝛽 𝑋
Pretende-se minimizar a soma dos quadrados dos desvios (resíduos) através do método OrdinarS
Least Squares (OLS) e os estimadores obtidos, designados por estimadores OLS são, na classe
dos estimadores não enviesados, os que têm variância mínima, isto é, são BLUE (best linear
unbiasedness estimators).
⎧ ∑ 𝑒 = 0 ⎧ ∑ 𝑒 > 0
⎪ 𝛽 ⎪ 𝛽
𝑒
⎨ ∑ 𝑒 = 0 ⎨ ∑ 𝑒 > 0
⎪ 𝛽 ⎪ 𝛽
⎩ ⎩
A solução conduz às seguintes fórmulas para a ordenada na origem (𝛽 ) e o declive da recta (𝛽 ):
𝛽 = 𝑌 − 𝛽𝑋
𝑛∑𝑋 𝑌 −∑𝑋 ∑𝑌 𝑛∑𝑋 𝑌 − 𝑌∑𝑋 ∑ 𝑋 𝑌 − 𝑛𝑋𝑌 ∑(𝑋 − 𝑋)(𝑌 − 𝑌)
𝛽 = = = =
𝑛 ∑ 𝑋 − (∑ 𝑋 ) ∑𝑋 − 𝑌∑𝑋 ∑ 𝑋 − 𝑛𝑋 ∑(𝑋 − 𝑋)
1
A estimação do modelo deve ser feita após se ter validado as hipóteses do mesmo.
©ISCTE-Instituto Universitário de Lisboa 4
Modelos de regressão
Output: ___________________________________________________________________________
Coefficientsa
Unstandardized Standardized
Coefficients Coefficients 95% Confidence Interval for B
Model B Std. Error Beta t Sig. Lower Bound Upper Bound
1 (Constant) 132,325 12,301 10,757 ,000 107,844 156,805
Leitura aprazível -15,890 3,310 -,473 -4,800 ,000 -22,478 -9,302
a. Dependent Variable: Tempo de leitura do semanário (minutos)
𝛽 = 132,325 mesmo que a concordância com o atributo Leitura Aprazível fosse hipoteticamente nula,
estima-se que os tempos de leitura do semanário preferido fossem aproximadamente de
132,325 minutos por mês ( tempo de leitura máxima e hipotética)
𝛽 = −15,89 por cada variação unitária na concordância, estima-se que os tempos de leitura dos
semanários diminuam de cerca de ¼ de hora (15,89 minutos). Significa que um aumento
de um nível na concordância com este atributo provoca uma redução estimada de 15,89
minutos no Tempo de leitura do semanário.
∗
𝐼𝐶 , = ]−22,478; −9,302[ Com 95% de confiança, estima-se que o verdadeiro valor de 𝛽 se
encontre neste intervalo estimado porque é assim na maioria das vezes
(95 em 100).
(𝑌 − 𝑌) = 𝑌 −𝑌 + 𝑌 −𝑌
∑ 𝑌 −𝑌 ∑ 𝑌 −𝑌
1= +
∑(𝑌 − 𝑌) ∑(𝑌 − 𝑌)
∑ 𝑌 −𝑌 𝑅𝑆𝑆 𝐸𝑆𝑆
𝑅 = = =1− with 𝑅 ∈ [0 , 1]
∑(𝑌 − 𝑌) 𝑇𝑆𝑆 𝑇𝑆𝑆
Outputs2: _____________________________________________________________________
Variables Entered/Removeda
Variables
Model Variables Entered Removed Method
1 Leitura aprazívelb . Enter
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. All requested variables entered.
Model SummarSb
Mede a dispersão dos
Adjusted R Std. Error of the resíduos relativamente ao
Model R R Square Square Estimate
modelo estimado; quanto
1 ,473a ,224 ,214 27,172 menor o seu valor, maior a
a. Predictors: (Constant), Leitura aprazível precisão nas estimativas
b. Dependent Variable: Tempo de leitura do semanário (minutos)
ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 17010,956 1 17010,956 23,041 ,000b
Residual 59063,739 80 738,297
Total 76074,695 81
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), Leitura aprazível
2
Depois de se terem eliminado os outliers severos ou influentes.
©ISCTE-Instituto Universitário de Lisboa 7
Modelos de regressão
𝐻 :𝑅 çã =0
𝐻 :𝑅 çã ≠0
/
Estatística do teste: 𝐹 = /( )
∩ 𝐹( ; )
ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 17010,956 1 17010,956 23,041 ,000b
Residual 59063,739 80 738,297
Total 76074,695 81
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), Leitura aprazível
Decisão: 𝐹( ; ) = 23,041; 𝑆𝑖𝑔 = 0,000, rejeita-se a hipótese nula. Logo, o modelo é válido porque
a única variável independente é significativa a explicar variações da dependente.
𝐻 :𝛽 =0
𝐻 :𝛽 ≠0
Estatística do teste: 𝑡 = ∩ 𝑡( )
Coefficientsa
Unstandardized Standardized
Coefficients Coefficients
Model B Std. Error Beta t Sig.
1 (Constant) 132,325 12,301 10,757 ,000
Leitura aprazível -15,890 3,310 -,473 -4,800 ,000
a. Dependent Variable: Tempo de leitura do semanário (minutos)
Decisão: como 𝑡 = −4,800; 𝑆𝑖𝑔 = 0,000, rejeita-se a hipótese nula, ou seja, a variável Leitura
Aprazível contribui significativamente para a explicação da variação dos tempos de
leitura do semanário (min).
(𝑅 = 0,224). Mas, em termos académicos e para exemplificar este ponto, vai-se estimar o tempo
de leitura do semanário se a concordância com a leitura aprazível for de 4,5 no período de
previsão.
Para isso convém no comando Save pedir-se Studentized deleted residual. A vantagem é que os
resíduos estudentizados detectam casos influentes de outliers.
Output:
____________________________________________________________________________________________
___________
Residuals Statisticsa
Minimum Maximum Mean Std. Deviation N
Predicted Value 66,35 127,58 88,70 13,831 100
Std. Predicted Value -1,616 2,811 ,000 1,000 100
Standard Error of Predicted Value 4,321 12,936 5,817 1,859 100
Adjusted Predicted Value 64,90 137,20 88,83 14,118 100
Residual -97,576 105,688 ,000 42,946 100
Std. Residual -2,261 2,448 ,000 ,995 100
Stud. Residual -2,369 2,461 -,002 1,005 100
Deleted Residual -107,204 106,757 -,134 43,815 100
Stud. Deleted Residual -2,428 2,528 ,002 1,015 100
Mahal. Distance ,002 7,901 ,990 1,438 100
Cook's Distance ,000 ,277 ,010 ,029 100
Centered Leverage Value ,000 ,080 ,010 ,015 100
a. Dependent Variable: Tempo de leitura do semanário (minutos)
Interpretação: deste output, que apresentam algumas estatísticas descritivas dos resíduos, temos a
indicação sobre a possível presença de outliers e/ou casos influentes. “Olhando” para o
valor mínimo e máximo do Studentized Deleted Residual, parece existirem outliers uma
vez que o valor mínimo é de (−2,428) e um valor máximo de (2,528), o que equivale a
dizer que estes valores estão a cerca de 2,5 desvios padrão da média (0,000).
A identificação destes outliers severos e/ou influentes é feita através de um teste paramétrico
uma vez que cada resíduo studentized deleted segue distribuição t-Student com (𝑛 − 𝑝 − 1) graus
de liberdade, em que p é o número de variáveis independentes.
Hipóteses:
Acedendo-se aos comandos SPSS Statistics, a identificação dos resíduos outliers é feita através
de (1 − 𝐶𝐷𝐹. 𝑇(𝑎𝑏𝑠(𝑆𝐷𝑅 ), 983)) ∗ 2 para se obter os percentis da distribuição t-Student para cada
um dos valores absolutos de SDR_1.
Output: ___________________________________________________________________________
Decisão: todos os casos em que o 𝑝 − 𝑣𝑎𝑙𝑢𝑒 ≤ 0,1 devem ser eliminados. Os casos 4, 11, 13, 16,
23, 28, 30, 35, 39, 40, e 42 devem ser eliminados simultaneamente.
Regresse-se novamente o modelo mas com a variável dependente corrigida destes outliers e teste-
se a hipótese da normalidade dos resíduos.
Decisão: O ajustamento não é o melhor mas existe uma relação causal e linear de sinal negativo (o
declive da reta é decrescente). É visível nesta figura que a relação linear entre estas variáveis é
fraca mas existe (𝑅 = −0,473) e que as variáveis variam em direções opostas.
obtém-se uma nova variável identificada na base de dados por ZRE_1 já sem as onze observações
que foram eliminadas. Depois, pede-se para esta nova variável o Normality Tests with Plots no
menu do Explore, ou seja
Analyze, Descriptive Statistics, Explore, Plots, NormalitS plots with tests, Both
Outputs: _________________________________________________________________________
Descriptives
Statistic Std. Error
Standardized Mean ,0000000 ,10539580
Residual 5% Trimmed Mean -,0262694
Median -,1754023
Variance ,989
Std. Deviation ,99430195
Minimum -1,83222
Maximum 2,42305
Range 4,25527
Interquartile Range 1,50775
Skewness ,352 ,255
Kurtosis -,571 ,506
Tests of Normality
Kolmogorov-Smirnova Shapiro-Wilk
Statistic df Sig. Statistic df Sig.
Standardized Residual ,100 89 ,029 ,975 89 ,079
a. Lilliefors Significance Correction
Decisão: rejeita-se a hipótese da normalidade dos erros aleatórios se o nível de significância for de
0,05 ou 0,1. Assim, proceda-se a uma análise do coeficiente de assimetria:
Conclusão: os erros aleatórios não seguem distribuição normal. Mas, como o coeficiente de assimetria
pertence ao intervalo de confiança quer para um 𝜆 = 0,95 quer para 𝜆 = 0,9, pode concluir-
se que a violação deste pressuposto não é grave e que os erros aleatórios seguem
aproximadamente distribuição normal.
Regression Standardazied
Regression Standardazied
Residual
Residual
Residual
Em (a), os pontos observados estão dispersos aleatoriamente em torno de zero; em (b) os pontos
observados seguem um padrão em forma de funil, mostrando que os dados violam a hipótese de
homoscedasticidade; em (c), os pontos observados identificam heteroscedasticidade e uma
relação não linear. O teste de White é um dos testes mais usados para a deteção da hipótese da
homoscedasticidade ou heteroscedasticidade.
4
O teste de White é uma opção para validar ou não este pressuposto.
©ISCTE-Instituto Universitário de Lisboa 14
Modelos de regressão
Teste de White
As hipóteses deste teste são
Model Summaryb
Adjusted Std. Error of
Model R R Square R Square the Estimate
1 ,078a ,006 -,018 29,39728537
a. Predictors: (Constant), LeituraAprazível_2, Leitura aprazível
b. Dependent Variable: Unstandardized Residual
Decisão: o 𝑅 é igual a 0,006. Como a estatística do teste (0,516 < 11,07) pertence à região de
aceitação, não se rejeita a hipótese nula e conclui-se que se está perante a
homoscedasticidade dos resíduos.
𝑇 = 86 × 0,006 = 0,516 ~𝜒( ) ↔ 𝑣𝑎𝑙𝑜𝑟 𝑐𝑟í𝑡𝑖𝑐𝑜( ; , ) = 11,07
No IBM SPSS, esta hipótese é validada ou não através de um gráfico através dos seguintes
comandos:
Analyze, Regression, Linear, Plots
Output: _________________________________________________________________________
Decisão: Como os círculos estão ± distribuídos aleatoriamente em relação a zero, pode dizer-se
que esta hipótese está validada visualmente.
Mas, o processo mais comum em séries temporais é o processo autoregressivo de primeira ordem
𝐴𝑅(1).
Teste de Durbin-Watson
O teste de Durbin-Watson é um dos mais populares testes para testar ‘serial correlation’. Envolve
o cálculo da estatística do teste que se baseia nos resíduos obtidos através da estimação usando
o procedimento Ordinary Least Squares (OLS). Seja o modelo de regressão linear
𝑌 = 𝛽 +𝛽 𝑋 +⋯+𝛽 X +𝜀
A estatística é igual a
∑ 𝜀̂ − 𝜀̂
𝐷𝑊 =
∑ 𝜀̂
Assume-se que:
O processo gerador dos erros é um 𝐴𝑅(1) do tipo 𝜀 = 𝜌 𝜀 + 𝑢 onde |𝜌| < 1 𝑒 𝑢 é um
ruído branco5.
Um valor de DW inferior a d , conduz à rejeição da hipótese nula de não se estar perante erros
correlacionados.
Um valor de DW maior que d conduz à decisão de não se rejeitar a hipótese nula.
O intervalo entre d e d ou entre [(4 − d )𝑒 (4 − d )] conduz a um valor que pertence a uma
5
Para modelar o ruído branco, temos os modelos aditivos em torno de um dado nível e modelos multiplicativos em
que a variação aleatório é proporcional a um dado nível.
6
Implica que não se possa incluir como variáveis explicaticvas lags da variável dependente.
©ISCTE-Instituto Universitário de Lisboa 17
Modelos de regressão
decisão inconclusiva (por ser possível que a correlação entre os erros seja devida à autocorrelação
entre as variáveis independentes em vez de ser devida à autocorrelação dos erros).
Região de rejeição = [𝟎; 𝒅𝑳 [ [𝟒 − 𝒅𝑳 ; 𝟒[
Região inconclusiva = [𝒅𝑳 ; 𝒅𝑼 [ [𝟒 − 𝒅𝑼 ; 𝟒 − 𝒅𝑳 [
Região de aceitação = [𝒅𝑼 ; 𝟒 − 𝒅𝑼 [
The values of (𝑑 ) and (𝑑 ) are obtained from the following table where n is the sample
dimension and p is the number of independent variables:
Regra prática:
Se (𝜌 ≈ 0), 𝑑 ≈ 2, os erros não estão correlacionados;
If (𝜌 ≈ +1), 𝑑 ≈ 0, os erros estão positivamente correlacionados;
If (𝜌 ≈ −1), 𝑑 ≈ 4, os erros estão negativamente correlacionados.
1 𝑛
ℎ = 1− 𝑑
2 1 − 𝑛 𝑉𝑎𝑟 𝛽
𝑌 = 𝛽 + 𝛽 𝑋 + ⋯+ 𝛽 X +𝑒
Onde 𝑒 é ruído branco. Se 𝜀 = 𝑒 , não há o problema de autocorrelação.
𝑒 = 𝛼 + 𝛼 𝑋 + ⋯+ 𝛼 X +𝜏 𝑒 +𝜏 𝑒 + ⋯+ 𝜏 𝑒 +𝑣
Reduziu-se o número de observações para (𝑛 − 𝑝) devido aos termos autoregressivos. O 𝑅 desta
última equação é usado para calcular a estatística deste teste:
BG = 𝑛𝑅 ~ 𝜒( )
Se a estatística deste teste é superior ao valor crítico para um determinado nível de significância,
rjeita-se a hipótese nula (de não existência de autocorrelação).
ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 17320,477 1 17320,477 17,064 <,001b
Residual 88307,612 87 1015,030
Total 105628,090 88
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), Leitura aprazível
Coefficientsa
Unstandardized Standardized
Coefficients Coefficients
Model B Std. Error Beta t Sig.
1 (Constant) 135,087 13,967 9,672 <,001
Leitura aprazível -15,571 3,769 -,405 -4,131 <,001
a. Dependent Variable: Tempo de leitura do semanário (minutos)
1.2.1 Modelo 2
Exemplo 2:
Acredita-se que o Tempo de leitura dos semanários, em minutos, também é explicado pelas
Escalões etários dos leitores. Será que esta expectativa se pode comprovar?
Esta nova variável independente7 está codificada como uma variável nominal com duas
categorias, assumindo os valores:
0 Escalão_etário ≤ 30 anos
1 Escalão_etário = de 30 a 39 anos
2 Escalão_etário ≥ 40 anos
Para uma variável independente com p categorias são necessárias (𝑝 − 1) variáveis dummy que
são variáveis binárias com zeros e uns: o zero quando se estiver perante a ausência do atributo e
um significa a presença do atributo. Seja a categoria Ensino médio ou superior, codificada com
1, a variável de referência. Quando a variável nominal tem mais de duas categorias é necessário
criar (𝑝 − 1) variáveis dummy. Os comandos do SPSS Statistics são:
7
Recodificada em 1 (até aos 30 anos), a categoria de referência, 2 (31-39), e 3 (Mais de 40 anos).
©ISCTE-Instituto Universitário de Lisboa 20
Modelos de regressão
8
Que não se valida neste estudo por não se estar perante uma série cronológica.
©ISCTE-Instituto Universitário de Lisboa 21
Modelos de regressão
Obtendo-se o gráfico de dispersão entre as variáveis em estudo, verifica-se que a relação entre o
Tempo de leitura do semanário e os escalões etários dos leitores existe na amostra.
Figura 7: Relação entre o Tempo de leitura do semanário e os Escalões etários dos leitores
A relação linear entre a variável dependente e escalões etários dos leitores pode ser estudada
acedendo-se aos comandos SPSS Statistics
Output: __________________________________________________________________________
Report
Tempo de leitura do semanário (minutos)
Escalão etário Mean N Std. Deviation
< 30 anos 66,96 23 39,160
de 30 a 39 anos 76,94 36 28,114
>=40 anos 93,75 16 29,749
Total 77,47 75 33,180
ANOVA Table
Sum of Squares df Mean Square F Sig.
Tempo de leitura do Between (Combined) 6792,821 2 3396,411 3,275 ,044
semanário (minutos) Groups Linearity 6578,715 1 6578,715 6,343 ,014
* Escalão etário
Deviation from Linearity 214,106 1 214,106 ,206 ,651
Within Groups 74675,845 72 1037,165
Total 81468,667 74
Measures of Association
R R Squared Eta Eta Squared
Tempo de leitura do semanário (minutos) * Escalão etário ,284 ,0811 ,289 ,0832
, ,
Notas: (1) ; (2) .
, ,
O teste para a linearidade tem uma significância inferior a 0,05 (𝑆𝑖𝑔 = 0,014) o que indica que
há uma relação linear entre as variáveis; O teste dos desvios da linearidade tem uma significância
superior a 0,05 (𝑆𝑖𝑔 = 0,651) o que significa que não há uma relação não linear significativa
entre as variáveis além da componente linear, mas contribuindo para a existência de uma relação
combinada (𝑆𝑖𝑔 = 0,044) entre a componente linear e a componente não linear.
Interpretação: Contudo, pelos outputs pode-se concluir que os quadrados das respetivas associações são
muito próximas de zero (𝑅 = 0,081 𝑒 𝐸𝑡𝑎 = 0,083). Significa assim, que esta
variável independente explica somente cerca de 8% das variações da variação da
dependente patente no Figura 7.
Outputs: ______________________________________________________________________
Tests of Normality
Kolmogorov-Smirnova Shapiro-Wilk
Statistic df Sig. Statistic df Sig.
Standardized Residual ,092 75 ,183 ,960 75 ,019
a. Lilliefors Significance Correction
Decisão: o pressuposto da normalidade dos resíduos está validado (𝐾𝑆(75) = 0,092; 𝑆𝑖𝑔 = 0,183).
Este hipótese está sempre verificada uma vez que é validada internamente aquando da estimação
do modelo.
Decisão: como os círculos estão ± aleatoriamente distribuídos em relação a zero, esta hipótese
está validada.
Uma das hipóteses do modelo é que as variáveis explicativas sejam independentes, isto é, que
nenhuma variável independente esteja perfeitamente correlacionada com as outras, condição
necessária para que os parâmetros sejam estimados. A multicolinearidade elevada produz
variâncias elevadas associadas às estimativas dos parâmetros que deixam de ser credíveis.
Multicolinearidade: diagnóstico
O diagnóstico da multicolinearidade pode ser feita pela correlação elevada entre as variáveis
explicativas (duas a duas), mas quando mais de duas variáveis independentes quantitativas forem
colineares, a matriz das correlações já não deve ser usada. Assim, o diagnóstico da
multicolinearidade pode ser feita pelo Variance Inflation factor (VIF). O VIF relaciona-se com o
coeficiente de determinação do modelo entre uma variável independente (tratada como
dependente) e as outras independentes. Valores de VIF superiores a 10 indicam a presença deste
problema (Sheather, 20099 ou Kutner et al., 2005) e valores de VIF superiores a 5 podem ser
problemáticos10.
1
𝑉𝐼𝐹 =
1−𝑅
9
Sheather, Simon (2009). A modern approach to regression with R. New Sork, NS: Springer.
10
Devem ser analisados no output seguinte (Condition index).
11
Valores próprios são as raízes características da matriz .
©ISCTE-Instituto Universitário de Lisboa 24
Modelos de regressão
forem próximos de 1, as variáveis independentes são ortogonais. Condition index maior que 15
indica um possível problema com colinearidade; maior que 30, um problema sério. Na presença
de um caso grave de multicolinearidade sugere-se que se reestime a regressão usando os valores
das variáveis independentes estandardizados (z scores).
Grandes desvios padrão das estimativas são responsáveis por estimativas instáveis e baixos
valores
As estimativas dos parâmetros variam consideravelmente de amostra para amostra
Sinal errado para a estimativa de um parâmetro que é inesperado (da teoria) e conlusões erráticas
das significâncias das estimativas dos coeficientes
Fortes correlações entre pares de variáveis
Outputs: ______________________________________________________________________
Collinearity Diagnosticsa
Variance Proportions
Condition Leitura EscalãoEtário= EscalãoEtário=
Model Dimension Eigenvalue Index (Constant) aprazível de 30 a 39 anos >=40 anos
1 1 2,730 1,000 ,01 ,01 ,03 ,02
2 1,000 1,652 ,00 ,00 ,11 ,41
3 ,241 3,366 ,02 ,06 ,78 ,48
4 ,029 9,682 ,97 ,93 ,08 ,09
a. Dependent Variable: Tempo de leitura do semanário (minutos)
Interpretação: este output revela que não há problemas de multicoliearidade uma vez que as
associações são fortes entre uma das variáveis independentes e a constante.
Solução
Depois da validação dos pressupostos do modelo terem sido validados, passa-se para a etapa
seguinte que consiste na estimação final do modelo conduz aos seguintes outputs:
Outputs: ______________________________________________________________________
Model Summaryb
2
Adjusted R Std. Error of O R Ajustado (𝑅 ) é corrigido
Model R R Square Square the Estimate
segundo o número de variáveis
1 ,502a ,252 ,220 29,295 independentes e a dimensão da
a. Predictors: (Constant), EscalãoEtário=>=40 anos, Leitura aprazível, amostra.
EscalãoEtário=de 30 a 39 anos
b. Dependent Variable: Tempo de leitura do semanário (minutos)
[𝐀] – Coeficientes de regressão parciais: a partir das estimativas dos coeficientes associadas às
variáveis independentes, fica-se a conhecer a contribuição de cada uma destas variáveis na
explicação da variável dependente, se o efeito da(s) outra(s) variável(eis) estiver controlado;
[𝐁] - Coeficientes de regressão parciais com base nos valores estandardizados: as respectivas
estimativas são usadas para comparar o efeito das variáveis independentes em Y quando as
variáveis estão medidas em unidades diferentes. Permite dizer que a variável independente que
mais contribui para explicar variações do Tempo de leitura do semanário é a concordância com o
índice Leitura Aprazível (-0,415):
[𝐂] – Variance Inflation factor: para diagnosticar a presença ou não de multicolinearidade.
1.2.4 Modelo 3
Exemplo 3:
Acredita-se ainda que o Tempo de leitura dos semanários, em minutos, também é explicado
pelos atributos Caraterísticas físicas e Qualidade de informação. Será que estas expetativas
se podem comprovar?
Obtendo-se os gráficos de dispersão entre as variáveis em estudo, verifica-se que a relação linear
entre o Tempo de leitura do semanário e as Caraterísticas físicas é fraca. Assim, adicione-se
Output: ______________________________________________________________________
Tests of Normality
Kolmogorov-Smirnova Shapiro-Wilk
Statistic df Sig. Statistic df Sig.
Standardized Residual ,079 75 ,200* ,963 75 ,029
*. This is a lower bound of the true significance.
a. Lilliefors Significance Correction
Este hipótese está sempre verificada uma vez que é validada internamente aquando da estimação
do modelo.
𝑌 = 𝛽 + 𝛽 𝑋 + 𝛽 𝐷𝑢𝑚𝑚𝑦 + 𝛽 𝐷𝑢𝑚𝑚𝑦 + 𝛽 𝑋 + 𝛽 𝑋 𝜀
onde 𝑋 = 𝑄𝑢𝑎𝑙𝑖𝑑𝑎𝑑𝑒 𝑑𝑎 𝑖𝑛𝑓𝑜𝑟𝑚𝑎çã𝑜 para o sujeito i e 𝑋 = Características físicas para o
mesmo sujeito i.
Outputs______________________________________________________________________
Model Summaryb À medida que são adicionadas novas
Adjusted R Std. Error of variáveis independentes, o erro padrão da
Model R R Square Square the Estimate regressão vai decrescendo, o que indica que
1 ,552a ,305 ,254 28,651 as estimativas são mais credíveis.
a. Predictors: (Constant), I2_CaracterísticasFísicas, EscalãoEtário=>=40
anos, Leitura aprazível, I1_QualidadeInformação, EscalãoEtário=de 30 a 𝑂 𝑒𝑟𝑟𝑜 𝑝𝑎𝑑𝑟ã𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 = 29,310
39 anos
𝑂 𝑒𝑟𝑟𝑜 𝑝𝑎𝑑𝑟ã𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 = 29,295
b. Dependent Variable: Tempo de leitura do semanário (minutos)
𝑂 𝑒𝑟𝑟𝑜 𝑝𝑎𝑑𝑟ã𝑜 𝑒𝑠𝑡𝑖𝑚𝑎𝑑𝑜 = 28,651
ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 24826,522 5 4965,304 6,049 <,001b
Residual 56642,145 69 820,901
Total 81468,667 74
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), I2_CaracterísticasFísicas, EscalãoEtário=>=40 anos,
Leitura aprazível, I1_QualidadeInformação, EscalãoEtário=de 30 a 39 anos
Coefficientsa
Unstandardized Standardized Collinearity
Coefficients Coefficients Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) 122,968 26,031 4,724 <,001
I3 Leitura aprazível -14,794 3,630 -,415 -4,075 <,001 ,972 1,029
EscalãoEtário=de 30 a 39 anos 10,382 7,760 ,157 1,338 ,185 ,728 1,373
EscalãoEtário=>=40 anos 23,265 9,466 ,289 2,458 ,016 ,728 1,374
I1_QualidadeInformação -8,541 4,579 -,195 -1,865 ,066 ,923 1,084
I2_CaracterísticasFísicas 7,966 4,557 ,184 1,748 ,085 ,913 1,095
a. Dependent Variable: Tempo de leitura do semanário (minutos)
Conclusão: a variável, das variáveis quantitativas, que mais contribui para a capacidade explicativa
do modelo é o índice Leitura Aprazível (-0,415) e a que menos contribui é é o índice
Caraterísticas físicas (0,184). A inclusão das duas últimas variáveis são significativas
para um nível de significância de 0,1.
Notas: X é a Qualidade da informação para o sujeito i e X são as Características físicas para o mesmo sujeito.
Exemplo 4:
Acredita-se ainda que o nível educacional do leitor pode explicar o Tempo de leitura dos
semanários, em minutos. Será que esta expectativa se pode comprovar?
1.2.5 Modelo 4
𝑌 = 𝛽 +𝛽 𝑋 +𝛽 𝐷 +𝛽 𝐷 +𝛽 𝑋 +𝛽 𝑋 +𝛽 𝑋 +𝛽 𝐷 çã , +𝜀
onde
𝐷 çã , = 𝐸𝑛𝑠𝑖𝑛𝑜 𝑚é𝑑𝑖𝑜 𝑜𝑢 𝑠𝑢𝑝𝑒𝑟𝑖𝑜𝑟
para o leitor i (sendo a categoria de referência os que têm níveis educacionais até ao ensino
secundário.
Após se ter validado as hipóteses do MRL do modelo 4, apresentam-se os resultados das
respetivas estimativas.
Outputs: ______________________________________________________________________
Model Summaryb
Adjusted R Std. Error of the
Model R R Square Square Estimate
1 ,594a ,352 ,294 28,243
a. Predictors: (Constant), habilit=ensino médio e superior, EscalãoEtário=de 30 a 39
anos, I1_QualidadeInformação, Leitura aprazível, I2_CaracterísticasFísicas,
EscalãoEtário=>=40 anos
b. Dependent Variable: Tempo de leitura do semanário (minutos)
ANOVAa
Model Sum of Squares df Mean Square F Sig.
1 Regression 28657,475 6 4776,246 5,988 <,001b
Residual 52646,635 66 797,676
Total 81304,110 72
a. Dependent Variable: Tempo de leitura do semanário (minutos)
b. Predictors: (Constant), habilit=ensino médio e superior, EscalãoEtário=de 30 a 39 anos,
I1_QualidadeInformação, Leitura aprazível, I2_CaracterísticasFísicas, EscalãoEtário=>=40
anos
Coefficientsa
Unstandardized Standardized Collinearity
Coefficients Coefficients Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) 111,065 26,693 4,161 <,001
I1 Leitura aprazível -16,346 3,662 -,458 -4,463 <,001 ,931 1,074
EscalãoEtário=de 30 a 39 anos 10,942 7,813 ,164 1,400 ,166 ,717 1,394
EscalãoEtário=>=40 anos 24,347 9,419 ,302 2,585 ,012 ,720 1,390
I2_CaracterísticasFísicas 9,151 4,569 ,209 2,003 ,049 ,902 1,109
I1_QualidadeInformação -7,415 4,569 -,168 -1,623 ,109 ,918 1,090
Habilit=ensino médio e superior 14,443 6,880 ,216 2,099 ,040 ,924 1,083
a. Dependent Variable: Tempo de leitura do semanário (minutos)
Conclusão: a inclusão da variável Nivel educacional para a categoria ensino médio ou superior
igual a 1 aumentou a capacidade explicativa do modelo (𝑅 = 0,294) quando no
modelo anterior é de 0,254; a variável que mais contribui para a capacidade explicativa
deste modelo continua a ser a Leitura aprazível (-0,458) e a que menos contribui é a
dummy Escalão etário dos que têm idades entre os 30 e os 39 anos (0,164).
1.3 Previsão
Um bom modelo pode ser usado para previsão. Apesar da qualidade do Modelo 4 não ser boa,
utilize-se este modelo, modelo completo, para fornecer previsões para o Tempo de leitura do
semanário por razões pedagógicas.
Se por hipótese se admitir que a estrutura do passado se vai manter num futuro próximo,
assumindo-se que o modelo estimado é um bom modelo, pode-se usar este modelo estimado para
previsão:
Exemplo 5:
Interpretação: esse leitor com id 110 levará em média cerca de 86,5267 minutos a ler o semanário
preferido. Mais interessante que a estimação pontual para uma previsão de um valor
da variável dependente é a estimação intervalar de previsão.
Para se estimar um intervalo de confiança com um determinado nível de confiança (𝜆) para uma
ponderação de 4,2 à leitura aprazível, usa-se a seguinte expressão:
1 (𝑋 − 𝑋)
𝜎 =𝜎 1+ +
𝑛 ∑(𝑋 − 𝑋)
id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋)
1 2 2,56 12 3,5 0,01 23 3 0,36 34 3 0,36
2 3,5 0,01 13 4 0,16 24 3,5 0,01 35 4 0,16
3 3,5 0,01 14 3 0,36 25 2,5 1,21 36 3,5 0,01
4 3,5 0,01 15 2,5 1,21 26 2,5 1,21 37 3,5 0,01
5 1,5 4,41 16 1,5 4,41 27 4 0,16 38 3,5 0,01
6 2,5 1,21 17 3,5 0,01 28 4 0,16 39 3,5 0,01
7 3,5 0,01 18 3 0,36 29 3,5 0,01 40 4 0,16
8 3 0,36 19 3,5 0,01 30 4 0,16 41 4,5 0,81
9 3,5 0,01 20 1,5 4,41 31 3 0,36 42 5 1,96
10 3,5 0,01 21 1,5 4,41 32 3 0,36 43 2,5 1,21
11 2 2,56 22 2,5 1,21 33 3,5 0,01 44 4 0,16
id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋) id 𝑋 (𝑋 − 𝑋)
45 3 0,36 56 3,5 0,01 67 5 1,96 78 4 0,16
46 5 1,96 57 4,5 0,81 68 4 0,16 79 4 0,16
47 2,5 1,21 58 5 1,96 69 4 0,16 80 5 1,96
48 5 1,96 59 4,5 0,81 70 4 0,16 81 5 1,96
49 2 2,56 60 5 1,96 71 5 1,96 82 4,5 0,81
50 3 0,36 61 3 0,36 72 4 0,16 83 3,5 0,01
51 3,5 0,01 62 4 0,16 73 5 1,96 84 3,5 0,01
52 3,5 0,01 63 4 0,16 74 3,5 0,01 85 3,6 0
53 4 0,16 64 5 1,96 75 4,5 0,81 86 5 1,96
54 3,5 0,01 65 5 1,96 76 4,5 0,81 87 4 0,16
55 4,5 0,81 66 5 1,96 77 4 0,16 88 4 0,16
id 𝑋 (𝑋 − 𝑋)
89 4 0,16
90 5 1,96
91 4 0,16
92 5 1,96
93 3,5 0,01
94 4,5 0,81
95 4,5 0,81
96 4 0,16
1 (4,2 − 3,6)2
𝜎 = 577,969681 1 + + = 588,8218 ↔ 𝜎 ≈ 24,255665
73 70,9
𝑡( ; . ) = 2,00
Para 𝜆 = 0,95 ↔ 𝑡( ; . ) =
𝑡(
→ 𝑡( ; . ) ≈ 1,992
; . ) = 1,984
𝑌 = 86,5267
𝑌 − 𝑡( ; . )𝜎 ; 𝑌 + 𝑡( ; . )𝜎 ≈
]86,5267 − 1,992 × 24,255665 ; 86,5267 + 1,992 × 24,255665[ ≈ ]38,250 ; 134,844[
Prevê-se, com 95% de confiança que o tempo médio de leitura do semanáro preferido esteja entre
38,25 min e 134,84 min.
Quando a análise dos resíduos sugere relações não lineares, a regressão linear não deve ser
utilizada sem previamente se linearizarem essas relações, por exemplo, com recurso ao uso de
logaritmos (naturais).
O método utilizado nestas estimações foi o método ENTER em que todas as variáveis entram
numa única iteração. Mas, na presença de muitas variáveis independentes é aconselhado utilizar-
se um dos três métodos sequenciais:
MÉTODO BACKWARD – o modelo é iniciado com todas as variáveis independentes e para cada uma
delas são calculadas estatísticas F; a variável com menor valor de F 𝐹 é comparada com
um valor crítico (𝐹 ) e se o valor da 𝐹 <𝐹 , essa variável é removida do
modelo; e etc. O procedimento pára quando não há variáveis que satisfaçam o critério removal.
MÉTODO STEPWISE – é uma mistura dos dois anteriores. Inicia-se só com uma variável
independente. Este método é adequado quando existem correlações relevantes entre as variáveis
independentes.
Exemplo 6:
Uma variável é considerada uma variável moderada se alterar a direção ou força da relação entre
a variável independente e a dependente. Há uma interação no sentido de que o efeito de uma
variável independente na variável dependente depende do nível de uma outra.
Se as duas variáveis explicativas forem quantitativas, os efeitos de interação são modelados pela
identificação de um termo multiplicativo, o termo de interação (𝑋 𝑋 ), no MRLM:
𝑌𝒊 = 𝛽 + 𝛽 𝑋 + 𝛽 𝑀 + 𝛽 𝑋 × 𝑀 + 𝜀
É assim expectável que a relação entre o efeito principal 𝑋 e Y se altere devido ao efeito da
variável moderadora nesta relação.
𝑋 𝑌
No entanto, a inclusão desse termo multiplicativo pode levar à correlação entre as variáveis
independentes. Uma possibilidade para se evitar a potencial multicolinearidade entre as variáveis
independentes é usar os respetivos valores das variáveis centradas (𝑋 − 𝑋). Outra solução é
especificar no modelo teórico a variável independente (𝑋 ) e o termo de interação (𝑋 × 𝑀 ) e
omitir o termo com a variável moderadora.
Exemplo 7:
Coefficientsa
Unstandardized Standardized
Coefficients Coefficients Collinearity Statistics
Model B Std. Error Beta t Sig. Tolerance VIF
1 (Constant) -,036 ,063 -,581 ,562
D2 ,580 ,089 ,588 6,498 <,001 ,447 2,238
D2D13 ,116 ,033 ,321 3,535 <,001 ,444 2,253
D13 ,154 ,075 ,153 2,053 ,041 ,663 1,509
a. Dependent Variable: Atract_Valor Ambiental
Como a figura sugere, à medida que a percepção das práticas ambientais da organização aumenta,
o valor ambiental das práticas da organização também aumenta de acordo com o aumento dos
níveis das iniciativas ambientais dos colaboradores, mas convergindo para uma interseçção.
12
O gráfico obtido nao está relacionado com as estimativas obtidas na Figura 10.
©ISCTE-Instituto Universitário de Lisboa 37
Modelos de regressão
Se a variável moderadora for qualitativa nominal (ou tratada como tal) com 𝑘 categorias, os
níveis referem-se a cada um dos (𝑘 − 1) dummies mais a categoria que serve de referência
(baseline level).
Desta forma, obtém-se (𝑚 − 1) colunas binárias na base de dados, preenchidas com 0’s e 1’s.
Para uma variável de moderação qualitativa com 3 categorias, uma delas é a categoria de
referência e, portanto, deve ficar omissa do modelo que é assim identificado:
+𝜀𝑖
Se o coeficiente 𝛽 e/ou 𝛽 forem significativamente diferentes de zero, pode-se concluir que o
efeito de 𝑋 em 𝑌 é moderado por esta variável qualitativa. Deste modo, conclui-se que há um
efeito de interação entre a variável independente e a variável dependente.
Exemplo 8:
Estimar se o montante máximo que está disposto a pagar para comprar um produto de luxo
em 2ª mão é uma variável moderadora entre os benefícios de compra de um produto de
luxo em segunda mão online e as razão de compra de um produto de luxo em 2ª mão com
edição limitada (seja online seja em loja física), tendo em conta a base de dados [Link]
A variável moderadora, o montante máximo que está disposto(a) a comprar um produto de luxo
de 2ª mão?, é uma variável qualitativa ordinal passível de ser tratada como nominal (se não
atendermos à ordem) com três níveis: 200€ - 600€; 601€ - 1000€; e, a partir de 1001€. A
categoria de referência é a primeira.
Figura 12 – Visualização dos efeitos de interação do montante máximo que se está disposto(a) a
pagar na compra de produtos de luxo de 2ª mão na relação entre os benefícios da compra
oneline e a compra de produtos de luxo em 2ª mão (lojas físicas e online)13
É visível que para níveis elevados dos benefícios de compra online, a compra de produtos de
luxo em 2ª mão é também elevada quando o montante máximo que se está disposto(a) a pagar
corresponde ao intervalo intermédio de valores (entre 601 e 1000 euros mensais) face à categoria
de referência (200 – 600 euros); à medida que os benefícios da compra online vão aumentando,
a compra de produtos de luxo em 2ª mão vai também aumentando para montantes superiores a
1000 euros mas não tão substancialmente face à categoria anterior e à categoria de referência.
13
O gráfico não foi construído tendo por base as estimativas apresentadas na Tabela 7.
©ISCTE-Instituto Universitário de Lisboa 39