0% ont trouvé ce document utile (0 vote)
3 vues51 pages

Introduction à la régression linéaire

La régression linéaire modélise la relation entre variables indépendantes et dépendantes, avec des types uniques et multiples. Les hypothèses incluent la linéarité, l'homoscédasticité, l'indépendance et la normalité. Des tests d'hypothèses, comme le test t et le test du khi-deux, sont utilisés pour évaluer la significativité des modèles et des relations entre variables.

Transféré par

Youssef Chakour
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
3 vues51 pages

Introduction à la régression linéaire

La régression linéaire modélise la relation entre variables indépendantes et dépendantes, avec des types uniques et multiples. Les hypothèses incluent la linéarité, l'homoscédasticité, l'indépendance et la normalité. Des tests d'hypothèses, comme le test t et le test du khi-deux, sont utilisés pour évaluer la significativité des modèles et des relations entre variables.

Transféré par

Youssef Chakour
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Régression linéaire

Atelier 3
La régression linéaire

La régression linéaire est une approche utilisée pour modéliser la relation linéaire entre deux
variables ou plus.
Il existe deux principaux types de régression linéaire, à savoir :

 Régression linéaire unique : la régression linéaire unique est utilisée pour étudier la relation
entre une seule variable indépendante (x) et une seule variable dépendante (y).
 Régression linéaire multiple : la régression linéaire multiple est utilisée pour étudier la
relation entre deux variables indépendantes ou plus (x) et une seule variable dépendante (y).
Exemple :

 Régression linéaire simple:

La taille a-t-elle une influence sur le poids d'une personne ?


• Variable dépendante
• Variables indépendantes
 Régression linéaire multiple:

La taille et le sexe ont-ils une influence sur le poids d'une personne ?


Forme générale du modèle théorique de régression linéaire simple :

𝑌 = 𝑓 𝑋 = 𝛽1 𝑋 + 𝛽0 + 𝜀

Notation :
𝑌 = Variable dépendante ou expliquée
𝑋 = Variable indépendante ou explicative
𝛽0 et 𝛽1 = Coefficients théoriques de régression (à estimer à l'aide d'un échantillon)
𝜀 = Erreur théorique aléatoire (d'autres facteurs influencent 𝑌)
Hypothèses de régression linéaire :

Linéarité : La relation entre X et Y est linéaire.

Homoscédasticité : La variance du résidu est la même pour toute valeur de X.

Indépendance : Les observations sont indépendantes les unes des autres.

Normalité : Pour toute valeur fixe de X, Y est normalement distribué.


Les packages sont des collections de fonctions et d'ensembles de
données développées par la communauté.

Vous pouvez trouver une liste de tous les packages installés sur le
serveur RStudio en cliquant sur l'onglet Packages.
1. Accéder au dossier Atelier2AD
2. Cherchez le fichier [Link]
1. Allez au fenêtre Packages
2. Cherchez le package : MASS
3. S'il existe. Cochez la case devant "MASS".
4.S’il n’existe pas. Cliquez sur Install
5. Ecrirez la nom de package (MASS)
6. Cliquez sur Install
7. Cherchez le package : MASS
8. Cochez la case devant "MASS".
Exercice 1
L'ensemble de données " cats " est
un objet de type " data frame "
dans R.
- Il comporte 144 lignes
(individus) et trois colonnes.
Chaque colonne est une
variable.
- La première est une variable
de type factoriel (variable
qualitatif)
F pour les chats femelles
M pour les chats mâles.
- La deuxième et la troisième
variables sont de type
numérique:
Bwt : le poids du corps (en
kilogrammes) .
Hwt : le poids du cœur (en
grammes).
Représentation graphique en nuage de points des variables Bwt et Hwt

On observe une relation linéaire entre les variables Bwt et Hwt (c’est la
première hypothèse)
Le modèle de régression
La sortie précédente indique une matrice (Coefficients) de 5 colonnes.
•Estimate : les estimations des paramètres.
Dans notre cas:
β0=-0.3567
β1= 4.0341

•Std. Error : les écarts-types estimés des coefficients.


Pour notre cas :
Pour βo : 0.6923
Pour β1 : 0.2503
•t value : La valeur observée de la statistique de test d’hypotheses
H0:β0=0
H1:β0≠0
Pr(>|t|) : la probabilité critique (ou « p-value ») qui est la probabilité, pour la statistique de test
sous H0, de dépasser la valeur estimée.

La dernière colonne est une indication sur le résultat des tests.


- Si elle est vide cela signifie qu’on ne peut pas rejeter l’hypothèse H0
- Par contre si elle n’est pas vide ce qu’on rejette l’hypothèse H0 au seuil significatif
correspondant au symbole (***: 0.001, **: 0.01, *: 0.05, .: 0.1)
Les « p-value » de notre exemple sont toutes inferieures à α=5% (< 2.2e-16 ), on peut donc
rejeter l’hypothèse nulle pour un niveau de confiance de 95%.
En plus des informations sur les coefficients, la sortie de la fonction summary modèle
renseigne aussi sur :

• Residual standard error : l’estimation de σ de ϵ 1.452

• Degrees of freedom : le nombre de degré de liberté associe (n−2= 142)

• Le coefficient de détermination (𝑅2 ) : 0.6466

• Le coefficient de détermination ajuster : 0.6441

• F-statistic : est le résultat d'un test qui permet d'évaluer la significativité de la régression linéaire dans
son ensemble, et pas seulement des paramètres de l'équation de la droite.
un chat a un poids d'environ 3,18 kg.
Quel est son poids cardiaque ?

෢ −0.3567 + 4.0341 × 3.18


hwt=
= 12.472 grams
L'objectif de la régression est de trouver une ligne droite qui reflète au mieux la
relation linéaire entre la variable indépendante (BWT) et la variable dépendante
(HWT) c’est-à-dire de trouver 𝛽0 𝑒𝑡 𝛽1 .

On a donc l'équation de la droite de régression :


Y= 0.3567 +4.0341 *X

library(lattice)
xyplot(Hwt ~ Bwt, data=cats,
type=c("p","g","r"),
+ xlab="Body weight (Kilograms)",
+ ylab="Heart weight (Grams)")
Tests d’hypothèses
Un test d’hypothèse est un procédé d’inférence permettant de contrôler
(accepter ou rejeter) à partir de l’étude d’un ou plusieurs échantillons
aléatoires, la validité d’hypothèses relatives à une ou plusieurs populations.
Choix de type Test
Le choix du test et déterminé par la question posée et la structure des données de l'expérience.

Test paramétriques :
- Souvent les observations sont supposées suivre un modèle gaussien (loi normale)
- L'échantillon est de suffisamment grande taille pour accepter la normalité asymptotique par le théorème
centrale limite.
Test non paramétriques
- Petit échantillon.
- Distribution non gaussienne. Pas d'hypothèse sur la forme des distributions !

Remarque : Lorsque les hypothèses d'un test paramétrique sont vérifiées, un test non-paramétrique est
généralement moins puissant que un test paramétrique.
Différentes étapes doivent être suivies pour tester une hypothèse :

(1) définir l’hypothèse nulle, notée H0, à contrôler ;


(2) choisir une statistique pour contrôler H0 ;
(3) définir la distribution de la statistique sous l’hypothèse « H0 est réalisée » ;
(4) définir le niveau de signification du test α et la région critique associée ;
(5) calculer, à partir des données fournies par l’échantillon, la valeur de la statistique ;
(6) prendre une décision concernant l’hypothèse posée .
Exercice 2
Le test de khi deux (χ²) de Pearson ou d'indépendance

Si vous souhaitez vérifier s'il existe une relation entre xx et yy vous pouvez utiliser le test du
khi-deux (chi-deux) pour l'indépendance.

Hypothèses de test :

H₀ (Hypothèse nulle) : Il n'y a pas de relation entre les variables XX et YY

H₀ :XX et YY sont indépendantes

H₁ (Hypothèse alternative) : Il existe une relation entre les variables XX et YY.

H₁ :XX et YY ne sont pas indépendantes


Le test de khi deux (χ²) de Pearson ou d'indépendance

Statistique de test :

La statistique de test pour le test du khi-deux est généralement calculée à partir d'un tableau de
contingence qui montre la fréquence des occurrences dans chaque combinaison des catégories de
XX et YY.

(𝑂𝑖𝑗 − 𝐸𝑖𝑗 ) 2
𝝌² = ෍
𝐸𝑖𝑗

• 𝑂𝑖𝑗 sont les fréquences observées dans chaque cellule du tableau.


• 𝐸𝑖𝑗 sont les fréquences attendues (estimées) sous l'hypothèse d'indépendance (H₀).
Le test de khi deux (χ²) de Pearson ou d'indépendance

Décision :

• Si la valeur p associée au test du khi-deux est inférieure au niveau de signification choisi


(par exemple, 0.05), vous pouvez rejeter l'hypothèse nulle en faveur de l'hypothèse
alternative, indiquant qu'il y a une relation significative entre les variables XX et YY.

• Si la valeur p est supérieure au niveau de signification, vous ne rejetez pas l'hypothèse


nulle

la valeur-p est la probabilité pour un modèle statistique donné sous l'hypothèse nulle
d'obtenir la même valeur ou une valeur encore plus extrême que celle observée (seuil à 5% ).
Le test de khi deux (χ²) de Pearson ou d'indépendance

Les résultats du test du khi-deux indique ce qui suit :


[Link] de test χ2 (la valeur de l'indicateur de khi-deux) :
0.46515.
[Link]és de liberté (df) : df = (nb de lignes - 1) * (nb de colonnes – 1) .
9.
[Link] p :
1.
Le test de khi deux (χ²) de Pearson ou d'indépendance

Degrés de liberté (df) :


Dans ce cas, nous avons: 9 degrés de liberté.

La comparaison entre Khi2 calculé et Khi2 théorique (nous basons sur df et 𝛼) va nous permettre de
trancher entre les deux hypothèses. La règle est la suivante :

Khi2 Calculé < Khi2 théorique ⇒ accepter H0


Khi2 Calculé > Khi2 Théorique ⟹ rejeter H0

Si on fixe 𝜶 à 𝟓% avec 𝒅𝒍 = 𝟗
la valeur théorique de khi2 est 𝟑, 𝟑𝟑
Donc, Khi2 Calculé < Khi2 théorique
Alors on accepte H0:
XX et YY sont indépendantes
Le test de khi deux (χ²) de Pearson ou d'indépendance

Valeur p :
La valeur p est égale à 1 (avec 𝛼 est fixé 5 % ), ce qui signifie qu'il n'y a pas suffisamment de
preuves pour rejeter l'hypothèse nulle d'indépendance.

Conclusion :
La valeur p est 1 ⟹ nous ne pouvez pas rejeter l'hypothèse d'indépendance entre les variables testées.
C’est-a-dire on va accepter 𝐻0 : XX et YY sont indépendantes
(𝑂𝑖𝑗 − 𝐸𝑖𝑗 ) 2
𝝌² = ෍
𝐸𝑖𝑗

• 𝑂𝑖𝑗 sont les fréquences observées dans chaque cellule du


tableau.
• 𝐸𝑖𝑗 sont les fréquences attendues (estimées) sous l'hypothèse
d'indépendance (H₀).
le diagramme qqnorm permet de comparer la distribution des données d’un lot à la
distribution normale.
Et qqline ajoute une ligne qui passe par les premier et troisième quartiles.

Les quantiles de notre données et les quantiles théoriques suivent presque parfaitement
la ligne QQ.
Pour cette raison, QQplot indique que nos valeurs aléatoires sont normalement
distribuées.
෡ 𝟎 et 𝜷
Les paramètres estimés du modèle 𝜷 ෡ 𝟏:

𝛽መ0 = 2.133333

𝛽መ1 = 2.030303

෡𝟎 + 𝜷
ෝ =𝜷
Les valeurs 𝒚 ෡ 𝟏 *XX

1 2 3 4 5 6 7 8 9 10
4.163636 6.193939 8.224242 10.254545 12.284848 14.315152 16.345455 18.375758 20.406061 22.436364


𝑹é𝒔𝒊𝒅𝒖𝒆𝒍 = 𝒚 − 𝒚
Intervalles de confiance des valeurs prédites

L'intervalle de confiance reflète l'incertitude


autour des prévisions moyennes.

La sortie contient les colonnes suivantes :


•fit : les valeurs de vente prévues.
•lwr et upr: les limites de confiance inférieure et supérieure pour les valeurs attendues [ lwr , upr ].

L'intervalle de confiance pour les valeurs ajustées est une plage de valeurs dans laquelle,
avec un certain niveau de confiance (par exemple, 95 %), on peut s'attendre à ce que la vraie
valeur ajustée soit.

Cela peut être utile pour évaluer la précision de la prédiction. Un intervalle plus étroit suggère
une plus grande précision, tandis qu'un intervalle plus large indique une plus grande
incertitude.
Le test t de Student (t-test)

Pour vérifier si la régression linéaire simple est significative, on effectuer des tests des
hypothèses.

Le test d'hypothèses classique pour cela est le test t de Student.

Hypothèses de test :

1.H₀ (Hypothèse nulle): 𝛽0 = 0.


2.H₁ (Hypothèse alternative): 𝛽0 ≠ 0.
Test t pour le coefficient de pente :

La statistique de test t est calculée comme suit :


𝑏
t= 𝑆𝐸𝑏

b est ​le coefficient de pente estimé à partir de vos données.


𝑺𝑬𝒃 est l'écart-type standard de b
Décision :
1. Si la valeur p associée au test t est inférieure au niveau de signification choisi (par
exemple, 0.05), vous pouvez rejeter l'hypothèse nulle (H₀) en faveur de l'hypothèse
alternative (H₁ ).
2. Si la valeur p est supérieure au niveau de signification, vous ne rejetez pas l'hypothèse
nulle

la valeur-p est la probabilité pour un modèle statistique donné sous l'hypothèse nulle d'obtenir
la même valeur ou une valeur encore plus extrême que celle observée (seuil à 5% ).

Le vide ou ∙ : 𝑃 ≥ 0.05 non significatif


* : 𝑃 < 0.05 significatif
** : 𝑃 < 0.01 hautement significatif
***: 𝑃 < 0.001 très hautement significatif
L'hypothèse
nulle 𝐻0

Accepter Rejeter
𝑃 ≥ 0.05 𝑃 < 0.05
non significatif significatif
Coefficients :

•L'intercept est estimé à 2.13333 avec une erreur standard de 0.34363.


•Le test t associé a une valeur de 6.208
• la valeur p (Pr(>|t|) est très faible (0.000257).
Cela suggère que l'intercept est significatif.

•La pente est estimée à 2.03030 avec une erreur standard de 0.05538
•Le test t associé a une valeur de 36.661,
• la valeur p (Pr(>|t|) est extrêmement faible (3.36×10−10 ).
Cela suggère que la pente est significatif (𝑃 < 5%).
Residuals :

Les résidus représentent les erreurs du modèle, c'est-à-dire les différences entre les valeurs
observées (yy) et les valeurs prédites par le modèle.
- La sortie indique des statistiques récapitulatives sur les résidus : la valeur minimale, le premier
quartile, la médiane, le troisième quartile et la valeur maximale.

Residual standard error :

L'erreur standard résiduelle (Residual standard error) est une mesure de la dispersion des résidus.
Elle est estimée à 0.503.
R-squared et Adjusted R-squared :

•R2 et Adjusted R2 mesurent la proportion de la variance de la variable


dépendante (yy) expliquée par le modèle.

Dans ce cas, R2 est très élevé (0.9941), ce qui suggère que le modèle explique
bien la variance de yy.
F-statistic :

Dans votre cas, le test F a une valeur de 1344 et la valeur p associée est très faible
(3.36×10−10), indiquant que le modèle global est significatif.

En résumé, le modèle de régression linéaire semble être très significatif, avec un intercept et
une pente significativement différents de zéro. La majorité de la variance de la variable
dépendante (yy) est expliquée par le modèle, comme en témoignent les valeurs élevées de
R2 et Adjusted R2.
Tableau d’ANOVA (analyse de variance)

Le tableau d’ANOVA est un moyen d'évaluer la significativité globale


du modèle de régression.
Tableau d’ANOVA (analyse de variance)

• p = le nombre de paramètres dans le modèle dl = Degrés de liberté


• n = nombre d’observations CM = Moyenne des carrés
• SC = Somme des carrés F = valeur F
Le test F de Fisher (F-test)

• Le test F est utilisé pour tester l'hypothèse globale que tous les coefficients de
régression (à l'exception de l'intercept) sont égaux à zéro.
En d'autres termes, il teste si le modèle global est significatif.

• L'hypothèse nulle (Ho​) dans ce contexte est que tous les coefficients de régression
sont égaux à zéro, ce qui signifie que le modèle n'est pas significatif (le modèle
n'explique pas significativement la variance de la variable dépendante).
Hypothèses nulles et alternatives

•H₀ (Hypothèse nulle) : Tous les coefficients de régression (à l'exception de l'intercept)


sont égaux à zéro, c'est-à-dire que le modèle global n'est pas significatif.

•H₁ (Hypothèse alternative) : Au moins un des coefficients de régression est différent de


zéro, indiquant que le modèle global est significatif.
- Seuil de signification :
Nous utilisons le test de Fisher, avec 𝛼=0,05 :
1. Si la valeur p associée au test F est inférieure au niveau de signification choisi (𝛼), vous
pouvez rejeter l'hypothèse nulle (H₀) en faveur de l'hypothèse alternative (H₁ ).
2. Si la valeur p est supérieure au niveau de signification, vous ne rejetez pas l'hypothèse nulle

Règle de décision :
La comparaison entre F calculé et F théorique (nous basons sur df (ν1 = p-1, ν2=n-p) et 𝛼 =5%)
va nous permettre de trancher entre les deux hypothèses. La règle est la suivante :

F Calculé < F théorique ⇒ accepter H0


F Calculé > F théorique ⟹ rejeter H0

Vous aimerez peut-être aussi