0% ont trouvé ce document utile (0 vote)
4 vues14 pages

Guide de Révision

Le guide de révision sur la régression linéaire multiple explique comment modéliser une variable dépendante en fonction de plusieurs variables indépendantes, interpréter les coefficients, et évaluer la significativité des variables à l'aide de tests d'hypothèses. Il aborde également la qualité d'ajustement du modèle via le coefficient de détermination R², ainsi que la vérification des hypothèses concernant les résidus. Des commandes R essentielles et une checklist pour répondre aux questions d'examen sont également fournies.

Transféré par

Hassan Zorkot
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues14 pages

Guide de Révision

Le guide de révision sur la régression linéaire multiple explique comment modéliser une variable dépendante en fonction de plusieurs variables indépendantes, interpréter les coefficients, et évaluer la significativité des variables à l'aide de tests d'hypothèses. Il aborde également la qualité d'ajustement du modèle via le coefficient de détermination R², ainsi que la vérification des hypothèses concernant les résidus. Des commandes R essentielles et une checklist pour répondre aux questions d'examen sont également fournies.

Transféré par

Hassan Zorkot
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

GUIDE DE RÉVISION - RÉGRESSION LINÉAIRE MULTIPLE

Focus 100% Examen & Interprétation des résultats R

══════════════════════════════════════════════════════════
═════════════

📚 PARTIE 1 : COMPRENDRE LE MODÈLE DE BASE

Qu'est-ce que la régression linéaire multiple ?

C'est une méthode statistique qui permet d'expliquer une variable quantitative Y (variable à
expliquer, dépendante, endogène) en fonction de plusieurs variables quantitatives X₁, X₂, ..., X ₖ
(variables explicatives, indépendantes, exogènes).

Le modèle s'écrit : Y = β₀ + β₁X₁ + β₂X₂ + ... + βₖXₖ + ε

Où :

• β₀ = constante (ordonnée à l'origine)

• β₁, β₂, ..., βₖ = coefficients des variables explicatives

• ε = terme d'erreur aléatoire (moyenne nulle, écart-type σ)

Exemple concret :

Temps_passé_plateforme = β₀ + β₁(Nb_Cours) + β₂(Nb_Vidéos) + β₃(Activités) + ε

══════════════════════════════════════════════════════════
═════════════

📊 PARTIE 2 : INTERPRÉTER LES COEFFICIENTS (ESSENTIEL POUR L'EXAMEN)

Quand R te donne un modèle estimé, tu verras quelque chose comme :

Ŷ = 5.2 + 0.8X₁ - 0.3X₂ + 1.5X₃


Comment interpréter chaque coefficient ?

β̂ ₁ = 0.8 signifie : "Toutes choses égales par ailleurs (en gardant X₂ et X₃ constants), quand X₁
augmente d'une unité, Y augmente en moyenne de 0.8 unités."

β̂ ₂ = -0.3 signifie : "Toutes choses égales par ailleurs, quand X₂ augmente d'une unité, Y diminue en
moyenne de 0.3 unités."

Le signe du coefficient est crucial :

• Coefficient POSITIF → relation croissante (X augmente, Y augmente)

• Coefficient NÉGATIF → relation décroissante (X augmente, Y diminue)

Exemple pratique pour ton examen :

Si Coefficient(Nb_Vidéos) = 2.5, tu écris : "Chaque vidéo supplémentaire regardée augmente en


moyenne le temps passé sur la plateforme de 2.5 minutes, toutes choses égales par ailleurs."

══════════════════════════════════════════════════════════
═════════════

🎯 PARTIE 3 : LA SIGNIFICATIVITÉ DES VARIABLES (QUESTION CLASSIQUE D'EXAMEN)

C'est LA question la plus fréquente à l'examen : "Cette variable a-t-elle un effet significatif ?"

Le test d'hypothèses réalisé :

H₀ : βⱼ = 0 (la variable Xⱼ n'a pas d'effet sur Y)

H₁ : βⱼ ≠ 0 (la variable Xⱼ a un effet significatif sur Y)

Comment juger la significativité ?

Dans les résultats R, tu verras un tableau avec une colonne "Pr(>|t|)" ou "p-value".

RÈGLE D'OR (à connaître par cœur) :

• Si p-value < 0.05 (ou 5%) → Variable SIGNIFICATIVE au seuil de 5%


→ On REJETTE H₀ → La variable a un effet réel sur Y

• Si p-value ≥ 0.05 → Variable NON SIGNIFICATIVE au seuil de 5%

→ On NE PEUT PAS REJETER H₀ → On ne peut pas conclure que la variable a un effet

Astuce pour l'examen : Souvent R marque la significativité avec des étoiles :

*** = très significatif (p < 0.001)

** = significatif (p < 0.01)

* = significatif (p < 0.05)

. = faiblement significatif (p < 0.1)

(rien) = non significatif (p ≥ 0.1)

Comment répondre à l'examen :

"La variable Nb_Cours est significative au seuil de 5% (p-value = 0.003 < 0.05), donc elle a un effet
significatif sur le temps passé sur la plateforme. Par contre, la variable Heure_Connexion n'est pas
significative (p-value = 0.234 > 0.05), donc on ne peut pas conclure qu'elle influence le temps passé."

══════════════════════════════════════════════════════════
═════════════

📈 PARTIE 4 : QUALITÉ D'AJUSTEMENT - LE R² (TOUJOURS DEMANDÉ À L'EXAMEN)

Le coefficient de détermination R² mesure la qualité du modèle.

Formule : R² = SCE/SCT (rapport de la somme des carrés expliquée sur totale)

R² est toujours compris entre 0 et 1 (ou 0% et 100%).

Interprétation du R² :

R² = 0.85 (ou 85%) signifie : "Le modèle explique 85% de la variabilité de Y. Les variables explicatives
du modèle permettent de rendre compte de 85% des variations observées dans Y."
Comment juger si c'est bon ?

• R² > 0.70 (70%) : Très bon ajustement

• R² entre 0.50 et 0.70 : Bon ajustement

• R² entre 0.30 et 0.50 : Ajustement moyen

• R² < 0.30 : Ajustement faible

ATTENTION : R² augmente toujours quand on ajoute des variables, même non significatives !

Comment répondre à l'examen :

"Le coefficient de détermination R² est de 0.72, ce qui signifie que le modèle explique 72% de la
variabilité du temps passé sur la plateforme. C'est une bonne qualité d'ajustement, même si 28% de
la variabilité reste inexpliquée par le modèle (peut-être due à d'autres facteurs non mesurés)."

══════════════════════════════════════════════════════════
═════════════

🔍 PARTIE 5 : VÉRIFICATION DES HYPOTHÈSES - LES RÉSIDUS (QUESTIONS GRAPHIQUES)

Les résidus sont les erreurs du modèle : eᵢ = yᵢ - ŷᵢ

(la différence entre la valeur observée et la valeur prédite)

Trois vérifications essentielles à connaître pour l'examen :

────────────────────────────────────────────────────────────────────────

A. NORMALITÉ DES RÉSIDUS

Test utilisé : Test de Shapiro-Wilk

Hypothèses :

H₀ : Les résidus suivent une loi normale

H₁ : Les résidus ne suivent pas une loi normale


Règle de décision :

• Si p-value > 0.05 → On NE REJETTE PAS H₀ → Les résidus sont normaux ✓

• Si p-value < 0.05 → On REJETTE H₀ → Les résidus ne sont pas normaux ✗

Graphique : Droite de Henry (QQ-plot)

Comment l'interpréter ?

• Points bien alignés sur la droite diagonale = Normalité respectée ✓

• Points qui s'écartent fortement de la droite = Normalité non respectée ✗

• Petites déviations aux extrémités = Acceptable dans la pratique

Pour l'examen, tu écris :

"Sur la droite de Henry, les points sont globalement alignés sur la droite théorique, ce qui indique
que l'hypothèse de normalité des résidus est respectée. Le test de Shapiro-Wilk confirme cette
observation avec une p-value de 0.368 > 0.05, donc on ne peut pas rejeter l'hypothèse de normalité."

────────────────────────────────────────────────────────────────────────

B. HOMOSCÉDASTICITÉ DES RÉSIDUS

Définition : Les résidus ont une variance constante, quelle que soit la valeur prédite.

Graphique : Résidus vs Valeurs prédites (ou Fitted values)

Comment l'interpréter ?

• Points dispersés aléatoirement autour de 0, sans structure particulière = Homoscédasticité


respectée ✓

• Forme en entonnoir (dispersion qui augmente ou diminue) = Hétéroscédasticité ✗

• Structure ou motif visible (courbe, arc) = Problème de spécification ✗

Pour l'examen, tu écris :

"Le graphique des résidus en fonction des valeurs prédites montre un nuage de points dispersé de
manière homogène autour de zéro, sans structure particulière. La dispersion semble constante sur
toute la plage des valeurs prédites, ce qui indique que l'hypothèse d'homoscédasticité est
respectée."

Ou si c'est mauvais :

"On observe une forme en entonnoir sur le graphique : la dispersion des résidus augmente avec les
valeurs prédites. Cela indique une hétéroscédasticité, l'hypothèse d'homoscédasticité n'est donc pas
respectée."

────────────────────────────────────────────────────────────────────────

C. INDÉPENDANCE DES RÉSIDUS

Les résidus doivent être non corrélés entre eux.

Cette hypothèse est généralement vérifiée si :

• Les observations sont indépendantes (pas de structure temporelle ou spatiale)

• Il n'y a pas d'autocorrélation visible sur le graphique des résidus

══════════════════════════════════════════════════════════
═════════════

💻 PARTIE 6 : COMMANDES R À CONNAÎTRE

Tu n'auras pas à coder à l'examen, mais tu dois reconnaître ces commandes :

> modele <- lm(Y ~ X1 + X2 + X3, data=données)

Cette commande estime le modèle de régression multiple.

> summary(modele)

Affiche le résumé complet : coefficients, p-values, R², etc.

> coef(modele)

Extrait uniquement les coefficients estimés.


> residuals(modele)

Extrait les résidus du modèle.

> fitted(modele)

Extrait les valeurs prédites ŷᵢ.

> plot(modele)

Génère les graphiques de diagnostic (dont résidus et QQ-plot).

> [Link](resid(modele))

Réalise le test de normalité de Shapiro-Wilk sur les résidus.

> qqnorm(resid(modele)); qqline(resid(modele))

Trace la droite de Henry pour vérifier visuellement la normalité.

══════════════════════════════════════════════════════════
═════════════

📋 PARTIE 7 : CHECKLIST POUR RÉPONDRE AUX QUESTIONS D'EXAMEN

Question : "Identifier la variable à expliquer et les variables explicatives"

✓ Variable à expliquer = celle qu'on cherche à modéliser (Y)

✓ Variables explicatives = celles qui influencent Y (X₁, X₂, ...)

Question : "Identifier le test d'hypothèses et formuler les hypothèses"

✓ Test de Student (ou test t) pour chaque coefficient

✓ H₀ : βⱼ = 0 vs H₁ : βⱼ ≠ 0

Question : "Juger la significativité des variables"

✓ Comparer chaque p-value au seuil α = 0.05

✓ Conclure variable par variable avec justification


Question : "Interpréter la qualité d'ajustement"

✓ Donner la valeur du R²

✓ L'interpréter en pourcentage de variabilité expliquée

✓ Commenter si c'est bon/moyen/faible

Question : "Interpréter la normalité des résidus"

✓ Décrire le QQ-plot (points alignés ou non)

✓ Donner la p-value du test de Shapiro-Wilk

✓ Conclure si l'hypothèse est respectée

Question : "Rappeler et interpréter l'homoscédasticité"

✓ Définir : variance constante des résidus

✓ Décrire le graphique (dispersion homogène ou forme en entonnoir)

✓ Conclure si l'hypothèse est respectée

══════════════════════════════════════════════════════════
═════════════

🎓 PARTIE 8 : EXEMPLE COMPLET DE RÉPONSE TYPE EXAMEN

Situation : Modèle estimé pour prédire le temps passé sur une plateforme éducative

Résultats R donnés :

Coefficients :

Estimate [Link] t-value Pr(>|t|)

(Intercept) 3.245 1.123 2.890 0.006 **

Nb_Cours 2.150 0.456 4.714 0.000 ***

Nb_Videos 0.850 0.234 3.632 0.001 **

Activites 1.420 0.312 4.551 0.000 ***

Heure_Connexion 0.123 0.089 1.382 0.175


R² = 0.784

Test de Shapiro-Wilk : W = 0.981, p-value = 0.342

────────────────────────────────────────────────────────────────────────

Question 1 : Identifier la variable à expliquer et les variables explicatives.

RÉPONSE :

La variable à expliquer (variable dépendante) est le Temps passé sur la plateforme (TPS), mesurée en
minutes par jour.

Les variables explicatives (variables indépendantes) sont :

- Nombre de Cours Suivis (NCS)

- Nombre de Vidéos Regardées (NVR)

- Nombre d'Activités complétées (Act)

- Heure de Connexion (HC)

────────────────────────────────────────────────────────────────────────

Question 2 : Identifier le test d'hypothèses et formuler les hypothèses.

RÉPONSE :

Le test d'hypothèses réalisé est le test de Student (test t) pour tester la significativité individuelle de
chaque coefficient de régression.

Pour chaque variable Xⱼ, les hypothèses sont :

H₀ : βⱼ = 0 (la variable Xⱼ n'a pas d'effet significatif sur le temps passé)

H₁ : βⱼ ≠ 0 (la variable Xⱼ a un effet significatif sur le temps passé)

La décision se prend au seuil de significativité α = 5% en comparant la p-value au seuil.


────────────────────────────────────────────────────────────────────────

Question 3 : Juger la significativité des variables et justifier.

RÉPONSE :

Au seuil de significativité de 5% :

Variable Nb_Cours : SIGNIFICATIVE (p-value = 0.000 < 0.05)

Le nombre de cours suivis a un effet positif et significatif sur le temps passé. Chaque cours
supplémentaire augmente en moyenne le temps passé de 2.15 minutes.

Variable Nb_Videos : SIGNIFICATIVE (p-value = 0.001 < 0.05)

Le nombre de vidéos regardées a un effet positif et significatif. Chaque vidéo supplémentaire


augmente le temps passé de 0.85 minutes.

Variable Activites : SIGNIFICATIVE (p-value = 0.000 < 0.05)

Le nombre d'activités complétées a un effet positif et significatif. Chaque activité supplémentaire


augmente le temps passé de 1.42 minutes.

Variable Heure_Connexion : NON SIGNIFICATIVE (p-value = 0.175 > 0.05)

L'heure de connexion n'a pas d'effet significatif sur le temps passé au seuil de 5%. On ne peut pas
conclure que cette variable influence le temps passé sur la plateforme.

────────────────────────────────────────────────────────────────────────

Question 4 : Interpréter la qualité d'ajustement du modèle.

RÉPONSE :

Le coefficient de détermination R² est de 0.784, soit 78.4%.

Cela signifie que le modèle de régression explique 78.4% de la variabilité totale du temps passé sur la
plateforme. Les quatre variables explicatives (nombre de cours, vidéos, activités et heure de
connexion) permettent de rendre compte de plus des trois quarts des variations observées dans le
temps passé.
C'est une très bonne qualité d'ajustement. Il reste 21.6% de variabilité inexpliquée qui pourrait être
due à d'autres facteurs non inclus dans le modèle (par exemple la motivation des étudiants, la qualité
du contenu, etc.).

────────────────────────────────────────────────────────────────────────

Question 5a : Interpréter la normalité des résidus.

RÉPONSE (en supposant que tu as un QQ-plot qui montre des points alignés) :

Sur la droite de Henry (QQ-plot), les points représentant les quantiles des résidus sont bien alignés
sur la droite théorique de la loi normale, avec seulement de légères déviations aux extrémités qui
sont acceptables.

Le test de Shapiro-Wilk confirme cette observation visuelle : avec une p-value de 0.342, largement
supérieure au seuil de 5%, on ne peut pas rejeter l'hypothèse nulle de normalité.

Conclusion : L'hypothèse de normalité des résidus est respectée. Les résidus suivent
approximativement une distribution normale.

────────────────────────────────────────────────────────────────────────

Question 5b : Rappeler la condition d'homoscédasticité et interpréter.

RÉPONSE :

L'homoscédasticité signifie que la variance des résidus est constante, quelle que soit la valeur prédite
par le modèle. En d'autres termes, la dispersion des erreurs doit être la même pour toutes les valeurs
de la variable à expliquer.

Interprétation du graphique (en supposant un graphique correct) :

Sur le graphique des résidus en fonction des valeurs prédites, on observe un nuage de points
dispersé de manière aléatoire et homogène autour de la ligne horizontale à zéro. La dispersion des
points reste constante sur toute la plage des valeurs prédites, sans forme particulière (pas
d'entonnoir, pas de structure).
Conclusion : L'hypothèse d'homoscédasticité est respectée. La variance des résidus est constante.

══════════════════════════════════════════════════════════
═════════════

⚡ PARTIE 9 : ERREURS À ÉVITER ABSOLUMENT

❌ Confondre significativité et importance

Une variable peut être très significative (p < 0.001) mais avoir un coefficient faible, donc un effet
pratique limité.

❌ Dire qu'une variable non significative "n'a pas d'effet"

Formule correcte : "On ne peut pas conclure que la variable a un effet significatif au seuil de 5%."

❌ Interpréter R² comme "le modèle est correct à 85%"

Non ! R² mesure la part de variabilité EXPLIQUÉE, pas la "justesse" du modèle.

❌ Oublier "toutes choses égales par ailleurs" dans l'interprétation des coefficients

C'est crucial en régression multiple !

❌ Ne pas justifier avec les valeurs numériques

Toujours donner la p-value quand tu juges une significativité, le R² quand tu parles de qualité
d'ajustement, etc.

══════════════════════════════════════════════════════════
═════════════

✨ PARTIE 10 : VOCABULAIRE TECHNIQUE À MAÎTRISER

Termes équivalents à connaître :

Variable à expliquer = Variable dépendante = Variable endogène = Y


Variables explicatives = Variables indépendantes = Variables exogènes = Régresseurs = X₁, X₂, ...

SCT = Somme des Carrés Totale = Variabilité totale de Y

SCE = Somme des Carrés Expliquée = Variabilité de Y expliquée par le modèle

SCR = Somme des Carrés Résiduelle = Variabilité de Y non expliquée

Résidus = Erreurs = Écarts = eᵢ = yᵢ - ŷᵢ

Valeurs ajustées = Valeurs prédites = Valeurs estimées = ŷᵢ

══════════════════════════════════════════════════════════
═════════════

🎯 RÉCAPITULATIF ULTRA-RAPIDE POUR L'EXAMEN

1. COEFFICIENTS : Signe + interprétation "toutes choses égales par ailleurs"

2. SIGNIFICATIVITÉ : p-value < 0.05 = significatif, p-value ≥ 0.05 = non significatif

3. R² : Entre 0 et 1, mesure le % de variabilité expliquée

4. NORMALITÉ : QQ-plot aligné + Shapiro p-value > 0.05 = OK

5. HOMOSCÉDASTICITÉ : Résidus dispersés uniformément autour de 0 = OK

6. TOUJOURS JUSTIFIER avec les valeurs numériques !

══════════════════════════════════════════════════════════
═════════════
BON COURAGE POUR TON EXAMEN ! 🚀

Tu as maintenant TOUT ce qu'il faut pour interpréter correctement les résultats d'une régression
linéaire multiple. Concentre-toi sur la compréhension plutôt que la mémorisation mécanique, et tu
réussiras !

Vous aimerez peut-être aussi