GUIDE DE RÉVISION - RÉGRESSION LINÉAIRE MULTIPLE
Focus 100% Examen & Interprétation des résultats R
══════════════════════════════════════════════════════════
═════════════
📚 PARTIE 1 : COMPRENDRE LE MODÈLE DE BASE
Qu'est-ce que la régression linéaire multiple ?
C'est une méthode statistique qui permet d'expliquer une variable quantitative Y (variable à
expliquer, dépendante, endogène) en fonction de plusieurs variables quantitatives X₁, X₂, ..., X ₖ
(variables explicatives, indépendantes, exogènes).
Le modèle s'écrit : Y = β₀ + β₁X₁ + β₂X₂ + ... + βₖXₖ + ε
Où :
• β₀ = constante (ordonnée à l'origine)
• β₁, β₂, ..., βₖ = coefficients des variables explicatives
• ε = terme d'erreur aléatoire (moyenne nulle, écart-type σ)
Exemple concret :
Temps_passé_plateforme = β₀ + β₁(Nb_Cours) + β₂(Nb_Vidéos) + β₃(Activités) + ε
══════════════════════════════════════════════════════════
═════════════
📊 PARTIE 2 : INTERPRÉTER LES COEFFICIENTS (ESSENTIEL POUR L'EXAMEN)
Quand R te donne un modèle estimé, tu verras quelque chose comme :
Ŷ = 5.2 + 0.8X₁ - 0.3X₂ + 1.5X₃
Comment interpréter chaque coefficient ?
β̂ ₁ = 0.8 signifie : "Toutes choses égales par ailleurs (en gardant X₂ et X₃ constants), quand X₁
augmente d'une unité, Y augmente en moyenne de 0.8 unités."
β̂ ₂ = -0.3 signifie : "Toutes choses égales par ailleurs, quand X₂ augmente d'une unité, Y diminue en
moyenne de 0.3 unités."
Le signe du coefficient est crucial :
• Coefficient POSITIF → relation croissante (X augmente, Y augmente)
• Coefficient NÉGATIF → relation décroissante (X augmente, Y diminue)
Exemple pratique pour ton examen :
Si Coefficient(Nb_Vidéos) = 2.5, tu écris : "Chaque vidéo supplémentaire regardée augmente en
moyenne le temps passé sur la plateforme de 2.5 minutes, toutes choses égales par ailleurs."
══════════════════════════════════════════════════════════
═════════════
🎯 PARTIE 3 : LA SIGNIFICATIVITÉ DES VARIABLES (QUESTION CLASSIQUE D'EXAMEN)
C'est LA question la plus fréquente à l'examen : "Cette variable a-t-elle un effet significatif ?"
Le test d'hypothèses réalisé :
H₀ : βⱼ = 0 (la variable Xⱼ n'a pas d'effet sur Y)
H₁ : βⱼ ≠ 0 (la variable Xⱼ a un effet significatif sur Y)
Comment juger la significativité ?
Dans les résultats R, tu verras un tableau avec une colonne "Pr(>|t|)" ou "p-value".
RÈGLE D'OR (à connaître par cœur) :
• Si p-value < 0.05 (ou 5%) → Variable SIGNIFICATIVE au seuil de 5%
→ On REJETTE H₀ → La variable a un effet réel sur Y
• Si p-value ≥ 0.05 → Variable NON SIGNIFICATIVE au seuil de 5%
→ On NE PEUT PAS REJETER H₀ → On ne peut pas conclure que la variable a un effet
Astuce pour l'examen : Souvent R marque la significativité avec des étoiles :
*** = très significatif (p < 0.001)
** = significatif (p < 0.01)
* = significatif (p < 0.05)
. = faiblement significatif (p < 0.1)
(rien) = non significatif (p ≥ 0.1)
Comment répondre à l'examen :
"La variable Nb_Cours est significative au seuil de 5% (p-value = 0.003 < 0.05), donc elle a un effet
significatif sur le temps passé sur la plateforme. Par contre, la variable Heure_Connexion n'est pas
significative (p-value = 0.234 > 0.05), donc on ne peut pas conclure qu'elle influence le temps passé."
══════════════════════════════════════════════════════════
═════════════
📈 PARTIE 4 : QUALITÉ D'AJUSTEMENT - LE R² (TOUJOURS DEMANDÉ À L'EXAMEN)
Le coefficient de détermination R² mesure la qualité du modèle.
Formule : R² = SCE/SCT (rapport de la somme des carrés expliquée sur totale)
R² est toujours compris entre 0 et 1 (ou 0% et 100%).
Interprétation du R² :
R² = 0.85 (ou 85%) signifie : "Le modèle explique 85% de la variabilité de Y. Les variables explicatives
du modèle permettent de rendre compte de 85% des variations observées dans Y."
Comment juger si c'est bon ?
• R² > 0.70 (70%) : Très bon ajustement
• R² entre 0.50 et 0.70 : Bon ajustement
• R² entre 0.30 et 0.50 : Ajustement moyen
• R² < 0.30 : Ajustement faible
ATTENTION : R² augmente toujours quand on ajoute des variables, même non significatives !
Comment répondre à l'examen :
"Le coefficient de détermination R² est de 0.72, ce qui signifie que le modèle explique 72% de la
variabilité du temps passé sur la plateforme. C'est une bonne qualité d'ajustement, même si 28% de
la variabilité reste inexpliquée par le modèle (peut-être due à d'autres facteurs non mesurés)."
══════════════════════════════════════════════════════════
═════════════
🔍 PARTIE 5 : VÉRIFICATION DES HYPOTHÈSES - LES RÉSIDUS (QUESTIONS GRAPHIQUES)
Les résidus sont les erreurs du modèle : eᵢ = yᵢ - ŷᵢ
(la différence entre la valeur observée et la valeur prédite)
Trois vérifications essentielles à connaître pour l'examen :
────────────────────────────────────────────────────────────────────────
A. NORMALITÉ DES RÉSIDUS
Test utilisé : Test de Shapiro-Wilk
Hypothèses :
H₀ : Les résidus suivent une loi normale
H₁ : Les résidus ne suivent pas une loi normale
Règle de décision :
• Si p-value > 0.05 → On NE REJETTE PAS H₀ → Les résidus sont normaux ✓
• Si p-value < 0.05 → On REJETTE H₀ → Les résidus ne sont pas normaux ✗
Graphique : Droite de Henry (QQ-plot)
Comment l'interpréter ?
• Points bien alignés sur la droite diagonale = Normalité respectée ✓
• Points qui s'écartent fortement de la droite = Normalité non respectée ✗
• Petites déviations aux extrémités = Acceptable dans la pratique
Pour l'examen, tu écris :
"Sur la droite de Henry, les points sont globalement alignés sur la droite théorique, ce qui indique
que l'hypothèse de normalité des résidus est respectée. Le test de Shapiro-Wilk confirme cette
observation avec une p-value de 0.368 > 0.05, donc on ne peut pas rejeter l'hypothèse de normalité."
────────────────────────────────────────────────────────────────────────
B. HOMOSCÉDASTICITÉ DES RÉSIDUS
Définition : Les résidus ont une variance constante, quelle que soit la valeur prédite.
Graphique : Résidus vs Valeurs prédites (ou Fitted values)
Comment l'interpréter ?
• Points dispersés aléatoirement autour de 0, sans structure particulière = Homoscédasticité
respectée ✓
• Forme en entonnoir (dispersion qui augmente ou diminue) = Hétéroscédasticité ✗
• Structure ou motif visible (courbe, arc) = Problème de spécification ✗
Pour l'examen, tu écris :
"Le graphique des résidus en fonction des valeurs prédites montre un nuage de points dispersé de
manière homogène autour de zéro, sans structure particulière. La dispersion semble constante sur
toute la plage des valeurs prédites, ce qui indique que l'hypothèse d'homoscédasticité est
respectée."
Ou si c'est mauvais :
"On observe une forme en entonnoir sur le graphique : la dispersion des résidus augmente avec les
valeurs prédites. Cela indique une hétéroscédasticité, l'hypothèse d'homoscédasticité n'est donc pas
respectée."
────────────────────────────────────────────────────────────────────────
C. INDÉPENDANCE DES RÉSIDUS
Les résidus doivent être non corrélés entre eux.
Cette hypothèse est généralement vérifiée si :
• Les observations sont indépendantes (pas de structure temporelle ou spatiale)
• Il n'y a pas d'autocorrélation visible sur le graphique des résidus
══════════════════════════════════════════════════════════
═════════════
💻 PARTIE 6 : COMMANDES R À CONNAÎTRE
Tu n'auras pas à coder à l'examen, mais tu dois reconnaître ces commandes :
> modele <- lm(Y ~ X1 + X2 + X3, data=données)
Cette commande estime le modèle de régression multiple.
> summary(modele)
Affiche le résumé complet : coefficients, p-values, R², etc.
> coef(modele)
Extrait uniquement les coefficients estimés.
> residuals(modele)
Extrait les résidus du modèle.
> fitted(modele)
Extrait les valeurs prédites ŷᵢ.
> plot(modele)
Génère les graphiques de diagnostic (dont résidus et QQ-plot).
> [Link](resid(modele))
Réalise le test de normalité de Shapiro-Wilk sur les résidus.
> qqnorm(resid(modele)); qqline(resid(modele))
Trace la droite de Henry pour vérifier visuellement la normalité.
══════════════════════════════════════════════════════════
═════════════
📋 PARTIE 7 : CHECKLIST POUR RÉPONDRE AUX QUESTIONS D'EXAMEN
Question : "Identifier la variable à expliquer et les variables explicatives"
✓ Variable à expliquer = celle qu'on cherche à modéliser (Y)
✓ Variables explicatives = celles qui influencent Y (X₁, X₂, ...)
Question : "Identifier le test d'hypothèses et formuler les hypothèses"
✓ Test de Student (ou test t) pour chaque coefficient
✓ H₀ : βⱼ = 0 vs H₁ : βⱼ ≠ 0
Question : "Juger la significativité des variables"
✓ Comparer chaque p-value au seuil α = 0.05
✓ Conclure variable par variable avec justification
Question : "Interpréter la qualité d'ajustement"
✓ Donner la valeur du R²
✓ L'interpréter en pourcentage de variabilité expliquée
✓ Commenter si c'est bon/moyen/faible
Question : "Interpréter la normalité des résidus"
✓ Décrire le QQ-plot (points alignés ou non)
✓ Donner la p-value du test de Shapiro-Wilk
✓ Conclure si l'hypothèse est respectée
Question : "Rappeler et interpréter l'homoscédasticité"
✓ Définir : variance constante des résidus
✓ Décrire le graphique (dispersion homogène ou forme en entonnoir)
✓ Conclure si l'hypothèse est respectée
══════════════════════════════════════════════════════════
═════════════
🎓 PARTIE 8 : EXEMPLE COMPLET DE RÉPONSE TYPE EXAMEN
Situation : Modèle estimé pour prédire le temps passé sur une plateforme éducative
Résultats R donnés :
Coefficients :
Estimate [Link] t-value Pr(>|t|)
(Intercept) 3.245 1.123 2.890 0.006 **
Nb_Cours 2.150 0.456 4.714 0.000 ***
Nb_Videos 0.850 0.234 3.632 0.001 **
Activites 1.420 0.312 4.551 0.000 ***
Heure_Connexion 0.123 0.089 1.382 0.175
R² = 0.784
Test de Shapiro-Wilk : W = 0.981, p-value = 0.342
────────────────────────────────────────────────────────────────────────
Question 1 : Identifier la variable à expliquer et les variables explicatives.
RÉPONSE :
La variable à expliquer (variable dépendante) est le Temps passé sur la plateforme (TPS), mesurée en
minutes par jour.
Les variables explicatives (variables indépendantes) sont :
- Nombre de Cours Suivis (NCS)
- Nombre de Vidéos Regardées (NVR)
- Nombre d'Activités complétées (Act)
- Heure de Connexion (HC)
────────────────────────────────────────────────────────────────────────
Question 2 : Identifier le test d'hypothèses et formuler les hypothèses.
RÉPONSE :
Le test d'hypothèses réalisé est le test de Student (test t) pour tester la significativité individuelle de
chaque coefficient de régression.
Pour chaque variable Xⱼ, les hypothèses sont :
H₀ : βⱼ = 0 (la variable Xⱼ n'a pas d'effet significatif sur le temps passé)
H₁ : βⱼ ≠ 0 (la variable Xⱼ a un effet significatif sur le temps passé)
La décision se prend au seuil de significativité α = 5% en comparant la p-value au seuil.
────────────────────────────────────────────────────────────────────────
Question 3 : Juger la significativité des variables et justifier.
RÉPONSE :
Au seuil de significativité de 5% :
Variable Nb_Cours : SIGNIFICATIVE (p-value = 0.000 < 0.05)
Le nombre de cours suivis a un effet positif et significatif sur le temps passé. Chaque cours
supplémentaire augmente en moyenne le temps passé de 2.15 minutes.
Variable Nb_Videos : SIGNIFICATIVE (p-value = 0.001 < 0.05)
Le nombre de vidéos regardées a un effet positif et significatif. Chaque vidéo supplémentaire
augmente le temps passé de 0.85 minutes.
Variable Activites : SIGNIFICATIVE (p-value = 0.000 < 0.05)
Le nombre d'activités complétées a un effet positif et significatif. Chaque activité supplémentaire
augmente le temps passé de 1.42 minutes.
Variable Heure_Connexion : NON SIGNIFICATIVE (p-value = 0.175 > 0.05)
L'heure de connexion n'a pas d'effet significatif sur le temps passé au seuil de 5%. On ne peut pas
conclure que cette variable influence le temps passé sur la plateforme.
────────────────────────────────────────────────────────────────────────
Question 4 : Interpréter la qualité d'ajustement du modèle.
RÉPONSE :
Le coefficient de détermination R² est de 0.784, soit 78.4%.
Cela signifie que le modèle de régression explique 78.4% de la variabilité totale du temps passé sur la
plateforme. Les quatre variables explicatives (nombre de cours, vidéos, activités et heure de
connexion) permettent de rendre compte de plus des trois quarts des variations observées dans le
temps passé.
C'est une très bonne qualité d'ajustement. Il reste 21.6% de variabilité inexpliquée qui pourrait être
due à d'autres facteurs non inclus dans le modèle (par exemple la motivation des étudiants, la qualité
du contenu, etc.).
────────────────────────────────────────────────────────────────────────
Question 5a : Interpréter la normalité des résidus.
RÉPONSE (en supposant que tu as un QQ-plot qui montre des points alignés) :
Sur la droite de Henry (QQ-plot), les points représentant les quantiles des résidus sont bien alignés
sur la droite théorique de la loi normale, avec seulement de légères déviations aux extrémités qui
sont acceptables.
Le test de Shapiro-Wilk confirme cette observation visuelle : avec une p-value de 0.342, largement
supérieure au seuil de 5%, on ne peut pas rejeter l'hypothèse nulle de normalité.
Conclusion : L'hypothèse de normalité des résidus est respectée. Les résidus suivent
approximativement une distribution normale.
────────────────────────────────────────────────────────────────────────
Question 5b : Rappeler la condition d'homoscédasticité et interpréter.
RÉPONSE :
L'homoscédasticité signifie que la variance des résidus est constante, quelle que soit la valeur prédite
par le modèle. En d'autres termes, la dispersion des erreurs doit être la même pour toutes les valeurs
de la variable à expliquer.
Interprétation du graphique (en supposant un graphique correct) :
Sur le graphique des résidus en fonction des valeurs prédites, on observe un nuage de points
dispersé de manière aléatoire et homogène autour de la ligne horizontale à zéro. La dispersion des
points reste constante sur toute la plage des valeurs prédites, sans forme particulière (pas
d'entonnoir, pas de structure).
Conclusion : L'hypothèse d'homoscédasticité est respectée. La variance des résidus est constante.
══════════════════════════════════════════════════════════
═════════════
⚡ PARTIE 9 : ERREURS À ÉVITER ABSOLUMENT
❌ Confondre significativité et importance
Une variable peut être très significative (p < 0.001) mais avoir un coefficient faible, donc un effet
pratique limité.
❌ Dire qu'une variable non significative "n'a pas d'effet"
Formule correcte : "On ne peut pas conclure que la variable a un effet significatif au seuil de 5%."
❌ Interpréter R² comme "le modèle est correct à 85%"
Non ! R² mesure la part de variabilité EXPLIQUÉE, pas la "justesse" du modèle.
❌ Oublier "toutes choses égales par ailleurs" dans l'interprétation des coefficients
C'est crucial en régression multiple !
❌ Ne pas justifier avec les valeurs numériques
Toujours donner la p-value quand tu juges une significativité, le R² quand tu parles de qualité
d'ajustement, etc.
══════════════════════════════════════════════════════════
═════════════
✨ PARTIE 10 : VOCABULAIRE TECHNIQUE À MAÎTRISER
Termes équivalents à connaître :
Variable à expliquer = Variable dépendante = Variable endogène = Y
Variables explicatives = Variables indépendantes = Variables exogènes = Régresseurs = X₁, X₂, ...
SCT = Somme des Carrés Totale = Variabilité totale de Y
SCE = Somme des Carrés Expliquée = Variabilité de Y expliquée par le modèle
SCR = Somme des Carrés Résiduelle = Variabilité de Y non expliquée
Résidus = Erreurs = Écarts = eᵢ = yᵢ - ŷᵢ
Valeurs ajustées = Valeurs prédites = Valeurs estimées = ŷᵢ
══════════════════════════════════════════════════════════
═════════════
🎯 RÉCAPITULATIF ULTRA-RAPIDE POUR L'EXAMEN
1. COEFFICIENTS : Signe + interprétation "toutes choses égales par ailleurs"
2. SIGNIFICATIVITÉ : p-value < 0.05 = significatif, p-value ≥ 0.05 = non significatif
3. R² : Entre 0 et 1, mesure le % de variabilité expliquée
4. NORMALITÉ : QQ-plot aligné + Shapiro p-value > 0.05 = OK
5. HOMOSCÉDASTICITÉ : Résidus dispersés uniformément autour de 0 = OK
6. TOUJOURS JUSTIFIER avec les valeurs numériques !
══════════════════════════════════════════════════════════
═════════════
BON COURAGE POUR TON EXAMEN ! 🚀
Tu as maintenant TOUT ce qu'il faut pour interpréter correctement les résultats d'une régression
linéaire multiple. Concentre-toi sur la compréhension plutôt que la mémorisation mécanique, et tu
réussiras !