Rapport TP 7 — Régression Linéaire & Logistique
Université Mohammed Première
École Supérieure de Technologie de Nador
Filière : ILCS & DAWN — Année : 2025/2026
TP 7
Régression Linéaire &
Régression Logistique
Module : Intelligence Artificielle
Encadrant : O. Mahmoudi
Année universitaire : 2025/2026
Partie 1 : Régression Linéaire Simple
L'objectif de cette partie est de prédire le prix de vente (SalePrice) d'une maison en utilisant
uniquement la surface habitable (GrLivArea) comme variable prédictive.
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
1.1 Importation des bibliothèques et chargement des données
Figure 1.1 — Importation des librairies Python nécessaires
Figure 1.2 — Chargement et aperçu du dataset House Prices
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
1.2 Sélection des variables et division des données (Holdout 80/20)
Figure 1.3 — Sélection de la variable X (GrLivArea) et Y (SalePrice), division train/test
1.3 Entraînement du modèle
Figure 1.4 — Entraînement du modèle de régression linéaire simple
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
1.4 Visualisation et prédictions
Figure 1.5 — Droite de régression sur les données d'entraînement
Figure 1.6 — Prédictions sur l'ensemble de test
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
1.5 Évaluation du modèle
Figure 1.7 — Métriques d'évaluation : MSE, RMSE, MAE, R²
1.6 Réponses aux questions
Q1. Quelle est l'équation de la droite trouvée ?
L'équation est de la forme SalePrice = a + b × GrLivArea, où a est l'ordonnée à l'origine et b est le
coefficient directeur. Ces valeurs sont affichées dans les captures ci-dessus après l'entraînement
(model.intercept_ et model.coef_).
Q2. Que signifie le coefficient b ?
Le coefficient b représente l'augmentation marginale du prix de vente pour chaque pied carré
supplémentaire de surface habitable. Par exemple, si b ≈ 107, cela signifie qu'une augmentation
de 1 ft² entraîne en moyenne une hausse de 107$ du prix.
Q3. Si R² = 0.85, que signifie-t-il ?
Un R² de 0.85 indique que le modèle explique 85% de la variance du prix de vente. Le modèle
capture bien la relation entre la surface et le prix.
Q4. Que se passe-t-il si R² est négatif ?
Un R² négatif signifie que le modèle est moins performant qu'une simple prédiction par la
moyenne. Cela traduit un modèle mal adapté aux données ou une relation non linéaire ignorée.
Q5. Pourquoi RMSE est plus interprétable que MSE ?
La RMSE est exprimée dans la même unité que la variable cible (ici en dollars), ce qui facilite
l'interprétation directe de l'erreur moyenne. La MSE, étant un carré, amplifie les grandes erreurs et
est plus difficile à interpréter concrètement.
Partie 2 : Régression Linéaire Multiple
Dans cette partie, nous utilisons plusieurs variables explicatives — GrLivArea, BedroomAbvGr,
FullBath et TotalBsmtSF — pour prédire SalePrice avec un modèle de régression linéaire
multiple.
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
2.1 Préparation des données et entraînement
Figure 2.1 — Sélection des variables multiples et entraînement du modèle
Figure 2.2 — Coefficients du modèle multiple et intercept
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
2.2 Prédictions et évaluation
Figure 2.3 — Prédictions sur le jeu de test
Figure 2.4 — Métriques d'évaluation de la régression multiple
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
2.3 Comparaison simple vs multiple
Figure 2.5 — Visualisation comparative des résidus : régression simple vs multiple
2.4 Réponses aux questions
Q1. Comparez R² simple vs multiple.
Le R² de la régression multiple est systématiquement supérieur à celui de la régression simple,
car le modèle intègre plus d'informations explicatives sur le prix (nombre de chambres, salles de
bain, sous-sol).
Q2. Pourquoi R² augmente souvent en multiple ?
En régression multiple, chaque variable ajoutée apporte une part d'explication supplémentaire. R²
peut croître même si la variable ajoutée est faiblement corrélée, ce qui motive l'utilisation du R²
ajusté pour tenir compte du nombre de variables.
Q3. Qu'est-ce que la multicolinéarité ?
La multicolinéarité est la corrélation forte entre deux ou plusieurs variables explicatives. Elle rend
les coefficients instables et difficiles à interpréter, sans nécessairement dégrader les prédictions.
On la détecte via le VIF (Variance Inflation Factor).
Q4. Quelle variable influence le plus le prix ?
D'après les coefficients du modèle, GrLivArea (surface habitable) a généralement l'impact le plus
fort sur le prix de vente, ce qui est cohérent avec la réalité du marché immobilier.
Q5. Comment interpréter un coefficient négatif ?
Un coefficient négatif signifie que, toutes choses égales par ailleurs, l'augmentation d'une unité de
cette variable entraîne une diminution du prix prédit. Par exemple, un nombre de chambres élevé
sans surface adaptée peut indiquer des petites pièces et réduire la valeur.
Partie 3 : Validation Croisée (K-Fold)
La validation croisée K-Fold permet d'évaluer la robustesse et la capacité de généralisation du
modèle de manière plus fiable qu'une simple division Holdout.
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
3.1 Mise en œuvre de la validation K-Fold (k=5)
Figure 3.1 — Code de la validation croisée K-Fold avec k=5
Figure 3.2 — Scores par fold et score moyen
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
3.2 Analyse des résultats
Figure 3.3 — Distribution des scores K-Fold et stabilité du modèle
3.3 Réponses aux questions
Q1. Pourquoi K-Fold réduit l'overfitting ?
K-Fold entraîne et évalue le modèle sur k sous-ensembles différents, permettant de s'assurer que
les performances sont stables et non spécifiques à un seul partage des données. Le score moyen
est un estimateur moins biaisé des performances réelles.
Q2. Quelle différence entre Holdout et K-Fold ?
Holdout divise les données une seule fois (ex. 80/20). K-Fold effectue k divisions successives et
fait la moyenne des scores. K-Fold est plus robuste mais plus coûteux en calcul.
Q3. Que se passe-t-il si k = nombre d'observations ?
Cela correspond au Leave-One-Out Cross-Validation (LOOCV). Chaque observation est tour à
tour utilisée comme ensemble de test. C'est très précis mais très coûteux computationnellement
sur de grands datasets.
Partie 4 : Classification — Régression Logistique
Cette partie porte sur la classification multi-classes du dataset Iris. L'objectif est de prédire
l'espèce d'iris (Setosa, Versicolor, Virginica) à partir de ses mesures de sépales et pétales.
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
4.1 Chargement et préparation du dataset Iris
Figure 4.1 — Chargement du dataset Iris et division train/test
Figure 4.2 — Aperçu des données Iris
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
4.2 Entraînement du modèle multinomial
Figure 4.3 — Entraînement du modèle LogisticRegression (multi_class='multinomial')
4.3 Prédictions et évaluation
Figure 4.4 — Prédictions sur les données de test
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
Figure 4.5 — Matrice de confusion et Accuracy
Figure 4.6 — Rapport de classification complet (precision, recall, F1)
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
4.4 Visualisations
Figure 4.7 — Visualisation des frontières de décision
Figure 4.8 — Matrice de confusion graphique
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
Figure 4.9 — Distribution des classes prédites vs réelles
4.5 Réponses aux questions
Q1. Quelle différence entre régression linéaire et logistique ?
La régression linéaire prédit une valeur continue (ex. un prix). La régression logistique prédit une
probabilité d'appartenance à une classe, via la fonction sigmoïde, et produit donc une sortie entre
0 et 1 utilisée pour la classification.
Q2. Pourquoi utilise-t-on la fonction sigmoïde ?
La sigmoïde transforme n'importe quelle valeur réelle en un score entre 0 et 1, interprétable
comme une probabilité. Elle est dérivable partout, ce qui permet l'optimisation par descente de
gradient.
Q3. Que signifie un seuil de 0.5 ?
Avec un seuil de 0.5, si la probabilité prédite est supérieure à 0.5 la classe positive est attribuée,
sinon la classe négative. Ce seuil peut être ajusté selon le coût des erreurs (faux positifs vs faux
négatifs).
Q4. Différence entre OvR et OvO ?
OvR (One vs Rest) entraîne un classifieur binaire par classe contre toutes les autres. OvO (One
vs One) entraîne un classifieur pour chaque paire de classes. OvO est plus précis mais plus
coûteux. Pour Iris (3 classes), OvR suffit généralement.
Q5. Pourquoi la régression logistique ne prédit pas des valeurs continues ?
Car elle utilise la fonction logistique pour projeter le résultat dans [0,1], produisant une probabilité
de classe et non une valeur scalaire continue. Pour une prédiction continue, c'est la régression
linéaire qui est appropriée.
Analyse Globale & Interprétation
Cette section synthétise les observations tirées de l'ensemble des expériences réalisées dans ce
TP.
EST Nador — Intelligence Artificielle — 2025/2026
Rapport TP 7 — Régression Linéaire & Logistique
5.1 Comparaison des performances de régression
Régression simple vs multiple :
Le modèle de régression multiple affiche de meilleures performances que le modèle simple sur
toutes les métriques (R² plus élevé, RMSE et MAE plus faibles). L'ajout de variables comme
TotalBsmtSF et FullBath enrichit significativement la capacité prédictive du modèle.
5.2 Généralisation et risque d'overfitting
Quel modèle généralise le mieux ?
La validation croisée K-Fold montre que les scores sont stables entre les folds, ce qui indique une
bonne généralisation. Le modèle de régression multiple avec 4 variables reste simple et ne
présente pas de risque élevé d'overfitting.
Y a-t-il overfitting ?
Aucun signe évident d'overfitting n'est détecté. Les scores sur l'ensemble de test et les scores K-
Fold sont proches, indiquant que le modèle généralise correctement aux données non vues.
5.3 Choix des métriques
Quelle métrique est la plus adaptée ?
Pour la régression, le RMSE est la métrique la plus informative car il est dans la même unité que
SalePrice (dollars) et pénalise davantage les grandes erreurs. Le R² est utile pour comparer deux
modèles entre eux. Pour la classification Iris, l'Accuracy est pertinente car les classes sont
équilibrées.
5.4 Propositions d'amélioration
• Feature engineering : créer de nouvelles variables dérivées (ex. ratio surface/chambres).
• Traitement des outliers : identifier et supprimer ou transformer les valeurs aberrantes
dans SalePrice.
• Normalisation des données : appliquer StandardScaler pour améliorer la convergence.
• Modèles plus avancés : tester Ridge, Lasso ou Random Forest pour réduire la variance.
• Analyse de multicolinéarité : calculer le VIF pour chaque variable et éliminer les
redondances.
— Fin du rapport —
EST Nador — Intelligence Artificielle — 2025/2026