0% ont trouvé ce document utile (0 vote)
3 vues16 pages

TP2 Rapport

Le rapport présente une analyse approfondie des techniques de régression linéaire et logistique, en se concentrant sur la prédiction des prix de vente de maisons et la classification des espèces d'iris. Il aborde la régression linéaire simple et multiple, ainsi que la validation croisée K-Fold pour évaluer la robustesse des modèles. Les résultats montrent que la régression multiple améliore les performances, tandis que la régression logistique est utilisée pour des problèmes de classification.

Transféré par

ffigdxggdhcdd
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
3 vues16 pages

TP2 Rapport

Le rapport présente une analyse approfondie des techniques de régression linéaire et logistique, en se concentrant sur la prédiction des prix de vente de maisons et la classification des espèces d'iris. Il aborde la régression linéaire simple et multiple, ainsi que la validation croisée K-Fold pour évaluer la robustesse des modèles. Les résultats montrent que la régression multiple améliore les performances, tandis que la régression logistique est utilisée pour des problèmes de classification.

Transféré par

ffigdxggdhcdd
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

Rapport TP 7 — Régression Linéaire & Logistique

Université Mohammed Première


École Supérieure de Technologie de Nador
Filière : ILCS & DAWN — Année : 2025/2026

TP 7

Régression Linéaire &


Régression Logistique

Module : Intelligence Artificielle


Encadrant : O. Mahmoudi
Année universitaire : 2025/2026

Partie 1 : Régression Linéaire Simple


L'objectif de cette partie est de prédire le prix de vente (SalePrice) d'une maison en utilisant
uniquement la surface habitable (GrLivArea) comme variable prédictive.

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

1.1 Importation des bibliothèques et chargement des données

Figure 1.1 — Importation des librairies Python nécessaires

Figure 1.2 — Chargement et aperçu du dataset House Prices

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

1.2 Sélection des variables et division des données (Holdout 80/20)

Figure 1.3 — Sélection de la variable X (GrLivArea) et Y (SalePrice), division train/test

1.3 Entraînement du modèle

Figure 1.4 — Entraînement du modèle de régression linéaire simple

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

1.4 Visualisation et prédictions

Figure 1.5 — Droite de régression sur les données d'entraînement

Figure 1.6 — Prédictions sur l'ensemble de test

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

1.5 Évaluation du modèle

Figure 1.7 — Métriques d'évaluation : MSE, RMSE, MAE, R²

1.6 Réponses aux questions


Q1. Quelle est l'équation de la droite trouvée ?
L'équation est de la forme SalePrice = a + b × GrLivArea, où a est l'ordonnée à l'origine et b est le
coefficient directeur. Ces valeurs sont affichées dans les captures ci-dessus après l'entraînement
(model.intercept_ et model.coef_).
Q2. Que signifie le coefficient b ?
Le coefficient b représente l'augmentation marginale du prix de vente pour chaque pied carré
supplémentaire de surface habitable. Par exemple, si b ≈ 107, cela signifie qu'une augmentation
de 1 ft² entraîne en moyenne une hausse de 107$ du prix.
Q3. Si R² = 0.85, que signifie-t-il ?
Un R² de 0.85 indique que le modèle explique 85% de la variance du prix de vente. Le modèle
capture bien la relation entre la surface et le prix.
Q4. Que se passe-t-il si R² est négatif ?
Un R² négatif signifie que le modèle est moins performant qu'une simple prédiction par la
moyenne. Cela traduit un modèle mal adapté aux données ou une relation non linéaire ignorée.
Q5. Pourquoi RMSE est plus interprétable que MSE ?
La RMSE est exprimée dans la même unité que la variable cible (ici en dollars), ce qui facilite
l'interprétation directe de l'erreur moyenne. La MSE, étant un carré, amplifie les grandes erreurs et
est plus difficile à interpréter concrètement.

Partie 2 : Régression Linéaire Multiple


Dans cette partie, nous utilisons plusieurs variables explicatives — GrLivArea, BedroomAbvGr,
FullBath et TotalBsmtSF — pour prédire SalePrice avec un modèle de régression linéaire
multiple.

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

2.1 Préparation des données et entraînement

Figure 2.1 — Sélection des variables multiples et entraînement du modèle

Figure 2.2 — Coefficients du modèle multiple et intercept

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

2.2 Prédictions et évaluation

Figure 2.3 — Prédictions sur le jeu de test

Figure 2.4 — Métriques d'évaluation de la régression multiple

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

2.3 Comparaison simple vs multiple

Figure 2.5 — Visualisation comparative des résidus : régression simple vs multiple

2.4 Réponses aux questions


Q1. Comparez R² simple vs multiple.
Le R² de la régression multiple est systématiquement supérieur à celui de la régression simple,
car le modèle intègre plus d'informations explicatives sur le prix (nombre de chambres, salles de
bain, sous-sol).
Q2. Pourquoi R² augmente souvent en multiple ?
En régression multiple, chaque variable ajoutée apporte une part d'explication supplémentaire. R²
peut croître même si la variable ajoutée est faiblement corrélée, ce qui motive l'utilisation du R²
ajusté pour tenir compte du nombre de variables.
Q3. Qu'est-ce que la multicolinéarité ?
La multicolinéarité est la corrélation forte entre deux ou plusieurs variables explicatives. Elle rend
les coefficients instables et difficiles à interpréter, sans nécessairement dégrader les prédictions.
On la détecte via le VIF (Variance Inflation Factor).
Q4. Quelle variable influence le plus le prix ?
D'après les coefficients du modèle, GrLivArea (surface habitable) a généralement l'impact le plus
fort sur le prix de vente, ce qui est cohérent avec la réalité du marché immobilier.
Q5. Comment interpréter un coefficient négatif ?
Un coefficient négatif signifie que, toutes choses égales par ailleurs, l'augmentation d'une unité de
cette variable entraîne une diminution du prix prédit. Par exemple, un nombre de chambres élevé
sans surface adaptée peut indiquer des petites pièces et réduire la valeur.

Partie 3 : Validation Croisée (K-Fold)


La validation croisée K-Fold permet d'évaluer la robustesse et la capacité de généralisation du
modèle de manière plus fiable qu'une simple division Holdout.

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

3.1 Mise en œuvre de la validation K-Fold (k=5)

Figure 3.1 — Code de la validation croisée K-Fold avec k=5

Figure 3.2 — Scores par fold et score moyen

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

3.2 Analyse des résultats

Figure 3.3 — Distribution des scores K-Fold et stabilité du modèle

3.3 Réponses aux questions


Q1. Pourquoi K-Fold réduit l'overfitting ?
K-Fold entraîne et évalue le modèle sur k sous-ensembles différents, permettant de s'assurer que
les performances sont stables et non spécifiques à un seul partage des données. Le score moyen
est un estimateur moins biaisé des performances réelles.
Q2. Quelle différence entre Holdout et K-Fold ?
Holdout divise les données une seule fois (ex. 80/20). K-Fold effectue k divisions successives et
fait la moyenne des scores. K-Fold est plus robuste mais plus coûteux en calcul.
Q3. Que se passe-t-il si k = nombre d'observations ?
Cela correspond au Leave-One-Out Cross-Validation (LOOCV). Chaque observation est tour à
tour utilisée comme ensemble de test. C'est très précis mais très coûteux computationnellement
sur de grands datasets.

Partie 4 : Classification — Régression Logistique


Cette partie porte sur la classification multi-classes du dataset Iris. L'objectif est de prédire
l'espèce d'iris (Setosa, Versicolor, Virginica) à partir de ses mesures de sépales et pétales.

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

4.1 Chargement et préparation du dataset Iris

Figure 4.1 — Chargement du dataset Iris et division train/test

Figure 4.2 — Aperçu des données Iris

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

4.2 Entraînement du modèle multinomial

Figure 4.3 — Entraînement du modèle LogisticRegression (multi_class='multinomial')

4.3 Prédictions et évaluation

Figure 4.4 — Prédictions sur les données de test

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

Figure 4.5 — Matrice de confusion et Accuracy

Figure 4.6 — Rapport de classification complet (precision, recall, F1)

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

4.4 Visualisations

Figure 4.7 — Visualisation des frontières de décision

Figure 4.8 — Matrice de confusion graphique

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

Figure 4.9 — Distribution des classes prédites vs réelles

4.5 Réponses aux questions


Q1. Quelle différence entre régression linéaire et logistique ?
La régression linéaire prédit une valeur continue (ex. un prix). La régression logistique prédit une
probabilité d'appartenance à une classe, via la fonction sigmoïde, et produit donc une sortie entre
0 et 1 utilisée pour la classification.
Q2. Pourquoi utilise-t-on la fonction sigmoïde ?
La sigmoïde transforme n'importe quelle valeur réelle en un score entre 0 et 1, interprétable
comme une probabilité. Elle est dérivable partout, ce qui permet l'optimisation par descente de
gradient.
Q3. Que signifie un seuil de 0.5 ?
Avec un seuil de 0.5, si la probabilité prédite est supérieure à 0.5 la classe positive est attribuée,
sinon la classe négative. Ce seuil peut être ajusté selon le coût des erreurs (faux positifs vs faux
négatifs).
Q4. Différence entre OvR et OvO ?
OvR (One vs Rest) entraîne un classifieur binaire par classe contre toutes les autres. OvO (One
vs One) entraîne un classifieur pour chaque paire de classes. OvO est plus précis mais plus
coûteux. Pour Iris (3 classes), OvR suffit généralement.
Q5. Pourquoi la régression logistique ne prédit pas des valeurs continues ?
Car elle utilise la fonction logistique pour projeter le résultat dans [0,1], produisant une probabilité
de classe et non une valeur scalaire continue. Pour une prédiction continue, c'est la régression
linéaire qui est appropriée.

Analyse Globale & Interprétation


Cette section synthétise les observations tirées de l'ensemble des expériences réalisées dans ce
TP.

EST Nador — Intelligence Artificielle — 2025/2026


Rapport TP 7 — Régression Linéaire & Logistique

5.1 Comparaison des performances de régression


Régression simple vs multiple :
Le modèle de régression multiple affiche de meilleures performances que le modèle simple sur
toutes les métriques (R² plus élevé, RMSE et MAE plus faibles). L'ajout de variables comme
TotalBsmtSF et FullBath enrichit significativement la capacité prédictive du modèle.

5.2 Généralisation et risque d'overfitting


Quel modèle généralise le mieux ?
La validation croisée K-Fold montre que les scores sont stables entre les folds, ce qui indique une
bonne généralisation. Le modèle de régression multiple avec 4 variables reste simple et ne
présente pas de risque élevé d'overfitting.
Y a-t-il overfitting ?
Aucun signe évident d'overfitting n'est détecté. Les scores sur l'ensemble de test et les scores K-
Fold sont proches, indiquant que le modèle généralise correctement aux données non vues.

5.3 Choix des métriques


Quelle métrique est la plus adaptée ?
Pour la régression, le RMSE est la métrique la plus informative car il est dans la même unité que
SalePrice (dollars) et pénalise davantage les grandes erreurs. Le R² est utile pour comparer deux
modèles entre eux. Pour la classification Iris, l'Accuracy est pertinente car les classes sont
équilibrées.

5.4 Propositions d'amélioration


• Feature engineering : créer de nouvelles variables dérivées (ex. ratio surface/chambres).
• Traitement des outliers : identifier et supprimer ou transformer les valeurs aberrantes
dans SalePrice.
• Normalisation des données : appliquer StandardScaler pour améliorer la convergence.
• Modèles plus avancés : tester Ridge, Lasso ou Random Forest pour réduire la variance.
• Analyse de multicolinéarité : calculer le VIF pour chaque variable et éliminer les
redondances.

— Fin du rapport —

EST Nador — Intelligence Artificielle — 2025/2026

Vous aimerez peut-être aussi