Mastère Data & Intelligence Artificielle
Projet de synthèse – Jour 1
Machine Learning supervisé avec Python
Préparation des données et régression
Travail en binôme autorisé
Présentation orale obligatoire
Projet – Jour 1 Machine Learning supervisé avec Python
Table des matières
1 Contexte du projet 2
2 Objectifs pédagogiques 2
3 Consignes générales 2
3.1 Choix du dataset . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2
3.2 Travail en binôme . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
3.3 Livrables attendus . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
4 Travail demandé 3
4.1 Partie 1 – Présentation du dataset . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
4.2 Partie 2 – Exploration initiale des données . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
4.3 Partie 3 – Gestion des valeurs manquantes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
4.4 Partie 4 – Traitement des variables catégorielles . . . . . . . . . . . . . . . . . . . . . . . . . . 4
4.5 Partie 5 – Préparation des données pour le Machine Learning . . . . . . . . . . . . . . . . . . 4
4.6 Partie 6 – Régression linéaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
4.7 Partie 7 – Évaluation du modèle linéaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
4.8 Partie 8 – Visualisation et analyse des erreurs . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
4.9 Partie 9 – Régression polynomiale . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
4.10 Partie 10 – Comparaison des deux modèles . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
5 Structure conseillée du notebook 6
6 Présentation orale 6
6.1 Durée . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
6.2 Contenu attendu . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
6.3 Critères d’une bonne présentation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
7 Barème indicatif 7
8 Conseils méthodologiques 7
9 Conclusion 7
1
Projet – Jour 1 Machine Learning supervisé avec Python
1. Contexte du projet
Dans le cadre du module Machine Learning supervisé avec Python, vous devez réaliser un mini-
projet de Data Science à partir d’un jeu de données trouvé sur Kaggle.
Ce projet a pour objectif de vous faire appliquer l’ensemble des notions vues lors du Jour 1, à savoir :
— l’exploration d’un dataset ;
— la préparation et le nettoyage des données ;
— la gestion des valeurs manquantes ;
— le traitement des variables catégorielles ;
— la séparation entre données d’apprentissage et de test ;
— l’entraînement d’un modèle de régression linéaire ;
— l’entraînement d’un modèle de régression polynomiale ;
— l’évaluation et l’interprétation des performances.
Vous pouvez travailler seul ou en binôme. Chaque binôme choisit un dataset différent, ou bien un angle
d’analyse différent s’il y a plusieurs groupes sur un même thème.
2. Objectifs pédagogiques
À travers ce projet, vous devez démontrer que vous êtes capables de :
1. sélectionner un jeu de données pertinent sur Kaggle ;
2. comprendre la structure d’un dataset ;
3. identifier la variable cible à prédire ;
4. analyser la qualité des données ;
5. traiter les valeurs manquantes de manière justifiée ;
6. encoder les variables catégorielles si nécessaire ;
7. préparer les variables explicatives X et la variable cible y ;
8. séparer les données en ensembles d’apprentissage et de test ;
9. entraîner une régression linéaire ;
10. entraîner une régression polynomiale ;
11. comparer les deux modèles avec des métriques adaptées ;
12. présenter clairement votre démarche, vos résultats et vos conclusions.
3. Consignes générales
3.1. Choix du dataset
Vous devez choisir un dataset Kaggle contenant :
— une variable cible quantitative à prédire ;
— plusieurs variables explicatives ;
— idéalement un mélange de variables numériques et catégorielles ;
— éventuellement des valeurs manquantes pour mettre en pratique le nettoyage des données.
Exemples de thématiques possibles :
— prix de maisons ou d’appartements ;
— ventes de produits ;
— consommation énergétique ;
— coûts médicaux ;
— salaires ;
— performance académique ;
— assurance ou finance.
2
Projet – Jour 1 Machine Learning supervisé avec Python
3.2. Travail en binôme
Le travail en binôme est autorisé.
Dans ce cas :
— les deux étudiants doivent participer à l’analyse ;
— les deux étudiants doivent comprendre le code ;
— les deux étudiants doivent intervenir pendant la présentation orale.
3.3. Livrables attendus
Chaque groupe doit fournir :
1. un notebook Jupyter propre et commenté ;
2. un support de présentation synthétique ;
3. une présentation orale.
4. Travail demandé
4.1. Partie 1 – Présentation du dataset
Dans cette première partie, vous devez présenter le jeu de données choisi.
Votre travail doit inclure :
— le titre du dataset ;
— le lien Kaggle ;
— le thème ou domaine d’application ;
— le nombre de lignes et de colonnes ;
— le nom de la variable cible ;
— une description rapide des variables les plus importantes.
4.2. Partie 2 – Exploration initiale des données
Vous devez effectuer une première exploration du dataset en utilisant Pandas.
Cette partie doit contenir :
— l’affichage des premières lignes ;
— l’affichage des dimensions ;
— l’affichage de la liste des colonnes ;
— l’analyse des types de variables ;
— les statistiques descriptives ;
— une première lecture métier des données.
Questions à traiter :
1. Quelle est la variable cible ?
2. Quelles sont les variables numériques ?
3. Quelles sont les variables catégorielles ?
4. Certaines colonnes semblent-elles inutiles ?
5. Les données paraissent-elles cohérentes ?
3
Projet – Jour 1 Machine Learning supervisé avec Python
4.3. Partie 3 – Gestion des valeurs manquantes
Vous devez identifier et traiter les valeurs manquantes.
Votre analyse doit comporter :
— le nombre de valeurs manquantes par variable ;
— leur proportion ;
— la stratégie de traitement choisie ;
— une justification de cette stratégie.
Vous pouvez par exemple :
— supprimer certaines lignes ;
— supprimer certaines colonnes ;
— remplacer par la moyenne ;
— remplacer par la médiane ;
— remplacer par le mode ;
— remplacer par une valeur fixe.
Important : toute décision doit être expliquée.
4.4. Partie 4 – Traitement des variables catégorielles
Si votre dataset contient des variables catégorielles, vous devez les transformer en variables numériques.
Vous devez :
— identifier les variables catégorielles ;
— afficher leurs modalités ;
— choisir une méthode de transformation ;
— justifier ce choix.
Vous pouvez utiliser par exemple :
— pd.get_dummies() ;
— une autre méthode appropriée si elle est justifiée.
4.5. Partie 5 – Préparation des données pour le Machine Learning
Vous devez ensuite préparer les données pour l’apprentissage.
Cette étape doit inclure :
— la définition de X (variables explicatives) ;
— la définition de y (variable cible) ;
— la séparation en données d’apprentissage et de test avec train_test_split() ;
— l’affichage des dimensions de chaque sous-ensemble.
Vous devez rappeler brièvement l’intérêt de séparer les données en train et test.
4.6. Partie 6 – Régression linéaire
Vous devez entraîner un modèle de régression linéaire sur votre dataset.
Votre travail doit contenir :
— l’import du modèle ;
— l’entraînement du modèle ;
— les prédictions sur le jeu de test ;
— l’affichage de l’interception ;
— l’affichage des coefficients ;
— une première interprétation.
Analyse attendue :
1. Le modèle semble-t-il pertinent ?
2. Quels variables semblent avoir le plus d’impact ?
3. Les signes des coefficients sont-ils cohérents ?
4
Projet – Jour 1 Machine Learning supervisé avec Python
4.7. Partie 7 – Évaluation du modèle linéaire
Vous devez évaluer votre modèle avec les métriques suivantes :
— MSE ;
— RMSE ;
— R2 .
Vous devez :
— calculer ces métriques ;
— expliquer ce qu’elles signifient ;
— interpréter vos résultats.
4.8. Partie 8 – Visualisation et analyse des erreurs
Vous devez produire au moins deux visualisations parmi les suivantes :
— valeurs réelles vs valeurs prédites ;
— graphique des résidus ;
— histogramme des erreurs ;
— autre visualisation pertinente.
Vous devez commenter les graphiques et répondre à la question suivante :
Le modèle semble-t-il bien prédire la variable cible ? Pourquoi ?
4.9. Partie 9 – Régression polynomiale
Vous devez ensuite entraîner un modèle de régression polynomiale.
Votre travail doit inclure :
— la transformation des variables avec PolynomialFeatures ;
— le choix d’un degré polynomial (au minimum degré 2) ;
— l’entraînement du modèle ;
— les prédictions ;
— le calcul des métriques MSE, RMSE et R2 .
4.10. Partie 10 – Comparaison des deux modèles
Vous devez comparer :
— la régression linéaire ;
— la régression polynomiale.
La comparaison doit porter sur :
— les performances ;
— la qualité de l’ajustement ;
— la simplicité d’interprétation ;
— les limites éventuelles.
Conclusion attendue :
Quel modèle recommandez-vous pour votre dataset, et pourquoi ?
5
Projet – Jour 1 Machine Learning supervisé avec Python
5. Structure conseillée du notebook
Votre notebook peut être organisé comme suit :
1. Introduction et présentation du dataset ;
2. Importation des bibliothèques ;
3. Chargement des données ;
4. Exploration initiale ;
5. Gestion des valeurs manquantes ;
6. Traitement des variables catégorielles ;
7. Préparation de X et y ;
8. Train/test split ;
9. Régression linéaire ;
10. Évaluation ;
11. Visualisations ;
12. Régression polynomiale ;
13. Comparaison des modèles ;
14. Conclusion générale.
6. Présentation orale
Chaque groupe devra réaliser une présentation orale.
6.1. Durée
— 5 à 8 minutes par groupe ;
— suivies de quelques questions.
6.2. Contenu attendu
La présentation doit contenir :
1. le contexte et le choix du dataset ;
2. la variable cible ;
3. les principales étapes de nettoyage ;
4. les choix de préparation des données ;
5. les résultats de la régression linéaire ;
6. les résultats de la régression polynomiale ;
7. la comparaison finale ;
8. la conclusion du groupe.
6.3. Critères d’une bonne présentation
Une bonne présentation doit être :
— claire ;
— structurée ;
— synthétique ;
— illustrée par quelques résultats ou graphiques ;
— techniquement correcte.
6
Projet – Jour 1 Machine Learning supervisé avec Python
7. Barème indicatif
Critère Points
Choix du dataset et compréhension du problème 2
Exploration initiale des données 2
Gestion des valeurs manquantes 2
Traitement des variables catégorielles 2
Préparation des données et train/test split 2
Implémentation de la régression linéaire 3
Évaluation et interprétation du modèle linéaire 2
Régression polynomiale 3
Comparaison des deux modèles 2
Qualité du notebook (clarté, commentaires, structure) 2
Présentation orale 3
Total 25
8. Conseils méthodologiques
— Choisissez un dataset ni trop simple ni trop complexe.
— Ne gardez pas des colonnes inutiles sans justification.
— Nettoyez les données avant toute modélisation.
— Expliquez toujours vos choix.
— Ne vous contentez pas d’afficher des résultats : interprétez-les.
— Soignez la lisibilité du notebook.
— Préparez une présentation concise et compréhensible.
9. Conclusion
Ce projet constitue une première mise en pratique complète des notions vues lors du Jour 1.
À travers ce travail, vous devez montrer que vous savez :
— manipuler un dataset réel ;
— préparer les données pour un problème de régression ;
— entraîner et évaluer plusieurs modèles ;
— comparer les résultats de manière rigoureuse ;
— communiquer votre démarche à l’oral.
L’objectif n’est pas seulement d’obtenir le meilleur score, mais de construire une démarche cohérente,
justifiée et compréhensible.
Consigne finale : Chaque groupe doit être capable d’expliquer son code, ses choix de préparation, ses
métriques et sa conclusion.