0% ont trouvé ce document utile (0 vote)
6 vues8 pages

Projet Machine Learning Supervisé Avec Python

Le projet de synthèse du Mastère Data & Intelligence Artificielle se concentre sur le Machine Learning supervisé avec Python, en utilisant un dataset de Kaggle. Les étudiants doivent explorer, préparer et modéliser les données à travers des régressions linéaires et polynomiales, tout en justifiant leurs choix méthodologiques. Une présentation orale est également requise pour communiquer les résultats et les conclusions de manière claire et structurée.
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
6 vues8 pages

Projet Machine Learning Supervisé Avec Python

Le projet de synthèse du Mastère Data & Intelligence Artificielle se concentre sur le Machine Learning supervisé avec Python, en utilisant un dataset de Kaggle. Les étudiants doivent explorer, préparer et modéliser les données à travers des régressions linéaires et polynomiales, tout en justifiant leurs choix méthodologiques. Une présentation orale est également requise pour communiquer les résultats et les conclusions de manière claire et structurée.
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Mastère Data & Intelligence Artificielle

Projet de synthèse – Jour 1


Machine Learning supervisé avec Python

Préparation des données et régression

Travail en binôme autorisé


Présentation orale obligatoire
Projet – Jour 1 Machine Learning supervisé avec Python

Table des matières

1 Contexte du projet 2

2 Objectifs pédagogiques 2

3 Consignes générales 2
3.1 Choix du dataset . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2
3.2 Travail en binôme . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
3.3 Livrables attendus . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3

4 Travail demandé 3
4.1 Partie 1 – Présentation du dataset . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
4.2 Partie 2 – Exploration initiale des données . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 3
4.3 Partie 3 – Gestion des valeurs manquantes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
4.4 Partie 4 – Traitement des variables catégorielles . . . . . . . . . . . . . . . . . . . . . . . . . . 4
4.5 Partie 5 – Préparation des données pour le Machine Learning . . . . . . . . . . . . . . . . . . 4
4.6 Partie 6 – Régression linéaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4
4.7 Partie 7 – Évaluation du modèle linéaire . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
4.8 Partie 8 – Visualisation et analyse des erreurs . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
4.9 Partie 9 – Régression polynomiale . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5
4.10 Partie 10 – Comparaison des deux modèles . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5

5 Structure conseillée du notebook 6

6 Présentation orale 6
6.1 Durée . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
6.2 Contenu attendu . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6
6.3 Critères d’une bonne présentation . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6

7 Barème indicatif 7

8 Conseils méthodologiques 7

9 Conclusion 7

1
Projet – Jour 1 Machine Learning supervisé avec Python

1. Contexte du projet
Dans le cadre du module Machine Learning supervisé avec Python, vous devez réaliser un mini-
projet de Data Science à partir d’un jeu de données trouvé sur Kaggle.
Ce projet a pour objectif de vous faire appliquer l’ensemble des notions vues lors du Jour 1, à savoir :
— l’exploration d’un dataset ;
— la préparation et le nettoyage des données ;
— la gestion des valeurs manquantes ;
— le traitement des variables catégorielles ;
— la séparation entre données d’apprentissage et de test ;
— l’entraînement d’un modèle de régression linéaire ;
— l’entraînement d’un modèle de régression polynomiale ;
— l’évaluation et l’interprétation des performances.
Vous pouvez travailler seul ou en binôme. Chaque binôme choisit un dataset différent, ou bien un angle
d’analyse différent s’il y a plusieurs groupes sur un même thème.

2. Objectifs pédagogiques
À travers ce projet, vous devez démontrer que vous êtes capables de :
1. sélectionner un jeu de données pertinent sur Kaggle ;
2. comprendre la structure d’un dataset ;
3. identifier la variable cible à prédire ;
4. analyser la qualité des données ;
5. traiter les valeurs manquantes de manière justifiée ;
6. encoder les variables catégorielles si nécessaire ;
7. préparer les variables explicatives X et la variable cible y ;
8. séparer les données en ensembles d’apprentissage et de test ;
9. entraîner une régression linéaire ;
10. entraîner une régression polynomiale ;
11. comparer les deux modèles avec des métriques adaptées ;
12. présenter clairement votre démarche, vos résultats et vos conclusions.

3. Consignes générales
3.1. Choix du dataset
Vous devez choisir un dataset Kaggle contenant :
— une variable cible quantitative à prédire ;
— plusieurs variables explicatives ;
— idéalement un mélange de variables numériques et catégorielles ;
— éventuellement des valeurs manquantes pour mettre en pratique le nettoyage des données.
Exemples de thématiques possibles :
— prix de maisons ou d’appartements ;
— ventes de produits ;
— consommation énergétique ;
— coûts médicaux ;
— salaires ;
— performance académique ;
— assurance ou finance.

2
Projet – Jour 1 Machine Learning supervisé avec Python

3.2. Travail en binôme


Le travail en binôme est autorisé.
Dans ce cas :
— les deux étudiants doivent participer à l’analyse ;
— les deux étudiants doivent comprendre le code ;
— les deux étudiants doivent intervenir pendant la présentation orale.

3.3. Livrables attendus


Chaque groupe doit fournir :
1. un notebook Jupyter propre et commenté ;
2. un support de présentation synthétique ;
3. une présentation orale.

4. Travail demandé
4.1. Partie 1 – Présentation du dataset
Dans cette première partie, vous devez présenter le jeu de données choisi.
Votre travail doit inclure :
— le titre du dataset ;
— le lien Kaggle ;
— le thème ou domaine d’application ;
— le nombre de lignes et de colonnes ;
— le nom de la variable cible ;
— une description rapide des variables les plus importantes.

4.2. Partie 2 – Exploration initiale des données


Vous devez effectuer une première exploration du dataset en utilisant Pandas.
Cette partie doit contenir :
— l’affichage des premières lignes ;
— l’affichage des dimensions ;
— l’affichage de la liste des colonnes ;
— l’analyse des types de variables ;
— les statistiques descriptives ;
— une première lecture métier des données.
Questions à traiter :
1. Quelle est la variable cible ?
2. Quelles sont les variables numériques ?
3. Quelles sont les variables catégorielles ?
4. Certaines colonnes semblent-elles inutiles ?
5. Les données paraissent-elles cohérentes ?

3
Projet – Jour 1 Machine Learning supervisé avec Python

4.3. Partie 3 – Gestion des valeurs manquantes


Vous devez identifier et traiter les valeurs manquantes.
Votre analyse doit comporter :
— le nombre de valeurs manquantes par variable ;
— leur proportion ;
— la stratégie de traitement choisie ;
— une justification de cette stratégie.
Vous pouvez par exemple :
— supprimer certaines lignes ;
— supprimer certaines colonnes ;
— remplacer par la moyenne ;
— remplacer par la médiane ;
— remplacer par le mode ;
— remplacer par une valeur fixe.
Important : toute décision doit être expliquée.

4.4. Partie 4 – Traitement des variables catégorielles


Si votre dataset contient des variables catégorielles, vous devez les transformer en variables numériques.
Vous devez :
— identifier les variables catégorielles ;
— afficher leurs modalités ;
— choisir une méthode de transformation ;
— justifier ce choix.
Vous pouvez utiliser par exemple :
— pd.get_dummies() ;
— une autre méthode appropriée si elle est justifiée.

4.5. Partie 5 – Préparation des données pour le Machine Learning


Vous devez ensuite préparer les données pour l’apprentissage.
Cette étape doit inclure :
— la définition de X (variables explicatives) ;
— la définition de y (variable cible) ;
— la séparation en données d’apprentissage et de test avec train_test_split() ;
— l’affichage des dimensions de chaque sous-ensemble.
Vous devez rappeler brièvement l’intérêt de séparer les données en train et test.

4.6. Partie 6 – Régression linéaire


Vous devez entraîner un modèle de régression linéaire sur votre dataset.
Votre travail doit contenir :
— l’import du modèle ;
— l’entraînement du modèle ;
— les prédictions sur le jeu de test ;
— l’affichage de l’interception ;
— l’affichage des coefficients ;
— une première interprétation.
Analyse attendue :
1. Le modèle semble-t-il pertinent ?
2. Quels variables semblent avoir le plus d’impact ?
3. Les signes des coefficients sont-ils cohérents ?

4
Projet – Jour 1 Machine Learning supervisé avec Python

4.7. Partie 7 – Évaluation du modèle linéaire


Vous devez évaluer votre modèle avec les métriques suivantes :
— MSE ;
— RMSE ;
— R2 .
Vous devez :
— calculer ces métriques ;
— expliquer ce qu’elles signifient ;
— interpréter vos résultats.

4.8. Partie 8 – Visualisation et analyse des erreurs


Vous devez produire au moins deux visualisations parmi les suivantes :
— valeurs réelles vs valeurs prédites ;
— graphique des résidus ;
— histogramme des erreurs ;
— autre visualisation pertinente.
Vous devez commenter les graphiques et répondre à la question suivante :
Le modèle semble-t-il bien prédire la variable cible ? Pourquoi ?

4.9. Partie 9 – Régression polynomiale


Vous devez ensuite entraîner un modèle de régression polynomiale.
Votre travail doit inclure :
— la transformation des variables avec PolynomialFeatures ;
— le choix d’un degré polynomial (au minimum degré 2) ;
— l’entraînement du modèle ;
— les prédictions ;
— le calcul des métriques MSE, RMSE et R2 .

4.10. Partie 10 – Comparaison des deux modèles


Vous devez comparer :
— la régression linéaire ;
— la régression polynomiale.
La comparaison doit porter sur :
— les performances ;
— la qualité de l’ajustement ;
— la simplicité d’interprétation ;
— les limites éventuelles.
Conclusion attendue :
Quel modèle recommandez-vous pour votre dataset, et pourquoi ?

5
Projet – Jour 1 Machine Learning supervisé avec Python

5. Structure conseillée du notebook


Votre notebook peut être organisé comme suit :
1. Introduction et présentation du dataset ;
2. Importation des bibliothèques ;
3. Chargement des données ;
4. Exploration initiale ;
5. Gestion des valeurs manquantes ;
6. Traitement des variables catégorielles ;
7. Préparation de X et y ;
8. Train/test split ;
9. Régression linéaire ;
10. Évaluation ;
11. Visualisations ;
12. Régression polynomiale ;
13. Comparaison des modèles ;
14. Conclusion générale.

6. Présentation orale
Chaque groupe devra réaliser une présentation orale.

6.1. Durée
— 5 à 8 minutes par groupe ;
— suivies de quelques questions.

6.2. Contenu attendu


La présentation doit contenir :
1. le contexte et le choix du dataset ;
2. la variable cible ;
3. les principales étapes de nettoyage ;
4. les choix de préparation des données ;
5. les résultats de la régression linéaire ;
6. les résultats de la régression polynomiale ;
7. la comparaison finale ;
8. la conclusion du groupe.

6.3. Critères d’une bonne présentation


Une bonne présentation doit être :
— claire ;
— structurée ;
— synthétique ;
— illustrée par quelques résultats ou graphiques ;
— techniquement correcte.

6
Projet – Jour 1 Machine Learning supervisé avec Python

7. Barème indicatif
Critère Points
Choix du dataset et compréhension du problème 2
Exploration initiale des données 2
Gestion des valeurs manquantes 2
Traitement des variables catégorielles 2
Préparation des données et train/test split 2
Implémentation de la régression linéaire 3
Évaluation et interprétation du modèle linéaire 2
Régression polynomiale 3
Comparaison des deux modèles 2
Qualité du notebook (clarté, commentaires, structure) 2
Présentation orale 3
Total 25

8. Conseils méthodologiques
— Choisissez un dataset ni trop simple ni trop complexe.
— Ne gardez pas des colonnes inutiles sans justification.
— Nettoyez les données avant toute modélisation.
— Expliquez toujours vos choix.
— Ne vous contentez pas d’afficher des résultats : interprétez-les.
— Soignez la lisibilité du notebook.
— Préparez une présentation concise et compréhensible.

9. Conclusion
Ce projet constitue une première mise en pratique complète des notions vues lors du Jour 1.
À travers ce travail, vous devez montrer que vous savez :
— manipuler un dataset réel ;
— préparer les données pour un problème de régression ;
— entraîner et évaluer plusieurs modèles ;
— comparer les résultats de manière rigoureuse ;
— communiquer votre démarche à l’oral.
L’objectif n’est pas seulement d’obtenir le meilleur score, mais de construire une démarche cohérente,
justifiée et compréhensible.

Consigne finale : Chaque groupe doit être capable d’expliquer son code, ses choix de préparation, ses
métriques et sa conclusion.

Vous aimerez peut-être aussi