Mini-projet : Techniques de prévision
Prédiction des retards de trains ou d’avions
Organisation du travail :
o Travail en groupe : 4 étudiants par groupe
o Deadline : validation en présentiel le jeudi 11 décembre 2025
Objectif du projet
Développer une application complète de prédiction des retards (trains ou avions) en
s’appuyant sur des techniques d’apprentissage supervisé.
Les étudiants devront parcourir toutes les étapes d’un projet de data science : collecte,
préparation, modélisation, évaluation, déploiement et interface utilisateur.
Tâches à réaliser
1. Recherche et sélection du jeu de données
o Trouver un dataset réel et suffisamment grand (par ex. données publiques de
vols ou de trains).
o Le dataset doit contenir des caractéristiques temporelles, géographiques et
opérationnelles (heure de départ, heure d’arrivée, météo, compagnie, etc.).
2. Prétraitement des données (Data Preprocessing)
o Nettoyage : gestion des valeurs manquantes, doublons, erreurs.
o Encodage des variables catégorielles (One-Hot, Label Encoding…).
o Normalisation ou standardisation des variables numériques.
o Séparation du jeu de données en train / test / validation.
3. Modélisation et apprentissage
o Tester plusieurs modèles de Machine Learning supervisés, vus dans le cours
o Comparer les modèles selon des métriques pertinentes :
Pour un problème de classification (retard ou pas) : choissez entre
accuracy, F1-score, recall, precision.
Pour un problème de régression (prédire le nombre de minutes de
retard) : RMSE, MAE, R².
4. Sélection et sauvegarde du meilleur modèle
o Sélectionner le modèle le plus performant selon la métrique choisie.
o Sauvegarder le modèle avec
5. Développement d’une interface utilisateur
o Créer une interface simple, belle et conviviale
o L’utilisateur doit pouvoir :
Saisir les caractéristiques d’un vol/train (heure, compagnie, météo…)
Lancer la prédiction.
Voir le résultat clair et concis : “Ce vol a plus de chances d’être en
retard” ou “Retard estimé : 12 minutes”.
6. Présentation finale
o Rapport court ou notebook récapitulant :
Le choix du dataset
Les étapes de nettoyage
Les modèles testés et leurs performances
Le modèle final et son interprétation
o Démonstration de l’interface fonctionnelle.
Compétences visées et Evaluation
Recherche et préparation de données réelles
Application des techniques de Machine Learning supervisé
Évaluation et comparaison de modèles
Sauvegarde et réutilisation de modèles ML
Développement d’une interface utilisateur orientée data science
Livrables
Chaque groupe devra déposer un dossier de deux fichiers :
Ce dossier doit contenir les éléments suivants :
1. Rapport synthétique (PDF)
o Description du dataset choisi (source, taille, variables, nettoyage effectué).
o Présentation des modèles testés et des métriques obtenues.
o Analyse et justification du choix du modèle final.
o Captures d’écran de l’interface développée.
o Conclusion et perspectives d’amélioration.
2. Code source complet
o Code source (Notebook ou scripts Python)
o Modèle sauvegardé