Test Data Science
Enoncé :
Un train en provenance d’Espagne et en direction de l’Angleterre, en passant par la France, a eu un
terrible accident. Plusieurs de ses passagers y ont perdu la vie.
En tant que futur Data Scientist nous avons 2 missions pour vous :
Comprendre quels critères ont été déterminants (ou non) dans la survie ou la mort des
passagers.
Développer un modèle de prédiction, pour anticiper la survie ou non en cas d’accident des
passagers lors de futurs trajets.
Pour réaliser cela, nous mettons à votre disposition un jeu de données [Link] qui comporte les
colonnes suivantes :
L’identifiant du passager
Survived : 1 si le passager a survécu, sinon 0
Pclass : la classe du passager :
o 1 : Elite
o 2 : Business
o 3 : Economique
Name : le nom du passager
Sex : le sexe du passager
Age : l’âge du passager
Nb_siblings : le nombre de frères/sœurs et de femme/mari du passager
Nb_parents : le nombre de père/mère et d’enfants du passager
Ticket : le numéro de ticket
Fare : le prix du billet
Cabin : numéro de cabine dans laquelle se trouve le passager
Station : La station dans laquelle il est monté
o C = Carthagène
o Q = Quincy-le-Vicomte
o S = Séville
Livrable : Le test doit être réalisé sur un Jupyter Notebook que vous mettrez dans un fichier zip avec
le fichier data. L’idée est qu’on puisse exécuter votre code sans avoir à changer de chemin dans ce
dernier.
Quelques conseils :
Commentez un maximum ce que vous faites : via votre code, on souhaite comprendre vos
réflexions.
Justifiez le choix de ou des algorithmes de ML que vous allez utiliser.
N’hésitez pas à la fin de rajouter des pistes d’amélioration de ce que vous auriez souhaité
faire si vous aviez plus de temps.
Bon courage !