COURS Analyse de Données Avancées & Scoring
Projet Scoring
Pr. Zineb El Akkaoui
Dans ce projet, l’objectif est de construire des modèles de prévision de score, permettant de prévoir si un
client aurait des difficultés financières dans les deux années à venir. Les modèles à construire doivent
utiliser les informations comme le salaire moyen, l’âge, le taux d’intérêt, etc… Les données existent dans
les fichiers .csv joints avec ce document : ScoringTraining, ScoringTest et SampleScoring et la description
des variables prédictives introduites dans le fichier Data Dictionary. Ces données permettront d’apprendre
et de valider les modèles de prévision de score construits, ainsi que d’en évaluer la performance.
Le projet est à implémenter sur l’outil RStudio.
I- Phase de prétraitement
Sélection de variables / prédicteurs (Feature Engineering)
Cette phase consiste à sélectionner l’ensemble des variables susceptibles de décrire au mieux le score.
Cette phase est déjà faite pour vous.
Préparation de données
La préparation du jeu de données qui représente convenablement le problème étudié est une étape cruciale
avant la construction du modèle de scoring. L’efficacité du modèle est, en effet, fortement liée à
l’échantillon de données utilisé.
Dans cette étape, il s’agit de répondre aux questions suivantes :
1. Retrouver la proportion de défauts. C’est souvent un défi d’atteindre une proportion de 5% de
défauts. Utiliser les diagrammes en camembert ou les nuages de points.
2. Retrouver les données extrêmes (i.e. outliers). Utiliser les boites à moustaches ou l’histogramme.
3. Retrouver les valeurs manquantes. Utiliser des fonctions de visualisation telles que le missmap()
du package Amelia.
4. Décider de la manière de gérer ces cas.
Equilibrage des données d’apprentissage :
La classe « 0 » de la variable réponse « SeriousDlqin2yrs » représente 93.31% de la population, par
contre, la classe « 1 » représente seulement 6.685%.
1
COURS Analyse de Données Avancées & Scoring
5. Afin d’équilibrer les données, choisir des échantillons - de training et de test - dont la classe « 0 »
est de taille égale à la taille de la classe « 1 » (down-sampling).
Identification des meilleurs prédicteurs parmi les variables :
6. A partir des représentations (boites à moustache) des deux classes pour chaque variable, identifier
les meilleures variables dans le modèle de prédiction.
II- Modèle de prévision
7. Appliquer l’AFD. Interpréter.
Après avoir choisi une méthode de validation croisée sur les données training :
8. Appliquer le LDA et le QDA après vérification des conditions de chacune.
9. Appliquer la régression logistique seule et avec la fonctionnalité stepwise. Interpréter.
10. Pour extension, il est possible d’appliquer d’autres types de modèles.
III- Phase d’évaluation et règle de décision retenue
11. Comparer les deux principales propriétés entre les différents modèles construits :
- Goodness of fit : à quel niveau le modèle convient aux données existantes. Cet indicateur est
calculé à partir des données ScoringTraining.
- Pouvoir de prédiction : à quel niveau le modèle est capable de prévoir de nouvelles données, using
la courbe ROC et la matrice de confusion. Ces indicateurs sont calculés à partir des données
ScoringTest et SampleScoring.
12. Choisir le modèle le plus performant.
13. Définir la règle de décision à la base de ce modèle.
Bonne chance