0 évaluation 0% ont trouvé ce document utile (0 vote) 4 vues 31 pages AQWXCDFE
Le projet vise à prédire le churn des clients et à optimiser les stratégies marketing pour améliorer la fidélisation. Il propose une solution basée sur des modèles de machine learning, une application web interactive, et des recommandations personnalisées pour chaque client selon leur risque de churn. La méthodologie inclut la collecte et la préparation des données, l'entraînement de modèles prédictifs, et une évaluation rigoureuse de la performance des modèles.
Description améliorée par l'IA
Copyright
© All Rights Reserved
Formats disponibles
Téléchargez aux formats PDF ou lisez en ligne sur Scribd
Go to previous items Go to next items
+ Prendre des décisions stratégiques sur les clients & fidéliser en priorité.
+ Adapter les ofires et services proposés.
+ Dép
1.3 Problématique abordée :
Dans ce contexte, la problématique centrale a laquelle ce projet tente de
répondre est la suivante :
Comment prédire efficacement le churn des clients et ajuster les stratégies
marketing afin de maximiser leur fidélisation ?
Cette problématique souléve plusieurs sous-questions :
+ Quelles données collecter et analyser pour détecter les signes
avantcoureurs du churn %
+ Quels modéles de machine Learning sont les plus adaptés pour effectuer
des prédictions fiables sur des données clients ?
+ Comment rendre les résultats de ces prédictions compréhensibles et
exploitables par des équipes marketing et commerciales sans expertise
technique avancée ?
+ Quelles recommandations personnalisées proposer pour agir efficacement
selon le profil et le risque de churn de chaque client ?+ Comment faire pour réduire les couts marketing
Le projet vise ainsi a apporter une réponse structurée et opérationnelle a cette
problématique, en intégrant des solutions d’analyse prédictive et des
recommandations opérationnelles au sein d’une application web.
1.4 Solution envisagée
Pour répondre a cette problématique, la solution proposée repose sur plusicurs
composantes complémentaires articulées autour d’un pipeline complet de
machine Learning et de visualisation interactive :
1.4.1 Collecte et préparation des données
Le projet débute par la constitution d’une base de données clients simulés
partir de jeux de données publics. Ces données incluent des informations
personnelles, des historiques d’achats, des interactions digitales ainsi que des
données transactionnelles et comportementales. Un important travail de feature
engineering est réalisé afin d’enrichir les données brutes : calcul de la fréquence
achat, valeurs moyennes des commandes, indicateurs temporels (comme le
nombre de jours depuis la derni¢re commande) et encodage des variables
catégorielles. Les données sont ensuite nettoyées et normalisées pour garantir
leur compatibilité avec les algorithmes de machine Learning.
1.4.2 Construction et entrainement d’un modéle prédictif
Plusieurs modéles supervisés sont testés et comparés dans le cadre d’un
Stacking Classifier, combinant plusieurs classifieurs complémentaires :
+ XGBoost : reconnu pour sa performance et sa capacité a gérer des
données complexes et hétérogenes.
+ LightGBM : apprécié pour sa rapidité d’exécution et son efficacité sur de
gros volumes de données.
+ SVM (Support Vector Machine) : intégré avec une calibration de ses
scores pour fournir des probabilités de churn précises.
Les prédictions issues de ces trois modéles sont ensuite agrégées via un
métamodéle de régression logistique.
évaluation du modéle se fait selon plusieurs métriques (précision, rappel,
score F1) et en utilisant une validation croisée temporelle (TimeSeriesSplit) pour
respecter la dimension temporelle des comportements clients.1.4.3 Développement d’une application interactive avec
Streamlit
Pour rendre le systéme accessible aux équipes marketing et opérationnelles, une
application web interactive est développée avec Streamlit. Cette application
permet de :
Importer des fichiers de données clients au format CSV.
+ Visualiser les résultats sous forme de tableaux et de graphiques
dynamiques.
+ Afficher des analyses explicatives des prédictions grace 4 l’intégration de
SHAP qui identifie les variables les plus influentes sur la probabilité de
chum de chaque client.
+ Faire des simulations avant le lancement de nouveaux produits pour
optimiser le marketing en diminuant les couts marketings
1.4.4 Recommandations marketing personnalisées
En fonction du score de churn prédit pour chaque client, |’application propose
des recommandations marketing adaptées :
+ Pour les clients & faible risque : maintien des campagnes de fidélisation
courantes.
+ Pour les clients & risque modéré : envoi d’offres promotionnelles ciblées
ou de codes de réduetion.
+ Pour les clients & fort risque : prise de contact personnalisée, appels,
téléphoniques et propositions d’avantages exclusif.L’objectif est d’optimiser l’allocation des ressources marketing en priorisant les
actions sur les clients a forte probabilité de churn, tout en renforcant la relation
avec les
ients fidéles.
Le projet s’est structuré autour de plusieurs cycles itératifs comprenant :
L’analyse des besoins techniques et fonctionnels :
Le découpage en lots de taches : chaque phase de travail est divisée en
taches unitaires avec des objectifs clairs (ex.: traitement des valeurs
manquantes, entrainement d’un modéle Random Forest, intégration de
SHAP).
Des revues techniques intermédiaires : a la fin de chaque phase, les
livrables sont testés et validés afin de détecter d’éventuels
dysfonctionnements ou pistes d’amélioration (ajustement
dhyperparamétres, ajout de nouvelles visualisations. ..)
L’intégration testée avant de
passer 8 I’étape suivante,
La documentation continue : rédaction des observations techniques,
résultats de tests, et justifications des choix méthodologiques.Afin d’assurer le bon déroulement du projet et de respecter les délais impartis,
un planning prévisionnel structuré en six phases a été établi, chacune
correspondant a un livrable concret et mesurable.
[Link] Tableau de planification
Phases Objectifs Livrables associés
Durée
estimée
I “
Phase 1 : Etude 1 semaine Rapport de veille
documentaire technologique et
Réaliser une veille sur les bibliographique
problématiques de churn et
les techniques de machine
leaming
I
Phase 2 : Collecte et I semaine | Rassembler un jeu de Jeu de données
préparation des données données adapté et effeetuer | final prét & usage
le nettoyage, normalisation
et transformation.
I
Phase 3: Conception et | 2 semaines Implémenter__plusieurs | Modeles entrainés
entrainement des modéles modéles, comparer leurs et 6valuation des
performances et sélectionner | performances
Ie plus performant.
I semaine |Mettre en place les modules Modules
SHAP et alibidetect. opérationnels
Phase 4 : Intégration des intégres
modules
ExplicatifS et de détection
de dérive
I
1 semaine
Phase 5:
Développement de
application Streamlit
Créer une interface web
conviviale pour les
utilisateurs.
Application
Streamlit
fonctionnelle[
hase 6: Tests finaux et [I semaine _Effectuer les tests globaux de Rapport de projet e
ion du rapport a solution et rédiger la ‘support de
;cumentation finale, sentation
[Link] Diagramme de Gantt
Phases Semaine Semaine Semaine Semaine Semaine
1 2 3 4 5 Se
mai
ne
6
Phase 1 : Etude
documentairePhase 2 : Collecte et
préparation des données
Phase 3 : Conception et i i
entrainement des
modéles
Phase 4: Intégration
des modules
explicatifs et de
détection de d
ive
Phase 5 :
Développement de
Vapplication Streamlit
Phase 6 : Tests finaux et
rédaction du rapport i
Légende :
HER = période de réalisation de la phase.
[Link] Suivi du planning
Un point hebdomadaire permet de contrdler 'avancement des taches,
identifier les éventuels retards ou obstacles et de réajuster les priorités si
nécessaire. Cette planification prévisionnelle a permis de structurer
organisation du travail et d’anticiper les étapes critiques du projet.1.6 Conclusion
Ce premier chapitre a permis de poser les bases théoriques et organisationnelles
du projet. A partir d’une problématique clairement définie— la prédiction du
churn client et l’optimisation des actions marketing —, les objectifs généraux et
spécifiques ont été explicités.
Chapitre 2 : Analyseméthodes sont appréciées pour leur simplicité, rapidité d’exécution et leur
interprétabilité.
La régression logistique
+ Modéle de classification binaire qui estime la probabilité qu’un
événement se produise (ici le churn)
+ Elle permet de quantifier l’effet de chaque variable explicative sur la
variable cible (ex : impact de l’ancienneté client sur la probabilité de
départ).
+ Formule :
P(y=1X) =11+e-(80+DBiXi)P(y=I|X) = \frac {1} {1+e* (-(\beta_O +
\sum \beta_i X_i)}} P@-1X) -I+e-(B0 +Yi Xi)1 —Avantages
+ Facile a interpréter
+ Robuste sur des petits jeux de données
Limites :
+ Hypothese de linéarité entre les variables explicatives et le logit
* Moins efficace sur des relations complexes ou non linéaires
[Link].2 Analyse discriminante linéaire et quadratique
+ Classifie les observations en fonction des distributions statistiques des
groupes.
+ Hypotheses plus strictes que la régression logistique (ex : normalité et
égalité des matrices de variance-covariance).
[Link].3 Arbres de décision simples.
+ Méthode arborescente divisant I’échantillon en sous-groupes homogénes.
+ Facile a visualiser et 4 comprendre, mais sujette a l’overfitting.
[Link] Approches Modernes+ Random Forest : agrégation de plusieurs arbres de décision construits sur
des échantillons aléatoires.
Avantages :
+ Précision élevée
+ Résistance 4 overfitting (notamment pour Random Forest)
+ Gestion efficace des données déséquilibrées avec pondération
[Link].2 Support Vector Machines (SVM)
+ Algorithme qui sépare les classes 4 aide d’un hyperplan maximisant la
marge.
+ Efficace pour des données de faible dimension ou de dimension moyenne.
[Link].3 Réseaux de neurones et Deep Learning
Perceptron multicouche (MLP) pour des problémes de classification non
linéaire.
Capacité & gérer de grands volumes de données
Faible interprétabilité
Temps de calcul important[Link] Techniques d’Assemblage
Les techniques d’assemblage combinent plusieurs modéles pour obtenir une
prédiction plus fiable et plus précise qu’un modéle unique. Elles permettent de
réduire la variance et le biais.
[Link].1 Bagging (Bootstrap Agrégations)
+ Principe : création de plusieurs jeux de données d’apprentissage par tirage
aléatoire avec remise.
+ Construction d’un modéle sur chaque sous-échantillon.
+ Agrégation des résultats (vote majoritaire ou moyenne des probabilités).
Exemple : Random Forest
Avantage : réduit la variance et limite le sur-apprentissage.
[Link].2 Boosting
+ Principe : les modéles sont entrainés séquentiellement ; chaque nouveau
modéle cortige les erreurs du précédent.
+ Pondération des observations mal classées pour leur accorder plus
d’importance.
Exemples : AdaBoost, XGBoost, LightGBM, CatBoost
Avantage : amélioration progressive de la performance et capacité a gérer des
données déséquilibrées.
[Link].3 Stacking (Stacked Generalization)
+ Combine différents modéles de base (ex : SVM, Random Forest, Logistic
Regression).
+ Les prédictions des modéles de base servent d’entrée A un modéle méta
apprenant (souvent une régression logistique).
Avantage : profite des forces de différents modéles
D. Evaluation des ModélesL’évaluation de la performance des modéles de prédiction de chum est
essentielle, notamment dans des contextes oii la classe minoritaire (les churners)
est beaucoup moins représentée.
Indi Définition Avantages Inconvénients
cate ur
I _T
Acc | Taux de prédictions Simple a calculer et &
lurac y_orrectes (proportion des cas | Comprendre, Pou fiable en cas de
orrectement classés). classes déséquilibrées
(ex: beaucoup plus de
nonchumers que de
churners).
I T
Prée [Proportion de chumers —_JR&duit les faux positifs, Ignore les faux négatifs ;
sion korrectement identifiés parmijutile pour éviter des peut étre insuffisant si le
es clients prédits chumers. factions coditeuses sur de rappel est faible.
lraux churners.
i T
Rec all |Proportion de churners _|Réduit le risque de rater _Peut augmenter le nombre
(Sen correctement détectés|des chumers: de faux positifs si utilisé
sibili t&| —_ parmi_ les churners réels.((faux négatifs). seul.
I T
Fiscor |Moyenne harmonique de la |Bon équilibre entre Moins intuitif a interpréter
e [précision et du rappel lprécision et rappel dans seul, surtout pour des
\des jeux de données profils non techniques.
\déséquilibrés.
AUC Surface sous la courbe _[Synthétique et robuste face|Peut-étre abstrait sans la
L ROC, mesure la capacité du au déséquilibre des classes,bourbe associée ; parfois,
ROC |modéle bien distinguer futile pour —_comparerfifficile a interpréter pour
lchumers et nonchurners. plusieurs modéles. Jes décideurs.2.2.2 Etude Comparative des Solutions Existantes
i T T ~
Soluti_ Fonetionnal | Méthodes de Recomm | Colit/ | Avantage | Inconvéni
on ites prédiction andation 9€¢°8_ = g ents
Principales utilisées s sibilit €
marketin g
T
Oui ton Intégré au
Salesf CRMavecIA | Machine fev) CRM Coiteux,
ore _ intégrée, Leaming dépendant
Einste scoring de | automatisé Facilea | de
in churn (MLaas) déployer | Salesforce
I T T
Payan t Interface
Non natif vieillissant ¢
IBM __ Analyse Random Interpréta
SPSS Prédictive, | Forest, ble,
Model détection de | SVM, historique
er churn Régression solide
r T T
CRM + Machine Oui \Abord.
Tableau de bord Learning (campagn able a.
Zoho gnalytique _intégré es ciblées) Facile a /Moins
CRM configurer _|performant
Analyt .intégré [sur gros
ies CRM lvolumes
I
HubS potCRM + IRégles métiers Oui Facile 'Moins
Serviee scoringde [+ \d’accés pour |Puissant sur I
Hub clients IIA basique Freem [PME (data
ium /
Payanbredic Machine
tiveio Marketing | earning
(ancie ny Prédictif
et
coring de
hun
(Oui
lacet)|t
Dispar u Historique |N'existe plus
(a rempl intéressan
2.2.3 Partie 2 : Comparatif des approches algorithmiques
Critére XGBoost Deep Learning
Random Logistic
Forest Regression
T
85% 88-90% 75-80% 90%+
Précision moyenne
I I
Interprétabilit 6 Moyenne loyenne Excelente _Faible
T
Rapide Moyen Trés rapide Long
‘Temps
@entrainemen
t
I T,
Moyen Moyen a élevé Hlevé
Besoin en Faible a
données moyen
I
Toutes
Gestion des Catégorielles & | Catégorielles & | Variables
variables numériques | numériques lingairesRésistance au Bonne Trés bonne ‘Moyenne ‘Moyenne (si pas
surapprentiss age bien régulé)
] A
Cas idéal Datasets Datasets Cas simples et|Gros volumes,
moyens, non | complexes et interprétable s {détection patterns
linéaires volumineux
Notre valeur ajoutée :
+ Combinaison de plusieurs modéles (Stacking) pour une meilleure
généralisation.
+ Interface Streamlit permettant une interaction sans code pour les équipes
marketing.
+ Validation temporelle (TimeSeriesSplit) pour éviter les fuites de données
et simuler des conditions réelles.
2.3 Analyse des besoins :
2.3.1 Spécification des besoins :
Afin de réaliser notre projet ; il est impératif d’expliciter les différents besoins
fonctionnels et techniques, comme il suit :
[Link] Besoins fonctionnels
1,Gestion des utilisateurs
a. Authentification et gestion des droits d’accés (admin, analyste,
marketeur).
b. Création et gestion des profils utilisateurs.
2. Importation et gestion des données.a. Importation des fichiers clients et transactions au format
CSV/Excel.
b. Visualisation et consultation des données dans des tableaux.
c. Nettoyage et préparation des données intégrés (gestion des valeurs
manquantes, doublons).
Modélisation et prédiction
a. Entrainement de modéles de machine leaning.
b. Possibilité de tester plusieurs algorithmes et de comparer leurs
performances.
c. Prédiction du chum pour les clients actifs.
d. Affichage de la probabilité de churn par client.
Segmentation des clients
a. Catégorisation automatique des clients : 4 risque élevé, moyen,
faible.
b. Visualisation graphique des segments (diagramme, heatmap.
Recommandation marketing
a. Génération de recommandations marketing personnali
fonction du segment client
b. Possibilité de définir des scénarios marketing selon le niveau de
risque.
Suivi des campagnes
a. Enregistrement des campagnes lancées.
b. Suivi des actions marketing par client (offres envoyées, retours,
conversions).
Analyse et reporting
a. Génération de rapports statistiques (taux de churn, performance des
campagnes).
b. Affichages de Dashboard personnalisables avec des indicateurs
clés.
c. Exportation des rapports en PDF ou Excel.
Alertes et notifications
a. Notification automatique des marketeurs pour les clients a risque
élevé.
b. Systéme d’alertes paramétrables selon les seuils de churn définis.
10, [Link] Besoins non fonctionnels (détaillés)ll.
12
13.
14.
15,
16.
17.
18.
. Possibilité
Performance
.. Prédictions réalisées en moins de 3 secondes par client pour des
bases jusqu’é 100 000 clients.
. Rapports générés en moins de 5 secondes.
Sécurité
Authentification forte (login/mot de passe et éventuellement double
de données sans perte de performance.
jouter de nouvelles sources de données ou variables
explicatives.
A
. Design simple, intuitif et adapté aux usages professionnels.
.. Navigation fluide avec menus clairs et pages de consultation
rapides,
Facilité d’intégration
. Intégration possible avec le CRM existant et d’autres outils
marketing.
. API pour automatiser import/export de données.
Maintenabilité
a, Documentation technique et utilisateur,
b. Facilité d’évolution pour ajouter de nouveaux modules
(ex:
module de satisfaction elient futur).
Conformitéa. Respect des normes de protection des données personnelles (ex :
RGPD pour les données clients en Europe).
2.3.2 Cas d’utilisations :
Acteurs :
+ Utilisateur Administrateur : Personne qui a accés a toutes les
fonctionnalités du systéme, comme la gestion des utilisateurs et des
paramétres.
+ Marketeur : Utilisateur chargé de la gestion des campagnes marketing, qui
consulte les prédictions de churn et ajuste les actions marketing.
+ Systéme : Le systéme de prédiction et d’ajustement marketing.
2. Cas d’utilisation principaux :
Voici les principaux cas d'utilisation pour ton projet, détaillés avec leurs
objectifs, préconditions et scénarios.
[Link] Cas d'utilisation 1 : Prédire le churn des clients
Acteur principal : Marketeur
* Objectif : Prédire la probabilité de churn pour chaque client de
Ventreprise.
+ Préconditions :
o Le systéme doit étre connecté a la base de données clients et aux
historiques transactionnels.
© Le modéle de prédiction du churn est déja formé et prét 4 l'emploi.
Scénario principal: 0 Le marketeur se connecte a l’application.
o Il accéde a l'onglet Prédiction du churn.
© Le systéme analyse les données historiques des clients
(Transactions, interactions, comportement) et génére une
probabilité de churn pour chaque client.Le marketeur consulte la liste des clients et leurs probabilités de
churn.
o Le marketeur peut filtrer les clients en fonction du niveau de
risque (faible, moyen, élevé).
'Scénarios alternatifs :
© Sides données sont manquantes pour certains clients, un
message d'erreur s'affiche, indiquant que le churn ne peut
pas étre prédit pour ces clients.
0 Sile modéle de churn est obsoléte, le systéme invite
ladministrateur a réentrainer le modéle avec de nouvelles
données.
[Link] Cas d'utilisation 2 : Proposer des actions marketing personnalisées
Acteur principal : Marketeur
* Objectif : Générer des actions marketing adaptées aux clients a risque
de churn.
+ Préconditions :
o Le systéme a déja prédit le churn pour tous les clients.
0 Des scénarios marketing sont préalablement définis dans le
systéme.
| Scénario principal :
o Le marketeur consulte la liste des clients 4 risque de churn, obtenue
a partir de la prédiction du churn.
o Le marketeur sélectionne un client a risque élevé.
o Le systéme génére automatiquement une action marketing (offre
spéciale, réduction, campagne personnalisée) pour le client a risque
élevé.
o Le marketeur valide ou ajuste l'action marketing proposée. 0
L’action marketing est envoyée au client via les canaux appropriés
(email, SMS, notification push, ete.).
' Scénarios alternatifs :°
o L’administrateur accéde a l’interface d’administration.
o L’administrateur peut également supprimer ou modifier les
informations des utilisateurs existants.
| Scénarios alternatifs
o Si l’administrateur tente de créer un utilisateur avec un email deja
existant, un message d’erreur apparait.Chapitre 3 : Environnement@ python3.1.2 IDE
Figure 3 Logo de yscodeJupyter permettent une autocomplétion intelligente, un débogage avancé et une
exécution simplifiée de notebooks.
VSCode intégre nativement des outils qui en font bien plus qu'un simple éditeur de
texte. Parmi eux :
+ Un terminal intégré, évitant de jongler entre plusieurs fenétres.
+ Un débogueur puissant, avec points d'arrét et inspection des variables
on approche3.2 Outils de bibliothéque :
3.2.1 Pandas
jul pandas
Figure 4 Logo de Pandas
Pandas est la bibliothéque incontournable pour la manipulation et l'analyse de
données en Python, Avec ses structures phares que sont les Data Frames et les,
Séries, Pandas permet de nettoyer, transformer et explorer des jeux de données
de maniére intuitive et efficace. Que ce soit pour agréger des données, gérer les
valeurs manquantes ou fusionner des tables, Pandas offre une syntaxe claire et
des performances optimisées, en faisant l'outil de prédilection des data scientistes
et analystes.
+ Lanalyse financiére et risque crédit
+ Le traitement de logs et données utilisateurs
+ La préparation de datasets pour le ML
+ L'automatisation de rapports business3.2.2 Numpy
Son efficacité repose aussi sur sa compatibilité avec les bibliothéques écrites en
C, ce qui accélére les calcul. NumPy simplifie également la gestion des données
grace A des fonctions de manipulation et de transformation trés puissantes.
Aujourd’hui, elle est enseignée dans la plupart des formations en data science et
en informatique scientifique.En résumé, NumPy est un outil incontournable dés qu’il s’agit de calcul
numérique sous Python, Elle offre rapidité, simplicité et performance pour
manipuler et analyser des données numériques. Grace a elle, de nombreuses taches
complexes deviennent accessibles et plus lisibles.
C'est donc une alliée précieuse pour tout développeur ou analyste souhaitant
travailler efficacement avec des données.3.2.3 Scikit-learn
Figure 6 Logo de Scikit-learrn
Scikit-leamn est une biblioth¢que Python spécialisée dans le domaine du machine
Learning, Elle a été congue pour offrir des outils simples et efficaces afin de
créer et d’expérimenter des modéles d’apprentissage automatique. Trés prisée par
les data scientistes et les chercheurs, elle fait aujourd’hui partie des références
incontournables dans ce domaine.
Cette biblioth&que permet de réaliser plusieurs types d’analyses prédictives,
comme la classification, la régression et le regroupement de données. Elle
propose une large gamme d’algorithmes standard, faciles utiliser et bien
documentés. Grace & sa structure claire et accessible, Scikit-leamn s’adresse autant
aux débutants qu’aux utilisateurs expérimentés.
Scikit-leamn se base sur d’autres biblioth€ques comme NumPy, SciPy et
Matplotlib pour le traitement et la visualisation des données. Elle facilite ainsi
Venchainement des étapes d’un projet de machine Learning : depuis la préparation
des données jusqu’a I’évaluation du modéle. On peut facilement comparer
différents algorithmes pour trouver celui qui donne les meilleurs résultats.
Un autre avantage de Scikit-learn est sa grande communauté active qui contribue
réguligrement a son amélioration. Elle est largement utilisée dans les projets de
reconnaissance d’image, de traitement du langage naturel et d’analyse
Vous aimerez peut-être aussi