0 évaluation 0% ont trouvé ce document utile (0 vote) 4 vues 21 pages AQSDFGGH
Le projet vise à prédire le churn des clients et à optimiser les stratégies marketing pour améliorer la fidélisation. Il repose sur la collecte et l'analyse de données clients, l'utilisation de modèles de machine learning, et le développement d'une application web interactive pour rendre les résultats accessibles aux équipes marketing. Des recommandations personnalisées sont fournies en fonction du risque de churn de chaque client, tout en adoptant une démarche de gestion de projet agile.
Description améliorée par l'IA
Copyright
© All Rights Reserved
Formats disponibles
Téléchargez aux formats PDF ou lisez en ligne sur Scribd
Go to previous items Go to next items
+ Prendre des décisions stratégiques sur les clients & fidéliser en priorité.
+ Adapter les ofires et services proposés.
+ Dép
1.3 Problématique abordée :
Dans ce contexte, la problématique centrale a laquelle ce projet tente de
répondre est la suivante :
Comment prédire efficacement le churn des clients et ajuster les stratégies
marketing afin de maximiser leur fidélisation ?
Cette problématique souléve plusieurs sous-questions :
+ Quelles données collecter et analyser pour détecter les signes
avantcoureurs du churn %
+ Quels modéles de machine Learning sont les plus adaptés pour effectuer
des prédictions fiables sur des données clients ?
+ Comment rendre les résultats de ces prédictions compréhensibles et
exploitables par des équipes marketing et commerciales sans expertise
technique avancée ?
+ Quelles recommandations personnalisées proposer pour agir efficacement
selon le profil et le risque de churn de chaque client ?+ Comment faire pour réduire les couts marketing
Le projet vise ainsi a apporter une réponse structurée et opérationnelle a cette
problématique, en intégrant des solutions d’analyse prédictive et des
recommandations opérationnelles au sein d’une application web.
1.4 Solution envisagée
Pour répondre a cette problématique, la solution proposée repose sur plusicurs
composantes complémentaires articulées autour d’un pipeline complet de
machine Learning et de visualisation interactive :
1.4.1 Collecte et préparation des données
Le projet débute par la constitution d’une base de données clients simulés
partir de jeux de données publics. Ces données incluent des informations
personnelles, des historiques d’achats, des interactions digitales ainsi que des
données transactionnelles et comportementales. Un important travail de feature
engineering est réalisé afin d’enrichir les données brutes : calcul de la fréquence
achat, valeurs moyennes des commandes, indicateurs temporels (comme le
nombre de jours depuis la derni¢re commande) et encodage des variables
catégorielles. Les données sont ensuite nettoyées et normalisées pour garantir
leur compatibilité avec les algorithmes de machine Learning.
1.4.2 Construction et entrainement d’un modéle prédictif
Plusieurs modéles supervisés sont testés et comparés dans le cadre d’un
Stacking Classifier, combinant plusieurs classifieurs complémentaires :
+ XGBoost : reconnu pour sa performance et sa capacité a gérer des
données complexes et hétérogenes.
+ LightGBM : apprécié pour sa rapidité d’exécution et son efficacité sur de
gros volumes de données.
+ SVM (Support Vector Machine) : intégré avec une calibration de ses
scores pour fournir des probabilités de churn précises.
Les prédictions issues de ces trois modéles sont ensuite agrégées via un
métamodéle de régression logistique.
évaluation du modéle se fait selon plusieurs métriques (précision, rappel,
score F1) et en utilisant une validation croisée temporelle (TimeSeriesSplit) pour
respecter la dimension temporelle des comportements clients.1.4.3 Développement d’une application interactive avec
Streamlit
Pour rendre le systéme accessible aux équipes marketing et opérationnelles, une
application web interactive est développée avec Streamlit. Cette application
permet de :
Importer des fichiers de données clients au format CSV.
+ Visualiser les résultats sous forme de tableaux et de graphiques
dynamiques.
+ Afficher des analyses explicatives des prédictions grace 4 l’intégration de
SHAP qui identifie les variables les plus influentes sur la probabilité de
chum de chaque client.
+ Faire des simulations avant le lancement de nouveaux produits pour
optimiser le marketing en diminuant les couts marketings
1.4.4 Recommandations marketing personnalisées
En fonction du score de churn prédit pour chaque client, |’application propose
des recommandations marketing adaptées :
+ Pour les clients & faible risque : maintien des campagnes de fidélisation
courantes.
+ Pour les clients & risque modéré : envoi d’offres promotionnelles ciblées
ou de codes de réduetion.
+ Pour les clients & fort risque : prise de contact personnalisée, appels,
téléphoniques et propositions d’avantages exclusif.L’objectif est d’optimiser l’allocation des ressources marketing en priorisant les
actions sur les clients a forte probabilité de churn, tout en renforcant la relation
avec les clients fideles.
1.5 Conduite du projet
1.5.1 Démarche de gestion de projet
Pour mener a bien ce projet de prédiction du chum client, une démarche de
gestion de projet rigoureuse a été adoptée, inspirée des méthodes agiles,
favorisant la flexibilité et ’amélioration continue. Cette approche permet
adapter le déroulement du projet aux éventuels imprévus techniques et
intégrer progressivement des ajustements fonctionnels
Le projet s’est structuré autour de plusieurs cycles itératifs comprenant :
+ L’analyse des besoins techniques et fonctionnels :
Identification précise des livrables attendus, choix des outils de
Développement (Python, Streamlit, scikit-learn, XGBoost, SHAP,
alibidetect) et définition des métriques de performance adaptées
(accuracy, recall, Fl-score, AUC).
+ Le découpage en lots de taches : chaque phase de travail est divisée en
taches unitaires avec des objectifs clairs (ex.: traitement des valeurs
manquantes, entrainement d’un modéle Random Forest, intégration de
SHAP).
+ Des revues techniques intermédiaires : a la fin de chaque phase, les
livrables sont testés et validés afin de détecter d’éventuels
dysfonctionnements ou pistes d’amélioration (ajustement
d’hyperparamétres, ajout de nouvelles visualisations...).
+ L’intégration continue et validation des modules : chaque fonctionnalité
(prétraitement, modeéle, interface Streamlit) est intégrée et testée avant de
passer a I’étape suivante.
+ La documentation continue : rédaction des observations techniques,
résultats de tests, et justifications des choix méthodologiques.Afin d’assurer le bon déroulement du projet et de respecter les délais impartis,
un planning prévisionnel structuré en six phases a été établi, chacune
correspondant a un livrable concret et mesurable.
[Link] Tableau de planification
Phases Objectifs Livrables associés
Durée
estimée
I “
Phase 1 : Etude 1 semaine Rapport de veille
documentaire technologique et
Réaliser une veille sur les bibliographique
problématiques de churn et
les techniques de machine
leaming
I
Phase 2 : Collecte et I semaine | Rassembler un jeu de Jeu de données
préparation des données données adapté et effeetuer | final prét & usage
le nettoyage, normalisation
et transformation.
I
Phase 3: Conception et | 2 semaines Implémenter__plusieurs | Modeles entrainés
entrainement des modéles modéles, comparer leurs et 6valuation des
performances et sélectionner | performances
Ie plus performant.
I semaine |Mettre en place les modules Modules
SHAP et alibidetect. opérationnels
Phase 4 : Intégration des intégres
modules
ExplicatifS et de détection
de dérive
I
1 semaine
Phase 5:
Développement de
application Streamlit
Créer une interface web
conviviale pour les
utilisateurs.
Application
Streamlit
fonctionnelle[
hase 6: Tests finaux et [I semaine _Effectuer les tests globaux de Rapport de projet e
ion du rapport a solution et rédiger la ‘support de
;cumentation finale, sentation
[Link] Diagramme de Gantt
Phases Semaine Semaine Semaine Semaine Semaine
1 2 3 4 5 Se
mai
ne
6
Phase 1 : Etude
documentairePhase 2 : Collecte et
préparation des données
Phase 3 : Conception et i i
entrainement des
modéles
Phase 4: Intégration
des modules
explicatifs et de
détection de d
ive
Phase 5 :
Développement de
Vapplication Streamlit
Phase 6 : Tests finaux et
rédaction du rapport i
Légende :
HER = période de réalisation de la phase.
[Link] Suivi du planning
Un point hebdomadaire permet de contrdler 'avancement des taches,
identifier les éventuels retards ou obstacles et de réajuster les priorités si
nécessaire. Cette planification prévisionnelle a permis de structurer
organisation du travail et d’anticiper les étapes critiques du projet.1.6 Conclusion
Ce premier chapitre a permis de poser les bases théoriques et organisationnelles
du projet. A partir d’une problématique clairement définie— la prédiction du
churn client et l’optimisation des actions marketing —, les objectifs généraux et
spécifiques ont été explicités.
Chapitre 2 : Analyseméthodes sont appréciées pour leur simplicité, rapidité d’exécution et leur
interprétabilité.
La régression logistique
+ Modéle de classification binaire qui estime la probabilité qu’un
événement se produise (ici le churn)
+ Elle permet de quantifier l’effet de chaque variable explicative sur la
variable cible (ex : impact de l’ancienneté client sur la probabilité de
départ).
+ Formule :
P(y=1X) =11+e-(80+DBiXi)P(y=I|X) = \frac {1} {1+e* (-(\beta_O +
\sum \beta_i X_i)}} P@-1X) -I+e-(B0 +Yi Xi)1 —Avantages
+ Facile a interpréter
+ Robuste sur des petits jeux de données
Limites :
+ Hypothese de linéarité entre les variables explicatives et le logit
* Moins efficace sur des relations complexes ou non linéaires
[Link].2 Analyse discriminante linéaire et quadratique
+ Classifie les observations en fonction des distributions statistiques des
groupes.
+ Hypotheses plus strictes que la régression logistique (ex : normalité et
égalité des matrices de variance-covariance).
[Link].3 Arbres de décision simples.
+ Méthode arborescente divisant I’échantillon en sous-groupes homogénes.
+ Facile a visualiser et 4 comprendre, mais sujette a l’overfitting.
[Link] Approches Modernes+ Random Forest : agrégation de plusieurs arbres de décision construits sur
des échantillons aléatoires.
Avantages :
+ Précision élevée
+ Résistance 4 Poverfitting (notamment pour Random Forest)
+ Gestion efficace des données déséquilibrées avec pondération
[Link].2 Support Vector Machines (SVM)
+ Algorithme qui sépare les classes 4 aide d’un hyperplan maximisant la
marge.
+ Efficace pour des données de faible dimension ou de dimension moyenne.
[Link].3 Réseaux de neurones et Deep Learning
Perceptron multicouche (MLP) pour des problémes de classification non
linéaire.
+ Réseaux récurrents (RNN, LSTM) pour des données séquentielles (ex :
historique de consommation). Avantages :
+ Capacité 4 gérer de grands volumes de données
+ Apprentissage de relations complexes
+ Intégration de données non structurées (textes, images)
Inconvénients :
+ Besoin de beaucoup de données
+ Faible interprétabilité
+ Temps de calcul important[Link] Techniques d’Assemblage
Les techniques d’assemblage combinent plusieurs modéles pour obtenir une
prédiction plus fiable et plus précise qu’un modéle unique. Elles permettent de
réduire la variance et le biais.
[Link].1 Bagging (Bootstrap Agrégations)
+ Principe : création de plusieurs jeux de données d’apprentissage par tirage
aléatoire avec remise.
+ Construction d’un modéle sur chaque sous-échantillon.
+ Agrégation des résultats (vote majoritaire ou moyenne des probabilités).
Exemple : Random Forest
Avantage : réduit la variance et limite le sur-apprentissage.
[Link].2 Boosting
+ Principe : les modéles sont entrainés séquentiellement ; chaque nouveau
modéle cortige les erreurs du précédent.
+ Pondération des observations mal classées pour leur accorder plus
d’importance.
Exemples : AdaBoost, XGBoost, LightGBM, CatBoost
Avantage : amélioration progressive de la performance et capacité a gérer des
données déséquilibrées.
[Link].3 Stacking (Stacked Generalization)
+ Combine différents modéles de base (ex : SVM, Random Forest, Logistic
Regression).
+ Les prédictions des modéles de base servent d’entrée A un modéle méta
apprenant (souvent une régression logistique).
Avantage : profite des forces de différents modéles
D. Evaluation des ModélesL’évaluation de la performance des modéles de prédiction de chum est
essentielle, notamment dans des contextes oii la classe minoritaire (les churners)
est beaucoup moins représentée.
Indi Définition Avantages Inconvénients
cate ur
I _T
Acc | Taux de prédictions Simple a calculer et &
lurac y_orrectes (proportion des cas | Comprendre, Pou fiable en cas de
orrectement classés). classes déséquilibrées
(ex: beaucoup plus de
nonchumers que de
churners).
I T
Prée [Proportion de chumers —_JR&duit les faux positifs, Ignore les faux négatifs ;
sion korrectement identifiés parmijutile pour éviter des peut étre insuffisant si le
es clients prédits chumers. factions coditeuses sur de rappel est faible.
lraux churners.
i T
Rec all |Proportion de churners _|Réduit le risque de rater _Peut augmenter le nombre
(Sen correctement détectés|des chumers: de faux positifs si utilisé
sibili t&| —_ parmi_ les churners réels.((faux négatifs). seul.
I T
Fiscor |Moyenne harmonique de la |Bon équilibre entre Moins intuitif a interpréter
e [précision et du rappel lprécision et rappel dans seul, surtout pour des
\des jeux de données profils non techniques.
\déséquilibrés.
AUC Surface sous la courbe _[Synthétique et robuste face|Peut-étre abstrait sans la
L ROC, mesure la capacité du au déséquilibre des classes,bourbe associée ; parfois,
ROC |modéle bien distinguer futile pour —_comparerfifficile a interpréter pour
lchumers et nonchurners. plusieurs modéles. Jes décideurs.2.2.2 Etude Comparative des Solutions Existantes
i T T ~
Soluti_ Fonetionnal | Méthodes de Recomm | Colit/ | Avantage | Inconvéni
on ites prédiction andation 9€¢°8_ = g ents
Principales utilisées s sibilit €
marketin g
T
Oui ton Intégré au
Salesf CRMavecIA | Machine fev) CRM Coiteux,
ore _ intégrée, Leaming dépendant
Einste scoring de | automatisé Facilea | de
in churn (MLaas) déployer | Salesforce
I T T
Payan t Interface
Non natif vieillissant ¢
IBM __ Analyse Random Interpréta
SPSS Prédictive, | Forest, ble,
Model détection de | SVM, historique
er churn Régression solide
r T T
CRM + Machine Oui \Abord.
Tableau de bord Learning (campagn able a.
Zoho gnalytique _intégré es ciblées) Facile a /Moins
CRM configurer _|performant
Analyt .intégré [sur gros
ies CRM lvolumes
I
HubS potCRM + IRégles métiers Oui Facile 'Moins
Serviee scoringde [+ \d’accés pour |Puissant sur I
Hub clients IIA basique Freem [PME (data
ium /
Payanbredic Machine
tiveio Marketing | earning
(ancie ny Prédictif
et
coring de
hun
(Oui
lacet)|t
Dispar u Historique |N'existe plus
(a rempl intéressan
2.2.3 Partie 2 : Comparatif des approches algorithmiques
Critére XGBoost Deep Learning
Random Logistic
Forest Regression
T
85% 88-90% 75-80% 90%+
Précision moyenne
I I
Interprétabilit 6 Moyenne loyenne Excelente _Faible
T
Rapide Moyen Trés rapide Long
‘Temps
@entrainemen
t
I T,
Moyen Moyen a élevé Hlevé
Besoin en Faible a
données moyen
I
Toutes
Gestion des Catégorielles & | Catégorielles & | Variables
variables numériques | numériques lingairesRésistance au Bonne Trés bonne ‘Moyenne ‘Moyenne (si pas
surapprentiss age bien régulé)
] A
Cas idéal Datasets Datasets Cas simples et|Gros volumes,
moyens, non | complexes et interprétable s {détection patterns
linéaires volumineux
Notre valeur ajoutée :
+ Combinaison de plusieurs modéles (Stacking) pour une meilleure
généralisation.
+ Interface Streamlit permettant une interaction sans code pour les équipes
marketing.
+ Validation temporelle (TimeSeriesSplit) pour éviter les fuites de données
et simuler des conditions réelles.
2.3 Analyse des besoins :
2.3.1 Spécification des besoins :
Afin de réaliser notre projet ; il est impératif d’expliciter les différents besoins
fonctionnels et techniques, comme il suit :
[Link] Besoins fonctionnels
1,Gestion des utilisateurs
a. Authentification et gestion des droits d’accés (admin, analyste,
marketeur).
b. Création et gestion des profils utilisateurs.
2. Importation et gestion des données.a. Importation des fichiers clients et transactions au format
CSV/Excel.
b. Visualisation et consultation des données dans des tableaux.
c. Nettoyage et préparation des données intégrés (gestion des valeurs
manquantes, doublons).
Modélisation et prédiction
a. Entrainement de modéles de machine leaning.
b. Possibilité de tester plusieurs algorithmes et de comparer leurs
performances.
c. Prédiction du chum pour les clients actifs.
d. Affichage de la probabilité de churn par client.
Segmentation des clients
a. Catégorisation automatique des clients : 4 risque élevé, moyen,
faible.
b. Visualisation graphique des segments (diagramme, heatmap.
Recommandation marketing
a. Génération de recommandations marketing personnali
fonction du segment client
b. Possibilité de définir des scénarios marketing selon le niveau de
risque.
Suivi des campagnes
a. Enregistrement des campagnes lancées.
b. Suivi des actions marketing par client (offres envoyées, retours,
conversions).
Analyse et reporting
a. Génération de rapports statistiques (taux de churn, performance des
campagnes).
b. Affichages de Dashboard personnalisables avec des indicateurs
clés.
c. Exportation des rapports en PDF ou Excel.
Alertes et notifications
a. Notification automatique des marketeurs pour les clients a risque
élevé.
b. Systéme d’alertes paramétrables selon les seuils de churn définis.
10, [Link] Besoins non fonctionnels (détaillés)ll.
12
13.
14.
15,
16.
17.
18.
. Possibilité
Performance
.. Prédictions réalisées en moins de 3 secondes par client pour des
bases jusqu’é 100 000 clients.
. Rapports générés en moins de 5 secondes.
Sécurité
Authentification forte (login/mot de passe et éventuellement double
facteur).
. Chiftrement des données sensibles (nom, email, transactions).
. Gestion des logs d’activité des utilisateurs.
Scalabilité
. Capacité a gérer l’évolution du nombre d’utilisateurs et du volume
de données sans perte de performance.
jouter de nouvelles sources de données ou variables
explicatives.
Disponibilité
. Application disponible 24h/24 et 7j/7.
Taux de disponibilité supérieur 4 99%.
Accessibilité et ergonomie
._ Interface responsive (web et mobile).
. Design simple, intuitif et adapté aux usages professionnels.
c. Navigation fluide avec menus clairs et pages de consultation
rapides.
Facilité d’intégration
. Intégration possible avec le CRM existant et d’autres outils
marketing.
. API pour automatiser import/export de données.
Maintenabilité
a, Documentation technique et utilisateur,
b. Facilité d’évolution pour ajouter de nouveaux modules
(ex:
module de satisfaction elient futur).
Conformitéa. Respect des normes de protection des données personnelles (ex :
RGPD pour les données clients en Europe).
2.3.2 Cas d’utilisations :
Acteurs :
+ Utilisateur Administrateur : Personne qui a accés a toutes les
fonctionnalités du systéme, comme la gestion des utilisateurs et des
paramétres.
+ Marketeur : Utilisateur chargé de la gestion des campagnes marketing, qui
consulte les prédictions de churn et ajuste les actions marketing.
+ Systéme : Le systéme de prédiction et d’ajustement marketing.
2. Cas d’utilisation principaux :
Voici les principaux cas d'utilisation pour ton projet, détaillés avec leurs
objectifs, préconditions et scénarios.
[Link] Cas d'utilisation 1 : Prédire le churn des clients
Acteur principal : Marketeur
* Objectif : Prédire la probabilité de churn pour chaque client de
Ventreprise.
+ Préconditions :
o Le systéme doit étre connecté a la base de données clients et aux
historiques transactionnels.
© Le modéle de prédiction du churn est déja formé et prét 4 l'emploi.
Scénario principal: 0 Le marketeur se connecte a l’application.
o Il accéde a l'onglet Prédiction du churn.
© Le systéme analyse les données historiques des clients
(Transactions, interactions, comportement) et génére une
probabilité de churn pour chaque client.Le marketeur consulte la liste des clients et leurs probabilités de
churn.
o Le marketeur peut filtrer les clients en fonction du niveau de
risque (faible, moyen, élevé).
'Scénarios alternatifs :
© Sides données sont manquantes pour certains clients, un
message d'erreur s'affiche, indiquant que le churn ne peut
pas étre prédit pour ces clients.
0 Sile modéle de churn est obsoléte, le systéme invite
ladministrateur a réentrainer le modéle avec de nouvelles
données.
[Link] Cas d'utilisation 2 : Proposer des actions marketing personnalisées
Acteur principal : Marketeur
* Objectif : Générer des actions marketing adaptées aux clients a risque
de churn.
+ Préconditions :
o Le systéme a déja prédit le churn pour tous les clients.
0 Des scénarios marketing sont préalablement définis dans le
systéme.
| Scénario principal :
o Le marketeur consulte la liste des clients 4 risque de churn, obtenue
a partir de la prédiction du churn.
o Le marketeur sélectionne un client a risque élevé.
o Le systéme génére automatiquement une action marketing (offre
spéciale, réduction, campagne personnalisée) pour le client a risque
élevé.
o Le marketeur valide ou ajuste l'action marketing proposée. 0
L’action marketing est envoyée au client via les canaux appropriés
(email, SMS, notification push, ete.).
' Scénarios alternatifs :
Vous aimerez peut-être aussi