0% ont trouvé ce document utile (0 vote)
1 vues10 pages

Projet

Ce document présente un projet de conception d'une application de détection de fraude utilisant un modèle de régression logistique, visant à identifier les transactions bancaires et achats en ligne suspects. Les objectifs incluent la prétraitement des données, l'entraînement du modèle et l'évaluation de ses performances, tout en abordant les défis liés au déséquilibre des données et à l'évolution des comportements frauduleux. Le projet propose une architecture modulaire pour intégrer facilement des modèles plus avancés à l'avenir.

Transféré par

ronaldfreddy580
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
1 vues10 pages

Projet

Ce document présente un projet de conception d'une application de détection de fraude utilisant un modèle de régression logistique, visant à identifier les transactions bancaires et achats en ligne suspects. Les objectifs incluent la prétraitement des données, l'entraînement du modèle et l'évaluation de ses performances, tout en abordant les défis liés au déséquilibre des données et à l'évolution des comportements frauduleux. Le projet propose une architecture modulaire pour intégrer facilement des modèles plus avancés à l'avenir.

Transféré par

ronaldfreddy580
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

REPUBLIQUE DU REPUBLIC OF CAMEROON

CAMEROUN PEACE- WORK-


PAIX-TRAVAIL-PATRIE FATHERLAND
******* *******
MINISTERE DES
ENSEIGNEMENTS MINISTRY OF HIGHER
SUPERIEUR EDUCATION
******* *******
IAI - CAMEROUN AICS - CAMEROON

INSTITUT AFRICAINE D’INFORMATIQUE


« Centre d’Excellence Technologique Paul Biya »
BP: 13719 Yaoundé, Cameroun
Tel: 242 77 99 58/ 242 77 99 57
Site web:[Link]
Email : contact@[Link]

REVUE DE PROJET
THEME : CONCEPTION ET
REALISATION D’UNE APPLICATION
DE DETECTION DE FRAUDE PAR IA
BASIQUE REALISER
PAR : ASSALA
EMMANUEL
PLACIDE classe : L1C

YIMTSA ZEBAZE DIMITRY


MBOU DE MEKONTCHOU RONALD
SOUS LA SUPERVISION DE :

Mme HAGBE
ANNEE ACADEMIQUE: 2025-2026

1
Table des matières
Table des matières...................................................................................................................2
1. Introduction..........................................................................................................................3
2. Contexte et problématique...................................................................................................3
3. Objectifs du projet................................................................................................................3
3.1 Objectif général..................................................................................................................3
3.2 Objectifs spécifiques..........................................................................................................3
4. État de l'art...........................................................................................................................3
5. Méthodologie........................................................................................................................4
5.1 Données utilisées...............................................................................................................4
5.2 Prétraitement des données................................................................................................4
5.3 Choix du modèle : la régression logistique........................................................................4
5.4 Métriques d'évaluation.......................................................................................................4
6. Architecture proposée du système.......................................................................................5
7. Résultats attendus...............................................................................................................5
8. Limites et difficultés anticipées.............................................................................................6
9. Perspectives d'amélioration.................................................................................................6
10. Conclusion.........................................................................................................................6
Références bibliographiques....................................................................................................6

2
1. Introduction

La fraude liée aux transactions bancaires et aux achats en ligne représente un enjeu majeur
pour les institutions financières et les commerçants, avec des pertes financières importantes et
une perte de confiance des utilisateurs. L'intelligence artificielle, et en particulier les méthodes
d'apprentissage automatique, offre des outils efficaces pour détecter automatiquement les
comportements suspects au sein de grands volumes de données [Link] rapport
présente un projet de conception d'une application simple de détection de fraude reposant sur
un modèle de régression logistique. L'objectif est de proposer une solution accessible,
interprétable et facilement explicable, adaptée à un contexte académique de niveau licence,
tout en respectant les bonnes pratiques de la science des données.
Exposé – Arbres Binaire & ABR

2. Contexte et problématique

Les transactions bancaires et les achats en ligne génèrent quotidiennement un volume


considérable de données. Parmi celles-ci, seule une faible proportion correspond à des cas de
fraude, ce qui rend leur détection difficile : les jeux de données sont fortement déséquilibrés et
les comportements frauduleux évoluent constamment pour contourner les systèmes de
sécurité.

La problématique centrale de ce projet peut être formulée ainsi : comment concevoir un


système simple, basé sur l'intelligence artificielle, capable d'identifier avec une fiabilité
suffisante les transactions potentiellement frauduleuses, tout en limitant le nombre de fausses
alertes ?

3. Objectifs du projet

3.1 Objectif général

Concevoir et présenter une application de détection de fraude basée sur un modèle


d'intelligence artificielle simple (régression logistique), appliquée aux transactions bancaires
et aux achats en ligne.

3.2 Objectifs spécifiques

• Identifier les caractéristiques pertinentes pour décrire une transaction et ses risques associés.

• Prétraiter les données afin de gérer le déséquilibre entre transactions légitimes et frauduleuses.

• Entraîner un modèle de régression logistique capable de classer une transaction comme


légitime ou suspecte.

• Évaluer la performance du modèle à l'aide de métriques adaptées au contexte de la fraude.

• Proposer une architecture simple pour intégrer ce modèle dans une application fonctionnelle.

4. État de l'art

La détection de fraude par apprentissage automatique est un domaine largement étudié. Les
approches les plus courantes incluent les modèles supervisés (régression logistique, arbres de

Structures de données fondamentales


Exposé – Arbres Binaire & ABR

décision, forêts aléatoires, réseaux de neurones) entraînés sur des historiques de transactions
étiquetées, ainsi que les approches non supervisées (détection d'anomalies) utilisées lorsque
peu de données étiquetées sont disponibles.

Parmi les jeux de données académiques fréquemment utilisés pour ce type de projet figure le
jeu de données « Credit Card Fraud Detection », mis à disposition par le groupe de recherche
en apprentissage automatique de l'Université Libre de Bruxelles (ULB), qui contient des
transactions par carte bancaire anonymisées et étiquetées. Ce type de ressource peut servir de
base pour entraîner et tester un modèle simple comme celui proposé ici.

La régression logistique reste un choix pertinent pour un premier prototype : il s'agit d'un
modèle simple, rapide à entraîner, facilement interprétable (les coefficients indiquent
l'influence de chaque variable) et largement documenté, ce qui en fait une base solide avant
d'envisager des modèles plus complexes.

5. Méthodologie

5.1 Données utilisées

Le projet s'appuierait sur des données décrivant des transactions bancaires et des achats en
ligne, comprenant par exemple : le montant de la transaction, la date et l'heure, la localisation
géographique, le type de marchand, le mode de paiement, ainsi qu'un historique des
transactions précédentes du client. Une étiquette indiquant si la transaction est frauduleuse ou
non serait nécessaire pour l'apprentissage supervisé.

5.2 Prétraitement des données

• Nettoyage : traitement des valeurs manquantes ou aberrantes.

• Normalisation : mise à l'échelle des variables numériques (montant, durée, etc.).

• Encodage : transformation des variables catégorielles (type de marchand, mode de paiement)


en variables numériques.

• Gestion du déséquilibre des classes : techniques de sous-échantillonnage de la classe


majoritaire ou de sur-échantillonnage de la classe minoritaire (par exemple SMOTE), afin
d'éviter qu'un modèle se contente de prédire systématiquement « non-fraude ».

5.3 Choix du modèle : la régression logistique

Structures de données fondamentales


Exposé – Arbres Binaire & ABR

La régression logistique est un modèle de classification binaire qui estime la probabilité


qu'une transaction appartienne à la classe « fraude ». Son principal atout est l'interprétabilité :
le poids associé à chaque variable permet de comprendre quels facteurs augmentent le risque
de fraude. Sa simplicité de mise en œuvre et son faible coût de calcul en font un excellent
point de départ pour un projet de niveau licence, avant d'envisager des modèles plus
sophistiqués.

5.4 Métriques d'évaluation

Étant donné le déséquilibre naturel entre transactions légitimes et frauduleuses, l'exactitude


globale n'est pas un indicateur suffisant. Les métriques suivantes seraient privilégiées :

Métrique Pertinence pour la détection de fraude

Précision Mesure la proportion de transactions signalées comme frauduleuses


qui le sont réellement. Évite de submerger les analystes de fausses
alertes.

Rappel (sensibilité) Mesure la proportion de fraudes réelles correctement détectées.


Essentiel car une fraude non détectée a un coût élevé.

F1-score Moyenne harmonique entre précision et rappel, utile pour équilibrer


les deux objectifs.

AUC-ROC Évalue la capacité globale du modèle à distinguer fraude et non-


fraude, indépendamment du seuil choisi.

Exactitude (accuracy) Peu informative ici : les fraudes étant rares, un modèle naïf prédisant
toujours « non-fraude » obtiendrait déjà une exactitude élevée.

6. Architecture proposée du système

L'application envisagée suivrait un pipeline simple, structuré en plusieurs étapes successives,


de la collecte des données jusqu'à la génération d'une alerte :

Structures de données fondamentales


Exposé – Arbres Binaire & ABR

Étape Description

1. Collecte des Récupération des transactions bancaires et des achats en ligne


données (montant, date, heure, localisation, type de marchand, identifiant
client).

2. Prétraitement Nettoyage des valeurs manquantes, normalisation des variables


numériques, encodage des variables catégorielles, traitement du
déséquilibre des classes.

3. Extraction de Création d'indicateurs pertinents : fréquence des transactions, écart par


caractéristiques rapport aux habitudes du client, montant inhabituel, heure atypique.

4. Entraînement du Apprentissage d'une régression logistique sur les données


modèle d'entraînement étiquetées (fraude / non-fraude).

5. Évaluation Mesure des performances sur un jeu de test via les métriques adaptées
(précision, rappel, F1-score, AUC-ROC).

6. Alerte / Décision Classification de chaque transaction comme suspecte ou légitime,


avec génération d'une alerte si le score de risque dépasse un seuil
défini.

Cette architecture modulaire permettrait, dans une version ultérieure, de remplacer la


régression logistique par un modèle plus avancé sans modifier l'ensemble du système.

7. Résultats attendus

À ce stade, le projet n'a pas encore été implémenté et reste au stade de la conception. Les
résultats attendus, à confirmer lors de la phase d'expérimentation, seraient un modèle capable
de détecter une part significative des transactions frauduleuses tout en maintenant un taux de
fausses alertes raisonnable. Les performances réelles dépendront fortement de la qualité et de
la représentativité des données utilisées pour l'entraînement.

8. Limites et difficultés anticipées

Structures de données fondamentales


Exposé – Arbres Binaire & ABR

• Le déséquilibre important entre transactions légitimes et frauduleuses peut biaiser


l'apprentissage du modèle.

• La régression logistique, étant un modèle linéaire, peut avoir des difficultés à capturer des
relations complexes ou non linéaires entre les variables.

• L'accès à des données réelles et étiquetées est souvent limité pour des raisons de
confidentialité, ce qui peut nécessiter l'usage de jeux de données publics ou synthétiques.

• Les comportements frauduleux évoluent dans le temps, ce qui peut réduire la performance du
modèle si celui-ci n'est pas régulièrement réentraîné.

9. Perspectives d'amélioration

• Comparer la régression logistique à des modèles plus complexes (forêts aléatoires, gradient
boosting, réseaux de neurones) pour évaluer le gain de performance.

• Mettre en place un système de détection en temps réel plutôt qu'une analyse différée.

• Ajouter un mécanisme de réentraînement périodique du modèle pour suivre l'évolution des


comportements frauduleux.

• Développer une interface de tableau de bord permettant aux analystes de visualiser et de


traiter les alertes générées.

10. Conclusion

Structures de données fondamentales


Exposé – Arbres Binaire & ABR

Ce projet propose une première approche simple et interprétable de la détection de fraude,


appliquée aux transactions bancaires et aux achats en ligne, à travers un modèle de régression
logistique. Bien que limité par sa simplicité, ce type de modèle constitue une base
pédagogique solide pour comprendre les enjeux de la détection de fraude par intelligence
artificielle, avant d'envisager des approches plus avancées dans de futurs travaux.

Structures de données fondamentales


Exposé – Arbres Binaire & ABR

Références bibliographiques

Dal Pozzolo, A., Caelen, O., Le Borgne, Y.-A., Waterschoot, S., & Bontempi, G. (2014).
Learned lessons in credit card fraud detection from a practitioner perspective. Expert Systems
with Applications.

Bahnsen, A. C., Aouada, D., Stojanovic, A., & Ottersten, B. (2016). Feature engineering
strategies for credit card fraud detection. Expert Systems with Applications.

Groupe de recherche en apprentissage automatique, Université Libre de Bruxelles (ULB). Jeu


de données « Credit Card Fraud Detection ».

[Ajoutez ici les autres sources consultées : cours, articles, sites spécialisés.]

Structures de données fondamentales

Vous aimerez peut-être aussi