On commence par la base : C’est quoi le projet
Ton projet consiste à créer un système qui classe les dossiers fiscaux selon leur niveau de risque (faible, moyen, élevé).
Pourquoi ?
👉 Aujourd’hui, l’administration fiscale doit analyser beaucoup trop de dossiers, et elle manque de ressources pour tout vérifier.
👉 Certains dossiers sont à faible risque et n’ont pas besoin d’un contrôle approfondi, alors que d’autres ont des anomalies qui
méritent une enquête.
👉 L’objectif de ton projet est donc de faire gagner du temps aux agents fiscaux en leur indiquant directement quels dossiers
méritent d’être contrôlés en priorité.
💡 Imagine que tu sois un agent fiscal : Tu préfères analyser 10 000 dossiers manuellement ou avoir un outil qui te dit
immédiatement "ces 200 dossiers sont les plus suspects" ? → C’est là que ton projet devient utile !
2. Comment on va classifier les dossiers ?
Il faut utiliser un modèle d’intelligence artificielle (IA) qui va analyser les données des dossiers et essayer de détecter des
patterns (des schémas récurrents).
Les étapes principales :
1️⃣ On récupère les dossiers fiscaux existants.
Ces dossiers contiennent des informations comme les revenus déclarés, les dépenses, les transactions bancaires, les
antécédents fiscaux, etc.
2️⃣ On analyse les anomalies.
Par exemple :
Quelqu’un qui déclare un petit revenu mais qui a des dépenses très élevées → Suspect !
Une entreprise qui fait peu de bénéfices mais qui achète beaucoup de biens de luxe → Suspect !
3️⃣ On entraîne un modèle d'IA sur ces données.
On montre au modèle des dossiers déjà classés (des vrais dossiers fiscaux analysés par des experts) et on lui apprend à
reconnaître les schémas suspects.
4️⃣ Une fois entraîné, notre modèle pourra analyser de nouveaux dossiers et dire :
🔵 Faible risque → Pas besoin d’un audit approfondi.
🟠 Risque moyen → À vérifier, mais pas urgent.
🔴 Risque élevé → Ce dossier doit être contrôlé en priorité.
3. Plan simplifié pour avancer pas à pas
💡 On divise le projet en petites étapes pour ne pas être submergée.
📅 Mois 1 : Comprendre et préparer les données
✅ Apprendre à manipuler les fichiers fiscaux avec Pandas.
✅ Nettoyer les données, identifier les variables importantes.
✅ Stocker les données dans une base PostgreSQL.
📅 Mois 2-3 : Créer un modèle simple
✅ Tester Random Forest ou SVM (algorithmes faciles à comprendre).
✅ Voir si le modèle arrive à détecter des incohérences.
✅ Évaluer sa performance (précision, rappel).
📅 Mois 4 : Développer une API pour utiliser ton modèle
✅ Créer une API avec Flask qui reçoit un dossier fiscal et retourne son niveau de risque.
📅 Mois 5-6 : Tester, améliorer et documenter
✅ Vérifier les résultats avec l’équipe technique.
✅ Améliorer le modèle si nécessaire.
✅ Faire un tableau de bord (Power BI) pour visualiser les dossiers classés.
=> Explication claire
Le modèle prend les informations des dossiers (revenus, dépenses, transactions suspectes, etc.).
Il apprend à partir de cas connus où les risques ont été identifiés (dossiers déjà classés).
Il prédit si un nouveau dossier est "faible", "moyen" ou "élevé" en risque.