Apprentissage Supervisé
Classication : Binaire & Multiple
Machine Learning
Machine Learning Apprentissage Supervisé 1 / 45
Classication Dénition
Dénition
La Classication est une technique de Machine Learning supervisé appliquée lorsque la variable
à prédire peut prendre une valeur d'un ensemble ni de valeurs (qu'on appelle des classes).
Prédire une Catégorie
Résultats possibles
En règle générale, dans toute tâche de classication, votre modèle ne peut obtenir que deux
résultats :
Soit votre modèle était correct dans sa prédiction
Soit votre modèle était incorrect dans sa prédiction
Machine Learning Apprentissage Supervisé 2 / 45
Évaluation d'un Modèle de Classication
Principe d'évaluation
Pour évaluer un modèle de classication : La comparaison entre les valeurs prédites et les
valeurs réelles de l'ensemble des données de test (Testing Set).
Processus de comparaison
Ce processus de comparaison consiste en un nombre de correspondances :
Combien de lignes de données ont été correctement classées
Combien de lignes de données ont été incorrectement classées par le modèle
Résumé
Ces nombres sont résumés dans la matrice de confusion.
Machine Learning Apprentissage Supervisé 3 / 45
Introduction
Contexte
Classication d'entreprises par secteur
Classe Positive : Logistique
Classe Négative : Textile
Objectif : Évaluer les performances du modèle de classication
Machine Learning Apprentissage Supervisé 4 / 45
Matrice de Confusion - Structure
Valeur Prédite
Logistique Textile
Valeur Réelle
Logistique
TP
True Positive
FN
False Negative
Textile
FP
False Positive
TN
True Negative
Machine Learning Apprentissage Supervisé 5 / 45
Signication des 4 Cases
TP - True Positive FP - False Positive
Prédiction : Logistique Prédiction : Logistique
Réalité : Logistique Réalité : Textile
✓ Correct ! × Erreur - Fausse alarme
FN - False Negative TN - True Negative
Prédiction : Textile Prédiction : Textile
Réalité : Logistique Réalité : Textile
× Erreur - Manqué ✓ Correct !
Machine Learning Apprentissage Supervisé 6 / 45
Exemple - Jeu de Données (100 entreprises)
Prédiction
Logistique Textile
Résumé
Logistique 50 5 85 prédictions correctes
Réalité
TP FN
(TP=50 + TN=35)
Textile 10
FP
35
TN
15 erreurs
(FN=5 + FP=10)
Machine Learning Apprentissage Supervisé 7 / 45
Accuracy (Exactitude)
Mesure la proportion de prédictions correctes parmi toutes les prédictions eectuées.
Prédiction Formule
TP + TN
TP FN Accuracy =
TP + TN + FP + FN
Réalité
50 5
Exemple
FP TN
Accuracy =
50 + 35
=
85
= 85%
10 35 50 + 35 + 5 + 10 100
Interprétation
85% des prédictions correctes - Métrique trompeuse
si classes déséquilibrées
Machine Learning Apprentissage Supervisé 8 / 45
Accuracy Paradox Classes déséquilibrées
Scénario Calcul de l'Accuracy
Dataset : 99 Textile, 1 Logistique Modèle Accuracy =
0 + 99
= 99%
naïf : Prédire toujours Textile 100
Prédiction Le piège !
Log. Textile Rappel(Logistique) = 0% Aucune entreprise
Logistique détectée ! Le modèle est inutile malgré
Log. 0 0 99% d'accuracy.
Réalité
TP FN
Solution
Textile 1 99 Utiliser des métriques adaptées :
Rappel, Précision, F1-Score
FP TN
Balanced Accuracy, MCC
Machine Learning Apprentissage Supervisé 9 / 45
Rappel Recall / Sensibilité
Parmi toutes les entreprises réellement Logistique, quelle
proportion a été détectée ?
Prédiction Formule
Focus TP FN Rappel =
TP
TP + FN
Réalité
FP TN
Machine Learning Apprentissage Supervisé 10 / 45
Rappel - Exemple 1
Données
TP = 50 | FN = 10
Rappel = 50 50+ 10 = 5060 = 0.833 = 83.3%
Interprétation
Il y avait 60 entreprises Logistique dans la réalité
50 ont été détectées (TP)
10 ont été manquées (FN - classées Textile par erreur)
Taux de détection : 83.3%
Machine Learning Apprentissage Supervisé 11 / 45
Rappel - Exemple 2
Données
TP = 50 | FN = 30
Rappel = 50 50+ 30 = 5080 = 0.625 = 62.5%
Interprétation
Il y avait 80 entreprises Logistique dans la réalité
Seulement 50 ont été détectées
30 ont été manquées (opportunités perdues !)
37.5% d'opportunités manquées
Machine Learning Apprentissage Supervisé 12 / 45
Rappel - Quand le Maximiser ?
Scénario : Recrutement
Un cabinet cherche TOUTES les entreprises Logistique pour une campagne
Problème si Rappel faible :
On manque des opportunités (FN élevé)
Perte de candidats potentiels
Perte de contrats
Autres cas d'usage
Détection de maladie grave
Détection de fraude
Contrôle qualité (défauts critiques)
Machine Learning Apprentissage Supervisé 13 / 45
Précision Precision
Parmi toutes les prédictions "Logistique", quelle proportion
était correcte ?
Focus Formule
Prédiction TP
Précision =
TP + FP
TP FN
Réalité
FP TN
Machine Learning Apprentissage Supervisé 14 / 45
Précision - Exemple 1
Données
TP = 50 | FP = 5
Précision = 5050+ 5 = 5055 = 0.909 = 90.9%
Interprétation
J'ai prédit "Logistique" 55 fois
50 fois c'était correct (TP)
5 fois c'était une erreur (FP - en fait Textile)
Fiabilité : 90.9%
Machine Learning Apprentissage Supervisé 15 / 45
Précision - Exemple 2
Données
TP = 50 | FP = 30
Précision = 50 50+ 30 = 5080 = 0.625 = 62.5%
Interprétation
J'ai prédit "Logistique" 80 fois
Seulement 50 étaient correctes
30 fausses alarmes (trop d'erreurs)
Trop d'erreurs : 37.5%
Machine Learning Apprentissage Supervisé 16 / 45
Précision - Quand la Maximiser ?
Scénario : Investissement Ciblé
Un fonds d'investissement veut nancer UNIQUEMENT des entreprises Logistique
Problème si Précision faible :
Investissements dans le mauvais secteur (FP élevé)
Pertes nancières importantes
Autres cas d'usage
Filtrage spam (ne pas bloquer les vrais emails)
Marketing ciblé (éviter dépenses inutiles)
Diagnostic médical (éviter traitements inutiles)
Machine Learning Apprentissage Supervisé 17 / 45
Spécicité Specicity
Parmi toutes les entreprises réellement Textile, quelle
proportion a été correctement identiée ?
Prédiction Formule
TP FN Spécicité =
TN
TN + FP
Réalité
Focus FP TN
Machine Learning Apprentissage Supervisé 18 / 45
Spécicité - Exemple 1
Données
TN = 35 | FP = 5
Spécicité = 3535+ 5 = 4035 = 0.875 = 87.5%
Interprétation
Il y avait 40 entreprises Textile dans la réalité
35 ont été correctement identiées (TN)
5 ont été mal classées comme Logistique (FP)
Taux de reconnaissance : 87.5%
Machine Learning Apprentissage Supervisé 19 / 45
Spécicité - Exemple 2
Données
TN = 35 | FP = 20
Spécicité = 35 35+ 20 = 3555 = 0.636 = 63.6%
Interprétation
Il y avait 55 entreprises Textile dans la réalité
Seulement 35 ont été correctement identiées
20 ont été confondues avec Logistique (fausses alarmes)
36.4% de fausses alarmes
Machine Learning Apprentissage Supervisé 20 / 45
Spécicité - Quand la Maximiser ?
Scénario : Subvention Textile
Le gouvernement ore des aides EXCLUSIVEMENT aux entreprises Textile
Problème si Spécicité faible :
Subventions accordées au mauvais secteur (FP élevé)
Gaspillage des fonds publics
Autres cas d'usage
Tests médicaux (ne pas alarmer patients sains)
Systèmes de sécurité (ne pas bloquer utilisateurs légitimes)
Contrôle qualité (ne pas rejeter bons produits)
Machine Learning Apprentissage Supervisé 21 / 45
F1-Score
Formule
Précision × Rappel
F1-Score = 2 ×
Précision + Rappel
Utilité
Combine Précision et Rappel
Moyenne harmonique (pénalise les déséquilibres)
Bon pour classes déséquilibrées
Machine Learning Apprentissage Supervisé 22 / 45
F1-Score - Exemple 1
Données
Précision = 90.9% | Rappel = 83.3%
F1 = 2 × 00..909 × 0.833
909 + 0.833
= ×2 01..757
742 = 86.9%
Interprétation
Bon équilibre entre Précision et Rappel
Machine Learning Apprentissage Supervisé 23 / 45
F1-Score - Exemple 2
Données
Précision = 95% | Rappel = 50%
F1 = 2 × 00..9595 ×+ 00..5050
= × 2 01..475
45 = 65.5%
Interprétation
Déséquilibre pénalisé ! Rappel trop faible tire F1 vers le bas
Machine Learning Apprentissage Supervisé 24 / 45
Balanced Accuracy
Formule
Sensibilité + Spécicité
Balanced Accuracy =
2
Exemple 1
Sensibilité (Rappel) = 83.3%, Spécicité = 87.5%
83.3 + 87.5
BA = = 85.4%
2
Exemple 2 (modèle naïf)
Sensibilité = 0%, Spécicité = 100%
0 + 100
BA = = 50%
2
Machine Learning Apprentissage Supervisé 25 / 45
Matthews Correlation Coecient (MCC)
Formule
TP × TN − FP × FN
MCC = p
(TP + FP)(TP + FN)(TN + FP)(TN + FN)
Interprétation
Valeur entre -1 et +1
+1 : Prédiction parfaite
0 : Aléatoire
-1 : Désaccord total
Métrique la plus robuste et complète !
Machine Learning Apprentissage Supervisé 26 / 45
MCC - Exemple
Données
TP = 50, TN = 35, FP = 5, FN = 10
50 × 35 − 5 × 10
MCC = p
(50 + 5)(50 + 10)(35 + 5)(35 + 10)
1750 − 50
=√
55 × 60 × 40 × 45
1700 1700
=√ = = 0.70
5, 940, 000 2437
Interprétation
Bonne corrélation entre prédictions et réalité
Machine Learning Apprentissage Supervisé 27 / 45
Tableau Récapitulatif
Exemple : TP=50, TN=35, FP=5, FN=10
Métrique Valeur Interprétation
Rappel 83.3% Détecte 5/6 des Logistique
Précision 90.9% 9/10 de raison si prédit Logistique
Spécicité 87.5% Identie 87.5% des Textile
F1-Score 86.9% Bon équilibre
Accuracy 85.0% 85% correct au total
Balanced Acc. 85.4% Performance équilibrée
MCC 0.70 Bonne corrélation
Machine Learning Apprentissage Supervisé 28 / 45
Comment Choisir la Métrique ?
Minimiser FN Minimiser FP
Maximiser Rappel Maximiser Précision
Exemples : Exemples :
Détection maladie Investissement
Détection fraude Filtrage spam
Recrutement exhaustif Ciblage marketing
Métriques générales
F1-Score, Balanced Accuracy, MCC : Pour un aperçu équilibré
Machine Learning Apprentissage Supervisé 29 / 45
Extension au Cas Multi-Classe
Exemple : Classication en 3 secteurs
Prédiction Structure
Logistique Textile Agroalim. Lignes = Vraie classe
Colonnes = Prédiction
Logistique
45 3 2 Diagonale = Correct
Réalité
Lecture
Textile
5 30 2 Ligne Textile :
30 correctes
Agroalim.
3 1 9
5 Logistique
2 Agroalim.
Machine Learning Apprentissage Supervisé 30 / 45
Calcul par Classe Approche One-vs-All
Pour calculer Rappel et Précision : transformer en problème binaire
Focus sur "Logistique" Calculs
Rappel = 4545+ 5
Prédiction
Logistique Autres
Logistique TP FN 45 = 90%
45 8
=
50
Réalité
Précision = 4545+ 8
(5+3)
Autres FP TN
5 42 45 = 84.9%
(3+2) (30+2+1+9) =
53
Machine Learning Apprentissage Supervisé 31 / 45
ROC Curve (Receiver Operating Characteristic)
True Positive Rate (TPR)
TP
TPR =
TP + FN
TP FN Événements positifs correctement classés
FP TN False Positive Rate (FPR)
FP
FPR =
FP + TN
Événements négatifs mal classés
Utilité de la courbe ROC
Visualise le compromis entre TPR et FPR pour diérents seuils de classication
Machine Learning Apprentissage Supervisé 32 / 45
Comprendre les Prédictions : TP, TN, FP, FN
Machine Learning Apprentissage Supervisé 33 / 45
Courbe ROC Receiver Operating Characteristic
Machine Learning Apprentissage Supervisé 34 / 45
Cohen's Kappa (κ) Concept et Formule
Motivation
L'accuracy peut être trompeuse avec des classes déséquilibrées.
Le Cohen's Kappa corrige l'accord qui serait obtenu par hasard.
Formule
p0 − pe
κ=
1 − pe
p0 = Accuracy observée | pe = Accuracy attendue par hasard
Interprétation
κ = 1 : Performance parfaite
κ = 0 : Performance équivalente au hasard
κ < 0 : Performance pire que le hasard
Machine Learning Apprentissage Supervisé 35 / 45
Classication de 100 échantillons par deux annotateurs
Étape 1 : Accord observé (p0 )
Les deux annotateurs sont d'accord sur :
Matrice de Confusion
Annotateur B "Logistique" : 40 cas
Log. Text. "Textile" : 45 cas
40 + 45
40 10 50 = 0.85
Annotateur A
Log. p0 =
100
Text. 5 45 50 Étape 2 : Accord par hasard (pe )
Pour chaque classe, probabilité d'accord par hasard :
45 55 50
Logistique : 100
50
45
× 100
55
= 0.225
Textile : 100 × 100 = 0.275
pe = 0.225 + 0.275 = 0.50
Cohen's Kappa Exemple : Logistique vs Textile (2/2)
Rappel des valeurs calculées
Accord observé : p0 = 0.85 (85% des cas)
Accord par hasard : pe = 0.50 (50% attendu par hasard)
Étape 3 : Calcul du Kappa
p0 − pe 0.85 − 0.50 0.35
κ= = = = 0.70
1 − pe 1 − 0.50 0.50
Interprétation
κ = 0.70 indique un accord substantiel entre les deux annotateurs
Cet accord est bien meilleur que le simple hasard
L'accuracy seule (85%) masquait qu'une partie importante de cet accord (50%) serait
arrivée par pur hasard !
Machine Learning Apprentissage Supervisé 37 / 45
Cohen's Kappa Exemple Comparatif
Modèle équilibré Modèle déséquilibré
14 6 6 14
5 75 5 75
p0 = 0.89 pe = 0.686 p0 = 0.81 pe = 0.734
κ = 0.65 κ = 0.29
Conclusion : Le Kappa révèle la vraie qualité du modèle
Machine Learning Apprentissage Supervisé 38 / 45
Questions ?
Merci !
Machine Learning Apprentissage Supervisé 39 / 45