0% ont trouvé ce document utile (0 vote)
3 vues39 pages

Classification Machine Learning

La classification est une technique de machine learning supervisé qui prédit des catégories à partir d'un ensemble de données. L'évaluation des modèles de classification se fait par la comparaison des valeurs prédites avec les valeurs réelles, souvent résumées dans une matrice de confusion. Des métriques telles que l'accuracy, le rappel, la précision, et le F1-score sont utilisées pour mesurer la performance des modèles, en tenant compte des déséquilibres de classes.

Transféré par

amzilchaymaa04
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
3 vues39 pages

Classification Machine Learning

La classification est une technique de machine learning supervisé qui prédit des catégories à partir d'un ensemble de données. L'évaluation des modèles de classification se fait par la comparaison des valeurs prédites avec les valeurs réelles, souvent résumées dans une matrice de confusion. Des métriques telles que l'accuracy, le rappel, la précision, et le F1-score sont utilisées pour mesurer la performance des modèles, en tenant compte des déséquilibres de classes.

Transféré par

amzilchaymaa04
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Apprentissage Supervisé

Classication : Binaire & Multiple

Machine Learning

Machine Learning Apprentissage Supervisé 1 / 45


Classication  Dénition
Dénition
La Classication est une technique de Machine Learning supervisé appliquée lorsque la variable
à prédire peut prendre une valeur d'un ensemble ni de valeurs (qu'on appelle des classes).
 Prédire une Catégorie
Résultats possibles
En règle générale, dans toute tâche de classication, votre modèle ne peut obtenir que deux
résultats :
Soit votre modèle était correct dans sa prédiction
Soit votre modèle était incorrect dans sa prédiction

Machine Learning Apprentissage Supervisé 2 / 45


Évaluation d'un Modèle de Classication
Principe d'évaluation
Pour évaluer un modèle de classication :  La comparaison entre les valeurs prédites et les
valeurs réelles de l'ensemble des données de test (Testing Set).

Processus de comparaison
Ce processus de comparaison consiste en un nombre de correspondances :
Combien de lignes de données ont été correctement classées
Combien de lignes de données ont été incorrectement classées par le modèle

Résumé
Ces nombres sont résumés dans la matrice de confusion.

Machine Learning Apprentissage Supervisé 3 / 45


Introduction
Contexte
Classication d'entreprises par secteur

Classe Positive : Logistique


Classe Négative : Textile

Objectif : Évaluer les performances du modèle de classication

Machine Learning Apprentissage Supervisé 4 / 45


Matrice de Confusion - Structure
Valeur Prédite
Logistique Textile
Valeur Réelle

Logistique
TP
True Positive
FN
False Negative

Textile
FP
False Positive
TN
True Negative

Machine Learning Apprentissage Supervisé 5 / 45


Signication des 4 Cases
TP - True Positive FP - False Positive
Prédiction : Logistique Prédiction : Logistique
Réalité : Logistique Réalité : Textile
✓ Correct ! × Erreur - Fausse alarme

FN - False Negative TN - True Negative


Prédiction : Textile Prédiction : Textile
Réalité : Logistique Réalité : Textile
× Erreur - Manqué ✓ Correct !

Machine Learning Apprentissage Supervisé 6 / 45


Exemple - Jeu de Données (100 entreprises)
Prédiction
Logistique Textile
Résumé
Logistique 50 5 85 prédictions correctes
Réalité

TP FN
(TP=50 + TN=35)
Textile 10
FP
35
TN
15 erreurs
(FN=5 + FP=10)

Machine Learning Apprentissage Supervisé 7 / 45


Accuracy (Exactitude)
Mesure la proportion de prédictions correctes parmi toutes les prédictions eectuées.

Prédiction Formule
TP + TN
TP FN Accuracy =
TP + TN + FP + FN
Réalité

50 5
Exemple
FP TN
Accuracy =
50 + 35
=
85
= 85%
10 35 50 + 35 + 5 + 10 100

Interprétation
85% des prédictions correctes - Métrique trompeuse
si classes déséquilibrées
Machine Learning Apprentissage Supervisé 8 / 45
Accuracy Paradox  Classes déséquilibrées
Scénario Calcul de l'Accuracy
Dataset : 99 Textile, 1 Logistique Modèle Accuracy =
0 + 99
= 99%
naïf :  Prédire toujours Textile  100

Prédiction Le piège !
Log. Textile Rappel(Logistique) = 0%  Aucune entreprise
Logistique détectée ! Le modèle est inutile malgré
Log. 0 0 99% d'accuracy.
Réalité

TP FN

Solution
Textile 1 99 Utiliser des métriques adaptées :

Rappel, Précision, F1-Score


FP TN
Balanced Accuracy, MCC

Machine Learning Apprentissage Supervisé 9 / 45


Rappel  Recall / Sensibilité
Parmi toutes les entreprises réellement Logistique, quelle
proportion a été détectée ?

Prédiction Formule

Focus TP FN Rappel =
TP
TP + FN
Réalité

FP TN
Machine Learning Apprentissage Supervisé 10 / 45
Rappel - Exemple 1
Données
TP = 50 | FN = 10

Rappel = 50 50+ 10 = 5060 = 0.833 = 83.3%


Interprétation
Il y avait 60 entreprises Logistique dans la réalité
50 ont été détectées (TP)
10 ont été manquées (FN - classées Textile par erreur)
Taux de détection : 83.3%
Machine Learning Apprentissage Supervisé 11 / 45
Rappel - Exemple 2
Données
TP = 50 | FN = 30

Rappel = 50 50+ 30 = 5080 = 0.625 = 62.5%


Interprétation
Il y avait 80 entreprises Logistique dans la réalité
Seulement 50 ont été détectées
30 ont été manquées (opportunités perdues !)
37.5% d'opportunités manquées
Machine Learning Apprentissage Supervisé 12 / 45
Rappel - Quand le Maximiser ?
Scénario : Recrutement
Un cabinet cherche TOUTES les entreprises Logistique pour une campagne
Problème si Rappel faible :
On manque des opportunités (FN élevé)
Perte de candidats potentiels
Perte de contrats

Autres cas d'usage


Détection de maladie grave
Détection de fraude
Contrôle qualité (défauts critiques)
Machine Learning Apprentissage Supervisé 13 / 45
Précision  Precision
Parmi toutes les prédictions "Logistique", quelle proportion
était correcte ?

Focus Formule
Prédiction TP
Précision =
TP + FP
TP FN
Réalité

FP TN
Machine Learning Apprentissage Supervisé 14 / 45
Précision - Exemple 1
Données
TP = 50 | FP = 5

Précision = 5050+ 5 = 5055 = 0.909 = 90.9%


Interprétation
J'ai prédit "Logistique" 55 fois
50 fois c'était correct (TP)
5 fois c'était une erreur (FP - en fait Textile)
Fiabilité : 90.9%
Machine Learning Apprentissage Supervisé 15 / 45
Précision - Exemple 2
Données
TP = 50 | FP = 30

Précision = 50 50+ 30 = 5080 = 0.625 = 62.5%


Interprétation
J'ai prédit "Logistique" 80 fois
Seulement 50 étaient correctes
30 fausses alarmes (trop d'erreurs)
Trop d'erreurs : 37.5%
Machine Learning Apprentissage Supervisé 16 / 45
Précision - Quand la Maximiser ?
Scénario : Investissement Ciblé
Un fonds d'investissement veut nancer UNIQUEMENT des entreprises Logistique
Problème si Précision faible :
Investissements dans le mauvais secteur (FP élevé)
Pertes nancières importantes

Autres cas d'usage


Filtrage spam (ne pas bloquer les vrais emails)
Marketing ciblé (éviter dépenses inutiles)
Diagnostic médical (éviter traitements inutiles)

Machine Learning Apprentissage Supervisé 17 / 45


Spécicité  Specicity
Parmi toutes les entreprises réellement Textile, quelle
proportion a été correctement identiée ?

Prédiction Formule

TP FN Spécicité =
TN
TN + FP
Réalité

Focus FP TN

Machine Learning Apprentissage Supervisé 18 / 45


Spécicité - Exemple 1
Données
TN = 35 | FP = 5

Spécicité = 3535+ 5 = 4035 = 0.875 = 87.5%


Interprétation
Il y avait 40 entreprises Textile dans la réalité
35 ont été correctement identiées (TN)
5 ont été mal classées comme Logistique (FP)
Taux de reconnaissance : 87.5%
Machine Learning Apprentissage Supervisé 19 / 45
Spécicité - Exemple 2
Données
TN = 35 | FP = 20

Spécicité = 35 35+ 20 = 3555 = 0.636 = 63.6%


Interprétation
Il y avait 55 entreprises Textile dans la réalité
Seulement 35 ont été correctement identiées
20 ont été confondues avec Logistique (fausses alarmes)
36.4% de fausses alarmes
Machine Learning Apprentissage Supervisé 20 / 45
Spécicité - Quand la Maximiser ?
Scénario : Subvention Textile
Le gouvernement ore des aides EXCLUSIVEMENT aux entreprises Textile
Problème si Spécicité faible :
Subventions accordées au mauvais secteur (FP élevé)
Gaspillage des fonds publics

Autres cas d'usage


Tests médicaux (ne pas alarmer patients sains)
Systèmes de sécurité (ne pas bloquer utilisateurs légitimes)
Contrôle qualité (ne pas rejeter bons produits)

Machine Learning Apprentissage Supervisé 21 / 45


F1-Score
Formule
Précision × Rappel
F1-Score = 2 ×
Précision + Rappel

Utilité
Combine Précision et Rappel
Moyenne harmonique (pénalise les déséquilibres)
Bon pour classes déséquilibrées

Machine Learning Apprentissage Supervisé 22 / 45


F1-Score - Exemple 1
Données
Précision = 90.9% | Rappel = 83.3%

F1 = 2 × 00..909 × 0.833
909 + 0.833
= ×2 01..757
742 = 86.9%
Interprétation
Bon équilibre entre Précision et Rappel
Machine Learning Apprentissage Supervisé 23 / 45
F1-Score - Exemple 2
Données
Précision = 95% | Rappel = 50%

F1 = 2 × 00..9595 ×+ 00..5050
= × 2 01..475
45 = 65.5%
Interprétation
Déséquilibre pénalisé ! Rappel trop faible tire F1 vers le bas
Machine Learning Apprentissage Supervisé 24 / 45
Balanced Accuracy
Formule
Sensibilité + Spécicité
Balanced Accuracy =
2

Exemple 1
Sensibilité (Rappel) = 83.3%, Spécicité = 87.5%
83.3 + 87.5
BA = = 85.4%
2
Exemple 2 (modèle naïf)
Sensibilité = 0%, Spécicité = 100%
0 + 100
BA = = 50%
2
Machine Learning Apprentissage Supervisé 25 / 45
Matthews Correlation Coecient (MCC)
Formule
TP × TN − FP × FN
MCC = p
(TP + FP)(TP + FN)(TN + FP)(TN + FN)

Interprétation
Valeur entre -1 et +1
+1 : Prédiction parfaite
0 : Aléatoire
-1 : Désaccord total

Métrique la plus robuste et complète !


Machine Learning Apprentissage Supervisé 26 / 45
MCC - Exemple
Données
TP = 50, TN = 35, FP = 5, FN = 10

50 × 35 − 5 × 10
MCC = p
(50 + 5)(50 + 10)(35 + 5)(35 + 10)

1750 − 50
=√
55 × 60 × 40 × 45
1700 1700
=√ = = 0.70
5, 940, 000 2437
Interprétation
Bonne corrélation entre prédictions et réalité
Machine Learning Apprentissage Supervisé 27 / 45
Tableau Récapitulatif
Exemple : TP=50, TN=35, FP=5, FN=10

Métrique Valeur Interprétation


Rappel 83.3% Détecte 5/6 des Logistique
Précision 90.9% 9/10 de raison si prédit Logistique
Spécicité 87.5% Identie 87.5% des Textile
F1-Score 86.9% Bon équilibre
Accuracy 85.0% 85% correct au total
Balanced Acc. 85.4% Performance équilibrée
MCC 0.70 Bonne corrélation

Machine Learning Apprentissage Supervisé 28 / 45


Comment Choisir la Métrique ?
Minimiser FN Minimiser FP
Maximiser Rappel Maximiser Précision
Exemples : Exemples :
Détection maladie Investissement
Détection fraude Filtrage spam
Recrutement exhaustif Ciblage marketing

Métriques générales
F1-Score, Balanced Accuracy, MCC : Pour un aperçu équilibré

Machine Learning Apprentissage Supervisé 29 / 45


Extension au Cas Multi-Classe
Exemple : Classication en 3 secteurs

Prédiction Structure
Logistique Textile Agroalim. Lignes = Vraie classe
Colonnes = Prédiction
Logistique
45 3 2 Diagonale = Correct
Réalité

Lecture
Textile
5 30 2 Ligne Textile :
30 correctes
Agroalim.
3 1 9 
5 Logistique

2 Agroalim.

Machine Learning Apprentissage Supervisé 30 / 45


Calcul par Classe  Approche One-vs-All
Pour calculer Rappel et Précision : transformer en problème binaire
Focus sur "Logistique" Calculs

Rappel = 4545+ 5
Prédiction
Logistique Autres
Logistique TP FN 45 = 90%
45 8
=
50
Réalité

Précision = 4545+ 8
(5+3)

Autres FP TN
5 42 45 = 84.9%
(3+2) (30+2+1+9) =
53
Machine Learning Apprentissage Supervisé 31 / 45
ROC Curve (Receiver Operating Characteristic)
True Positive Rate (TPR)
TP
TPR =
TP + FN
TP FN Événements positifs correctement classés

FP TN False Positive Rate (FPR)


FP
FPR =
FP + TN
Événements négatifs mal classés

Utilité de la courbe ROC


Visualise le compromis entre TPR et FPR pour diérents seuils de classication

Machine Learning Apprentissage Supervisé 32 / 45


Comprendre les Prédictions : TP, TN, FP, FN

Machine Learning Apprentissage Supervisé 33 / 45


Courbe ROC  Receiver Operating Characteristic

Machine Learning Apprentissage Supervisé 34 / 45


Cohen's Kappa (κ)  Concept et Formule
Motivation
L'accuracy peut être trompeuse avec des classes déséquilibrées.
Le Cohen's Kappa corrige l'accord qui serait obtenu par hasard.

Formule
p0 − pe
κ=
1 − pe
p0 = Accuracy observée | pe = Accuracy attendue par hasard

Interprétation
κ = 1 : Performance parfaite
κ = 0 : Performance équivalente au hasard
κ < 0 : Performance pire que le hasard
Machine Learning Apprentissage Supervisé 35 / 45
Classication de 100 échantillons par deux annotateurs
Étape 1 : Accord observé (p0 )
Les deux annotateurs sont d'accord sur :
Matrice de Confusion
Annotateur B "Logistique" : 40 cas
Log. Text. "Textile" : 45 cas
40 + 45
40 10 50 = 0.85
Annotateur A

Log. p0 =
100

Text. 5 45 50 Étape 2 : Accord par hasard (pe )


Pour chaque classe, probabilité d'accord par hasard :
45 55 50
Logistique : 100
50
45
× 100
55
= 0.225
Textile : 100 × 100 = 0.275
pe = 0.225 + 0.275 = 0.50
Cohen's Kappa  Exemple : Logistique vs Textile (2/2)
Rappel des valeurs calculées
Accord observé : p0 = 0.85 (85% des cas)
Accord par hasard : pe = 0.50 (50% attendu par hasard)

Étape 3 : Calcul du Kappa


p0 − pe 0.85 − 0.50 0.35
κ= = = = 0.70
1 − pe 1 − 0.50 0.50

Interprétation
κ = 0.70 indique un accord substantiel entre les deux annotateurs
Cet accord est bien meilleur que le simple hasard
L'accuracy seule (85%) masquait qu'une partie importante de cet accord (50%) serait
arrivée par pur hasard !
Machine Learning Apprentissage Supervisé 37 / 45
Cohen's Kappa  Exemple Comparatif
Modèle équilibré Modèle déséquilibré

14 6 6 14

5 75 5 75
p0 = 0.89 pe = 0.686 p0 = 0.81 pe = 0.734

κ = 0.65 κ = 0.29

Conclusion : Le Kappa révèle la vraie qualité du modèle

Machine Learning Apprentissage Supervisé 38 / 45


Questions ?

Merci !

Machine Learning Apprentissage Supervisé 39 / 45

Vous aimerez peut-être aussi