0% ont trouvé ce document utile (0 vote)
4 vues38 pages

La Classification

La classification est une tâche d'apprentissage supervisée visant à prédire des étiquettes à partir de caractéristiques d'objets. Elle se divise en classification binaire et multi-classe, avec des exemples tels que la détection de spam ou l'identification de langues. Les méthodes incluent K Nearest Neighbors (KNN) et les arbres de décision, chacun ayant ses propres principes de fonctionnement et critères d'évaluation.

Transféré par

Mohammed Maimouni
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
4 vues38 pages

La Classification

La classification est une tâche d'apprentissage supervisée visant à prédire des étiquettes à partir de caractéristiques d'objets. Elle se divise en classification binaire et multi-classe, avec des exemples tels que la détection de spam ou l'identification de langues. Les méthodes incluent K Nearest Neighbors (KNN) et les arbres de décision, chacun ayant ses propres principes de fonctionnement et critères d'évaluation.

Transféré par

Mohammed Maimouni
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

La classification

Présenté par : Radouan DAHBI

IIRT (4ème année)

2025/2026

Classification
Plan du cours 1 Définition

2 K Nearest Neighbors (KNN)

3 Fonctionnement d’un KNN

4 Decision tree (Arbre de décision)

5 Fonctionnement d’un arbre de


décision

6 Métriques d’évaluation

Classification 2
Définition

Classification 3
Définition
• La classification est une tâche d'apprentissage supervisée qui consiste à
prédire une étiquette (classe ou label) à partir d'un ensemble de
caractéristiques (attributs/features) d'un individu ou d'un objet.
• L'objectif est d'apprendre, à partir de données déjà étiquetées, un modèle
capable de prédire la classe d'une nouvelle observation.

Classification 4
Exemple de classification

Classification 5
Types de classification : binaire vs multi-classe

• La classification binaire fait référence aux tâches de classification qui ont deux
étiquettes de classe (l’espace des labels est binaire càd Y={0,1}).
• Voici quelques exemples de problèmes de classification binaire :
o Identifier si un email est un spam ou non ;
o Identifier si un tableau a été peint par Picasso ou non ;
o Identifier si une image contient ou non une girafe ;
o Identifier si une molécule peut ou non traiter la dépression ;
o Identifier si une transaction financière est frauduleuse ou non.

Classification 6
Types de classification : binaire vs multi-classe
• La classification multi-classe fait référence aux tâches de classification qui ont
plus de deux étiquettes de classe (l’espace des labels est discret et fini càd
Y={0,1,2……,C} avec C est le nombre des classes).
• Voici quelques exemples de problèmes de classification multi-classe :
o Identifier en quelle langue un texte est écrit ;
o Identifier l’expression d’un visage parmi une liste prédéfinie de possibilités
(colère, tristesse, joie, etc.) ;
o Identifier à quelle espèce appartient une plante ;
o Identifier les objets présents sur une photographie.

Classification 7
K Nearest Neighbors (KNN)

Classification 8
C’est quoi un KNN

• Un KNN (K plus proches voisins) est un modèle d'apprentissage automatique


supervisé simple et facile à mettre en œuvre qui peut être utilisé pour résoudre
à la fois des problèmes de classification et de régression.

• L’algorithme KNN repose sur l’idée que les exemples similaires se trouvent
proches les uns des autres dans l’espace des caractéristiques.

Classification 9
Le nombre de voisins K
K : nombre de voisins les plus proches utilisés pour prédire la classe d’un nouvel
exemple.

K=5 K=3
Classification 10
Fonctionnement d’un KNN

Classification 11
Principe de l’algorithme KNN

• Trouver les K exemples d’apprentissage les plus proches (appelés voisins) d’un
nouvel exemple à classer dans l’espace des caractéristiques.
• Observer leurs classes connues, puis attribuer à la nouvelle donnée la classe
majoritaire parmi ces K voisins (vote majoritaire).
• En pratique, K est un entier positif, choisi de manière à équilibrer précision et
stabilité du modèle :
o Un petit K rend le modèle plus précis mais sensible au bruit,
o Un grand K le rend plus stable, mais parfois moins précis.

Classification 12
Principe de l’algorithme KNN

• Le K plus proches voisins (KNN) est un modèle non paramétrique, c’est-à-dire


qu’il n’impose aucune forme mathématique ou équation aux données. Il ne
construit pas de modèle explicite pendant l’apprentissage.

• Au lieu de cela, le modèle mémorise simplement les données d’apprentissage


et prédit la classe d’un nouvel exemple en fonction de ses voisins les plus
proches. C’est pourquoi le classifieur KNN est également appelé un apprenant
paresseux (lazy learner).

Classification 13
Trouver le K optimal

• La valeur de K a un impact majeur sur les performances du modèle. Il est donc


essentiel de trouver le K optimal.

• Il n’existe pas de formule statistique exacte pour déterminer cette valeur : elle
se choisit expérimentalement.

• Pour choisir le meilleur K, on trace la courbe du taux d’erreur en fonction de K


sur un intervalle défini, puis on sélectionne la valeur de K correspondant au
taux d’erreur minimal.

Classification 14
Trouver le K optimal

Classification 15
Decision tree (Arbre de décision)

Classification 16
C’est quoi un arbre de décision
• Un arbre de décision est un modèle d'apprentissage automatique supervisé
populaire et interprétable, utilisé pour la classification et la régression. Il
représente les décisions sous forme de branches basées sur des règles simples
dérivées des caractéristiques (attributs/features) des données.

• Le principe d’un arbre de décision consiste à diviser progressivement (de façon


récursive) l’ensemble des données d’apprentissage en sous-groupes de plus en plus
homogènes. À chaque étape, l’algorithme choisit l’attribut le plus pertinent pour
séparer les exemples, jusqu’à obtenir des groupes contenants presque uniquement
des éléments d’une même classe.
L’arbre de décision apprend en posant des questions successives sur les
attributs les plus pertinents, pour aboutir à des feuilles contenant des
exemples similaires.
Classification 17
Les types des arbres de décision
Il existe deux principaux types d'arbres de décision :
• Les arbres de classification (Classification Tree) prédisent la classe à laquelle
appartient la variable cible. Dans ce cas, la prédiction est une étiquette de
classe.

• Les arbres de régression (Regression Tree) prédisent une quantité réelle (par
exemple, le prix d'une maison ou la durée du séjour d'un patient à l'hôpital).
Dans ce cas, la prédiction est une valeur numérique.
Contrairement à la régression linéaire, cette approche ne fait pas d'hypothèse sur
la forme des relations entre les variables, ce qui en fait un outil puissant pour
modéliser des données complexes et non linéaires.
Classification 18
Exemple d’un arbre de décision

Classification 19
Exemple d’un arbre de décision

Classification 20
Représentation d’un arbre de décision

Classification 21
Définition d’un arbre de classification
• Un arbre de classification est un modèle d’apprentissage supervisé représenté sous
forme d’un arbre de décision tel que :
o Les nœuds de l’arbre testent les attributs du jeu de données ;
o Chaque branche correspond à une valeur possible de l’attribut testé ;
o Les feuilles indiquent la classe prédite (deux ou plusieurs) ou la valeur de
sortie.
• Un arbre de décision divise les données en plusieurs sous-groupes basés sur des
questions ou des conditions, généralement sous forme de si… alors.
Exemple
o Question au nœud : “La maison fait-elle plus de 100 m² ?”
o Branches : Oui / Non
o Feuilles : Classe de prix → Élevé / Moyen / Bas
Classification 22
Fonctionnement d’un arbre de
décision

Classification 23
Apprentissage par génération de règles
• L’arbre de décision apprend, à partir d’exemples déjà connus, des règles de
décision permettant de prédire la classe d’un nouvel exemple.
• Ces règles prennent la forme :
o Si [condition] Alors [résultat]
o condition : conjonction de descripteurs logiques du type
Attribut = valeur (ou opérateur de comparaison, ou ensemble de
valeurs)
o résultat : classe ou catégorie prédite
• C’est un modèle non paramétrique, c’est-à-dire qu’il n’impose pas de forme
mathématique aux données : il apprend uniquement à partir de la base
d’apprentissage en construisant ses propres règles.

Classification 24
Construction de l’arbre de décision
L’arbre se construit de manière récursive à partir de la racine jusqu’aux feuilles :
• Il sélectionne à chaque nœud l’attribut qui permet de mieux diviser les
données (paramètres à optimiser = attributs choisis + seuils de division).
• Ce processus est basé sur des critères qui mesure la pureté des sous-
groupes, comme :
o Indice de Gini : mesure la pureté des sous-groupes créés.
o Entropie (Gain d’information ) : mesure la réduction de l’incertitude
(désordre).
L’objectif est de minimiser l’impureté (maximiser la pureté) des nœuds

Classification 25
Construction de l’arbre de décision
• Ensuite, les données sont divisées en sous-groupes basés sur l’attribut le
plus pertinent, c’est-à-dire celui qui minimise l’impureté des nœuds selon le
critère choisi.
• Ce processus continue jusqu’à un critère d’arrêt : l’arbre atteigne une
profondeur maximale ou que toutes les feuilles soient pures (chaque feuille
contient une seule classe)
Il s’agit d’un algorithme d’optimisation glouton (greedy).
• Une fois l’arbre construit, pour effectuer une prédiction de classe, on part
de la racine et on suit les branches en fonction des valeurs des attributs
d’un nouvel exemple, jusqu’à atteindre une feuille qui indique la classe
prédite.
Classification 26
Choix de l’attribut

Classification 27
Critères de mesure de l’impureté
• Indice de Gini :

Plus l’indice de Gini est proche de 0, plus le nœud est pur.

• Entropie :

Plus l’entropie est faible, plus le nœud est pur.


Classification 28
Exemple de construction de l’arbre de décision

Classification 29
Critères d’arrêt
Un arbre de décision s’arrête quand :
• Chaque attribut a déjà été inclus le long de ce chemin dans l’arbre.
• Lorsqu’une feuille contient uniquement des exemples d’une seule classe
(entropie = 0).
• L’hétérogénéité des nœuds ne diminue plus.
• Lorsque le gain en information (entropie avant – entropie après) est
inférieur à un seuil minimal.
• Nombre d’exemples dans une feuille inférieur à un seuil fixé.
• Taux d’exemples bien classées dans une feuille supérieur à un seuil
prédéfini.
Ces critères servent à contrôler la taille de l’arbre et à éviter le
sur-apprentissage (overfitting).
Classification 30
Métriques d’évaluation

Classification 31
Métriques d’évaluation
Evaluer les performances d’un modèle de classification est primordial :
• Pour savoir si le modèle est globalement significatif ou s’il ne fait que
mémoriser les données : Mon modèle traduit-il vraiment une causalité ?
• Pour se donner une idée des performances en déploiement (situation réelle) :
Quelle sera la fiabilité (les couts associés) lorsque j’utiliserai mon modèle ?
• Pour comparer plusieurs modèles candidats : Lequel parmi plusieurs modèles
sera le plus performant compte tenu de mes objectifs ?

Classification 32
Métriques d’évaluation
• Plusieurs indicateurs permettent de mesurer la performance des modèles
de classification.
• Chaque indicateur a ses spécificités. il faut bien souvent en utiliser plusieurs
pour avoir une vision complète de la performance de votre modèle.
• Pour évaluer la performance d’un modèle de classification nous présentons
quatre indicateurs qui sont calculés à partir de la matrice de confusion :
o Accuracy
o Recall
o Precision
o F1 score

Classification 33
Matrice de confusion
La matrice de confusion est une table qui permet de visualiser les
performances d'un modèle de classification. Elle montre les
prédictions correctes et incorrectes en fonction des classes réelles.

Faux négatifs : erreurs de détection


Faux positifs : fausses alarmes
Classification 34
Quelques métriques d’évaluation

Classification 35
Quelques métriques d’évaluation
• Accuracy : Le taux de justesse est le pourcentage de prédictions correctes
réalisées par le classifieur sur l’ensemble des données.

• Recall (or Sensitivity) : Le rappel ou TPR (Taux de Vrais Positifs) est la


proportion de vrais positifs parmi tous les positifs réels (capacité à ne pas
manquer de cas positifs = minimiser les faux négatifs).

Classification 36
Quelques métriques d’évaluation
• Precision : La précision est la proportion de vrais positifs parmi toutes les
prédictions positives faites par le classifieur (fiabilité des prédictions positives =
minimiser les faux positifs).

• Score F1 : Le score F1 est la moyenne harmonique de la précision et du rappel.


Un classifieur obtiendra un bon score F1 uniquement si son rappel et sa
précision sont élevés (utile lorsque les classes sont déséquilibrées).

Classification 37
Des questions
[Link]@[Link]

Classification 38

Vous aimerez peut-être aussi