0% ont trouvé ce document utile (0 vote)
6 vues26 pages

Évaluation des modèles d'IA : Métriques clés

Le document traite de l'évaluation des modèles d'intelligence artificielle, en mettant l'accent sur l'importance de mesurer la performance et de comparer différents modèles. Il présente les différentes métriques d'évaluation selon le type d'apprentissage (supervisé, non supervisé) et la nature des sorties (classification, régression). Des concepts tels que la matrice de confusion, la validation croisée et les métriques dérivées (précision, rappel, F1-score) sont également abordés pour assurer une évaluation rigoureuse des modèles.

Transféré par

y.ettouyjer9683
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
6 vues26 pages

Évaluation des modèles d'IA : Métriques clés

Le document traite de l'évaluation des modèles d'intelligence artificielle, en mettant l'accent sur l'importance de mesurer la performance et de comparer différents modèles. Il présente les différentes métriques d'évaluation selon le type d'apprentissage (supervisé, non supervisé) et la nature des sorties (classification, régression). Des concepts tels que la matrice de confusion, la validation croisée et les métriques dérivées (précision, rappel, F1-score) sont également abordés pour assurer une évaluation rigoureuse des modèles.

Transféré par

y.ettouyjer9683
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Module : Intelligence Artificielle Avancé

Évaluation des modèles d’intelligence artificielle

Pr. Oumaima STITINI


[Link]@[Link]
AU: 2025-2026
Introduction

L’évaluation d’un modèle d’intelligence artificielle (IA) permet de mesurer


sa performance, de comparer plusieurs modèles, et de s’assurer qu’il
généralise bien sur de nouvelles données.

Sans une évaluation rigoureuse, un modèle peut sembler:


q performant sur les données d’entraînement
q échouer complètement sur des données réelles

Phénomène d’overfitting
2
Introduction

Les métriques d’évaluation ne sont pas les mêmes selon le type


d’apprentissage et selon la nature de la sortie du modèle.

Non Supervisé
Le type
d’apprentissage
Catégorie
Supervisé
La nature de la Valeur Numérique
sortie du modèle
3
Pourquoi les métriques varient ?
Chaque modèle d’intelligence artificielle a un objectif différent :
q Certains doivent classer des objets dans des catégories,
q D’autres doivent prédire une valeur numérique,
q Et d’autres encore doivent découvrir des structures cachées sans étiquettes.

On ne peut pas utiliser les mêmes indicateurs pour:

Evaluer un Un modèle de Un algorithme


classifieur régression non supervisé.

4
Evaluation du modèle AI
Cas 1 — Apprentissage supervisé :
Classification

5
Du découpage du jeu de données à l’évaluation du
modèle
Avant de pouvoir évaluer un modèle d’intelligence artificielle, il faut disposer
d’un jeu de données bien structuré.

6
Du découpage du jeu de données à l’évaluation du
modèle
q Après l’apprentissage, le modèle utilise X_test pour faire ses prédictions.
q Ces prédictions sont enregistrées dans une variable appelée souvent y_pred.
Pour mesurer la qualité de ces prédictions, on les compare aux valeurs
réelles du test:
𝐲true = 𝐲test
𝐲true correspond aux vraies étiquettes du jeu de test.

𝐲test correspond aux valeurs prédites par le modèle.


7
Du découpage du jeu de données à l’évaluation du
modèle
q La comparaison entre y_true et y_pred permet alors de calculer la matrice de
confusion, à partir de laquelle on déduit :

Les Vrais Les Vrais Les Faux Les Faux


Positifs (TP). Négatifs (TN). Positifs (FP). Négatifs (FN).

Le nombre de Le nombre de Le nombre de Le nombre de


cas où: cas où: cas où: cas où:
y_true = 1 et y_true = 0 et y_true = 0 et y_true = 1 et
y_pred = 1 y_pred = 0 y_pred = 1 y_pred = 0
Métriques de classification
Matrice de confusion
q La matrice de confusion est la base de l’évaluation en classification
q Elle permet de comprendre ce que le modèle confond et dans quelle
proportion.
q La matrice de confusion est un tableau qui résume les prédictions d’un
modèle de classification en les comparant aux valeurs réelles.
q Elle permet de savoir:

ü Combien de prédictions sont correctes.


ü Où le modèle se trompe (quelles classes sont confondues).

9
Métriques de classification
Matrice de confusion
Exemple de matrice de confusion binaire

10
Métriques de classification
Matrice de confusion
Interprétation des cases

Les Vrais Les Vrais Les Faux Les Faux


Positifs (TP). Négatifs (TN). Positifs (FP). Négatifs (FN).

Cas positifs
Cas Cas Cas négatifs
mal prédits
correctement correctement mal prédits
comme
prédits positifs prédits négatifs comme positifs
négatifs
Types de problèmes et choix des métriques

12
Métriques de classification
Métriques dérivées
À partir des valeurs TP, TN, FP, FN, on calcule plusieurs mesures importantes:

Précision Rappel (Recall Exactitude globale


(Precision) F1-score
ou Sensibilité) (Accuracy)

13
Métriques de classification
Métriques dérivées: Précision

Exemple: si le modèle détecte 100 spams, mais 20 sont des faux positifs, la
précision est de 80%.

14
Métriques de classification
Métriques dérivées: Recall

Exemple: sur 100 spams réels, si le modèle en détecte 90, le rappel est de 0.9.

15
Métriques de classification
Métriques dérivées: F1-score

Exemple: Elle est utile quand il faut équilibrer les deux (ex. éviter à la fois faux
positifs et faux négatifs).

16
Métriques de classification
Métriques dérivées: Accuracy

Exemple: si 95 % des mails sont non-spam, un modèle qui prédit toujours


“non-spam” aura 95 % d’accuracy, mais ne détectera aucun spam.

17
Métriques de classification
Visualisation et interprétation
En pratique, la matrice de confusion est souvent représentée sous forme de heatmap :

Cette visualisation aide à :


q Repérer les classes les plus confondues.
q Identifier les erreurs dominantes.
q Guider les améliorations du modèle:

1. Ajouter des données


2. Equilibrer les classes

18
Métriques de classification
Matrice de confusion

q La matrice de confusion montre où le modèle se trompe.


q Elle permet de calculer toutes les métriques principales (accuracy,
precision, recall, F1).
q L’accuracy seule ne suffit pas, surtout si les classes sont déséquilibrées.
q En multi-classes, on interprète la diagonale comme les prédictions
correctes.
q C’est une technique indispensable pour l’évaluation d’un système d’IA de
classification.

19
Métriques de classification
Extension au cas multi-classes

20
Valaidation Croisée
Pourquoi la validation croisée ?
q Lorsqu’on évalue un modèle, on veut être sûr que ses performances ne dépendent
pas uniquement du découpage aléatoire entre le jeu d’entraînement et le jeu de
test.
q Un simple découpage train_test_split peut donner une évaluation biaisée, car
selon la répartition des données, le modèle peut sembler trop bon… ou trop mauvais.

q La validation croisée vient résoudre ce problème en répétant


l’apprentissage plusieurs fois sur différents sous-ensembles des données.
q Elle permet d’obtenir une moyenne plus fiable de la performance réelle du
modèle.
21
Valaidation Croisée
Principe général

L’idée est simple :


1. on divise le jeu de données en k sous-ensembles (appelés folds).
2. Puis on entraîne et teste le modèle k fois :
à chaque itération :
q On choisit un fold pour le test,
q et les (k-1) autres pour l’entraînement.
On calcule ensuite la moyenne des scores (accuracy, RMSE, etc.) sur les k
itérations.

22
Valaidation Croisée
Exemple illustré : Validation croisée à 5 plis (k=5)

23
Valaidation Croisée
Avantages

Évaluation plus robuste et stable.

Exploite tout le jeu de données (chaque observation est utilisée à


la fois pour l’entraînement et pour le test).

Réduit le risque de surapprentissage (overfitting) dû à un seul


découpage.
24
Evaluation du modèle AI
Cas 2 — Apprentissage supervisé :
Régression

25
Evaluation du modèle AI
Cas 3 — Apprentissage non supervisé

26

Vous aimerez peut-être aussi