Module : Intelligence Artificielle Avancé
Évaluation des modèles d’intelligence artificielle
Pr. Oumaima STITINI
[Link]@[Link]
AU: 2025-2026
Introduction
L’évaluation d’un modèle d’intelligence artificielle (IA) permet de mesurer
sa performance, de comparer plusieurs modèles, et de s’assurer qu’il
généralise bien sur de nouvelles données.
Sans une évaluation rigoureuse, un modèle peut sembler:
q performant sur les données d’entraînement
q échouer complètement sur des données réelles
Phénomène d’overfitting
2
Introduction
Les métriques d’évaluation ne sont pas les mêmes selon le type
d’apprentissage et selon la nature de la sortie du modèle.
Non Supervisé
Le type
d’apprentissage
Catégorie
Supervisé
La nature de la Valeur Numérique
sortie du modèle
3
Pourquoi les métriques varient ?
Chaque modèle d’intelligence artificielle a un objectif différent :
q Certains doivent classer des objets dans des catégories,
q D’autres doivent prédire une valeur numérique,
q Et d’autres encore doivent découvrir des structures cachées sans étiquettes.
On ne peut pas utiliser les mêmes indicateurs pour:
Evaluer un Un modèle de Un algorithme
classifieur régression non supervisé.
4
Evaluation du modèle AI
Cas 1 — Apprentissage supervisé :
Classification
5
Du découpage du jeu de données à l’évaluation du
modèle
Avant de pouvoir évaluer un modèle d’intelligence artificielle, il faut disposer
d’un jeu de données bien structuré.
6
Du découpage du jeu de données à l’évaluation du
modèle
q Après l’apprentissage, le modèle utilise X_test pour faire ses prédictions.
q Ces prédictions sont enregistrées dans une variable appelée souvent y_pred.
Pour mesurer la qualité de ces prédictions, on les compare aux valeurs
réelles du test:
𝐲true = 𝐲test
𝐲true correspond aux vraies étiquettes du jeu de test.
𝐲test correspond aux valeurs prédites par le modèle.
7
Du découpage du jeu de données à l’évaluation du
modèle
q La comparaison entre y_true et y_pred permet alors de calculer la matrice de
confusion, à partir de laquelle on déduit :
Les Vrais Les Vrais Les Faux Les Faux
Positifs (TP). Négatifs (TN). Positifs (FP). Négatifs (FN).
Le nombre de Le nombre de Le nombre de Le nombre de
cas où: cas où: cas où: cas où:
y_true = 1 et y_true = 0 et y_true = 0 et y_true = 1 et
y_pred = 1 y_pred = 0 y_pred = 1 y_pred = 0
Métriques de classification
Matrice de confusion
q La matrice de confusion est la base de l’évaluation en classification
q Elle permet de comprendre ce que le modèle confond et dans quelle
proportion.
q La matrice de confusion est un tableau qui résume les prédictions d’un
modèle de classification en les comparant aux valeurs réelles.
q Elle permet de savoir:
ü Combien de prédictions sont correctes.
ü Où le modèle se trompe (quelles classes sont confondues).
9
Métriques de classification
Matrice de confusion
Exemple de matrice de confusion binaire
10
Métriques de classification
Matrice de confusion
Interprétation des cases
Les Vrais Les Vrais Les Faux Les Faux
Positifs (TP). Négatifs (TN). Positifs (FP). Négatifs (FN).
Cas positifs
Cas Cas Cas négatifs
mal prédits
correctement correctement mal prédits
comme
prédits positifs prédits négatifs comme positifs
négatifs
Types de problèmes et choix des métriques
12
Métriques de classification
Métriques dérivées
À partir des valeurs TP, TN, FP, FN, on calcule plusieurs mesures importantes:
Précision Rappel (Recall Exactitude globale
(Precision) F1-score
ou Sensibilité) (Accuracy)
13
Métriques de classification
Métriques dérivées: Précision
Exemple: si le modèle détecte 100 spams, mais 20 sont des faux positifs, la
précision est de 80%.
14
Métriques de classification
Métriques dérivées: Recall
Exemple: sur 100 spams réels, si le modèle en détecte 90, le rappel est de 0.9.
15
Métriques de classification
Métriques dérivées: F1-score
Exemple: Elle est utile quand il faut équilibrer les deux (ex. éviter à la fois faux
positifs et faux négatifs).
16
Métriques de classification
Métriques dérivées: Accuracy
Exemple: si 95 % des mails sont non-spam, un modèle qui prédit toujours
“non-spam” aura 95 % d’accuracy, mais ne détectera aucun spam.
17
Métriques de classification
Visualisation et interprétation
En pratique, la matrice de confusion est souvent représentée sous forme de heatmap :
Cette visualisation aide à :
q Repérer les classes les plus confondues.
q Identifier les erreurs dominantes.
q Guider les améliorations du modèle:
1. Ajouter des données
2. Equilibrer les classes
18
Métriques de classification
Matrice de confusion
q La matrice de confusion montre où le modèle se trompe.
q Elle permet de calculer toutes les métriques principales (accuracy,
precision, recall, F1).
q L’accuracy seule ne suffit pas, surtout si les classes sont déséquilibrées.
q En multi-classes, on interprète la diagonale comme les prédictions
correctes.
q C’est une technique indispensable pour l’évaluation d’un système d’IA de
classification.
19
Métriques de classification
Extension au cas multi-classes
20
Valaidation Croisée
Pourquoi la validation croisée ?
q Lorsqu’on évalue un modèle, on veut être sûr que ses performances ne dépendent
pas uniquement du découpage aléatoire entre le jeu d’entraînement et le jeu de
test.
q Un simple découpage train_test_split peut donner une évaluation biaisée, car
selon la répartition des données, le modèle peut sembler trop bon… ou trop mauvais.
q La validation croisée vient résoudre ce problème en répétant
l’apprentissage plusieurs fois sur différents sous-ensembles des données.
q Elle permet d’obtenir une moyenne plus fiable de la performance réelle du
modèle.
21
Valaidation Croisée
Principe général
L’idée est simple :
1. on divise le jeu de données en k sous-ensembles (appelés folds).
2. Puis on entraîne et teste le modèle k fois :
à chaque itération :
q On choisit un fold pour le test,
q et les (k-1) autres pour l’entraînement.
On calcule ensuite la moyenne des scores (accuracy, RMSE, etc.) sur les k
itérations.
22
Valaidation Croisée
Exemple illustré : Validation croisée à 5 plis (k=5)
23
Valaidation Croisée
Avantages
Évaluation plus robuste et stable.
Exploite tout le jeu de données (chaque observation est utilisée à
la fois pour l’entraînement et pour le test).
Réduit le risque de surapprentissage (overfitting) dû à un seul
découpage.
24
Evaluation du modèle AI
Cas 2 — Apprentissage supervisé :
Régression
25
Evaluation du modèle AI
Cas 3 — Apprentissage non supervisé
26