1️⃣ Intelligence Artificielle (IA)
Définition
👉 L’IA regroupe toutes les techniques qui permettent à une machine
d’imiter certaines capacités humaines :
● raisonner
● apprendre
● décider
● créer
Exemples
● Reconnaissance faciale
● Recommandation Netflix
● ChatGPT
● Voitures autonomes
2️⃣ Machine Learning (ML)
Définition
👉 Le Machine Learning permet à une machine d’apprendre à partir des données,
sans être programmée explicitement.
📌 Au lieu de dire :
“SI âge > 18 ALORS adulte”
👉 On donne des données + réponses, la machine découvre la règle toute seule.
🔹 Types de Machine Learning
3️⃣ Apprentissage supervisé
Principe
👉 On donne à la machine :
● les données
● les bonnes réponses
📦 Exemple dataset :
Age Salaire Achet
e
25 2000 Oui
40 5000 Oui
18 800 Non
👉 Achete = Target (cible)
👉 Age + Salaire = Features
🔸 Classification
👉 La sortie est une classe
Exemples :
● Spam / Non spam
● Malade / Sain
● Oui / Non
🔸 Régression
👉 La sortie est une valeur numérique
Exemples :
● Prix d’une maison
● Température
● Chiffre d’affaires
4️⃣ Apprentissage non supervisé
Principe
👉 On donne uniquement les données,
❌ pas les réponses
La machine cherche des structures cachées.
🔸 Clustering (regroupement)
Exemple :
● Regrouper des clients selon leurs comportements
● Groupes : clients riches / moyens / faibles
🔸 Détection d’anomalies
Exemple :
● Transactions bancaires suspectes
● Pannes industrielles
5️⃣ Dataset – notions essentielles
📌 Target (cible)
👉 Ce qu’on veut prédire
Exemples :
● Classe (Oui / Non)
● Prix
● Catégorie
📌 Features (caractéristiques)
👉 Les informations utilisées pour prédire
Exemple :
● âge
● salaire
● niveau d’éducation
📌 Échantillon (instance)
👉 Une ligne complète du dataset
(données + réponse)
6️⃣ Pipeline Machine Learning
Un projet ML suit toujours ces étapes :
1. Collecte des données
2. Nettoyage (valeurs manquantes, erreurs)
3. Feature engineering
4. Séparation Train / Test
5. Entraînement
6. Prédiction
7. Évaluation
8. Déploiement
7️⃣ CRISP-DM (méthode projet)
Méthode officielle et très demandée à l’examen :
1️⃣ Compréhension métier
2️⃣ Compréhension des données
3️⃣ Préparation des données
4️⃣ Modélisation
5️⃣ Évaluation
6️⃣ Déploiement
8️⃣ KNN – k Nearest Neighbors
🔹 Principe
👉 Pour classer une nouvelle donnée :
1. Chercher ses k voisins les plus proches
2. Regarder leurs classes
3. Appliquer un vote majoritaire
🔹 Exemple simple
Supposons :
● k = 3
● 3 voisins les plus proches :
○ Oui
○ Oui
○ Non
👉 Classe prédite = Oui
🔹 Distance euclidienne
d(x,y)=(x1−y1)2+(x2−y2)2d(x,y) = \sqrt{(x_1-y_1)^2 + (x_2-y_2)^2}d(x,y)=(x1−y1)2+(x2−y2)2
Exemple concret
Client 1 :
● Age = 34
● Income = 190
● Education = 3
Client 2 :
● Age = 30
● Income = 200
● Education = 8
d=(34−30)2+(190−200)2+(3−8)2d = \sqrt{(34-30)^2 + (190-200)^2 +
(3-8)^2}d=(34−30)2+(190−200)2+(3−8)2
⚠️ Important pour KNN
● Sensible aux échelles
● Il faut normaliser les données
● k trop petit → bruit
● k trop grand → perte de précision
9️⃣ Arbres de Décision
🔹 Principe
👉 Modèle sous forme de questions successives
Exemple :
Age < 25 ?
├─ Oui → Refus
└─ Non → Salaire > 3000 ?
├─ Oui → Accepté
└─ Non → Refus
🔹 Composants
● Racine (première question)
● Nœuds internes (tests)
● Feuilles (classe finale)
🔹 Avantages
✔ Facile à comprendre
✔ Interprétable
✔ Peu de prétraitement
🔹 Inconvénients
❌ Surapprentissage
❌ Instable
1️⃣0️⃣ Impureté – Entropie
🔹 Intuition
👉 Mesure le désordre dans un groupe
● Groupe pur → entropie = 0
● Groupe mélangé → entropie élevée
🔹 Formule
H=−∑p(ck)log2(p(ck))H = -\sum p(c_k)\log_2(p(c_k))H=−∑p(ck)log2(p(ck))
Exemple
3 classes :
● Setosa : 3/7
● Versicolor : 3/7
● Virginica : 1/7
👉 Entropie élevée → groupe mélangé
1️⃣1️⃣ Indice de Gini
🔹 Définition
Mesure d’impureté utilisée par CART
Gini=1−∑p(ck)2Gini = 1 - \sum p(c_k)^2Gini=1−∑p(ck)2
Exemple
Classes :
● Oui : 3/7
● Non : 4/7
Gini=1−(3/7)2−(4/7)2Gini = 1 - (3/7)^2 - (4/7)^2Gini=1−(3/7)2−(4/7)2
🔹 Interprétation
● Gini = 0 → pur
● Gini proche de 1 → impur
1️⃣2️⃣ Construction d’un arbre (CART)
Étapes
1️⃣ Tester chaque attribut
2️⃣ Calculer Gini pour chaque split
3️⃣ Choisir le split avec gain max
4️⃣ Répéter sur chaque sous-groupe
5️⃣ Arrêter quand les feuilles sont pures
1️⃣3️⃣ Évaluation du modèle
🔹 Matrice de confusion
Prédit Oui Prédit Non
Réel Oui TP FN
Réel Non FP TN
🔹 Taux d’erreur
Erreur=mal classeˊstotal\text{Erreur} = \frac{\text{mal classés}}{\text{total}}Erreur=totalmal
classeˊs