📊 FICHE DE RÉVISION - MACHINE LEARNING (QCM)
1. CRISP-DM (Processus)
● Définition : Méthodologie standard pour les projets de data science.
● Phases (ordre) :
○ Compréhension métier (Business Understanding)
○ Compréhension des données (Data Understanding) -> Cest ici quon fait
l’analyse exploratoire (EDA)
○ Préparation des données (Data Preparation)
○ Modélisation (Modeling)
○ Évaluation (Evaluation)
○ Déploiement (Deployment)
❌
● Caractéristique clé (PIÈGE QCM) :
✅
○ FAUX : Cest un processus linéaire et séquentiel.
○ VRAI : Cest un processus itératif (on peut revenir en arrière) et
adaptable.
2. APPRENTISSAGE : SUPERVISÉ vs NON SUPERVISÉ
Critère Supervisé Non Supervisé
Données Étiquetées (avec variable cible Non étiquetées (pas de Y).
Y).
Objectif Prédire une valeur/classe. Découvrir une
structure/cachee.
Exemples Régression, Classification Clustering (K-Means,
(KNN, SVM, Arbres). DBSCAN), ACP.
3. PRÉPARATION DES DONNÉES (Data Prep)
Cœur du nettoyage et transformation.
Valeurs manquantes
● Imputation : Remplacer par une valeur estimée (moyenne, médiane, mode).
● À ne pas faire : Supprimer toutes les lignes automatiquement.
Valeurs aberrantes (Outliers)
● Technique adaptée : Détection et remplacement par des valeurs plausibles.
● Alternative : Transformation logarithmique pour réduire l’impact.
Variables catégorielles
● One-Hot Encoding : Créer une colonne binaire par modalité (le plus courant).
● Label Encoding : Assigner un chiffre (attention, peut créer un ordre artificiel).
Mise à l'échelle (Feature Scaling)
● Pourquoi ? Éviter qu’une variable domine le calcul des distances.
● Normalisation (MinMaxScaler) : Met les données dans un intervalle [0, 1].
● Standardisation : Centre les données (moyenne=0, écart-type=1).
Réduction de dimensionnalité
● Avantage : Améliore la visualisation et la compréhension.
● Inconvénient (feature selection) : Risque de perdre des informations
importantes.
4. ACP (Analyse en Composantes Principales)
● Type : Non supervisé.
● But : Réduire la dimensionnalité en créant de nouvelles variables (les
composantes principales) qui résument l’information.
● Principe : Projeter les données sur des axes qui maximisent la variance.
5. MÉTRIQUES D'ÉVALUATION
La Matrice de Confusion
Prédit POSITIF Prédit NEGATIF
Réel POSITIF VP (Vrai Positif) FN (Faux Négatif)
Réel NEGATIF FP (Faux Positif) VN (Vrai Négatif)
Les Formules à connaître
● Accuracy (Taux de bonne classification) : (VP + VN) / (Total)
● Précision : VP / (VP + FP)
● Rappel (Sensibilité) : VP / (VP + FN)
● F1-Score : Moyenne harmonique de Précision et Rappel.
Courbe ROC et AUC
● AUC-ROC : Mesure la capacité du modèle à distinguer entre les classes.
● Valeur : Entre 0.5 (modèle = hasard) et 1 (modèle parfait).
● Interprétation :
○ AUC élevée en train, faible en test = Overfitting.
○ Courbe proche de la diagonale = Prédictions aléatoires.
6. KNN (K-Nearest Neighbors)
● Type : Supervisé (classification ou régression).
● Principe : Un point est classé selon la majorité de ses K voisins.
● Phase coûteuse : La phase de test (car on calcule toutes les distances).
● K trop petit : Modèle sensible au bruit, risque d’overfitting.
● K trop grand : Lissage excessif, modèle moins performant.
● Inconvénients :
○ Sensible aux features non pertinentes.
○ Lent sur les grands jeux de données.
○ Non recommandé en grande dimension.
7. SVM (Support Vector Machine)
● Type : Supervisé (classification principalement).
● But : Trouver l’hyperplan qui maximise la marge entre les classes.
● Marge : Distance entre l’hyperplan et les échantillons les plus proches (les
vecteurs supports).
● Problèmes non linéaires : On utilise les fonctions noyau (kernels).
● Sensibilité : Très sensible aux outliers.
● Marge étroite : Risque d’overfitting.
8. ARBRES DE DÉCISION
● Type : Supervisé (classification/régression).
● Objectif des splits : Minimiser l’hétérogénéité (impureté) des nœuds.
● Indice de Gini = 0 : Nœud parfaitement pur.
● Problèmes :
○ Instables : sensibles aux petites variations.
○ Overfitting : surtout si l’arbre est trop profond.
● Solutions : Limiter la profondeur, élagage, random forest.
9. CLUSTERING : K-MEANS
● Type : Non supervisé.
● Principe : Partitionne les données en K groupes (clusters).
● Fonctionnement :
1. Choisir K centres aléatoirement.
2. Assigner chaque point au centre le plus proche.
3. Recalculer les centres (centroïdes).
4. Répéter jusqu’à convergence.
● Paramètre clé : Le nombre K de clusters (à définir avant).
● Limite : Sensible aux valeurs aberrantes et à la forme sphérique des clusters.
10. CLUSTERING : DBSCAN
● Type : Non supervisé.
● Principe : Algorithme basé sur la densité.
● Avantages :
○ Trouve des clusters de forme arbitraire.
○ Résistant aux outliers (il les identifie comme du bruit).
○ N’a pas besoin de spécifier le nombre de clusters à l’avance.
● Paramètres : eps (rayon) et minPts (nombre minimum de points).
✅ Récapitulatif "Quel Algo pour Quel Problème ?