0% ont trouvé ce document utile (0 vote)
12 vues6 pages

Fiche de Révision - Machine Learning (QCM) : 1. CRISP-DM (Processus)

Le document présente une fiche de révision sur le machine learning, incluant la méthodologie CRISP-DM, les différences entre apprentissage supervisé et non supervisé, ainsi que des techniques de préparation des données. Il aborde également des algorithmes spécifiques tels que KNN, SVM, et des méthodes de clustering comme K-Means et DBSCAN, tout en détaillant les métriques d'évaluation des modèles. Enfin, il souligne l'importance de la gestion des données manquantes et des valeurs aberrantes dans le processus de data science.

Transféré par

Lina Hadidi
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
12 vues6 pages

Fiche de Révision - Machine Learning (QCM) : 1. CRISP-DM (Processus)

Le document présente une fiche de révision sur le machine learning, incluant la méthodologie CRISP-DM, les différences entre apprentissage supervisé et non supervisé, ainsi que des techniques de préparation des données. Il aborde également des algorithmes spécifiques tels que KNN, SVM, et des méthodes de clustering comme K-Means et DBSCAN, tout en détaillant les métriques d'évaluation des modèles. Enfin, il souligne l'importance de la gestion des données manquantes et des valeurs aberrantes dans le processus de data science.

Transféré par

Lina Hadidi
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

📊 FICHE DE RÉVISION - MACHINE LEARNING (QCM)

1. CRISP-DM (Processus)

●​ Définition : Méthodologie standard pour les projets de data science.


●​ Phases (ordre) :
○​ Compréhension métier (Business Understanding)
○​ Compréhension des données (Data Understanding) -> Cest ici quon fait
l’analyse exploratoire (EDA)
○​ Préparation des données (Data Preparation)
○​ Modélisation (Modeling)
○​ Évaluation (Evaluation)
○​ Déploiement (Deployment)


●​ Caractéristique clé (PIÈGE QCM) :


○​ FAUX : Cest un processus linéaire et séquentiel.
○​ VRAI : Cest un processus itératif (on peut revenir en arrière) et
adaptable.

2. APPRENTISSAGE : SUPERVISÉ vs NON SUPERVISÉ

Critère Supervisé Non Supervisé

Données Étiquetées (avec variable cible Non étiquetées (pas de Y).


Y).

Objectif Prédire une valeur/classe. Découvrir une


structure/cachee.

Exemples Régression, Classification Clustering (K-Means,


(KNN, SVM, Arbres). DBSCAN), ACP.
3. PRÉPARATION DES DONNÉES (Data Prep)

Cœur du nettoyage et transformation.

Valeurs manquantes

●​ Imputation : Remplacer par une valeur estimée (moyenne, médiane, mode).


●​ À ne pas faire : Supprimer toutes les lignes automatiquement.

Valeurs aberrantes (Outliers)

●​ Technique adaptée : Détection et remplacement par des valeurs plausibles.


●​ Alternative : Transformation logarithmique pour réduire l’impact.

Variables catégorielles

●​ One-Hot Encoding : Créer une colonne binaire par modalité (le plus courant).
●​ Label Encoding : Assigner un chiffre (attention, peut créer un ordre artificiel).

Mise à l'échelle (Feature Scaling)

●​ Pourquoi ? Éviter qu’une variable domine le calcul des distances.


●​ Normalisation (MinMaxScaler) : Met les données dans un intervalle [0, 1].
●​ Standardisation : Centre les données (moyenne=0, écart-type=1).

Réduction de dimensionnalité

●​ Avantage : Améliore la visualisation et la compréhension.


●​ Inconvénient (feature selection) : Risque de perdre des informations
importantes.

4. ACP (Analyse en Composantes Principales)

●​ Type : Non supervisé.


●​ But : Réduire la dimensionnalité en créant de nouvelles variables (les
composantes principales) qui résument l’information.
●​ Principe : Projeter les données sur des axes qui maximisent la variance.

5. MÉTRIQUES D'ÉVALUATION

La Matrice de Confusion

Prédit POSITIF Prédit NEGATIF

Réel POSITIF VP (Vrai Positif) FN (Faux Négatif)

Réel NEGATIF FP (Faux Positif) VN (Vrai Négatif)

Les Formules à connaître

●​ Accuracy (Taux de bonne classification) : (VP + VN) / (Total)


●​ Précision : VP / (VP + FP)
●​ Rappel (Sensibilité) : VP / (VP + FN)
●​ F1-Score : Moyenne harmonique de Précision et Rappel.

Courbe ROC et AUC

●​ AUC-ROC : Mesure la capacité du modèle à distinguer entre les classes.


●​ Valeur : Entre 0.5 (modèle = hasard) et 1 (modèle parfait).
●​ Interprétation :
○​ AUC élevée en train, faible en test = Overfitting.
○​ Courbe proche de la diagonale = Prédictions aléatoires.

6. KNN (K-Nearest Neighbors)

●​ Type : Supervisé (classification ou régression).


●​ Principe : Un point est classé selon la majorité de ses K voisins.
●​ Phase coûteuse : La phase de test (car on calcule toutes les distances).
●​ K trop petit : Modèle sensible au bruit, risque d’overfitting.
●​ K trop grand : Lissage excessif, modèle moins performant.
●​ Inconvénients :
○​ Sensible aux features non pertinentes.
○​ Lent sur les grands jeux de données.
○​ Non recommandé en grande dimension.

7. SVM (Support Vector Machine)

●​ Type : Supervisé (classification principalement).


●​ But : Trouver l’hyperplan qui maximise la marge entre les classes.
●​ Marge : Distance entre l’hyperplan et les échantillons les plus proches (les
vecteurs supports).
●​ Problèmes non linéaires : On utilise les fonctions noyau (kernels).
●​ Sensibilité : Très sensible aux outliers.
●​ Marge étroite : Risque d’overfitting.

8. ARBRES DE DÉCISION

●​ Type : Supervisé (classification/régression).


●​ Objectif des splits : Minimiser l’hétérogénéité (impureté) des nœuds.
●​ Indice de Gini = 0 : Nœud parfaitement pur.
●​ Problèmes :
○​ Instables : sensibles aux petites variations.
○​ Overfitting : surtout si l’arbre est trop profond.
●​ Solutions : Limiter la profondeur, élagage, random forest.

9. CLUSTERING : K-MEANS

●​ Type : Non supervisé.


●​ Principe : Partitionne les données en K groupes (clusters).
●​ Fonctionnement :
1.​ Choisir K centres aléatoirement.
2.​ Assigner chaque point au centre le plus proche.
3.​ Recalculer les centres (centroïdes).
4.​ Répéter jusqu’à convergence.
●​ Paramètre clé : Le nombre K de clusters (à définir avant).
●​ Limite : Sensible aux valeurs aberrantes et à la forme sphérique des clusters.

10. CLUSTERING : DBSCAN

●​ Type : Non supervisé.


●​ Principe : Algorithme basé sur la densité.
●​ Avantages :
○​ Trouve des clusters de forme arbitraire.
○​ Résistant aux outliers (il les identifie comme du bruit).
○​ N’a pas besoin de spécifier le nombre de clusters à l’avance.
●​ Paramètres : eps (rayon) et minPts (nombre minimum de points).

✅ Récapitulatif "Quel Algo pour Quel Problème ?

Vous aimerez peut-être aussi