MACHINE LEARNING · GUIDE PRATIQUE 1/2
Machine Learning
Supervisé, non-supervisé, modèles et évaluation — les fondamentaux
Les 3 types d'apprentissage
Type Principe Exemples d'algorithmes
Apprend depuis des données étiquetées (X → Y
Supervisé Régression, SVM, Random Forest
connu)
Trouve des structures dans des données sans
Non supervisé K-Means, PCA, DBSCAN
étiquettes
Agent apprend via récompenses/pénalités dans
Par renforcement Q-Learning, PPO, AlphaGo
un environnement
Algorithmes supervisés — comparaison
Algorithme Type de tâche Avantage Limite
Régression linéaire Régression Simple, interprétable Relations non-linéaires
Régression logistique Classification Rapide, probabilités Frontière linéaire
Decision Tree Les deux Interprétable Sur-apprentissage
Random Forest Les deux Robuste, précis Lent à entraîner
Lent sur grandes
SVM Classification Haute dimension
données
Réseau de neurones Les deux Très puissant Boîte noire, données++
Document éducatif · MACHINE LEARNING · GUIDE PRATIQUE © 2025
MACHINE LEARNING · GUIDE PRATIQUE 2/2
Pipeline ML type en Python (scikit-learn)
from sklearn.model_selection import train_test_split
from [Link] import RandomForestClassifier
from [Link] import accuracy_score
import pandas as pd
# 1. Charger les données
df = pd.read_csv('[Link]')
X, y = [Link]('cible', axis=1), df['cible']
# 2. Séparer train/test
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
# 3. Entraîner
model = RandomForestClassifier(n_estimators=100)
[Link](X_train, y_train)
# 4. Évaluer
predictions = [Link](X_test)
print('Accuracy:', accuracy_score(y_test, predictions))
Métriques d'évaluation
Métrique Formule simplifiée Quand l'utiliser
Accuracy Bons / Total Classes équilibrées
Precision Vrais+ / (Vrais+ + Faux+) Coût des fausses alarmes élevé
Recall Vrais+ / (Vrais+ + Faux-) Coût des ratés élevé (médecine)
Moyenne harmonique
F1-Score Classes déséquilibrées
Precision/Recall
RMSE Racine de l'erreur quadratique Tâches de régression
À retenir : le ML n'est pas de la magie — c'est de l'optimisation mathématique sur des données. 80% du
travail est dans la préparation des données (data cleaning). Un bon dataset + un modèle simple > un
modèle complexe + données médiocres.
Document éducatif · MACHINE LEARNING · GUIDE PRATIQUE © 2025