Machine Learning
Algorithmes & Méthodes
Référence Technique — Data Science
Auteur : Dr. A. Mansouri | Version : 1.7 | Mai 2026
1. Types d'Apprentissage
Type Description Exemples d'algorithmes
Supervisé Données étiquetées, prédiction de sortiesRégression, SVM, Forêts aléatoires
Non supervisé Données non étiquetées, découverte de structuresK-Means, DBSCAN, PCA
Semi-supervisé Mélange de données étiquetées/non étiquetées
Label Propagation, Self-Training
Par renforcement Agent apprenant par essais-erreurs et récompenses Q-Learning, PPO, A3C
2. Algorithmes Fondamentaux
2.1 Régression Linéaire
La régression linéaire modélise la relation entre une variable dépendante y et une ou plusieurs variables
indépendantes X. Le modèle cherche à minimiser l'erreur quadratique moyenne (MSE).
# Implémentation avec scikit-learn from sklearn.linear_model import LinearRegression
from sklearn.model_selection import train_test_split from [Link] import
mean_squared_error X_train, X_test, y_train, y_test = train_test_split(X, y,
test_size=0.2) model = LinearRegression() [Link](X_train, y_train) y_pred =
[Link](X_test) mse = mean_squared_error(y_test, y_pred)
2.2 Forêts Aléatoires (Random Forest)
Ensemble de nombreux arbres de décision entraînés sur des sous-ensembles aléatoires des données.
Très robuste au sur-apprentissage et performant sur de nombreux problèmes réels.
n_estimators Nombre d'arbres dans la forêt (défaut : 100)
max_depth Profondeur maximale de chaque arbre
min_samples_split Nombre minimum d'échantillons pour diviser un nœud
max_features Nombre de features considérées à chaque division
bootstrap Utiliser ou non le rééchantillonnage Bootstrap
3. Métriques d'Évaluation
Métrique Formule Usage Interprétation
Accuracy TP+TN / Total Classification Plus proche de 1 = mieux
Précision TP / (TP+FP) Classification Évite les faux positifs
Rappel TP / (TP+FN) Classification Évite les faux négatifs
F1-Score 2*(P*R)/(P+R) Classification Équilibre précision/rappel
MSE mean((y-y_pred)^2) Régression Erreur quadratique (bas = mieux)
R² 1 - SS_res/SS_tot Régression 0 à 1 (1 = parfait)
4. Pipeline Complet ML
1. Collecte des données — Acquisition depuis API, BDD, fichiers CSV/JSON
2. Exploration (EDA) — Visualisation, distributions, corrélations, valeurs manquantes
3. Prétraitement — Normalisation, encodage, imputation, sélection de features
4. Modélisation — Choix de l'algorithme, entraînement, validation croisée
5. Évaluation — Métriques sur jeu de test, matrices de confusion, courbes ROC
6. Déploiement — Export du modèle (pickle/ONNX), API REST, monitoring
5. Ressources & Bibliothèques
Bibliothèque Version stable Usage principal
scikit-learn 1.4.x ML classique, preprocessing, métriques
XGBoost 2.0.x Gradient boosting haute performance
LightGBM 4.x Gradient boosting rapide pour grands datasets
TensorFlow 2.15.x Deep learning, production Google
PyTorch 2.2.x Deep learning, recherche, flexibilité
pandas 2.2.x Manipulation de données tabulaires
matplotlib/seaborn 3.8.x / 0.13.x Visualisation de données