0% ont trouvé ce document utile (0 vote)
6 vues2 pages

02 Machine Learning Algorithmes

Ce document présente une référence technique sur les algorithmes et méthodes de machine learning, incluant les types d'apprentissage tels que supervisé, non supervisé, semi-supervisé et par renforcement. Il décrit également des algorithmes fondamentaux comme la régression linéaire et les forêts aléatoires, ainsi que les métriques d'évaluation pertinentes. Enfin, il propose un pipeline complet pour le machine learning et liste des ressources et bibliothèques utiles pour la mise en œuvre.

Transféré par

oda.saci
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
6 vues2 pages

02 Machine Learning Algorithmes

Ce document présente une référence technique sur les algorithmes et méthodes de machine learning, incluant les types d'apprentissage tels que supervisé, non supervisé, semi-supervisé et par renforcement. Il décrit également des algorithmes fondamentaux comme la régression linéaire et les forêts aléatoires, ainsi que les métriques d'évaluation pertinentes. Enfin, il propose un pipeline complet pour le machine learning et liste des ressources et bibliothèques utiles pour la mise en œuvre.

Transféré par

oda.saci
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Machine Learning

Algorithmes & Méthodes


Référence Technique — Data Science

Auteur : Dr. A. Mansouri | Version : 1.7 | Mai 2026

1. Types d'Apprentissage
Type Description Exemples d'algorithmes

Supervisé Données étiquetées, prédiction de sortiesRégression, SVM, Forêts aléatoires

Non supervisé Données non étiquetées, découverte de structuresK-Means, DBSCAN, PCA

Semi-supervisé Mélange de données étiquetées/non étiquetées


Label Propagation, Self-Training

Par renforcement Agent apprenant par essais-erreurs et récompenses Q-Learning, PPO, A3C

2. Algorithmes Fondamentaux
2.1 Régression Linéaire
La régression linéaire modélise la relation entre une variable dépendante y et une ou plusieurs variables
indépendantes X. Le modèle cherche à minimiser l'erreur quadratique moyenne (MSE).

# Implémentation avec scikit-learn from sklearn.linear_model import LinearRegression


from sklearn.model_selection import train_test_split from [Link] import
mean_squared_error X_train, X_test, y_train, y_test = train_test_split(X, y,
test_size=0.2) model = LinearRegression() [Link](X_train, y_train) y_pred =
[Link](X_test) mse = mean_squared_error(y_test, y_pred)

2.2 Forêts Aléatoires (Random Forest)


Ensemble de nombreux arbres de décision entraînés sur des sous-ensembles aléatoires des données.
Très robuste au sur-apprentissage et performant sur de nombreux problèmes réels.

n_estimators Nombre d'arbres dans la forêt (défaut : 100)

max_depth Profondeur maximale de chaque arbre


min_samples_split Nombre minimum d'échantillons pour diviser un nœud

max_features Nombre de features considérées à chaque division

bootstrap Utiliser ou non le rééchantillonnage Bootstrap

3. Métriques d'Évaluation
Métrique Formule Usage Interprétation

Accuracy TP+TN / Total Classification Plus proche de 1 = mieux

Précision TP / (TP+FP) Classification Évite les faux positifs

Rappel TP / (TP+FN) Classification Évite les faux négatifs

F1-Score 2*(P*R)/(P+R) Classification Équilibre précision/rappel

MSE mean((y-y_pred)^2) Régression Erreur quadratique (bas = mieux)

R² 1 - SS_res/SS_tot Régression 0 à 1 (1 = parfait)

4. Pipeline Complet ML
1. Collecte des données — Acquisition depuis API, BDD, fichiers CSV/JSON
2. Exploration (EDA) — Visualisation, distributions, corrélations, valeurs manquantes
3. Prétraitement — Normalisation, encodage, imputation, sélection de features
4. Modélisation — Choix de l'algorithme, entraînement, validation croisée
5. Évaluation — Métriques sur jeu de test, matrices de confusion, courbes ROC
6. Déploiement — Export du modèle (pickle/ONNX), API REST, monitoring

5. Ressources & Bibliothèques


Bibliothèque Version stable Usage principal

scikit-learn 1.4.x ML classique, preprocessing, métriques

XGBoost 2.0.x Gradient boosting haute performance

LightGBM 4.x Gradient boosting rapide pour grands datasets

TensorFlow 2.15.x Deep learning, production Google

PyTorch 2.2.x Deep learning, recherche, flexibilité

pandas 2.2.x Manipulation de données tabulaires

matplotlib/seaborn 3.8.x / 0.13.x Visualisation de données

Vous aimerez peut-être aussi