Module 1 - Introduction et Fondations du Machine Learning
Auteur : Copilot
Duree estimee : 1 semaine (6-10 h)
Resume : Ce module introduit les bases du Machine Learning, les types d'apprentissage, le pipeline
ML, les fondements mathematiques, l'exploration de donnees (EDA) et la preparation des donnees.
Il constitue la premiere etape du parcours professionnel en ML.
Resume du module
Ce module constitue l'introduction fondamentale au parcours Machine Learning. Il pose les bases
necessaires pour comprendre les types d'apprentissage, le cycle de vie d'un projet ML, les outils de
preparation des donnees et les notions mathematiques essentielles. Il prepare l'apprenant a
manipuler un jeu de donnees reel et a construire un pipeline de traitement reproductible.
Objectifs pedagogiques
- Comprendre les types d'apprentissage (supervise, non supervise, renforcement)
- Identifier les etapes d'un pipeline ML
- Realiser une EDA simple
- Appliquer les techniques de nettoyage, encodage, scaling
- Utiliser scikit-learn pour construire un pipeline de preprocessing
- Comprendre les bases mathematiques (esperance, variance, gradient)
Prerequis et installation
Prerequis : Python, statistiques de base, algebra lineaire.
Installation rapide :
Via conda :
conda create -n ml_env python=3.9 -y
conda activate ml_env
pip install numpy pandas scikit-learn matplotlib seaborn jupyter
Via pip :
pip install numpy pandas scikit-learn matplotlib seaborn jupyter
Contenu pedagogique
A. Introduction au ML
Le Machine Learning est une branche de l'IA qui permet aux machines d'apprendre a partir de
donnees. Trois types :
- Supervise : predire une variable cible (ex : prix, spam)
- Non supervise : decouvrir des structures (ex : clustering)
- Renforcement : apprentissage par recompense (ex : jeux, robotique)
B. Pipeline ML
Etapes : collecte -> nettoyage -> feature engineering -> modelisation -> evaluation -> deploiement
Bonne pratique : separer train/val/test avant toute transformation.
C. Notions mathematiques
Esperance : E[X] = Somme x*p(x)
Variance : Var(X) = E[(X - mu)^2]
Produit scalaire : u.v = Somme u_i*v_i
Descente de gradient : theta <- theta - eta * gradient(J(theta))
D. EDA
Visualisations : histogrammes, boxplots, pairplot, heatmap
Detection : [Link]().sum(), IQR pour outliers
E. Preparation des donnees
Imputation : SimpleImputer
Encodage : OneHotEncoder, LabelEncoder
Scaling : StandardScaler, MinMaxScaler
Pipeline : make_pipeline(imputer, scaler)
Checklist de fin de module
- Avoir execute le notebook complet
- Avoir compris les etapes du pipeline
- Avoir obtenu un dataset pret a l'emploi
- Score >= 80% au quiz