DATAPATH · ROADMAP Édition 2025 – 2027
PARCOURS DE COMPÉTENCES · DATA & AI
Maîtriser
la Data.
De zéro à l'IA.
Une roadmap détaillée couvrant six rôles progressifs — des
fondamentaux SQL jusqu'à l'ingénierie GenAI. Chaque
compétence est décomposée au niveau granulaire, avec ses
outils, ses prérequis mathématiques, et le rôle qu'elle débloque.
01 02 03 04 05 06
Data Data Analytics ML Data AI/GenAI
Analyst Engineer Engineer Engineer Scientist Engineer
~4–6 mois ~6–10 ~3–5 mois ~8–12 ~6–10 ~6–10
mois mois mois mois
Cochez chaque compétence acquise • Imprimez en PDF via Ella · Usage
Fichier → Imprimer → Enregistrer en PDF personnel
COMMENT UTILISER CETTE ROADMAP
Case à Compétence Case M Section
cocher maîtrisée "Rôle Mathématiques
Cliquez Le texte se barre débloqué" Les
pour automatiquement. Apparaît fondamentaux
marquer La barre de en bas de théoriques.
une progression du chaque Couvrez-les en
compétence rôle se met à jour. section. parallèle du
comme Cochez rôle
acquise. quand correspondant.
L'état est vous
sauvegardé maîtrisez
dans votre tous les
navigateur. skills du
rôle.
RÔLE 01 / 06 · FONDATIONS
01 Point d'entrée Débloque → Data Engineer
Data Analyst
Extraire, transformer et communiquer des insights depuis des données
structurées. Vous devenez le pont entre les données brutes et les décisions
business.
Compétences clés à débloquer : SQL avancé · Excel/Sheets · Python de
base · Visualisation · Statistiques descriptives
Progression : 0 / 46 0%
SQL — Langage de PYTHON —
FONDAMENTAUX données ANALYSE DE Programmation
DONNÉES
B AS E S & S YN T A XE
PYTHON DE BASE
SELECT, FROM, WHERE,
ORDER BY, LIMIT Types primitifs & structures
Filtrage, tri, restriction de int, float, str, bool, list, dict, tuple,
résultats set — mutabilité, indexation
Types de données Contrôle de flux
INT, VARCHAR, DATE, BOOLEAN, if/elif/else, for/while,
NULL, FLOAT — casting et break/continue, comprehensions
coercition
Fonctions & lambda
Opérateurs & conditions def, *args, **kwargs, valeurs par
AND, OR, NOT, IN, BETWEEN, défaut, portée (scope)
LIKE, IS NULL
Gestion d'erreurs
try/except/finally, levée
A GR É GA T IO N
d'exceptions personnalisées
GROUP BY + fonctions
PANDAS
d'agrégat
COUNT, SUM, AVG, MIN, MAX —
DataFrame & Series —
différence COUNT(*) vs
création et import
COUNT(col)
read_csv, read_excel, from_dict
HAVING — index, colonnes
Filtrer après agrégation —
Sélection & filtrage
différence avec WHERE
.loc[], .iloc[], masques booléens,
query()
DISTINCT & COUNT Nettoyage de données
DISTINCT dropna, fillna, astype, duplicates,
Dédoublonnage et cardinalité rename, strip strings
Agrégation & groupby
J OI N TU R ES
groupby().agg(), pivot_table,
crosstab, resample (séries
INNER JOIN
temporelles)
Intersection — lignes qui
matchent dans les deux tables Merge & concat
[Link] (how=left/inner/outer),
LEFT / RIGHT JOIN
[Link], join — équivalent SQL
Conservation de la table de
gauche/droite — NULL pour les Apply & map
non-matches apply(), map(), applymap —
quand vectoriser plutôt que
FULL OUTER JOIN & CROSS
boucler
JOIN
Produit cartésien, union de VISUALISATION
toutes les lignes
Self JOIN Matplotlib — figures de base
Jointure d'une table sur elle- [Link], bar, hist, scatter,
même — hiérarchies, subplots, axes, titres, légendes
comparaisons dans une même Seaborn — visualisation
table statistique
Jointures multiples & heatmap, pairplot, boxplot,
conditions composées violinplot, countplot, FacetGrid
JOIN ON multiple colonnes, Choix du bon graphique
jointures sur des tables Quand utiliser bar vs line vs
intermédiaires scatter vs histogram — règles de
dataviz
F ON C TI O NS A V A NCÉ E S
Fonctions de fenêtre
(Window Functions)
OVER(), PARTITION BY, ORDER
BY dans OVER — concept de
fenêtre glissante
ROW_NUMBER, RANK,
DENSE_RANK, NTILE
Classement dans une partition —
différences entre RANK et
DENSE_RANK
LAG, LEAD, FIRST_VALUE,
LAST_VALUE
Accès aux valeurs de lignes
voisines — calculs de
progression/glissement
SUM/AVG/COUNT avec
OVER
Totaux cumulatifs, moyennes
glissantes
CTE — Common Table
Expressions
WITH clause, lisibilité et
réutilisabilité — CTE récursives
pour les hiérarchies
Sous-requêtes (Subqueries)
Inline, dans WHERE, dans FROM
— quand CTE est préférable
CASE WHEN
Logique conditionnelle, pivot
manuel, catégorisation
Fonctions de dates
DATE_TRUNC, DATEDIFF,
EXTRACT, FORMAT DATE —
manipulation temporelle
Fonctions de texte
TRIM, LOWER, UPPER, CONCAT,
SUBSTRING, REPLACE, REGEXP
STATISTIQUES BI & Outils &
Mathématiques
DESCRIPTIVES & VISUALISATION Communication
· Fondation
INFÉRENTIELLES
TABLEAUX DE BORD
S TA T IS T IQ UE S DES C R I PTIVES
Tableau / Power BI / Looker
Mesures de tendance Studio
centrale Connexion aux sources,
Moyenne, médiane, mode — dimensions/mesures, calculated
sensibilité aux outliers, quand fields, filtres
utiliser laquelle Design de dashboard
Mesures de dispersion Hiérarchie visuelle, choix des
Variance, écart-type, IQR, range, KPIs, cohérence couleur,
coefficient de variation réduction du bruit
Distributions de données Storytelling avec les
Normale, asymétrique (skew), données
kurtosis, loi de Poisson, loi Structure narrative, annotation
binomiale des graphiques, adapter au
public non-tech
Corrélation
Pearson, Spearman, matrice de
SPREADSHEETS AVANCÉES
corrélation — corrélation ≠
causalité Excel / Google Sheets
avancé
S TA T IS T IQ UE S
VLOOKUP/INDEX-MATCH,
I NF É RE N TI EL L E S
formules imbriquées, tableaux
croisés dynamiques
Intervalles de confiance
Signification, calcul, Power Query / Google Apps
interprétation du CI à 95% Script
Tests d'hypothèses Automatisation basique,
transformation de données sans
H0 et H1, p-value, seuil α,
code
erreurs Type I et II
Tests statistiques courants
t-test (Student), chi-carré,
ANOVA, Mann-Whitney — quand
les utiliser
A/B Testing
Design d'expérience, puissance
statistique, taille d'échantillon,
Bonferroni
Data Analyst — Compétences débloquées
En maîtrisant l'ensemble de cette section, vous pouvez postuler à
des postes de Data Analyst et commencer à aborder :
SQL avancé Pandas Matplotlib/Seaborn
Tableau/Looker Statistiques inférentielles
A/B testing
Prochaine étape : Data Engineer (Rôle 02)
RÔLE 02 / 06 · INFRASTRUCTURE DES DONNÉES
02 Prérequis : Rôle 01 Débloque → Analytics Eng. + ML Eng.
Data Engineer
Construire et maintenir les pipelines qui acheminent les données depuis leurs
sources jusqu'aux équipes qui les consomment. Fiabilité, scalabilité,
orchestration.
Compétences clés : Python avancé · SQL + DWH · ETL/ELT · Cloud ·
Orchestration · Spark
Progression : 0 / 40 0%
PYTHON AVANCÉ SQL AVANCÉ &
Programmation Modélisation
— ENGINEERING DATA
des données
WAREHOUSING
P OO & P AT TE R N S
SQL DE NIVEAU PRODUCTION
Classes & héritage
__init__, @property, Optimisation de requêtes
@classmethod, @staticmethod, EXPLAIN/EXPLAIN ANALYZE,
MRO (Method Resolution Order) plans d'exécution, lecture des
Décorateurs coûts, éviter les full scans
Écrire ses propres décorateurs — Index — types et stratégies
use cases : logging, cache, retry B-tree, Hash, composite index,
Générateurs & itérateurs partial index — quand indexer,
yield, yield from — traitement de coût des index en écriture
gros volumes sans charger en Transactions & ACID
mémoire BEGIN/COMMIT/ROLLBACK,
Context managers isolation levels (READ
with statement, COMMITTED, SERIALIZABLE),
__enter__/__exit__, contextlib deadlocks
Concurrence & async DDL & gestion de schémas
asyncio, async/await, CREATE/ALTER/DROP TABLE,
ThreadPoolExecutor, contraintes (PK, FK, UNIQUE,
multiprocessing — GIL et ses CHECK), migrations
limites
DATA WAREHOUSE
Q UA L IT É D U C O DE
Tests unitaires Modélisation
pytest, unittest, fixtures, mocking dimensionnelle
([Link]), coverage Schéma étoile, schéma flocon,
Type hints & Pydantic tables de faits vs dimensions,
SCD (Slowly Changing
Annotations de types, mypy,
Dimensions)
validation de schémas avec
Pydantic v2 Partitionnement &
Packaging & clustering
environnements Partition par date/colonne —
pruning de partitions, clustering
venv, pip, poetry, [Link],
dans BigQuery/Snowflake
__init__.py, imports relatifs
Logging & gestion d'erreurs BigQuery / Snowflake /
avancée Redshift
Architecture columnar, compute
logging module, niveaux
vs storage séparé,
(DEBUG CRITICAL), handlers,
slots/crédits/concurrence
retry patterns avec tenacity
PIPELINES Ingestion & CLOUD & Environnement
ETL / ELT Transformation INFRASTRUCTURE de production
P AT T ER N S DE P IPE L I N E CLOUD (AWS / GCP / AZURE)
ETL vs ELT Stockage objet
Différences architecturales, S3 / GCS / ADLS — buckets,
quand utiliser chaque pattern, préfixes, politiques, versioning,
impact sur le DWH lifecycle rules
Ingestion batch vs Compute serverless
streaming AWS Lambda / GCP Cloud
Microbach, latence, throughput — Functions — triggers, limites, cold
choisir selon le use case métier start
Idempotence & IAM & sécurité
reproductibilité Rôles, policies, least privilege,
Pipelines sans effets de bord sur secrets manager, chiffrement at
re-run, checkpoints, upsert vs rest/in transit
insert Messagerie / streaming
Kafka (topics, partitions,
O UT I LS consumers, offsets), Pub/Sub,
Kinesis — sémantiques de
Apache Airflow livraison
DAGs, operators (Python, Bash,
SQL), sensors, XComs, variables, DEVOPS / DATAOPS
connections, retry
dbt (data build tool) Git avancé
Models, sources, tests (unique, Branching strategies, rebase vs
not_null), documentation, merge, PR reviews, git hooks,
snapshots, packages monorepos
Airbyte / Fivetran / Stitch Docker
Connecteurs sources, sync Dockerfile, images, containers,
modes (full refresh, incremental), volumes, docker-compose, multi-
CDC stage builds
Formats de données CI/CD basique
JSON, CSV, Parquet, Avro, ORC — GitHub Actions / GitLab CI —
columnar vs row-based, pipeline de lint, test, deploy
compression automatisé
Terraform (bases)
Infrastructure as Code, providers,
state, plan/apply — gestion de
ressources cloud
APACHE SPARK — Traitement MATHÉMATIQUES Mathématiques
BIG DATA distribué — COMPLEXITÉ & · Data
PROBABILITÉS Engineering
F ON D AM E NT AU X SPA R K
COMPLEXITÉ ALGORITHMIQUE
Architecture Spark
Driver, Executors, Cluster Notation Big O
Manager, stages, tasks, DAG O(1), O(log n), O(n), O(n log n),
d'exécution O(n²) — analyse d'algorithmes de
PySpark DataFrames tri et de recherche
SparkSession, transformations Structures de données
(select, filter, join, groupBy), Hash tables, arbres B, heaps,
actions (show, collect, count) queues — complexités de chaque
Partitionnement & shuffle opération
repartition vs coalesce, shuffle
(wide transformations), skew de PROBABILITÉS DE BASE
données
Probabilités conditionnelles
Optimisation Spark P(A|B), théorème de Bayes,
Catalyst optimizer, persist/cache, indépendance — applications en
broadcast joins, Spark UI pour le monitoring de données
diagnostic
Loi des grands nombres &
Spark SQL & Delta Lake TCL
Spark SQL syntax, tables Théorème Central Limite —
temporaires, Delta Lake (ACID fondement des estimations sur
sur data lake), time travel échantillons
Data Engineer — Compétences débloquées
Vous pouvez construire et opérer des pipelines de données en
production. Python avancé Airflow dbt Spark Docker
Cloud (S3/GCS) Kafka BigQuery/Snowflake
Prochaine étape : Analytics Engineer (Rôle 03) ou ML Engineer
(Rôle 04)
RÔLE 03 / 06 · TRANSFORMATION & MODÉLISATION
03 Prérequis : Rôles 01 + 02 Débloque → Data Scientist
Analytics Engineer
Le pont entre Data Engineer et Data Analyst. Vous transformez les données
brutes en modèles propres, documentés et testés, prêts pour l'analyse et la BI.
Compétences clés : dbt Expert · Modélisation avancée · Qualité des
données · Sémantique layer
Progression : 0 / 19 0%
DBT — Transformation MODÉLISATION &
Architecture
EXPERT SQL QUALITÉ DES
analytique
DONNÉES
A RC H IT E CT UR E DBT
MODÉLISATION AVANCÉE
Couches de modélisation
(staging / intermediate / One Big Table vs
mart) Normalized
Convention de nommage, Trade-offs en termes de
séparation des responsabilités, performance, maintenance et
ref() vs source() lisibilité analytique
Matérialisations Métriques & semantic layer
View, table, incremental MetricFlow, LookML, [Link] —
(unique_key, merge vs définir des métriques business
delete+insert), ephemeral — partagées
quand utiliser chaque
Gestion des PII & RGPD
Tests dbt Pseudonymisation, masquage,
Generic (unique, not_null, politiques d'accès aux colonnes
accepted_values, relationships), sensibles
tests personnalisés, dbt-
expectations QUALITÉ & OBSERVABILITÉ
Macros & Jinja
Data contracts
Boucles, conditions, macros
Définition des schémas attendus,
réutilisables, packages
validation à l'ingestion, alertes
(dbt_utils, codegen)
en cas de dérive
Snapshots & SCD Type 2
Great Expectations / Soda
Tracking des changements
Suites de tests de qualité,
historiques, strategy timestamp
checkpoints, data docs,
vs check, valid_from/to
intégration pipeline
Documentation & lineage Data catalogues
Descriptions en YAML, dbt docs Datahub, Alation — metadata,
generate, graphe de découvrabilité, lineage end-to-
dépendances end
CI/CD dbt
dbt Cloud jobs, Slim CI (defer to
prod), intégration GitHub Actions
BI AVANCÉE & Communication MATHÉMATIQUES Mathématiques
PRÉSENTATION analytique — ALGÈBRE · Analytics
RELATIONNELLE Engineering
O UT I LS BI A V A NCÉ S
THÉORIE DES BASES DE
Tableau / Power BI avancé DONNÉES
LOD expressions (Tableau), DAX
(Power BI), calculated measures, Formes normales (1NF
performance optimization 3NF, BCNF)
Looker / LookML Dépendances fonctionnelles,
Views, explores, dimensions, élimination des redondances,
measures, derived tables, trade-offs avec la
caching (PDTs) dénormalisation
Self-service analytics Théorème CAP
Conception de modèles Cohérence, Disponibilité,
permettant aux business users Tolérance aux partitions —
d'explorer seuls implications pour les systèmes
distribués
Théorie des ensembles
Union, intersection, différence,
produit cartésien — fondements
des jointures SQL
Analytics Engineer — Compétences débloquées
Vous produisez des modèles de données fiables et documentés
consommés par toute l'organisation. dbt Expert
Semantic Layer Data Quality LookML Data Contracts
Prochaine étape : Data Scientist (Rôle 05)
RÔLE 04 / 06 · MACHINE LEARNING EN PRODUCTION
04 Prérequis : Rôle 02 + Maths ML
Débloque → Data Scientist + AI Eng.
ML Engineer
Déployer et opérer des modèles de machine learning à l'échelle. Vous
construisez la feature store, les pipelines d'entraînement, et les API de serving.
Compétences clés : ML Theory · Scikit-learn · Feature Eng. · MLflow ·
FastAPI · Kubernetes
Progression : 0 / 38 0%
MATHÉMATIQUES FONDAMENTALES DU ML Mathématiques · ML
— À MAÎTRISER AVANT LE RESTE Engineer + Data Scientist
Ces mathématiques sont les fondations de tout le ML. Couvrez-les en parallèle
de votre apprentissage de Scikit-learn.
A LG È BR E L IN É A IRE CALCUL PROBABILITÉS &
DIFFÉRENTIEL STATISTIQUES ML
Vecteurs & (CALCULUS)
opérations Distributions de
Norme, produit Dérivées & règle probabilité
scalaire, produit de la chaîne Gaussienne,
vectoriel, angle entre Dérivées partielles, Bernoulli, Multinoulli,
vecteurs gradient d'une Dirichlet — moment,
fonction scalaire — entropie
Matrices &
cœur de la backprop
opérations Maximum de
Addition, Gradient & vraisemblance
multiplication, descente de (MLE)
transposée, inverse, gradient Log-likelihood,
déterminant Direction du optimisation,
Valeurs propres & gradient, taux connection avec la
d'apprentissage, cross-entropy loss
vecteurs propres
point de minimum,
Décomposition Inférence
gradient
spectrale, bayésienne
stochastique (SGD)
diagonalisation — Prior, likelihood,
fondements de PCA posterior — MAP vs
MLE, distributions a
priori conjuguées
SVD — Jacobienne & Théorie de
Décomposition en Hessienne l'information
valeurs Matrice jacobienne Entropie de
singulières (transformations), Shannon, entropie
SVD complète et hessienne (convexité) croisée, divergence
tronquée — utilisée — Newton's method KL, information
dans les systèmes de mutuelle
Fonctions
recommandation, d'activation — Espérance,
NLP variance,
analyse
Espaces Sigmoid, tanh, ReLU covariance
vectoriels et ses variantes — E[X], Var[X], Cov[X,Y],
Base, dimension, problèmes du matrice de
sous-espace, gradient covariance —
projection vanishing/exploding propriétés et calculs
orthogonale Optimisation
Normes convexe
matricielles Convexité d'une
Norme de Frobenius, fonction,
norme L1, L2 — maxima/minima
régularisation locaux vs globaux,
Ridge/Lasso conditions KKT
ALGORITHMES ML — Machine MLOPS — DE Machine
THÉORIE & Learning L'EXPÉRIENCE À Learning
PRATIQUE Core LA PRODUCTION Operations
A PP R EN T IS SA G E SU P E R VISÉ GESTION D'EXPÉRIENCES
Régression linéaire MLflow
OLS, équation normale, gradient Tracking (params, metrics,
descent, hypothèses artifacts), Model Registry,
(homoscédasticité, normalité des Projects, autolog
résidus)
Feature Store
Régression logistique Feast, Tecton — features en ligne
Fonction sigmoïde, log-loss, vs hors ligne, point-in-time joins,
multiclasse (softmax), skew train/serve
interprétation des coefficients
Hyperparameter tuning
Arbres de décision Grid search, Random search,
Gini impurity, entropie, Optuna/Hyperopt (Bayesian
information gain, profondeur, optimization), Halving
élagage (pruning)
DÉPLOIEMENT DE MODÈLES
Random Forest & Gradient
Boosting FastAPI / Flask pour ML
Bagging vs Boosting, XGBoost, Endpoints de prédiction,
LightGBM, CatBoost — schémas Pydantic, gestion des
hyperparamètres clés erreurs, async requests
SVM — Support Vector Conteneurisation ML
Machines Docker pour modèles, packaging
Hyperplan, marge, vecteurs de Scikit-learn/PyTorch avec leurs
support, kernel trick (RBF, dépendances
polynomial)
KNN & Naïve Bayes Kubernetes (bases)
Distances (Euclidienne, cosinus), Pods, Deployments, Services,
choix de k — Bayes pour le texte Ingress, autoscaling —
déploiement d'API ML
A PP R EN T IS SA G E NO N -
Batch vs Online serving
S UP E RV I SÉ
Prédictions à la demande vs
prédictions pré-calculées —
K-Means & DBSCAN
latence vs throughput
Inertie, choix de k
(elbow/silhouette), DBSCAN pour
MONITORING ML
les clusters de forme arbitraire
PCA — Analyse en Drift de données & de
Composantes Principales modèle
Variance expliquée, scree plot, Covariate shift, concept drift, PSI,
réduction de dimension pour KS-test — détection et alertes
visualisation et feature eng.
Evidently AI / WhyLabs
t-SNE & UMAP Rapports de qualité de données,
Visualisation de données haute dashboard de monitoring de
dimension — perplexity, modèles
interprétation des clusters
É VA L UA T IO N D E MO D È L ES
Métriques de classification
Accuracy, Precision, Recall, F1,
AUC-ROC — quand privilégier
chaque métrique
Métriques de régression
MAE, MSE, RMSE, R², MAPE —
sensibilité aux outliers
Overfitting & underfitting
Bias-variance tradeoff, courbes
d'apprentissage, régularisation
L1/L2/ElasticNet
Validation croisée
k-fold, stratified k-fold, time
series CV (TimeSeriesSplit),
nested CV
ML Engineer — Compétences débloquées
Vous déployez des modèles ML robustes et monitorés en
production. Scikit-learn XGBoost/LightGBM MLflow
FastAPI Docker/K8s Feature Store
Prochaine étape : Data Scientist (Rôle 05) ou AI/GenAI
Engineer (Rôle 06)
RÔLE 05 / 06 · SCIENCE & RECHERCHE APPLIQUÉE
05 Prérequis : Rôles 01 + 03 + 04 Débloque → AI/GenAI Engineer
Data Scientist
Formuler des problèmes business en problèmes de ML, explorer les données,
développer des modèles avancés et communiquer les résultats aux décideurs.
Compétences clés : Deep Learning · NLP · Time Series · Expérimentation ·
Feature Engineering avancé
Progression : 0 / 31 0%
DEEP LEARNING — Réseaux de NLP — TRAITEMENT
Texte &
FONDAMENTAUX neurones DU LANGAGE
Séquences
NATUREL
R ÉS E AU X D E N E URO N E S
D EN S ES (M LP ) NLP CLASSIQUE
Architecture MLP Prétraitement texte
Couches, neurones, poids, biais, Tokenisation, stemming,
propagation forward — lemmatisation, stop words,
représentation matricielle normalisation (regex, unicode)
Backpropagation TF-IDF & Bag of Words
Règle de la chaîne, calcul des Vectorisation de texte, matrix
gradients couche par couche, document-terme, similarité
computational graph cosinus
Optimiseurs Word2Vec / GloVe /
SGD, Momentum, Adam, AdamW, FastText
RMSProp — learning rate Embeddings de mots, Skip-gram
scheduling (warmup, cosine) vs CBOW, propriétés
Régularisation DL géométriques
Dropout, Batch Normalization,
Layer Norm, Weight Decay, Early TRANSFORMERS & BERT
Stopping
Mécanisme d'attention
C NN & V IS IO N Self-attention, Q/K/V, softmax
attention — complexité O(n²) et
Convolutions ses implications
Kernel, stride, padding, feature Architecture Transformer
maps, receptive field — pooling Encoder/Decoder, positional
(max, average) encoding, multi-head attention,
feed-forward layers
Architectures CNN HuggingFace Transformers
ResNet (skip connections), Pipeline, Tokenizer, AutoModel,
EfficientNet, transfer learning, from_pretrained, fine-tuning sur
fine-tuning tâche custom
Fine-tuning BERT /
P YT O RC H
RoBERTa
Tenseurs & autograd Classification de texte, NER, QA
Création, opérations, gradient — Trainer API, LoRA pour
tracking (requires_grad), l'efficacité
.backward()
[Link] — construction
de modèles
Layers (Linear, Conv2d, LSTM),
forward(), paramètres,
Sequential
DataLoader & Dataset
Classe Dataset personnalisée,
DataLoader, collate_fn, shuffle,
workers
Training loop
optimizer.zero_grad(),
[Link](), [Link](),
validation, checkpointing
SÉRIES MATHÉMATIQUES
Data Mathématiques
TEMPORELLES & — DEEP
Science · Data
FEATURE appliquée
LEARNING & Scientist
ENGINEERING OPTIMISATION
S ÉR I ES TE MP O R ELL E S OPTIMISATION NUMÉRIQUE
Décomposition (tendance, Descente de gradient
saisonnalité, résidu) stochastique (SGD)
STL, seasonal_decompose, Mini-batch, convergence, saddle
détection d'anomalies points, plateaux — visualisation
temporelles du loss landscape
Stationnarité & tests ADF Momentum & méthodes
Tests de Dickey-Fuller, adaptatives
différenciation, transformation Momentum Nesterov, AdaGrad,
log RMSProp, Adam — théorèmes de
ARIMA / SARIMA convergence
Paramètres p,d,q, ACF/PACF, Régularisation — analyse
sélection de modèle (AIC/BIC) mathématique
Prophet / NeuralProphet L1 favorise la sparsité (norme L1
Modèle additif, saisonnalités non-différentiable), L2 pénalise
multiples, effets de vacances, les grands poids
incertitude
THÉORIE DE
F EA T UR E E NG I N EER I N G L'APPRENTISSAGE
Encodage des variables Complexité de Vapnik-
catégorielles Chervonenkis (VC)
One-hot, Label encoding, Target Dimension VC, borne de
encoding, Ordinal — impact sur généralisation, PAC learning —
les modèles pourquoi le DL généralise
Normalisation & Théorie de l'information
standardisation dans le ML
MinMaxScaler, StandardScaler, Entropie croisée comme loss, IB
RobustScaler — leakage train/test (Information Bottleneck),
compression et généralisation
Traitement des valeurs
manquantes
Imputation simple/multiple
(KNN, MICE), indicateurs de
manquant, impact modèle
Feature importance &
sélection
SHAP values, permutation
importance, RFE, corrélation —
réduction de dimension
Gestion des outliers
Z-score, IQR, isolation forest,
winsorizing — distinguer outlier
vs erreur de donnée
Data Scientist — Compétences débloquées
Vous menez des projets end-to-end : de la question business aux
modèles en production. PyTorch HuggingFace SHAP
NLP avancé Time Series A/B testing ML
Prochaine étape : AI/GenAI Engineer (Rôle 06)
RÔLE 06 / 06 · INTELLIGENCE ARTIFICIELLE GÉNÉRATIVE
06 Prérequis : Rôles 04 + 05 Rôle final
AI / GenAI Engineer
Concevoir et déployer des applications alimentées par des LLMs et modèles
génératifs. RAG, agents, fine-tuning, orchestration et évaluation de systèmes
AI.
Compétences clés : LLMs · RAG · Agents · Fine-tuning · Prompt
Engineering · Évaluation AI
Progression : 0 / 36 0%
LLMS — Large PROMPT
Art de
communiquer
ARCHITECTURE & Language ENGINEERING avec les LLMs
COMPRÉHENSION Models
TECHNIQUES DE PROMPTING
A RC H IT E CT UR E DES L L MS
Zero-shot & Few-shot
Transformer décodeur
Exemples dans le prompt, format
(GPT-style) des exemples, nombre optimal
Causal masking, auto-regressive selon la tâche
generation, attention causale —
différence encoder/decoder Chain-of-Thought (CoT)
"Let's think step by step", CoT
Tokenisation BPE / auto-consistant, Tree of
WordPiece Thoughts
Vocabulary, context window,
tokens vs mots — coût et
Structured outputs
implications pour les prompts JSON mode, function calling,
Instructor library — contraindre
Stratégies de génération la sortie du LLM
Temperature, top-k, top-p
(nucleus sampling), greedy,
Système de rôles
beam search — beam search vs (system/user/assistant)
sampling System prompt, personas,
instructions de format, gestion de
Embeddings & espaces la mémoire de conversation
sémantiques
Embeddings de phrases
Prompt injection & sécurité
(sentence-transformers), Attaques d'injection, jailbreaking,
distance cosinus, clustering garde-fous — validation des
sémantique entrées/sorties
Context window & long-
context
Positional encoding (RoPE,
ALiBi), attention flash, KV cache
— stratégies pour longs
documents
A PI S & MO DÈ L E S
API OpenAI / Anthropic /
Google
Chat completions, function
calling, vision, streaming, gestion
des erreurs et rate limits
Modèles open-source
Llama, Mistral, Qwen —
HuggingFace Hub, Ollama pour
l'inférence locale
RAG — AGENTS & Systèmes
Grounding &
RETRIEVAL- ORCHESTRATION autonomes
mémoire
AUGMENTED externe
GENERATION
ARCHITECTURES D'AGENTS
ReAct (Reason + Act)
P IP E LI N E RA G
Boucle
Chunking de documents pensée/action/observation, tool
use, parsing des sorties de
Fixed-size, recursive, semantic
raisonnement
chunking — taille de chunk,
overlap, impact sur la retrieval Function / Tool calling
Vector databases Définition des tools (JSON
schema), parsing des appels,
Chroma, Pinecone, Weaviate,
gestion des erreurs de tools
Qdrant — indexation ANN
(HNSW, IVF), filtrage hybride Multi-agents
Recherche hybride Orchestrateur + agents
spécialisés, LangGraph, CrewAI,
BM25 (lexical) + embeddings
communication entre agents
(sémantique), RRF (Reciprocal
Rank Fusion), reranking Mémoire d'agent
Évaluation RAG Mémoire épisodique vs
sémantique, summarization,
RAGAS (faithfulness, answer
embeddings de conversation
relevancy, context
precision/recall), LLM-as-judge Guardrails & sécurité
Advanced RAG patterns NeMo Guardrails, Llama Guard,
validation entrées/sorties, rate
Query rewriting, HyDE, parent-
limiting, coûts
child chunking, multi-vector
retrieval, routing
F RA M EW O RK S
LangChain
Chains, LCEL, retrievers, memory,
document loaders, output
parsers
LlamaIndex
Index types (vector, summary,
knowledge graph), query engines,
sub-question
FINE-TUNING & MATHÉMATIQUES
Spécialisation Mathématiques
ADAPTATION DE —
de modèles · AI/GenAI
LLMS TRANSFORMERS Engineer
& ATTENTION
T EC H NI Q UE S D E FI N E - TUNING
ATTENTION MATHÉMATIQUE
LoRA / QLoRA
Décomposition de rang faible, Scaled dot-product
modules cibles (Q, K, V), attention
quantization 4-bit avec Attention(Q,K,V) = softmax(QKᵀ/
bitsandbytes √d)V — scaling pour éviter la
Instruction tuning saturation du softmax
Format Alpaca/ChatML, datasets Multi-head attention —
d'instructions, qualité vs quantité
analyse
des données
Projections, têtes parallèles,
RLHF & DPO concaténation — que capture
RLHF (reward model + PPO), chaque tête
DPO plus simple — alignement
Positional encoding
des préférences humaines
PE sinusoïdal (propriétés
Évaluation des LLMs fine- d'extrapolation), RoPE —
tunés encodage de la position dans les
Benchmarks (MMLU, HellaSwag), vecteurs
évaluation humaine, LLM-as- Softmax & cross-entropy —
judge, MT-Bench
analyse
Propriétés du softmax, lien avec
D ÉP L OI E ME NT L LMS
la distribution de Boltzmann,
gradient de la cross-entropy
Inférence efficace
vLLM, TGI (Text Generation
THÉORIE GÉNÉRATIVE
Inference), quantization (GPTQ,
AWQ), speculative decoding
Modèles de diffusion —
GPU & calcul distribué bases
CUDA basics, tensor parallelism, Forward process (bruit), reverse
pipeline parallelism — coûts et process, DDPM, DDIM — score
sizing GPU matching
VAE & espace latent
Reparameterization trick, ELBO,
KL divergence — représentation
latente et génération
AI / GenAI Engineer — Toutes compétences
débloquées !
Vous maîtrisez l'intégralité du stack Data AI. Vous pouvez
construire, déployer et opérer des applications AI complètes.
LLMs RAG Agents Fine-tuning vLLM
LangChain/LlamaIndex Vector DB RLHF/DPO
Félicitations — parcours complet maîtrisé !
RESSOURCES RECOMMANDÉES PAR RÔLE
Data Analyst Data Engineer Analytics Engineer
Mode Analytics (dbt Fundamentals of Data dbt Developer
blog) Engineering (Reis) Certification
SQL Murder Mystery [Link] — DE Metabase / Looker
(exercices) Zoomcamp documentation
Kaggle Learn — Airflow docs + The Kimball Group
Pandas Astronomer Learn Reader
StatQuest with Josh dbt Learn Projet : dbt +
Starmer ([Link]) BigQuery + Looker Studio
Storytelling with Data Hussein Nasser
(C. Knaflic) (Kafka, architecture)
Exercices : LeetCode Projet : pipeline GCS
SQL, StrataScratch BigQuery dbt
ML Engineer Data Scientist AI / GenAI Engineer
Hands-On ML Deep Learning Building LLMs for
(Aurélien Géron) (Goodfellow et al.) Production (Biewald)
Designing ML Systems [Link] — Practical DL [Link]
(Chip Huyen) for Coders Short Courses
Full Stack Deep Natural Language LlamaIndex /
Learning Processing with LangChain docs
Mathematics for ML Transformers Attention Is All You
(Deisenroth) Andrej Karpathy — Need (paper)
Projet : modèle Neural Networks: Zero to Projet : RAG + agents
MLflow FastAPI Hero + fine-tuning + eval
Docker Projet : fine-tune
BERT + déploiement API
Dat aP at h R o a dm a p · E ll a · U sa g e per sonnel
La persévérance bat le talent quand le talent ne
persévère pas.
DATA