Cours : LLM et RAG
1. Introduction
LLM (Large Language Model) : Modèle d’intelligence artificielle entraîné sur de très grands
corpus de textes pour comprendre et générer du langage naturel.
RAG (Retrieval-Augmented Generation) : Technique qui combine un LLM avec une base
documentaire externe, afin de générer des réponses plus fiables, à jour et spécifiques.
2. Les LLM : Définition et fonctionnement
a) Qu’est-ce qu’un LLM ?
Un réseau de neurones de très grande taille (souvent basé sur l’architecture Transformer).
Entraîné sur des milliards de mots pour apprendre les relations et structures du langage.
Exemples : GPT-4, LLaMA, Claude, Mistral.
b) Fonctionnement
1. Entraînement : apprentissage de la probabilité des séquences de mots (prédiction du mot
suivant).
2. Paramètres : milliards de poids qui représentent la "mémoire statistique" du modèle.
3. Utilisation : génération de texte, résumé, traduction, codage, etc.
c) Limites des LLM seuls
Ils ne savent que ce qu’ils ont vu jusqu’à leur date de coupure.
Ils peuvent halluciner (inventer des faits).
Ils ne sont pas spécialisés dans une base de données particulière (juridique, médicale,
entreprise...).
3. Le RAG : Retrieval-Augmented Generation
a) Définition
Le RAG est une méthodologie hybride :
On connecte un LLM à un système de recherche documentaire (moteur de recherche, base
vectorielle, knowledge graph).
Le modèle va chercher les informations pertinentes avant de générer une réponse.
b) Architecture RAG
1. Question de l’utilisateur
2. Retrieval (Recherche) : la question est transformée en vecteur → recherche dans une base
vectorielle (Pinecone, FAISS, Weaviate…).
3. Augmentation : les documents retrouvés sont ajoutés au prompt.
4. Generation (LLM) : le LLM utilise à la fois sa mémoire interne et les documents pour générer
une réponse fiable.
📌 Exemple concret :
Un avocat interroge un LLM sur une jurisprudence récente (postérieure à 2023).
Le LLM seul ne connaît pas la loi 2024 → hallucination possible.
Le RAG va chercher dans une base juridique à jour → le LLM génère une réponse correcte en
citant les documents trouvés.
4. Cas d’usage
Entreprise : Chatbot connecté aux documents internes (rapports, politiques RH, manuels
techniques).
Médecine : Recherche dans des articles médicaux récents pour répondre à une question
clinique.
Éducation : Génération de résumés basés sur les supports de cours réels d’un enseignant.
Recherche scientifique : Interroger des bases comme PubMed ou ArXiv et générer des
synthèses.
5. Avantages et limites
✅ Avantages du RAG
Réponses plus fiables et factuelles.
Accès à des données à jour.
Réduction des hallucinations.
Adaptation à un contexte métier spécifique.
⚠️Limites
Dépend de la qualité des données indexées.
Peut récupérer des documents non pertinents si la recherche est mal configurée.
Le LLM peut encore mal interpréter les documents.
6. Schéma simplifié
[Utilisateur] → [Question]
[Moteur de recherche / base vectorielle]
↓
[Documents pertinents récupérés]
[LLM + Contexte documentaire]
[Réponse finale fiable]
7. Conclusion
Les LLM sont puissants mais limités en précision et actualité.
Le RAG permet d’exploiter leur puissance en les connectant à des données fiables.
C’est aujourd’hui la méthode standard pour créer des assistants spécialisés (juridiques,
médicaux, éducation, entreprise).