INTRODUCTION À LA RECHERCHE
D’INFORMATION
Enseignante : Rim Mahouachi
Groupe : GLSI2
CONTEXTE ET MOTIVATION
La généralisation des supports numériques.
La chute des coûts des médias de stockage.
L’augmentation vertigineuse de la quantité d’information stockée sous format
numérique.
L’hétérogénéité de l’information (texte, image, son, ..).
2
CONTEXTE ET MOTIVATION
L’information est partout !
Chaque 60 secondes sur internet en 2024 :
• 5,9 millions de recherches sont effectuées sur Google,
• Siri répond à plus d’un million de questions,
• Près de 3,5 millions de vidéos YouTube sont visionnées,
• Près de 139 millions de Reels sont joués sur Facebook et Instagram,
• 251 millions d’emails sont envoyés,
• Plus d’un million de messages sont envoyés sur Slack,
• Gemini, l’IA de Google, accueille 8 574 visiteurs,
• Les Tiktokeurs uploadent 16 000 vidéos,
• Les abonné(e)s Netflix streament près de 363 000 heures de programmes.
L‘utilisation d’internet a augmenté de 1 482 % entre 2000 et 2024. Aujourd’hui,
le nombre d’utilisateurs d’internet dans le monde s’élève à 5,5 milliards, soit 69 3
% de la population mondiale.
CONTEXTE ET MOTIVATION
Le problème n’est donc pas la disponibilité de l’information
MAIS :
sa sélection, son identification arriver à trouver au bon
moment l’information utile
4
CONTEXTE ET MOTIVATION
Un travailleur du savoir passe 2,5 heures par jour (≈ 30 %
du temps) à chercher de l’information
seulement 50 % des informations sont correctement indexées et
donc faciles à retrouver
Les 1 000 plus grandes entreprises américaines perdent au
moins 2,5 milliards $ par an à cause d’une mauvaise
recherche d’information
(Source : The High Cost of Not Finding Information | IDC White Paper)
L’émergence d’un domaine de recherche : Recherche d’Information
(RI) ou Repérage d’Information = Information Retrieval (IR)
5
RECHERCHE D’INFORMATION (RI)
DÉFINITION
Recherche d’information (RI) :
Ensemble des méthodes et techniques pour l’acquisition,
l’organisation, le stockage, la recherche et la sélection
d’information pertinente pour un utilisateur
Concerne la recherche de données non structurées,
généralement des documents, satisfaisant une demande
d’information spécifique
Par données non structurées, on entend les données qui ne possèdent
pas de structure interne précise ou qui sont sémantiquement ambigües
6
RECHERCHE D’INFORMATION (RI)
DONNÉE – INFORMATION - CONNAISSANCE
Les données sont des faits bruts, des valeurs ou des
observations sans signification contextuelle.
Ce sont des éléments de base qui n'ont pas encore été
interprétés ou analysés.
Elles peuvent être sous forme de nombres, de mots, d'images,
ou même de sons.
Exemple : "25", "Paris", "6h15", "apple"
L'information est créée lorsque les données sont traitées,
organisées ou structurées d'une manière qui leur donne un
sens dans un contexte spécifique.
C’est une donnée qui a été interprétée et qui devient utile
pour répondre à des questions comme "quoi", "où" et "quand".
Exemple : Il est 25°C à Bizerte à 6h15 ce matin. 7
RECHERCHE D’INFORMATION (RI)
DONNÉE – INFORMATION - CONNAISSANCE
La connaissance est le résultat de l'interprétation et de la
compréhension de l'information par un individu ou un
groupe.
Elle est souvent liée à l'expérience, la compétence ou le
jugement et permet de comprendre "pourquoi" quelque chose
se produit ou "comment" utiliser l'information de manière
efficace dans un contexte donné.
Exemple : "25°C à Bizerte signifie qu'il fait chaud et que des
vêtements légers sont recommandés"
Connaissance
Information
8
Données
RECHERCHE D’INFORMATION (RI)
DONNÉE – INFORMATION - CONNAISSANCE
SGBD
Exemple dans le cadre d'une entreprise Données
o Données : Les ventes mensuelles des
différents produits (ex : "Produit A :
100 unités", "Produit B : 150 unités").
Connaissance Information
o Information : "Le Produit B a été
vendu davantage que le Produit A au
cours du mois dernier."
o Connaissance : "Les ventes du Produit
Fouille de
B augmentent à chaque saison, il données SRI
serait donc judicieux de renforcer la
promotion de ce produit avant le
prochain trimestre." 9
RECHERCHE D’INFORMATION (RI)
PROBLÈMES EN RI
Recherche Ad-hoc
Rechercher dans une large collection de documents les documents
qui satisfont l’information souhaitée (documents pertinents)
Ad-hoc : vient du comment est construite la requête
Ad-hoc : « formed or used for specific or immediate problems or needs »
(Merriam-Webster’s Collegiate Dictionary)
Recherche spécialisée, ciblée et temporaire, visant à résoudre une
question ou un problème spécifique dans un court laps de temps
Plusieurs types de RI Ad-hoc
Recherche sur le web
Recherches spécifiques
Domaine spécifique (médical, légal, chimie, …)
Recherche d’événements
10
Recherche de personnes (expert)
RECHERCHE D’INFORMATION (RI)
PROBLÈMES EN RI
Classification des documents
Catégoriser automatiquement une collection de documents suivant
un ensemble de classes prédéfinies
Exemple : système anti-spams
Partitionnement des documents
Regrouper les documents qui sont similaires par rapport à un
critère donné
Exemples :
identification des thèmes dans une collection de documents
Groupement des machines suivant leurs fichiers logs pour maintenance
/ dépannage
..
11
SYSTÈME DE RECHERCHE D’INFORMATION
RÔLE D’UN SRI
Étant donné
Une collection de documents (appelé aussi corpus, ou fond de
documents) ;
Un besoin exprimé à travers une requête de la part d’un
utilisateur.
Objectif d’un SRI
Retrouver les documents répondant à ce besoin le plus
précisément et le plus exhaustivement possible.
La qualité des documents retournés (ou retrouvés) dépend étroitement
de la satisfaction de l’utilisation : notion de pertinence.
12
SYSTÈME DE RECHERCHE D’INFORMATION
DÉFINITION
Un système de recherche d’information (RI) est un système qui
permet de retrouver les documents pertinents à une requête
d’utilisateur, à partir d’une base de documents volumineuse.
13
EXEMPLES DE SYSTÈMES DE RECHERCHE D’INFORMATION
Moteurs de recherche
Mais aussi dans :
• Les entreprises
• Les bibliothèques numériques
• Domaines d’application (médecine,
droit, …)
• Nos ordinateurs
14
SGBD VS SRI
Spécification d’un livre
ISBN : 0-201-12227-8
Auteur : Salton Gerard
Titre : Automatic text processing : the transformation, analysis, and
retrieval of information by computer
Éditeur : Addison-Wesley
Date publication : 1989
Contenu : <Texte du livre>
SGBD:
1 Recherche par attributs (données structurées) (Auteur, Éditeur,
etc.)
recherche dans les BD (simple)
Pour trouver les livre écrits par "Musso", on peut poser la requête
suivante en SQL : select * from Livre where Auteur = "Musso"
SRI: 2 Recherche par le contenu (données non structurées) 15
RI (complexe)
SYSTÈME DE RECHERCHE D’INFORMATION
DOCUMENT, REQUÊTE, PERTINENCE
Document
Toute unité qui peut constituer une réponse à une requête
d’utilisateur
Forme : Texte, image, vidéo, etc ..
Nature : Hétérogène (multi-sources, multi-langues)
Structure : structuré, non structuré, semi-structuré
16
SYSTÈME DE RECHERCHE D’INFORMATION
DOCUMENT, REQUÊTE, PERTINENCE
Requête
Expression en texte "libre" formulée par l'utilisateur
Exemples : "text mining", "je voudrais trouver des documents qui
parlent de ...", requêtes ambigües "apple", "java", "jaguar"…
Exprime le besoin en information (une expression mentale)
d’un utilisateur
17
SYSTÈME DE RECHERCHE D’INFORMATION
DOCUMENT, REQUÊTE, PERTINENCE
Requête
Besoin utilisateur en information (sur le web) :
Besoin informationnel : vouloir apprendre quelque chose (ex: low
homoglobin)
Besoin navigationnel : lié à la recherche des sites d’accueil des
personnes, organisations, etc. (ex : Tunisair, UVT)
Besoin transactionnel : lié à la recherche des services en ligne (ex :
météo Bizerte), téléchargement (ex : fond d’écran Avengers),
shopping (ex : Canon S410)
18
SYSTÈME DE RECHERCHE D’INFORMATION
DOCUMENT, REQUÊTE, PERTINENCE
Pertinence
Qualité d’un système à répondre exactement à la requête
demandée par l’utilisateur
Issue de la mise en correspondance de 3 éléments : la
requête, le document et le besoin utilisateur
19
SYSTÈME DE RECHERCHE D’INFORMATION
DOCUMENT, REQUÊTE, PERTINENCE
Pertinence utilisateur
représente la façon dont l’utilisateur évalue les documents
retrouvés par le SRI en fonction de son besoin d’information
(on parle de ses jugements de pertinence).
c’est une évaluation subjective (floue) qui varie au cours du
temps et qui dépend de l’utilisateur en question :
un même utilisateur peut avoir deux avis différents concernant un
document retrouvé suite à sa requête et ceci en fonction de sa
situation lors de l’évaluation.
deux utilisateurs peuvent avoir deux avis différents concernant un
même document.
Mesurer de manière automatique la pertinence Solution : la pertinence 20
utilisateur est une tâche complexe système
SYSTÈME DE RECHERCHE D’INFORMATION
DOCUMENT, REQUÊTE, PERTINENCE
Pertinence système
pertinence attribuée par le système à partir des méthodes
utilisées pour comparer les documents et la requête.
c’est un score obtenu automatiquement par les SRI en
comparant les représentations des documents et celles des
requêtes : rend “mesurable” la notion de pertinence.
Ce score n’est qu’une représentation imprécise de la pertinence
utilisateur (un document considéré comme pertinent par le système ne
l’est pas nécessairement par l’utilisateur) : l’enjeu de la RI est de
rapprocher tant que possible la pertinence système de la pertinence
utilisateur.
21
SYSTÈME DE RECHERCHE D’INFORMATION
RÉALISER UN SRI : APPROCHES POSSIBLES
1 Approche très naïve :
considérer une requête comme une chaîne de caractères, et un
document pertinent comme celui qui contient cette chaîne de caractères
balayer les documents séquentiellement, en les comparant avec la
chaîne de caractères qui est la requête.
Si on trouve la même chaîne de caractère dans un document, alors il est
sélectionné comme réponse.
Problèmes :
Vitesse: Pour chaque requête, on doit parcourir tous les documents dans la
base.
Pouvoir d'expression d'une requête: Une requête étant une simple chaîne de
caractères, il est difficile d'exprimer des besoins complexes comme "Trouver
des documents concernant la base de données et l'intelligence artificielle
utilisées dans l'industrie".
n'est utilisée que dans des systèmes jouets très petits 22
SYSTÈME DE RECHERCHE D’INFORMATION
RÉALISER UN SRI : APPROCHES POSSIBLES
2 Approche basée sur une indexation :
On effectue certains pré-traitements sur les documents et les
requêtes, ce qu'on appelle l'indexation.
Cette opération vise à construire une structure d'index qui permet de
retrouver très rapidement les documents incluant des mots demandés :
l’index inversé
Une requête peut être maintenant une expression plus complexe,
incluant des opérateurs logiques (ET, OU, …)
Avantages :
Elle est plus rapide : plus besoin du parcours séquentiel car avec la
structure d'index, on peut directement savoir quels documents contiennent
tel ou tel mot.
23
L'expression des requêtes peut être très complexe, exprimant des
besoins d'information complexes
PROCESSUS DE LA RI
VUE GLOBALE
Besoin formulation requête documents
d’information
comparaison
Documents retournés
Tâches principales :
o La représentation du contenu des documents (appelée aussi analyse ou indexation)
o La comparaison (ou appariement) : établit la correspondance entre la requête de
l’utilisateur et les documents du corpus
24
o L’évaluation de la performance du système
PROCESSUS DE LA RI
L’INDEXATION indexation
Besoin formulation requête documents
d’information
analyse analyse
représentation représentation
comparaison
Documents retournés
Des techniques qui attachent à un document, un ensemble de descripteurs
(représentation) de son contenu dans le but de faciliter la recherche 25
d’information.
PROCESSUS DE LA RI
L’INDEXATION
Indexation - Chaumier 2000
Description du contenu du document à l’aide de mots clés pour faciliter la
mémorisation du contenu de ce document pour une recherche ultérieure.
Les unités extraites afin de représenter un document sont appelées mots
clés, ou descripteurs, ou termes d’indexation, ou index.
26
PROCESSUS DE LA RI
COMPARAISON ET MISE EN CORRESPONDANCE
Besoin formulation requête documents
d’information
analyse analyse
représentation représentation
Modèles de RI
comparaison
Documents retournés
Les modèles de RI ont pour objectif de définir une méthode de
comparaison entre une représentation d’un document et une représentation
d’une requête afin de déterminer leur degré de correspondance 27
(similarité).
PROCESSUS DE LA RI
EVALUATION D’UN SRI
Besoin formulation requête documents
d’information
analyse analyse
Evaluation représentation représentation
comparaison
Documents retournés
Le but de la RI est de trouver des documents pertinents à une requête, et donc utiles pour
l'utilisateur.
La qualité d'un SRI doit être mesurée en comparant les réponses du système avec les
réponses idéales que l'utilisateur espère recevoir. 28
Plus les réponses du système correspondent à celles que l'utilisateur espère, mieux est le
système.
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
Le moteur de recherche le plus populaire est Google, avec
91,47 % des parts de marché. Google est suivi par Bing, qui
détient uniquement 3,24 % des parts de marché.
L’index de recherche de Google contient des centaines de
milliards de pages qui totalisent plus de 100 000 000
gigaoctets.
53,3 % du trafic web mondial est généré par la recherche.
Environ 99 000 recherches sont effectuées sur Google toutes les
secondes.
Une personne moyenne recherche sur Google 3 à 4 fois par jour.
29
[Link]
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
Exploration
Les robots d'exploration collectent les informations issues de
centaines de milliards de pages Web et les organisent dans
l'index de recherche Google.
À mesure que les robots d'exploration visitent ces sites Web,
ils recherchent des liens vers d'autres pages à parcourir.
Les webmasters peuvent donner des instructions plus
spécifiques pour le traitement des pages de leurs sites :
demander d'explorer des pages à nouveau ou désactiver
l'exploration à l'aide d'un fichier [Link]
30
Source : [Link]
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
Indexation
Une fois que Google trouve une page, il essaye de déterminer ce sur
quoi elle porte. Ce processus s'appelle l'indexation.
Il analyse le contenu de la page, catalogue les images et les fichiers
vidéo qui s'y trouvent, et exploite toute autre information disponible
pour identifier l'objet de cette page.
Lorsque Google indexe une page Web, il l'associe aux entrées des
différents mots affichés sur la page.
Ces informations sont rassemblées dans l'index Google, une énorme
base de données stockée sur un très grand nombre d'ordinateurs
L'index de recherche Google contient des centaines de milliards de pages
Web et sa taille est bien supérieure à 100 millions de gigaoctets.
31
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
Diffusion (et classement)
Lorsqu'un internaute saisit une requête, Google se base sur de
nombreux critères pour essayer de déterminer la réponse la
plus appropriée à partir de son index.
Il tient compte d'autres éléments, tels que la zone
géographique de l'internaute, sa langue ou son appareil
(ordinateur ou téléphone), pour optimiser l'expérience
utilisateur et fournir les réponses les plus pertinentes.
Par exemple, la recherche "atelier de réparation de vélo" ne génère
pas les mêmes résultats selon que l'internaute se trouve à Paris ou à
Hong Kong.
32
Source : [Link]
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
Avant :
Google recherchait simplement les mots correspondants
Par exemple, si vous avez recherché "pziza" - à moins qu'il n'y ait une page
avec cette faute d'orthographe particulière, vous devrez probablement
refaire la recherche avec l'orthographe correcte pour trouver une tranche
près de chez vous.
Aujourd’hui :
Google utilise les techniques d’apprentissage automatique pour
améliorer la recherche et ainsi rendre l’expérience utilisateur
meilleure
33
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
Aujourd’hui, avec l'apprentissage automatique:
Google peut reconnaître plus intuitivement si un mot ne semble
pas correct et suggérer une éventuelle correction
La recherche s'exécute sur des centaines d'algorithmes et de
modèles d'apprentissage automatique
Chaque algorithme et modèle a un rôle spécifique, et ils se
déclenchent à des moments différents et dans des
combinaisons distinctes pour aider à fournir les résultats les
plus utiles
34
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
Bert (2019) : un modèle pour comprendre le contexte des requêtes
Exemple : Pour la requête "pouvez-vous obtenir des médicaments pour
quelqu'un dans une pharmacie", BERT comprend qu’on essaye de
déterminer si on veut obtenir des médicaments pour quelqu'un d'autre.
35
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
De l'Indexation à la Synthèse
"Google ne trie plus seulement le web, il le lit et le résume."
L'outil : Les AI Overviews (Aperçu IA)
o En haut de la page de résultats, au lieu
d'une liste de liens, l'utilisateur voit un
bloc de texte structuré qui répond
directement à sa question.
o C'est le modèle Gemini qui réalise ce
travail de lecture massive. Il parcourt des
dizaines de pages web en une fraction
de seconde, élimine les redondances et
génère une synthèse. 36
FONCTIONNEMENT D’UN MOTEUR DE RECHERCHE
GOOGLE COMME EXEMPLE
La Multimodalité
L'outil : L'AI Mode (et Gemini Live)
Une interface où l'on interagit de manière fluide. On peut poser une question
à l'oral (Gemini Live), entourer un objet sur son écran (Circle to Search) ou
filmer une situation réelle.
La technologie : Contrairement aux anciens systèmes qui traduisaient les
images en texte pour les comprendre, Gemini est "natif multimodal".
Entrée : Mots-clés tapés au clavier
Entrée : Voix, Image, Vidéo via l'AI
37
Mode
RETRIEAVAL AUGMENTED GENERATION (RAG)
38
AGENTIC RAG
39
La recherche n'est pas un problème résolu
La compréhension de la langue reste un défi permanent, et cela
nous motive à continuer d'améliorer la recherche. Nous nous
améliorons toujours et travaillons pour trouver le sens de chaque
requête que vous nous envoyez et les informations les plus utiles
pour celles-ci.
(Google)
40