Recherche sur Internet
• La recherche d'information (RI) est historiquement liée aux sciences de l'information et à la
bibliothéconomie.
• La RI vise à représenter des documents et à récupérer des informations par la construction
d'index.
• Avec le développement de l'Informatique, la RI est devenue numérique.
• La RI est une préoccupation primordiale de l'informatique, qui cherche à trouver des
documents pertinents dans un ensemble volumineux (Big DATA).
• La RI consiste à trouver des documents peu ou faiblement structurés dans une grande
collection, en fonction d'un besoin d'information.
• La RI est la science qui étudie la manière de répondre pertinemment à une requête en
retrouvant l'information dans un corpus.
• La RI a pour thème central l'étude des modèles et systèmes d'interaction entre utilisateurs
humains et documents numériques pour satisfaire des besoins d'information.
RI et Information structurée
• La RI fut d'abord le domaine des spécialistes des Sciences de l'Information.
• Généralement, l'information est non structurée, par exemple, l'information textuelle.
• L'informatique était une science de l'information structurée.
• La RI affrontait l'information textuelle, non structurée ou semi-structurée.
• Ce type d'information est caractérisé par l'ambiguïté et l'incertitude difficiles à gérer.
• En général, la RI traite de l'information non structurée, surtout de l'information "naturelle",
avec toute sa complexité.
Les Types d'Information
• Actuellement, avec le développement des approches scientifiques, l'informatique s'occupe
de trois types d'information.
• L'information structurée est facile à manipuler, avec une nature et une fonction bien
identifiées.
• L'information structurée se trouve dans les bases de données et les langages informatiques.
• Les informations structurées sont disposées de façon à être traitées automatiquement et
efficacement par un logiciel.
• Un courriel est transmis sur Internet dans une forme non structurée, contenant une
combinaison d'informations non structurées (corps du message) et structurées (date, auteur,
etc.).
• Une partie du courriel s'adresse à un humain, l'autre à une machine.
• Une page web a une caracteristique semblable, une partie de son contenu s'adresse à
l'humain (texte non structurées), et l'autre partie est destinée à la machine (balises
structurées).
• Les Informations non structurées et semi structurées représentent un problème complexe
qui constitue Le domaine de la Recherche d'Informations.
• Actuellement, le développement des outils de gestion des informations non et semi
structurés est en rapide croissance..
Manipulation de l'Information
• L'information structurée est facile à manipuler, tandis que l'information non structurée est
difficile.
• Il est difficile de trouver automatiquement le nombre de postulants ayant un baccalauréat
dans un CV textuel.
• Il est difficile de trouver un rapport écrit en 2001 sur la nouvelle politique concernant les
départs à la retraite.
• Il est difficile de trouver la définition de l'expression << abus législatif >> dans un ensemble
de documents juridiques.
• Il est difficile de trouver la photographie de son enfant, qui a été prise le jour de son dernier
anniversaire.
• Il est difficile de trouver la dernière fois que le cours de ses actions a connu une hausse
subite.
La Recherche d'Information (RI)
• La recherche d'information est une branche de l'informatique qui s'intéresse à l'acquisition,
l'organisation, le stockage, la recherche et la sélection d'information.
• La RI est l'ensemble des méthodes et techniques pour l'acquisition, l'organisation, le
stockage, la recherche et la sélection d'information pertinente pour un utilisateur.
Collecte des informations pertinentes
• Les opérateurs booléens "ET", "SAUF", "OU" sont utilisés pour collecter des informations
pertinentes.
• "ET" exige que les documents correspondent aux deux termes.
• "SAUF" exclut un terme spécifique.
• "OU" exige que les documents incluent au moins un des deux termes.
Analyse des mots-clés
• S'il y a trop de résultats, il faut être plus précis et utiliser un vocabulaire technique, ou des
opérateurs de recherche.
• En cas d'insuffisance de résultats, utiliser un vocabulaire plus large et général, ou alléger
l'équation.
Éléments clés en RI
• Les éléments clés de la recherche d'informations sont : les documents, le contenu des
documents, le besoin d'information d'un utilisateur et la satisfaction de ce besoin.
• Les differents types d'information par média comprennent : textes, images, vidéos,
documents structurés, livres, articles, lettres, images par rayons X, photographies,
graphiques, document complet, élément de structure (chapitre, section, paragraphe,
phrase), passage (fenêtre de x mots dans un texte), vidéo, un plan, une image.
• Les deux classes d'information sont : la méta-information (information à propos du
document, comme le titre, l'auteur, la date de création, structure, organisation du contenu,
structure logique, liens, etc.) et le contenu (le document initial, ou l'information extraite du
contenu brut).
• Une requête correspond à la traduction du besoin d'information de l'utilisateur dans un
langage d'interrogation du SRI.
• La requête est constituée d'une liste de mots-clés, de termes du langage naturel ou d'un
graphique.
• Le système doit être simple à utiliser, fournir les meilleures réponses possibles qui doivent
être pertinentes pour l'utilisateur, un nombre raisonnable de réponses dans des délais
rapides.
• La simplicité d'utilisation et la rapidité sont difficiles à réaliser.
• La notion de pertinence peut être appréhendée à deux niveaux.
• Au niveau utilisateur, la pertinence correspond à la satisfaction de l'utilisateur par rapport à
l'ensemble des documents restitués par le SRI (pertinence subjective, cognitive).
• Au niveau système, le système mesure un degré de pertinence, une valeur de similitude
entre un document et une requête.
• Le but d'un SRI est de rapprocher la pertinence système de la pertinence utilisateur.
Bref aperçu historique de la RI
• 1940 : Apparition des SRI, focalisation de la RI sur les applications dans des bibliothèques.
• 1950 : Le modèle booléen est apparu, avec l'élaboration de petites expérimentations sur de
petites collections de documents.
• 1960 et 1970: Le système SMART (G. Salton, 1971), le développement d'une méthodologie
d'évaluation de système et la conception de corpus de test pour évaluer des systèmes
différents ont été introduits.
• 1980 : Le développement de l'intelligence artificielle a permis d'intégrer des techniques de
l'IA en RI (système expert).
• 1990 et 1995 : L'apparition d'internet a modifié la RI et sa problématique (traitement des
documents multimédia).
RI et Bases de données
• L'information dans une base de données est structurée par des schémas prédéfinis à l'avance
par des relations (exemple: Auteur(Livre, Nom).
• Une information peut être facilement retrouvée par une requête (ex. select Livre from
Auteur where Nom = "DIB").
• Seule une partie des spécifications du document RI est structurée.
• Un SGBD peut être utilisé pour rechercher des attributs externes.
Difficultés dans la RI
• La RI est basée essentiellement sur le contenu.
• Le contenu n'a pas de structure donc il est impossible d'extraire une relation.
• Mesurer la pertinence d'un SRI est une difficulté.
• La Précision et le Rappel est un moyen permettant de mesurer la pertinence car la notion de
valeur de plausibilité est assez vague.
• La Précision représente le nombre des documents renvoyés sont Pertinents, c'est la
proportion des documents pertinents parmi l'ensemble de ceux renvoyés par le système.
• Un système de RI aura beaucoup de rappel s'il renvoie la plupart des documents pertinents
du corpus pour une question, c'est la proportion de documents pertinents renvoyés par le
système parmi tous ceux qui sont pertinents.
• Il y a une forte relation entre Précision et Rappel: quand l'un croît, l'autre décroît.
Indexation
• L'indexation est, de manière simplifiée, le processus de manipulation d'un document pour
produire un index.
• Il existe deux approches pour l'indexation : naïve et basée sur un index.
• L'approche naïve consiste à balayer les documents séquentiellement et les comparer avec la
requête.
• L'approche basée sur une indexation nécessitent des prétraitements sur les documents et les
requêtes.
• La production d'un index permet de retrouver rapidement les documents incluant les mots
demandés.
• Un index est une structure qui donne, pour chaque mot trouvé dans un corpus, la liste des
documents où il se trouve et/ou la position des mots dans les documents.
• L'indexation peut concerner la représentation des documents ou des requêtes.
• L'indexation a pour rôle d'extraire à partir d'un document ou d'une requête, une
représentation paramétrée qui couvre au mieux son contenu sémantique.
• Elle utilise une déscription brute de Requête ou Document pour créer la Représentation
Structurée (Documents ou Requête) : des descripteurs (éléments « clés » du document ou de
requête).
• La qualité de la recherche dépend en grande partie de la qualité de l'indexation.
• Si l'information est un texte, le descripteur est : une liste de termes ou groupe de termes
significatifs pour l'unité textuelle correspondante.
• Elle doit permettre de sélectionner des représentants du document (mots clés).
• Ces représentants permettent de décrire le contenu (la sémantique) du document et de la
requête de façon assez précise.
• L'extraction des caractéristiques de l'information est un point commun entre les méthodes
d'indexation.
• Avec l'indexation par le contenu, l'indexation est réalisée sur le contenu graphique de
l'image, c'est-à-dire les formes, les couleurs, les textures.
• Cela consiste, après l'analyse de tous les pixels, à décrire classiquement les images rendant
compte de leur texture, couleur, forme.
• L'indexation texte permet spécifier des champs tels que ISBN, Auteur, Titre, Editeur, Date et
Contenu.
• L'indexation peut être manuelle, semi-automatique, ou automatique.
• Chaque document est analysé par un documentaliste ou un spécialiste du domaine étudié
dans l'indexation manuelle.
• L'indexation manuelle exige un effort et prend beaucoup de temps, car basé sur le thésaurus,
le lexique.
• Un premier processus automatique permet d'extraire les termes du document, ensuite un
spécialiste du domaine choisira les termes significatives de la sélection précédente dans
l'indexation semi-automatique.
• L'indexation automatique est un processus complètement automatisé à l'aide d'un processus
adéquat.
• Les étapes d'indexation sont : le segmentateur, la normalisation linguistique, l'indexeur et le
fichier d'indexation.
• La segmentation consiste à diviser un texte en unités lexicales (token) élémentaires.
• Dans la normalisation linguistique, les séparateurs (caractères blancs, ponctuations)
identifient les chaînes de caractères comme étant des mots ainsi qu' un correction des fautes
d'orthographe et des erreurs de saisie.
• Diverses options comme élimination des mots vides (les articles, les conjonctions de
coordination, les verbes auxiliaires etc....), racinisation, lemmatisation ,extraction des mots
composés(« canne à pêche ») sont mis en en œuvre.
• En pondération on statistique la fréquence d'occurrence de chaque mot dans le document.
• Un mot récurrent aura un plus au poids.
• Un système de recherche d'informations (SRI, base de données documentaires) permet
d'analyser, d'indexer et de retrouver les documents pertinents répondant à un besoin d'un
utilisateur.
• Un exemple d'indexation : soit "systeme 1,recherc 1, informa 1, documen 3, sri 1, base 1,
donnee 1, analyse1, indexer 1, retrouv 1, pertine 1, reponda 1, besoin 1, utilisa 1".
• Après analyse de documents d'un corpus, on obtient un tableau index dit direct document
terme, pour utilisation en tableau direct << document -> terme ».
• Ces mots sont ensuite stockés dans une structure appelée fichier inverse.
• La Génération d'un tableau inverse inverse << terme -> document » (appelé fichier inverse)
Approches d'indexeur
• L'indexeur sélectionne les index et leur associe une pondération, assignant aux termes leur
degrés d'importance dans les documents.
• Approche basée sur la fréquence d'occurrences (loi de Zipf).
• Approche basée sur la valeur de discrimination.
• Approche basée sur tf*idf.
• Les mots sont classés dans l'ordre décroissant de leurs fréquences puis on leur affecte un
numéro de rang (1, 2, ...), rang * fréquence = constante.
• La loi de Zipf est utilisée pour déterminer les mots qui représentent au mieux le contenu d'un
document.
• La conjecture de Luhn est basée sur la loi de Zipf et elle mesure l' Informativité.
• Dans la conjecture de Luhn, les termes de rang faible (très fréquents) et élevés (très rares)
nesont pas pertinents,les descripteurs pertinents sont les termes de rang intermédiaire
• Il ne faut pas garder tous les mots les plus fréquents.
• On définit un seuil maximal pour élminer les mots trop fréquents
• Dans la RI, l'informativité est utilisée de façon intuitive est ce que les mots ont des
fréquences entre les deux seuils et sont considérés ayant l'informativité est la plus élevée
Indexation: Phase 3 (Approche basée sur la valeur de discrimination)
• Un terme est dit discriminant s'il distingue bien un document des autres.
• Un terme qui apparaît dans tous les documents n'est pas discriminant.
• Le poids du terme tj dans V est la moyenne de ses poids dans les documents
• Mesure du degré de similarité, de l'uniformité du corpus
• Uniformisation du poids du terme en question tk à o (zéro).
• La valeur de discrimination est v =U2-U1
Indexation : TF et IDF
• TF représente la fréquence d'apparition du terme d'indexation ou représente le nombre
d'occurrences du terme d'indexation dans un document.
• IDF représente la fréquence inverse d'apparition du terme d'indexation dans a collection
globale d'unités documentaire; cela donne un poids plus important aux termes les moins
fréquents.
• La combinaison des deux mesures donne une bonne approximation de l'importance du
terme dans le document.
• On considère l'importance du terme dans l'ensemble du corpus,Dans le schéma TF-IDF, elle
vise à donner un poids plus important aux termes les moins fréquents, considérés comme
plus discriminants d'où le nom inverse.
• Un terme est dit discriminant s'il distingue bien un document des autres document (ex: le
terme apparait dans un seul document).
• TF-IDF permet d'évaluer l'importance d'un terme contenu dans un document, relativement à
une collection ou un corpus, basé sur le fait que, + un terme est présent dans un document,+
il est représentatif du contenu du document (TF).
• TF, + une occurrence de terme est significative (IDF). Il varie en fonction de la fréquence du
mot dans le corpus
• Tf: désigne l'importance d'un terme pour un document ou bien la fréquence d'un terme dans
un document.
• Idf: mesure si le terme est discriminant (ou non-uniformément distribué), sa fréquence dans
le corpus de documents
• Il peut prendre des variations «brute», binaire (1 ou O) pour l'existance ou non et enfin la
Normalization.
• Pondération avec calcul de score d'un document avec des fonctions telle les fonctions avec
taille, Okapi et Logarithne variant.
• Dérivation des formules logarithmiques et comparaison et des deux documents et les
requêtes,
• Le premier document apparaît comme « le plus pertinent ». (plus élevé logarithmaiquement)
Les modèles de RI
• Les modèles de RI manipulent les besoins, les documents, les termes, les jugements de
pertinence et les utilisateurs.
• Les modèles de RI se distinguent par le principe d'appariement (matching) :appariement
exact /approché (Exact /Best matching).
• L'appariement exact nécessite Des Requêtes structurées et difficiles à écrire, et les difficultés
augmentent avec la taille de la collection..
• Dans L'appariement exact la sélection est basées est basée sur une décision [Link]
résultat est un ensemble de documents non ordonnés
• En appariement approché,,les meilleures performances sont dans les premiers documents
avec Des Requêtes décrivant les critères de recherche dans un documentLe résultat est un
ensemble de documents pondérés
• La difficulté d'appariement exact augmente avec le nombre de documents potentiels
retournés..
• Les différents modèles de la RI comprennent les modèles booléen, vectoriel, probabiliste,
connexionniste (réseaux de neurones), inférence (réseau d'inférence bayésien) et LSI (Latent
Sementic Indexing)..
• Ce modèle est basé sur la théorie des ensembles.
• Dans ce modèle, un document est représenté comme une conjonction d=t^t^...t
• L appariement est Exact basé sur la présence ou l'absence des termes de la requête dans les
documents de termes (non pondérés).
• Les expressions de recherche logique comprennent
• Ce modèle ne permet pas de définir la notion de ressemblance.
• Le modèle comprend différents opérateur q = t₁ A(t2 V-t3) et de calcule le résultat selon un
arbre.
Les modèles de RI : modèle vectoriel
• Ce modèle utilise desvecteurs dans l'espace engendré par tous les termes de la collection de
documents pour faire le calcule du degré de similarité entre documents et requêtes
• Le poids du terme ij dans le document et la requête sont calculé
• La pertinence est déduite de ces vecteurs et leurs similarité
• Une requête est également représentée par un vecteur.
• Une collection de n documents et M termes distincts peut être représentée.
Le modèle booléen étendu
• Prendre en compte l'importante des termes dans les documents et/ou dans la requête,
Possibilité d'ordonner les documents sélectionnés avecDeux modèles : Modèles flou et
booléen étendu
• L'appariement se fait avec des approximations.
• On associe des poids w aux termes d'indexation avec un degré de pertinence requête et
documents
• On exécute des fonction booléan simple A et B et des fonctions de distance
• Le modèle booléen based sur les ensembles flous Un document a des termes qui sont
pondéres selon le Lukaswicz and Zadeh (selon si un élément et dans une requête ou non
Les modèles de RI : modèle booléen basé sur les ensembles flous
Un document comprend des termes qui sont pondérés Dans ce modèle on détermine selon
évaluation et le Lukaswicz ou Zadeh (selon si un élément et dans une requête ou non On prend les
valeurs les plus élevé et basse et les fonction sont des échelles selon les opérateurs
Autre
• Indexation : TF représente la fréquence du terme dans un document(TF) et IDf le terme dans
la collection ( IDF)
• Basées sur des fréquences : + un terme est présent dans un document+ il est représentatif du
contenu du document – une occurrence de terme est significative (IDF)