Topic Model
Modèle par thème
Enseignant : Sonia Gharsalli
1
• La dimensionnalité est un problème en fouille de textes.
=> La représentation des documents dans un espace intermédiaire préservant
la proximité entre eux peut être une des solutions permettant de réduire les
dimensions.
2
• Topic Model : L’espace correspond à un ensemble de « topics » (thèmes)
définis par les termes avec des poids élevés, et qui permettent de décrire les
documents dans un nouvel espace de représentation.
=> Les documents peuvent être associés à des divers degrés à des topics (ex.
un ouvrage de machine learning sous Python)
3
Topic Model: exemple
• Indexation des mails
4
Topic Model: exemple
• Analyse des documents : Recherche des Topics de chaque document
5
Topic Model: exemple
Food
Animals
6
Topic Model
7
Matrice documents termes, Le nombre de termes p est souvent très élevé
Changement vers un espace de thèmes
Un terme peut appartenir à plusieurs
thèmes. Mais, avec des degrés différents.
=> Un Topic est une combinaison linéaire de
plusieurs termes avec des probabilités
différentes.
8
Description des documents dans
l’espace des topics.
On un a un réel avantage si K << p ;
=> On peut associer une sémantique
aux topics.
9
LATENT SEMANTIC INDEXING
(LSI)
10
LATENT SEMANTIC INDEXING (LSI)
• Le LSI est une technique qui élabore un espace de représentation
synthétique préservant au mieux les propriétés des données, en particulier
les distances entre les termes.
• C’est une technique factorielle équivalente à l’ACP (analyse en composantes
principales) où les variables ne sont ni réduites, ni centrées. Avec les mêmes
objectifs et les mêmes outils pour évaluer la qualité de représentation.
=> Les outils d’interprétation sont : qualité de représentation des termes et
des documents sur les facteurs ; contribution des termes et des documents
aux facteurs
11
LSI: Calcul Matriciel
Corpus de 3 documents (Grossman, page 71): Matrice termes-documents M
12
• Principe en décomposition en valeurs singulières SVD
• Pour exprimer la fidélité de représentation d’un facteur 𝐹𝑘 , nous
calculons l’équivalent de la valeur propre d’une ACP
13
Nouvelle représentation
Topic1 Topic2
doc1 doc2 doc3
14
Nouvelle représentation
=> Plus le terme (document) est loin de l’origine plus il contribue
15
• Pour positionner un nouveau document, il faut le projeter sur le même plan
(k=2)
Q: « gold silver truck »
16
Reconstitution du tableau termes/documents
Il est possible d’approximer le tableau de données initial dans l’espace de
représentation réduit.
La SVD peut être vue comme un système de compression des données avec pertes (la reconstitution est
approximative, mais la qualité peut être modulée).
Le gain en espace de stockage n’est intéressant que si 𝒌 ≪ 𝐦𝐢𝐧(𝒑, 𝒏)
17
• Que pensez-vous de la reconstitution du tableau termes/documents pour
k = 2?
Si on applique un seuil = 0,5, alors
on peut revenir au tableau initiale
18
Remarques:
• La méthode LSI repose sur la décomposition en valeurs singulières de la
matrice termes documents => valable quelle que soit la pondération utilisée.
• Les topics (facteurs) sont définis par les termes à divers degrés.
• Il est possible de positionner les documents dans le nouvel espace de
représentation
19
ANALYSE FACTORIELLE DES
CORRESPONDANCES
20
AFC: Analyse Factorielle des Correspondances
• L’AFC s'utilisent pour décrire et hiérarchiser les relations statistiques qui
peuvent exister entre des individus placés en ligne et des variables placées
en colonnes dans un tableau
• La spécificité de l’AFC est qu’elle considère en même temps un nuage de
point représentant les lignes (individus) et un autre représentant les
colonnes (variables).
21
• L’AFC a précisément pour but de projeter le nuage des v points-termes
associée à la configuration pondérée (f, Dχ), de haute dimensionnalité, dans
un espace plus petit, typiquement à 2 dimensions, afin de pouvoir le
visualiser – tout en veillant à conserver un maximum de dispersion ∆
22
AFC
• L’AFC peut s’appliquer à tout tableau croisé de valeurs positives ou nulles dès lors que les
notions de marge et de profils ont un sens.
• C’est le cas pour la matrice termes documents, en particulier pour les pondérations
binaires et fréquences d’apparition d’un terme.
Pondération fréquence
d’apparition
23
1/5 1/4
2/13
1/2 1/2
𝑃(𝑡𝑒𝑟𝑚𝑒 ∕ 𝑑𝑜𝑐𝑢𝑚𝑒𝑛𝑡) 𝑃(𝑑𝑜𝑐𝑢𝑚𝑒𝑛𝑡 ∕ 𝑡𝑒𝑟𝑚𝑒)
4/13 5/13
24
Distances entre profils
Distance KHI 2
Distances entre termes
(distances entre profils lignes)
Distances entre documents
(distances entre profils colonnes)
25
Détection du nombre adéquat de facteurs
²
Avec K: termes et L : documents
Qualité de représentation (COS²) et contribution aux facteurs (CTR)
Profils sur les termes
Profils sur les colonnes
26
positionnement relatif des termes (profils des lignes)
positionnement relatif des documents (profils des colonnes)
27
Association termes-Documents
On peut mesurer l’association via la statistique du KHI-2 d’écart à
l’indépendance
28
• La matrice R des résidus standardisés permet
de situer les attractions et répulsions entre les
termes et les documents.
La contribution au KHI-2 permet de
mesurer l’impact des associations dans
la quantité d’information globale
Une grande partie de l’information vient des attractions
29
(D2, silver) et (D1, [damaged, fire]).
Représentation simultanée
• La représentation simultanée est possible grâce aux relations de transition c.-à-d. il est
possible d’obtenir les coordonnées d’une modalité colonne à partir des coordonnées de
l’ensemble des modalités lignes, et inversement.
30
AFC: résumant
• On cherche à produire des vecteurs de projections de manière à ce que la dispersion des
modalités lignes (colonnes) soit la plus grande possible sur l’axe.
• La dispersion doit être la même pour les modalités lignes et les modalités colonnes.
• Les facteurs sont orthogonaux deux à deux.
• L’AFC permet de positionner les termes entre eux (en fonction des documents qui les
contiennent) et les documents entres eux (en fonction des termes qu’ils contiennent).
• Elle permet aussi de situer les associations termes – documents.
31
LATENT DIRICHLET
ALLOCATION (LDA)
32
LDA
• Modèle probabiliste génératif : modéliser le processus de génération des
données c.-à-d. des paires documents-termes à l’aide de facteurs latents
(sous-jacents) => Modèle de mélange
La modélisation va nous
fournir les éléments en
vert.
33
LDA
• Le changement de représentation est intéressant dans le cas où K nombre
de topics << p nombre de termes.
• Hypothèse de travail: Les topics ne sont pas censés être corrélés entre eux.
• Distribution des termes (j) pour chaque topic (k) : distribution de Dirichlet
symétrique de paramètre 𝛿.
avec Sélectionner le topic (k) pour le terme (j)
34
• Distribution des topics pour chaque document (Dirichlet)
Sélectionner le topic pour chaque couple terme document
35
• L’estimation des paramètres de la LDA passe par l’estimation des distributions des
variables latentes à partir des données observées (posterior inference). On peut le voir
sous l’angle de la maximisation de la log-vraisemblance. Nous passons par des
heuristiques
• Gibbs sampling est une méthode de Monte-Carlo. Elle commence par assigner
aléatoirement les topics puis, sur des échantillons, calcule les distributions
conditionnelles et assigne les topics aux termes selon une certaine probabilité. On
recommence un grand nombre de fois pour obtenir une bonne approximation des
distributions.
• Algorithme EM (espérance-maximisation), un algorithme itératif comprenant deux
phases : espérance (E), calcul de l’espérance de la vraisemblance à valeurs des
paramètres fixés ; maximisation (M) : calcul des paramètres maximisant la vraisemblance
obtenue à l’étape E. On répète jusqu’à convergence.
36
Topic 1 est avant tout déterminé par les termes « arrived » et « Pas très convaincant sur cet
silver », Topic 2 par les termes « gold » et « truck » exemple. Mais on se rend compte
surtout que les documents sont
placés dans un nouvel espace de
représentation, celui des topics.
=> On peut appliquer d’autres
algorithmes pour avoir plus de
visibilité sur leur classification par
exemple. 37
=> Pas de « surprises » ici, les termes sont associés aux mêmes topics, quels que soient
les documents
38
• La LDA permet de mettre en évidence un ensemble de « topics » sous-
jacents qui régissent un ensemble de documents.
• Les topics sont décrits dans l’espace des termes. Les documents peuvent
être décrits dans l’espace des topics.
• Il existe un mécanisme pour la projection des documents supplémentaires
dans l’espace des topics (puisque nous disposons de la description des
topics dans l’espace des termes).
• Le choix du nombre de topics (K) reste un problème ouvert (ex. graphique
de décroissance de la déviance en fonction du nombre de topics).
39