0% ont trouvé ce document utile (0 vote)
30 vues3 pages

Interprétation d'un Dendrogramme de Clustering

Le document présente un dendrogramme issu d'un clustering hiérarchique, illustrant la manière dont les données sont regroupées en clusters selon leur similarité. Il explique comment interpréter les regroupements, la séparation et la densité des clusters, ainsi que l'homogénéité et l'hétérogénéité entre eux. Pour déterminer le nombre optimal de clusters, il est conseillé de couper le dendrogramme à une hauteur appropriée en fonction des objectifs de regroupement.

Transféré par

hrvenana
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
30 vues3 pages

Interprétation d'un Dendrogramme de Clustering

Le document présente un dendrogramme issu d'un clustering hiérarchique, illustrant la manière dont les données sont regroupées en clusters selon leur similarité. Il explique comment interpréter les regroupements, la séparation et la densité des clusters, ainsi que l'homogénéité et l'hétérogénéité entre eux. Pour déterminer le nombre optimal de clusters, il est conseillé de couper le dendrogramme à une hauteur appropriée en fonction des objectifs de regroupement.

Transféré par

hrvenana
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

Ce graphique est un dendrogramme issu d'un clustering hiérarchique.

Il représente comment
des données sont regroupées progressivement en clusters (groupes) en fonction de leur similarité.
Supposons que nous avons un jeu de données avec deux dimensions (x et y) et un clustering
hiérarchique effectué avec k = 4 clusters.
ANALYSE DU DENDROGRAMME
Les feuilles (en bas) représentent les observations individuelles.
Les branches montrent comment les observations ou les groupes sont fusionnés.
Plus deux points sont connectés bas, plus ils sont similaires.
L’axe vertical indique la distance ou la dissimilarité entre les clusters lorsqu'ils sont
fusionnés.
Une fusion à faible hauteur signifie des groupes très similaires, tandis qu'une fusion à
grande hauteur indique des groupes plus différents. Ici, nous avons 8 groupes
hétérogènes.
Pour déterminer le nombre optimal de clusters, on peut tracer une ligne horizontale et
observer où elle coupe les branches.
Par exemple, une coupe à hauteur 10 pourrait former environ 4 à 5 clusters distincts.
INTERPRETATION DES REGROUPEMENTS
 Les groupes qui se forment plus tôt (à des niveaux bas) sont très homogènes. Chaque
point sur le graphique représente une observation ou un enregistrement de notre jeu de
données.
 Les regroupements qui se forment plus tard (à des niveaux élevés) sont plus
hétérogènes.
 Si on cherche des groupes homogènes, il vaut mieux couper le dendrogramme à une
hauteur basse.
 Si on cherche des groupes plus larges mais hétérogènes, on peut couper à une hauteur
plus élevée.
 Séparation entre les clusters : Si les clusters sont bien séparés visuellement, cela
suggère que le modèle de clustering hiérarchique a bien divisé les données en groupes
distincts. Plus les points d'un même cluster sont proches les uns des autres, plus le
regroupement est cohérent. Si les clusters sont largement séparés, cela peut indiquer
que les variables utilisées dans le clustering expliquent bien les différences entre les
groupes. Si les clusters sont mal séparés (points de couleurs mélangées ou
chevauchantes), cela pourrait suggérer que la séparation des données n'est pas très
nette, ce qui peut signifier que les variables choisies ne sont pas suffisantes pour créer
des distinctions claires entre les groupes.
 Densité des clusters : Si un cluster est plus dense (plus de points dans un espace plus
restreint), cela peut signifier que ce groupe est homogène et que ses membres
partagent des caractéristiques communes. Un cluster plus large ou moins dense peut
représenter un groupe plus varié, ce qui peut signifier que ce groupe est plus diversifié
et nécessite peut-être plus de segmentation.
 Homogénéité dans les clusters : Si les points au sein de chaque cluster sont
relativement proches les uns des autres, cela indique que les observations dans chaque
cluster sont similaires entre elles, ce qui est l'objectif du clustering.
 Hétérogénéité entre les clusters : Si les clusters sont bien distincts, cela peut signifier
que les groupes sont suffisamment différenciés sur la base des dimensions utilisées.
Cela pourrait suggérer qu'il y a des différences substantielles dans les caractéristiques
des groupes.

Vous aimerez peut-être aussi