0% ont trouvé ce document utile (0 vote)
0 vues3 pages

TP2

Le document présente un TP sur la classification ascendante hiérarchique et les centres mobiles, utilisant des jeux de données comme iris, loup/chien, citycrime et cancer du sein. Il décrit des exercices pratiques sur l'analyse des données, la réalisation de CAH, l'utilisation de k-means, et l'interprétation des résultats. Les étudiants sont invités à appliquer des méthodes statistiques et à justifier leurs choix tout en analysant les résultats obtenus.

Transféré par

yahiridaniel684
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
0 vues3 pages

TP2

Le document présente un TP sur la classification ascendante hiérarchique et les centres mobiles, utilisant des jeux de données comme iris, loup/chien, citycrime et cancer du sein. Il décrit des exercices pratiques sur l'analyse des données, la réalisation de CAH, l'utilisation de k-means, et l'interprétation des résultats. Les étudiants sont invités à appliquer des méthodes statistiques et à justifier leurs choix tout en analysant les résultats obtenus.

Transféré par

yahiridaniel684
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

TP 2 : Classification Ascendante Hiérarchique et Centres

Mobiles

Exercice 1. (Données Iris)


On s’intéresse dans un premier temps à un jeu de données test appelé iris, que l’on peut charger
à l’aide de la commande data(iris). Ce jeu de données concerne l’étude de fleurs pour lesquelles
on dispose des variables [Link], [Link], [Link] et [Link],
mesurant respectivement les longueur et largeur des sépales et les longueur et largeur des
pétales. La variable Species est la variable d’appartenance à une espèce. On souhaite savoir
si la classification nous permet de retrouver la partition induite par la variable Species.

I. Classification ascendante hiérarchique

1. Réaliser une première analyse des données. Vous semble-t-il nécessaire de procéder à
une standardisation des données ? Vous justifierez votre réponse.

2. La fonction hclust permet de réaliser une CAH à partir d’une matrice de distance et
pour plusieurs critères d’agrégation. Effectuer la classification hiérarchique des données
iris en utilisant la distance euclidienne et le critère de Ward. Analyser les sorties du
logiciel et tracer le dendrogramme correspondant (fonction plot appliquée à l’objet issu
de hclust).

3. Tracer la courbe de perte de l’inertie inter-classes. Combien de groupes choisiriez-vous ?


Répéter la démarche en utilisant NbClust du package NbClust. Afficher les groupes à
l’aide de la fonction cutree.

4. Faire apparaître les groupes sur le dendrogramme à l’aide de la fonction [Link].

5. Comparer la classification obtenue avec la variable Species. Commentez les résultats


obtenus.

6. Représenter les résultats à l’aide de la fonction clusplot du package cluster (voir la


documentation de [Link]). Que représente cette visualisation ?

II. Agrégation autour de centres mobiles

1. La fonction kmeans donne le résultat de l’algorithme d’agrégation autour des centres


mobiles. En utilisant l’aide de la fonction, étudiez les principaux paramètres nécessaires
à son utilisation.

2. Effectuer la partition des données iris en 3 groupes. Analyser les sorties de la fonction
et représenter les résultats à l’aide de graphiques appropriés.

3. Relancer plusieurs fois la procédure. Que constatez-vous ?

1
4. L’argument nstart de la fonction kmeans permet d’exécuter l’algorithme avec plusieurs
initialisations et de retenir celle qui minimise l’inertie intra-classes. Appliquer cette ap-
proche avec 50 initialisations et commenter les résultats obtenus.

Exercice 2. (Données loup/chien)


On considère le jeu de données [Link] contenant des mesures pour 30 crânes de
chiens domestiques de haute taille et 12 crânes de loups. Sur ces crânes, on a mesuré la
longueur de la carnassière supérieure, la longueur et la largeur de la première molaire supérieure
(respectivement notées LoC, LoM et LaM).

1. Faire les représentations graphiques des variables deux à deux. Par la suite, pour les
représentations graphiques, on représentera LoC en fonction de LoM et LaM en fonction
de LoM.

2. Effectuer la CAH avec la distance euclidienne et les méthodes d’agrégation du saut max-
imal et de Ward sur le jeu de données privé de l’individu pour lequel l’espèce est incon-
nue. Combien de classes choisirait-on ?

3. Représenter les résultats de la classification. Ajouter l’individu "inconnu". D’après vous,


quelle pourrait être son espèce ?

4. Appliquer la méthode du coude version K-means : calculer l’inertie intra pour K = 1


jusqu’à une valeur suffisamment grande (par exemple 10 ou 15) et repérer le coude.
Commenter les résultats.

Pour aller plus loin : Expliquer l’intérêt de l’utilisation de la distance basée sur la cor-
rélation, puis réaliser une CAH en utilisant cette distance. Comparer les résultats avec
ceux obtenus en utilisant la distance euclidienne.

Exercice 3. (Données Citycrime)


Le jeu de données [Link] contient le nombre de crime pour 100000 habitants suiv-
ant leur type dans 16 villes américaines. Appliquer les différentes méthodes de classification
comme pour les applications précédentes. On justifiera soigneusement les choix faits pour
chacune d’entre elles. Interprétez les résultats obtenus.

Exercice 4. (Données de cancer du sein)


Nous nous intéressons pour cela au jeu de données [Link] concernant des pa-
tientes atteintes de cancer du sein. Plusieurs variables génériques sur les patientes sont don-
nées (âge, statut ménopause) ainsi que des variables liées à la maladie (taille de la tumeur,
nombres de noeuds lymphatiques metastasés, capsule lymphatique metastasée, degré de ma-
linité, sein affecté, quart affecté, irradiation).
1. Pour l’ensemble du jeu de données, construire le tableau disjonctif complet associée à
l’ensemble des variables (on pourra utiliser la fonction [Link] du package
ade4 ou la fonction [Link] du package FactoMineR).

2. En utilisant la fonction χ2 du TP1, calculer la matrice distance associée à ce jeu de don-


nées.

3. Réaliser le partitionnement des individus en classes.

2
4. Analyser les résultats obtenus en utilisant des projections factorielles. On rappelle que
pour le cas de données qualitatives, la technique adaptée pour le calcul des projec-
tions factorielles est l’AFCM. On pourra utiliser les fonctions [Link] (ade4) ou MCA
(FactoMineR).

Vous aimerez peut-être aussi