0% ont trouvé ce document utile (0 vote)
0 vues2 pages

tp7ML

Ce document présente un TP sur le K-means clustering, incluant des instructions pour préparer l'environnement et utiliser des bibliothèques Python comme Pandas, NumPy, Matplotlib, Seaborn et scikit-learn. Il décrit le principe du K-means, ses avantages et limites, ainsi que les méthodes d'évaluation de la qualité du clustering. En conclusion, bien que le K-means soit efficace pour le regroupement de données, son succès dépend de la sélection appropriée des paramètres et des caractéristiques des données.

Transféré par

esra belhassen
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
0 vues2 pages

tp7ML

Ce document présente un TP sur le K-means clustering, incluant des instructions pour préparer l'environnement et utiliser des bibliothèques Python comme Pandas, NumPy, Matplotlib, Seaborn et scikit-learn. Il décrit le principe du K-means, ses avantages et limites, ainsi que les méthodes d'évaluation de la qualité du clustering. En conclusion, bien que le K-means soit efficace pour le regroupement de données, son succès dépend de la sélection appropriée des paramètres et des caractéristiques des données.

Transféré par

esra belhassen
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

TP Machine Learning : K-means Clustering

Enseignant : Mouheb Mehdoui

Partie 1 : Instructions
1. Préparation de l’environnement
Ouvrir Google Colab ou Jupyter Notebook et créer un nouveau notebook.
2. Importer le fichier [Link] via le menu Fichier.

3. Complétez chaque cellule selon les instructions fournies pour réaliser les tâches.

Partie 2 : Bibliothèques utilisées


Pour ce TP, nous utiliserons des bibliothèques Python pour l’analyse de données et la modélisation :

• Pandas : import pandas as pd


Pour manipuler les données sous forme de DataFrames.

• NumPy : import numpy as np


Outils de calcul scientifique pour les tableaux multidimensionnels.
• Matplotlib et Seaborn : import [Link] as plt et import seaborn as sns
Pour visualiser les données.

• scikit-learn : from [Link] import KMeans


Fournit des outils pour la mise en œuvre de l’algorithme K-means et autres algorithmes de machine
learning.

Partie 3 : Rappel sur le K-means Clustering


Le K-means clustering est une méthode de partitionnement non supervisée qui vise à regrouper les
données en k clusters basés sur leur similarité.

Principe du K-means Clustering: Le K-means fonctionne en :

1. Initialisation : Choisir k centres de clusters (aléatoirement ou avec une méthode spécifique comme
k-means++).
2. Assignation : Chaque point de données est assigné au cluster dont le centre est le plus proche
(basé sur la distance euclidienne).

3. Mise à jour : Les centres des clusters sont recalculés comme la moyenne des points assignés à
chaque cluster.
4. Répétition : Répéter les étapes 2 et 3 jusqu’à convergence (les centres des clusters ne changent
plus ou un critère d’arrêt est atteint).

Avantages et Limites du K-means: Avantages :


• Simplicité d’implémentation et rapidité d’exécution.

• Efficace pour des données de grande taille lorsque k est bien choisi.
Limites :

1
TP Machine Learning K-means Clustering Enseignant : Mouheb Mehdoui

• Sensible aux valeurs aberrantes et aux données bruitées.


• Nécessite de spécifier k à l’avance.
• Suppose des clusters de forme sphérique et de tailles similaires.

Évaluation du K-means: Pour évaluer la qualité du clustering, nous utilisons des métriques telles que
:

• Inertie intra-cluster : Somme des distances au carré entre les points et leurs centres de clusters
respectifs.

• Indice silhouette : Mesure le degré de séparation entre les clusters.

Conclusion
Le K-means clustering est une méthode efficace et largement utilisée pour des tâches de regroupement
de données. Cependant, son efficacité dépend fortement de la bonne sélection des paramètres et des
caractéristiques des données analysées.

Vous aimerez peut-être aussi