TP Machine Learning : K-means Clustering
Enseignant : Mouheb Mehdoui
Partie 1 : Instructions
1. Préparation de l’environnement
Ouvrir Google Colab ou Jupyter Notebook et créer un nouveau notebook.
2. Importer le fichier [Link] via le menu Fichier.
3. Complétez chaque cellule selon les instructions fournies pour réaliser les tâches.
Partie 2 : Bibliothèques utilisées
Pour ce TP, nous utiliserons des bibliothèques Python pour l’analyse de données et la modélisation :
• Pandas : import pandas as pd
Pour manipuler les données sous forme de DataFrames.
• NumPy : import numpy as np
Outils de calcul scientifique pour les tableaux multidimensionnels.
• Matplotlib et Seaborn : import [Link] as plt et import seaborn as sns
Pour visualiser les données.
• scikit-learn : from [Link] import KMeans
Fournit des outils pour la mise en œuvre de l’algorithme K-means et autres algorithmes de machine
learning.
Partie 3 : Rappel sur le K-means Clustering
Le K-means clustering est une méthode de partitionnement non supervisée qui vise à regrouper les
données en k clusters basés sur leur similarité.
Principe du K-means Clustering: Le K-means fonctionne en :
1. Initialisation : Choisir k centres de clusters (aléatoirement ou avec une méthode spécifique comme
k-means++).
2. Assignation : Chaque point de données est assigné au cluster dont le centre est le plus proche
(basé sur la distance euclidienne).
3. Mise à jour : Les centres des clusters sont recalculés comme la moyenne des points assignés à
chaque cluster.
4. Répétition : Répéter les étapes 2 et 3 jusqu’à convergence (les centres des clusters ne changent
plus ou un critère d’arrêt est atteint).
Avantages et Limites du K-means: Avantages :
• Simplicité d’implémentation et rapidité d’exécution.
• Efficace pour des données de grande taille lorsque k est bien choisi.
Limites :
1
TP Machine Learning K-means Clustering Enseignant : Mouheb Mehdoui
• Sensible aux valeurs aberrantes et aux données bruitées.
• Nécessite de spécifier k à l’avance.
• Suppose des clusters de forme sphérique et de tailles similaires.
Évaluation du K-means: Pour évaluer la qualité du clustering, nous utilisons des métriques telles que
:
• Inertie intra-cluster : Somme des distances au carré entre les points et leurs centres de clusters
respectifs.
• Indice silhouette : Mesure le degré de séparation entre les clusters.
Conclusion
Le K-means clustering est une méthode efficace et largement utilisée pour des tâches de regroupement
de données. Cependant, son efficacité dépend fortement de la bonne sélection des paramètres et des
caractéristiques des données analysées.