Module : Intelligence Artificielle
TP3 – Classification
L'objectif de ce TP est d'appliquer différentes techniques de classification, notamment le KNN (K-Nearest
Neighbors), l'arbre de décision, SVM (Support Vector Machine) et régression logistique, pour prédire le type de
drogue approprié pour un patient en fonction de ses caractéristiques médicales.
Rappelons que la classification est une tâche de machine learning supervisée où l'objectif est de prédire la classe
(ou l'étiquette) d'un échantillon en fonction de ses caractéristiques. Dans notre cas, nous voulons prédire le type
de drogue en fonction de l'âge, du sexe, des niveaux de pression artérielle, des niveaux de cholestérol et du ratio
sodium-potassium.
Dans ce TP, vous allez :
Comprendre le concept du KNN (K-Nearest Neighbors), l'arbre de décision, SVM (Support Vector
Machine) et la régression logistique, ainsi que leur utilisation dans la classification.
Effectuer une préparation complète des données.
Utiliser les bibliothèques Python appropriées pour implémenter ces méthodes et analyser leurs
performances.
Partie 1 : Préparation des Données
1) Charger le fichier CSV téléchargé.
2) Affichez les premières lignes du jeu de données pour comprendre sa structure.
3) Identifiez les différentes colonnes et leur signification potentielle.
4) Encoder les variables catégorielles en utilisant LabelEncoder.
5) Définir X l’espace caractéristiques et y la variable cible.
6) Normaliser les données en utilisant StandardScaler de [Link].
7) Diviser la data (X et y) en deux groupes ‘training’ et ‘testing’ (80% training, 20% testing) en utilisant la
fonction train_test_split de sklearn.model_selection.
Partie 2 : Création du modèle de classification
1) Créer un modèle de classification par KNN en utilisant la fonction KNeighborsClassifier de
[Link] puis entrainer ce modèle sur le dataset ‘training’.
2) Prédire la sortie y_predict du dataset ‘testing’.
3) Evaluer le modèle en utilisant les métrique accuracy_score.
4) Créer un modèle de classification par l’arbre de décision en utilisant la fonction DecisionTreeClassifier
de [Link] puis entrainer ce modèle sur le dataset ‘training’.
5) Refaire les questions 2) et 3).
6) Créer un modèle de classification par régression logistique en utilisant la fonction LogisticRegression de
sklearn.linear_model puis entrainer ce modèle sur le dataset ‘training’.
7) Refaire les questions 2) et 3).
Dr. K. Hadj-Rabah
Module : Intelligence Artificielle
8) Créer un modèle de classification par SVM en utilisant la fonction SVC de [Link] puis entrainer ce
modèle sur le dataset ‘training’.
9) Refaire les questions 2) et 3).
Conclusion
Résumez les principales étapes de classification puis comparer entre les méthodes étudiées.
Quelles sont vos conclusions ?
Dr. K. Hadj-Rabah