0% ont trouvé ce document utile (0 vote)
5 vues20 pages

Guide complet du Machine Learning en Python

Ce document présente les étapes essentielles de l'apprentissage automatique en Python, notamment l'importation et le traitement des données, la création et l'entraînement de modèles, ainsi que l'évaluation de leur performance. Il décrit également les bibliothèques nécessaires comme Numpy, Pandas, Matplotlib et Scikit-learn, en détaillant leurs fonctionnalités et méthodes. Enfin, il aborde des techniques de visualisation des données et de manipulation des tableaux pour faciliter l'analyse.

Transféré par

mahrakotosoa
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
5 vues20 pages

Guide complet du Machine Learning en Python

Ce document présente les étapes essentielles de l'apprentissage automatique en Python, notamment l'importation et le traitement des données, la création et l'entraînement de modèles, ainsi que l'évaluation de leur performance. Il décrit également les bibliothèques nécessaires comme Numpy, Pandas, Matplotlib et Scikit-learn, en détaillant leurs fonctionnalités et méthodes. Enfin, il aborde des techniques de visualisation des données et de manipulation des tableaux pour faciliter l'analyse.

Transféré par

mahrakotosoa
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

MACHINE LEARNING EN

PYTHON
MACHINE LEARNING EN PYTHON
Différentes étapes :
Importer le datasets
Analyser et Traiter le dataset
Partager les en data test et data training
Créer le modèle
Entrainer le modèle
Faire la prediction
Evaluer la performance du modèle
Librairies nécessaires

Numpy : permet de créer et manipuler des matrices simplement et avec


efficacité.
Pandas : une excéllente librairie pour importer vos tableaux Excel (et autres
formats) dans Python dans le but de tirer des statistiques et de charger
votre Dataset dans Sklearn.
Matplotlib : permet de visualiser nos Datasets, nos fonctions, nos résultats
sous forme de graphes, courbes et nuages de points.
Seaborn : permet de visualiser basé sur matplotlib.
Scikit-learn (sklearn): bibliothèques Python les plus populaires pour
l'apprentissage automatique (machine learning). Elle offre un large
éventail d'algorithmes d'apprentissage supervisé et non supervisé, ainsi
que des outils pour la préparation des données, la sélection de modèle,
l'évaluation de performances .
Librairies nécessaires
Importer le datasets :
Librairies nécessaires
Numpy : objet très puissant pour manipuler des tableaux ou matrices
appelés Ndarray.
Librairies nécessaires
Numpy (suite) : Tableau de taille fixée, multidimensionnel contenant des
élements de méme type et de même taille. Ce tableau peut être définit par :
son contenu sous forme d’une liste de valeurs :
Ex : a=[Link]([1,3,5,7,9,11,13,17])
ses dimensions et son profil :
Ex : b=[Link]([[1,2,3],[4,5,6]])
son type d’élément :
Ex: a=[Link]([0.1, 0.0, 0.2],dtype='f')
b=[Link]([[1,2,3],[4,5,6]],dtype='i')
[Link]
Librairies nécessaires
Numpy (suite): Indexing et slicing
Soit un tableau A de 2Darray tel que [Link] = (4,4).
Index : A [ligne,colonne] (ex: A[2,3] = element de la ligne 2 et colonne 3)
Slice : A [debut:fin,debut:fin] (ex : A[1:3,:] ou A[:,0] )
A [debut:fin:pas,debut:fin:pas] (ex : A[::2,2:4:2])
Indexing boolean :array1 = [Link]([12, 24, 16, 21, 32, 29, 7, 15])
boolean_mask = array1 > 20
[False, True, False, True, True, True, False, False]
Librairies nécessaires
Numpy (suite): Indexing et slicing

# Slicing de tableau pour créer un nouveau tableau


sliced_array = arr[1:4] # Trancher de l'index 1 à 3 (exclusif) [20,30,40]
# Slicing avec un pas de 2
sliced_array = arr[0::2] # Commence à l'index 0, pas de 2 [10,30,50]
# Slicing avec un index négatif
second_to_last = arr[-2: :] # Accéder aux deux derniers éléments [40,50]
# Slicing conditionnel : Sélectionner les éléments supérieurs à 30
sliced_array = arr[arr > 30] # Résultat : [40, 50]
# Création d'un tableau NumPy 2D
arr_2d = [Link]([[1, 2, 3], [4, 5, 6], [7, 8, 9]])
# Slicing le long des lignes et des colonnes
sliced_array = arr_2d[1:3, 0:2] # Découper un sous-réseau 2x2 : [[4, 5], [7, 8]]
Librairies nécessaires
Module NumPy (suite) :

Caractéristiques d’un tableau


Quelques propriétés pour un ndarray :
Librairies nécessaires

Numpy (suite): Les attributs


[Link]: permet de visualiser la forme d' un tableau(nbre de lignes
et colonnes) ou la profondeur dans le cas de 3Darray.
Ex :
Générer un tableau
[Link](object)
ex: B=[Link]([1,2,3],[4,5,6])
[Link](shape) , [Link](shape) et
[Link](shape)
ex: B=[Link]((3,4))
[Link](shape,value)
ex : C=[Link]((3,4),8)
[Link](shape)
[Link](debut,fin,quantite)
ex: [Link](0,10,20,dtype=np.float64)
[Link](debut,fin,pas)
Librairies nécessaires

Numpy :Manipulation des tableaux


Rassembler deux ou plusieurs tableaux :hstack() et vstack()

[Link] : permet de remodeler un tableau


Librairies nécessaires
Numpy :Manipulation des tableaux
Identifier les valeurs manquantes :
# Créer un tableau NumPy avec des valeurs manquantes
data = [Link]([78, 62, [Link], 41, [Link], 26])
# Vérifier les valeurs manquantes
Val_mank = [Link](data)
print(Val_mank)

Suppression des lignes ou colonnes des valeurs manquantes


# Créer un tableau 2D avec des valeurs manquantes
data = [Link]([[1, 2, 3], [4, [Link], 6], [7, 8, 9]])
# Supprimer les lignes contenant des valeurs manquantes
cleaned_data = data[~[Link]([Link](data), axis=1)]
print(cleaned_data) # Résultat : [[1,2,3],[7,8,9]
Librairies nécessaires
Numpy (suite): Operations sur les tableaux Numpy

# Création de tableaux NumPy 1D # Ajouter des éléments à la place


arr2 = [Link](arr2, [4, 5, 6])
arr1 = [Link]([1, 2, 3])
# Création de tableaux NumPy 2D
arr2 = [Link]([4, 5, 6])
m1 = [Link]([[1, 2], [3, 4]])
scalaire = 2
m2 = [Link]([[5, 6], [7, 8]])
# Addition
# Multiplication (par éléments, pas par matrice)
result_add = arr1 + arr2 # [5, 7, 9]
result_mul = m1 * m2 # [[5, 12], [21, 32]]
# Multiplication, de même que la division
# Multiplication matricielle réelle à l'aide de [Link]
result_mul = arr1 * arr2 # [4, 10, 18]
matrix_mult = [Link](m1,m2)
# Supprimer l'élément à l'index 2 (valeur 3) # Broadcasting : Multiplier un tableau par un scalaire
new_arr = [Link](arr1, 2) result = arr1 * scalaire # [2, 4, 6]

Broadcasting : NumPy permet d’effectuer des opérations entre des tableaux de formes (shape)
et de tailles différentes, ce que l’on appelle le broadcasting (ou diffusion en français).
Le broadcasting ajuste automatiquement la forme du plus petit tableau pour qu’elle
corresponde à celle du plus grand, ce qui la rend compatible avec les opérations par éléments.
Librairies nécessaires

Matplotlib : permet de visualiser les donnees sous forme graphique.


• La visualisation de données est une étape clé de l’analyse de données. Après avoir collecté, stocké
et analysé des données, il est essentiel de transformer les résultats de ces analyses en rapports et
en visualisations graphiques.
Le « plotting » consiste à créer un graphique. Il est nécessaire d’utiliser des données, sous forme
de paires clé / valeur constituant les axes X et Y. On utilise ensuite des fonctions comme « scatter
», « bar » et « pie » pour créer le schéma.
.
Librairies nécessaires
Matplotlib (suite) :
months = ['Janvier', 'Février', 'Mars', 'Avril', 'Mai',
'Juin']
traffic = [150, 200, 180, 220, 250, 210]
# Créer un graphique linéaire avec une apparence
personnalisée
[Link] (months, traffic, marker='o', linestyle='--',
color='g')
# Ajouter des étiquettes et un titre
[Link] ('Mois')
[Link] ('Trafic mensuel (en milliers')
[Link] ('Trafic mensuel du site web')
# Ajouter une grille au tracé
[Link] (True)
# Afficher le graphe
[Link] ()
Librairies nécessaires
Diagramme à barre : Les diagrammes à barres représentent des données catégorielles
à l’aide de barres rectangulaires, la longueur ou la hauteur de chaque barre représentant
une valeur. Syntaxe : [Link](x,y)

L’Histogramme : Les histogrammes sont utilisés pour visualiser la distribution de données


continues ou numériques et ils nous aident à identifier des modèles dans les données. Les
données sont regroupées en « bins», et la hauteur de chaque barre représente la fréquence
ou le nombre de points de données dans cette bin.
Syntaxe : [Link](x)
Diagramme de dispersion : Les diagrammes de dispersion représentent des points de
données individuels sur un plan bidimensionnel.
Syntaxe : [Link](x,y,size,color,alpha)
Diagramme circulaire : Ils conviennent pour montrer la composition d’une seule variable
catégorielle en termes de pourcentages. Mais ils ne sont pas adaptés lorsqu’il y a plus de six
catégories,
Syntaxe : [Link](x,labels=tes_noms_de_catégorie, colors=liste_de_couleur_désirée)

Diagramme en boîte : ils résument la distribution des données numériques en affichant les
quartiles, les valeurs aberrantes et l’asymétrie potentielle.
Syntaxe : [Link](data)
Librairies nécessaires
Matplotlib : subplot qui permet de gènérer plusieurs
graphiques sur une même figure.
[Link](ligne,colonne,position)
Librairies nécessairesc
Pandas : est éfficace pour traiter les données de type catégories,
labels,dates et texte brut.

Les methodes
Head() et tail() : affiche réspectivement les premières et dernières
lignes .
Syntaxe : [Link]() / [Link]()
Shape et dtype : renvoie le nombre des lignes et colonnes du
dataframe, dtype renvoie le type de chaque colonne.
Librairies nécessairesc

Pandas :
Manipuler les colonnes :
_ afficher les colonnes: [Link]
_ accéder à une colonne : NomDataframe[Nomcolonne]
_accéder à plusieurs colonnes : NomDtataframe[list des noms des
colonnes à acceder]
Ex: df[“age”,”gender”}
_ Modifier une colonne existante :NomDataF[colonne]=c ou c soit une
valeur fixe soit un objet de même dimension que la colonne.
_Créer une colonne : NomData[nouvelleColonne]=c
_ Supprimer une colonne : [Link](“columns”=”NomColonne”)
_Trier un Dataframe : sort_values(colonne)
Librairies nécessairesc

Pandas :
Sélectionner une ligne specifique via des indices : .iloc
Syntaxe : [Link][indice_ligne,indice_colonne]
Sélection via des conditions : .loc
Syntaxe : [Link][conditions sur les lignes,colonnes
]

Vous aimerez peut-être aussi