Département: Mathématiques & Informatique
Séance 10:
Analyse de données en Python
Module : pandas
Licence : Physique Chimie
Pr: Youssef Ouassit
IMPORTATION DES DONNEES
01
EXPLORATION DES DONNEES
02
NETTOYAGE DES DONNEES
03
FILTRAGE DES DONNEES
Sommaire 04
La bibliothèque pandas
Introduction
Origine Définition
Le nom « Pandas » est en fait la Bibliothèque écrite pour le
contraction du terme « Panel langage python permettant la
Datas » désignant les ensembles manipulation et l’analyse des
de données incluant des
données
observations sur de multiples
périodes temporelles.
Manipulation Type
Pandas manipule les données Qualitatif et quantitatif
sous forme de data frame .
La bibliothèque pandas
Introduction
Pandas est une bibliothèque Python qui permet de manipuler
facilement des structures de données, principalement sous forme de
tables, telles que des fichiers CSV, Excel, ou des bases de données.
Pandas fournit deux structures principales :
•Series : un tableau unidimensionnel étiqueté.
•DataFrame : une table bidimensionnelle (tableau avec des lignes et
des colonnes).
DataFrame
La bibliothèque pandas
Introduction
Caractéristiques:
• Structure bidimensionnelle
• Colonnes étiquetées
• Mutable
• Types de données hétérogènes
• …
La bibliothèque pandas
Introduction
Importation des modules:
import numpy as np
import pandas as pd
pd.read_csv()
1-FONCTIONS D’IMPORTATION
Le format csv
Le format CSV (Comma Separated Values) est l'un des formats
de fichiers les plus courants pour le stockage et l'échange de
données tabulaires (lignes et colonnes). Les fichiers CSV sont
des fichiers texte dans lesquels les données sont séparées par
des virgules (ou d'autres délimiteurs comme des tabulations
ou des points-virgules), et chaque ligne représente une ligne
de données.
Le format csv
Nom,Age,Ville,Téléphone,Salaire
Youssef,30,Rabat,0661111111,5000
Hanane,25,Casablanca,0661222222,6000
Rachid,25,Tanger,0661333333,7000
Dounia,27,Marrakech,0661444444,10000
Rachida,27,Marrakech,0661444444,9000
Lina,47,Essaouira,0661444444,4000
Ahmed,27,Fès,,20000
Nabil,27,Marrakech,0661888888,8500
Nada,17,Casablanca,0661999999,5000
Lire un fichier d’extension
pd.read_csv() CSV
import pandas as pd
df = pd.read_csv('[Link]')
lire les données sous formes
pd.read_table() de fichier texte comme TSV
pd.read_excel() lire un fichier d’extension
xlsx
Récapitulatifs
import pandas as pd
➢ pd.read_csv() = lire un fichier CSV
➢pd.read_table() = lire les données sous formes de fichier texte comme TSV
➢pd.read_excel() = lire les données sous formes de fichier Excel;
➢pd.read_sql[(query,connection_objet) = lire les données du table SQL/base de
données
➢pd.read_json(json_string) = lire les données d un fichier json
➢pd.read_DataFrame(dict) = depuis un dictionnaire, les données sont sous
formes de ligne et de colonnes
pd.read_csv()
2-FONCTIONS D’EXPLORATION
➢ Informations sur les
[Link]() colonnes
[Link]() Donne une vue statistique
d’ensemble
Donne les n premières ligne
[Link](2) s du dataframe
Donne les n dernières lignes
[Link]( 3 ) du dataframe
Donne la moyenne
[Link]()
Donne la valeur minimale
[Link]() ,[Link]() et la valeur maximale des
variables
Affiche le nombre de
[Link]() valeurs non nulles
Sélectionner une colonne
df[col_name] particulière
df['Nom']
Sélectionner plusieurs
df[ [col1,col2, …]] colonnes particulière
df[ ['Nom', 'Salaire'] ]
RECAPITULATIFS
➢ [Link] : donne le nombre de ligne et de colonne du dataframe
➢ [Link]() :donne le type de donnée
➢ [Link]() :donne une vue statistique d’ensemble
➢ [Link](n): afficher les n premiers éléments du dataframe
➢ [Link]() affiche les n derniers éléments du dataframe
➢ [Link]() : donne la moyenne de chaque colonnes
➢ [Link]() : retourne une division standard de chaque colonnes
➢ [Link]() :valeurs minimale de chaque colonnes
➢ [Link](): valeurs maximale de chaque colonnes
➢ [Link]() :affiche le nombre de valeurs non nulles
➢ df[col_name] : affiche une colonne particulière
pd.read_csv()
3-FONCTIONS DE NETTOYAGE
Supprimer une colonne
df=[Link](columns=nom_col) particulière
df = [Link](columns=['Ticket', 'PassengerId'])
Ou en place :
[Link](columns=['Ticket', 'PassengerId'], inplace=True)
Affiche les valeurs
[Link]( ) manquantes
Supprimer les valeurs
[Link](condition) manquantes
[Link]()
Supprimer les valeurs
[Link](condition) manquantes
[Link](how='all')
Remplacer toutes les
[Link]() valeurs manquantes
[Link]('---')
Remplacer les valeurs par
[Link]( ancien, nouveau) des valeurs quelconques
Jointure par rapport aux
[Link]([df1, df2], axis=1) lignes
pd.read_csv()
4-FONCTIONS DE FILTRAGE
Faire des sélections sur des
df[conditions] colonnes
df[ df['Salaire']>=7000 ]
Faire des sélections sur des
df[conditions] colonnes
df[ (df['Salaire']>=7000) & (df['Age'] >= 27) ]
Faire des sélections sur des
[Link](condition) colonnes
[Link]('Salaire>=7000 & Age >= 27')
Faire un tri selon une
df.sort_values(‘col', ascending=False)
direction ascendante
Filtrage des valeurs de la
df.sort_values(['Age','Pclass'],
colonne Age de façon
ascending=[True,False]) ascendante et de la colonne
Pclass de façon descendante