0% ont trouvé ce document utile (0 vote)
6 vues39 pages

Cours Pandas Python

Ce document présente une introduction à la bibliothèque pandas pour l'analyse de données en Python, en se concentrant sur son utilisation pour l'importation, l'exploration, le nettoyage et le filtrage des données. Il décrit les principales structures de données, notamment les Series et DataFrames, ainsi que les fonctions essentielles pour manipuler des fichiers CSV, Excel et d'autres formats. Les sections incluent des exemples de code pour illustrer les différentes opérations que l'on peut réaliser avec pandas.

Transféré par

Andria N'jhäka
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
6 vues39 pages

Cours Pandas Python

Ce document présente une introduction à la bibliothèque pandas pour l'analyse de données en Python, en se concentrant sur son utilisation pour l'importation, l'exploration, le nettoyage et le filtrage des données. Il décrit les principales structures de données, notamment les Series et DataFrames, ainsi que les fonctions essentielles pour manipuler des fichiers CSV, Excel et d'autres formats. Les sections incluent des exemples de code pour illustrer les différentes opérations que l'on peut réaliser avec pandas.

Transféré par

Andria N'jhäka
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Département: Mathématiques & Informatique

Séance 10:
Analyse de données en Python
Module : pandas
Licence : Physique Chimie

Pr: Youssef Ouassit


IMPORTATION DES DONNEES
01

EXPLORATION DES DONNEES


02

NETTOYAGE DES DONNEES


03

FILTRAGE DES DONNEES


Sommaire 04
La bibliothèque pandas
Introduction

Origine Définition
Le nom « Pandas » est en fait la Bibliothèque écrite pour le
contraction du terme « Panel langage python permettant la
Datas » désignant les ensembles manipulation et l’analyse des
de données incluant des
données
observations sur de multiples
périodes temporelles.

Manipulation Type
Pandas manipule les données Qualitatif et quantitatif
sous forme de data frame .
La bibliothèque pandas
Introduction

Pandas est une bibliothèque Python qui permet de manipuler


facilement des structures de données, principalement sous forme de
tables, telles que des fichiers CSV, Excel, ou des bases de données.
Pandas fournit deux structures principales :

•Series : un tableau unidimensionnel étiqueté.

•DataFrame : une table bidimensionnelle (tableau avec des lignes et


des colonnes).
DataFrame
La bibliothèque pandas
Introduction

Caractéristiques:

• Structure bidimensionnelle
• Colonnes étiquetées
• Mutable
• Types de données hétérogènes
• …
La bibliothèque pandas
Introduction

Importation des modules:

import numpy as np

import pandas as pd
pd.read_csv()

1-FONCTIONS D’IMPORTATION
Le format csv

Le format CSV (Comma Separated Values) est l'un des formats


de fichiers les plus courants pour le stockage et l'échange de
données tabulaires (lignes et colonnes). Les fichiers CSV sont
des fichiers texte dans lesquels les données sont séparées par
des virgules (ou d'autres délimiteurs comme des tabulations
ou des points-virgules), et chaque ligne représente une ligne
de données.
Le format csv
Nom,Age,Ville,Téléphone,Salaire
Youssef,30,Rabat,0661111111,5000
Hanane,25,Casablanca,0661222222,6000
Rachid,25,Tanger,0661333333,7000
Dounia,27,Marrakech,0661444444,10000
Rachida,27,Marrakech,0661444444,9000
Lina,47,Essaouira,0661444444,4000
Ahmed,27,Fès,,20000
Nabil,27,Marrakech,0661888888,8500
Nada,17,Casablanca,0661999999,5000
Lire un fichier d’extension
pd.read_csv() CSV
import pandas as pd
df = pd.read_csv('[Link]')
lire les données sous formes
pd.read_table() de fichier texte comme TSV
pd.read_excel() lire un fichier d’extension
xlsx
Récapitulatifs

import pandas as pd

➢ pd.read_csv() = lire un fichier CSV


➢pd.read_table() = lire les données sous formes de fichier texte comme TSV
➢pd.read_excel() = lire les données sous formes de fichier Excel;

➢pd.read_sql[(query,connection_objet) = lire les données du table SQL/base de


données
➢pd.read_json(json_string) = lire les données d un fichier json
➢pd.read_DataFrame(dict) = depuis un dictionnaire, les données sont sous
formes de ligne et de colonnes
pd.read_csv()

2-FONCTIONS D’EXPLORATION
➢ Informations sur les
[Link]() colonnes
[Link]() Donne une vue statistique
d’ensemble
Donne les n premières ligne
[Link](2) s du dataframe
Donne les n dernières lignes
[Link]( 3 ) du dataframe
Donne la moyenne
[Link]()
Donne la valeur minimale
[Link]() ,[Link]() et la valeur maximale des
variables
Affiche le nombre de
[Link]() valeurs non nulles
Sélectionner une colonne
df[col_name] particulière

df['Nom']
Sélectionner plusieurs
df[ [col1,col2, …]] colonnes particulière

df[ ['Nom', 'Salaire'] ]


RECAPITULATIFS

➢ [Link] : donne le nombre de ligne et de colonne du dataframe


➢ [Link]() :donne le type de donnée
➢ [Link]() :donne une vue statistique d’ensemble
➢ [Link](n): afficher les n premiers éléments du dataframe
➢ [Link]() affiche les n derniers éléments du dataframe
➢ [Link]() : donne la moyenne de chaque colonnes
➢ [Link]() : retourne une division standard de chaque colonnes
➢ [Link]() :valeurs minimale de chaque colonnes
➢ [Link](): valeurs maximale de chaque colonnes
➢ [Link]() :affiche le nombre de valeurs non nulles
➢ df[col_name] : affiche une colonne particulière
pd.read_csv()

3-FONCTIONS DE NETTOYAGE
Supprimer une colonne
df=[Link](columns=nom_col) particulière

df = [Link](columns=['Ticket', 'PassengerId'])
Ou en place :
[Link](columns=['Ticket', 'PassengerId'], inplace=True)
Affiche les valeurs
[Link]( ) manquantes
Supprimer les valeurs
[Link](condition) manquantes

[Link]()
Supprimer les valeurs
[Link](condition) manquantes

[Link](how='all')
Remplacer toutes les
[Link]() valeurs manquantes

[Link]('---')
Remplacer les valeurs par
[Link]( ancien, nouveau) des valeurs quelconques
Jointure par rapport aux
[Link]([df1, df2], axis=1) lignes
pd.read_csv()

4-FONCTIONS DE FILTRAGE
Faire des sélections sur des
df[conditions] colonnes

df[ df['Salaire']>=7000 ]
Faire des sélections sur des
df[conditions] colonnes

df[ (df['Salaire']>=7000) & (df['Age'] >= 27) ]


Faire des sélections sur des
[Link](condition) colonnes

[Link]('Salaire>=7000 & Age >= 27')


Faire un tri selon une
df.sort_values(‘col', ascending=False)
direction ascendante
Filtrage des valeurs de la
df.sort_values(['Age','Pclass'],
colonne Age de façon
ascending=[True,False]) ascendante et de la colonne
Pclass de façon descendante

Vous aimerez peut-être aussi