Cours de Python
Concepts de base
Pourquoi Python ?
Définition : Python est un langage de programmation de haut niveau,
interprété, qui met l'accent sur la lisibilité du code et la productivité du
développeur.
Un langage accessible:
Concept : La facilité d'apprentissage est la pierre angulaire de Python.
• Syntaxe claire et intuitive
• Proche du langage naturel
• Pas de compilateur nécessaire
• Gestion automatique de la mémoire
Structure de base d'un programme
Python
• Les variables
Définition : Une variable est un espace mémoire
nommé qui stocke une valeur.
Structure de base d'un programme
Python
• Les opérateurs:
Définition : Les opérateurs sont des symboles
qui permettent d'effectuer des opérations sur
les variables et les valeurs.
• Les conditions en Python:
Définition : Les conditions permettent
d'exécuter différentes parties du code selon que
certaines expressions sont vraies ou fausses.
Structure de base d'un programme
Python
• Les conditions en Python:
Structure de base d'un programme
Python
Les boucles:
Définition : Les boucles permettent de répéter un bloc d'instructions
plusieurs fois.
• Boucle for
Concept : La boucle for est utilisée pour itérer sur une séquence (liste,
chaîne, etc.) ou d'autres objets itérables.
Structure de base d'un programme
Python
Les boucles:
Boucle while
Concept : La boucle while répète un bloc de
code tant qu'une condition est vraie.
Structure de base d'un programme
Python
Les Fonctions:
Définition : Une fonction est un bloc de code
réutilisable qui effectue une tâche spécifique.
Structure de base d'un programme
Python
Les listes:
Définition : Une liste est une collection
ordonnée et modifiable d'éléments.
Structure de base d'un programme
Python
Les Dictionnaires:
Définition : Un dictionnaire est une collection
non ordonnée de paires clé-valeur.
Structure de base d'un programme
Python
Les Bibliothèques essentielles:
Définition : Collections de modules et fonctions
pré-écrites étendant les capacités de Python.
DataFrames avec Pandas
Définition : Un DataFrame est une structure de
données 2D étiquetée avec des colonnes de
types potentiellement différents. C'est comme
une feuille Excel en Python.
Concepts clés des DataFrames
Index:
• Étiquettes de lignes uniques
• Peut être numérique ou textuel
Concepts clés des DataFrames
Colonnes:
• Séries de données étiquetées
• Peuvent avoir différents types
Exemple d’utilisation desDataFrames
import pandas as pd
# Création d'un DataFrame
data = {
'Nom': ['Alice', 'Bob', 'Charlie'],
'Age': [25, 30, 35],
'Ville': ['Paris', 'Lyon', 'Marseille']
}
df = [Link](data)
# Afficher les premières lignes
print([Link]()) # Par défaut 5 lignes
print([Link](2)) # 2 premières lignes
# Afficher les dernières lignes
print([Link]()) # Par défaut 5 lignes
print([Link](3)) # 3 dernières lignes
# Résumé statistique
print([Link]())
Exemple d’utilisation desDataFrames
# Information sur le DataFrame
print([Link]())
# Sélection de données
print(df['Nom']) # Une colonne
print(df[['Nom', 'Age']]) # Plusieurs colonnes
print([Link][0]) # Première ligne
print([Link][0:2]) # Lignes par index label
# Filtrage
jeunes = df[df['Age'] < 30]
parisiens = df[df['Ville'] == 'Paris']
# Tri
df_tri = df.sort_values('Age', ascending=False)
# Ajout d'une colonne
df['Année_Naissance'] = 2024 - df['Age']
# Groupement et agrégation
par_ville = [Link]('Ville').agg({
'Age': ['mean', 'min', 'max'],
'Nom': 'count'
})
Exemple d’utilisation desDataFrames
# Fusion de DataFrames
df2 = [Link]({
'Nom': ['Alice', 'Bob', 'David'],
'Salaire': [45000, 50000, 55000]
})
fusion = [Link](df, df2, on='Nom',
how='left')
# Gestion des valeurs manquantes
print([Link]().sum()) # Compte les valeurs
manquantes
df_clean = [Link]() # Supprime les lignes
avec valeurs manquantes
df_fill = [Link](0) # Remplace les valeurs
manquantes par 0
# Exportation
df.to_csv('[Link]', index=False)
df.to_excel('[Link]')
Analyse de Données Unidimensionnelle
Mesures de Tendance Centrale:
Analyse de Données Unidimensionnelle
Mesures de Dispersion:
Analyse de Données Unidimensionnelle
Visualisation Unidimensionnelle:
Analyse de Données Unidimensionnelle
Tests Statistiques Unidimensionnels:
Analyse de Données Multidimensionnelle
Définition: Analyse des relations entre plusieurs variables.
Corrélations:
Analyse de Données Multidimensionnelle
Visualisation Multidimensionnelle:
Analyse de Données Multidimensionnelle
Tests Statistiques Multidimensionnels:
Analyse de Données Multidimensionnelle
Analyse en Composantes Principales (ACP):
Analyse de Données Multidimensionnelle
Clustering:
Analyse de Données Multidimensionnelle
Régression:
Multicolinéarité
Définition: La multicolinéarité est une situation
où plusieurs variables explicatives d'un modèle
sont fortement corrélées entre elles. Cette
situation peut poser des problèmes dans
l'analyse statistique et la modélisation.
Multicolinéarité
Détection de la Multicolinéarité:
• Matrice de Corrélation
Explication: La matrice de corrélation permet de visualiser les relations linéaires entre les variables. Une forte
corrélation (proche de 1 ou -1) indique une possible multicolinéarité.
Multicolinéarité
Détection de la Multicolinéarité:
• VIF (Variance Inflation Factor)
Explication: Le VIF mesure l'augmentation de la variance d'un coefficient de régression due à la colinéarité. Un
VIF > 5 ou 10 indique généralement une forte multicolinéarité.
Multicolinéarité
Solutions pour la Multicolinéarité:
• Sélection de Variables
Explication: Cette approche consiste à éliminer les variables qui contribuent le plus à la multicolinéarité, en se
basant sur les scores VIF.
Multicolinéarité
Solutions pour la Multicolinéarité:
• Analyse en Composantes Principales
Explication: L'ACP transforme les variables corrélées en composantes principales non corrélées, réduisant ainsi
la dimensionnalité et éliminant la multicolinéarité.