JOUR 1 – Python pour la Data
Bienvenue.
Aujourd’hui, on ne « découvre » pas Python comme un hobby.
On entre dans Python comme un Data Analyst professionnel.
Si tu es débutant : tu vas poser des bases extrêmement solides.
Si tu as déjà touché à Python : tu vas comprendre enfin pourquoi tu fais les choses,
comment penser data, et comment travailler proprement comme en entreprise.
À la fin de ce Jour 1, tu dois être à l’aise dans un environnement professionnel
Python (VS Code), comprendre comment Python est utilisé en Data Analysis, et
maîtriser les fondations du langage avec une logique orientée données.
1. Accueil & vision de la formation
Avant de coder, on s’aligne.
Cette formation n’est pas :
❌ un cours académique de programmation
❌ un empilement de syntaxes Python
●
●
Cette formation est :
✅ une préparation au métier de Data Analyst
✅ une montée en compétences progressive, logique et concrète
●
✅ orientée projets réels, données réelles, décisions réelles
●
●
👉 Ici, chaque ligne de code a un objectif data.
Tu ne vas pas apprendre Python « pour Python ». Tu vas apprendre Python pour analyser,
comprendre et expliquer des données.
2. Ce que nous allons faire aujourd’hui
Aujourd’hui, on pose les fondations.
Nous allons :
1. Comprendre le rôle exact de Python dans la Data Analysis
2. Installer et configurer un environnement professionnel (Python + VS Code)
3. Comprendre comment un Data Analyst travaille réellement avec Python
4. Maîtriser les bases essentielles du langage, mais avec une logique data
À la fin de la journée, tu devras te dire :
« Je comprends où je vais, comment je vais travailler, et pourquoi chaque chose
existe. »
3. Python dans le monde de la Data : la vraie réalité
Prenons une vérité simple :
Python n’est PAS utilisé parce qu’il est “cool”.
Python est utilisé parce qu’il permet :
● d’explorer rapidement des données
● de nettoyer des datasets sales
● d’automatiser des analyses répétitives
● de produire des insights clairs
● de collaborer avec d’autres analystes
Python dans une mission réelle de Data Analyst
Un Data Analyst utilise Python pour :
● charger des données (CSV, Excel, bases de données)
● comprendre leur structure
● détecter les erreurs et incohérences
● transformer les données
● analyser
● visualiser
● raconter une histoire avec les chiffres
👉 Tout ce que tu apprends aujourd’hui servira chaque jour dans ces étapes.
4. Environnement de travail : ici, on travaille comme des
pros
⚠️ Point très important :
👉 Nous n’utiliserons PAS Jupyter Notebook.
Pourquoi ?
● En entreprise, beaucoup de Data Analysts travaillent sur VS Code
● VS Code permet :
○ un code plus propre
○ une meilleure organisation
○ une logique proche de la production
○ l’utilisation de Git, scripts, projets structurés
Aujourd’hui, tu apprends Python comme un outil professionnel, pas comme un jouet.
Notre stack
● Python 3
● VS Code
● Terminal intégré
● Fichiers .py
5. Installation & configuration (à faire ensemble)
5.1 Vérifier Python
Dans ton terminal :
● Vérifier la version de Python
● Comprendre la différence entre python et python3
👉 Objectif : savoir où est Python, et comment il est exécuté.
5.2 Installer VS Code (si ce n’est pas fait)
VS Code n’est pas juste un éditeur. C’est ton poste de travail de Data Analyst.
Extensions essentielles :
● Python
● Pylance
● Code Runner (optionnel)
👉 Tu dois comprendre ce que fait chaque extension, pas juste cliquer.
6. Comment Python fonctionne VRAIMENT
Avant d’écrire du code, comprends ceci :
Python est un interpréteur. Il lit ton code ligne par ligne, de haut en bas.
Cela implique :
● l’ordre du code est crucial
● une variable doit exister avant d’être utilisée
● une erreur stoppe l’exécution
👉 Beaucoup d’erreurs de débutants viennent de là.
7. Variables : la base de toute analyse
Une variable, ce n’est pas « juste un nom ».
👉 C’est une information stockée, issue de données réelles.
Exemple data
● salaire
● âge
● chiffre d’affaires
● nombre de clients
Tu apprends à :
● nommer correctement une variable
● utiliser des noms clairs et professionnels
● éviter les erreurs classiques
⚠️ Un mauvais nom de variable = analyse confuse.
8. Types de données essentiels (pensée Data Analyst)
Tu dois maîtriser ces types parfaitement :
🔹 int (entiers)
● nombre d’employés
● nombre de ventes
🔹 float (décimaux)
● salaires
● moyennes
● taux
🔹 string (texte)
● noms
● catégories
● pays
🔹 bool (vrai / faux)
● actif / inactif
● client fidèle ou non
👉 En Data Analysis, mal choisir un type = erreur d’analyse.
9. Opérations : Python comme calculatrice intelligente
Un Data Analyst passe son temps à :
● additionner
● comparer
● calculer des ratios
● calculer des moyennes
Tu dois être rapide et précis avec :
● puissances
● priorités de calcul
On fera des calculs liés à des cas réels :
● salaires
● ventes
● performances
10. Structures de données fondamentales
Ici, on entre dans quelque chose de TRÈS important.
Les données ne viennent jamais seules. Elles viennent en groupes.
Listes
● plusieurs salaires
● plusieurs notes
● plusieurs ventes
Dictionnaires
● une ligne de données
● clé = colonne
● valeur = donnée
👉 Le dictionnaire, c’est la préfiguration d’une ligne de DataFrame Pandas.
Si tu comprends bien ça aujourd’hui, Pandas sera facile demain.
11. Pratique guidée (fondamentale)
Aujourd’hui, tu vas :
● créer un premier fichier Python
● écrire ton premier script d’analyse simple
● manipuler des données fictives mais réalistes
Exemples :
● analyse de salaires
● calcul de moyennes
● comparaison de performances
👉 Pas pour faire joli. Pour penser comme un analyste.
12. Mentalité Data Analyst
Ne cherche pas à :
● mémoriser tout
● aller trop vite
Cherche à :
● comprendre
● expliquer ce que tu fais
● relier chaque ligne de code à une donnée réelle
Un bon Data Analyst n’est pas celui qui code le plus vite.
C’est celui qui comprend le mieux ses données.
1️⃣ Vision & posture du Data Analyst avec Python
Avant de parler de code, on parle de toi, de ton rôle et de ta posture.
Si tu rates cette section, tout le reste sera plus difficile. Si tu la comprends profondément, tout
Python deviendra logique.
Pourquoi Python est devenu incontournable en Data Analysis
Soyons très clairs.
Python n’a pas remplacé Excel parce qu’Excel est mauvais. Python a gagné parce que le
volume, la complexité et la vitesse des données ont explosé.
Un Data Analyst moderne doit être capable de :
● travailler avec des milliers voire des millions de lignes
● répéter les mêmes analyses sans erreurs
● documenter et expliquer son raisonnement
● automatiser ce qui est répétitif
👉 Excel atteint vite ses limites. 👉 Python, non.
Python est aujourd’hui utilisé parce qu’il permet de :
● analyser vite
● analyser proprement
● analyser à grande échelle
La différence fondamentale : coder vs analyser
Voici une vérité importante :
Un Data Analyst ne code pas pour montrer qu’il sait coder.
Il code pour :
● répondre à une question métier
● éclairer une décision
● réduire l’incertitude
Exemple :
❌ « J’ai écrit 300 lignes de code »
✅ « J’ai compris pourquoi les ventes chutent dans cette région »
●
●
👉 Python est un moyen, pas une fin.
Le rôle réel d’un Data Analyst avec Python
Dans une mission réelle, un Data Analyst utilise Python pour :
1. Charger des données (CSV, Excel, bases de données)
2. Explorer rapidement leur contenu
3. Nettoyer les incohérences
4. Transformer les données
5. Analyser
6. Visualiser
7. Communiquer les résultats
👉 Chaque notion que tu apprendras en Python servira au moins une de ces étapes.
Si tu ne vois pas le lien : pose la question.
Pourquoi nous apprenons Python AVANT Pandas
Beaucoup de formations font l’erreur suivante :
« Voilà Pandas, débrouille-toi. »
Résultat :
● les apprenants copient du code
● ils ne comprennent pas ce qu’ils font
● ils paniquent au moindre bug
Nous faisons l’inverse.
👉 Python d’abord = compréhension. 👉 Pandas ensuite = puissance.
Si tu comprends :
● variables
● types
● listes
● dictionnaires
Alors Pandas sera intuitif.
La posture mentale attendue de toi
Dès aujourd’hui, adopte cette posture :
● Tu n’es pas un étudiant
● Tu es un Data Analyst en formation
Cela implique :
● comprendre avant de mémoriser
● poser des questions quand ce n’est pas clair
● relier chaque ligne de code à une donnée réelle
Ne cherche pas à aller vite.
Cherche à être solide.
Les pièges classiques à éviter dès le Jour 1
● Apprendre Python comme une langue étrangère
● Copier du code sans comprendre
● Chercher à impressionner avec du code complexe
● Aller trop vite sans bases solides
👉 La Data punit toujours ces erreurs plus tard.
✅ Ce que tu dois avoir compris à la fin de cette section
Si cette section est réussie, tu dois pouvoir dire :
● Je sais pourquoi j’apprends Python
● Je sais à quoi il sert concrètement en Data Analysis
● Je comprends que le code est au service de l’analyse
● Je suis prêt à apprendre proprement, pas vite
2️⃣ Ton premier script Python (exécution consciente)
Dans bases_python.py, écris :
print("Bienvenue dans Python pour la Data")
Exécute le fichier depuis le terminal :
python bases_python.py
🧠 Ce que tu dois comprendre :
● Python lit ton fichier de haut en bas
● Chaque ligne est exécutée dans l’ordre
● Rien n’est magique
👉 Beaucoup de personnes utilisent Python sans comprendre ça. Pas toi.
Python interactif
Ma façon préférée d’écrire du code Python
Le meilleur des deux mondes
Le mode Python interactif est ma façon préférée d’écrire du code Python, et j’utilise rarement
autre chose. Il combine l’organisation des fichiers Python avec l’interactivité des notebooks
Jupyter.
C’est ainsi que je coderai tout au long de ce cours. Une fois que tu l’auras essayé, tu
comprendras pourquoi c’est un outil aussi puissant pour apprendre et développer des
applications d’IA.
Qu’est-ce que le Python interactif ?
Imagine que tu cuisines en goûtant au fur et à mesure, plutôt que d’attendre que tout le plat soit
terminé. C’est exactement le principe du Python interactif :
● Écrire du code dans un fichier .py (propre et bien organisé)
● Exécuter instantanément des portions de code avec Shift + Entrée
● Voir les résultats immédiatement dans un panneau latéral
● Conserver toutes les variables en mémoire
Pourquoi c’est parfait pour le développement en IA
Quand on travaille avec l’IA et les données, on est constamment en train de :
● Inspecter les données
● Tester des transformations
● Vérifier les résultats
● Expérimenter différentes approches
Exécuter tout le fichier à chaque fois (comme avec [Link]) serait lent et frustrant. Le mode
interactif te permet de travailler de manière itérative, rapide et efficace.
Prérequis
Le Python interactif nécessite le noyau IPython. Installons-le.
Assure-toi que ton environnement virtuel est activé :
(Tu devrais voir (venv) dans ton terminal)
Installe ensuite le package requis :
pip install ipykernel
Ce package permet à Jupyter d’exécuter du code Python de manière interactive.
Configurer le Python interactif
Activons maintenant la fonctionnalité interactive dans VS Code :
1. Ouvre les paramètres de VS Code
○ Appuie sur Ctrl/Cmd + ,
○ Ou Fichier > Préférences > Paramètres
2. Recherche "execute selection"
3. Trouve le paramètre :
Jupyter > Interactive Window > Text Editor: Execute Selection
4. Coche la case pour l’activer
Ce que cela fait :
Lorsque tu appuies sur Shift + Entrée, le code sélectionné s’exécute dans la fenêtre interactive
Jupyter au lieu du terminal Python. Tu obtiens ainsi une expérience beaucoup plus riche et
visuelle.
🎉 C’est tout ! Tu es maintenant prêt à utiliser le mode interactif.
3️⃣ Les variables : penser en données, pas en code
Une variable représente une information issue du monde réel.
Exemples :
salaire_mensuel = 750000
age_employe = 32
taux_croissance = 0.12
Règles professionnelles de nommage
❌ Mauvais :
x = 750000
✅ Bon :
salaire_mensuel = 750000
👉 En Data Analysis, ton code doit être lisible comme un rapport.
Pose-toi toujours la question :
« Si quelqu’un lit ce code sans moi, comprend-il les données ? »
4️⃣ Types de données : une notion CRUCIALE
Python n’est pas indulgent avec les types. La Data non plus.
🔢 int (entier)
nombre_employes = 120
Utilisé pour :
● comptages
● volumes
🔢 float (décimal)
salaire_moyen = 458000.75
Utilisé pour :
● moyennes
● ratios
● pourcentages
🔤 string (texte)
nom_departement = "Data & Analytics"
Utilisé pour :
● catégories
● pays
● noms
bool (vrai / faux)
employe_actif = True
Utilisé pour :
● filtres
● conditions
👉 90 % des bugs en data viennent de mauvais types.
5️⃣ Vérifier et comprendre les types
Ne devine jamais. Vérifie.
print(type(salaire_mensuel))
print(type(nom_departement))
Un Data Analyst sérieux inspecte toujours ses données.
6️⃣ Opérations : Python comme moteur de calcul
Exemple réel :
salaire_janvier = 450000
salaire_fevrier = 470000
salaire_moyen = (salaire_janvier + salaire_fevrier) / 2
print(salaire_moyen)
👉 Ici, Python remplace :
● Excel
● calculatrice
● erreurs humaines
7️⃣ Comparaisons : début de l’analyse
salaire = 500000
print(salaire > 400000)
print(salaire == 500000)
Ces comparaisons seront la base :
● des filtres
● des conditions
● des décisions
8️⃣ Listes : manipuler plusieurs données
Les données ne viennent jamais seules.
salaires = [350000, 420000, 500000, 610000]
Accéder à un élément :
print(salaires[0])
👉 Une liste = une colonne de données (avant Pandas).
9️⃣ Dictionnaires : penser comme une ligne de dataset
employe = {
"nom": "Jean",
"age": 34,
"salaire": 520000,
"actif": True
}
Accéder à une valeur :
print(employe["salaire"])
🧠 Très important :
Ce dictionnaire, c’est exactement une ligne de DataFrame Pandas.
Si tu comprends ça aujourd’hui, Pandas sera naturel.
🔟 Mini-analyse guidée (fondation Data Analyst)
salaires = [300000, 450000, 500000, 650000]
moyenne = sum(salaires) / len(salaires)
print("Salaire moyen :", moyenne)
👉 Tu viens de faire une analyse de données, même simple.
C’est exactement ce que fera Pandas, mais à grande échelle.
2️⃣ Environnement de travail professionnel : Python
+ VS Code
Maintenant que la posture est claire, on parle d’un point non négociable.
👉 Un bon Data Analyst ne se reconnaît pas seulement à son raisonnement, mais aussi à la
manière dont il travaille.
Aujourd’hui, tu vas mettre en place ton poste de travail professionnel.
Pourquoi l’environnement est CRUCIAL
Beaucoup de débutants pensent :
« Tant que le code marche, c’est bon. »
C’est faux.
En Data Analysis :
● un mauvais environnement = erreurs
● un environnement mal compris = stress
● un environnement mal structuré = projets inutilisables
👉 On ne cherche pas juste à “faire tourner du code”. 👉 On cherche à travailler proprement,
efficacement et sereinement.
Pourquoi NOUS n’utilisons PAS Jupyter Notebook
Soyons très clairs.
Jupyter est utile. Mais il crée souvent de mauvaises habitudes chez les débutants :
● exécution dans le désordre
● variables qui existent sans qu’on sache pourquoi
● dépendance au copier-coller
Dans cette formation :
👉 Nous utilisons VS Code + fichiers .py.
Pourquoi ?
● logique proche de l’entreprise
● exécution claire, linéaire
● code lisible et versionnable
● meilleure compréhension de Python
👉 Si tu maîtrises Python en .py, Jupyter deviendra trivial plus tard.
🧰 Ton poste de travail de Data Analyst
Voici exactement ce que tu dois avoir :
● Python 3 installé
● VS Code installé
● Terminal intégré fonctionnel
● Un dossier de projet clair
Rien de plus. Rien de moins.
Vérifier que Python est bien installé
Ouvre le terminal (dans VS Code ou ton OS) et tape :
python --version
ou
python3 --version
🧠 Ce que tu dois comprendre :
● où est Python sur ta machine
● quelle version tu utilises
● comment Python est appelé
👉 Un Data Analyst ne travaille jamais à l’aveugle.
Comprendre python vs python3
Sur certaines machines :
● python = Python 2 (ancien)
● python3 = Python 3 (actuel)
👉 Nous utilisons Python 3 uniquement.
Ce détail évite beaucoup de bugs stupides.
Installer et comprendre VS Code
VS Code n’est pas « juste un éditeur de texte ».
C’est ton atelier de Data Analyst.
Tu dois repérer :
● l’explorateur de fichiers
● l’éditeur de code
● le terminal intégré
● la barre d’état
👉 Si tu sais où tout se trouve, tu travailles vite.
Extensions Python indispensables
Installe et comprends ces extensions :
● Python (officielle)
○ exécution du code
○ détection d’erreurs
● Pylance
○ aide intelligente
○ compréhension des types
Optionnel :
● Code Runner (pour tester rapidement)
⚠️ Règle importante :
Une extension que tu ne comprends pas est un futur problème.
📁 Organisation professionnelle des dossiers
Crée une structure claire dès le début :
python-data-analyst/
│
├── jour_01/
│ └── bases_python.py
Pourquoi c’est essentiel ?
● clarté mentale
● projets propres
● facilité de collaboration
👉 Le désordre sur ton disque reflète le désordre dans ta tête.
▶️ Exécuter un fichier Python correctement
Dans bases_python.py, écris :
print("Python pour la Data – Jour 1")
Exécute-le via le terminal :
python bases_python.py
🧠 À comprendre absolument :
● Python exécute le fichier entier
● toujours de haut en bas
● à chaque exécution, tout recommence
👉 Cette compréhension évite 70 % des erreurs futures.
❌ Erreurs classiques à ce stade
● cliquer partout sans comprendre
● exécuter le mauvais fichier
● travailler hors du dossier projet
● ne pas lire les messages d’erreur
👉 On corrige ces erreurs maintenant, pas au Jour 8.
3️⃣ Comprendre comment Python fonctionne vraiment
(exécution & erreurs)
Ici, on touche à une section fondamentale.
Si tu comprends profondément cette section :
● Python devient logique
● les erreurs te font moins peur
● tu progresses beaucoup plus vite que la moyenne
Si tu la survoles :
● tu copieras du code
● tu bloqueras souvent
● tu douteras inutilement
Prends ton temps.
Python n’est pas magique (et c’est une bonne nouvelle)
Python est un interpréteur.
Ça veut dire une chose très simple :
Python lit ton fichier ligne par ligne, de haut en bas, et exécute ce qu’il lit.
Rien de plus. Rien de moins.
👉 Il n’anticipe pas. 👉 Il ne “devine” rien. 👉 Il exécute.
▶️ L’ordre d’exécution : une règle ABSOLUE
Crée ce fichier :
print("Début du script")
salaire = 500000
print(salaire)
print("Fin du script")
Quand tu exécutes le fichier, Python :
1. lit la ligne 1
2. l’exécute
3. passe à la suivante
Toujours.
👉 En Data Analysis, l’ordre du code est aussi important que les données elles-mêmes.
❌ Exemple d’erreur classique (et très pédagogique)
print(salaire)
salaire = 500000
Python va lever une erreur. Pourquoi ?
Parce que :
● au moment où Python lit print(salaire)
● la variable salaire n’existe pas encore
👉 Python n’est pas injuste. 👉 Il est cohérent.
🧠 Ce que ça change pour un Data Analyst
Dans la vraie vie :
● tu charges des données
● tu les nettoies
● tu les analyses
👉 Tu ne peux pas analyser avant de charger. 👉 Tu ne peux pas nettoyer avant de voir.
L’ordre du script reflète l’ordre de la réflexion analytique.
🚨 Comprendre les erreurs (sans paniquer)
Une erreur Python n’est pas un échec. C’est un message.
Exemple :
NameError: name 'salaire' is not defined
Ce message te dit exactement :
● ce qui ne va pas
● où ça ne va pas
👉 Un bon Data Analyst lit les erreurs. Un mauvais les ignore ou panique.
Lire une erreur intelligemment
Quand une erreur apparaît :
1. Lis le type d’erreur
2. Lis le message
3. Regarde la ligne concernée
Ne saute jamais directement sur Google.
👉 80 % des erreurs se résolvent par une lecture attentive.
Exécution complète vs exécution partielle
Dans un fichier .py :
● tout le script est exécuté
● à chaque lancement
👉 Contrairement à Jupyter :
● pas d’état caché
● pas de variables fantômes
C’est pour ça que nous travaillons ainsi.
Redémarrer = repartir de zéro
À chaque fois que tu fais :
python bases_python.py
Python :
● oublie tout
● relit tout
● recommence
👉 C’est une garantie de fiabilité.
❌ Erreurs mentales fréquentes à éviter
● penser que Python “se souvient”
● croire qu’une variable existe sans l’avoir définie
● exécuter dans le désordre
👉 Ces erreurs coûtent cher en projet réel.
4️⃣ Variables : représenter des données réelles avec
Python
On arrive maintenant au cœur du métier de Data Analyst.
Une variable, ce n’est PAS un concept informatique abstrait.
👉 Une variable est la traduction directe d’une information réelle en Python.
Si tu comprends bien cette section, tout le reste de la Data Analysis devient naturel.
Ce qu’est vraiment une variable (version Data Analyst)
Une variable, c’est :
● une information
● issue du monde réel
● que tu stockes pour l’analyser
Exemples réels :
● salaire d’un employé
● âge d’un client
● chiffre d’affaires d’un mois
● nombre de commandes
Python ne fait que stocker ces informations pour toi.
🔤 Créer une variable en Python
La syntaxe est volontairement simple :
salaire = 500000
Lis cette ligne ainsi :
« Le salaire vaut 500 000 »
👉 Ce n’est PAS une égalité mathématique. 👉 C’est une affectation.
Python met la valeur dans la variable.
🚫 Erreur mentale classique à corriger tout de suite
Beaucoup de débutants pensent :
salaire = salaire + 10000
Et se disent : « Ça n’a pas de sens ».
En réalité, Python lit :
1. prends la valeur actuelle de salaire
2. ajoute 10 000
3. stocke le résultat dans salaire
👉 C’est exactement ce qu’on fait en analyse : mettre à jour une donnée.
Les variables racontent une histoire
Un script Python bien écrit se lit comme un raisonnement.
Exemple :
salaire_janvier = 450000
salaire_fevrier = 470000
salaire_moyen = (salaire_janvier + salaire_fevrier) / 2
Même sans connaître Python, on comprend l’analyse.
👉 C’est ça l’objectif.
Règles PROFESSIONNELLES de nommage
Un bon nom de variable :
● décrit la donnée
● est lisible
● évite l’ambiguïté
❌ Mauvais exemples
x = 450000
a = 32
✅ Bons exemples
salaire_mensuel = 450000
age_employe = 32
👉 En entreprise, un mauvais nom de variable est un vrai problème.
Convention Python (snake_case)
Python utilise une convention standard :
chiffre_affaires_annuel = 12500000
● minuscules
● underscore _
● pas d’espace
👉 Respecter cette convention = code professionnel.
⚠️ Ce qu’une variable NE PEUT PAS être
❌ Commencer par un chiffre ❌ Contenir des espaces ❌ Être un mot-clé Python (for, if,
print, etc.)
Python te le dira. Mais autant éviter.
Inspecter une variable (réflexe Data Analyst)
Tu ne dois jamais « supposer ».
print(salaire_mensuel)
print(type(salaire_mensuel))
👉 Inspecter ses données est une habitude professionnelle.
Variables = données temporaires
Important à comprendre :
● une variable vit uniquement pendant l’exécution du script
● quand le script se termine, tout disparaît
👉 C’est pour ça que l’ordre et la structure sont essentiels.
Mini-cas pratique guidé
Lis, écris et exécute ce code :
nom = "Alice"
age = 29
salaire = 480000
print("Employé :", nom)
print("Âge :", age)
print("Salaire :", salaire)
👉 Tu viens de créer une mini-fiche employé.
C’est exactement comme ça qu’on commence une analyse réelle.
❌ Erreurs fréquentes à ce stade
● utiliser des noms vagues
● écraser une variable sans le vouloir
● oublier ce que contient une variable
👉 La rigueur commence ici.
5️⃣ Types de données fondamentaux : comprendre la
nature de tes données
Ici, on entre dans une zone critique de la Data Analysis.
👉 Beaucoup de bugs, d’erreurs d’analyse et de mauvaises décisions viennent d’une mauvaise
compréhension des types de données.
Un Data Analyst sérieux ne manipule jamais une donnée sans connaître son type.
Principe clé à retenir tout de suite
Une valeur + un type = une donnée exploitable
Python ne voit pas seulement des nombres ou du texte. Il voit :
● un nombre entier
● un nombre décimal
● du texte
● une valeur vraie ou fausse
● une absence de valeur
👉 Et chaque type se comporte différemment.
🔢 1. int — les nombres entiers
📌 Ce que c’est
Les int représentent des quantités discrètes.
Exemples réels :
● nombre d’employés
● nombre de commandes
● âge
● stock
Exemple
nombre_employes = 42
age = 30
⚠️ Points importants
● pas de virgule
● opérations mathématiques exactes
print(nombre_employes + 10)
👉 Très utilisé pour les comptages, IDs, index.
🔢 2. float — les nombres décimaux
📌 Ce que c’est
Les float représentent des mesures continues.
Exemples réels :
● salaire
● chiffre d’affaires
● moyenne
● taux
Exemple
salaire = 485000.75
taux_croissance = 0.12
⚠️ Piège classique (très important)
print(0.1 + 0.2)
Résultat inattendu ❗
👉 Les float sont approximatifs. 👉 En Data Analysis, on arrondit, on contrôle, on vérifie.
🔤 3. str — les chaînes de caractères (texte)
Ce que c’est
Tout ce qui est texte.
Exemples réels :
● nom
● email
● pays
● catégorie
Exemple
nom = "Alice"
pays = "Cameroun"
⚠️ Règle ABSOLUE
"500000" # texte
500000 # nombre
👉 Ce n’est PAS la même chose. 👉 Confondre les deux = analyses fausses.
Concaténation de texte
print("Nom : " + nom)
👉 Utile pour le reporting, les logs, les exports.
✅ 4. bool — les valeurs vraies / fausses
Ce que c’est
Les booléens servent à prendre des décisions.
True
False
Exemples réels :
● client actif ?
● paiement validé ?
● employé présent ?
Exemple
client_actif = True
paiement_valide = False
👉 Les filtres, conditions et règles métier reposent là-dessus.
🚫 5. None — l’absence de valeur
📌 Ce que c’est
None signifie :
● donnée manquante
● non renseignée
● inconnue
👉 Ce n’est NI 0, NI "", NI False.
🧪 Exemple
date_depart = None
👉 Fondamental pour gérer les données manquantes (très fréquent en entreprise).
Identifier le type d’une donnée (réflexe pro)
print(type(salaire))
print(type(nom))
👉 Tu dois le faire tout le temps.
🔄 Conversion de types (casting)
En Data Analysis, les données arrivent souvent mal typées.
Exemples essentiels
age = "30"
age = int(age)
salaire = "450000.75"
salaire = float(salaire)
👉 Conversion = étape critique avant toute analyse.
⚠️ Erreurs fréquentes (et graves)
❌ additionner du texte et des nombres ❌ analyser un chiffre stocké comme str ❌ oublier
les valeurs None
👉 Ces erreurs passent parfois sans message d’erreur, mais détruisent les résultats.
Mini-cas Data Analyst guidé
nom = "Jean"
age = "28"
salaire = "520000"
age = int(age)
salaire = float(salaire)
salaire_annuel = salaire * 12
print("Employé :", nom)
print("Salaire annuel :", salaire_annuel)
👉 Tu viens de :
● corriger des types
● faire un calcul fiable
● produire une information exploitable
6️⃣ Structurer les données : listes, tuples et dictionnaires
Jusqu’ici, tu as manipulé une information à la fois.
Mais un Data Analyst ne travaille jamais sur une seule valeur.
👉 Il travaille sur :
● plusieurs employés
● plusieurs ventes
● plusieurs clients
● plusieurs observations
Cette section est le pont direct vers les datasets.
🧠 Changement de mentalité (très important)
Tu ne penses plus en :
"une variable = une donnée"
Tu penses désormais en :
une structure = un ensemble de données liées
C’est exactement ce que tu retrouveras plus tard dans :
● pandas DataFrame
● bases de données
● fichiers CSV / Excel
1. Les listes (list) — la base absolue
Ce que c’est
Une liste est une collection ordonnée de valeurs.
Exemples réels :
● liste de salaires
● liste d’âges
● liste de ventes journalières
Créer une liste
salaires = [450000, 480000, 520000, 500000]
👉 Une seule variable, plusieurs observations.
Accéder aux éléments (index)
print(salaires[0]) # premier salaire
print(salaires[2]) # troisième salaire
⚠️ Python commence à 0.
👉 C’est fondamental pour toute analyse.
Modifier une liste
[Link](530000)
👉 Très fréquent quand on ajoute de nouvelles données.
Taille d’une liste
print(len(salaires))
👉 Savoir combien d’observations tu analyses.
Calculs simples sur une liste
somme_salaires = sum(salaires)
salaire_moyen = somme_salaires / len(salaires)
👉 Tu viens de faire une analyse descriptive basique.
2. Les tuples (tuple) — données fixes
Ce que c’est
Un tuple ressemble à une liste, mais ne peut pas être modifié.
coordonnees = (1.5, 2.8)
👉 Utilisé quand la donnée ne doit pas changer.
⚠️ Différence clé avec les listes
coordonnees[0] = 3.2 # ERREUR
👉 Cette protection est parfois volontaire.
3. Les dictionnaires (dict) — structure DATA ANALYST
Ce que c’est
Un dictionnaire stocke des données sous forme clé → valeur.
👉 C’est LA structure la plus importante ici.
🧪 Créer un dictionnaire
employe = {
"nom": "Alice",
"age": 29,
"salaire": 480000,
"departement": "Data"
}
👉 Lis-le comme une fiche RH.
Accéder aux valeurs
print(employe["salaire"])
👉 Accès par clé, pas par position.
Modifier / ajouter une donnée
employe["salaire"] = 500000
employe["anciennete"] = 3
👉 Mise à jour métier.
Pourquoi les dictionnaires sont cruciaux
Parce qu’ils :
● donnent du sens aux données
● évitent les erreurs de position
● ressemblent aux lignes d’un dataset
👉 Chaque ligne = un dictionnaire.
Combiner les structures (très important)
Exemple réaliste
employes = [
{"nom": "Alice", "age": 29, "salaire": 480000},
{"nom": "Bob", "age": 35, "salaire": 520000},
{"nom": "Claire", "age": 31, "salaire": 500000}
]
👉 Tu viens de créer un mini-dataset.
🔄 Parcourir les données
for employe in employes:
print(employe["nom"], employe["salaire"])
👉 Tu fais déjà de l’analyse tabulaire.
⚠️ Erreurs fréquentes
❌ utiliser une liste quand un dictionnaire est plus clair ❌ mélanger des types incohérents ❌
oublier la structure des données
👉 Une mauvaise structure = analyses complexes et bugs.
Mini-cas Data Analyst guidé
ventes = [120000, 150000, 100000, 180000]
chiffre_affaires = sum(ventes)
vente_moyenne = chiffre_affaires / len(ventes)
print("CA total :", chiffre_affaires)
print("Vente moyenne :", vente_moyenne)
👉 Exactement le type de calcul fait en entreprise.
7️⃣ Comparaisons et logique : conditions if/else et
boucles for
C’est ici que Python devient un véritable outil d’analyse, et pas seulement un moyen de
stocker des données.
Tu vas apprendre à :
● filtrer les données
● prendre des décisions automatiques
● répéter des calculs sur plusieurs observations
Tout ce que fait un Data Analyst en entreprise.
La logique conditionnelle if/else
📌 Principe
Selon la valeur d’une variable, exécute une action différente.
Exemple métier :
● un employé a-t-il droit à une prime ?
● un client est-il actif ?
🧪 Exemple simple
salaire = 500000
if salaire > 480000:
print("Prime possible")
else:
print("Pas de prime")
✅ Résultat : le script prend une décision automatique.
⚠️ Pièges classiques
❌ = au lieu de ==
● = : assignation
● == : comparaison
if salaire = 500000: # ERREUR
👉 Toujours relire et comprendre le message d’erreur.
🔄 Comparateurs utiles
● > : supérieur
● < : inférieur
● >= : supérieur ou égal
● <= : inférieur ou égal
● == : égal
● != : différent
Exemple :
age = 30
if age >= 18:
print("Adulte")
else:
print("Mineur")
Logique combinée
● and : les deux conditions doivent être vraies
● or : au moins une condition vraie
● not : inverse la condition
salaire = 500000
anciennete = 4
if salaire > 480000 and anciennete >= 3:
print("Prime accordée")
👉 Très utilisé pour les règles métier complexes.
🔁 Les boucles for — automatiser l’analyse
Principe
Répéter une action pour chaque élément d’une liste ou d’un dictionnaire.
Exemple simple :
salaires = [450000, 480000, 500000]
for salaire in salaires:
print(salaire)
✅ Résultat : chaque salaire est imprimé automatiquement.
🔄 Boucles sur dictionnaires
employe = {"nom": "Alice", "salaire": 480000}
for cle in employe:
print(cle, employe[cle])
👉 Permet d’explorer toutes les données d’une ligne.
Boucles imbriquées
Avec plusieurs observations :
employes = [
{"nom": "Alice", "salaire": 480000},
{"nom": "Bob", "salaire": 520000}
]
for employe in employes:
if employe["salaire"] > 500000:
print(employe["nom"], "prime possible")
✅ Résultat : analyse automatique sur toutes les lignes.
⚠️ Erreurs fréquentes
● oublier les deux-points :
● mauvaise indentation
● utiliser = au lieu de ==
● mélanger types (int vs str)
👉 Ces erreurs sont les plus courantes en entreprise.
Mini-cas Data Analyst guidé
ventes = [120000, 150000, 100000, 180000]
for vente in ventes:
if vente >= 150000:
print("Objectif atteint :", vente)
else:
print("Objectif non atteint :", vente)
✅ Analyse simple et pratique sur plusieurs observations.
8️⃣ Listes avancées et comprehension : analyse efficace
des données
Maintenant que tu sais manipuler des listes, des boucles et des conditions, il est temps de
passer à l’étape suivante : traiter rapidement plusieurs données avec des techniques
avancées.
En Data Analysis, tu manipuleras souvent des centaines ou milliers d’observations.
Objectif
● filtrer des données selon des critères précis
● transformer une liste en une autre liste rapidement
● produire des mini-analyses sans écrire des dizaines de lignes
Compréhension de liste (list comprehension)
Une list comprehension est une manière concise et puissante de créer ou transformer des
listes.
Exemple classique
salaires = [450000, 480000, 500000, 520000]
salaires_hauts = [s for s in salaires if s > 480000]
print(salaires_hauts)
✅ Résultat : [500000, 520000]
👉 Lis le code ainsi :
● pour chaque s dans salaires
● si s > 480000
● alors ajoute-le à la nouvelle liste
Transformation rapide de données
salaires_euros = [s / 655 for s in salaires] # Convertir en euros
print(salaires_euros)
👉 On applique une fonction à chaque élément sans boucle explicite.
Mini-analyse avec comprehension
salaire_total = sum([s for s in salaires if s > 480000])
print("Total salaires > 480k :", salaire_total)
👉 Combiner comprehension + fonctions Python natives = analyse rapide et lisible.
Filtrage et conditions multiples
salaire_total = sum([s for s in salaires if s > 480000 and s < 520000])
print(salaire_total)
✅ Résultat : somme des salaires compris entre 480k et 520k.
Boucles vs comprehension
Boucle classique
salaires_hauts = []
for s in salaires:
if s > 480000:
salaires_hauts.append(s)
List comprehension équivalente
salaires_hauts = [s for s in salaires if s > 480000]
👉 List comprehension = moins de code, plus lisible.
Analyse avec plusieurs listes
noms = ["Alice", "Bob", "Claire"]
salaires = [480000, 520000, 500000]
# Employés avec salaire > 500k
employes_top = [nom for nom, salaire in zip(noms, salaires) if salaire > 500000]
print(employes_top)
✅ Résultat : ['Bob', 'Claire']
👉 zip() = outil très pratique pour travailler sur plusieurs colonnes simultanément.
Mini-cas Data Analyst guidé
ventes = [120000, 150000, 100000, 180000]
ventes_sup_150k = [v for v in ventes if v >= 150000]
print("Ventes >= 150k :", ventes_sup_150k)
ventes_totales = sum(ventes_sup_150k)
print("Total ventes >= 150k :", ventes_totales)
✅ Résultat : analyse automatique sur plusieurs observations.
⚠️ Erreurs fréquentes
● confondre boucle et comprehension
● oublier la condition
● manipuler des listes de tailles différentes sans zip
● ne pas tester sur un petit jeu de données avant de passer aux gros datasets
9️⃣ Fonctions : automatiser et réutiliser ton code
Dans cette section, tu vas comprendre comment créer, utiliser et exploiter des fonctions,
compétences indispensables pour tout Data Analyst.
Les fonctions te permettent :
● de réutiliser du code sans le réécrire
● de clarifier ton raisonnement analytique
● de préparer ton script pour l’automatisation et l’analyse de gros datasets
Qu’est-ce qu’une fonction ?
Une fonction est un bloc de code réutilisable qui effectue une tâche précise.
Exemple métier :
● calculer le salaire annuel d’un employé
● convertir des devises
● filtrer les ventes supérieures à un seuil
Définir une fonction simple
def calcul_salaire_annuel(salaire_mensuel):
"""Retourne le salaire annuel"""
return salaire_mensuel * 12
salaire = 480000
print(calcul_salaire_annuel(salaire)) # 5760000
👉 def = mot-clé pour définir la fonction 👉 return = valeur que la fonction renvoie 👉
Docstring (""" """)) = explique la fonction (très utile pour toi et tes collègues)
🔹 Fonctions avec plusieurs paramètres
def prime_employe(salaire, anciennete):
if anciennete >= 3:
return salaire * 0.1 # prime de 10%
else:
return 0
prime = prime_employe(500000, 4)
print(prime) # 50000
👉 Très pratique pour appliquer les règles métier sur plusieurs colonnes d’un dataset
🔹 Valeurs par défaut des paramètres
def prime_employe(salaire, anciennete=3):
if anciennete >= 3:
return salaire * 0.1
else:
return 0
print(prime_employe(500000)) # 50000, utilise la valeur par défaut
👉 Permet d’éviter des répétitions inutiles
🔹 Fonctions anonymes (lambda) pour analyse rapide
salaires = [450000, 480000, 500000, 520000]
prime = list(map(lambda s: s*0.1, salaires))
print(prime) # [45000.0, 48000.0, 50000.0, 52000.0]
● lambda = petite fonction rapide
● map() = applique la fonction à chaque élément de la liste
👉 Très pratique pour des mini-analyses rapides sur des colonnes
🔹 Retour multiple
def statistiques(salaires):
total = sum(salaires)
moyen = total / len(salaires)
maximum = max(salaires)
return total, moyen, maximum
salaires = [450000, 480000, 500000, 520000]
total, moyen, maximum = statistiques(salaires)
print(total, moyen, maximum)
👉 Les fonctions peuvent renvoyer plusieurs valeurs en même temps
🔹 Mini-cas pratique Data Analyst
1. Crée une fonction taux_croissance qui prend ancien_valeur et
nouvelle_valeur et retourne le pourcentage de croissance.
2. Applique-la sur une liste de chiffres d’affaires.
chiffres_affaires = [100000, 120000, 150000]
# écrire la fonction et appliquer avec map ou une boucle
👉 Cela te montre comment automatiser des calculs sur plusieurs observations
⚠️ Erreurs fréquentes
● oublier return → la fonction renvoie None
● confondre paramètres et variables globales
● complexifier la fonction inutilement → perdre en lisibilité
🔟 Modules et packages : exploiter les outils
professionnels
En Data Analysis, tu ne réinventes jamais la roue. Python dispose d’une multitude de modules
et packages prêts à l’emploi.
Cette section te montre d’où viennent ces modules, comment les importer, et comment les
utiliser efficacement pour l’analyse de données.
Qu’est-ce qu’un module et un package ?
● Module : un fichier .py qui contient des fonctions, classes et variables pré-écrites.
● Package : un ensemble de modules organisés dans un dossier avec un fichier spécial
__init__.py.
Exemple :
● math = module standard pour les calculs mathématiques
● random = module standard pour la génération de nombres aléatoires
● numpy, pandas, plotly = packages externes très utilisés en Data Analysis
Importer un module
import math
print([Link](16)) # 4.0
● import math = charge le module entier
● accès aux fonctions via math.nom_fonction
Importer une fonction spécifique
from math import sqrt
print(sqrt(25)) # 5.0
● plus concis
● seulement la fonction dont tu as besoin
🔹 Alias pour simplifier
import numpy as np
arr = [Link]([1, 2, 3])
print(arr)
● as np = raccourci pour ne pas réécrire numpy à chaque fois
● standard dans le monde Data Analyst / Data Scientist
🔹 Module random pour les données simulées
import random
print([Link](1, 100)) # entier aléatoire entre 1 et 100
● très pratique pour créer des datasets de test ou des simulations
🔹 Packages externes populaires en Data Analysis
1. NumPy : tableaux multidimensionnels, calculs rapides, vecteurs et matrices
2. Pandas : structures DataFrame et Series, manipulation de datasets
3. Plotly : visualisations interactives et graphiques professionnels
Pour utiliser ces packages externes, il faut les installer via pip :
pip install numpy pandas plotly
🔹 Exemple d’utilisation combinée
import numpy as np
import pandas as pd
import [Link] as px
# Créer un tableau NumPy
arr = [Link]([450000, 480000, 500000, 520000])
# Créer un DataFrame Pandas
df = [Link]({"Employe": ["Alice", "Bob", "Claire", "David"],
"Salaire": arr})
# Visualiser avec Plotly
fig = [Link](df, x="Employe", y="Salaire", title="Salaires")
[Link]()
👉 Tu viens de combiner NumPy + Pandas + Plotly pour un mini-projet d’analyse et
visualisation.
⚠️ Bonnes pratiques
● Toujours importer les modules au début du script
● Utiliser des alias standards (np, pd, px) pour la lisibilité
● Installer seulement les packages nécessaires pour éviter des conflits
Conclusion
Félicitations, tu viens de terminer le Jour 1 de la formation Python pour la Data. 🔥
Tu as maintenant toutes les bases indispensables pour travailler comme Data Analyst :
● Variables et types de données (int, float, str, bool, None)
● Structures de données avancées : listes, tuples, dictionnaires
● Conditions et boucles (if/else, for) pour automatiser les analyses
● Listes avancées, comprehension, filtrage et mini-analyses
● Fonctions pour automatiser et structurer ton code
● Modules et packages (math, random, numpy, pandas, plotly) pour aller plus loin
Tu as maintenant tous les outils Python pour manipuler, analyser et visualiser des
données simples à complexes.
Mise en pratique : mini-cas Data Analyst
Pour consolider tes compétences, voici un mini-projet pratique : Analyse des salaires et
primes d’une équipe.
Objectif
● Créer un dataset avec plusieurs employés
● Calculer des informations clés : salaire annuel, prime éventuelle
● Filtrer et analyser les salaires supérieurs à un seuil
● Visualiser les résultats avec Plotly
Étapes pratiques
1. Créer le dataset (liste de dictionnaires)
employes = [
{"nom": "Alice", "age": 29, "salaire": 480000, "anciennete": 4},
{"nom": "Bob", "age": 35, "salaire": 520000, "anciennete": 5},
{"nom": "Claire", "age": 31, "salaire": 500000, "anciennete": 2},
{"nom": "David", "age": 28, "salaire": 450000, "anciennete": 3}
]
2. Définir une fonction pour calculer la prime
def calcul_prime(salaire, anciennete):
return salaire * 0.1 if anciennete >= 3 else 0
3. Appliquer la fonction à chaque employé
for e in employes:
e["prime"] = calcul_prime(e["salaire"], e["anciennete"])
4. Filtrer les employés avec salaire > 480000
employes_top = [e for e in employes if e["salaire"] > 480000]
print(employes_top)
5. Créer un DataFrame Pandas pour l’analyse et visualisation
import pandas as pd
import [Link] as px
df = [Link](employes)
fig = [Link](df, x="nom", y=["salaire", "prime"], title="Salaires et primes")
[Link]()
✅ Résultat :
● Mini dataset structuré
● Calcul automatisé des primes
● Filtrage des données importantes
● Visualisation graphique interactive
Ce mini-cas te permet de mettre en pratique toutes les compétences du jour 1,
exactement comme dans un projet réel en entreprise.
À la fin du jour 1, tu es capable de :
● manipuler les données avec Python de manière professionnelle
● structurer des datasets simples
● appliquer des règles métier et calculs automatisés
● produire des analyses et visualisations claires
Tu es maintenant prêt à passer au Jour 2, où nous commencerons à explorer NumPy et
Pandas en profondeur, pour manipuler de vrais datasets volumineux et effectuer des analyses
complexes.