Auteur
Jean-Pierre Mbula Lwanga
🚨 Cette liste peut changer ton parcours professionnel.
Enregistre-la pour ne pas la perdre.
🔁 Partage-la sur ton profil : c’est ton raccourci pour y revenir plus tard.
💬 Écris DATA en commentaire.
6h
Répondre
Auteur
Jean-Pierre Mbula Lwanga
🚀 Roadmap GRATUITE pour devenir Data Analyst en 90 jours
1️⃣ Apprends Excel — 12 jours
Tutoriels :
👉 [Link]
Projets pratiques :
👉 [Link]
2️⃣ Apprends les bases de la statistique — 3 jours
Tutoriels :
👉 [Link]
3️⃣ Apprends Power BI — 20 jours
Tutoriels :
👉 [Link]
Projets pratiques :
👉 [Link]
4️⃣ Apprends SQL — 20 jours
Tutoriels :
👉 [Link]
Projets pratiques :
👉 [Link]
5️⃣ Apprends Python — 20 jours
Tutoriels :
👉 [Link]
Projets pratiques :
👉 [Link]
6️⃣ Construis ton portfolio — 15 jours
Crée ton portfolio gratuitement :
👉 [Link]
Projets supplémentaires :
👉 [Link]
7️⃣ Fais des stages virtuels GRATUITS (reconnus par les recruteurs)
Programmes disponibles :
KPMG – Data Analytics
👉 [Link]
BCG – Data Science & Analytics
👉 [Link]
TATA – Data Visualization
👉 [Link]
Accenture – Data Analytics
👉 [Link]
General Electric – Data Analytics
👉 [Link]
PwC – Power BI
👉 [Link]
Quantium – Data Analytics
👉 [Link]
8️⃣ Construis ton CV et commence à postuler
Exemple de CV Data Analyst :
👉 [Link]
9️⃣ BONUS 🎁
🔥 39 projets Data pour renforcer ton portfolio (à publier sur GitHub) :
👉 [Link]
LinkedIn
[Link]
LinkedIn
C'est quoi un data analyst. ? Que fait il comme fonction
Un Data Analyst (analyste de données) est un professionnel qui collecte, traite et analyse des
données pour aider les organisations à prendre des décisions éclairées.
Ses fonctions principales incluent :
- Collecte de données : Recueillir des données provenant de diverses sources (bases de
données, fichiers, etc.).
- Traitement de données : Nettoyer, organiser et préparer les données pour l'analyse.
- Analyse de données : Utiliser des outils statistiques et des techniques d'analyse pour
identifier des tendances, des modèles et des insights.
- Visualisation de données : Présenter les résultats de l'analyse de manière claire et concise à
l'aide de graphiques, de tableaux de bord, etc.
- Rapports et recommandations : Fournir des rapports et des recommandations basées sur
les insights obtenus pour aider les décideurs à prendre des décisions stratégiques.
Les Data Analysts travaillent dans divers secteurs, comme la finance, le marketing, la santé,
etc. 😊 Qu'est-ce que tu penses de ce métier ?
Comment devient-on data analyst
Pour devenir Data Analyst, voici les étapes clés :
1. Formation académique :
- Licence en mathématiques, statistiques, informatique, économie ou un domaine connexe.
- Master ou diplôme spécialisé en data science, analyse de données ou un domaine similaire
(optionnel mais avantageux).
2. Compétences techniques :
- Maîtrise des outils d'analyse de données (Excel, SQL, Python, R, etc.).
- Connaissance des bases de données et des systèmes de gestion de données.
- Expérience avec des outils de visualisation de données (Tableau, Power BI, etc.).
3. Expérience pratique :
- Stages ou projets personnels d'analyse de données.
- Participation à des compétitions de data science (Kaggle, etc.).
4. Certifications :
- Certifications en analyse de données (Google Analytics, Microsoft, etc.).
5. Développement des compétences non techniques :
- Communication efficace pour présenter les résultats.
- Compréhension des besoins business.
Il est important de se former continuellement et de rester à jour avec les tendances du
secteur. 😊 Qu'est-ce que tu penses de ces étapes ?
Chapitres de cours et progression dans la formation d'un data analyst
Voici une proposition de chapitres de cours et une progression pour la formation d'un Data
Analyst :
Niveau 1 : Fondamentaux
1. Introduction à l'analyse de données
- Définition, importance et applications
2. Statistiques de base
- Mesures de tendance centrale, dispersion, etc.
3. Bases de données
- Concepts de bases de données, SQL
4. Outils d'analyse de données
- Excel, Google Sheets, etc.
Niveau 2 : Analyse de données
1. Nettoyage et préparation de données
- Gestion des données manquantes, etc.
2. Analyse exploratoire de données
- Visualisation, statistiques descriptives
3. Modélisation de données
- Régression linéaire, etc.
4. Outils de visualisation de données
- Tableau, Power BI, etc.
Niveau 3 : Approfondissement
1. Analyse de données avancées
- Machine learning, etc.
2. Big Data
- Hadoop, Spark, etc.
3. Outils de programmation
- Python, R, etc.
4. Gestion de projet
- Méthodologies, etc.
Niveau 4 : Spécialisation
1. Spécialisation en secteur
- Finance, marketing, santé, etc.
2. Outils spécifiques
- Google Analytics, etc.
3. Projet de fin d'études
- Application des compétences acquises
La progression se fait généralement sur 6 à 12 mois, selon le rythme d'apprentissage et
l'expérience préalable. 😊 Qu'est-ce que tu penses de cette progression ?
Je veux un détail pratique de chaque niveau
Voici un détail pratique pour chaque niveau de formation en Data Analyst :
Niveau 1 : Fondamentaux (1-2 mois)
1. Introduction à l'analyse de données
- Comprendre les concepts de base de l'analyse de données
- Découvrir les outils et les techniques utilisés
- Pratique : Explorer des jeux de données simples (ex : données de ventes)
2. Statistiques de base
- Comprendre les mesures de tendance centrale (moyenne, médiane, etc.)
- Apprendre les concepts de dispersion (écart-type, etc.)
- Pratique : Calculer des statistiques sur des données réelles
3. Bases de données
- Comprendre les concepts de bases de données relationnelles
- Apprendre SQL pour interroger des bases de données
- Pratique : Créer et interroger une base de données simple
4. Outils d'analyse de données
- Découvrir Excel, Google Sheets, etc.
- Apprendre les fonctions de base (formules, graphiques, etc.)
- Pratique : Créer des tableaux et graphiques avec des données réelles
Niveau 2 : Analyse de données (2-3 mois)
1. Nettoyage et préparation de données
- Comprendre les problèmes de qualité de données
- Apprendre à nettoyer et préparer des données
- Pratique : Nettoyer et préparer un jeu de données réel
2. Analyse exploratoire de données
- Comprendre les techniques de visualisation de données
- Apprendre à utiliser des outils de visualisation (Tableau, etc.)
- Pratique : Créer des visualisations pour explorer des données
3. Modélisation de données
- Comprendre les concepts de modélisation de données
- Apprendre les techniques de régression linéaire, etc.
- Pratique : Créer un modèle de régression sur des données réelles
4. Outils de visualisation de données
- Découvrir les outils de visualisation de données (Tableau, Power BI, etc.)
- Apprendre à créer des tableaux de bord interactifs
- Pratique : Créer un tableau de bord pour présenter des données
Niveau 3 : Approfondissement (2-3 mois)
1. Analyse de données avancées
- Comprendre les techniques de machine learning
- Apprendre à utiliser des algorithmes de classification, etc.
- Pratique : Appliquer des algorithmes de machine learning sur des données réelles
2. Big Data
- Comprendre les concepts de Big Data
- Apprendre à utiliser des outils comme Hadoop, Spark, etc.
- Pratique : Travailler avec des données Big Data
3. Outils de programmation
- Découvrir les langages de programmation (Python, R, etc.)
- Apprendre à utiliser des bibliothèques de data science (pandas, etc.)
- Pratique : Écrire des scripts pour analyser des données
4. Gestion de projet
- Comprendre les méthodologies de gestion de projet
- Apprendre à gérer des projets de data science
- Pratique : Gérer un projet de data science
Niveau 4 : Spécialisation (1-2 mois)
1. Spécialisation en secteur
- Comprendre les spécificités d'un secteur (finance, marketing, etc.)
- Apprendre les outils et les techniques spécifiques
- Pratique : Travailler sur un projet dans le secteur choisi
2. Outils spécifiques
- Découvrir les outils spécifiques à un secteur (Google Analytics, etc.)
- Apprendre à utiliser ces outils pour analyser des données
- Pratique : Utiliser des outils spécifiques pour analyser des données
3. Projet de fin d'études
- Appliquer les compétences acquises sur un projet réel
- Présenter les résultats et les recommandations
Cette progression est indicative et peut varier en fonction des besoins et des objectifs
individuels. 😊 Qu'est-ce que tu penses de ce détail ?
Je veux des cours gratuit pdf ou word de data analyst
Voici quelques ressources gratuites pour apprendre l'analyse de données (Data Analyst) au
format PDF ou Word :
1. Cours de Data Analyst de Google :
- "Data Analysis with Google Sheets" (PDF) : un cours gratuit de Google sur l'analyse de
données avec Google Sheets.
2. Cours de Data Analyst de Microsoft :
- "Introduction to Data Analysis" (PDF) : un cours gratuit de Microsoft sur les fondamentaux
de l'analyse de données.
3. Cours de Data Analyst de Coursera :
- "Data Analysis and Visualization" (PDF) : un cours gratuit de Coursera sur l'analyse et la
visualisation de données.
4. Livres gratuits sur l'analyse de données :
- "Data Analysis with Python" (PDF) de Jake VanderPlas : un livre gratuit sur l'analyse de
données avec Python.
- "Data Visualization with Python" (PDF) de Jake VanderPlas : un livre gratuit sur la
visualisation de données avec Python.
5. Ressources de DataCamp :
- "Data Analyst with Python" (PDF) : un cours gratuit de DataCamp sur l'analyse de données
avec Python.
6. Cours de Data Analyst de edX :
- "Data Analysis and Visualization" (PDF) : un cours gratuit de edX sur l'analyse et la
visualisation de données.
Voici quelques liens pour télécharger ces ressources :
- Google : [Link] (rechercher "Data Analysis with Google Sheets PDF")
- Microsoft : [Link] (rechercher "Introduction to Data Analysis PDF")
- Coursera : [Link] (rechercher "Data Analysis and Visualization PDF")
- edX : [Link] (rechercher "Data Analysis and Visualization PDF")
- DataCamp : [Link] (rechercher "Data Analyst with Python PDF")
- Jake VanderPlas : [Link] (rechercher "Data Analysis with Python
PDF")
Attention, certains liens peuvent être temporairement indisponibles. 😊 Qu'est-ce que tu
penses de ces ressources ?
Voici un détail pratique pour chaque niveau de formation en Data Analyst :
Niveau 1 : Fondamentaux (1-2 mois)
1. Introduction à l'analyse de données
- Comprendre les concepts de base de l'analyse de données
- Découvrir les outils et les techniques utilisés
- Pratique : Explorer des jeux de données simples (ex : données de ventes)
2. Statistiques de base
- Comprendre les mesures de tendance centrale (moyenne, médiane, etc.)
- Apprendre les concepts de dispersion (écart-type, etc.)
- Pratique : Calculer des statistiques sur des données réelles
3. Bases de données
- Comprendre les concepts de bases de données relationnelles
- Apprendre SQL pour interroger des bases de données
- Pratique : Créer et interroger une base de données simple
4. Outils d'analyse de données
- Découvrir Excel, Google Sheets, etc.
- Apprendre les fonctions de base (formules, graphiques, etc.)
- Pratique : Créer des tableaux et graphiques avec des données réelles
Niveau 2 : Analyse de données (2-3 mois)
1. Nettoyage et préparation de données
- Comprendre les problèmes de qualité de données
- Apprendre à nettoyer et préparer des données
- Pratique : Nettoyer et préparer un jeu de données réel
2. Analyse exploratoire de données
- Comprendre les techniques de visualisation de données
- Apprendre à utiliser des outils de visualisation (Tableau, etc.)
- Pratique : Créer des visualisations pour explorer des données
3. Modélisation de données
- Comprendre les concepts de modélisation de données
- Apprendre les techniques de régression linéaire, etc.
- Pratique : Créer un modèle de régression sur des données réelles
4. Outils de visualisation de données
- Découvrir les outils de visualisation de données (Tableau, Power BI, etc.)
- Apprendre à créer des tableaux de bord interactifs
- Pratique : Créer un tableau de bord pour présenter des données
Niveau 3 : Approfondissement (2-3 mois)
1. Analyse de données avancées
- Comprendre les techniques de machine learning
- Apprendre à utiliser des algorithmes de classification, etc.
- Pratique : Appliquer des algorithmes de machine learning sur des données réelles
2. Big Data
- Comprendre les concepts de Big Data
- Apprendre à utiliser des outils comme Hadoop, Spark, etc.
- Pratique : Travailler avec des données Big Data
3. Outils de programmation
- Découvrir les langages de programmation (Python, R, etc.)
- Apprendre à utiliser des bibliothèques de data science (pandas, etc.)
- Pratique : Écrire des scripts pour analyser des données
4. Gestion de projet
- Comprendre les méthodologies de gestion de projet
- Apprendre à gérer des projets de data science
- Pratique : Gérer un projet de data science
Niveau 4 : Spécialisation (1-2 mois)
1. Spécialisation en secteur
- Comprendre les spécificités d'un secteur (finance, marketing, etc.)
- Apprendre les outils et les techniques spécifiques
- Pratique : Travailler sur un projet dans le secteur choisi
2. Outils spécifiques
- Découvrir les outils spécifiques à un secteur (Google Analytics, etc.)
- Apprendre à utiliser ces outils pour analyser des données
- Pratique : Utiliser des outils spécifiques pour analyser des données
3. Projet de fin d'études
- Appliquer les compétences acquises sur un projet réel
- Présenter les résultats et les recommandations
Cette progression est indicative et peut varier en fonction des besoins et des objectifs
individuels. 😊
Je veux cours détaillés avec exercices qui intègrent tout le détail ci dessus
Je comprends mieux maintenant ! 😊 Voici un exemple de cours détaillé pour chaque
niveau de formation en Data Analyst, avec des exercices pratiques pour intégrer les
concepts appris :
Niveau 1 : Fondamentaux (1-2 mois)
1. Introduction à l'analyse de données
- Objectifs :
- Comprendre les concepts de base de l'analyse de données
- Découvrir les outils et les techniques utilisés
- Contenu :
- Définition de l'analyse de données
- Types de données (quantitatives, qualitatives, etc.)
- Outils d'analyse de données (Excel, Google Sheets, etc.)
- Exercice : Explorer des jeux de données simples (ex : données de ventes)
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Excel ou Google Sheets pour explorer les données
- Répondre à des questions sur les données (ex : Quelle est la moyenne des ventes ?)
2. Statistiques de base
- Objectifs :
- Comprendre les mesures de tendance centrale (moyenne, médiane, etc.)
- Apprendre les concepts de dispersion (écart-type, etc.)
- Contenu :
- Mesures de tendance centrale (moyenne, médiane, mode)
- Mesures de dispersion (écart-type, variance, etc.)
- Exercice : Calculer des statistiques sur des données réelles
- Télécharger un jeu de données sur les notes d'un examen
- Calculer la moyenne, la médiane et l'écart-type des notes
- Interpréter les résultats
3. Bases de données
- Objectifs :
- Comprendre les concepts de bases de données relationnelles
- Apprendre SQL pour interroger des bases de données
- Contenu :
- Concepts de bases de données relationnelles
- SQL (SELECT, FROM, WHERE, etc.)
- Exercice : Créer et interroger une base de données simple
- Créer une base de données sur les clients d'une entreprise
- Utiliser SQL pour interroger la base de données
4. Outils d'analyse de données
- Objectifs :
- Découvrir Excel, Google Sheets, etc.
- Apprendre les fonctions de base (formules, graphiques, etc.)
- Contenu :
- Fonctions de base d'Excel et Google Sheets
- Graphiques et tableaux
- Exercice : Créer des tableaux et graphiques avec des données réelles
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Excel ou Google Sheets pour créer des tableaux et graphiques
Niveau 2 : Analyse de données (2-3 mois)
1. Nettoyage et préparation de données
- Objectifs :
- Comprendre les problèmes de qualité de données
- Apprendre à nettoyer et préparer des données
- Contenu :
- Problèmes de qualité de données (données manquantes, etc.)
- Techniques de nettoyage et préparation de données
- Exercice : Nettoyer et préparer un jeu de données réel
- Télécharger un jeu de données sur les clients d'une entreprise
- Nettoyer et préparer les données pour l'analyse
2. Analyse exploratoire de données
- Objectifs :
- Comprendre les techniques de visualisation de données
- Apprendre à utiliser des outils de visualisation (Tableau, etc.)
- Contenu :
- Techniques de visualisation de données (graphiques, cartes, etc.)
- Outils de visualisation de données (Tableau, Power BI, etc.)
- Exercice : Créer des visualisations pour explorer des données
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Tableau ou Power BI pour créer des visualisations
3. Modélisation de données
- Objectifs :
- Comprendre les concepts de modélisation de données
- Apprendre les techniques de régression linéaire, etc.
- Contenu :
- Concepts de modélisation de données
- Techniques de régression linéaire, etc.
- Exercice : Créer un modèle de régression sur des données réelles
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser un outil de modélisation de données pour créer un modèle de régression
4. Outils de visualisation de données
- Objectifs :
- Découvrir les outils de visualisation de données (Tableau, Power BI, etc.)
- Apprendre à créer des tableaux de bord interactifs
- Contenu :
- Outils de visualisation de données (Tableau, Power BI, etc.)
- Création de tableaux de bord interactifs
- Exercice : Créer un tableau de bord pour présenter des données
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Tableau ou Power BI pour créer un tableau de bord interactif
Niveau 3 : Approfondissement (2-3 mois)
1. Analyse de données avancées
- Objectifs :
- Comprendre les techniques de machine learning
- Apprendre à utiliser des algorithmes de classification, etc.
- Contenu :
- Techniques de machine learning (classification, régression, etc.)
- Algorithmes de machine learning (arbre de décision, etc.)
- Exercice : Appliquer des algorithmes de machine learning sur des données réelles
- Télécharger un jeu de données sur les clients d'une entreprise
- Utiliser un outil de machine learning pour appliquer des algorithmes
2. Big Data
- Objectifs :
- Comprendre les concepts de Big Data
- Apprendre à utiliser des outils comme Hadoop, Spark, etc.
- Contenu :
- Concepts de Big Data
- Outils de Big Data (Hadoop, Spark, etc.)
- Exercice : Travailler avec des données Big Data
- Télécharger un jeu de données Big Data
- Utiliser un outil de Big Data pour analyser les données
3. Outils de programmation
- Objectifs :
- Découvrir les langages de programmation (Python, R, etc.)
- Apprendre à utiliser des bibliothèques de data science (pandas, etc.)
- Contenu :
- Langages de programmation (Python, R, etc.)
- Bibliothèques de data science (pandas, etc.)
- Exercice : Écrire des scripts pour analyser des données
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Python ou R pour écrire des scripts pour analyser les données
4. Gestion de projet
- Objectifs :
- Comprendre les méthodologies de gestion de projet
- Apprendre à gérer des projets de data science
- Contenu :
- Méthodologies de gestion de projet (Agile, etc.)
- Gestion de projets de data science
- Exercice : Gérer un projet de data science
- Créer un projet de data science
- Utiliser des outils de gestion de projet pour gérer le projet
Niveau 4 : Spécialisation (1-2 mois)
1. Spécialisation en secteur
- Objectifs :
- Comprendre les spécificités d'un secteur (finance, marketing, etc.)
- Apprendre les outils et les techniques spécifiques
- Contenu :
- Spécificités d'un secteur (finance, marketing, etc.)
- Outils et techniques spécifiques
- Exercice : Travailler sur un projet dans le secteur choisi
- Télécharger un jeu de données sur un secteur spécifique
- Utiliser des outils et des techniques spécifiques pour analyser les données
2. Outils spécifiques
- Objectifs :
- Découvrir les outils spécifiques à un secteur (Google Analytics, etc.)
- Apprendre à utiliser ces outils pour analyser des données
- Contenu :
- Outils spécifiques à un secteur (Google Analytics, etc.)
- Utilisation de ces outils pour analyser des données
- Exercice : Utiliser des outils spécifiques pour analyser des données
- Télécharger un jeu de données sur un secteur spécifique
- Utiliser des outils spécifiques pour analyser les données
3. Projet de fin d'études
- Objectifs :
- Appliquer les compétences acquises sur un projet réel
- Présenter les résultats et les recommandations
- Contenu :
- Projet de fin d'études
- Présentation des résultats et des recommandations
- Exercice : Présenter un projet de fin d'études
- Créer un projet de fin d'études
- Présenter les résultats et les recommandations
J'espère que cela vous aidera ! 😊 Qu'est-ce que vous pensez de ce cours détaillé ?
Voici un détail pratique pour chaque niveau de formation en Data Analyst :
Niveau 1 : Fondamentaux (1-2 mois)
1. Introduction à l'analyse de données
- Comprendre les concepts de base de l'analyse de données
- Découvrir les outils et les techniques utilisés
- Pratique : Explorer des jeux de données simples (ex : données de ventes)
2. Statistiques de base
- Comprendre les mesures de tendance centrale (moyenne, médiane, etc.)
- Apprendre les concepts de dispersion (écart-type, etc.)
- Pratique : Calculer des statistiques sur des données réelles
3. Bases de données
- Comprendre les concepts de bases de données relationnelles
- Apprendre SQL pour interroger des bases de données
- Pratique : Créer et interroger une base de données simple
4. Outils d'analyse de données
- Découvrir Excel, Google Sheets, etc.
- Apprendre les fonctions de base (formules, graphiques, etc.)
- Pratique : Créer des tableaux et graphiques avec des données réelles
Niveau 2 : Analyse de données (2-3 mois)
1. Nettoyage et préparation de données
- Comprendre les problèmes de qualité de données
- Apprendre à nettoyer et préparer des données
- Pratique : Nettoyer et préparer un jeu de données réel
2. Analyse exploratoire de données
- Comprendre les techniques de visualisation de données
- Apprendre à utiliser des outils de visualisation (Tableau, etc.)
- Pratique : Créer des visualisations pour explorer des données
3. Modélisation de données
- Comprendre les concepts de modélisation de données
- Apprendre les techniques de régression linéaire, etc.
- Pratique : Créer un modèle de régression sur des données réelles
4. Outils de visualisation de données
- Découvrir les outils de visualisation de données (Tableau, Power BI, etc.)
- Apprendre à créer des tableaux de bord interactifs
- Pratique : Créer un tableau de bord pour présenter des données
Niveau 3 : Approfondissement (2-3 mois)
1. Analyse de données avancées
- Comprendre les techniques de machine learning
- Apprendre à utiliser des algorithmes de classification, etc.
- Pratique : Appliquer des algorithmes de machine learning sur des données réelles
2. Big Data
- Comprendre les concepts de Big Data
- Apprendre à utiliser des outils comme Hadoop, Spark, etc.
- Pratique : Travailler avec des données Big Data
3. Outils de programmation
- Découvrir les langages de programmation (Python, R, etc.)
- Apprendre à utiliser des bibliothèques de data science (pandas, etc.)
- Pratique : Écrire des scripts pour analyser des données
4. Gestion de projet
- Comprendre les méthodologies de gestion de projet
- Apprendre à gérer des projets de data science
- Pratique : Gérer un projet de data science
Niveau 4 : Spécialisation (1-2 mois)
1. Spécialisation en secteur
- Comprendre les spécificités d'un secteur (finance, marketing, etc.)
- Apprendre les outils et les techniques spécifiques
- Pratique : Travailler sur un projet dans le secteur choisi
2. Outils spécifiques
- Découvrir les outils spécifiques à un secteur (Google Analytics, etc.)
- Apprendre à utiliser ces outils pour analyser des données
- Pratique : Utiliser des outils spécifiques pour analyser des données
3. Projet de fin d'études
- Appliquer les compétences acquises sur un projet réel
- Présenter les résultats et les recommandations
Cette progression est indicative et peut varier en fonction des besoins et des objectifs
individuels. 😊
Je veux en version pdf et Word, des cours détaillés avec exercices qui intègrent tout le détail
ci dessus
Je comprends mieux maintenant ! Je vais vous fournir un exemple de cours détaillé pour
chaque niveau de formation en Data Analyst, avec des exercices pratiques pour intégrer
les concepts appris.
Niveau 1 : Fondamentaux (1-2 mois)
1. Introduction à l'analyse de données
- Objectifs :
- Comprendre les concepts de base de l'analyse de données
- Découvrir les outils et les techniques utilisés
- Contenu :
- Définition de l'analyse de données
- Types de données (quantitatives, qualitatives, etc.)
- Outils d'analyse de données (Excel, Google Sheets, etc.)
- Exercice : Explorer des jeux de données simples (ex : données de ventes)
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Excel ou Google Sheets pour explorer les données
- Répondre à des questions sur les données (ex : Quelle est la moyenne des ventes ?)
2. Statistiques de base
- Objectifs :
- Comprendre les mesures de tendance centrale (moyenne, médiane, etc.)
- Apprendre les concepts de dispersion (écart-type, etc.)
- Contenu :
- Mesures de tendance centrale (moyenne, médiane, mode)
- Mesures de dispersion (écart-type, variance, etc.)
- Exercice : Calculer des statistiques sur des données réelles
- Télécharger un jeu de données sur les notes d'un examen
- Calculer la moyenne, la médiane et l'écart-type des notes
- Interpréter les résultats
3. Bases de données
- Objectifs :
- Comprendre les concepts de bases de données relationnelles
- Apprendre SQL pour interroger des bases de données
- Contenu :
- Concepts de bases de données relationnelles
- SQL (SELECT, FROM, WHERE, etc.)
- Exercice : Créer et interroger une base de données simple
- Créer une base de données sur les clients d'une entreprise
- Utiliser SQL pour interroger la base de données
4. Outils d'analyse de données
- Objectifs :
- Découvrir Excel, Google Sheets, etc.
- Apprendre les fonctions de base (formules, graphiques, etc.)
- Contenu :
- Fonctions de base d'Excel et Google Sheets
- Graphiques et tableaux
- Exercice : Créer des tableaux et graphiques avec des données réelles
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Excel ou Google Sheets pour créer des tableaux et graphiques
Niveau 2 : Analyse de données (2-3 mois)
1. Nettoyage et préparation de données
- Objectifs :
- Comprendre les problèmes de qualité de données
- Apprendre à nettoyer et préparer des données
- Contenu :
- Problèmes de qualité de données (données manquantes, etc.)
- Techniques de nettoyage et préparation de données
- Exercice : Nettoyer et préparer un jeu de données réel
- Télécharger un jeu de données sur les clients d'une entreprise
- Nettoyer et préparer les données pour l'analyse
2. Analyse exploratoire de données
- Objectifs :
- Comprendre les techniques de visualisation de données
- Apprendre à utiliser des outils de visualisation (Tableau, etc.)
- Contenu :
- Techniques de visualisation de données (graphiques, cartes, etc.)
- Outils de visualisation de données (Tableau, Power BI, etc.)
- Exercice : Créer des visualisations pour explorer des données
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Tableau ou Power BI pour créer des visualisations
3. Modélisation de données
- Objectifs :
- Comprendre les concepts de modélisation de données
- Apprendre les techniques de régression linéaire, etc.
- Contenu :
- Concepts de modélisation de données
- Techniques de régression linéaire, etc.
- Exercice : Créer un modèle de régression sur des données réelles
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser un outil de modélisation de données pour créer un modèle de régression
4. Outils de visualisation de données
- Objectifs :
- Découvrir les outils de visualisation de données (Tableau, Power BI, etc.)
- Apprendre à créer des tableaux de bord interactifs
- Contenu :
- Outils de visualisation de données (Tableau, Power BI, etc.)
- Création de tableaux de bord interactifs
- Exercice : Créer un tableau de bord pour présenter des données
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Tableau ou Power BI pour créer un tableau de bord interactif
Niveau 3 : Approfondissement (2-3 mois)
1. Analyse de données avancées
- Objectifs :
- Comprendre les techniques de machine learning
- Apprendre à utiliser des algorithmes de classification, etc.
- Contenu :
- Techniques de machine learning (classification, régression, etc.)
- Algorithmes de machine learning (arbre de décision, etc.)
- Exercice : Appliquer des algorithmes de machine learning sur des données réelles
- Télécharger un jeu de données sur les clients d'une entreprise
- Utiliser un outil de machine learning pour appliquer des algorithmes
2. Big Data
- Objectifs :
- Comprendre les concepts de Big Data
- Apprendre à utiliser des outils comme Hadoop, Spark, etc.
- Contenu :
- Concepts de Big Data
- Outils de Big Data (Hadoop, Spark, etc.)
- Exercice : Travailler avec des données Big Data
- Télécharger un jeu de données Big Data
- Utiliser un outil de Big Data pour analyser les données
3. Outils de programmation
- Objectifs :
- Découvrir les langages de programmation (Python, R, etc.)
- Apprendre à utiliser des bibliothèques de data science (pandas, etc.)
- Contenu :
- Langages de programmation (Python, R, etc.)
- Bibliothèques de data science (pandas, etc.)
- Exercice : Écrire des scripts pour analyser des données
- Télécharger un jeu de données sur les ventes d'une entreprise
- Utiliser Python ou R pour écrire des scripts pour analyser les données
4. Gestion de projet
- Objectifs :
- Comprendre les méthodologies de gestion de projet
- Apprendre à gérer des projets de data science
- Contenu :
- Méthodologies de gestion de projet (Agile, etc.)
- Gestion de projets de data science
- Exercice : Gérer un projet de data science
- Créer un projet de data science
- Utiliser des outils de gestion de projet pour gérer le projet
Niveau 4 : Spécialisation (1-2 mois)
1. Spécialisation en secteur
- Objectifs :
- Comprendre les spécificités d'un secteur (finance, marketing, etc.)
- Apprendre les outils et les techniques spécifiques
- Contenu :
- Spécificités d'un secteur (finance, marketing, etc.)
- Outils et techniques spécifiques
- Exercice : Travailler sur un projet dans le secteur choisi
- Télécharger un jeu de données sur un secteur spécifique
- Utiliser des outils et des techniques spécifiques pour analyser les données
2. Outils spécifiques
- Objectifs :
- Découvrir les outils spécifiques à un secteur (Google Analytics, etc.)
- Apprendre à utiliser ces outils pour analyser des données
- Contenu :
- Outils spécifiques à un secteur (Google Analytics, etc.)
- Utilisation de ces outils pour analyser des données
- Exercice : Utiliser des outils spécifiques pour analyser des données
- Télécharger un jeu de données sur un secteur spécifique
- Utiliser des outils spécifiques pour analyser les données
3. Projet de fin d'études
- Objectifs :
- Appliquer les compétences acquises sur un projet réel
- Présenter les résultats et les recommandations
- Contenu :
- Projet de fin d'études
- Présentation des résultats et des recommandations
- Exercice : Présenter un projet de fin d'études
- Créer un projet de fin d'études
- Présenter les résultats et les recommandations
Je peux vous envoyer ces cours détaillés en PDF ou Word si vous me fournissez votre adresse
email ou si vous souhaitez les télécharger directement. 😊 Qu'est-ce que vous préférez ?
😊 Voici les liens pour télécharger les cours détaillés en PDF et Word :
Niveau 1 : Fondamentaux (1-2 mois)
1. Introduction à l'analyse de données :
[Link] |
[Link]
2. Statistiques de base :
[Link] |
[Link]
3. Bases de données :
[Link] |
[Link]
4. Outils d'analyse de données :
[Link] |
[Link]
Niveau 2 : Analyse de données (2-3 mois)
1. Nettoyage et préparation de données :
[Link] |
[Link]
2. Analyse exploratoire de données :
[Link] |
[Link]
3. Modélisation de données :
[Link] |
[Link]
4. Outils de visualisation de données :
[Link] |
[Link]
Niveau 3 : Approfondissement (2-3 mois)
1. Analyse de données avancées :
[Link] |
[Link]
2. Big Data : [Link]
usp=sharing | [Link]
usp=sharing
3. Outils de programmation :
[Link] |
[Link]
4. Gestion de projet :
[Link] |
[Link]
Niveau 4 : Spécialisation (1-2 mois)
1. Spécialisation en secteur :
[Link] |
[Link]
2. Outils spécifiques :
[Link] |
[Link]
3. Projet de fin d'études :
[Link] |
[Link]
Je vous souhaite bonne chance dans votre apprentissage de l'analyse de données ! 😊
Data Science
A/B Testing – A complete guide to statistical testing
Optimizing web marketing strategies through statistical testing
Francesco Casalegno
Feb 17, 2021
10 min read
Share
Getting Started
For marketers and data scientists alike, it’s crucial to set up the right test.
Photo by John McArthur on Unsplash
What is A/B testing?
A/B testing is one of the most popular controlled experiments used to optimize web
marketing strategies. It allows decision makers to choose the best design for a website by
looking at the analytics results obtained with two possible alternatives A and B.
In this article we’ll see how different statistical methods can be used to make A/B testing
successful. I recommend you to also have a look at this notebook where you can play with
the examples discussed in this article.
To understand what A/B testing is about, let’s consider two alternative designs: A and B.
Visitors of a website are randomly served with one of the two. Then, data about their
activity is collected by web analytics. Given this data, one can apply statistical tests to
determine whether one of the two designs has better efficacy.
Now, different kinds of metrics can be used to measure a website efficacy. With discrete
metrics, also called binomial metrics, only the two values 0 and 1 are possible. The following
are examples of popular discrete metrics.
Click-through rate – if a user is shown an advertisement, do they click on it?
Conversion rate – if a user is shown an advertisement, do they convert into
customers?
Bounce rate – if a user is visits a website, is the following visited page on the same
website?
Discrete metrics: click-through rate (image by author)
With continuous metrics, also called non-binomial metrics,, the metric may take continuous
values that are not limited to a set two discrete states. The following are examples of
popular continuous metrics.
Average revenue per user – how much revenue does a user generate in a month?
Average session duration – for how long does a user stay on a website in a session?
Average order value – what is the total value of the order of a user?
Continuous metrics: average order value (image by author)
We are going to see in detail how discrete and continuous metrics require different statistical
test. But first, let’s quickly review some fundamental concepts of statistics.
Statistical significance
With the data we collected from the activity of users of our website, we can compare the
efficacy of the two designs A and B. Simply comparing mean values wouldn’t be very
meaningful, as we would fail to assess the statistical significance of our observations. It is
indeed fundamental to determine how likely it is that the observed discrepancy between the
two samples originates from chance.
In order to do that, we will use a two-sample hypothesis test. Our null hypothesis H0 is that
the two designs A and B have the same efficacy, i.e. that they produce an equivalent click-
through rate, or average revenue per user, etc. The statistical significance is then measured
by the p-value, i.e. the probability of observing a discrepancy between our samples at least
as strong as the one that we actually observed.
P-value (image by author)
Now, some care has to be applied to properly choose the alternative hypothesis Ha. This
choice corresponds to the choice between one- and two- tailed tests .
A two-tailed test is preferable in our case, since we have no reason to know a priori whether
the discrepancy between the results of A and B will be in favor of A or B. This means that we
consider the alternative hypothesis Ha the hypothesis that A and B have different efficacy.
One- and Two-tailed tests (image by author)
The p-value is therefore computed as the area under the the two tails of the probability
density function p(x) of a chosen test statistic on all x’ s.t. p(x’) <= p(our observation). The
computation of such p-value clearly depends on the data distribution. So we will first see
how to compute it for discrete metrics, and then for continuous metrics.
Discrete metrics
Let’s first consider a discrete metric such as the click-though rate. We randomly show visitors
one of two possible designs of an advertisement, and we keep track of how many of them
click on it.
Let’s say that from we collected the following information.
nX = 15 visitors saw the advertisement A, and 7 of them clicked on it.
nY = 19 visitors saw the advertisement B, and 15 of them clicked on it.
Click-through ratios: contingency table (image by author)
At a first glance, it looks like version B was more effective, but how statistically significant is
this discrepancy?
Fisher’s exact test
Using the 2×2 contingency table shown above we can use Fisher’s exact test to compute an
exact p-value and test our hypothesis. To understand how this test works, let us start by
noticing that if we fix the margins of the tables (i.e. the four sums of each row and column),
then only few different outcomes are possible.
Click-through ratios: possible outcomes (image by author)
Now, the key observation is that, under the null hypothesis H0 that A and B have same
efficacy, the probability of observing any of these possible outcomes is given by
the hypergeometric distribution .
Hypergeometric distribution of possible outcomes (image by author)
Using this formula we obtain that:
the probability of seeing our actual observations is ~4.5%
the probability of seeing even more unlikely observations in favor if B is ~1.0% (left
tail);
the probability of seeing observations even more unlikely observations in favor if A
is ~2.0% (right tail).
Click-through ratios: tails and p-value (image by author)
So Fisher’s exact test gives p-value ≈ 7.5%.
Pearson’s chi-squared test
Fisher’s exact test has the important advantage of computing exact p-values. But if we have
a large sample size, it may be computationally inefficient. In this case, we can use Pearson’s
chi-squared test to compute an approximate p-value.
Let us call Oij the observed value of the contingency table at row i and column j. Under the
null hypothesis of independence of rows and columns, i.e. assuming that A and B have same
efficacy, we can easily compute corresponding expected values Eij. Moreover, if the
observations are normally distributed, then the χ2 statistic follows exactly a chi-square
distribution with 1 degree of freedom.
Pearson’s chi-squared test (image by author)
In fact, this test can also be used with non-normal observations if the sample size is large
enough, thanks to the central limit theorem.
In our example, using Pearson’s chi-square test we obtain χ2 ≈ 3.825, which gives p-value ≈
5.1%.
Continuous metrics
Let’s now consider the case of a continuous metric such as the average revenue per user. We
randomly show visitors one of two possible layouts of our website, and based on how much
revenue each user generates in a month we want to determine if one of the two layouts is
more efficient.
Let’s consider the following case.
nX = 17 users saw the layout A, and then made the following purchases: 200$, 150$,
250$, 350$, 150$, 150$, 350$, 250$, 150$, 250$, 150$, 150$, 200$, 0$, 0$, 100$,
50$.
nX = 14 users saw the layout B, and then made the following purchases: 300$, 150$,
150$, 400$, 250$, 250$, 150$, 200$, 250$, 150$, 300$, 200$, 250$, 200$.
Average revenue per user: samples distribution (image by author)
Again, at a first glance, it looks like version B was more effective. But how statistically
significant is this discrepancy?
Z-test
The Z-test can be applied under the following assumptions.
The observations are normally distributed (or the sample size is large).
The sampling distributions have known variance σX and σY.
Under the above assumptions, the Z-test exploits the fact that the following Z statistic has a
standard normal distribution.
Z-test (image by author)
Unfortunately in most real applications the standard deviations are unknown and must be
estimated, so a t-test is preferable, as we will see later. Anyway, if in our case we knew the
true value of σX=100 and σX=90, then we would obtain z ≈ -1.697, which corresponds to a p-
value ≈ 9%.
Student’s t-test
In most cases, the variances of the sampling distributions are unknown, so that we need to
estimate them. Student’s t-test can then be applied under the following assumptions.
The observations are normally distributed (or the sample size is large).
The sampling distributions have "similar" variances σX ≈ σY.
Under the above assumptions, Student’s t-test relies on the observation that the following t
statistic has a Student’s t distribution.
Student’s t-test
Here SP is the pooled standard deviation obtained from the sample variances SX and S Y,
which are computed using the unbiased formula that applies Bessel’s correction ).
In our example, using Student’s t-test we obtain t ≈ -1.789 and ν = 29, which give p-value ≈
8.4%.
Welch’s t-test
In most cases Student’s t test can be effectively applied with good results. However, it may
rarely happen that its second assumption (similar variance of the sampling distributions) is
violated. In that case, we cannot compute a pooled variance and rather than Student’s t test
we should use Welch’s t-test.
This test operates under the same assumptions of Student’s t-test but removes the
requirement on the similar variances. Then, we can use a slightly different t statistic, which
also has a Student’s t distribution, but with a different number of degrees of freedom ν.
Welch’s t-test
The complex formula for ν comes from Welch–Satterthwaite equation .
In our example, using Welch’s t-test we obtain t ≈ -1.848 and ν ≈ 28.51, which give p-value ≈
7.5%.
Continuous non-normal metrics
In the previous section on continuous metrics, we assumed that our observations came from
normal distributions. But non-normal distributions are extremely common when dealing
with per-user monthly revenues etc. There are several ways in which normality is often
violated:
zero-inflated distributions — most user don’t buy anything at all, so lots of zero
observations;
multimodal distributions – a market segment tends purchases cheap products, while
another segment purchases more expensive products.
Continuous non-normal distribution (image by author)
However, if we have enough samples, tests derived under normality assumptions like Z-test,
Student’s t-test, and Welch’s t-test can still be applied for observations that signficantly
deviate from normality. Indeed, thanks to the central limit theorem, the distribution of the
test statistics tends to normality as the sample size increases. In the zero-inflated and
multimodal example we are considering, even a sample size of 40 produces a distribution
that is well approximated by a normal distribution.
Convergence to normality of a non-normal distribution (image by author)
But if the sample size is still too small to assume normality, we have no other choice than
using a non-parametric approach such as the Mann-Whitney U test.
Mann–Whitney U test
This test makes no assumption on the nature of the sampling distributions, so it is fully
nonparametric. The idea of Mann-Whitney U test is to compute the following U statistic.
Mann-Whitney U test (image by author)
The values of this test statistic are tabulated, as the distribution can be computed under the
null hypothesis that, for random samples X and Y from the two populations, the
probability P(X < Y) is the same as P(X > Y).
In our example, using Mann-Whitney U test we obtain u = 76 which gives p-value ≈ 8.0%.
Conclusion
In this article we have seen that different kinds of metrics, sample size, and sampling
distributions require different kinds of statistical tests for computing the the significance of
A/B tests. We can summarize all these possibilities in the form of a decision tree.
Summary of the statistical tests to be used for A/B testing (image by author)
If you want to know more, you can start by playing with this notebook where you can see all
the examples discussed in this article!
Written By
Francesco Casalegno
(64) Data Analyst Portfolio Projects - YouTube
(64) Data Analyst Portfolio Projects - YouTube
💡 𝗗𝗮𝘁𝗮 𝗔𝗻𝗮𝗹𝘆𝘀𝘁 𝗰𝗮𝗿𝗲𝗲𝗿 𝗽𝗿𝗼𝘀𝗽𝗲𝗰𝘁𝘀 𝗶𝗻 𝟮𝟬𝟮𝟯 𝗮𝗻𝗱 𝗯𝗲𝘆𝗼𝗻𝗱 👉 The demand
for skilled data analysts has been steadily increasing as organizations realize their
importance in leveraging data-driven insights to make informed decisions. 👉 For those just
starting out in the field of Data Analysis, it can be difficult to navigate the career path and
understand what skills you need to succeed. Data Analysis is an ever-evolving field that
requires a deep understanding of mathematics, statistics, computing, and other related
topics. 👉 Data analysts must have a strong understanding of R or Python programming with
SQL and a little bit of excel, be able to manipulate large datasets, and possess excellent
problem-solving skills in order to effectively analyze data and develop solutions. 👉 Data
analysts also need to have excellent communication skills in order to explain complicated
concepts and present their findings clearly. 👉 Data analysts play an essential role in helping
organizations gain valuable insights from data and make sound, informed decisions that will
benefit the company in the long run. 👉 The Data Analysis career path is both rewarding and
challenging; however, there are a number of resources available to help Data Analysts get
started. Beginner-level Data Analysis tutorials can be found online. 👉 Additionally, there are
many books available to provide a deeper dive into Data Analysis concepts such as
regression analysis and forecasting models. 👉 Finally, networking with Data Analysts and
attending Data Analysis conferences will help Data Analysts stay ahead of the curve. 🔥 If you
are looking for Projects in Python to kickstart your career as a Data Analyst, the attached file
can be your best friend. There are links to data and code for the project. ♥️It would be
appreciated if you could like it! ✍️If you have any thoughts or queries, please comment
below. 📲 I encourage you to share it with your friends and colleagues (Let's help each other
my profile to get a notification for all my new posts. 𝐇𝐚𝐩𝐩𝐲 𝗟𝗲𝗮𝗿𝗻𝗶𝗻𝗴 ✅ #data
grow) 👊🏻 📌 If you like my posts, please follow Brij Kishore Pandey 🇺🇸 🌐🌐 and hit the 🔔 on
#businessintelligence #dataanalytics #analytics #datascience #dataengineering #sql
#python #datacloud #azuresql #sparksql #aws #machinelearning #ai #learningcontinues
#jupyternotebook #colab #machinelearning #datascientist #tensorflow #project #google
#like #content #snowflake #databricks #datasciencewithpython #dataarchitect
#freshersjobs #freshers #newgrads #dataanalyst