Introduction générale (2h)
L’analyse de données et le reporting constituent un pilier essentiel du pilotage d’entreprise. Ils
permettent de transformer l’information brute en connaissance exploitable dans la prise
de décision stratégique et opérationnelle.
Dans un contexte marqué par la digitalisation, le Big Data et l’automatisation, la maîtrise de
ces compétences devient indispensable pour les managers et ingénieurs.
Objectifs du cours :
Comprendre les principes fondamentaux de l’analyse de données
Savoir collecter, préparer, transformer et visualiser des données
Apprendre à produire un reporting clair, fiable et décisionnel
Savoir utiliser des outils modernes : Excel avancé, Power BI, Google Data Studio,
Python (bases), SQL (bases)
Développer un esprit critique vis-à-vis des données : cohérence, qualité, biais,
interprétation
📌 PARTIE 1 – La donnée dans l’entreprise
(4h)
1.1. Nature et typologie des données
Données quantitatives (discrètes / continues)
Données qualitatives (nominales / ordinales)
Données structurées, semi-structurées, non structurées
Sources internes : ERP, CRM, comptabilité, RH…
Sources externes : INSTAT, Banque mondiale, API web, open data…
1.2. Cycle de vie de la donnée
1. Collecte
2. Stockage (bases de données, data lake, cloud)
3. Nettoyage et préparation
4. Analyse et interprétation
5. Visualisation et reporting
6. Diffusion et gouvernance
o Collecte des données
La collecte est la première phase du cycle de vie de la donnée. Elle consiste à réunir
l’information brute provenant de différentes sources pour répondre à un besoin
d’analyse.
1.1. Types de sources
Sources internes :
o ERP (SAP, Odoo), CRM (Salesforce)
o Comptabilité, facturation
o RH (paie, effectif)
o Production (machines, capteurs IoT)
o Marketing (Google Analytics, campagnes Facebook)
Sources externes :
o Open data (INSTAT, Banque Mondiale, Eurostat)
o Réseaux sociaux
o API publiques ou privées
o Données achetées (Data providers)
1.2. Méthodes de collecte
Formulaires (ex : enquête clients)
Imports de fichiers (CSV, Excel, JSON)
Collecte automatique via API
Scraping web (à utiliser dans le respect légal)
Flux de streaming (capteurs, logs serveurs)
1.3. Problèmes courants
Données incomplètes
Données non fiables (erreurs humaines)
Données non uniformisées
Volume trop important pour Excel (Big Data)
o Stockage des données
Après la collecte, les données doivent être stockées dans un environnement sécurisé et
accessible pour l’analyse.
2.1. Bases de données (SGBD)
SQL (MySQL, PostgreSQL, SQL Server) : données structurées, tables,
relations.
NoSQL (MongoDB, Cassandra) : données non structurées ou volumineuses.
Concepts clés :
Table, enregistrement (row), colonne (field)
Indexation
Clé primaire, clé étrangère
Requêtes (SELECT, JOIN…)
2.2. Data Lakes
Stockage massif de données brutes, sans structure définie. Utilisés pour le Big Data.
Ex : Hadoop, Amazon S3, Azure Data Lake.
2.3. Stockage Cloud
Avantages :
Scalabilité
Sécurité
Accessible de partout
Automatisation des sauvegardes
Ex : Google Cloud, AWS, Microsoft Azure.
2.4. Problèmes courants
Mauvaise architecture → lenteur
Duplication des données (data silos)
Mauvaise sécurité
o Nettoyage et préparation des données
C’est l’étape la plus chronophage (70–80 % du travail d’analyse). Elle vise à
transformer la donnée brute en donnée exploitable.
3.1. Nettoyage
Traitement des valeurs manquantes (remplissage, suppression)
Suppression des doublons
Correction des erreurs de saisie
Uniformisation des formats :
o Dates (JJ/MM/AAAA vs MM/DD/YYYY)
o Montants (Ar, €, $)
o Textes (majus/minus, accents)
3.2. Préparation
Création de nouvelles variables (ex : marge = CA – coût)
Agrégation : somme, moyenne, par mois / par région
Normalisation / standardisation
Jointure de sources multiples (SQL JOIN, Excel XLOOKUP)
3.3. Outils utilisés
Excel / Power Query
Power BI – Query Editor
Python (pandas)
SQL
Talend, Dataiku pour les entreprises
o Analyse et interprétation
C’est la phase où l’on comprend réellement la donnée et où l’on génère des insights
pour l’entreprise.
Insights c’est quoi ? : ce sont des découvertes éclairantes et exploitables tirées de
l'analyse de données, qui permettent de comprendre en profondeur un phénomène, un
marché ou un comportement.
4.1. Analyse descriptive
Moyenne, médiane, mode
Variance, écart-type
Histogramme (distribution)
Analyse des tendances (séries temporelles)
4.2. Analyse bivariée
Corrélations
Coefficients de dépendance
Régressions simples
4.3. Analyse multivariée
Régression multiple
ACP (Analyse en Composantes Principales)
Clustering (segmentation, k-means)
4.4. Interprétation
Vérifier la logique métier
Vérifier les biais possibles
Confronter les résultats à la réalité du terrain
Produire des recommandations concrètes
Exemple :
Une baisse de ventes peut être due à :
un prix trop élevé,
une concurrence plus forte,
un problème logistique,
un changement de comportement client.
o Visualisation et reporting
Après l’analyse, il faut communiquer efficacement les résultats à des décideurs.
5.1. Principes de visualisation
Simplicité
Lisibilité
Mise en avant des éléments clés
Choix du bon graphique (barre, ligne, scatter, pie…)
5.2. Outils
Excel (TCD + graphiques)
Power BI (dashboard dynamique)
Google Data Studio
Tableau Software
Python (matplotlib, seaborn)
5.3. Types de reporting
Tableau de bord stratégique
Indicateurs KPI
Reporting opérationnel (quotidien)
Reporting financier (mensuel)
5.4. Storytelling
Un bon reporting doit :
raconter une histoire,
aller du général au particulier,
conclure par une recommandation actionnable.
o Diffusion et gouvernance des données
Cette étape concerne la gestion, la sécurité, la qualité, et la distribution de la
donnée dans l’organisation.
6.1. Diffusion
Partage via PDF, dashboards web, emails automatisés
Mises à jour automatiques (Power BI Service)
Accès selon rôles (manager, analyste, direction)
6.2. Gouvernance
C’est l’ensemble des politiques qui garantissent que la donnée est :
fiable
sécurisée
accessible aux bonnes personnes
conforme (RGPD, politique interne)
6.3. Rôles dans la gouvernance
Data Owner : responsable métier
Data Steward : qualité et documentation
Data Analyst : analyse et reporting
Data Engineer : pipelines, automatisation
DSI : sécurité, infrastructure
6.4. Politique de données
Catalogage des données
Mise en place de dictionnaire de données
Contrôle des accès
Traçabilité (logs)
Audit et conformité périodique
1.3. Qualité de la donnée
Cohérence
Exhaustivité
Exactitude
Fiabilité
Problèmes courants : doublons, valeurs manquantes, outliers, erreurs de saisie.
📌 PARTIE 2 – Préparation et Nettoyage des
Données (6h)
2.1. Importance du data cleaning
80% du temps d’un analyste est consacré au nettoyage. La qualité de l’analyse dépend de la
qualité des données.
2.2. Techniques principales
Supprimer / corriger valeurs manquantes
Détection des outliers : boxplot, Z-score
Harmonisation des formats : dates, devises, unités
Normalisation / standardisation
Agrégation et regroupement
Jointure de tables (JOIN en SQL, VLOOKUP/XLOOKUP en Excel…)
2.3. Outils de préparation
Excel (Power Query)
Power BI – Query Editor
Python (pandas)
SQL (SELECT, WHERE, GROUP BY…)
📌 PARTIE 3 – Analyse de Données (8h)
(Statistiques appliquées au management)
3.1. Statistiques descriptives
Moyenne, médiane, mode
Variance et écart-type
Quartiles, percentiles
Distribution des données
Indicateurs de dispersion
Applications : analyse des ventes, satisfaction client, coûts, performances RH.
3.2. Analyse bivariée
Covariance
Corrélation (Pearson, Spearman)
Matrice de corrélation
Analyse croisée (tables pivot dynamiques)
Applications :
corrélation entre prix et ventes,
impact d’une formation sur la performance,
relation âge / salaire.
3.3. Initiation aux analyses multivariées
Régression linéaire simple et multiple
ACP (Analyse en Composantes Principales) – notion générale
Clustering (K-means) – concept
Détection de patterns
📌 PARTIE 4 – Visualisation des données
(5h)
4.1. Principes de data visualisation
Choisir le bon graphique pour le bon type de donnée
Règles de lisibilité : contraste, couleur, hiérarchie
Visualisation délibérément trompeuse (à éviter)
Storytelling visuel
4.2. Types de graphiques
Bar chart, line chart, scatter plot
Histogramme, boxplot
Heatmap
KPI cards, jauges
Sankey diagram (flux)
4.3. Outils disponibles
Excel : graphiques, tableaux croisés, segmentations
Power BI : visualisation dynamique
Google Data Studio
Python : matplotlib / pandas (pour les bases)
📌 PARTIE 5 – Reporting (5h)
5.1. Qu’est-ce qu’un reporting ?
Document (tableau de bord, dashboard, PDF, rapport) permettant de communiquer des
résultats à une direction.
5.2. Types de reporting
Reporting stratégique
Reporting opérationnel
Reporting financier
Reporting RH
KPI (indicateurs clés)
o Finances : marge, CA, EBITDA
o Marketing : CAC, LTV, taux de conversion
o RH : turnover, absentéisme
o Production : TRS, rendement
5.3. Conception d’un dashboard
1. Définir les objectifs
2. Identifier les KPI réellement utiles
3. Choisir les visualisations pertinentes
4. Organiser l’information
5. Automatiser la mise à jour
6. Tester auprès des utilisateurs
5.4. Règles d’or
Simplicité
Cohérence visuelle
Rapidité de compréhension
Automatisation
Mise à jour fiable