Data Analytics
Data Analytics
Data Analytics 1
✔ La POSITION est la propriété visuelle la plus précise pour
représenter des valeurs numériques.
👉 Pourquoi ?
Parce que l’œil humain compare plus facilement des positions sur un axe que
des couleurs ou des surfaces.
Data Analytics 2
Comparer des valeurs discrètes
✔ Type de données
Variable catégorique + variable numérique
🔎 Différence
Adapté aux comparaisons entre catégories
Pas idéal pour montrer une évolution continue
✔ Type de données
Variable temporelle ou continue
Data Analytics 3
Analyser la corrélation
✔ Type de données
Deux variables numériques
🔎 Différence
Scatter → relation
Line → évolution
Bar → comparaison
📦 4️⃣ Histogramme
✔ Utilisation
Montrer la distribution d’une variable numérique
✔ Montre
Dispersion
Symétrie
Concentration
Outliers potentiels
🔎 Différence
Histogramme → distribution
Bar chart → catégories
📊 5️⃣ Boxplot
✔ Utilisation
Résumé statistique
Data Analytics 4
Identifier médiane et outliers
✔ Montre
Q1, Médiane, Q3
Valeurs aberrantes
🔎 Différence
Histogramme → forme complète
Boxplot → résumé statistique
🌡 6️⃣ Heatmap
✔ Utilisation
Matrice de valeurs numériques
Détecter patterns globaux
✔ Propriété principale
Couleur
🔎 Différence
Heatmap → grande quantité de données
Scatter → relation précise
✔ Différence
Encode position spatiale réelle
Peut combiner couleur ou taille
Data Analytics 5
🌳 8️⃣ Treemap
✔ Utilisation
Données hiérarchiques
Part-to-whole
✔ Encode
Surface
🔎 Différence
Treemap → hiérarchie
Bar chart → comparaison simple
🔎 Différence
Line → tendance
Area → volume cumulé
Data Analytics 6
Graphique Sert à Type de données
Carte Géographique Spatial
✅ Caractéristiques
Pas de filtres
Pas de zoom
Pas de sélection
Pas d’animation
Image immuable (PDF, image, papier)
✅ Exemple
Un graphique imprimé dans un rapport
Une image insérée dans un PowerPoint
Data Analytics 7
Un graphique interactif permet à l’utilisateur de modifier, explorer ou
manipuler les données en temps réel.
✅ Caractéristiques
Filtres dynamiques
Zoom
Sélection de catégories
Highlight
Tooltips (infobulles)
Animation (motion chart)
✅ Exemple
Dashboard Tableau
Visualisation web interactive
🎯 Différence principale
Graphique Statique Graphique Interactif
Fixe Dynamique
Pas de modification Manipulation possible
Vue unique Exploration multiple
Passif Actif
📌 Exemples d’utilisation
Matrice de corrélation
Data Analytics 9
Similarité entre objets
Données de performance
Clustering
Analyse de grands volumes
⚠ Important
Heatmap ≠ Carte géographique (même si parfois le terme est confondu).
Heatmap = matrice numérique
Carte = données spatiales
Data Analytics 10
On veut observer des variations dans le temps
Exemple :
Évolution des ventes par mois
Température quotidienne
Croissance annuelle
👉 Le line chart montre la continuité entre les points.
🔹 Bar Chart (Diagramme en barres)
On l’utilise quand :
On compare des catégories distinctes
Les données ne sont pas continues
On veut faire un classement
Exemple :
Ventes par catégorie
Population par pays
Nombre d’employés par département
👉 Le bar chart montre une comparaison entre groupes séparés.
🎯 Différence principale
Line Chart Bar Chart
Données continues Données catégorielles
Montre une tendance Compare des groupes
Axe temporel fréquent Axe catégorique
Data Analytics 11
adapté à la comparaison entre catégories distinctes.
3️⃣ Daltonisme
Certaines personnes ne distinguent pas bien :
Rouge / vert
Bleu / violet
Data Analytics 12
Donc certaines palettes deviennent illisibles.
🧠 Règles à retenir
Données quantitatives → palette séquentielle
Données divergentes → palette centrée sur zéro
Données catégoriques → palette discrète
Éviter rouge/vert seul
1️⃣
Data Analytics 13
1️⃣ Adapter l’encodage au type de données
🔢 Données numériques
Position (meilleur)
Longueur
📊 Données ordinales
Position
Longueur
🏷 Données catégoriques
Couleur (discrète)
Forme
🔹 Pourquoi ?
Chaque point = une observation
Position X = variable 1
Position Y = variable 2
Permet de visualiser :
Corrélation positive
Data Analytics 15
Corrélation négative
Absence de corrélation
Forme non linéaire
🔹 On peut ajouter :
Une ligne de tendance
Le coefficient R²
✔ C’est la réponse correcte dans ton QCM
data viz 2024 t
Data Analytics 17
🎯 Quelle propriété utiliser selon le type
de données ?
🔢 1️⃣ Pour des valeurs numériques
✔ Position (la plus précise)
✔ Longueur
👉 Réponse correcte dans ton examen :
La propriété la plus adaptée pour représenter des valeurs numériques est la
position
data viz 2024 t
Data Analytics 18
✍️ Formulation parfaite pour l’examen
La propriété visuelle la plus adaptée pour représenter des valeurs
numériques est la position, car elle offre la meilleure précision perceptuelle
pour comparer des quantités.
⚠ Important
Le changement dans le temps peut :
Data Analytics 19
Améliorer la compréhension si bien conçu
Créer de la confusion si mal contrôlé
🔹 Données catégoriques
→ Palette discrète
Data Analytics 20
✍️ Formulation parfaite pour l’examen
Sur une carte mondiale des ventes utilisant une palette séquentielle, les
niveaux élevés sont généralement représentés par une couleur chaude et
intense comme le rouge vif, indiquant une forte valeur.
⚠ Attention
La couleur dépend toujours :
De la palette choisie
Du contexte
De la légende
📊 Exemple
Motion chart
Data Analytics 21
Animation temporelle d’un dashboard
Évolution d’un scatter plot au fil des années
⚠ Important
Avantage :
Meilleure compréhension des changements
Risque :
Peut désorganiser la perception si trop rapide
📌 Exemple
Marque de voiture (Toyota, BMW, Renault)
Pays
Data Analytics 22
Numéro de série d’un livre
Genre (Homme/Femme)
📌 Visualisations adaptées
Bar chart
Pie chart
Treemap
📌 Exemple
Taille T-shirt (S, M, L, XL)
Niveau de satisfaction (Faible, Moyen, Élevé)
Classement (1er, 2e, 3e)
📌 Visualisations adaptées
Bar chart ordonné
Line chart (si progression)
📌 Deux sous-types :
🔹
Data Analytics 23
🔹 a) Discret
Valeurs comptables
Ex : Nombre d’enfants, Nombre de ventes
🔹 b) Continu
Valeurs mesurées
Ex : Taux de décès, Température, Montant d’achat
📌 Visualisations adaptées
Histogramme
Boxplot
Scatter plot
Line chart
Data Analytics 24
Une palette de couleurs est un ensemble organisé de couleurs utilisé pour
représenter des données dans une visualisation.
Le choix dépend du type de données.
📌 Structure
Couleur claire → Couleur foncée
📌 Exemple
Ventes
Population
Température
📌 Exemple visuel
Bleu clair → Bleu foncé
Jaune → Rouge
📌 Structure
Couleur A → Neutre → Couleur B
📌
Data Analytics 25
📌 Exemple
Bénéfices (+) / Pertes (−)
Variation autour de 0
Taux de croissance
📌 Exemple visuel
Rouge → Blanc → Bleu
✔ C’est la bonne réponse dans ton QCM
data viz 2024 t
📌 Exemple
Pays
Marque
Département
⚠ Pas adaptée aux données numériques continues.
🎯 Règle d’or à écrire à l’examen
Le choix de la palette de couleurs dépend du type de données : séquentielle
pour les données quantitatives, divergente pour les données centrées autour
d’un point neutre, et catégorique pour les données qualitatives.
⚠
❌
Erreurs fréquentes
Utiliser palette catégorique pour données numériques
Data Analytics 26
❌ Utiliser rouge/vert (daltonisme)
❌ Utiliser trop de couleurs
❌ Saturation excessive
🧠 Résumé rapide
Type de données Palette adaptée
Numérique Séquentielle
Positif / négatif Divergente
Catégorique Discrète
📌 Structure
Une seule teinte avec variation d’intensité :
Clair → Foncé
Faible → Élevé
📌 Exemple
Ventes
Population
Température
Revenus
📌 Objectif
Montrer une progression ou une intensité croissante
Data Analytics 27
🏷 2️⃣ Palettes Catégoriques (Discrètes)
📌 Utilisation
Pour des données qualitatives / nominales
📌 Structure
Couleurs distinctes sans ordre
📌 Exemple
Pays
Marque
Département
Catégorie produit
⚠ Chaque couleur représente une catégorie différente, pas une intensité.
🔢 3️⃣ Palettes Multi-classes
📌 Utilisation
Quand on a plusieurs classes ordonnées, souvent en classification.
📌 Exemple
Niveau de risque (faible, moyen, élevé)
Classes socio-économiques
Tranches de performance
Elles peuvent ressembler à des palettes séquentielles mais sont divisées en
classes distinctes.
Data Analytics 28
(= Palettes Divergentes)
📌 Utilisation
Pour des données avec :
Valeurs positives et négatives
Un point central important (0, moyenne…)
📌 Structure
Couleur A → Couleur neutre → Couleur B
Exemple :
Rouge → Blanc → Bleu
📌 Exemple
Profit / perte
Variation autour de zéro
Croissance positive / négative
✔ C’est la bonne réponse dans ton QCM pour données divergentes
data viz 2024 t
Data Analytics 29
classes pour des classes ordonnées, et divergente (centrée sur un point
neutre) pour des données comportant des valeurs positives et négatives.
Data Analytics 30
🎨 Marques & Canaux (base du codage
visuel)
🔹 Marques
Points
Lignes
Aires
Rectangles
🔹 Canaux visuels
Position
Longueur
Taille
Aire
Couleur
Saturation
Forme
📊
✔
Exemple
Correct :
Un bar chart montrant les ventes par catégorie avec axe proportionnel.
❌ Violation d’expressivité :
Un axe tronqué qui exagère les différences.
⚠ À ne pas confondre
Expressivité → fidélité de l’information
Effectivité → efficacité perceptuelle du canal visuel
✅ Réponse correcte :
✔ Diagramme à barres groupées (Grouped Bar Chart)
📌 Pourquoi ?
On veut :
Comparer plusieurs produits
À l’intérieur de plusieurs catégories
Observer les différences côte à côte
Le diagramme à barres groupées permet :
Une comparaison claire entre produits
Une lecture simple par catégorie
Une analyse visuelle précise grâce à la longueur (canal précis)
🎯
❌
Pourquoi pas les autres ?
Diagramme en aires empilées
Data Analytics 33
→ Bon pour évolution temporelle, pas pour comparaison précise.
Data Analytics 34
Permet de voir :
Corrélation positive
Corrélation négative
Absence de corrélation
Relation linéaire ou non linéaire
📈 On peut ajouter :
Une ligne de tendance
Le coefficient R²
Une troisième variable (taille ou couleur)
Data Analytics 35
Commentez.
✅ Réponse :
✔ Le Line Chart (Graphique en courbe)
📌 Explication
Le line chart est le plus adapté pour représenter une évolution dans le temps
car :
Il montre la continuité des données
Il permet d’identifier facilement :
Les tendances (croissance / baisse)
Les pics
Les fluctuations
Il facilite la comparaison de plusieurs séries temporelles
✔ Utilisé quand :
On veut analyser la répartition des valeurs d’une variable continue.
Data Analytics 37
✔ Utilisé quand :
On veut un résumé statistique clair et comparer plusieurs groupes.
🧠 Résumé rapide
Graphique Sert à
Histogramme Voir la forme complète
Boxplot Voir résumé statistique
Density plot Distribution lissée
Data Analytics 38
Comparer des catégories distinctes
Faire un classement
Montrer des différences entre groupes
Comparer des valeurs discrètes
📊 Situations typiques
1️⃣ Comparer des catégories
Exemple :
Ventes par catégorie
Population par pays
Nombre d’étudiants par filière
❓ Problème
1000 objets
20 caractéristiques (donc multidimensionnel)
Objectif : analyser les similarités
✅
✔
Réponse recommandée
Heatmap avec clustering (matrice de similarité)
ou
✔ Projection dimensionnelle (ex : PCA) + Scatter plot
📊 Option 1 : Heatmap avec clustering
Pourquoi ?
Les données peuvent être transformées en matrice de similarité
1000 objets → Scatter plot simple devient illisible
La heatmap permet :
Visualiser des patterns globaux
Identifier des groupes similaires
Data Analytics 40
Voir des blocs (clusters)
Avantage :
Bonne scalabilité
Data Analytics 41
Multidimensionnalité
Justification du choix
Compréhension des limites perceptuelles
Data Analytics 42
On veut analyser une répartition part-to-whole
On veut voir quelles sous-catégories dominent
On a beaucoup de catégories
Exemple :
Ventes par catégorie → sous-catégorie
Budget par département → service
Structure d’un portefeuille d’investissement
⚠ Limites
Comparaison précise difficile (aire moins précise que longueur)
Peut devenir confus si trop de petites catégories
🔹 Marques utilisées
Points
Chaque point représente un pays.
🔹 Canaux visuels
Position X → Fertility
Position Y → Life expectancy
Taille → Population (si variable proportionnelle visible)
Couleur → Région / groupe
🔹 Avantages
Excellent pour montrer corrélation
Permet visualisation multidimensionnelle
Permet ajout de ligne de tendance
🔹 Inconvénients
Peut devenir surchargé avec beaucoup de points
Interprétation difficile si chevauchement important
🔹 Marques utilisées
Polygones (territoires)
Lignes (flux)
🔹 Canaux visuels
Position spatiale réelle → localisation géographique
Épaisseur des lignes → volume
Couleur → intensité ou catégorie
🔹 Avantages
Intuitif pour données géographiques
Montre relations spatiales
🔹 Inconvénients
Peut devenir illisible si trop de flux
Superposition excessive possible
🔹 Marques utilisées
Data Analytics 45
Lignes
🔹 Canaux visuels
Position X → Temps
Position Y → Valeur
Encodage identique dans chaque sous-graphe
🔹 Avantages
Comparaison claire entre groupes
Évite surcharge d’un seul graphique
Bonne lisibilité
🔹 Inconvénients
Prend plus d’espace
Comparaison précise nécessite effort visuel
🔹 Marques utilisées
Rectangles (cellules)
🔹 Canaux visuels
Couleur → valeur numérique
Organisation en matrice (lignes × colonnes)
🔹
Data Analytics 46
🔹 Comment ils sont utilisés
Chaque cellule encode une valeur par intensité de couleur.
Le clustering organise les lignes/colonnes pour révéler des patterns.
🔹 Avantages
Bonne scalabilité
Permet identifier rapidement des patterns
Adapté aux grands volumes
🔹 Inconvénients
Comparaison précise difficile
Dépend fortement du choix de palette
Data Analytics 47
🔵 Graphique C
✅ Type de coordination
✔ Petits multiples (Small Multiples)
🔹 Shared Encoding
✔ Même encodage visuel
Même type de graphique (line chart)
Même axes
Même codage position X / Y
🔹 Shared Data
❌ Données différentes (chaque sous-graphe représente un pays ou une
catégorie différente)
🔵 Graphique D
✅ Type de coordination
✔ Juxtaposition de vues
🔹 Shared Encoding
❌ Encodage visuel différent (plusieurs types de graphiques dans un
dashboard)
🔹 Shared Data
✔ Données partagées (même dataset)
🎯
Data Analytics 48
🎯 Justification courte à écrire
Le graphique D correspond à une juxtaposition de vues car plusieurs
visualisations différentes sont placées côte à côte, utilisant les mêmes
données mais avec des encodages visuels différents.
🔵 Graphique E
D’après la figure E (comparaison côte à côte de deux représentations
similaires).
✅ Type de coordination
✔ Juxtaposition de vues
🔹 Shared Encoding
❌ Encodage différent entre les sous-graphes
🔹 Shared Data
✔ Données similaires ou partagées
Data Analytics 49
⚠ Ce que le prof veut voir
Compréhension de coordination des vues
Différence entre petits multiples et juxtaposition
Mention explicite de shared encoding et shared data
✅ Graphique recommandé :
✔ Line Chart (Graphique en courbe)
📌 Justification
Le line chart est le plus adapté pour représenter une évolution dans le temps
car :
Les 12 mois représentent une dimension temporelle continue
Il permet d’identifier clairement :
Les tendances (hausse / baisse)
Les pics saisonniers
Les fluctuations mensuelles
Il montre la continuité entre les points
La propriété visuelle principale utilisée est la position, qui est le canal le plus
précis pour représenter des valeurs numériques.
Data Analytics 50
🎯 Réponse parfaite à écrire à l’examen
Pour présenter l’évolution des ventes sur 12 mois, le graphique en courbe
(line chart) est le plus adapté car il permet de visualiser la continuité
temporelle, d’identifier les tendances et de détecter les variations
saisonnières de manière claire et précise.
✅ Graphique recommandé :
✔ Diagramme à barres (Bar Chart)
(éventuellement barres groupées si plusieurs sous-catégories)
📌 Justification
On veut :
Comparer des catégories distinctes
Sur une période donnée (une année complète)
Observer quelle catégorie performe le plus
Le bar chart est adapté car :
Il utilise la longueur, qui est un canal visuel précis
Il permet un classement clair
Il facilite la comparaison visuelle entre groupes
Data Analytics 51
✔ Bar chart groupé par mois
❌ Pourquoi pas un pie chart ?
Mauvais pour comparer plusieurs catégories précisément
Peu adapté quand il y a beaucoup de catégories
✅ Graphique recommandé :
✔ Carte géographique (Choropleth Map)
ou
✔ Diagramme à barres (si on ne veut pas utiliser la dimension spatiale)
📌 Cas 1 : Si la dimension géographique
est importante
✔ Carte (Choropleth Map)
Justification :
Les régions ont une dimension spatiale réelle
La position géographique facilite la compréhension
La couleur (palette séquentielle) représente l’intensité des ventes
Permet d’identifier rapidement les zones performantes
Data Analytics 52
📌 Cas 2 : Si l’objectif est la comparaison
précise
✔ Bar Chart
Justification :
La longueur est un canal plus précis que la couleur
Meilleur pour comparer quantitativement les régions
Permet un classement clair
Alternative :
Barres empilées si on veut montrer la contribution de chaque catégorie au total
régional.
🧠 Justification à écrire :
Lorsque le nombre de catégories est modéré (une dizaine), un diagramme à
barres groupées est adapté car il permet une comparaison claire entre
régions et catégories grâce au canal longueur.
✅
Data Analytics 54
✅ Graphique recommandé :
✔ Treemap
ou
✔ Heatmap
📌 Pourquoi ?
🔹 Treemap
Adapté aux nombreuses catégories
Bonne visualisation hiérarchique (région → catégorie)
Compact
🔹 Heatmap
Permet une matrice région × catégorie
Bonne scalabilité
Couleur encode intensité
Data Analytics 55
Proposez un graphique pour analyser les
relations de corrélation entre les ventes
de certaines catégories
✅ Graphique recommandé :
✔ Scatter Plot (Graphique de dispersion)
📌 Pourquoi ?
Pour analyser une corrélation, on a :
Deux variables numériques continues
(ex : ventes catégorie A vs ventes catégorie B)
Le scatter plot permet :
De visualiser la relation entre les deux catégories
D’identifier :
Corrélation positive
Corrélation négative
Absence de corrélation
D’ajouter une ligne de tendance
De calculer R²
📊 Exemple
Axe X → Ventes catégorie A
Axe Y → Ventes catégorie B
Chaque point → une région ou une période
📈
✔
Si plusieurs catégories
Matrice de scatter plots
Data Analytics 56
ou
✔ Heatmap de corrélation
🎯 Réponse parfaite à écrire à l’examen
Pour analyser la relation de corrélation entre les ventes de différentes
catégories, le graphique de dispersion (scatter plot) est le plus adapté, car il
permet d’observer la direction, la force et la forme de la relation entre deux
variables numériques continues.
⚠ Important à ajouter
Corrélation ne signifie pas causalité.
⚠ À ne pas confondre
Filtre → réduit les données affichées
Highlight → met en évidence sans supprimer
Agrégation → regroupe les données
Superposition → combine plusieurs graphiques
📌 Justification
Lorsque l’utilisateur sélectionne une région :
Les catégories correspondantes sont mises à jour automatiquement
Les autres données peuvent être masquées ou mises en évidence
Si la sélection réduit les données affichées →
👉 Filtre croisé
Si la sélection met seulement en évidence sans supprimer →
👉 Highlight
Data Analytics 58
🎯 Réponse parfaite à écrire à l’examen
Le concept utilisé est le filtre croisé, car la sélection d’une région met à jour
dynamiquement les catégories affichées en fonction des données associées
à cette région.
Data Analytics 59
📌 Cas 2 : Une courbe par catégorie
séparément
✔ Juxtaposition de vues
ou
✔ Petits multiples
Même encodage
Données différentes par catégorie
Meilleure lisibilité si nombreuses catégories
Data Analytics 60
✔ Filtre dynamique lié au zoom
📌 Justification
Lorsque l’utilisateur agrandit la zone d’affichage :
La visualisation révèle progressivement plus de détails
Les données deviennent plus précises (ex : passer de vue annuelle →
mensuelle → quotidienne)
Cela permet une exploration hiérarchique des données
Le zoom est une interaction qui modifie le niveau de détail sans changer la
structure globale.
Data Analytics 61
✔ Petits multiples (Small multiples)
📌
✔
Cas 1 : Nombre modéré de catégories
Line chart multi-séries
Axe X → Temps
Axe Y → Ventes
Une couleur différente par catégorie
Pourquoi ?
Permet de comparer directement les tendances
Met en évidence la continuité temporelle
Facilite l’analyse des variations entre catégories
⚠ Limite : peut devenir illisible si trop de catégories.
📌
✔
Cas 2 : Grand nombre de catégories
Petits multiples (un line chart par catégorie)
Même encodage
Données séparées
Meilleure lisibilité
Pourquoi ?
Évite surcharge visuelle
Permet comparaison claire
Bonne scalabilité
Data Analytics 62
les petits multiples sont préférables afin d’améliorer la lisibilité et d’éviter la
surcharge visuelle.
Objectif
Créer 2 dashboards :
1️⃣ Analyse globale des ventes
2️⃣ Analyse par région et par catégorie
Dataset :
Âge des clients
Catégorie de produits
Produits
Date d’achat
Montant d’achat
Pays
Data Analytics 63
Permet d’analyser distribution
Identifier tranches dominantes
📊 4️⃣
d’âge
Catégories les plus populaires selon tranches
✔ Bar chart groupé
Axe X : Tranches d’âge
Axe Y : Montant / nombre ventes
Couleur : Catégorie
🔵
✔
Interactions utilisées (Dashboard 1)
Filtres
Date
Pays
Catégorie
✔ Filtre croisé
Sélectionner une tranche d’âge met à jour autres graphiques
✔ Highlight
Met en évidence catégorie sélectionnée
✔ Tooltips (Info-bulles)
Afficher détails précis
🎯 Justification interaction
Les filtres permettent une exploration dynamique, le filtre croisé assure la
coordination des vues, et les infobulles offrent un niveau de détail sans
surcharger la visualisation.
Data Analytics 65
📊 2️⃣ Ventes par catégorie dans chaque région
✔ Bar chart groupé
ou
✔ Heatmap région × catégorie
📈 3️⃣ Évolution des ventes par région
✔ Line chart multi-séries
📊 4️⃣ Catégories dominantes par région
✔ Treemap par région
ou
✔ Bar chart trié
🔵
✔
Interactions utilisées (Dashboard 2)
Filtre région
✔ Filtre date
✔ Drill-down
Région → Pays → Ville
✔ Superposition
Plusieurs courbes dans même graphique
✔ Juxtaposition
Carte + bar chart + line chart
🎯 Justification interactions
L’utilisation du filtre régional permet une analyse ciblée, le drill-down facilite
l’exploration hiérarchique, et la juxtaposition de vues améliore la
compréhension globale en combinant plusieurs perspectives analytiques.
Data Analytics 66
🧠 Ce que le prof veut voir
Bon choix graphique selon type de données
Mention de hiérarchie
Notion de coordination des vues
Interaction dynamique
Justification claire
✍️ Conclusion à écrire
Ces deux dashboards permettent une analyse globale et régionale des
ventes en combinant des visualisations adaptées au type de données et des
interactions dynamiques facilitant l’exploration et la prise de décision.
Data Analytics 67