Université de Blida1
Département d’informatique
Master 1
Cours 2: Données et
Proximités.
Mme Fareh
2025/2026
13/02/2026 1
Plan
1. Représentation des données
1. Types de données
2. Types de dataset
2. Distance, similarité et corrélation
1. Numérique
2. Binaire
3. Nominal
3. Analyse de données
1. Paramètres de tendances centrale
2. Paramètres de dispersion
3. Visualisation graphique
13/02/2026 2
Qu’est-ce que les données ?
Collecte d' objets de données Les
et de leurs attributs attributs
Un attribut est une propriété Tid Refund Marital Taxable
ou une caractéristique d'un Status Income Cheat
objet 1 Yes Single 125K No
◦ Exemples : couleur des yeux d'une 2 No Married 100K No
personne, température, etc.
3 No Single 70K No
◦ L'attribut est également appelé
Objets
variable, champ, caractéristique, 4 Yes Married 120K No
dimension ou fonctionnalité. 5 No Divorced 95K Yes
Une collection d'attributs 6 No Married 60K No
décrit un objet 7 Yes Divorced 220K No
◦ L'objet est également appelé 8 No Single 85K Yes
enregistrement, point, cas,
9 No Married 75K No
échantillon, entité ou instance.
10 No Single 90K Yes
13/02/2026 10
3
Les données
Données quantitatives (numériques):
➢Données continues
➢Données discrètes
Données textuelles
➢Elles ont pour valeurs des textes, écrites
en langage naturel.
13/02/2026 4
Les données
Les données qualitatives (non
numériques)
➢Données énumératives (nominales)
➢Ex. la couleur
➢Données énumératives ordonnées
(ordinales)
➢ Ex. Niveau{insuffisant, passable, bien, très
bien}
13/02/2026 5
Les données
Données binaires:
➢Symétrique:
o Les deux états sont équivalents
➢Non symétrique:
o Un état est plus important qu’un autre
13/02/2026 6
Types des datasets
Enregistrements (Record)
◦ Matrice de données
◦ Données du document
◦ Données de transaction
Graphique (Graph)
◦ World Wide Web
◦ Structures moléculaires
Ordonné (ordred)
◦ Données temporelles
◦ Données séquentielles
13/02/2026 7
Types des datasets
Enregistrements (Record)
Tid Refund Marital Taxable
Status Income Cheat
Données constituées 1 Yes Single 125K No
d'une collection 2 No Married 100K No
d'enregistrements, chacun 3 No Single 70K No
étant constitué d'un 4 Yes Married 120K No
ensemble fixe d'attributs 5 No Divorced 95K Yes
chaque enregistrement 6 No Married 60K No
(objet) possède le même 7 Yes Divorced 220K No
ensemble d'attributs 8 No Single 85K Yes
9 No Married 75K No
10 No Single 90K Yes
10
13/02/2026 8
Types des datasets
Matrice de données
Si les objets de données ont un ensemble fixe d'attributs
numériques, alors les objets de données peuvent être considérés
comme des points dans un espace multidimensionnel, où chaque
dimension représente un attribut distinct.
Vecteurs dans un espace multidimensionnel
Un tel ensemble de données peut être représenté par une
matrice n par p , où il y a n lignes, une pour chaque objet, et p
colonnes, une pour chaque attribut.
Projection Projection Distance Load Thickness
of x Load of y load
10.23 5.27 15.22 2.7 1.2
12.65 6.25 16.22
13/02/2026 2.2 1.1 9
Matrice
n: le nombre d’objets
p: le nombre d’attributs
X ij :est la valeur de l’attribut j de l’objet i
13/02/2026 10
Données du document
Chaque document devient un vecteur de «
termes, ou mots »
◦ Chaque terme est une composante (attribut) du
vecteur
◦ La valeur de chaque composant est le nombre de fois
que le terme correspondant apparaît dans le
document.
timeout
season
coach
game
score
play
team
win
ball
lost
Document 1 3 0 5 0 2 6 0 2 0 2
Document 2 0 7 0 2 1 0 0 3 0 0
Document 3 0 1 0 0 1 2 2 0 3 0
Données de transaction
Un type spécial de données, où
◦ Chaque transaction implique un ensemble d'éléments.
◦ Par exemple, considérons une épicerie. L'ensemble des produits
achetés par un client au cours d'une séance d'achat constitue une
transaction, tandis que les produits individuels achetés sont les
articles.
◦ Généralement les attributs sont binaires, indiquant si un article a
été acheté ou non
TID Items
1 Bread, Coke, Milk
2 Beer, Bread
3 Beer, Coke, Diaper, Milk
4 Beer, Bread, Diaper, Milk
5 Coke, Diaper, Milk
Données graphiques
Exemples : graphique générique, molécule et pages Web
2
5 1
2
5
Benzene Molecule: C6H6
• Des pages Web du World Wide Web, qui contiennent à la fois du texte et des liens vers
d'autres pages.
• La structure de composants chimiques peut être représentée par un graphique dans lequel
les nœuds sont des atomes et les liens entre les nœuds sont des liaisons chimiques
Données ordonnées
Séquences de transactions(temporelle)
• Les attributs ont des relations qui impliquent un ordre dans le temps
• Les données séquentielles (temporelles) peuvent être considéré comme une
extension des données d'enregistrement, où chaque enregistrement est associé à
une heure
• Le pic des ventes de bonbons avant L’aid
• Les personnes qui achètent des lecteurs DVD ont tendance à acheter des DVD dans
la période immédiatement suite à l’achat 13/02/2026 14
Mesures de Distance ou de similarité
De nombreuses tâches d’exploration de données et d’analyse impliquent
la comparaison d’objets et la détermination en termes de leurs
similarités (ou dissimilarités)
◦ Recherche, classification et prédiction
◦ Catégorisation automatique
◦ Analyse de corrélation
◦ Réduction de la dimension
Beaucoup d’applications du monde réel d’aujourd’hui reposent sur les
similarités de calcul ou les distances entre les objets
◦ Systèmes de Recommandation
◦ Catégorisation des documents
◦ Recherche d’informations
13/02/2026 15
Mesures de similarité et de
dissimilarité (distance)
Mesure de similarité
◦ Mesure numérique de la similarité de deux objets de données.
◦ Est plus élevé lorsque les objets se ressemblent davantage.
◦ Se situe souvent dans la plage [0,1]
Mesure de dissimilarité
◦ Mesure numérique de la différence entre deux objets de
données
◦ Petite lorsque les objets se ressemblent davantage
◦ La dissimilarité minimale est souvent de 0
◦ La limite supérieure varie
La proximité fait référence à une similarité ou une dissimilarité
Matrice de distance
Quelles sont les propriétés de la matrice de distance?
13/02/2026 17
Matrice de distance
Matrice carrée
Valeurs nulles sur la diagonale
Matrice symétrique
Les valeurs sont positives
13/02/2026 18
Fonction de distance
Données numériques:
1. Distance euclidienne
2. Distance de Manhattan
avec i = (x i1, x i2, …, x ip) et j = (x j1, x j2, …, x jp) deux objets à p dimensions
13/02/2026 19
Distance de Minkowski
de Minkowski est une généralisation de la
distance euclidienne
Où r est un paramètre, n est le nombre
de dimensions (attributs) et x k et y k
sont, respectivement, les k ème attributs
des objets x et y
r = 1. Distancee de Manhattan
r = 2. Distance euclidienne
Similarité entre les vecteurs binaires
La situation courante est que les objets x et y n'ont que des
attributs binaires
Calculer les similarité en utilisant les quantités suivantes
f 01 = le nombre d'attributs où x était 0 et y était 1
f10 = le nombre d'attributs où x était 1 et y était 0
f 00 = le nombre d'attributs où x était 0 et y était 0
f 11 = le nombre d'attributs où x était 1 et y était 1
Coefficient SMC: Coefficient d'appariement simple (Simple
Matching Coefficient) Un coefficient de similarité
couramment utilisé est SMC
SMC = nombre de correspondances / nombre d'attributs
= ( f 11 + f 00 ) / ( f 01 + f 10 + f 11 + f 00 )
Données binaires
Table de contingence
la variable symétrique la variable asymétrique
13/02/2026 22
Données nominales
Attributs nominaux:
Jaccard(S,T)=
13/02/2026 23
La similarité cosinus
13/02/2026 24
Similarité cosinus
Sid 1 et d 2 sont deux vecteurs de document, alors
cos( d 1 , d 2 ) = < d 1 , d 2 > / || d 1 || || d 2 || ,
où < d 1 , d 2 > indique le produit scalaire ou le produit scalaire
vectoriel de vecteurs, d 1 et d 2, et || d || est la norme du
vecteur d .
Exemple:
d1=3205000200
d 2= 1 0 0 0 0 0 0 1 0 2
<d 1 , d2> = 3*1 + 2*0 + 0*0 + 5*0 + 0*0 + 0*0 + 0*0 + 2*1 + 0*0 + 0*2 = 5
|| d 1 || = (3*3+2*2+0*0+5*5+0*0+0*0+0*0+2*2+0*0+0*0) 0,5 = (42) 0,5 = 6,481
|| d 2 || = (1*1+0*0+0*0+0*0+0*0+0*0+0*0+1*1+0*0+2*2) 0,5 = (6) 0,5 = 2,449
cos( d 1 , d 2 ) = 0,3150
Similarité : Corrélation
Elle mesure la relation linéaire entre les objets,
Le coefficient de corrélation linéaire de X et Y est défini par:
Le coefficient de Pearson.
▪ La valeur de r varie de -1 à +1.
13/02/2026 26
Évaluation visuelle de la corrélation
Nuages de points montrant la similarité de –1 à 1.
Distance/Similarité /Corrélation
1. Données continues :pour évaluer la proximité entre les
points. la distance euclidienne sont couramment utilisées
2. Données clairsemées: elles ont de nombreuses valeurs
nulles ou manquantes, les mesures de similarité telles que la
similarité cosinus ou la mesure de Jaccard sont plus
appropriées.
3. Données catégorielles: les variables sont des catégories
ou des étiquettes plutôt que des valeurs numériques, des
mesures de similarité telles que la similarité de Jaccard sont
souvent utilisées.
4. Données temporelles: Pour les séries temporelles, la
mesure de la corrélation peut être plus pertinente que la
distance euclidienne, car elle tient compte des variations
entre les séries, elle peut être utilisée pour mesurer la
similarité entre deux séries temporelles en examinant à
quel point elles varient ensemble.
13/02/2026 28
Analyse des données
L’ Analyse des données est un ensemble de techniques pour
découvrir la structure, éventuellement compliquée, d’un tableau
de nombres à plusieurs dimensions et de traduire par une
structure plus simple et qui la résume au mieux. Cette structure
peut le plus souvent, être représentée graphiquement.
Un ensemble de méthodes statistiques, mathématiques ou
informatiques qui permettent de transformer des données brutes
en connaissances pouvant être exploitées.
Ces techniques qui sont essentiellement descriptives, ont pour
but de décrire, de réduire, de classer et de clarifier les données
en tenant compte de nombreux points de vue et d’étudier, en
dégageant les liaisons, les ressemblances ou les différences entre
les variables ou groupes de variables.
13/02/2026 29
Processus d’analyse de données
Les principales étapes du processus d'analyse consistent à :
1. Cerner les sujets d'analyse,
2. Déterminer la disponibilité de données appropriées. La
collecte de données par:
1. Expérimentation
2. Collecte de données en ligne
3. Enquêtes et questionnaires
4. Techniques de Web Scraping,…
3. Décider des méthodes qu'il y a lieu d'utiliser pour répondre
aux questions d'intérêt,
4. Appliquer les méthodes, et
5. Evaluer, résumer et interpréter les résultats.
13/02/2026 30
Analyse des données univariée:
Mesures de la tendance centrale
Les mesures de la tendance centrale visent
à rendre compte de manière synthétique
d’un aspect important d’une distribution, à
savoir, ce que l’on pourrait appeler
intuitivement, la valeur (ou modalité)
« dominante » (ou « centrale ») de cette
distribution.
13/02/2026 31
Mesures de la tendance centrale :
moyenne, médiane et mode
La moyenne
La moyenne pondérée
La médiane: est le point milieu d’un jeu de données, de
sorte que 50 % des unités ont une valeur inférieure ou
égale à la médiane et 50 % des unités ont une valeur
supérieure ou égale.
Le mode: Le mode est la valeur ayant l’effectif le plus
élevé.
13/02/2026 32
Exemple
Les résultats d’une classe à un examen:
On constate que 14/20 est la note la plus souvent obtenue pour
cet examen dans cette classe ou, la note obtenue par le plus
grand nombre d’élèves. C’est la notion de mode.
On pourrait aussi constater que la moitié des élèves de cette
classe a obtenu au moins 13/20. En quelque sorte, 13 est la note
qui partage le groupe en une moitié inférieure et une moitié
supérieure. C’est la médiane .
La note moyenne obtenue par cette classe pour cet examen est
de 12,8/20, en additionnant toutes les notes et en divisant cette
somme par le nombre d’élèves. C’est la moyenne
Les mesures de la tendance centrale sont très précieuses. Elles
fournissent de manière très synthétique une distribution.
13/02/2026 33
Les mesures de dispersion
Les mesures de dispersion servent à
caractériser l'étalement des valeurs
présentes dans une distribution. Plus
la distribution sera étalée, plus la valeur de
la mesure de dispersion sera élevée.
13/02/2026 34
Etendue
L'étendue d'une distribution est égale à la
différence entre la plus grande et la plus
petite valeur de la distribution:
Etendue de X = Xmax-Xmin
13/02/2026 35
Variance et écart type:
Variance: Elle mesure la dispersion des données autour de la
Moyenne.
C’est la moyenne des carrés des écarts des valeurs à la
moyenne de la population.
Variance : Série brute : Série groupée ou classée :
n
1
1 k k
V = n i ( x i - x ) = fi ( x i - x )
2
V = xi − xlj 2 2
n
i=1
n i=1 i=1
1 k
V = n i x i2 − x 2 = Moyenne des carrés - Carré de la moyenne
n i=1
Ecart-type : σ= V
13/02/2026 36
Quantiles et quartiles
Quantiles : on appelle quantiles les valeurs du caractère
qui définissent les bornes d'une partition en classes
d'effectifs égaux.
Les quartiles sont les trois valeurs qui permettent de
découper la distribution en quatre classes d'effectifs
égaux. On les note Xq1 , Xq2 et Xq3.
Partition du caractère Xmin Xq1 Xq2 Xq3 Xmax
fréquence des effectifs 25% 25% 25% 25%
◦ Remarque : Xq2 est égal à la médiane.
L'écart interquartile est la différence entre le
troisième et le premier quartiles.
L'écart-type est une mesure de dispersion par rapport
à la moyenne.
13/02/2026 37
Visualisation
Diagramme à Barres (également appelés diagrammes
de colonnes) sont extrêmement polyvalents et sont
généralement les graphiques les plus faciles pour une
interprétation par les lecteurs. Les graphiques à barres
utilisés pour comparer les valeurs entre les catégories.
13/02/2026 38
Le Diagramme Circulaire
Les diagrammes circulaires sont plus indiqués pour faire
des comparaisons partielles ou complètes et pour
montrer la répartition d'une population à l'intérieur d'une
distribution en pourcentage.
13/02/2026 39
Graphiques Linéaires
Un graphique linéaire est une comparaison visuelle des relations
entre deux variables placées sur l'axe des x et l'axe des y. Il
montre les liens entre les informations en plaçant un trait
continu entre les points d'une grille.
13/02/2026 40
Les Diagrammes de Dispersion
Un diagramme de dispersion est un graphique qui
montre deux indicateurs liés l’un à l'autre: l'un est placé
sur l'axe des « x » et l'autre est tracé sur l'axe des « y ».
Diagramme dans lequel chaque donnée
d’une distribution est représentée par un point afin de
faire apparaitre globalement une approximation visuelle.
13/02/2026 41
Boxplot
Boxplot que l'on appelle aussi boîte à moustache. Ce
graphique tout simple permet de résumer une variable
de manière simple et visuelle, d'identifier les valeurs
extrêmes et de comprendre la répartition des
observations.
13/02/2026 42