0% ont trouvé ce document utile (0 vote)
12 vues20 pages

Introduction à l'Analyse de Données

Transféré par

zaidchouimet0
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PPTX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
12 vues20 pages

Introduction à l'Analyse de Données

Transféré par

zaidchouimet0
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PPTX, PDF, TXT ou lisez en ligne sur Scribd

Cours : Analyse de Données

Introduction

Lt- Colonel A. ROUIGUEB 1


Contenu
I. Analyse données (ADD)
1) Définitions, concepts
2) Exemples d’application
II. Représentation des données
1) Représentation tabulaire
2) Représentation géométrique
3) Types de données
III. Séries temporelles
IV. Régression linéaire simple/multiple
V. Reconnaissance de formes
I. Exemples etudiés KNN, Kmeans, Deep Learning

2
Analyse de données: définitions
• L’analyse de données (ADD) est le processus
de recherche, de découvertes des nouvelles
connaissances à partir d’un échantillon de
données.
ADD est un ensemble de méthodes et de
techniques qui utilisent les données, qui sont
collectées du monde réel, pour répondre à des
questions d’intérêt, pour la prise de décision.

3
Catégories de l’ADD

• Narrative (e.g. lois, arts)


• Descriptive (e.g. sciences sociales)
• Statistique|mathématiques (sciences appliquées)
– Machine Learning: algorithmes sophistiqués (e.g svm)
– Data mining : big data, algorithmes simple et rapides
• Autres

La deuxième et la troisième sont les plus populaires en


sciences appliquées
Analyse de données: objectifs

 Expliquer les relations cause-à-effet d’un phénomène

 Trouver des nouveaux modèles, structures (motifs, Pattern), et


connaissances, qui sont dissimulées dans les données
 Prédire le future dans le monde réel, dans un but d’anticipation.

Trouver des réponses à des questions d’un problème donné

Ressortir des conclusions sur un événement du monde réel


Analyse de données: principes
Les données ne peuvent pas parler (statiques)
 ADD : faire parler les données
Base de données = une mine, un gisement
 L’analyse contient quelques aspects scientifiques du
raisonnement et d’argumentation:
 Définition
 Interprétation
 Evaluation
 Illustration
 Discussion
 Explication
 Simplification
 Comparaison
Processus complet d’ADD

1. Poser une question, formuler un problème


2. Collecter les données relatives au problème étudié et les
préparer dans un format exploitable, (définir les variables liées
au phénomène étudié et les mesurer)  dataset
3. Explorer et analyser les données, trouver des motifs, et
construire une intuition sur la question posée (recours aux
techniques statistiques)
4. Tirer des conclusions et|ou faire des prédictions
5. Communiquer vos résultats (rapports)
7
Représentation
de
données

8
Représentation tabulaire
• Données peuvent être
représentées sous forme d’un
tableau abstrait n*d
• ‘n’ lignes : entités, individus,
observations, objets, points de
données, instances, vecteurs
• ‘d’ colonnes : attributs ou
propriétés d’intérêt,
caractéristiques ,variables, features
• Chaque ligne: valeurs observées
d’une seule entité=un vecteur
• Chaque attribut prend des valeurs
dans son domaine.
9
Représentation tabulaire

• Selon le domaine d’application, selon la communauté:


– Les lignes sont appelées: entités, individus,
observations, instances, exemples,
enregistrements, transactions, objets, points,
vecteurs d’attributs, tuples, …etc

– Les colonnes sont appelées: attributs, propriétés,


attributs, caractéristiques, dimensions, variables,
champ, features, …etc.

10
Exemple (fleur Iris):Représentation algebrique

Question
Décrire
les éléments
de ce tableau

Base de données « Iris »


11
Exemple (fleur Iris):Représentation géométrique

12
Questions
• Les représentations tabulaire et géométrique sont elles
équivalentes? Quels sont les avantages de chacune
d’elles?

• Analyser visuellement le graphe précédent:


– Existe-t-elle une relation entre X1 et X2? Justifier.

• Sous quelles conditions, il n y aura pas de relation entre


ces deux variables?

• Quelle est l’utilité derrière l’estimation de densités de


probabilité monodimensionnelles et conjointes des
variables?
13
Type de données
Type d’attribut

Catégorielle Numérique
(qualitative) (quantitative)

Continues discrètes
Nominales Ordinales
Education, - Température - Age {1,2,…100}
Sexe, dom={M,F}
dom= {HighSchool,BS,MS,PhD}

À retenir: voir si les opérations arithmétiques +,-,/ et de comparaison <,


=, > ont un sens utile pour ces différents types de données
14
Exercice

• Donner deux exemples pour chacun des 04


types de données.

15
Contenu du cours

Analyse de données

Partie 1 Partie 3
Série chronologiques Reconnaissance de formes
(time séries) (Pattern recognition)

Partie 2
Analyse de régression

16
Partie1 : Séries chronologiques (introduction)

X1 (temps) X2
(plus de détails dans la leçon suivante)
1 10

 Un cas spécial de données: 2 11.2

3 15
• X1: dénoté t : temps, discrétisé
4 12
• X2: Attribut d’un phénomène quelconque
5 9

Objectif : analyse de l’évolution de X2 6 10.5


dans le temps, en fonction de t
7 08
identifier X2 =Fθ(t).

Séries multidimensionnelles (X1… Xd )=F(t). 17


Partie2 : Analyse de régression (introduction)

X1 ….. Xd Y
 Un cas spécial de données:
1 .. 2.1 10

• X1, …, Xd : variables explicatives, mesurées 2 .. 0.1 11.2


• Y: Variable à prédire, a expliquer
0 .. 11 15

Objectif : Identifier Y=F(X1 ....Xd) 0 .. -4 12

 tâche difficile 5 .. -6 9
Estimer F: trouver une approximation
6 .. 3 10.5
de F par :
i) Analyse de l’échantillon données disponible 7 3 08
ii) Exploitation des informations a priori sur
la forme de F
18
Partie3 : Pattern recognition
X1 … Xp Y
1 … 1 c2
Un autre cas spécial de données: 0.5 … 2.3 c2
2 … 0.6 c3
• X1, X1,…., Xp : caractéristiques, var.
1 … 2.0 c1
explicatives
-1 … 50 c3
• Y: variable (classe) à prédire,
variable réponse, à expliquer 2.6 … 20 c2

ici, Y est une variable catégorielle 7 .. 13 c1

(sera détaillée les leçons 4, 5)

19
Analyse en composantes principales
X1 … Xp
1 … 1
Analyse en composante princiaples 0.5 … 2.3
2 … 0.6
1 … 2.0
-1 … 50
2.6 … 20
7 .. 13

20

Vous aimerez peut-être aussi