0% ont trouvé ce document utile (0 vote)
20 vues33 pages

Introduction à l'Analyse en Composantes Principales

Transféré par

Yassine Tanabene
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
20 vues33 pages

Introduction à l'Analyse en Composantes Principales

Transféré par

Yassine Tanabene
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Chapitre 3 : Analyse en

composantes principales
(ACP)

Enseignante : Raghda Jouirou

[Link]@[Link]

Laboratoire de Recherche Automatique Traitement de Signal


et Image (LARATSI)
Plan

•1 Introduction à l’ACP
•2 Pourquoi utiliser l’ACP?
•3 Théorie de l’ACP
•4 Etapes mathématiques
•5 Variantes de l’ACP
•6 Exemple simple de l’ACP

26/12/2024 Raghda Jouirou 2


Introduction

Définition
L'Analyse en Composantes Principales (ACP) est l'une des méthodes de data mining
les plus populaires.
L’ACP est une méthode qui réduit le nombre de dimensions tout en maximisant
l’information capturée.
L'analyse en composantes principales est l'une des méthodes d'analyse de données
multivariées les plus fréquemment utilisées. Elle permet d'étudier des ensembles de
données multidimensionnelles avec des variables quantitatives

Objectifs
•Simplifier l’analyse des données complexes.
•Réduire le nombre de variables tout en gardant l’essentiel de l’information.

26/12/2024 Raghda Jouirou 3


Pourquoi utiliser l’ACP?

Dans plusieurs applications , le nombre de variable utilisé pour représenter les données
est très élevé.

Cas de traitement d’images haute-résolution (un pixel est représenter par ++variables)
Analyse de données génomiques (centaines de milliers de positions du génome peuvent
être caractérisées)

Bien qu’une représentation des données contenant plus de variables soit intuitivement
plus riches, il est plus difficile d’apprendre un modèle performant dans
ces circonstances !

26/12/2024 Raghda Jouirou 4


Pourquoi utiliser l’ACP?

 Identifier les relations entre les variables.

 Faciliter la visualisation des données multidimensionnelles.

 Prétraitement avant des algorithmes comme la classification ou la régression.

26/12/2024 Raghda Jouirou 5


Théorie de l’ACP Définitions

L'Analyse en Composantes Principales (ACP) est une méthode de réduction


dimensionnelle non supervisée qui permet d'identifier les corrélations et les patterns dans
un jeu de données. Elle transforme ces données en un ensemble avec un nombre réduit
de variables, tout en minimisant la perte d'information.

Le PCA permet de mettre aussi en évidence la variabilité entre les différentes données qui
composent la dataset, mais aussi la liaison entre les variables.

26/12/2024 Raghda Jouirou 6


Comment ?

Tout cela est réalisé en projetant le jeu de données initial dans un


espace de dimension réduite, en utilisant les vecteurs propres. Cette
projection consiste à représenter les points dans un espace plus petit,
ce qui peut entraîner une certaine perte d'information.

26/12/2024 Raghda Jouirou 7


Comment ?
Pour minimiser la perte lors de la projection :

Maximiser la variance des projections : Cela permet de conserver un maximum


d'informations pertinentes en différenciant les exemples dans leur nouvelle
représentation. La variance élevée indique que les données projetées capturent
mieux la structure des données originales.

Minimiser la distance entre les données initiales et leurs projections : Cela


garantit que les points projetés restent aussi proches que possible des données
d'origine, réduisant ainsi la perte d'information due à la réduction de dimension.
Ces deux objectifs sont atteints dans l'ACP grâce au choix des vecteurs propres
associés aux plus grandes valeurs propres, qui définissent les directions optimales
pour la projection.

26/12/2024 Raghda Jouirou 8


Maximisation de la variance: La variance des données
est maximale selon l’axe indiqué par une flèche

26/12/2024 Raghda Jouirou 9


Une ACP de la matrice X ∈ ℝ n×p est une transformation linéaire orthogonale
qui permet d’exprimer X dans une nouvelle base orthonormée, de sorte que :
la plus grande variance de X par projection s’aligne sur le premier axe de cette
nouvelle base,
la seconde plus grande variance sur le deuxième axe,
et ainsi de suite…

 Les axes de cette nouvelle base sont appelés composantes principales

26/12/2024 Raghda Jouirou 10


Théorie de l’ACP

Notions de base:

 Population: Nb des individus à étudier

 Echantillon: Partie de la population (n individus) sur laquelle est effectuée l’étude.

 Variable (caractère) : caractéristique des individus, définie sur la population

 On a 2 types de variables:

 Variable quantitative:  valeurs réelles


o Discrète (âge, nb enfants...)
o Continue(taille, température…)
 Variable qualitative:
o Nominale(couleur…)
o Ordinale(type voiture; petite, moyenne…)
26/12/2024 Raghda Jouirou 11
Théorie de l’ACP Variable quantitative

26/12/2024 Raghda Jouirou 12


Théorie de l’ACP
Analyse de la liaison entre 2 variables quantitatives

26/12/2024 Raghda Jouirou 13


Théorie de l’ACP
Analyse de la liaison entre 2 variables quantitatives

26/12/2024 Raghda Jouirou 14


Étapes mathématiques

1. Standardisation des données

•Pourquoi ? Éviter qu’une variable domine l’analyse.

2. Matrice de covariance : La matrice de covariance est calculée à


partir des données standardisées pour mesurer les covariances entre
toutes les paires de variables.

26/12/2024 Raghda Jouirou 15


Étapes mathématiques

3. Décomposition des valeurs propres et vecteurs propres

Les valeurs propres (λ) représentent l’importance des nouvelles directions (composantes
principales), et les vecteurs propres (v) définissent ces directions.

26/12/2024 Raghda Jouirou 16


Étapes mathématiques

4. Projection des données

Les données initiales sont projetées sur les nouvelles dimensions définies par les
composantes principales.

26/12/2024 Raghda Jouirou 17


Variantes de l’ACP

Nous pouvons distinguer trois variantes de l’analyse en composantes principales :

L`ACP générale, dans laquelle la recherche des directions de variance maximale est faite
sans transformer les données. On travaille donc directement sur la matrice des données
brutes, X=R. Dans ce cas, interviennent dans l’analyse à la fois la position du nuage
d’observations par rapport à l’origine et la forme du nuage. Cette variante est utilisée très
rarement, essentiellement pour tenir compte du zéro naturel de certaines variables.

26/12/2024 Raghda Jouirou 18


Variantes de l’ACP

L’ACP centrée consiste à soustraire la moyenne de chaque variable à ses observations,


transformant la matrice brute R en une matrice X de variables de moyenne nulle. Elle est
adaptée lorsque les variables initiales sont comparables en nature et en échelle.

26/12/2024 Raghda Jouirou 19


Variantes de l’ACP

L’ACP normée consiste à centrer et réduire les variables, en transformant la matrice RRR
pour obtenir une matrice X où chaque colonne a une moyenne nulle et un écart-type
unitaire. Cette méthode est utilisée lorsque les variables sont de nature différente ou
présentent des échelles variées.

26/12/2024 Raghda Jouirou 20


ACP à travers l’exemple

26/12/2024 Raghda Jouirou 21


ACP à travers l’exemple

Calcule de la moyenne des données (la croix rouge)

26/12/2024 Raghda Jouirou 22


ACP à travers l’exemple

Soustrait de la moyenne à tous les points => centrer les données pour ne pas impacter la
variance de nos données

26/12/2024 Raghda Jouirou 23


ACP à travers l’exemple

Cherchant la projection qui minimise la distance avec les différents points

26/12/2024 Raghda Jouirou 24


ACP à travers l’exemple

Cette droite minimise le mieux la distance entre les points.


Minimiser l’équation de min square erreur (par exemple MSE)
consiste à minimiser la moyenne de distance au carré entre les points projetés sur la
droite

26/12/2024 Raghda Jouirou 25


ACP à travers l’exemple

26/12/2024 Raghda Jouirou 26


ACP à travers l’exemple

Normaliser le vecteur par sa norme (√(x² + y²) )pour obtenir un vecteur unitaire car on
cherche une base orthonormée √(1² + 2²) = √(5)

26/12/2024 Raghda Jouirou 27


ACP à travers l’exemple

26/12/2024 Raghda Jouirou 28


ACP à travers l’exemple

Projections des données par rapports les nouvelles projections trouvées.

Calcul de produit matriciel entre les données centrées avec les


composantes calculées au paravent  ce qui va donner une nouvelle
projection => Ces sont les points a projeter sur les axes CP1, CP2.
Les valeurs propres représentent la quantité de variance expliquée par
chaque composante.

26/12/2024 Raghda Jouirou 29


ACP à travers l’exemple

26/12/2024 Raghda Jouirou 30


ACP à travers l’exemple

Calcul de variance de CP1 et CP2


Soit CP1= (2/√5, 1/√5)
Variance de la composante principale (2/√5, 1/√5) =
Var(PC)=[(2/√5, - moyenne)^2 + (1/√5 - moyenne)^2] / 2

où "moyenne" est la moyenne de ces deux valeurs, dans ce cas,


(2/√5 + 2/√5) / 2

26/12/2024 Raghda Jouirou 31


ACP à travers l’exemple

Pour obtenir la présentation en pourcentage de la variance de PC1 et PC2:


PC1/la somme de la variance de PC1+PC2
PC1 explique 64% de la variance de nos données et PC2 seulement 6%
Projeter nos données sur l’axe avec la variance la plus élevée

26/12/2024 Raghda Jouirou 32


ACP à travers l’exemple

26/12/2024 Raghda Jouirou 33

Vous aimerez peut-être aussi