Chapitre 3 : Analyse en
composantes principales
(ACP)
Enseignante : Raghda Jouirou
[Link]@[Link]
Laboratoire de Recherche Automatique Traitement de Signal
et Image (LARATSI)
Plan
•1 Introduction à l’ACP
•2 Pourquoi utiliser l’ACP?
•3 Théorie de l’ACP
•4 Etapes mathématiques
•5 Variantes de l’ACP
•6 Exemple simple de l’ACP
26/12/2024 Raghda Jouirou 2
Introduction
Définition
L'Analyse en Composantes Principales (ACP) est l'une des méthodes de data mining
les plus populaires.
L’ACP est une méthode qui réduit le nombre de dimensions tout en maximisant
l’information capturée.
L'analyse en composantes principales est l'une des méthodes d'analyse de données
multivariées les plus fréquemment utilisées. Elle permet d'étudier des ensembles de
données multidimensionnelles avec des variables quantitatives
Objectifs
•Simplifier l’analyse des données complexes.
•Réduire le nombre de variables tout en gardant l’essentiel de l’information.
26/12/2024 Raghda Jouirou 3
Pourquoi utiliser l’ACP?
Dans plusieurs applications , le nombre de variable utilisé pour représenter les données
est très élevé.
Cas de traitement d’images haute-résolution (un pixel est représenter par ++variables)
Analyse de données génomiques (centaines de milliers de positions du génome peuvent
être caractérisées)
Bien qu’une représentation des données contenant plus de variables soit intuitivement
plus riches, il est plus difficile d’apprendre un modèle performant dans
ces circonstances !
26/12/2024 Raghda Jouirou 4
Pourquoi utiliser l’ACP?
Identifier les relations entre les variables.
Faciliter la visualisation des données multidimensionnelles.
Prétraitement avant des algorithmes comme la classification ou la régression.
26/12/2024 Raghda Jouirou 5
Théorie de l’ACP Définitions
L'Analyse en Composantes Principales (ACP) est une méthode de réduction
dimensionnelle non supervisée qui permet d'identifier les corrélations et les patterns dans
un jeu de données. Elle transforme ces données en un ensemble avec un nombre réduit
de variables, tout en minimisant la perte d'information.
Le PCA permet de mettre aussi en évidence la variabilité entre les différentes données qui
composent la dataset, mais aussi la liaison entre les variables.
26/12/2024 Raghda Jouirou 6
Comment ?
Tout cela est réalisé en projetant le jeu de données initial dans un
espace de dimension réduite, en utilisant les vecteurs propres. Cette
projection consiste à représenter les points dans un espace plus petit,
ce qui peut entraîner une certaine perte d'information.
26/12/2024 Raghda Jouirou 7
Comment ?
Pour minimiser la perte lors de la projection :
Maximiser la variance des projections : Cela permet de conserver un maximum
d'informations pertinentes en différenciant les exemples dans leur nouvelle
représentation. La variance élevée indique que les données projetées capturent
mieux la structure des données originales.
Minimiser la distance entre les données initiales et leurs projections : Cela
garantit que les points projetés restent aussi proches que possible des données
d'origine, réduisant ainsi la perte d'information due à la réduction de dimension.
Ces deux objectifs sont atteints dans l'ACP grâce au choix des vecteurs propres
associés aux plus grandes valeurs propres, qui définissent les directions optimales
pour la projection.
26/12/2024 Raghda Jouirou 8
Maximisation de la variance: La variance des données
est maximale selon l’axe indiqué par une flèche
26/12/2024 Raghda Jouirou 9
Une ACP de la matrice X ∈ ℝ n×p est une transformation linéaire orthogonale
qui permet d’exprimer X dans une nouvelle base orthonormée, de sorte que :
la plus grande variance de X par projection s’aligne sur le premier axe de cette
nouvelle base,
la seconde plus grande variance sur le deuxième axe,
et ainsi de suite…
Les axes de cette nouvelle base sont appelés composantes principales
26/12/2024 Raghda Jouirou 10
Théorie de l’ACP
Notions de base:
Population: Nb des individus à étudier
Echantillon: Partie de la population (n individus) sur laquelle est effectuée l’étude.
Variable (caractère) : caractéristique des individus, définie sur la population
On a 2 types de variables:
Variable quantitative: valeurs réelles
o Discrète (âge, nb enfants...)
o Continue(taille, température…)
Variable qualitative:
o Nominale(couleur…)
o Ordinale(type voiture; petite, moyenne…)
26/12/2024 Raghda Jouirou 11
Théorie de l’ACP Variable quantitative
26/12/2024 Raghda Jouirou 12
Théorie de l’ACP
Analyse de la liaison entre 2 variables quantitatives
26/12/2024 Raghda Jouirou 13
Théorie de l’ACP
Analyse de la liaison entre 2 variables quantitatives
26/12/2024 Raghda Jouirou 14
Étapes mathématiques
1. Standardisation des données
•Pourquoi ? Éviter qu’une variable domine l’analyse.
2. Matrice de covariance : La matrice de covariance est calculée à
partir des données standardisées pour mesurer les covariances entre
toutes les paires de variables.
26/12/2024 Raghda Jouirou 15
Étapes mathématiques
3. Décomposition des valeurs propres et vecteurs propres
Les valeurs propres (λ) représentent l’importance des nouvelles directions (composantes
principales), et les vecteurs propres (v) définissent ces directions.
26/12/2024 Raghda Jouirou 16
Étapes mathématiques
4. Projection des données
Les données initiales sont projetées sur les nouvelles dimensions définies par les
composantes principales.
26/12/2024 Raghda Jouirou 17
Variantes de l’ACP
Nous pouvons distinguer trois variantes de l’analyse en composantes principales :
L`ACP générale, dans laquelle la recherche des directions de variance maximale est faite
sans transformer les données. On travaille donc directement sur la matrice des données
brutes, X=R. Dans ce cas, interviennent dans l’analyse à la fois la position du nuage
d’observations par rapport à l’origine et la forme du nuage. Cette variante est utilisée très
rarement, essentiellement pour tenir compte du zéro naturel de certaines variables.
26/12/2024 Raghda Jouirou 18
Variantes de l’ACP
L’ACP centrée consiste à soustraire la moyenne de chaque variable à ses observations,
transformant la matrice brute R en une matrice X de variables de moyenne nulle. Elle est
adaptée lorsque les variables initiales sont comparables en nature et en échelle.
26/12/2024 Raghda Jouirou 19
Variantes de l’ACP
L’ACP normée consiste à centrer et réduire les variables, en transformant la matrice RRR
pour obtenir une matrice X où chaque colonne a une moyenne nulle et un écart-type
unitaire. Cette méthode est utilisée lorsque les variables sont de nature différente ou
présentent des échelles variées.
26/12/2024 Raghda Jouirou 20
ACP à travers l’exemple
26/12/2024 Raghda Jouirou 21
ACP à travers l’exemple
Calcule de la moyenne des données (la croix rouge)
26/12/2024 Raghda Jouirou 22
ACP à travers l’exemple
Soustrait de la moyenne à tous les points => centrer les données pour ne pas impacter la
variance de nos données
26/12/2024 Raghda Jouirou 23
ACP à travers l’exemple
Cherchant la projection qui minimise la distance avec les différents points
26/12/2024 Raghda Jouirou 24
ACP à travers l’exemple
Cette droite minimise le mieux la distance entre les points.
Minimiser l’équation de min square erreur (par exemple MSE)
consiste à minimiser la moyenne de distance au carré entre les points projetés sur la
droite
26/12/2024 Raghda Jouirou 25
ACP à travers l’exemple
26/12/2024 Raghda Jouirou 26
ACP à travers l’exemple
Normaliser le vecteur par sa norme (√(x² + y²) )pour obtenir un vecteur unitaire car on
cherche une base orthonormée √(1² + 2²) = √(5)
26/12/2024 Raghda Jouirou 27
ACP à travers l’exemple
26/12/2024 Raghda Jouirou 28
ACP à travers l’exemple
Projections des données par rapports les nouvelles projections trouvées.
Calcul de produit matriciel entre les données centrées avec les
composantes calculées au paravent ce qui va donner une nouvelle
projection => Ces sont les points a projeter sur les axes CP1, CP2.
Les valeurs propres représentent la quantité de variance expliquée par
chaque composante.
26/12/2024 Raghda Jouirou 29
ACP à travers l’exemple
26/12/2024 Raghda Jouirou 30
ACP à travers l’exemple
Calcul de variance de CP1 et CP2
Soit CP1= (2/√5, 1/√5)
Variance de la composante principale (2/√5, 1/√5) =
Var(PC)=[(2/√5, - moyenne)^2 + (1/√5 - moyenne)^2] / 2
où "moyenne" est la moyenne de ces deux valeurs, dans ce cas,
(2/√5 + 2/√5) / 2
26/12/2024 Raghda Jouirou 31
ACP à travers l’exemple
Pour obtenir la présentation en pourcentage de la variance de PC1 et PC2:
PC1/la somme de la variance de PC1+PC2
PC1 explique 64% de la variance de nos données et PC2 seulement 6%
Projeter nos données sur l’axe avec la variance la plus élevée
26/12/2024 Raghda Jouirou 32
ACP à travers l’exemple
26/12/2024 Raghda Jouirou 33