Introduction à l'Analyse en Composantes Principales
Introduction à l'Analyse en Composantes Principales
Guidé par :
Professeur associé
Département d'informatique
Submitted by:
Cette transformation est définie de telle sorte que le premier composant principal ait un aussi haut un
variancedans la mesure du possible (c'est-à-dire, tenant compte autant que possible de la variabilité des données),
et chaque composant suivant a à son tour la plus grande variance possible sous le
contrainte qu'elle soit orthogonale aux composants précédents. L'ACP est sensible au
mise à l'échelle relative des variables originales.
La PCA a été inventée en 1901 parKarl PearsonMaintenant, il est principalement utilisé comme un outil dansexploratoire
analyse des donnéeset
pour faireprédiretmodèles ve. PCA peut être fait pareigenvalue
décomposétsurd'une donnéematrice de covarianceoudécomposition en valeurs singulièrestsurd'unmatrice de données,
en général après avoir centré les données de chaque attribut. Les résultats d'une ACP sont généralement
discuté en termes de scores de composant (les valeurs de variables transformées correspondant à un
cas particulier dans les données) et chargements (la variance que chaque variable d'origine aurait si
les données ont été projetées sur un axe ACP donné).
L'ACP est la plus simple des véritables analyses multivariées basées sur les vecteurs propres. Souvent, son opération
peut être considéré comme révélant la structure interne des données d'une manière qui explique le mieux
la variance dans les données. Si un ensemble de données multivariées est visualisé comme un ensemble de coordonnées dans un
haut-dimensionnelespace de données (1 axe par variable), l'ACP peut fournir à l'utilisateur une réduction de
image dimensionnelle, une "ombre" de cet objet lorsqu'il est vu sous son angle (dans un certain sens) le plus
point de vue informatif. Cela se fait en n'utilisant que les premiers composants principaux afin que
la dimensionnalité des données transformées est réduite.
L'ACP est étroitement liée àanalyse factorielle, en effet, certains packages statistiques délibérément
fusionner les deux techniques. La véritable analyse factorielle fait des hypothèses différentes sur le
structure sous-jacente et résout les vecteurs propres d'une matrice légèrement différente.
OBJECTIFS DE L'ANALYSE EN COMPOSANTES PRINCIPALES :
[Link] premier composant principal (l'éigenvecteur avec la plus grande valeur propre)
correspond à une ligne qui passe par la moyenne et minimisesomme des carrés
error avec ces points.
Chaque valeur propre est proportionnelle à la portion de la "variance" qui est corrélée avec chacune.
vecteur propre. La somme de toutes les valeurs propres est égale à la somme des distances au carré de
les points de leur moyenne multidimensionnelle.
L'ACP fait essentiellement pivoter l'ensemble des points autour de leur moyenne afin de s'aligner avec le premier
quelques composants principaux. Cela déplace autant que possible de la variance (en utilisant un linéaire
transformation) dans les premières dimensions. Les valeurs dans les dimensions restantes,
par conséquent, tendent à être fortement corrélés et peuvent être supprimés avec une perte minimale de
L'ACP est souvent utilisée de cette manière pourréduction de dimensionalitétsur.
Cependant,Réduction non linéaire de dimensionnalitétsurles techniques ont tendance à être plus computationnelles
exigeant que le PCA.
Avec les k−1 premières composantes, la k-ième composante peut être trouvée en soustrayant les k−1 premières
composantes principales de X :
et en substituant cela comme le nouvel ensemble de données pour trouver une composante principale dans
et ensuite obtenir la matrice de données à espace réduit Y en projetant X dans l'espace réduit
espace défini uniquement par les premiers vecteurs singuliers, WL:
La matrice W des vecteurs singuliers de X est équivalente à la matrice W des vecteurs propres de la
matrice des covariances observées C=X XT,
matrice de covariance
matrice de corrélation
HYPOTHÈSES :
La dérivation de l'ACP est basée sur les hypothèses suivantes :
Toutes les variables analysées doivent être évaluées à un niveau d'intervalle ou de rapport.
mesure.
Échantillonnage aléatoire
Chaque sujet contribuera par un score sur chaque variable observée. Ces ensembles de
Les scores devraient représenter un échantillon aléatoire tiré de la population d'intérêt.
Distributions Normales
Chaque variable observée doit être distribuée normalement. Les variables qui démontrent
une asymétrie ou une kurtose marquée peut être transformée pour mieux approcher la normalité.
Chaque paire de variables observées devrait afficher une distribution normale bivariée ; par exemple,
ils devraient former un nuage de points elliptique lorsqu'ils sont tracés.
Nous prenons n'importe quel ensemble de données. Dans cet exemple, nous prenons un ensemble de données en 2 dimensions. Cela est fait
Pour que l'ACP fonctionne correctement, nous devons soustraire la moyenne de chacune des données.
les dimensions. La moyenne soustraite est la moyenne de chaque dimension. Donc, tous lesx
values havex(the mean of thexvalues of all the data points) subtracted, and all the
Les valeurs y ont été soustraites. Cela produit un ensemble de données dont la moyenne est zéro.
Données DataAdjust
x y x y
2,5 2.4 .69 .49
0,5 0,7 -1,31 -1,21
2,2 2.9 .39 .99
1.9 2.2 .09 .29
3.1 3.0 1,29 1,09
2.3 2.7 .49 .79
2 1,6 .19 -0,31
1 1.1 -0,81 -0,81
1,5 1.6 -0,31 -0,31
1.1 0,9 -0,71 -1,01
Fig : Graphique des données
C=
Par ce processus de prise des vecteurs propres de la matrice de covariance, nous avons été
capable d'extraire des lignes qui caractérisent les données. Le reste des étapes implique
transformer les données afin qu'elles soient exprimées en termes de lignes.
Here is where the noton of data compression and reduced dimensionality comes
dans cela. Une fois les vecteurs propres trouvés à partir de la matrice de covariance, l'étape suivante est de
classez-les par valeur propre, de la plus élevée à la plus basse. Cela nous donne les composants dans l'ordre.
de significance. Nous pouvons également décider d'ignorer les composants de moindre significance.
Le vecteur caractéristique est construit en prenant les vecteurs propres que nous souhaitons conserver.
à partir de la liste des vecteurs propres, et en formant une matrice avec ces vecteurs propres dans le
colonnes.
Dans notre exemple de jeu de données, et le fait que nous avons 2 vecteurs propres, nous avons deux
Nous pouvons soit former un vecteur de caractéristiques avec les deux vecteurs propres :
ou, nous pouvons choisir de laisser de côté le composant plus petit, moins significatif et n'avoir que
une seule colonne :
Fig : Un graphique des données normalisées (moyenne
soustrait) avec les vecteurs propres de la
matrice de covariance superposée en haut.
Une fois que nous avons choisi les composants (vecteurs propres) que nous souhaitons conserver dans notre
données et a formé un vecteur de caractéristiques, nous prenons simplement la transposée du vecteur et
multipliez-le à gauche de l'ensemble de données original, transposé.
WhereRowFeatureVector est la matrice avec les vecteurs propres dans les colonnes
transposés de sorte que les vecteurs propres sont maintenant dans les lignes, avec les plus significatifs
vecteur propre en haut, et RowDataAdjust est les données ajustées par la moyenne transposées,
c'est-à-dire que les éléments de données se trouvent dans chaque colonne, chaque ligne contenant une dimension séparée.
FinalData est le jeu de données final, avec des éléments de données dans les colonnes et des dimensions le long.
lignes.
hypothèses concernant une structure causale sous-jacente qui est responsable de la covariation dans
les données. Lorsqu'il est possible de postuler l'existence d'un tel causal sous-jacent
Dans ce cas, il peut être plus approprié d'analyser les données en utilisant une analyse factorielle exploratoire.
À la fois l'ACP et l'analyse factorielle sont souvent utilisées pour construire des échelles à plusieurs éléments à partir des éléments.
qui constituent des questionnaires. Peu importe la méthode utilisée, une fois que ces échelles ont été
Étant donné qu'il a été développé, il est souvent souhaitable d'évaluer leur fiabilité en calculant le coefficient.