0% ont trouvé ce document utile (0 vote)
8 vues11 pages

Introduction à l'Analyse en Composantes Principales

1. L'analyse en composantes principales (ACP) est une technique utilisée pour réduire la dimensionnalité de grands ensembles de données en transformant des variables corrélées en un plus petit nombre de variables non corrélées appelées composantes principales. 2. L'ACP implique le calcul des valeurs propres et des vecteurs propres de la matrice de covariance de l'ensemble de données et les utilise pour définir un nouveau système de coordonnées pour les données avec moins de dimensions que l'ensemble de données d'origine. 3. L'ACP est couramment utilisée pour la réduction de dimensionnalité dans l'analyse de données et pour construire des modèles prédictifs en projetant des données de haute dimension dans un espace de dimension inférieure.

Traduit par

ScribdTranslations
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
8 vues11 pages

Introduction à l'Analyse en Composantes Principales

1. L'analyse en composantes principales (ACP) est une technique utilisée pour réduire la dimensionnalité de grands ensembles de données en transformant des variables corrélées en un plus petit nombre de variables non corrélées appelées composantes principales. 2. L'ACP implique le calcul des valeurs propres et des vecteurs propres de la matrice de covariance de l'ensemble de données et les utilise pour définir un nouveau système de coordonnées pour les données avec moins de dimensions que l'ensemble de données d'origine. 3. L'ACP est couramment utilisée pour la réduction de dimensionnalité dans l'analyse de données et pour construire des modèles prédictifs en projetant des données de haute dimension dans un espace de dimension inférieure.

Traduit par

ScribdTranslations
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Analyse en Composantes Principales

Mémoire pour l'extraction de données et l'entreposage de données

Guidé par :

Mme Rosy Das (Sarmah)

Professeur associé

Département d'informatique

Submitted by:

Soma Sarkar (CSB07012)

Rohit Kashyap (CSB07014)


INTRODUCTION :
L'analyse en composantes principales (ACP) implique une procédure mathématique qui transforme un
nombre de variables potentiellement corrélées en un nombre de variables non corrélées appelées
composantes principales, liées aux variables d'origine par untransformée orthogonaletsur.

Cette transformation est définie de telle sorte que le premier composant principal ait un aussi haut un
variancedans la mesure du possible (c'est-à-dire, tenant compte autant que possible de la variabilité des données),
et chaque composant suivant a à son tour la plus grande variance possible sous le
contrainte qu'elle soit orthogonale aux composants précédents. L'ACP est sensible au
mise à l'échelle relative des variables originales.

Selon le domaine d'application, il est également nommé le discretKarhunen–Loève


transformer (KLT), leHotellingtransformation ou décomposition orthogonale propre (POD).

La PCA a été inventée en 1901 parKarl PearsonMaintenant, il est principalement utilisé comme un outil dansexploratoire
analyse des donnéeset
pour faireprédiretmodèles ve. PCA peut être fait pareigenvalue
décomposétsurd'une donnéematrice de covarianceoudécomposition en valeurs singulièrestsurd'unmatrice de données,
en général après avoir centré les données de chaque attribut. Les résultats d'une ACP sont généralement
discuté en termes de scores de composant (les valeurs de variables transformées correspondant à un
cas particulier dans les données) et chargements (la variance que chaque variable d'origine aurait si
les données ont été projetées sur un axe ACP donné).

L'ACP est la plus simple des véritables analyses multivariées basées sur les vecteurs propres. Souvent, son opération
peut être considéré comme révélant la structure interne des données d'une manière qui explique le mieux
la variance dans les données. Si un ensemble de données multivariées est visualisé comme un ensemble de coordonnées dans un

haut-dimensionnelespace de données (1 axe par variable), l'ACP peut fournir à l'utilisateur une réduction de
image dimensionnelle, une "ombre" de cet objet lorsqu'il est vu sous son angle (dans un certain sens) le plus
point de vue informatif. Cela se fait en n'utilisant que les premiers composants principaux afin que
la dimensionnalité des données transformées est réduite.

L'ACP est étroitement liée àanalyse factorielle, en effet, certains packages statistiques délibérément
fusionner les deux techniques. La véritable analyse factorielle fait des hypothèses différentes sur le
structure sous-jacente et résout les vecteurs propres d'une matrice légèrement différente.
OBJECTIFS DE L'ANALYSE EN COMPOSANTES PRINCIPALES :

1. Découvrir ou réduire la dimensionalité de l'ensemble de données.


2. Identifier de nouvelles variables sous-jacentes significatives.

L'ACP est mathématiquement définie comme unorthogonaltransformation linéairetsurqui


transforme le
données à un nouveausystème de coordonnéestel que la plus grande variance par toute projection de la
les données viennent à se situer sur la première coordonnée (appelée la première composante principale), la deuxième
la plus grande variance sur la deuxième coordonnée, et ainsi de suite.

Données de Foramatrice,XT, avec zéromoyenne empirique(la moyenne empirique de la distribution a


été soustrait de l'ensemble de données), où chacune des lignes représente une répétition différente
de l'expérience, et chacune de ces colonnes donne un type particulier de donnée.

La transformation PCA est alors donnée par :

où les matrices W, Σ et V sont données par adécomposition en valeurs singulièrestsur(SVD) de


XasW Σ VT.Σest une matrice anm-diagonale avec des nombres réels non négatifs sur le
diagonal.

Étant donné un ensemble de points dansespace euclidien,

[Link] premier composant principal (l'éigenvecteur avec la plus grande valeur propre)
correspond à une ligne qui passe par la moyenne et minimisesomme des carrés
error avec ces points.

2. Le deuxième composant principal correspond au même concept après tout


la corrélation avec le premier composant principal a été soustraite de
points.

Chaque valeur propre est proportionnelle à la portion de la "variance" qui est corrélée avec chacune.
vecteur propre. La somme de toutes les valeurs propres est égale à la somme des distances au carré de
les points de leur moyenne multidimensionnelle.

L'ACP fait essentiellement pivoter l'ensemble des points autour de leur moyenne afin de s'aligner avec le premier
quelques composants principaux. Cela déplace autant que possible de la variance (en utilisant un linéaire
transformation) dans les premières dimensions. Les valeurs dans les dimensions restantes,
par conséquent, tendent à être fortement corrélés et peuvent être supprimés avec une perte minimale de
L'ACP est souvent utilisée de cette manière pourréduction de dimensionalitétsur.

Cependant,Réduction non linéaire de dimensionnalitétsurles techniques ont tendance à être plus computationnelles
exigeant que le PCA.

L'ACP est sensible à l'échelle des variables.

MATHEMATIQUE DE BASE IMPLIQUÉE :


La soustraction de la moyenne (c'est-à-dire le "centrage de la moyenne") est nécessaire pour effectuer l'ACP afin de garantir que le
la première composante principale décrit la direction de la variance maximale. Si la soustraction de la moyenne est
non effectué, le premier composant principal pourrait plutôt correspondre plus ou moins au
la moyenne des données. Une moyenne de zéro est nécessaire pour trouver une base qui minimise lesignifie
erreur quadratiquede l'approximation des données.

En supposant zéromoyenne empirique(la moyenne empirique de la distribution a été soustraite


à partir de l'ensemble de données), le composant principal1d'un ensemble de données X peut être défini comme :

Avec les k−1 premières composantes, la k-ième composante peut être trouvée en soustrayant les k−1 premières
composantes principales de X :

et en substituant cela comme le nouvel ensemble de données pour trouver une composante principale dans

La transformée de Karhunen–Loève est donc équivalente à la recherche devaleur singulière


décomposétsurde la matrice de données X,

et ensuite obtenir la matrice de données à espace réduit Y en projetant X dans l'espace réduit
espace défini uniquement par les premiers vecteurs singuliers, WL:
La matrice W des vecteurs singuliers de X est équivalente à la matrice W des vecteurs propres de la
matrice des covariances observées C=X XT,

TABLEAUX DE SYMBOLES ET D'ABBRÉVIATIONS :

Symbole Signification Dimensions Indices


matrice de données, composée de l'ensemble de tous
vecteurs de données, un vecteur par colonne
le nombre de vecteurs colonnes dans les données
scalaire
ensemble
le nombre d'éléments dans chaque colonne
scalaire
vecteur (dimension)
le nombre de dimensions dans le
sous-espace dimensionnellement réduit scalaire

vecteur d'empiriquesignifie, un moyen pour


chaque ligne de la matrice de données
vecteur empiriqueécarts types,
un écart type pour chaque ligne
la matrice de données
vecteur de tous les 1
écartsde la moyenne de chaque ligne
de la matrice de données
scores z, calculé en utilisant la moyenne et
écart type pour chaque ligne de la
matrice de données

matrice de covariance

matrice de corrélation

matrice constituée de l'ensemble de tous


vecteurs propresbien sûr, un vecteur propre par
colonne
matrice diagonalecomposé de l'ensemble de
toutvaleurs propresdeCalong sesprincipal
diagonal, et 0 pour tous les autres éléments

matrice de vecteurs de base, un vecteur par


colonne, où chaque vecteur de base est un
duvecteurs propresbien sûr, et où
les vecteurs dans Ware sont un sous-ensemble de ceux dans
V
matrice composée de N vecteurs colonnes,
où chaque vecteur est la projection de
le vecteur de données correspondant de
matriceXonto les vecteurs de base
contenu dans les colonnes de la matrice W.

HYPOTHÈSES :
La dérivation de l'ACP est basée sur les hypothèses suivantes :

Hypothèse sur la linéarité

Nous avons supposé que l'ensemble de données observé étaitcombinaison linéairetonsde


certaines bases. Non-
méthodes linéaires telles quePCA par noyauont été développés sans supposer de linéarité.

Mesure de niveau d'intervalle

Toutes les variables analysées doivent être évaluées à un niveau d'intervalle ou de rapport.
mesure.

Échantillonnage aléatoire

Chaque sujet contribuera par un score sur chaque variable observée. Ces ensembles de
Les scores devraient représenter un échantillon aléatoire tiré de la population d'intérêt.

Distributions Normales

Chaque variable observée doit être distribuée normalement. Les variables qui démontrent
une asymétrie ou une kurtose marquée peut être transformée pour mieux approcher la normalité.

Distribution normale bivariée

Chaque paire de variables observées devrait afficher une distribution normale bivariée ; par exemple,
ils devraient former un nuage de points elliptique lorsqu'ils sont tracés.

Méthodes de calcul de l'ACP :


Étape I : Obtenez les données

Nous prenons n'importe quel ensemble de données. Dans cet exemple, nous prenons un ensemble de données en 2 dimensions. Cela est fait

afin que le traçage puisse être démontré.

Étape II : Soustraire la moyenne

Pour que l'ACP fonctionne correctement, nous devons soustraire la moyenne de chacune des données.
les dimensions. La moyenne soustraite est la moyenne de chaque dimension. Donc, tous lesx
values havex(the mean of thexvalues of all the data points) subtracted, and all the
Les valeurs y ont été soustraites. Cela produit un ensemble de données dont la moyenne est zéro.

Données DataAdjust
x y x y
2,5 2.4 .69 .49
0,5 0,7 -1,31 -1,21
2,2 2.9 .39 .99
1.9 2.2 .09 .29
3.1 3.0 1,29 1,09
2.3 2.7 .49 .79
2 1,6 .19 -0,31
1 1.1 -0,81 -0,81
1,5 1.6 -0,31 -0,31
1.1 0,9 -0,71 -1,01
Fig : Graphique des données

Étape III : Calculer la matrice de covariance

La covariance peut être calculée par la formule

oùCnxnest une matrice avec n lignes et n colonnes, et Dimxest la xème dimension. Le


la matrice de covariance pour 2 dimensions peut donc être trouvée par

C=

La matrice de covariance pour l'ensemble de données ci-dessus serait


Étape IV : Calculez les vecteurs propres et les valeurs propres de la matrice de covariance

Calculez la matrice V devecteurs propreslequeldiagonalisela matrice de covariance C

whereDis thematrice diagonaledevaleurs propresdeC.

Par ce processus de prise des vecteurs propres de la matrice de covariance, nous avons été
capable d'extraire des lignes qui caractérisent les données. Le reste des étapes implique
transformer les données afin qu'elles soient exprimées en termes de lignes.

Étape V : Choisir des composants et former un vecteur de caractéristiques

Here is where the noton of data compression and reduced dimensionality comes
dans cela. Une fois les vecteurs propres trouvés à partir de la matrice de covariance, l'étape suivante est de
classez-les par valeur propre, de la plus élevée à la plus basse. Cela nous donne les composants dans l'ordre.
de significance. Nous pouvons également décider d'ignorer les composants de moindre significance.
Le vecteur caractéristique est construit en prenant les vecteurs propres que nous souhaitons conserver.
à partir de la liste des vecteurs propres, et en formant une matrice avec ces vecteurs propres dans le
colonnes.

Dans notre exemple de jeu de données, et le fait que nous avons 2 vecteurs propres, nous avons deux
Nous pouvons soit former un vecteur de caractéristiques avec les deux vecteurs propres :

ou, nous pouvons choisir de laisser de côté le composant plus petit, moins significatif et n'avoir que
une seule colonne :
Fig : Un graphique des données normalisées (moyenne
soustrait) avec les vecteurs propres de la
matrice de covariance superposée en haut.

Étape VI : Dérivation du nouveau jeu de données

Une fois que nous avons choisi les composants (vecteurs propres) que nous souhaitons conserver dans notre
données et a formé un vecteur de caractéristiques, nous prenons simplement la transposée du vecteur et
multipliez-le à gauche de l'ensemble de données original, transposé.

WhereRowFeatureVector est la matrice avec les vecteurs propres dans les colonnes
transposés de sorte que les vecteurs propres sont maintenant dans les lignes, avec les plus significatifs
vecteur propre en haut, et RowDataAdjust est les données ajustées par la moyenne transposées,
c'est-à-dire que les éléments de données se trouvent dans chaque colonne, chaque ligne contenant une dimension séparée.
FinalData est le jeu de données final, avec des éléments de données dans les colonnes et des dimensions le long.

lignes.

RELATION ENTRE PCA ET CLUSTERING K-MEANS :


Il a été démontré récemment (2007)[12][13] que la solution relaxée deClustering K-means ,
spécifié par les indicateurs de cluster, est donné par les composantes principales de l'ACP, et l'ACP
le sous-espace engendré par les directions principales est identique au sous-espace du centroïde du cluster
spécifié par la classe entrescatmatrice d'erAinsi, l'ACP projette automatiquement vers le
sous-espace où se trouve la solution globale du clustering K-means, et ainsi faciliter K-means
regroupement pour trouver des solutions quasi optimales
CONCLUSION:
L'analyse en composantes principales est un outil puissant pour réduire le nombre de variables observées.
en un nombre plus petit de variables artificielles qui rendent compte de la plupart de la variance dans le
ensemble de données. Il est particulièrement utilisé lorsque nous avons besoin d'une procédure de réduction de données qui ne fait pas

hypothèses concernant une structure causale sous-jacente qui est responsable de la covariation dans
les données. Lorsqu'il est possible de postuler l'existence d'un tel causal sous-jacent
Dans ce cas, il peut être plus approprié d'analyser les données en utilisant une analyse factorielle exploratoire.

À la fois l'ACP et l'analyse factorielle sont souvent utilisées pour construire des échelles à plusieurs éléments à partir des éléments.

qui constituent des questionnaires. Peu importe la méthode utilisée, une fois que ces échelles ont été
Étant donné qu'il a été développé, il est souvent souhaitable d'évaluer leur fiabilité en calculant le coefficient.

alpha : un indice de la fiabilité de cohérence interne.

Vous aimerez peut-être aussi