TD 1 — Réduction de dimension — DS + DSE — S1 Hicham Janati - hjanati@[Link].
ma
TD 1
Exercice 1 (Rappels de probabilités)
def def
Soit X = (X1 , . . . , Xd )> un vecteur aléatoire en dimension d. On définit µ = E(X) ∈ Rd et S = V(X) ∈
Rd×d . Soit a ∈ Rd , A ∈ Rm×d des éléments déterministes. Déterminez les quantités suivantes en fonction
de µ et S :
1. E(a> X) et V(a> X).
2. E(AX) et V(AX).
3. Montrez que V(X) est toujours une matrice semi-définie positive.
Exercice 2 (PCA : cadre général)
L’énoncé de la PCA ci-dessus est limité : il est défini en fonction des observations (et de n). Le but de
cet exercice est de le généraliser en remplaçant la moyenne empirique par la moyenne d’une variable
aléatoire. Ainsi, la projection obtenue dépendra directement de la distribution de X et non pas des
données. On considère un vecteur aléatoire X en dimension d. On définit la meilleure projection sur un
sous-espace de dimension k par :
E kX − projE (X)k2
min
E
dim(E)=k
1. Montrez que pour k = 1, la solution est donnée par la droite dirigée par le vecteur propre associée
à la plus grande valeur propre de V(X) noté par p1 .
2. Comme dans l’étude, en supposant que l’on peut construire une base orthogonale (p1 , . . . , pk ) de
E de proche en proche, déterminez la solution pour k > 1.
1
TD 1 — Réduction de dimension — DS + DSE — S1 Hicham Janati - hjanati@[Link]
3. Les axes de la base (p1 , . . . , pd ) sont appelés des composantes principales. On pose P la matrice
(de taille d x d) dont les colonnes sont les pi . Soit E un sous-espace de dimension k et x ∈ Rd .
Montrez que les coordonnées de projE (x) dans la base (p1 , . . . , pk ) sont données par P[:, : k]> x.
4. Comment peut-on estimer P en pratique à partir de n observations vectorielles x1 , . . . , xn ?
5. On note comme d’habitude X la matrice dont les lignes sont les observations x1 , . . . , xn . Montrez
que la matrice dont les lignes sont les projections projE (xi ) est donnée par XP[:, : k].
Définition : PCA à k composantes principales
Soit P la matrice des vecteurs propres de V(X). On définit la PCA à k composantes de X appliquée
à un vecteur x ∈ Rd par : PCAk (x) = P[:, : k]> x.
Exercice 3 (PCA et variance retenue)
On se place dans le cadre ci-dessus. Le but de cet exercice est de vous montrer un avantage de la
PCA autre que la réduction de dimension : la maximisation de la variance retenue. On note le vecteur
aléatoire en fonction de ses composantes : X = (X1 , . . . , Xd )> . La variance totale (théorique) est définie
def P
par Vtotale (X) = di=1 V(Xi ) ∈ R+ . On définit le vecteur aléatoire Y = PCAd (X) de dimension d donné
par la transformation PCA de l’exercice 2 avec k = d.
1. Calculez la variance V(Y). Que pouvez-vous en déduire concernant les composantes de Y ?
2. Comparez les variances totales Vtotale (X) et Vtotale (Y).
On rappelle que pour toutes matrices A, B : trace(AB) = trace(BA).
3. On suppose à présent 1 ≤ k ≤ d. Déterminez le pourcentage de variance totale retenue dans la
projection en fonction des valeurs propres de V(X).
4. Intuitivement, si k = d, on peut être mené à penser que “la meilleure projection d’un point x est
lui-même, donc X ne devrait pas changer ”. Avec quelle condition sur le vecteur aléatoire X (ou
les données X) ceci est-il vrai ?
Exercice 4 (PCA comme maximisation de la variance)
def
Soit X un vecteur aléatoire dans Rd tel que E(X) = 0. Soit q ∈ Rd∗ avec kqk = 1. On pose Z = q> X.
On rappelle que la projection orthogonale sur Vect(q) est donnée par : x 7→ projq (x) = hq, xiq.
1. Déterminez V(Z).
2. Résoudre le problème d’optimisation :
max V(Z)
q∈Rd∗
kqk=1
3. Comparez avec la transformation PCA1 .
Exercice 5 (PCA comme décorrélation linéaire)
Soit X un vecteur aléatoire dans Rd tel que E(X) = 0. Trouver une matrice A telle que les composantes
def
de Y = AX ne soient pas corrélées.
2
TD 1 — Réduction de dimension — DS + DSE — S1 Hicham Janati - hjanati@[Link]
Exercice 6 (PCA via une SVD)
On se place dans le même cadre d’habitude : X est un vecteur aléaoire centré et X ∈ Rn×d est la matrice
des observations. Jusqu’à présent, nous avons vu que la PCA en pratique passe par la diagonalisation de
la variance empirique Σ̂ = n1 X > X. Le but de cet exercice est de montrer que ceci n’est pas nécessaire.
1. Écrire la décomposition en valeurs singulières (SVD) réduite de X et en déduire Σ̂.
2. On souhaite appliquer une PCA à k composantes. Quelle est la matrice P[:, : k] et le pourcentage
de variance retenue en fonction des éléments de la SVD ?
3. Comment peut-on désormais facilement obtenir les projections données par XP[:, : k] ?
4. Implémentez les deux méthodes en Python et comparez avec les données d’un vecteur Gaussien.