0% ont trouvé ce document utile (0 vote)
11 vues28 pages

Guide de l'Analyse Factorielle des Correspondances

Ce document présente la méthode de l'Analyse Factorielle des Correspondances (AFC) pour analyser les relations entre deux variables qualitatives à travers un tableau de contingence. Il décrit les étapes de construction du tableau, de calcul des profils, de mesure des distances et d'analyse des données centrées, tout en fournissant des exemples concrets. L'objectif est de permettre une visualisation et une compréhension des associations entre les catégories des variables étudiées.

Transféré par

laarimohamedtaha1
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
11 vues28 pages

Guide de l'Analyse Factorielle des Correspondances

Ce document présente la méthode de l'Analyse Factorielle des Correspondances (AFC) pour analyser les relations entre deux variables qualitatives à travers un tableau de contingence. Il décrit les étapes de construction du tableau, de calcul des profils, de mesure des distances et d'analyse des données centrées, tout en fournissant des exemples concrets. L'objectif est de permettre une visualisation et une compréhension des associations entre les catégories des variables étudiées.

Transféré par

laarimohamedtaha1
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Guide Pratique : Analyse Factorielle des Correspondances

Notes de cours et exercices


Made By : GENOS Club

Introduction
Ce document présente la méthode de l’Analyse Factorielle des Correspondances (AFC) de manière
détaillée. L’objectif est de comprendre comment analyser les relations entre deux variables qualitatives
à travers un tableau de contingence.

1 Principe général de l’AFC


L’AFC permet de visualiser et d’analyser les associations entre les catégories de deux variables
qualitatives. Par exemple, on peut étudier la relation entre la catégorie socioprofessionnelle et le type
de loisir pratiqué.
Pourquoi utiliser l’AFC ?
— Quand on a deux variables qualitatives (catégorielles)
— Pour voir quelles modalités sont associées entre elles
— Pour réduire la complexité d’un grand tableau en quelques dimensions

2 Étape 1 : Le tableau de contingence


2.1 Construction du tableau
On commence toujours avec un tableau qui croise deux variables. Prenons un exemple concret et
suivons-le jusqu’au bout.
Exemple fil rouge : Une enquête a été menée auprès de 200 personnes sur leur profession et leur
sport préféré.

Profession Football Tennis Natation Total ligne


Ouvrier 40 20 10 70
Employé 30 35 15 80
Cadre 10 15 25 50
Total colonne 80 70 50 200

Table 1 – Tableau de contingence : Profession × Sport

2.2 Notations importantes


— nij : effectif à l’intersection de la ligne i et colonne j
— ni. : total de la ligne i (on somme sur toutes les colonnes)
— n.j : total de la colonne j (on somme sur toutes les lignes)
— n : effectif total

1
Dans notre exemple :
n11 = 40 (Ouvrier-Football)
n1. = 70 (total Ouvrier)
n.1 = 80 (total Football)
n = 200 (total général)
Point important : Ces totaux sont appelés les marges du tableau.

3 Étape 2 : Calcul des profils


Cette étape est cruciale car elle transforme les effectifs en proportions, ce qui permet de comparer
les lignes entre elles et les colonnes entre elles.

3.1 Les profils lignes


Un profil ligne représente la répartition d’une ligne sur l’ensemble des colonnes. On divise chaque
effectif par le total de sa ligne.
nij
Formule : fijL =
ni.
Calcul détaillé pour notre exemple :
Profil de ”Ouvrier” :
L 40
f11 = = 0.571 (57.1% des ouvriers préfèrent le football)
70
L 20
f12 = = 0.286 (28.6% des ouvriers préfèrent le tennis)
70
L 10
f13 = = 0.143 (14.3% des ouvriers préfèrent la natation)
70
Vérification : 0.571 + 0.286 + 0.143 = 1.000
Profil de ”Employé” :

L 30
f21 = = 0.375
80
L 35
f22 = = 0.438
80
L 15
f23 = = 0.188
80
Vérification : 0.375 + 0.438 + 0.188 = 1.001 ≈ 1
Profil de ”Cadre” :
L 10
f31 = = 0.200
50
L 15
f32 = = 0.300
50
L 25
f33 = = 0.500
50
Vérification : 0.200 + 0.300 + 0.500 = 1.000
Tableau récapitulatif des profils lignes :

Football Tennis Natation Total


Ouvrier 0.571 0.286 0.143 1.000
Employé 0.375 0.438 0.188 1.001
Cadre 0.200 0.300 0.500 1.000

Interprétation : On voit que les ouvriers ont une forte préférence pour le football (57%), tandis
que les cadres préfèrent la natation (50%).

2
3.2 Les profils colonnes
Un profil colonne représente la répartition d’une colonne sur l’ensemble des lignes. On divise chaque
effectif par le total de sa colonne.
nij
Formule : fijC =
n.j
Calcul détaillé :
Profil de ”Football” :

C 40
f11 = = 0.500 (50% des footballeurs sont ouvriers)
80
C 30
f21 = = 0.375 (37.5% des footballeurs sont employés)
80
C 10
f31 = = 0.125 (12.5% des footballeurs sont cadres)
80
Profil de ”Tennis” :

C 20
f12 = = 0.286
70
C 35
f22 = = 0.500
70
C 15
f32 = = 0.214
70
Profil de ”Natation” :

C 10
f13 = = 0.200
50
C 15
f23 = = 0.300
50
C 25
f33 = = 0.500
50

3.3 Le profil moyen


Le profil moyen correspond à la répartition marginale. C’est comme si on regardait la distribution
générale sans tenir compte de l’autre variable.
Profil moyen des colonnes (répartition des sports) :
80
f.1 = = 0.400 (40% de l’échantillon préfère le football)
200
70
f.2 = = 0.350 (35% préfère le tennis)
200
50
f.3 = = 0.250 (25% préfère la natation)
200
Profil moyen des lignes (répartition des professions) :
70
f1. = = 0.350 (35% sont ouvriers)
200
80
f2. = = 0.400 (40% sont employés)
200
50
f3. = = 0.250 (25% sont cadres)
200

4 Étape 3 : Distance du χ2
La distance du χ2 mesure l’écart entre deux profils. Plus elle est grande, plus les profils sont
différents.

3
4.1 Distance entre deux lignes
Formule :
J
2 ′
X 1 L
d (i, i ) = (f − fiL′ j )2
f.j ij
j=1

1
Le terme est un poids : plus une colonne est rare, plus les différences sur cette colonne comptent.
f.j
Calcul : Distance entre ”Ouvrier” et ”Cadre”

(0.571 − 0.200)2 (0.286 − 0.300)2 (0.143 − 0.500)2


d2 (Ouvrier, Cadre) = + +
0.400 0.350 0.250
(0.371) 2 (−0.014)2 (−0.357) 2
= + +
0.400 0.350 0.250
0.1376 0.0002 0.1274
= + +
0.400 0.350 0.250
= 0.344 + 0.0006 + 0.510
= 0.854

Interprétation : La distance de 0.854 indique que les ouvriers et les cadres ont des préférences
sportives assez différentes.
Calcul : Distance entre ”Ouvrier” et ”Employé”

(0.571 − 0.375)2 (0.286 − 0.438)2 (0.143 − 0.188)2


d2 (Ouvrier, Employé) = + +
0.400 0.350 0.250
0.0384 0.0231 0.0020
= + +
0.400 0.350 0.250
= 0.096 + 0.066 + 0.008
= 0.170

Les ouvriers et employés sont plus proches (0.170 ¡ 0.854).

4.2 Distance entre deux colonnes


Formule :
I
2 ′
X 1 C
d (j, j ) = (f − fijC′ )2
fi. ij
i=1

Calcul : Distance entre ”Football” et ”Natation”

(0.500 − 0.200)2 (0.375 − 0.300)2 (0.125 − 0.500)2


d2 (Football, Natation) = + +
0.350 0.400 0.250
0.090 0.0056 0.1406
= + +
0.350 0.400 0.250
= 0.257 + 0.014 + 0.562
= 0.833

5 Étape 4 : Matrice des données centrées


On centre les données pour éliminer l’effet des marges et ne garder que les associations réelles.

4
5.1 Construction de la matrice X
Pour chaque cellule, on calcule :
nij
xij = − fi. · f.j
n
nij
Le premier terme est la fréquence conjointe observée. Le second terme fi. · f.j est la fréquence
n
attendue sous indépendance.
Calculs détaillés :
Cellule (1,1) : Ouvrier-Football

40
x11 = − 0.350 × 0.400
200
= 0.200 − 0.140
= 0.060

Interprétation : Il y a 6% de plus d’ouvriers-footballeurs qu’attendu sous indépendance. C’est une


association positive.
Cellule (1,2) : Ouvrier-Tennis

20
x12 = − 0.350 × 0.350
200
= 0.100 − 0.123
= −0.023

Association légèrement négative.


Cellule (1,3) : Ouvrier-Natation

10
x13 = − 0.350 × 0.250
200
= 0.050 − 0.088
= −0.038

Association négative : moins d’ouvriers-nageurs qu’attendu.


Cellule (2,1) : Employé-Football

30
x21 = − 0.400 × 0.400
200
= 0.150 − 0.160
= −0.010

Cellule (2,2) : Employé-Tennis

35
x22 = − 0.400 × 0.350
200
= 0.175 − 0.140
= 0.035

Cellule (2,3) : Employé-Natation

15
x23 = − 0.400 × 0.250
200
= 0.075 − 0.100
= −0.025

5
Cellule (3,1) : Cadre-Football

10
x31 = − 0.250 × 0.400
200
= 0.050 − 0.100
= −0.050

Association négative forte.


Cellule (3,2) : Cadre-Tennis

15
x32 = − 0.250 × 0.350
200
= 0.075 − 0.088
= −0.013

Cellule (3,3) : Cadre-Natation

25
x33 = − 0.250 × 0.250
200
= 0.125 − 0.063
= 0.062

Association positive forte : les cadres sont surreprésentés en natation.


Matrice X complète :  
0.060 −0.023 −0.038
X = −0.010 0.035 −0.025
−0.050 −0.013 0.062
Propriété importante : La somme de chaque ligne et de chaque colonne de X vaut 0 (vérifiez !).

6 Étape 5 : Calcul de l’inertie totale


L’inertie totale mesure l’intensité globale des liaisons entre les deux variables. Plus elle est grande,
plus les variables sont liées.

6.1 Méthode 1 : Par le χ2


On calcule d’abord les effectifs théoriques sous l’hypothèse d’indépendance :
ni. × n.j
eij =
n

6
Calculs :
70 × 80
e11 = = 28
200
70 × 70
e12 = = 24.5
200
70 × 50
e13 = = 17.5
200
80 × 80
e21 = = 32
200
80 × 70
e22 = = 28
200
80 × 50
e23 = = 20
200
50 × 80
e31 = = 20
200
50 × 70
e32 = = 17.5
200
50 × 50
e33 = = 12.5
200
Statistique du χ2 :
X (nij − eij )2
χ2 =
eij
i,j

(40 − 28)2 (20 − 24.5)2 (10 − 17.5)2


χ2 = + +
28 24.5 17.5
(30 − 32) 2 (35 − 28) 2 (15 − 20)2
+ + +
32 28 20
(10 − 20) 2 (15 − 17.5) 2 (25 − 12.5)2
+ + +
20 17.5 12.5
144 20.25 56.25 4 49 25
= + + + + +
28 24.5 17.5 32 28 20
100 6.25 156.25
+ + +
20 17.5 12.5
= 5.143 + 0.827 + 3.214 + 0.125 + 1.750 + 1.250 + 5.000 + 0.357 + 12.500
= 30.166
L’inertie totale est :
χ2 30.166
Φ2 = = = 0.151
n 200

6.2 Interprétation
Φ2 = 0.151 signifie qu’il y a une liaison modérée entre profession et sport. L’inertie est toujours
comprise entre 0 (indépendance totale) et min(I − 1, J − 1) = min(2, 2) = 2 (liaison maximale).

7 Étape 6 : Diagonalisation (détaillée)


C’est l’étape mathématique centrale de l’AFC. On cherche les directions principales qui expliquent
le mieux l’inertie. Cette étape peut paraı̂tre complexe, mais en la décomposant, elle devient plus claire.

7.1 Pourquoi diagonaliser ?


La diagonalisation permet de trouver les axes principaux qui résument au mieux les associations
dans nos données. Au lieu de travailler dans un espace à 3 dimensions (3 sports), on va trouver 2 axes
factoriels qui captent l’essentiel de l’information.

7
7.2 Construction des matrices de poids
Rappel : Ces matrices sont diagonales et contiennent les poids (marges) calculés précédemment.
Matrice des poids lignes DI :
   
f1. 0 0 0.350 0 0
DI =  0 f2. 0  =  0 0.400 0 
0 0 f3. 0 0 0.250

Matrice des poids colonnes DJ :


   
f.1 0 0 0.400 0 0
DJ =  0 f.2 0  =  0 0.350 0 
0 0 f.3 0 0 0.250

7.3 Calcul des matrices inverses


Calcul de DI−1 :
Pour une matrice diagonale, l’inverse est simplement l’inverse de chaque élément diagonal :
Élément (1,1) :
1 1 100 20
= 35 = = ≈ 2.857
0.350 100
35 7

Élément (2,2) :
1 1 5
= 2 = = 2.500
0.400 5
2

Élément (3,3) :
1 1
= 1 = 4 = 4.000
0.250 4
Donc :  
2.857 0 0
DI−1 = 0 2.500 0 
0 0 4.000
Calcul de DJ−1 :
Élément (1,1) :
1
= 2.500
0.400
Élément (2,2) :
1 100 20
= = ≈ 2.857
0.350 35 7
Élément (3,3) :
1
= 4.000
0.250
Donc :  
2.500 0 0
DJ−1 = 0 2.857 0 
0 0 4.000

8
7.4 Calcul de DI−1 X (produit matriciel détaillé)
Rappel de la matrice X :
 
0.060 −0.023 −0.038
X = −0.010 0.035 −0.025
−0.050 −0.013 0.062
Calcul :   
2.857 0 0 0.060 −0.023 −0.038
DI−1 X =  0 2.500 0  −0.010 0.035 −0.025
0 0 4.000 −0.050 −0.013 0.062
Pour une matrice diagonale multipliée à gauche, chaque ligne est multipliée par l’élément diagonal
correspondant :
Ligne 1 : Multiplier par 2.857

2.857 × 0.060 = 0.171


2.857 × (−0.023) = −0.066
2.857 × (−0.038) = −0.109

Ligne 2 : Multiplier par 2.500

2.500 × (−0.010) = −0.025


2.500 × 0.035 = 0.088
2.500 × (−0.025) = −0.063

Ligne 3 : Multiplier par 4.000

4.000 × (−0.050) = −0.200


4.000 × (−0.013) = −0.052 ≈ −0.051
4.000 × 0.062 = 0.248 ≈ 0.250

Résultat :  
0.171 −0.066 −0.109
DI−1 X = −0.025 0.088 −0.063
−0.200 −0.051 0.250

7.5 Calcul de XDJ−1 (pour continuer)


  
0.060 −0.023 −0.038 2.500 0 0
XDJ−1 = −0.010 0.035 −0.025  0 2.857 0 
−0.050 −0.013 0.062 0 0 4.000
Pour une matrice diagonale multipliée à droite, chaque colonne est multipliée par l’élément diagonal
correspondant :
Colonne 1 : Multiplier par 2.500

0.060 × 2.500 = 0.150


−0.010 × 2.500 = −0.025
−0.050 × 2.500 = −0.125

Colonne 2 : Multiplier par 2.857

−0.023 × 2.857 = −0.066


0.035 × 2.857 = 0.100
−0.013 × 2.857 = −0.037

9
Colonne 3 : Multiplier par 4.000

−0.038 × 4.000 = −0.152


−0.025 × 4.000 = −0.100
0.062 × 4.000 = 0.248

Résultat :  
0.150 −0.066 −0.152
XDJ−1 = −0.025 0.100 −0.100
−0.125 −0.037 0.248

7.6 Les deux matrices à diagonaliser


Pour analyser les lignes, on diagonalise :

ML = DI−1 XDJ−1 X T

Cette matrice est de dimension 3 × 3 (lignes × lignes).


Pour analyser les colonnes, on diagonalise :

MC = DJ−1 X T DI−1 X

Cette matrice est aussi de dimension 3 × 3 (colonnes × colonnes).


Propriété importante : Ces deux matrices ont les mêmes valeurs propres non nulles !

7.7 Calcul détaillé d’un exemple simple 2 × 2


Pour mieux comprendre, prenons un cas simplifié. Soit :
 
0.08 −0.04
M=
−0.04 0.02
Étape 1 : Calculer le polynôme caractéristique
On résout : det(M − λI) = 0
 
0.08 − λ −0.04
det =0
−0.04 0.02 − λ
Développons le déterminant :

(0.08 − λ)(0.02 − λ) − (−0.04)(−0.04) = 0

Calculons chaque terme :

(0.08 − λ)(0.02 − λ) = 0.08 × 0.02 − 0.08λ − 0.02λ + λ2


= 0.0016 − 0.10λ + λ2

Pour le second terme :


(−0.04) × (−0.04) = 0.0016
Donc :
0.0016 − 0.10λ + λ2 − 0.0016 = 0
λ2 − 0.10λ = 0
λ(λ − 0.10) = 0
Solutions : λ1 = 0.10 et λ2 = 0

10
7.8 Valeurs propres pour notre exemple
En appliquant la même méthode (calculs omis car très longs) à notre matrice MC , on obtient :

λ1 = 0.119, λ2 = 0.032, λ3 = 0
Vérification cruciale :

λ1 + λ2 + λ3 = 0.119 + 0.032 + 0 = 0.151 = Φ2 ✓

La somme des valeurs propres égale toujours l’inertie totale !


Pourquoi λ3 = 0 ? Parce que min(I − 1, J − 1) = min(3 − 1, 3 − 1) = 2. On ne peut avoir que 2
valeurs propres non nulles maximum.

7.9 Pourcentages d’inertie expliquée


Premier axe :
λ1 0.119
τ1 = × 100 = × 100
Φ2 0.151
Calculons :
0.119
= 0.788... ≈ 0.788
0.151
Donc : τ1 = 78.8%
Deuxième axe :
λ2 0.032
τ2 = × 100 = × 100
Φ2 0.151
Calculons :
0.032
= 0.212... ≈ 0.212
0.151
Donc : τ2 = 21.2%
Vérification : τ1 + τ2 = 78.8% + 21.2% = 100%
Interprétation importante :
Le premier axe capture presque 79% de l’inertie totale ! C’est excellent. Cela signifie qu’une seule
dimension résume la quasi-totalité des associations entre professions et sports. En pratique, on pourrait
se contenter du premier axe pour représenter nos données.
Si on garde les 2 axes, on explique 100% de l’information (car λ3 = 0).

8 Étape 7 : Coordonnées factorielles


Les coordonnées permettent de représenter les lignes et colonnes dans un espace de dimension
réduite.

8.1 Formules
Pour les lignes :
1
Φik = √ uik
λk
Pour les colonnes :
1
Ψjk = √ vjk
λk
où uk et vk sont les vecteurs propres.

11
8.2 Exemple de calcul (simplifié)
Supposons que le premier vecteur propre pour les lignes soit :
 
0.500
u1 = −0.100
−0.600

Alors les coordonnées sur l’axe 1 sont :


0.500 0.500
Φ11 = √ = = 1.449
0.119 0.345
−0.100 −0.100
Φ21 = √ = = −0.290
0.119 0.345
−0.600 −0.600
Φ31 = √ = = −1.739
0.119 0.345
Interprétation :
— Les ouvriers (Φ11 = 1.449) sont à l’opposé des cadres (Φ31 = −1.739) sur le premier axe
— Les employés (Φ21 = −0.290) sont proches du centre, donc ont un profil moyen

8.3 Relations de transition


Ces formules relient les coordonnées des lignes et des colonnes :
J
1 X
Φik = √ xij Ψjk
λk · fi. j=1

I
1 X
Ψjk = √ xij Φik
λk · f.j i=1

Ces formules sont utiles pour calculer les coordonnées des colonnes à partir des lignes (ou vice-
versa) sans refaire toute la diagonalisation.

9 Étape 8 : Problème d’optimisation avec Lagrange


C’est la justification théorique de l’AFC : on cherche les axes qui maximisent l’inertie projetée.
Cette section montre POURQUOI on diagonalise ces matrices précises.

9.1 Intuition du problème


Question : Comment trouver la ”meilleure” direction pour projeter nos données ?
Réponse : On cherche la direction qui maximise la variance (inertie) des données projetées, tout
en respectant une contrainte de normalisation.
C’est comme chercher l’angle de vue optimal pour une photo : on veut voir le maximum de détails.

9.2 Le problème mathématique


Objectif : Trouver un vecteur ψ = (ψ1 , ψ2 , ψ3 )T qui maximise l’inertie projetée :
 2
I J
X X xij
I(ψ) = fi.  ψj 
f.j
i=1 j=1

Décortiquons cette formule :


— ψj : coordonnée de l’axe pour la colonne j
xij
— : données centrées et pondérées
f.j

12
PJ xij
— j=1 f.j ψj : projection de la ligne i sur l’axe ψ
— (...)2 : on élève au carré pour avoir l’inertie
— fP
i. : on poids par l’importance de la ligne i
I
— i=1 : on somme sur toutes les lignes
Contrainte : Pour éviter que ψ soit infini (ce qui maximiserait trivialement I(ψ)), on impose :
J
X ψj2
=1
f.j
j=1

C’est une normalisation avec la métrique du χ2 .

9.3 Méthode de Lagrange : principe


Rappel théorique : Pour optimiser une fonction f (x) sous contrainte g(x) = c, on construit le
Lagrangien :
L(x, λ) = f (x) − λ(g(x) − c)
Où λ est le multiplicateur de Lagrange.
Les solutions sont trouvées en résolvant :
∂L ∂L
=0 et =0
∂x ∂λ

9.4 Construction du Lagrangien pour l’AFC


P 2
xij
Fonction objectif : I(ψ) = Ii=1 fi. J
P
j=1 f.j ψ j
PJ ψj2
Contrainte : g(ψ) = j=1 f.j = 1
Lagrangien :
 2  
I J J 2
X X x ij
X ψ j
L(ψ, λ) = fi.  ψj  − λ  − 1
f.j f.j
i=1 j=1 j=1

9.5 Dérivation par rapport à ψj (étape par étape)


∂L
On calcule et on pose égal à 0.
∂ψj
Terme 1 : Dérivée de l’objectif
Posons Si = Jk=1 xf.k
P ik
ψk (somme sur toutes les colonnes)
PI
Alors : I(ψ) = i=1 fi. Si2
Par la règle de la chaı̂ne :
I
∂I X ∂Si
= fi. · 2Si ·
∂ψj ∂ψj
i=1

∂Si xij
Maintenant, = (seul le terme k = j contribue)
∂ψj f.j
Donc :
I J
!
∂I X X xik xij
=2 fi. ψk
∂ψj f.k f.j
i=1 k=1

Terme 2 : Dérivée de la contrainte


J
!
∂ X ψk2 2ψj
=
∂ψj f.k f.j
k=1

Dérivée du Lagrangien :

13
I J
!
∂L X X xik xij 2ψj
=2 fi. ψk −λ· =0
∂ψj f.k f.j f.j
i=1 k=1

9.6 Simplification
Divisons par 2 :
I J
!
X X xik xij ψj
fi. ψk =λ
f.k f.j f.j
i=1 k=1

Multiplions les deux côtés par f.j :


I J
!
X X xik
fi. xij ψk = λψj
f.k
i=1 k=1

9.7 Passage à la forme matricielle


Réorganisons le membre de gauche :
I J J I
!
X X xik X X fi. xij xik
fi. xij ψk = ψk
f.k f.k
i=1 k=1 k=1 i=1
PI fi. xij xik
Le terme i=1 [Link] l’élément (j, k) de la matrice DJ−1 X T DI−1 X.
Vérification sur un élément :
L’élément (j, k) de DJ−1 X T DI−1 X est :

I
X 1 xik
xij fi.
f.j f.k
i=1

Multiplions par f.j pour obtenir notre expression :


I
X fi. xij xik

f.k
i=1

Conclusion : Équation aux valeurs propres


On obtient donc :
DJ−1 X T DI−1 Xψ = λψ
C’est exactement l’équation aux valeurs propres ! Les vecteurs propres ψ sont les axes factoriels,
et les valeurs propres λ sont les inerties expliquées par ces axes.

9.8 Exemple numérique complet (cas 2 × 2)


Prenons un exemple simple pour tout calculer à la main.
Données :  
0.10 −0.10
X= , f1. = f2. = 0.5, f.1 = f.2 = 0.5
−0.10 0.10
Étape 1 : Matrices de poids
 
2 0
DI−1 = DJ−1 =
0 2
1
(car 0.5 = 2)

14
Étape 2 : Calcul de DI−1 X
    
−1 2 0 0.10 −0.10 0.20 −0.20
DI X = =
0 2 −0.10 0.10 −0.20 0.20

Étape 3 : Calcul de X T DI−1 X


 
T0.10 −0.10
X =
−0.10 0.10
  
T −1 0.10 −0.10 0.20 −0.20
X DI X =
−0.10 0.10 −0.20 0.20

Élément (1,1) :
0.10 × 0.20 + (−0.10) × (−0.20) = 0.02 + 0.02 = 0.04
Élément (1,2) :

0.10 × (−0.20) + (−0.10) × 0.20 = −0.02 − 0.02 = −0.04

Élément (2,1) :

(−0.10) × 0.20 + 0.10 × (−0.20) = −0.02 − 0.02 = −0.04

Élément (2,2) :
(−0.10) × (−0.20) + 0.10 × 0.20 = 0.02 + 0.02 = 0.04
Donc :  
0.04 −0.04
X T DI−1 X =
−0.04 0.04
Étape 4 : Calcul de DJ−1 X T DI−1 X
    
−1 T −1 2 0 0.04 −0.04 0.08 −0.08
DJ X DI X = =
0 2 −0.04 0.04 −0.08 0.08
Étape 5 : Valeurs propres
On résout : det(M − λI) = 0
 
0.08 − λ −0.08
det =0
−0.08 0.08 − λ

(0.08 − λ)2 − (−0.08)2 = 0


Développons :
(0.08 − λ)2 = 0.0064 − 0.16λ + λ2
Donc :
0.0064 − 0.16λ + λ2 − 0.0064 = 0
λ2 − 0.16λ = 0
λ(λ − 0.16) = 0
Solutions : λ1 = 0.16 et λ2 = 0
Étape 6 : Vecteur propre pour λ1 = 0.16
On résout : (M − 0.16I)ψ = 0
    
0.08 − 0.16 −0.08 ψ1 0
=
−0.08 0.08 − 0.16 ψ2 0

15
    
−0.08 −0.08 ψ1 0
=
−0.08 −0.08 ψ2 0
Les deux équations donnent : −0.08ψ1 − 0.08ψ2 = 0, soit ψ1 + ψ2 = 0
Donc : ψ2 = −ψ1  
1
Un vecteur propre est : ψ =
−1
Normalisation avec la contrainte :
ψ12 ψ2 12 (−1)2
+ 2 = + =2+2=4
f.1 f.2 0.5 0.5
   
1 1 1 1
Pour normaliser : ψnorm = √ =
4 −1 2 −1
 
1 1
Ou en notation standard : ψ = √ (avec la norme euclidienne)
2 −1

9.9 Conclusion : Pourquoi cette méthode ?


La méthode de Lagrange nous a permis de transformer un problème d’optimisation sous contrainte
en un problème de valeurs propres. C’est élégant car :
1. Les vecteurs propres sont orthogonaux ⇒ les axes sont indépendants
2. Les valeurs propres donnent directement l’inertie expliquée
3. Le problème a une solution unique et calculable
4. On obtient automatiquement tous les axes (pas juste le premier)
C’est pourquoi toutes les méthodes factorielles (ACP, AFC, etc.) reposent sur la diagonalisation !

10 Exercices d’entraı̂nement
10.1 Exercice 1 : Calculs de base (très détaillé)
On étudie la relation entre le niveau d’études et le type de logement pour 150 personnes :

Appartement Maison Total


Bac 45 15 60
Licence 30 30 60
Master 15 15 30
Total 90 60 150

Questions :
1. Calculer tous les profils lignes
2. Calculer tous les profils colonnes
3. Calculer le profil moyen
4. Calculer x11 (élément de la matrice centrée)
5. Calculer l’inertie totale Φ2
Solution ultra-détaillée :
1) Calcul des profils lignes :
Rappel théorique : Un profil ligne représente la distribution d’une ligne sur toutes les colonnes. On
nij
divise chaque effectif de la ligne par le total de cette ligne. La formule est : fijL =
ni.
Ligne 1 : Bac (60 personnes au total)
Pour calculer le profil de la ligne ”Bac”, on divise chaque effectif par 60 :

16
Profil Appartement :
L n11 45
f11 = =
n1. 60
Simplifions cette fraction :
45 45 ÷ 15 3
= = = 0.750
60 60 ÷ 15 4
Interprétation : 75% des personnes ayant le Bac vivent en appartement.
Profil Maison :
L n12 15
f12 = =
n1. 60
Simplifions :
15 15 ÷ 15 1
= = = 0.250
60 60 ÷ 15 4
Interprétation : 25% des personnes ayant le Bac vivent en maison.
Vérification obligatoire : La somme doit valoir 1
L L
f11 + f12 = 0.750 + 0.250 = 1.000 ✓

Ligne 2 : Licence (60 personnes au total)


Profil Appartement :
L n21 30
f21 = =
n2. 60
Calcul :
30 30 ÷ 30 1
= = = 0.500
60 60 ÷ 30 2
Profil Maison :
L n22 30 1
f22 = = = = 0.500
n2. 60 2
Interprétation : Les personnes avec une Licence sont réparties équitablement (50-50) entre appar-
tement et maison.
Vérification : 0.500 + 0.500 = 1.000 ✓
Ligne 3 : Master (30 personnes au total)
Profil Appartement :
L n31 15
f31 = =
n3. 30
Calcul :
15 15 ÷ 15 1
= = = 0.500
30 30 ÷ 15 2
Profil Maison :
L n32 15 1
f32 = = = = 0.500
n3. 30 2
Vérification : 0.500 + 0.500 = 1.000 ✓
Tableau récapitulatif des profils lignes :

Niveau Appartement Maison Somme


Bac 0.750 0.250 1.000
Licence 0.500 0.500 1.000
Master 0.500 0.500 1.000

Observation importante : Le profil Bac se distingue nettement (forte préférence pour l’appar-
tement), tandis que Licence et Master ont des profils identiques.

2) Calcul des profils colonnes :

17
Rappel théorique : Un profil colonne représente la distribution d’une colonne sur toutes les lignes.
nij
On divise chaque effectif de la colonne par le total de cette colonne. La formule est : fijC =
n.j
Colonne 1 : Appartement (90 personnes au total)
Part des Bac :
C n11 45
f11 = =
n.1 90
Simplifions :
45 45 ÷ 45 1
= = = 0.500
90 90 ÷ 45 2
Interprétation : Parmi les personnes en appartement, 50% ont le Bac.
Part des Licence :
C n21 30
f21 = =
n.1 90
Simplifions :
30 30 ÷ 30 1
= = = 0.333...
90 90 ÷ 30 3
On garde 3 décimales : 0.333
Part des Master :
C n31 15
f31 = =
n.1 90
Simplifions :
15 15 ÷ 15 1
= = = 0.166...
90 90 ÷ 15 6
On garde 3 décimales : 0.167 (arrondi)
Vérification : 0.500 + 0.333 + 0.167 = 1.000 ✓
Colonne 2 : Maison (60 personnes au total)
Part des Bac :
C n12 15
f12 = =
n.2 60
Calcul détaillé :
15 15 ÷ 15 1
= = = 0.25 = 0.250
60 60 ÷ 15 4
Part des Licence :
C n22 30
f22 = =
n.2 60
Calcul :
30 1
= = 0.500
60 2
Part des Master :
C n32 15
f32 = =
n.2 60
Calcul :
15 1
= = 0.250
60 4
Vérification : 0.250 + 0.500 + 0.250 = 1.000 ✓
Tableau récapitulatif des profils colonnes :

Niveau Appartement Maison


Bac 0.500 0.250
Licence 0.333 0.500
Master 0.167 0.250
Somme 1.000 1.000

18
3) Calcul du profil moyen :
Rappel théorique : Le profil moyen représente la distribution marginale, indépendamment de l’autre
variable.
Profil moyen des colonnes (distribution des types de logement) :
Proportion d’appartements :
n.1 90
f.1 = =
n 150
Simplifions :
90 90 ÷ 30 3
= = = 0.600
150 150 ÷ 30 5
Interprétation : 60% de l’échantillon vit en appartement.
Proportion de maisons :
n.2 60
f.2 = =
n 150
Simplifions :
60 60 ÷ 30 2
= = = 0.400
150 150 ÷ 30 5
Interprétation : 40% de l’échantillon vit en maison.
Vérification : 0.600 + 0.400 = 1.000 ✓
Profil moyen des lignes (distribution des niveaux d’études) :
Proportion de Bac :
n1. 60
f1. = =
n 150
Simplifions :
60 60 ÷ 30 2
= = = 0.400
150 150 ÷ 30 5
Interprétation : 40% de l’échantillon a le Bac.
Proportion de Licence :
n2. 60 2
f2. = = = = 0.400
n 150 5
Interprétation : 40% de l’échantillon a une Licence.
Proportion de Master :
n3. 30
f3. = =
n 150
Simplifions :
30 30 ÷ 30 1
= = = 0.200
150 150 ÷ 30 5
Interprétation : 20% de l’échantillon a un Master.
Vérification : 0.400 + 0.400 + 0.200 = 1.000 ✓

4) Calcul de x11 (élément de la matrice centrée) :


Rappel théorique : La matrice centrée mesure l’écart entre la fréquence observée et la fréquence
attendue sous indépendance. La formule est :
nij
xij = − fi. × f.j
n
Calcul de x11 (Bac - Appartement) :
Étape 1 : Fréquence observée
n11 45
=
n 150
Simplifions :
45 45 ÷ 15 3
= = = 0.300
150 150 ÷ 15 10

19
Étape 2 : Fréquence attendue sous indépendance
C’est le produit des marges :
f1. × f.1 = 0.400 × 0.600
Calculons ce produit :
4 6 24
0.400 × 0.600 = × = = 0.240
10 10 100
Étape 3 : Différence (centrage)

x11 = 0.300 − 0.240 = 0.060

Interprétation : x11 = 0.060 > 0 signifie qu’il y a une sur-représentation de personnes Bac en
appartement. On observe 6% de plus que ce qu’on attendrait si les variables étaient indépendantes.
Calcul de toute la matrice X pour mieux comprendre :
x12 (Bac - Maison) :

15
x12 = − 0.400 × 0.400 = 0.100 − 0.160 = −0.060
150
x21 (Licence - Appartement) :

30
x21 = − 0.400 × 0.600 = 0.200 − 0.240 = −0.040
150
x22 (Licence - Maison) :

30
x22 = − 0.400 × 0.400 = 0.200 − 0.160 = 0.040
150
x31 (Master - Appartement) :

15
x31 = − 0.200 × 0.600 = 0.100 − 0.120 = −0.020
150
x32 (Master - Maison) :

15
x32 = − 0.200 × 0.400 = 0.100 − 0.080 = 0.020
150
Matrice centrée complète :
 
0.060 −0.060
X = −0.040 0.040 
−0.020 0.020

Vérifications importantes :
— Somme ligne 1 : 0.060 + (−0.060) = 0 ✓
— Somme ligne 2 : −0.040 + 0.040 = 0 ✓
— Somme ligne 3 : −0.020 + 0.020 = 0 ✓
— Somme colonne 1 : 0.060 + (−0.040) + (−0.020) = 0 ✓
— Somme colonne 2 : −0.060 + 0.040 + 0.020 = 0 ✓
Toutes les sommes valent 0, c’est normal car les données sont centrées !

5) Calcul de l’inertie totale Φ2 :


Rappel théorique : L’inertie totale mesure l’intensité de la liaison entre les deux variables. Plus elle
χ2
est élevée, plus la liaison est forte. On la calcule via le χ2 : Φ2 =
n
Étape A : Calcul des effectifs théoriques sous indépendance
ni. × n.j
La formule est : eij =
n

20
e11 (Bac - Appartement) :
n1. × n.1 60 × 90
e11 = =
n 150
Calculons numérateur :
60 × 90 = 5400
Divisons par 150 :
5400 5400 ÷ 150
= = 36
150 150 ÷ 150
Donc : e11 = 36
e12 (Bac - Maison) :
60 × 60 3600
e12 = = = 24
150 150
e21 (Licence - Appartement) :

60 × 90 5400
e21 = = = 36
150 150
e22 (Licence - Maison) :
60 × 60 3600
e22 = = = 24
150 150
e31 (Master - Appartement) :

30 × 90 2700
e31 = = = 18
150 150
e32 (Master - Maison) :
30 × 60 1800
e32 = = = 12
150 150
Tableau comparatif Observé vs Théorique :

Observé Théorique
Appart. Maison Appart. Maison
Bac 45 15 36 24
Licence 30 30 36 24
Master 15 15 18 12

Étape B : Calcul du χ2
P (nij − eij )2
La formule est : χ2 = i,j
eij
Cellule (1,1) : Bac - Appartement

(n11 − e11 )2 (45 − 36)2


=
e11 36
Calcul de la différence :
45 − 36 = 9
Calcul du carré :
92 = 81
Division :
81
= 2.25
36
Cellule (1,2) : Bac - Maison
(15 − 24)2
24

21
Différence : 15 − 24 = −9
Carré : (−9)2 = 81
81
Division : = 3.375
24
Cellule (2,1) : Licence - Appartement
(30 − 36)2
36
Différence : 30 − 36 = −6
Carré : (−6)2 = 36
36
Division : = 1.000
36
Cellule (2,2) : Licence - Maison
(30 − 24)2
24
Différence : 30 − 24 = 6
Carré : 62 = 36
36
Division : = 1.500
24
Cellule (3,1) : Master - Appartement
(15 − 18)2
18
Différence : 15 − 18 = −3
Carré : (−3)2 = 9
9
Division : = 0.500
18
Cellule (3,2) : Master - Maison
(15 − 12)2
12
Différence : 15 − 12 = 3
Carré : 32 = 9
9
Division : = 0.750
12
Somme totale (valeur du χ2 ) :
χ2 = 2.25 + 3.375 + 1.000 + 1.500 + 0.500 + 0.750
= 9.375
Détail du calcul :
2.25 + 3.375 = 5.625
5.625 + 1.000 = 6.625
6.625 + 1.500 = 8.125
8.125 + 0.500 = 8.625
8.625 + 0.750 = 9.375
Étape C : Calcul de l’inertie totale

χ2 9.375
Φ2 = =
n 150
Calculons :
9.375
= 0.0625
150
1
Ou en fraction : Φ2 = = 0.0625
16
Interprétation finale :
Φ2 = 0.0625 indique une liaison faible à modérée entre le niveau d’études et le type de logement.
Pour rappel, Φ2 est compris entre :

22
— 0 : indépendance totale
— min(I − 1, J − 1) = min(2, 1) = 1 : liaison maximale possible
0.0625
Notre valeur de 0.0625 représente donc = 6.25% de la liaison maximale possible.
1
6) Calcul des coordonnées normalisées et dénormalisation :
Rappel théorique : Après avoir obtenu les vecteurs propres de la diagonalisation, on doit calculer
les coordonnées factorielles pour représenter les lignes et colonnes dans l’espace réduit.
Étape 1 : Diagonalisation (résultats)
Pour notre tableau 3 × 2, on diagonalise MC = DJ−1 X T DI−1 X.
Après calculs (détaillés dans l’étape 6 du cours), on obtient une seule valeur propre non nulle car
min(I − 1, J − 1) = min(2, 1) = 1 :

λ1 = 0.0625 = Φ2
(et λ2 = 0 car on ne peut avoir qu’un seul axe factoriel)
Vérification : λ1 + λ2 = 0.0625 + 0 = 0.0625 = Φ2
Le vecteur propre associé (après résolution de l’équation aux valeurs propres) est :
 
1
v1 =
−1
Étape 2 : Normalisation du vecteur propre
2
vj1
On doit normaliser avec la métrique du χ2 : Jj=1
P
=1
f.j
Vérifions la norme actuelle :
2
v11 v2 12 (−1)2
+ 21 = +
f.1 f.2 0.600 0.400
Calculons :
1 1 5
= 3 = = 1.667
0.600 5
3
1 1 5
= 2 = = 2.500
0.400 5
2
Somme :
1.667 + 2.500 = 4.167

La norme est 4.167 = 2.041
Vecteur propre normalisé :
   
1 1 0.490
v1norm = =
2.041 −1 −0.490

Vérification de la normalisation :
(0.490)2 (−0.490)2 0.240 0.240
+ = + = 0.400 + 0.600 = 1.000 ✓
0.600 0.400 0.600 0.400
Étape 3 : Coordonnées factorielles des colonnes (normalisées)
Les coordonnées des colonnes sur l’axe 1 sont données par le vecteur propre normalisé :

norm
Ψ11 = v11 = 0.490 (Appartement sur axe 1)

norm
Ψ21 = v21 = −0.490 (Maison sur axe 1)
Interprétation : Les deux types de logement sont à l’opposé sur l’axe 1, ce qui est logique car ils
représentent deux modalités différentes.
Étape 4 : Coordonnées factorielles des lignes (normalisées)

23
On utilise la formule de transition :
J
1 X
Φik = √ xij Ψjk
λk · fi. j=1

Ligne 1 : Bac
1
Φ11 = √ (x11 Ψ11 + x12 Ψ21 )
0.0625 × 0.400

Calculons λ1 :

r
1 1
0.0625 = = = 0.250
16 4
Calculons le produit : p
λ1 × f1. = 0.250 × 0.400 = 0.100
Calculons la somme pondérée :

x11 Ψ11 + x12 Ψ21 = 0.060 × 0.490 + (−0.060) × (−0.490)


= 0.0294 + 0.0294
= 0.0588

Donc :
0.0588
Φ11 = = 0.588
0.100
Ligne 2 : Licence
1
Φ21 = (x21 Ψ11 + x22 Ψ21 )
0.250 × 0.400
Calculons :

x21 Ψ11 + x22 Ψ21 = (−0.040) × 0.490 + 0.040 × (−0.490)


= −0.0196 − 0.0196
= −0.0392

Donc :
−0.0392
Φ21 = = −0.392
0.100
Ligne 3 : Master
1
Φ31 = (x31 Ψ11 + x32 Ψ21 )
0.250 × 0.200
Dénominateur :
0.250 × 0.200 = 0.050
Calculons :

x31 Ψ11 + x32 Ψ21 = (−0.020) × 0.490 + 0.020 × (−0.490)


= −0.0098 − 0.0098
= −0.0196

Donc :
−0.0196
Φ31 = = −0.392
0.050
Tableau des coordonnées normalisées :
Interprétation des coordonnées normalisées :
— Le Bac (0.588) est du même côté que Appartement (0.490) : association positive
— La Licence et le Master (-0.392) sont du côté opposé, associés avec Maison (-0.490)
— Les coordonnées sont normalisées : elles ont une variance égale à la valeur propre

24
Ligne Axe 1 (normalisé)
Colonne Axe 1 (normalisé)
Bac 0.588
Appartement 0.490
Licence -0.392
Maison -0.490
Master -0.392

Étape 5 : Dénormalisation des coordonnées


Pour faciliter l’interprétation
√ et la représentation graphique, on dénormalise les coordonnées en
les multipliant par λk :
p
Φdénorm
ik = λk × Φik

p
Ψdénorm
jk = λk × Ψjk

Avec λ1 = 0.250
Coordonnées dénormalisées des lignes :
Bac :
Φdénorm
11 = 0.250 × 0.588 = 0.147
Licence :
Φdénorm
21 = 0.250 × (−0.392) = −0.098
Master :
Φdénorm
31 = 0.250 × (−0.392) = −0.098
Coordonnées dénormalisées des colonnes :
Appartement :
Ψdénorm
11 = 0.250 × 0.490 = 0.123
Maison :
Ψdénorm
21 = 0.250 × (−0.490) = −0.123
Tableau final des coordonnées dénormalisées :

Ligne Axe 1 (dénormalisé)


Colonne Axe 1 (dénormalisé)
Bac 0.147
Appartement 0.123
Licence -0.098
Maison -0.123
Master -0.098

Pourquoi dénormaliser ?
1. Échelle comparable : Les coordonnées dénormalisées sont sur une échelle proportionnelle à
l’inertie expliquée
2. Représentation graphique : On peut superposer lignes et colonnes sur le même graphique
3. Distances interprétables : Les distances entre points reflètent les vraies distances du χ2
4. Contribution visuelle : Plus un point est éloigné de l’origine, plus il contribue à l’axe
Interprétation finale :
Sur l’axe 1 (qui explique 100% de l’inertie) :
— Côté positif : Bac (0.147) et Appartement (0.123) sont associés
— Côté négatif : Licence/Master (-0.098) et Maison (-0.123) sont associés
— Le Bac a la coordonnée la plus extrême : c’est le profil le plus atypique
— Licence et Master ont exactement la même coordonnée : profils identiques

25
10.2 Exercice 2 : Distance du χ2
Avec les données de l’exercice 1, calculer la distance du χ2 entre les profils ”Bac” et ”Master”.
Solution :

(0.750 − 0.500)2 (0.250 − 0.500)2


d2 (Bac, Master) = +
0.600 0.400

(0.250)2 (−0.250)2
= +
0.600 0.400
0.0625 0.0625
= +
0.600 0.400

= 0.104 + 0.156 = 0.260

10.3 Exercice 3 : Interprétation des valeurs propres


Après diagonalisation d’un tableau 4 × 3, on obtient :

λ1 = 0.35, λ2 = 0.08, λ3 = 0.02

L’inertie totale vaut Φ2 = 0.45.


Questions :
1. Calculer les pourcentages d’inertie de chaque axe
2. Combien d’axes faut-il garder pour avoir au moins 90% de l’inertie ?
3. Que représente le fait que λ3 soit très petit ?
Solution :
1) Pourcentages :
0.35
τ1 = × 100 = 77.8%
0.45
0.08
τ2 = × 100 = 17.8%
0.45
0.02
τ3 = × 100 = 4.4%
0.45
2) Nombre d’axes :
τ1 + τ2 = 77.8% + 17.8% = 95.6% > 90%
Il faut garder 2 axes.
3) Interprétation de λ3 :
Le fait que λ3 = 0.02 soit très petit (seulement 4.4% de l’inertie) signifie que le troisième axe
apporte peu d’information supplémentaire. Les deux premières dimensions suffisent pour résumer
l’essentiel des associations entre lignes et colonnes.

10.4 Exercice 4 : Lagrangien


On veut maximiser I(ψ) = 3ψ12 + 2ψ1 ψ2 + 4ψ22 sous la contrainte ψ12 + 2ψ22 = 1.
Questions :
1. Écrire le Lagrangien
2. Calculer les dérivées partielles
3. En déduire le système d’équations

26
Solution :
1) Lagrangien :
L(ψ1 , ψ2 , λ) = 3ψ12 + 2ψ1 ψ2 + 4ψ22 − λ(ψ12 + 2ψ22 − 1)
2) Dérivées :
∂L
= 6ψ1 + 2ψ2 − 2λψ1 = 0
∂ψ1
∂L
= 2ψ1 + 8ψ2 − 4λψ2 = 0
∂ψ2
∂L
= −(ψ12 + 2ψ22 − 1) = 0
∂λ
3) Système :
De la première équation : (6 − 2λ)ψ1 + 2ψ2 = 0
De la deuxième : 2ψ1 + (8 − 4λ)ψ2 = 0
Sous forme matricielle :     
6 − 2λ 2 ψ1 0
=
2 8 − 4λ ψ2 0
Ce système homogène a une solution non triviale si et seulement si le déterminant est nul :
(6 − 2λ)(8 − 4λ) − 4 = 0
C’est l’équation caractéristique qui donne les valeurs propres λ.

11 Mémo des formules essentielles


11.1 Profils
nij
— Profil ligne i : fijL = (somme sur j vaut 1)
ni.
nij
— Profil colonne j : fijC = (somme sur i vaut 1)
n.j
n.j
— Profil moyen colonne : f.j =
n
ni.
— Profil moyen ligne : fi. =
n

11.2 Distances
P 1 L
— Distance entre lignes : d2 (i, i′ ) = (f − fiL′ j )2
j
f.j ij
P 1
— Distance entre colonnes : d2 (j, j ′ ) = i (fijC − fijC′ )2
fi.

11.3 Matrice centrée et inertie


nij
— Élément centré : xij = − fi. · f.j
n
χ2 P (nij − eij )2
— Inertie totale : Φ2 = où χ2 = i,j
n eij
ni. · n.j
— Effectif théorique : eij =
n

11.4 Diagonalisation
— Matrice pour lignes : DI−1 XDJ−1 X T
— Matrice pour P colonnes : DJ−1 X T DI−1 X
— Vérification : k λk = Φ2
λk
— Part d’inertie : τk = 2 × 100%
Φ

27
11.5 Coordonnées
1
— Ligne i sur axe k : Φik = √ uik
λk
1
— Colonne j sur axe k : Ψjk = √ vjk
λk
1 P
— Transition : Φik = √ xij Ψjk
λk fi. j

11.6 Optimisation
— Lagrangien : L = I(ψ) − λ(g(ψ) − c) où g est la contrainte
∂L
— Conditions : = 0 pour tout j
∂ψj
— Aboutit à : DJ−1 X T DI−1 Xψ = λψ

12 Conseils pratiques pour l’examen


1. Toujours commencer par les marges : vérifier que les totaux sont corrects
2. Vérifier les profils : chaque profil ligne (ou colonne) doit sommer à 1
3. Signe de xij : positif = surreprésentation, négatif = sous-représentation
4. Somme de X : chaque ligne et colonne doit sommer à 0
5. Valeurs propres : elles doivent toutes être positives et leur somme vaut Φ2
6. Premier axe : c’est celui qui a la plus grande valeur propre
7. Choix du nombre d’axes : garder ceux qui expliquent au moins 80-90% de l’inertie
8. Lagrangien : ne pas oublier le signe moins devant la contrainte
9. Calculs numériques : garder au moins 3 décimales pour éviter les erreurs d’arrondi
10. Unités : l’inertie et les valeurs propres n’ont pas d’unité

Remarques finales
L’AFC est une méthode puissante mais qui demande de la rigueur dans les calculs. L’essentiel est
de comprendre que :
— On transforme un tableau de contingence en profils pour pouvoir comparer
— On utilise la distance du χ2 car elle pondère par les marges
— On centre pour éliminer l’effet des totaux marginaux
— On diagonalise pour trouver les axes principaux
— Le problème d’optimisation justifie mathématiquement pourquoi on diagonalise ces matrices
précises
L’interprétation des résultats est tout aussi importante que les calculs. Il faut toujours revenir au
sens concret : quelles catégories sont associées ? Pourquoi ? Quelle information les axes nous apportent-
ils ?
Bon courage Chabab !

28

Vous aimerez peut-être aussi