0% ont trouvé ce document utile (0 vote)
8 vues76 pages

Introduction à la Statistique Exploratoire

Transféré par

narimanemokhtari08
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
8 vues76 pages

Introduction à la Statistique Exploratoire

Transféré par

narimanemokhtari08
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

1 Statistique exploratoire

Exploration Statistique Multidimensionnelle


P HILIPPE B ESSE

Version juillet 2011

Attention ce cours est dense, la lecture de ce document ne suffira pas à la bonne compréhension des outils qui y sont décrits de
façon synthétique. La présence aux cours et la participation active aux TDs sont indispensables à l’acquisition des compétences
incontournables pour une utilisation raisonnable et raisonnée des techniques de d’exploration statistique.

Institut de Mathématiques de Toulouse — UMR CNRS C5219


Équipe de Statistique et Probabilités
Institut National des Sciences Appliquées de Toulouse — 31077 – Toulouse cedex 4.

Précédente Suivante Première Dernière Retour Quitter


1 Statistique : Introduction

Quelles sont les compétences nécessaires à la mise en œuvre de tels


Statistique : Introduction logiciels pour analyser, modéliser, interpréter des corpus de données
de plus en plus complexes et volumineux produits par une entreprise
ou un laboratoire ?
Résumé Les enjeux sont en effet majeurs ; les résultats influent directement sur les
prises de décision du management ou la validation de résultats scientifiques et
Introduction à la Statistique et ses méthodes. Contexte et objectifs (descrip-
leur valorisation par des publications.
tif, explicatif, prédictif) d’une analyse statistique ; les compétences nécessaires.
Ce cours est structuré en deux niveaux principaux et quelques grands
thèmes :
2 Terminologie
– L : Description et inférences statistiques élémentaires Le travail du statisticien est d’abord un travail de communication avec des
– M : Exploration multivariée représentants d’autres disciplines ou d’autres métiers. Ceci nécessite beaucoup
– M : Modèle linéaire et linéaire général de rigueur et donc de précision dans l’emploi des mots et concepts lorsqu’il
– M : Apprentissage et modélisation s’agit de traduire en phrases intelligibles des résultats numériques ou gra-
phiques. En effet, de ces interprétations découleront des prises de décision.
1 Le métier de statisticien
2.1 Statistique, statistiques, statistique
Le développement continu des moyens informatiques de saisie, de stockage
(bases de données) et de calcul permet la production, la gestion, le traitement Le mot statistiques avec un "s" est apparu au XVIIIème siècle pour désigner
et l’analyse d’ensembles de données de plus en plus volumineux. Par exemple, des quantités numériques : des tables ou états, issus de techniques de dénom-
les 600 Mb de données produites en une dizaine d’heures par l’un des séquen- brement et décrivant les ressources économiques (impôts...), situations démo-
ceurs actuels représentent l’équivalent de la production mondiale déposée dans graphiques (conscription...), d’un pays. La Statistique est une sous-discipline
GenBank entre 1982 et 1996. Les séquenceurs arrivant sur le marché en 2010 des Mathématiques qui s’est développée depuis la fin du XIXème siècle no-
produisent en 5 jours 200Gb par traitement. Le perfectionnement des interfaces tamment à la suite des travaux de l’école anglaise (K. Pearson, W. Gosset
graphiques offrent aux utilisateurs, statisticiens ou non, des possibilités de mise (Student), R. Fisher, J. Neyman...). Une statistique est une quantité définie par
en œuvre très simples des outils logiciels de plus en plus "conviviaux". Cette rapport à un modèle (i.e. une statistique de test) permettant d’inférer sur son
évolution, ainsi que la popularisation de nouvelles méthodes algorithmiques comportement dans une situation expérimentale donnée.
(réseaux de neurones, support vector machine, agrégation de modèles...) et ou- 2.2 Statistique descriptive, inférentielle et apprentis-
tils graphiques, conduisent au développement et à la commercialisation de lo-
giciels généraux, ou spécifiques à des métiers, qui intègrent un sous-ensemble
sage
de méthodes statistiques et algorithmiques plus ou moins exhaustif. De manière approximative, il est possible de classer les méthodes statis-
Une question émerge alors de façon très présente ; elle est fondamentale tiques en trois groupes : celui des méthodes, celui des méthodes inférentielles
pour l’emplois et les débouchés des étudiants, la gestion des ressources hu- et celui récent de l’apprentissage.
maines et les investissements économiques des entreprises ou encore les stra- – La Statistique descriptive regroupe les méthodes dont l’objectif princi-
tégies scientifiques des laboratoires de recherche. pal est la description des données étudiées ; cette description des données
se fait à travers leur présentation (la plus synthétique possible), leur re-

Précédente Suivante Première Dernière Retour Quitter


2 Statistique : Introduction

présentation graphique, et le calcul de résumés numériques. Dans cette Enquête (statistique) : opération consistant à observer (ou mesurer, ou ques-
optique, il n’est pas fait appel à des modèles probabilistes. On notera que tionner. . . ) l’ensemble des individus d’un échantillon.
les termes de statistique descriptive, statistique exploratoire et analyse
Recensement : enquête dans laquelle l’échantillon observé est la population
des données sont quasiment synonymes.
tout entière (enquête exhaustive).
– La statistique inférentielle. Ce terme regroupe les méthodes dont l’ob-
jectif principal est de préciser un phénomène sur une population globale, Sondage : enquête dans laquelle l’échantillon observé est un sous–ensemble
à partir de son observation sur une partie restreinte de cette population, strict de la population (enquête non exhaustive).
l’échantillon. Il s’agit donc d’induire (ou encore d’inférer) du particulier X

E si qualitative
au général avec un objectif principalement explicatif. Ce passage ne peut Variable (statistique) : Ω 7−→
R si quantitative
se faire qu’aux moyens de modèles et d’hypothèses probabilistes. Les caractéristique (âge, salaire, sexe, glycémie. . . ), définie sur la population
termes de statistique inférentielle, statistique mathématique, et statistique et observée sur l’échantillon ; mathématiquement, il s’agit d’une appli-
inductive sont eux aussi quasiment synonymes. cation définie sur l’échantillon. Si la variable est à valeurs dans R (ou
– L’apprentissage statistique est issu de l’interface entre deux disciplines : une partie de R, ou un ensemble de parties de R), elle est dite quantita-
Statistique et Machine Learning (apprentisage machine). L’objectif est tive (âge, salaire, taille. . . ) ; sinon elle est dite qualitative (sexe, catégorie
principalement la construction d’un modèle, statistique tradiditionnel ou socioprofessionnelle. . . ).
algorithmique sans nécessairemnt d’hypothèse probabiliste, en prévivi-
légiant la prévision d’une variables qualitative (discrimination ou classi- Données (statistiques) : ensemble des individus observés (échantillon), des
fication supervisée) ou quantitative (régression). Le contexte est souvent variables considérées, et des observations de ces variables sur ces indivi-
celui de données de grandes dimensions avec comme défi majeur le cas où dus. Elles sont en général présentées sous forme de tableaux (individus en
le nombre de variables explicatices p est considérablement plus important lignes et variables en colonnes) et stockées dans un fichier informatique.
que le nombre n d’observations ou taille de l’échantillon dit d’apprentis- Lorsqu’un tableau ne comporte que des nombres (valeurs des variables
sage. quantitatives ou codes associés aux variables qualitatives), il correspond
à la notion mathématique de matrice.
Pour continuer sur la statistique descriptive.
D’un point de vue méthodologique, la statistique descriptive précède la sta- 3 Démarche du statisticien
tistique inférentielle ou l’apprentisage statistique dans une démarche de trai-
tement de données : ces différents aspects de la statistique se complètent bien Le crédo de l’enseignement de statistique consiste à répéter inlassablement :
plus qu’ils ne s’opposent une fois que le ou les objectifs : dscriptif, explicatif, un statisticien (ou les compétences qu’ils représentent) doit être associé préa-
prédictif sont explicités. lablement à une étude, des expérimentations, une enquête... De la qualité du
recueil et de l’organisation des données dépendra bien évidemment la perti-
Population Ω (ou population statistique) : ensemble (au sens mathématique
nence des résultats de l’analyse. Plusieurs questions sont préalables :
du terme) concerné par une étude statistique. On parle parfois de champ
de l’étude. 3.1 Expérimentation
Individu ω ∈ Ω (ou unité statistique) : tout élément de la population.
– Quelle est la question biologique, sociologique, épidémiologique à la-
Échantillon : sous–ensemble de la population sur lequel sont effectivement quelle je veux apporter une réponse ? En particulier, quel est l’objectif
réalisées les observations. (descriptif, explicatif, prédictif ou une combinaison) ?
Taille de l’échantillon n : cardinal du sous-ensemble correspondant. – Quelle est la population étudiée ?

Précédente Suivante Première Dernière Retour Quitter


3 Statistique : Introduction

– Comment planifier des expériences ou des recueils d’informations dans 4 Quel logiciel ?
des bases pré-existantes ?
– Quels sont les échantillons ? Deux logiciels sont privilégiés : l’un commercial SAS car le plus répandu
– Précision des conditions expérimentales et le plus demandé dans les offres d’emplois ; l’autre, R, en distribution libre
– Observations et mesures (licence GNU) comme outil de développement des dernières avancées métho-
dologiques du monde universitaire.
3.2 Exploration pour un objectif descriptif
4.1 SAS
Cette étape est de toute façon un préalable à tout autre objectif. Les données
recueillies sont elles de qualité suffisante ? Sont-elles bien exemptes de biais Mis à part le module SAS/IML de langage matriciel très peu utilisé, SAS
ou artefacts ? Leurs grandes structures (groupes, corrélations...) sont elles en est un logiciel de type "boîte noire" superposant des couches basses, pour les-
accord avec les conaissances acquises sur le sujet ? quelles l’utilisateur écrit des lignes de code dans une syntaxe complexe, et des
– Valeurs manquantes, erronées ou atypiques interfaces graphiques conviviales (SAS/INSIGHT, SAS User Guide, Sas En-
– Modalités trop rares terprise Miner...). Sa diffusion est telle qu’il apparaît en situation de quasi mo-
– Distributions “anormales” nopole dans certaines branches d’activité comme l’industrie pharmaceutique.
– Incohérences, liaisons non linéaires Paradoxalement, sa complexité et son coût sont des atouts pour l’emploi de
– Transformations, imputation, codage... statisticiens indispensables à sa bonne utilisation et donc à sa rentabilisation.
Son apprentissage est incontournable.
3.3 Décision pour un objectif explicatif
4.2 R
Telle variable ou tel facteur a-t-il une influence sur la variable d’intérêt ? Le
modèle théorique est-il en accortd avec les résultats expérimentaux ? A l’opposé et à l’exception des traitements les plus rudimentaires pilotées
– Explicitation de l’hypothèse statistique répondant à la question biolo- par menu, R est avant tout un langage de programmation pour la manipula-
gique, tion des objets du statisticien : vecteurs matrices, bases de données, liste de
– Détermination du modèle statistique correspondant, résultats, graphiques. D’un point de vue pédagogique, sa mise en œuvre oblige
– Estimation des paramètres du modèl et calcul de la statistique de test, à l’indispensable compréhension des méthodes et de leurs limites. Il fait bien
– Prise de décision : rejet ou acceptation de l’hypothèse. admettre qu’il ne suffit pas d’obtenir des résultats, il faut leur donner du sens.
Rien ne nous semble en effet plus dangereux que des résultats ou des gra-
3.4 Apprentissage pour un objectif prédictif phiques obtenus à l’aide de quelques clics de mulot dont ni les techniques, ni
les options, ni leurs limites ne sont clairement explicitées ou contrôlées par
Un modèle explicatif construit dans l’étape précédente peut être un bon can-
l’utilisateur. Il est par ailleurs risqué de se laisser enfermer par les seules mé-
didat comme modèle prédictif mais, pas nécessairement. Paradoxalement, un
thodes et options offertes par “un” logiciel. En pratique, le réagencement ou
modèle “vrai” n’est pas nécessairement un “meilleur” modèle prédictif s’il est
la réorganisation de quelques commandes R offrent une combinatoire très ou-
trop complexe, pas assez “parcimonieux” . Une quantité impressionnante de
vertes de possibilités contrairement à un système clos de menus prédéfinis. Il
méthodes ont été développées ces dernières années sans qu’il soit possible de
offre par ailleurs, grâce à de nombreuses librairues facilement accessibles et
déterminer, a priori, celle qui conduira aux meilleures prévisions sur le pro-
continuellement mises à jour, un ensemble exhaustif des techniques et de leurs
blème et les données étudiées.
options ainsi que des interfaces à des gestionnaires de bases de données ou des
outils spécifiques à certaines disciplines (Biologie).

Précédente Suivante Première Dernière Retour Quitter


4 Statistique : Introduction

4.3 Quel choix ? de l’INRA de Toulouse. Il concerne 40 souris réparties en 2 génotypes (sau-
vages et génétiquement modifiées : PPARα déficientes) et 5 régimes alimen-
En résumé, il est bien et utile de savoir utiliser ces deux types de logiciels et taires (dha, efad, lin, ref, tsol). Le plan est équilibré complet : quatre souris par
il est important de comprendre que l’apprentissage syntaxique d’un logiciel est combinaison des deux facteurs.
indispensable mais secondaire. Une fois les méthodes comprises et appréhen-
dées, il est techniquement facile de passer d’un logiciel à l’autre, leurs fonc- dha régime enrichi en acides gras de la famille Oméga 3 et particulièrement
tionnalités étant structurellement les mêmes. La difficulté principale ne réside en acide docosahexaénoïque (DHA), à base d’huile de poisson ;
pas dans l’obtention de sorties ou résultats mais dans leur compréhension. efad (Essential Fatty Acid Deficient) : régime constitué uniquement d’acides
gras saturés, à base d’huile de coco hydrogénée ;
5 Domaines d’application lin régime riche en Oméga 3, à base d’huile de lin ;
Toutes les méthodes et techniques utilisées nécessitent d’être illustrées sur ref régime dont l’apport en Oméga 6 et en Oméga 3 est adapté des Ap-
des exemples simples ou "académiques", pour ne pas dire simplistes, afin d’en ports Nutritionnels Conseillés pour la population française, sept fois plus
comprendre les fondements. Néanmoins, leur apprentissage effectif requiert d’Oméga 6 que d’Oméga 3 ;
leur utilisation effective sur des jeux de données en vraie grandeur, issus de tsol riche en Oméga 6, à base d’huile de tournesol.
différents domaines d’applications. Ce n’est qu’à cette condition que peuvent
être appréhendées les difficultés de mise en œuvre, les limites, les stratégies Les expressions des gènes ainsi que des concentrations de 21 acides gras sont
d’interprétation mais aussi la grande efficacité de ces outils. mesurées au niveau du foie après euthanasie. Ce jeu de données aux problé-
matiques statistiques très riche est très souvent repris tout au long des présen-
Ils sont tirés des principaux domaines d’application de la Statistique. tations des différentes méthodes.
5.1 Sciences de le Vie 5.2 Marketing
Depuis les travaux pionniers de Sir Ronald Fisher, les disciplines des La prospection ou fouille de données (data mining) est une appellation issue
Sciences de la Vie ont toujours motivé les développements de la Statistique : des services marketing spécialisés dans la gestion de la relation client (GRC)
modèles de durée de vie, modèles épidémiologiques, dynamique de popula- (client relation management ou CRM). Elle désigne un ensemble de techniques
tion... Les techniques de séquençage et les technologies d’instrumentation à statistiques souvent regroupées dans un logiciel spécialement conçu à cet effet
haut débit (transcriptomique, protéomique, métabolomique...) viennent renfor- et vendu avec un slogan racoleur (SAS Enterprise Miner) :
cer lourdement cette tendance en posant des défis redoutables au statisticien :
que faire lorsque les transcriptions (quantités d’ARN messagers) de milliers de Comment trouver un diamant dans un tas de charbon sans se salir
gènes (les variables statistiques) sont simultanément observés pour seulement les mains.
quelques dizaines d’échantillons biologiques ? Les entreprises commerciales du tertiaire (banques, assurances, téléphonie,
La figure : 1 est un exemple original d’emploi de l’analyse canonique (ob- marketing directe, publipostage, ventes par correspondance...) sont en effet très
jectif descriptif). Cette méthode permet de mettre en relation deux paquets de motivées pour tirer parti et amortir, par une aide à la décision quantifiée, les
variables (gènes et concentrations d’acides gras) observées sur les mêmes in- coûts de stockage des teras octets que leur service informatique s’emploie à
dividus (souris). administrer.
Le jeu de données utilisé provient de l’Unité de Pharmacologie-Toxicologie Le contexte informationnel de la fouille de données est celui des data wha-
rehouses. Un entrepôt de données, dont la mise en place est assurée par un ges-

Précédente Suivante Première Dernière Retour Quitter


5 Statistique : Introduction

tionnaire de données (data manager), est un ensemble de bases relationnelles


extraites des données brutes de l’entreprise et relatives à une problématique.
Chaque banque, assurance... dispose d’un fichier client qui, pour des raisons
1.0
C22.6n.3 comptables, enregistre tous leurs mouvements et comportements. Les données
C20.5n.3
GSTpi2 CYP3A11
anonymes en provenance d’une banque décrivent tous les soldes et produits fi-
C22.5n.3 nanciers (emprunt, contrats d’assurance vie...) détenus par les clients ainsi que
0.5

CYP2c29
C18.0
G6Pase
CYP4A14
SPI1.1
C20.3n.3
CYP4A10
GSTmu
l’historique mensuel des mouvements, nombre d’opérations, de jours à décou-
C18.2n.6 Tpalpha
Dimension 2

PMDCI
mHMGCoAS
CBS
C18.3n.3
MCADTHB C16SR
IL.2 PPARd Tpbeta
AOX C16.0
PECI THIOL vert... La base initiale étudiée comprend 1425 clients décrits par 32 variables
Pex11a LCE BACT C20.3n.6GSTa
apoE
0.0

ACOTH HPNCL
BIEN
CAR1
C20.2n.6PON
ACAT1
M.CPT1
RXRb2
PPARg
apoB
OCTN2
Waf1
CIDEA
[Link]
SHP1
LXRb
TRa MDR1
[Link]
X36b4ACAT2
CYP26
CACP
cMOAT BSEP
ALDH3
[Link]
CPT2 ACBP explicitées la vignette décrivant les données.
CYP27b1LPLPAL CYP8b1
mABC1
SIAT4cRXRa
VLDLr
Lpin3
CYP2b10
FXR
MTHFR
NURR1
ADISP
GS ap2
apoC3
LXRa
ACC1
COX1AM2R MRP6 Lpin2 FAS
Lpin
C20.4n.6
Lpin1 CYP27a1
C20.1n.9 Bcl.3
hABC1 LPK
MSPDK4
C22.4n.6
RXRg1 TRb
CYP7a
CYP2b13
RARa
ADSS1
UCP3
RARb2
COX2
CYP24
VDR
NGFiB
PPARa
C22.5n.6
[Link]
[Link]
MDR2
apoA.I
GK Le graphique représenté est un grand classique du marketing bancaire.
UCP2
C18.3n.6
FDFT
[Link] G6PDH L’objectif (descriptif) de statistique multidimensionnelle est de construire des
−0.5

Ntcp [Link] cHMGCoAS


LDLr
S14
C16.1n.9 C16.1n.7
C14.0 C20.3n.9
ACC2HMGCoAred
PLTP
C18.1n.9
C18.1n.7
classes ou segments de clients homogènes quant à leur comportement bancaire.
Une fois les classes construites et l’ensemble des clients affectés, l’agent com-
−1.0

mercial sait quel langage adopter, quels produits proposer au client qu’il a en
−1.0 −0.5 0.0 0.5 1.0 face de lui. Après une analyse factorielle des correspondances multiples, les
Dimension 1 clients caractérisés par leur nouvelles coordonnées sont regroupés en classes
dont l’explicitation est facilitée par la représentation des modalités de ces
classes dans le plan factoriel de l’analyse des correspondances multiples (fi-
dha dha
gure 2). Un autre objectif (apprentissage) est abordé sur ces mêmes données
WT
PPARα
dha
dha
dha
dha lin pour la recherche de scores d’appétences ou d’attrition. Les applications mar-
0.2

lin lin
dha dha
lin
keting sont très nombreuses (intérêts de certains clients pour des produits fi-
nanciers, risque pour d’autre client de changer de fournisseur en téléphonie).
0.1

lin
Elles le sont également dans les appalications financières : risque de défaut de
Dimension 2

paiement d’un client, de ruine d’une entreprise.


0.0

tsol lin refref


ref
ref
lin tsol lin
tsol ref
tsol ref
efad tsol
5.3 Industrie
−0.1

tsol
refref tsol
tsol
efad

Pour des raisons culturelles et historiques trop longues à développer (culture


−0.2

efad efad
efad
déterministe des Écoles d’ingénieurs...), la Statistique a une place très mi-
efad
efad
efad
neures dans l’industrie française sauf en cas d’obligation légale : essais cli-
−0.4 −0.3 −0.2 −0.1 0.0 0.1 0.2
niques pour l’autorisation de mise sur le marché des médicaments, contrôle
Dimension 1
de qualité et fiabilité des matériaux pour la conformité aux normes ISO... La
Statistique est ainsi plus vécue comme une contrainte, un contrôle, que comme
F IGURE 1 – Souris : premier plan des facteurs canoniques : représentation une aide à la décision. D’autre part, les exemples développés dans le cadre
conjointe des relations gènes et acides gras puis des souris selon le génotype de thèses sont, outre les questions de confidentialité, souvent trop complexes
et le régime suivi. à expliciter pour s’adapter à la simple illustration de ce cours. Néanmoins, il

Précédente Suivante Première Dernière Retour Quitter


6 Statistique : Introduction

faut être conscient que chacune des techniques abordées, en particulier de bio-
statistique, se transposent directement : durée de vie et fiabilité des matériaux,
fouille de données et traçabilité pour la détection de défaillances... Le contexte
est souvent techniquement très complexe en terme de modélisation physique
mais plus favorable sur le plan statistique : beaucoup plus d’observations que
dans le domaine de la santé.
Les entreprises industrielles sont confrontées à la même situation que celles
du tertiaire : afflux et stockage massif de données, la situation et donc les mé-
tiers de la Statistique évoluent favorablement dans ce domaine.

6 Quelles compétences ?
Les compétences acquises doivent permettre de répondre avec assurance aux
questions suivantes ou alors conduire à une proposition de rédéfinition de la
problématique envisagée si celle-ci est trop mal engagée.
– Quelle est précisément la question posée ?
– Quelle méthode utilisée avec quelles limites ?
– Comment la mettre en œuvre ?
– Comprendre les sorties du logiciel utilisé.
– Quelle décision ?
Un argument tendancieux est souvent avancé : il n’est pas besoin d’être mé-
canicien pour conduire une voiture. C’est vrai, il n’est pas nécessaire d’être
informaticien pour utiliser un ordinateur. En revanche, toute étude statistique
nécessite des choix fondamentaux : transformation des données, sélection de
variables, choix de méthodes, valeurs des options et paramètres de ces mé-
F IGURE 2 – Banque : représentation des classes de clients, w1 à w5, dans le thodes... qu’il n’est pas prudent de laisser faire, par défaut, au logiciel utilisé.
premier plan factoriel de l’analyse des correspondances multiples Ces choix ne sont pas anodins et autrement plus difficiles à déterminer que le
choix du carburant dans une voiture. Ils doivent être conduits en connaissance
de cause par opposition à une stratégie de Shadok (cf. figure 3) qui est un
mode d’apprentissage de type "jeux vidéos". Elles est utile, mais pas en toute
circonstance, car il ne suffit pas d’obtenir un résultat pour qu’il soit pertinent
ou même simplement juste.

Précédente Suivante Première Dernière Retour Quitter


7 Statistique : Introduction

F IGURE 3 – Shadok : devise numéro 1

Précédente Suivante Première Dernière Retour Quitter


1 Introduction à la Statistique exploratoire multidimensionnelle

hypothèses de normalité.
Introduction à la Statistique exploratoire En France, l’expression “Analyse des Données” recouvre les techniques
multidimensionnelle ayant pour objectif la description statistique des grands tableaux (n lignes,
où n varie de quelques dizaines à quelques milliers, p colonnes, où p varie de
quelques unités à quelques dizaines). Ces méthodes se caractérisent par une
utilisation intensive de l’ordinateur, leur objectif exploratoire et une absence
Résumé quasi systématique d’hypothèses de nature probabiliste au profit de la géomé-
trie euclidienne. Elles insistent sur les représentations graphiques en particulier
Cette vignette fait suite à celles, plus élémentaires, de Statistique descriptive
de celles des individus qui sont considérés au même titre que les variables.
unidimensionnelle, bidimensionnelle et multidimensionnelle pour aborder les
principales méthodes factorielles de réduction de dimension et de représenta- Depuis la fin des années 1970, de nombreux travaux ont permis de rap-
tion optimale ainsi que celles de classification non supervisée. procher ou concilier les deux points de vue en introduisant, dans des espaces
multidimensionnels appropriés, les outils probabilistes et la notion de modèle,
Plan du cours :
usuelle en statistique inférentielle. Les techniques se sont ainsi enrichies de no-
– Introduction
tions telles que l’estimation, la convergence, la stabilité des résultats, le choix
– Analyse en Composantes Principales
de critères. . .
– Analyse Canonique des Corrélations
– Analyse Factorielle Discriminante L’objectif essentiel de ces méthodes est l’aide à la compréhension de vo-
– Analyse Factorielle des Correspondances lumes de données souvent considérables. Réduction de dimension, représenta-
– Analyse Factorielle des Correspondances Multiple tion graphique optimale, recherche de facteurs ou variables latentes... sont des
– Positionnement Multidimensionnel formulations équivalentes.
– Classification non supervisée
– Compléments d’algèbre linéaire 2 Méthodes
Les méthodes de Statistique exploratoire multidimensionnelle se classifient
1 Historique selon leur objectif (réduction de dimension ou classification) et le type des
Les bases théoriques de ces méthodes sont anciennes et sont principalement données à analyser (quantitatives et/ou qualitatives) :
issues de psychomètres américains : Spearman (1904) et Thurstone (1931, – Description et réduction de dimension (méthodes factorielles) :
1947) pour l’Analyse en Facteurs, Hotteling (1935) pour l’Analyse en Com- i. Analyse en Composantes Principales (p variables quantitatives),
posantes Principales et l’Analyse Canonique, Hirschfeld (1935) et Gutt-
ii. Analyse Factorielle Discriminante (p variables quantitatives, 1 va-
man (1941, 1959) pour l’Analyse des Correspondances. Pratiquement, leur
riable qualitative),
emploi ne s’est généralisé qu’avec la diffusion des moyens de calcul dans le
courant des années 60. Sous l’appellation “Multivariate Analysis” elles pour- iii. Analyse Factorielle des Correspondances simple (2 variables quali-
suivent des objectifs sensiblement différents à ceux qui apparaîtront en France. tatives) et Multiple (p variables qualitatives),
Un individu ou unité statistique n’y est souvent considéré que pour l’informa- iv. Analyse Canonique (p et q variables quantitatives),
tion qu’il apporte sur la connaissance des liaisons entre variables au sein d’un
échantillon statistique dont la distribution est le plus souvent soumise à des v. “Multidimensional Scaling” (M.D.S.) ou positionnement multidi-
mensionnel ou analyse factorielle d’un tableau de distances.

Précédente Suivante Première Dernière Retour Quitter


2 Introduction à la Statistique exploratoire multidimensionnelle

Toutes ces méthodes sont basées sur des outils classiques de géométrie eu-
clidienne qui sont développés dans les rappels et compléments d’algèbre
linéaire.
– Méthodes de classification :
i. Classification ascendante hiérarchique,
ii. Algorithmes de réallocation dynamique,
iii. Cartes de Kohonen (réseaus de neurones).
Les références introductives les plus utiles pour ce cours sont : Bouroche
& Saporta (1980), Jobson (1991), Droesbeke, Fichet & Tassi (1992), Everitt &
Dunn (1991), Mardia, Kent & Bibby (1979), Saporta (2006), Lebart, Morineau
& Piron (1995).

Précédente Suivante Première Dernière Retour Quitter


1 Analyse en Composantes Principales (ACP)

C’est l’interprétation de ces graphiques qui permettra de comprendre la


Analyse en Composantes Principales structure des données analysées. Cette interprétation sera guidée par un certain
nombre d’indicateurs numériques et graphiques, appelés aides à l’interpréta-
(ACP) tion, qui sont là pour aider l’utilisateur à faire l’interprétation la plus juste et la
plus objective possible.
L’analyse en Composantes Principales (ACP) est un grand classique de
Résumé l”’analyse des données” en France pour l’étude exploratoire ou la compres-
sion d’un grand tableau n × p de données quantitatives. Le livre de Jolliffe
Méthode factorielle de réduction de dimension pour l’exploration statistique
(2002) en détaille tous les aspects et utilisations de façon exhaustive. Elle est
de données quantitatives complexes. Construction du modèle statistique asso-
introduite ici comme l’estimation des paramètres d’un modèle, afin de préci-
cié, estimation. Représentations graphiques des individus, des variables et si-
ser la signification statistique des résultats obtenus. L’ACP est illustrée dans
multanée ; qualité de représentation.
ce chapitre à travers l’étude de données élémentaires. Elles sont constituées
Précédent : Introduction à la statistique exploratoire multidimensionnelle des moyennes sur dix ans des températures moyennes mensuelles de 32 villes
Suivant : Analyse canonique des corrélations françaises. La matrice initiale X est donc (32 × 12). Les colonnes sont l’ob-
servation à différents instants d’une même variable ; elles sont homogènes et il
Travaux pratiques de complexité croissante par l’études de données de tem-
est inutile de les réduire.
pératures puis de données socio économiques cubiques.
L’ACP joue dans ce cours un rôle central ; cette méthode sert de fondement
théorique aux autres méthodes de statistique multidimensionnelle dites facto-
1 introduction rielles qui en apparaissent comme des cas particuliers. Cette méthode est donc
Lorsqu’on étudie simultanément un nombre important de variables quantita- étudiée en détail et abordée avec différents niveaux de lecture. La première
tives (ne serait-ce que 4 !), comment en faire un graphique global ? La difficulté section présente les grands principes de façon très élémentaire, voire intuitive,
vient de ce que les individus étudiés ne sont plus représentés dans un plan, es- tandis que les suivantes explicitent les expressions matricielles des résultats.
pace de dimension 2, mais dans un espace de dimension plus importante (par D’un point de vue plus “mathématique”, l’ACP correspond à l’approxima-
exemple 4). L’objectif de l’Analyse en Composantes Principales (ACP) est tion d’une matrice (n, p) par une matrice de même dimensions mais de ranq
de revenir à un espace de dimension réduite (par exemple 2) en déformant le q < p (cf. rappels d’algèbre linéaire) ; q étant souvent de petite valeur 2, 3 pour
moins possible la réalité (cf. l’introduction élémentaire à l’ACP). Il s’agit donc la construction de graphiques facilement compréhensibles.
d’obtenir le résumé le plus pertinent possible des données initiales.
C’est la matrice des variances-covariances (ou celle des corrélations) qui va 2 Espaces vectoriels
permettre de réaliser ce résumé pertinent, parce qu’on analyse essentiellement
la dispersion des données considérées. De cette matrice, on va extraire, par
un procédé mathématique adéquat, les facteurs que l’on recherche, en petit
nombre. Ils vont permettre de réaliser les graphiques désirés dans cet espace
de petite dimension (le nombre de facteurs retenus), en déformant le moins
possible la configuration globale des individus selon l’ensemble des variables
initiales (ainsi remplacées par les facteurs).

Précédente Suivante Première Dernière Retour Quitter


2 Analyse en Composantes Principales (ACP)

2.1 Notations statistiques des propriétés et résultats mathématiques.


Soit p variables statistiques réelles X j (j = 1, . . . , p) observées sur n indi- Moyenne empirique de X j : xj =
0
Xej , 1n D = ej X0 D1n .
vidus i (i = 1, . . . , n) affectés des poids wi : Barycentre des individus : x = X0 D1n .
n Matrice des données centrées : X = X − 1n x0 .
X 0
∀i = 1, . . . , n : wi > 0 et wi = 1 ; Ecart-type de X j : σj = (xj Dxj )1/2 = xj D .
0
i=1 Covariance de X j et X k : xj Dxk = xj , xk D .
n 0
∀i = 1, . . . , n : xji
P
= X j (i), mesure de X j sur le ième individu. Matrice des covariances : S = i=1 wi (xi − x)(xi − x)
0
= X DX.
Ces mesures sont regroupées dans une matrice X d’ordre (n × p). hxj ,xk iD
Corrélation de X j et X k : kxj kD kxk kD
= cos θD (xj , xk ).
X1 ··· Xj ··· Xp
Attention : Par souci de simplicité des notations, on désigne toujours par xj
1 x11 ··· xj1 ··· xp1
.. .. .. .. les colonnes de la matrice centrée X. On considère donc que des vecteurs
. . . . “variables” sont toujours centrés.
i x1i ··· xji ··· xpi Ainsi, lorsque les variables sont centrées et représentées par des vecteurs de
.. .. .. ..
. . . . F:
n x1n ··· xjn ··· xpn – la longueur d’un vecteur représente un écart-type,
– le cosinus d’un angle entre deux vecteurs représente une corrélation.
– À chaque individu i est associé le vecteur xi contenant la i-ème ligne de
2.3 Objectifs
X mise en colonne. C’est un élément d’un espace vectoriel noté E de
dimension p ; nous choisissons Rp muni de la base canonique E et d’une Les objectifs poursuivis par une ACP sont :
métrique de matrice M lui conférant une structure d’espace euclidien : – la représentation graphique “optimale” des individus (lignes), minimisant
E est isomorphe à (Rp , E, M); E est alors appelé espace des individus. les déformations du nuage des points, dans un sous-espace Eq de dimen-
– À chaque variable X j est associé le vecteur xj contenant la j-ème co- sion q (q < p),
lonne centrée (la moyenne de la colonne est retranchée à toute la colonne) – la représentation graphique des variables dans un sous-espace Fq en ex-
de X. C’est un élément d’un espace vectoriel noté F de dimension n ; plicitant au “mieux” les liaisons initiales entre ces variables,
nous choisissons Rn muni de la base canonique F et d’une métrique de – la réduction de la dimension (compression), ou approximation de X par
matrice D diagonale des poids lui conférant une structure d’espace eucli- un tableau de rang q (q < p).
dien : F est isomorphe à (Rn , F, D) avec D = diag(w1 , . . . , wn ); F est Les derniers objectifs permettent d’utiliser l’ACP comme préalable à une
alors appelé espace des variables. autre technique préférant des variables orthogonales (régression linéaire) ou
un nombre réduit d’entrées (réseaux neuronaux).
2.2 Métrique des poids
Des arguments de type géométrique dans la littérature francophone, ou bien
L’utilisation de la métrique des poids dans l’espace des variables F donne de type statistique avec hypothèses de normalité dans la littérature anglo-
un sens très particulier aux notions usuelles définies sur les espaces euclidiens. saxonne, justifient la définition de l’ACP. Nous adoptons ici une optique in-
Ce paragraphe est la clé permettant de fournir les interprétations en termes termédiaire en se référant à un modèle “allégé” car ne nécessitant pas d’hypo-

Précédente Suivante Première Dernière Retour Quitter


3 Analyse en Composantes Principales (ACP)

thèse “forte” sur la distribution des observations (normalité). Plus précisément, revient donc à réduire la dimension.
l’ACP admet des définitions équivalentes selon que l’on s’attache à la repré- Si les zi sont considérés comme aléatoires, le modèle est alors dit struc-
sentation des individus, à celle des variables ou encore à leur représentation turel ; on suppose que {x , . . . , x } est un échantillon statistique i.i.d. Les
1 n
simultanée. unités statistiques jouent des rôles symétriques, elles ne nous intéressent que
pour l’étude des relations entre les variables. On retrouve alors le principe de
3 Modèle l’analyse en facteurs (ou en facteurs communs et spécifiques, ou factor analy-
sis).
Les notations sont celles du paragraphe précédent :
– X désigne le tableau des données issues de l’observation de p variables 3.1 Estimation
quantitatives X j sur n individus i de poids wi ,
P ROPOSITION 1. — L’estimation des paramètres de (1) est fournie par l’ACP
– E est l’espace des individus muni de la base canonique et de la métrique
de (X, M, D) c’est-à-dire par la décomposition en valeurs singulières de
de matrice M,
(X, M, D) :
– F est l’espace des variables muni de la base canonique et de la métrique q
des poids D = diag(w1 , . . . , wn ).
X 1/2 0
Z
cq = λk uk vk = Uq Λ1/2 Vq0 .
De façon générale, un modèle s’écrit : k=1

Observation = Modèle + Bruit


Preuve
assorti de différents types d’hypothèses et de contraintes sur le modèle et sur Sans hypothèse sur la distribution de l’erreur, une estimation par les moindres carrés
le bruit. conduit à résoudre le problème :
En ACP, la matrice des données est supposée être issue de l’observation de ( n )
n vecteurs aléatoires indépendants {x1 , . . . , xn }, de même matrice de cova- X 2
min wi kxi − zi kM ; dim(Eq ) = q, zi − z ∈ Eq . (2)
riance σ 2 Γ, mais d’espérances différentes zi , toutes contenues dans un sous- Eq ,zi
i=1
espace affine de dimension q (q < p) de E. Dans ce modèle, E(xi ) = zi
est un paramètre spécifique attaché à chaque individu i et appelé effet fixe, le Soit X = X − 1n x0 la matrice centrée et Z la matrice (n × p) dont les lignes sont
modèle étant dit fonctionnel. Ceci s’écrit en résumé : les vecteurs (zi − z)0 .
n n
{xi ; i = 1, . . . , n}, n vecteurs aléatoires indépendants de E, X X
 2 wi kxi − zi k2M = wi kxi − x + z − zi k2M + kx − zk2M ;
E(εi ) = 0, var(εi ) = σ Γ,
xi = zi + εi , i = 1, . . . , n avec (1) i=1 i=1
σ > 0 inc. Γ rég. et connue,
∃Aq , sous-espace affine de dim. q de E tel que ∀i, zi ∈ Aq (q < p). z = x et devient équivalent à résoudre :
le problème (2) conduit alors à prendre b
Pn
Soit z = i=1 wi zi . Les hypothèses du modèle entraînent que z appartient à n o
min X − Z M,D ; Z ∈ Mn,p , rang(Z) = q . (3)
Aq . Soit donc Eq le sous-espace vectoriel de E de dimension q tel que : Z

La fin de la preuve est une conséquence immédiate du théorème d’approximation ma-


Aq = z + Eq .
tricielles (cf. rappels d’algèbre linéaire). 2
0
Les paramètres à estimer sont alors Eq et zi , i = 1, . . . , n, éventuellement – Les uk sont les vecteurs propres D-orthonormés de la matrice XMX D
σ ; zi est la part systématique, ou effet, supposée de rang q ; éliminer le bruit associés aux valeurs propres λk rangées par ordre décroissant.

Précédente Suivante Première Dernière Retour Quitter


4 Analyse en Composantes Principales (ACP)

– Les vk , appelés vecteurs principaux, sont les vecteurs propres M- 3.2 Autre définition
0
orthonormés de la matrice X DXM = SM associés aux mêmes valeurs
On considère p variable statistiques centrées X 1 , . . . , X p . Une combinaison
propres ; ils engendrent des s.e.v. de dimension 1 appelés axes principaux.
linéaire de coefficients fj de ces variables,
Les estimations sont donc données par :
Xp
c = fj xj = Xf ,
z = x,
b
j=1
q
X 0 0
Z
cq = λ1/2 uk vk = Uq Λ1/2 Vq0 = XP
cq , définit une nouvelle variable centrée C qui, à tout individu i, associe la “me-
k=1 sure”
C(i) = (xi − x)0 f .
où P
cq = Vq Vq0 M est la matrice de projection
M-orthogonale sur E
cq , P ROPOSITION 2. — Soient p variables quantitatives centrées X 1 , . . . , X p ob-
servées sur n individus de poids wi ; l’ACP de (X, M, D) est aussi la re-
E
cq = vect{v1 , . . . , vq }, cherche des q combinaisons linéaires normées des X j , non corrélées et dont
E
c2 est appelé plan principal, la somme des variances soit maximale.
zbi = P
cq xi + x. – Les vecteurs f k = Mvk sont les facteurs principaux. Ils permettent de
définir les combinaisons linéaires des X j optimales au sens ci-dessus.
– Les vecteurs ck = Xf k sont les composantes principales.
Remarques
– Les variables C k associées sont centrées, non corrélées et de variance λk ;
i. Les solutions sont emboîtées pour q = 1, . . . , p : ce sont les variables principales ;
0 0
cov(C k , C ` ) = (Xf k ) DXf ` = f k Sf `
E1 = vect{v1 } ⊂ E2 = vect{v1 , v2 } ⊂ E3 = vect{v1 , v2 , v3 } ⊂ . . . 0 0
= vk MSMv` = λ` vk Mv` = λ` δk` .
– Les f k sont les vecteurs propres M−1 -orthonormés de la matrice MS.
ii. Les espaces principaux sont uniques sauf, éventuellement, dans le cas de
– La matrice
valeurs propres multiples.
C = XF = XMV = UΛ1/2
iii. Si les variables ne sont pas homogènes (unités de mesure différentes, va- est la matrice des composantes principales.
riances disparates), elles sont préalablement réduites : – Les axes définis par les vecteurs D-orthonormés uk sont appelés axes
factoriels.
e = XΣ−1/2 où Σ = diag (σ 2 , . . . , σ 2 ), avec σ 2 = Var (X j ) ;
X 1 p j
4 Graphiques
e est alors la matrice R = Σ−1/2 SΣ−1/2 des corrélations.
S
4.1 Individus
Sous l’hypothèse que la distribution de l’erreur est gaussienne, une estima-
Les graphiques obtenus permettent de représenter “au mieux” les distances
tion par maximum de vraisemblance conduit à la même solution.
euclidiennes inter-individus mesurées par la métrique M.

Précédente Suivante Première Dernière Retour Quitter


5 Analyse en Composantes Principales (ACP)

4.1.1 Projection 4
3
Chaque individu i représenté par xi est approché par sa projection M- 2
1
orthogonale zbi q sur le sous-espace E cq engendré par les q premiers vecteurs
0
1 q
principaux {v , . . . , v }. En notant ei un vecteur de la base canonique de E, A
x -1
la coordonnée de l’individu i sur vk est donnée par : e -2
2 -3
xi − x, vk M
= (xi − x)0 Mvk = e0i XMvk = cki . -4
-5
-6
-7
P ROPOSITION 3. — Les coordonnées de la projection M-orthogonale de xi − -8
x sur E
cq sont les q premiers élément de la i-ème ligne de la matrice C des
-10 0 10 20
composantes principales. Axe 1

4.1.2 Qualités
F IGURE 1 – Températures : premier plan des individus.
La “qualité globale” des représentations est mesurée par la part de disper-
sion expliquée :
Pq 4.1.3 Contributions
trSMP cq λk
rq = = Pk=1p .
trSM k=1 λk
Les contributions de chaque individu à l’inertie de leur nuage
2 Pp
Remarque. — La dispersion d’un nuage de points unidimensionnel par rapport wi kxi − xkM wi k=1 (cki )2
γi = = Pp ,
à sa moyenne se mesure par la variance. Dans le cas multidimensionnel, la trSM k=1 λk
dispersion du nuage N par rapport à son barycentre x se mesure par l’inertie,
ainsi qu’à la variance d’une variable principale
généralisation de la variance :
n wi (cki )2
X 2 2 0 γik = ,
Ig (N ) = wi kxi − xkM = X M,D = tr (X DXM) = tr (SM). λk
i=1
permettent de déceler les observations les plus influentes et, éventuellement,
La qualité de la représentation de chaque xi est donnée par le cosinus carré aberrantes. Ces points apparaissent visiblement lors du tracé des diagrammes-
de l’angle qu’il forme avec sa projection : boîtes parallèles des composantes principales qui évitent ainsi une lecture fas-
2 tidieuse de ce tableau des contributions. En effet, ils se singularisent aussi
cq (xi − x)
P Pq comme “outliers” hors de la boîte (au delà des moustaches) correspondant à
q 2 M (cki )2
[cos θ(xi − x, zbi )] = 2 = Pk=1
p k 2
. une direction principale. Les individus correspondants, considérés comme in-
kxi − xkM k=1 (ci ) dividus supplémentaires, peuvent être éliminés lors d’une nouvelle analyse.
Pour éviter de consulter un tableau qui risque d’être volumineux (n lignes), 4.1.4 Individus supplémentaires
les étiquettes de chaque individu sont affichées sur les graphiques avec des ca-
ractères dont la taille est fonction de la qualité. Un individu très mal représenté Il s’agit de représenter, par rapport aux axes principaux d’une analyse, des
est à la limite de la lisibilité. individus qui n’ont pas participé aux calculs de ces axes. Soit s un tel vecteur,

Précédente Suivante Première Dernière Retour Quitter


6 Analyse en Composantes Principales (ACP)

il doit être centré, éventuellement réduit, puis projeté sur le sous-espace de 4.2.3 Corrélations variables×facteurs
représentation. Les coordonnées sont fournies par :
Ces indicateurs aident à l’interprétation des axes factoriels en exprimant les
0 0 corrélations entre variables principales et initiales.
vk , Vq Vq0 M(s − x) M = vk MVq Vq0 M(s − x) = ek Vq0 M(s − x).

Les coordonnées d’un individu supplémentaire dans la base des vecteurs prin- j k j k j k
xj , uk D λk k
cor(X , C ) = cos θ(x , c ) = cos θ(x , u ) = jk
= vj ;
cipaux sont donc : kx D σ j
Vq0 M(s − x).
ce sont les éléments de la matrice Σ−1/2 VΛ1/2 .
4.2 Variables 4.2.4 Cercle des corrélations
Les graphiques obtenus permettent de représenter “au mieux” les corréla- ej = σ −1 xj , x
Dans le cas de variables réduites x ej D = 1, les x
ej sont sur la
tions entre les variables (cosinus des angles) et, si celles-ci ne sont pas réduites, sphère unité S de F . L’intersection S ∩ jF est un cercle centré sur l’origine
n n 2
leurs variances (longueurs). et de rayon 1 appelé cercle des corrélations. Les projections de x ej et xj sont
j
4.2.1 Projection colinéaires, celle de x
e étant à l’intérieur du cercle :

Une variable X j est représentée par la projection D-orthogonale Q


cq xj sur Q ej
c2 x = cos θ(xj , Q
c2 xj ) ≤ 1.
D
le sous-espace Fq engendré par les q premiers axes factoriels. La coordonnée
de xj sur uk est : Ainsi, plus Q
c2 xej est proche de ce cercle, meilleure est la qualité de sa repré-
0 1 0
sentation. Ce graphique est commode à interpréter à condition de se méfier
xj , uk D = xj Duk = √ xj DXMvk des échelles, le cercle devenant une ellipse si elles ne sont pas égales. Comme
λk
pour les individus, la taille des caractères est aussi fonction de la qualité des
1 0 0 p
= √ ej X DXMvk = λk vjk . représentations.
λk
4.3 Biplot
P ROPOSITION 4. — Les coordonnées de la projection D-orthogonale de xj À partir de la décomposition en valeurs singulières de (X, M, D), on re-
sur le sous-espace Fq sont les q premiers éléments de la j-ème ligne de la marque que chaque valeur
1/2
matrice VΛ . Xp h ij
xji − xj =
p
λk uki vkj = UΛ1/2 V0
i
4.2.2 Qualité k=1

La qualité de la représentation de chaque xj est donnée par le cosinus carré s’exprime comme produit scalaire usuel des vecteurs
de l’angle qu’il forme avec sa projection : h i h i
ci = UΛ1/2 et vj ou encore ui et VΛ1/2 .
2 i j
i2 cq xj
Q Pq j 2
h λ (v
k k )
cos θ(xj , Q
cq xj ) =
2
D
= Pk=1
p j 2
. Pour q = 2, la quantité zbi j en est une approximation limitée aux deux premiers
kxj kD λ
k=1 k k(v ) termes.

Précédente Suivante Première Dernière Retour Quitter


7 Analyse en Composantes Principales (ACP)

Cette remarque permet d’interpréter deux autres représentations graphiques


en ACP projetant simultanément individus et variables.
1.0 i. la représentation isométrique ligne utilise les matrices C et V ; elle per-
met d’interpréter les distances entre individus ainsi que les produits sca-
0.5 laires entre un individu et une variable qui sont, dans le premier plan
A principal, des approximations des valeurs observées X j (ωi ) ;
x
e 0.0 ii. la représentation isométrique colonne utilise les matrices U et VΛ1/2 ;
elle permet d’interpréter les angles entre vecteurs variables (corrélations)
2
et les produits scalaires comme précédemment.
-0.5
Remarques
i. Dans le cas fréquent où M = Ip et où les variables sont réduites, le point
-1.0 représentant X j , en superposition dans l’espace des individus se confond
-1.0 -0.5 0.0 0.5 1.0 avec un pseudo individu supplémentaire qui prendrait la valeur 1 (écart-
Axe 1 type) pour la variable j et 0 pour les autres.
ii. En pratique, ces différents types de représentations (simultanées ou non)
ne diffèrent que par un changement d’échelle sur les axes ; elles sont très
voisines et suscitent souvent les mêmes interprétations. L’usage théori-
quement abusif (figure ??) fait finalement superposer les deux représen-
1.0 tations isométriques lignes et colonnes.

0.5 5 Choix de dimension


A
x La qualité des estimations auxquelles conduit l’ACP dépend, de façon évi-
e 0.0
dente, du choix de q, c’est-à-dire du nombre de composantes retenues pour
3 reconstituer les données, ou encore de la dimension du sous-espace de repré-
-0.5 sentation.
De nombreux critères de choix pour q ont été proposés dans la littérature.
-1.0 Nous présentons ici ceux, les plus courants, basés sur une heuristique et un re-
posant sur une quantification de la stabilité du sous-espace de représentation.
-1.0 -0.5 0.0 0.5 1.0 D’autres critères, non explicités, s’inspirent des pratiques statistiques décision-
Axe 2 nelles ; sous l’hypothèse que l’erreur admet une distribution gaussienne, on
peut exhiber les lois asymptotiques des valeurs propres et donc construire des
tests de nullité ou d’égalité de ces dernières. Malheureusement, outre la néces-
saire hypothèse de normalité, ceci conduit à une procédure de tests emboîtés
F IGURE 2 – Températures : Premier et deuxième plan des variables. dont le niveau global est incontrôlable. Leur utilisation reste donc heuristique.

Précédente Suivante Première Dernière Retour Quitter


8 Analyse en Composantes Principales (ACP)

5.1 Part d’inertie


La “qualité globale” des représentations est mesurée par la part d’inertie
expliquée :
Pq
λk
rq = Ppk=1 .
k=1 λk

−10 −5 0 5 10 15 20 La valeur de q est choisie de sorte que cette part d’inertie expliquée rq soit
supérieure à une valeur seuil fixée a priori par l’utilisateur. C’est souvent le
0.6

20
bres seul critère employé.

5.2 Règle de Kaiser

15
0.4

On considère que, si tous les éléments de Y sont indépendants, les compo-

10
biar santes principales sont toutes de variances égales (égales à 1 dans le cas de
renn
0.2

l’ACP réduite). On ne conserve alors que les valeurs propres supérieures à leur
Comp.2

roue
janv
dece nant
ange lill moyenne car seules jugées plus “informatives” que les variables initiales ; dans

5
toul
fevr
ajac
nove ango limo stqu le cas d’une ACP réduite, ne sont donc retenues que celles plus grandes que 1.
mars
octo tourorle
0.0

pari reim Ce critère, utilisé implicitement par SAS/ASSIST, a tendance à surestimer le

0
nice bord
sept avri tlse clervich nombre de composantes pertinentes.
perp mai nanc
besa
−5
juin
aout
juilmont
−0.2

mars dijoembr
gren 5.3 Éboulis
nime lyon stra
−10

C’est le graphique (figures 4) présentant la décroissance des valeurs propres.


Le principe consiste à rechercher, s’il existe, un “coude” (changement de signe
dans la suite des différences d’ordre 2) dans le graphe et de ne conserver que
−0.2 0.0 0.2 0.4 0.6 les valeurs propres jusqu’à ce coude. Intuitivement, plus l’écart (λq − λq+1 )
est significativement grand, par exemple supérieur à (λq−1 − λq ), et plus on
Comp.1 peut être assuré de la stabilité de E
cq .

5.4 Diagrammes boîtes


F IGURE 3 – Températures : Représentation simultanée ou biplot du premier
Un graphique (figure 5 ) présentant, en parallèle, les diagrammes boîtes des
plan.
variables principales illustre bien leurs qualités : stabilité lorsqu’une grande
boîte est associée à de petites moustaches, instabilité en présence d’une petite
boîte, de grandes moustaches et de points isolés. Intuitivement, on conserve
les premières “grandes boîtes”. Les points isolés ou “outliers” désignent les
points à forte contribution, ou potentiellement influents, dans une direction
principale. Ils nécessitent une étude clinique : une autre analyse dans laquelle

Précédente Suivante Première Dernière Retour Quitter


9 Analyse en Composantes Principales (ACP)

PCTVAR CC
1.0 20
0.8
0.6 10

0.4
0
0.2
0.0
-10
0 1 2 3 4 5 6 7 8 9 1 1 1
0 1 2 0 1 2 3 4 5 6 7 8 9 10 11 12
K K

F IGURE 4 – Températures : éboulis des valeurs propres. F IGURE 5 – Températures : composantes en boîtes.

ils sont déclarés supplémentaires (poids nuls) afin d’évaluer leur impact sur estimation E cq .
l’orientation des axes.
Un risque moyen quadratique est alors défini en prenant l’espérance de la
5.5 Stabilité fonction perte :
Rq = EQ(Eq , E cq ). (4)
La présentation de l’ACP, comme résultat de l’estimation d’un modèle, offre
une autre approche au problème du choix de dimension. La qualité des estima- Sans hypothèse sur la distribution de l’erreur, seules des techniques de ré-
tions est évaluée de façon habituelle en statistique par un risque moyen quadra- échantillonnage (bootstrap, jackknife) permettent de fournir une estimation de
tique définissant un critère de stabilité du sous-espace de représentation. Il est ce risque moyen quadratique. Leur emploi est justifié, car le risque est inva-
défini comme l’espérance d’une distance entre le modèle “vrai” et l’estimation riant par permutation des observations, mais coûteux en temps de calcul. On
qui en est faite. Besse (1992) propose d’étudier la qualité de l’estimation du se pose donc la question de savoir pour quelles valeurs de q les représentations
sous-espace de représentation E cq en considèrant la fonction perte : graphiques sont fiables, c’est-à-dire stables pour des fluctuations de l’échan-
2
tillon. Besse (1992) propose d’utiliser une approximation de l’estimateur par
1
Lq = Q(Eq , Eq ) =
c Pq − Pqc = q − trPq Pq ,
c jackknife ; elle fournit, directement à partir des résultats de l’A.C.P. (valeurs
2 M,D propres et composantes principales), une estimation satisfaisante du risque :
où Q mesure la distance entre deux sous-espaces par la distance usuelle entre
−2
R JKq = RPq + O((n − 1) ).
les matrices de projection qui leur sont associées. C’est aussi la somme des \ d
carrés des coefficients de corrélation canonique entre les ensembles de com-
posantes ou de variables principales qui engendrent respectivement Eq et son RdPq est une approximation analytique de l’estimateur jackknife qui a pour

Précédente Suivante Première Dernière Retour Quitter


10 Analyse en Composantes Principales (ACP)

précédents mais souvent, en pratique, le critère de stabilité conduit à un choix


3.0 de dimension plus explicite.

6 Interprétation
2.5
2.0

Les macros SAS utilisées, de même que la plupart des logiciels, proposent,
ou autorisent, l’édition des différents indicateurs (contributions, qualités, cor-
1.5

rélations) et graphiques définis dans les paragraphes précédents.


– Les contributions permettent d’identifier les individus très influents pou-
1.0

vant déterminer à eux seuls l’orientation de certains axes ; ces points sont
vérifiés, caractérisés, puis éventuellement considérés comme supplémen-
0.5

taires dans une autre analyse.


– Il faut choisir le nombre de composantes à retenir, c’est-à-dire la dimen-
0.0

1 2 3 4 5 6 7 8 9 10 11 12 sion des espaces de représentation.


– Les axes factoriels sont interprétés par rapport aux variables initiales bien
représentées.
F IGURE 6 – Températures : stabilité des sous-espaces. – Les graphiques des individus sont interprétés, en tenant compte des quali-
tés de représentation, en termes de regroupement ou dispersions par rap-
port aux axes factoriels et projections des variables initiales.
expression :
Les quelques graphiques présentés suffisent, dans la plupart des cas, à l’in-
q p Pn j terprétation d’une ACP classique et évitent la sortie volumineuse, lorsque n
1 X X n1 i=1 (cki )2 (ci )2
RdPq = 2
(5) est grand, des tableaux d’aide à l’interprétation (contributions, cosinus car-
n−1 (λj − λk )
k=1 j=q+1 rés). On échappe ainsi à une critique fréquente, et souvent justifiée, des anglo-
saxons vis-à-vis de la pratique française de “l’analyse des données” qui, para-
où cji désigne le terme général de la matrice des composantes principales C. doxalement, cherche à “résumer au mieux l’information” mais produit plus de
Ce résultat souligne l’importance du rôle que joue l’écart (λq − λq+1 ) dans chiffres en sortie qu’il n’y en a en entrée !
la stabilité du sous-espace de représentation. Le développement est inchangé Remarque. — L’ACP est une technique linéaire optimisant un critère qua-
dans le cas d’une ACP réduite ; de plus, il est valide tant que dratique ; elle ne tient donc pas compte d’éventuelles liaisons non linéaires et
2 présente une forte sensibilité aux valeurs extrêmes.
kSk2
n> .
inf {(λk − λk+1 ); k = 1, . . . , q}
7 Exemple : Données génomiques
La figure 6 montrent la stabilité du sous-espace de représentation en fonction
de la dimension q pour l’A.C.P. des données de températures. Comme souvent, L’éboulis des premières valeurs propres (figure 7) conduit à considérer trois
le premier axe est très stable tandis que le premier plan reste fiable. Au delà, les dimensions représentant environ les deux tiers de l’inertie globale mais nous
axes étant très sensibles à toute perturbation des données, ils peuvent être as- limiterons l’interprétation un peu sommaire au premier plan.
sociés à du bruit. Ces résultats sont cohérents avec les deux critères graphiques La figures 8 et ?? représente conjointement souris et gènes (biplot). Dans le

Précédente Suivante Première Dernière Retour Quitter


11 Analyse en Composantes Principales (ACP)

0.4
0.3
Variances

0.2
0.1
0.0

F IGURE 7 – Souris : éboulis des dix premières valeurs propres de l’ACP.

0.3
0.2
cadre de cette ACP, il est cohérent de rechercher quels sont les 25% des gènes
contribuant le plus à la définition de l’espace propre à trois dimensions jugé CYP4A14

pertinent. Avec cette sélection, la représentation des variables ainsi restreinte à

0.1
CYP3A11
CYP4A10
30 gènes est plus facilement lisible sur le plan fatoriel. Pour des données plus GSTpi2CYP2c29 CAR1
PMDCI PECI
mHMGCoAS ACOTH
volumineuses (puces pangénomiques) d’autres outils (version parcimonieuse GSTmu
G6Pase
AOX SIAT4c
BIEN

PC2

0.0
ALDH3
HPNCL [Link]
VDR
Ntcp
ou creuse de l’ACP) sont à considérer. THIOL
[Link] GSTa
ACBP
LPK
Le premier plan (Fig. 8) doit être interprété globalement puisque sa HMGCoAred
ACC2

−0.1
GKcHMGCoAS
deuxième bissectrice sépare exactement les souris WT des souris PPAR. Les Lpin1
Lpin
gènes à coordonnées négatives sur l’axe 2 et positives sur l’axe1 sont sensible-

−0.2
S14
ment plus exprimés chez les souris WT, en particulier CYP3A11, CYP4A10,
CYP4A14, THIOL, PMDCI, GSTpi2, [Link] et FAS (négatif sur les deux FAS

−0.3
axes). À l’inverse, les gènes à forte coordonnée négative sur l’axe 2 s’ex-
priment davantage chez les souris PPAR, par exemple, S14 et CAR1. Ceci
est en partie connu des biologistes.
−0.3 −0.2 −0.1 0.0 0.1 0.2 0.3
Sur cette représentation, seules les souris WT présentent des comportement
sensiblement différents au regard des régimes. Le phénomène le plus mar- PC1
quant est l’opposition, chez ces souris WT, entre les régimes dha (triangles
noirs), dont les coordonnées sont toutes positives, et efad (triangles rouges),
dont les coordonnées sont toutes négatives. Les gènes les plus exprimés dans F IGURE 8 – Représentations conjointe sur le premier plan principal. Les sou-
le premier cas (régime dha chez les souris WT) sont CYP3A11, CYP4A10, ris identifiés par leur génotype (WT triangles vers le haut, PPAR vers le bas) et
CYP4A14 ; dans le second cas (régime efad chez les mêmes souris), il s’agit leur régime (principalement noir-dha et rouge-efad).
des gènes FAS et S14. Parmi ces régulations, on note une opposition entre les
CYP4A, connus pour être impliqués dans le catabolisme des acides gras, et les
gènes FAS et S14 impliqués eux dans la synthèse des lipides. Par ailleurs, la
régulation de CYP3A11 par le DHA a déjà été décrite dans la littérature.

Précédente Suivante Première Dernière Retour Quitter


1 Analyse factorielle discriminante (AFD)

On note T (n × m) la matrice des indicatrices des modalités de la variable


Analyse factorielle discriminante (AFD) T ; son terme général est

` ` 1 si T (ωi ) = T`
ti = t (ωi ) = .
0 sinon
Résumé En posant X
Méthode facorielle de réduction de dimension pour l’exploration statistique w` = wi ,
de variables quantitatives et d’une variable qualitative. Construction du modèle i∈Ω`
statistique associé, estimation. Représentation graphique optimale des classes il vient
des individus, liens avec d’autres définitions de l’AFD. D = T0 DT = diag(w1 , . . . , wm ).
Précédents : Analyse en composantes principales et Analyse canonique des
corrélations 1.2 Objectifs
Suivant : Analyse factorielle des correspondances Deux techniques cohabitent sous la même appellation d’analyse discrimi-
Travaux pratiques de complexité croissante par l’études de données socio- nante :
économiques. descriptive : cette méthode recherche, parmi toutes les ACP possibles sur les
variables X j , celle dont les représentations graphiques des individus dis-
1 Introduction criminent “au mieux” les m classes engendrées par la variable T (e.g.
recherche de facteurs de risque en statistique médicale) ;
1.1 Données décisionnelle : connaissant, pour un individu donné, les valeurs des Y j mais
pas la modalité de T , cette méthode consiste à affecter cet individu à une
Les données sont constituées de
modalité (e.g. reconnaissance de formes). Cette méthode est décrite dans
– p variables quantitatives X 1 , . . . , X p jouant le rôle de variables explica-
la partie modélisation de ce cours.
tives comme dans le modèle linéaire,
– une variable qualitative T , à m modalités {T1 , . . . , Tm }, jouant le rôle de Remarque. — Lorsque le nombre et les caractéristiques des classes sont
variable à expliquer. connues, il s’agit d’une discrimination ; sinon, on parle de classification ou
La situation est analogue à celle de la régression linéaire multiple mais, encore, avec des hypothèses sur les distributions, de reconnaissance de mé-
comme la variable à expliquer est qualitative, on aboutit à une méthode très langes.
Pnobservées sur l’ensemble Ω des n individus af-
différente. Les variables sont
1.3 Notations
fectés des poids wi > 0, ( i=1 wi = 1), et l’on pose
On note X la matrice (n×p) des données quantitatives, G la matrice (m×p)
D = diag(wi ; i = 1, . . . , n). des barycentres des classes :

g1 0
 
−1 1 X
G = D T0 DX =  ...  où g` = wi xi ,
 
La variable T engendre une partition {Ω` ; ` = 1, . . . , m} de l’ensemble Ω
0
w`
des individus dont chaque élément est d’effectif n` . gm i∈Ω`

Précédente Suivante Première Dernière Retour Quitter


2 Analyse factorielle discriminante (AFD)

et Xe la matrice (n × p) dont la ligne i est le barycentre g` de la classe Ω` à Il faut privilégier la variance interclasse au détriment de la variance intraclasse
laquelle appartient l’individu i : considérée comme due au bruit.

Xe = TG = PG ; En ACP, pour chaque effet zi à estimer, on ne dispose que d’une observation


xi ; dans le cas de l’AFD on considère que les éléments d’une même classe Ω`
−1
P = TD T0 D est la matrice de projection D-orthogonale sur le sous-espace P les observations répétées n` fois du même effet z` pondéré par w` =
sont
engendré par les indicatrices de T ; c’est encore l’espérance conditionnelle i∈Ω` wi . Le modèle devient donc :
sachant T .
Deux matrices “centrées” sont définies de sorte que X se décompose en
{xi ; i = 1, . . . , n}, n vecteurs indépendants
 de E,
X = Xr + Xe E(εi ) = 0, var(εi ) = Γ,
∀`, ∀i ∈ Ω` , xi = z` + εi avec
Γ régulière et inconnue, (1)
avec ∃Aq , sous-espace affine de de dimension q de E tel que
Xr = X − Xe et Xe = Xe − 1n x 0 . ∀`, z` ∈ Aq , (q < min(p, m − 1)).
On note également G la matrice centrée des barycentres : Pm
Remarque. — Soit z = `=1 w` z` . Le modèle entraîne que z ∈ Aq . Soit Eq
0
G = G − 1m x . le sous-espace de dimension q de E tel que Aq = z + Eq . Les paramètres à
estimer sont Eq et {z` ; ` = 1, . . . , m} ; w` est un paramètre de nuisance qui
On appelle alors variance intraclasse (within) ou résiduelle :
ne sera pas considéré.
m X
X
Sr = Xr 0 DXr = wi (xi − g` )(xi − g` )0 , 2.2 Estimation
`=1 i∈Ω`
L’estimation par les moindres carrés s’écrit ainsi :
et variance interclasse (between) ou expliquée :
m (m )
0 0 X
Se = G DG = X e DX e = w` (g` − x)(g` − x)0 . XX 2
min wi kxi − z` k M ; dim(Eq ) = q, z` − z ∈ Eq .
`=1 Eq ,z`
`=1 i∈Ω`

P ROPOSITION 1. — La matrice des covariances se décompose en


Comme on a
S = Se + Sr . m X
X m X
X m
X
2 2 2
wi kxi − z` kM = wi kxi − g` kM + w` kg` − z` kM ,
2 Définition `=1 i∈Ω` `=1 i∈Ω` `=1

on est conduit à résoudre :


2.1 Modèle
(m )
Dans l’espace des individus, le principe consiste à projeter les individus
X 2
min w` kg` − z` kM ; dim(Eq ) = q, z` − z ∈ Eq .
dans une direction permettant de mettre en évidence les groupes. À cette fin, Eq ,z`
`=1

Précédente Suivante Première Dernière Retour Quitter


3 Analyse factorielle discriminante (AFD)

La covariance σ 2 Γ du modèle (1) étant inconnue, il faut l’estimée. Ce mo- 3.2 Représentation des individus
dèle stipule que l’ensemble des observations d’une même classe Ωl suit une loi
(inconnue) de moyenne ze ll et de variance Γ. Dans ce cas particulier, la ma- L’espace des individus est (Rp , b. c., S−1r ). Une représentation simultanée

trice de covariances intraclasse ou matrice des covariances résiduelles empi- des individus xi et des barycentres g` des classes par rapport aux mêmes axes
riques Sr fournit donc une estimation “optimale” de la métrique de référence : discriminants est obtenue dans cet espace au moyen des coordonnées :
−1
C = XSr V pour les individus et
M=Γ b −1 = S−1 −1 0
r
C = GS−1 r V =D T DC pour les barycentres.
.
Les individus initiaux sont projetés comme des individus supplémentaires dans
le système des axes discriminants. Comme en ACP, on peut calculer des cosi-
P ROPOSITION 2. — L’estimation des paramètres Eq et z` du modèle 1 est
nus carrés pour préciser la qualité de représentation de chaque individu.
obtenue par l’ACP de (G, S−1 r , D). C’est l’Analyse Factorielle Discriminante
(AFD) de (X|T, D) . Il est utile de différencier graphiquement la classe de chaque individu afin
de pouvoir apprécier visuellement la qualité de la discrimination.
3 Réalisation de l’AFD 3.3 Représentation des variables
Les expressions matricielles définissant les représentations graphiques et les L’espace des variables est (Rm , b. c., D). Chaque variable X j est représenté
aides à l’interprétation découlent de celles de l’ACP. par un vecteur dont les coordonnées dans le système des axes factoriels est une
ligne de la matrice VΛ1/2 .
3.1 Matrice à diagonaliser
3.4 Interprétations
L’ACP de (G, S−1
r , D) conduit à l’analyse spectrale de la matrice positive
−1 Les interprétations usuelles : la norme est un écart-type, un cosinus d’angle
Sr -symétrique :
G 0 D GS−1r = Se Sr .
−1 est un coefficient de corrélation, doivent être faites en termes d’écarts-types et
de corrélations expliquées par la partition.
Comme S−1 r est régulière, cette matrice est de même rang que Se et donc de
même rang que G qui est de dimension (m × p). Les données étant centrées La représentation des variables est utilisée pour interprétée les axes en fonc-
lors de l’analyse, le rang de la matrice à diagonaliser est tion des variables initiales conjointement avec la matrice des corrélations ex-
pliquées variables×facteurs : Σ−1 e VΛ
1/2
. La matrice Σ−1e étant la matrice
−1
h = rang(Se Sr ) ≤ inf(m − 1, p), j
diagonale des écarts-types expliqués σe c’est-à-dire des racines carrées des
éléments diagonaux de la matrice Se .
qui vaut en général m − 1 c’est-à-dire le nombre de classes moins un.
Le point pratique essentiel est de savoir si la représentation des individus-
On note λ1 ≥ · · · ≥ λh > 0 les valeurs propres de Se S−1 1 h
r et v , . . . , v les barycentres et des individus initiaux permet de faire une bonne discrimination
vecteurs propresS−1 r -orthonormés associés. On pose entre les classes définies par la variable T . Si ce n’est pas le cas, l’AFD ne
1 h
Λ = diag(λ1 , . . . , λh ) et V = [v , . . . , v ]. sert à rien, les X j n’expliquent pas T . Dans le cas favorable, le graphique des
individus permet d’interpréter la discrimination en fonction des axes et, celui
Les vecteurs vk sont appelés vecteurs discriminants et les sous-espaces vecto- des variables, les axes en fonction des variables initiales. La synthèse des deux
riels de dimension 1 qu’ils engendrent dans Rp les axes discriminants. permet l’interprétation de T selon les X j .

Précédente Suivante Première Dernière Retour Quitter


4 Analyse factorielle discriminante (AFD)

4 Variantes de l’AFD suivante :


– matrice à diagonaliser : S∗e S∗−1
r = n−m −1
m−1 Se Sr ,
4.1 Individus de mêmes poids Λ∗ = n−m
– valeurs propres : m−1 Λ,
q
L’AFD peut être définie de différentes façon. Dans la littérature anglo- – vecteurs propres : V∗ = n
n−m V,
saxonne, et donc dans la version standard d’AFD du logiciel SAS (procédure ∗
q
n−m
candisc), ce sont les estimations sans biais des matrices de variances “intra” – représentation des barycentres : C = n C,
q
(within) et “inter” (between) qui sont considérées dans le cas d’individus de – représentation des variables : V∗ Λ∗1/2 = n
m−1 VΛ
1/2
,
mêmes poids 1/n.
– corrélations variables-facteurs : Σ∗−1
e V∗ Λ∗1/2 = −1
Σe VΛ .1/2
Dans ce cas particulier,
Ainsi, les représentations graphiques sont identiques à un facteur d’échelle près
1 1 tandis que les parts de variance expliquée et les corrélations variables-facteurs
D = In et D = diag(n1 , . . . , nm ) où n` = card(Ω` ) sont inchangées.
n n
et les matrices de covariances empiriques ont alors pour termes généraux : 4.2 Métrique de Mahalanobis
1X j
n L’AFD est souvent introduite dans la littérature francophone comme un cas
(S)kj = (x − xj )(xki − xk ), particulier d’Analyse Canonique entre un ensemble de p variables quantitatives
n i=1 i
et un ensemble de m variables indicatrices des modalités de T . La proposition
m
1X suivante établit les relations entre les deux approches :
(Se )kj = n` (g`j − xj )(g`k − xk ),
n
`=1 P ROPOSITION 3. — l’ACP de (G, S−1 r , D) conduit aux mêmes vecteurs prin-
1 Xm X cipaux que l’ACP de (G, S−1 , D). Cette dernière est l’ACP des barycentres
(Sr )kj = (xji − g`j )(xki − g`k ). des classes lorsque l’espace des individus est muni de la métrique dite de Ma-
n
`=1 i∈Ω` halanobis M = S−1 et l’espace des variables de la métrique des poids des
classes D.
Du point de vue de le Statistique inférentielle, on sait que les quantités cal-
culées ci-dessus ont respectivement (n − 1), (m − 1) et (n − m) degrés de Les résultats numériques de l’AFD se trouvent alors modifiés de la façon
liberté. En conséquence, ce point de vue est obtenu en remplaçant dans les suivante :
calculs – matrice à diagonaliser : Se S−1 ,
n – valeurs propres : Λ(I + Λ)−1 ,
S par S∗ = S, – vecteurs propres : V(I + Λ)1/2 ,
n−1
n – représentation des barycentres : C(I + Λ)−1/2 ,
Se par S∗e = B = Se ,
m−1 – représentation des variables : VΛ1/2 ,
n – corrélations variables-facteurs : Σ−1 1/2
Sr par S∗r = W = Sr . e VΛ .
n−m
Les représentations graphiques des individus (voir ci-dessus) ne diffèrent
Les résultats numériques de l’AFD se trouvent alors modifiés de la façon alors que d’une homothétie et conduisent à des interprétations identiques, les

Précédente Suivante Première Dernière Retour Quitter


5 Analyse factorielle discriminante (AFD)

3 5

2
4

3
1
2
A 0 A
x
e x 1
2
e
-1
2 0

-2 -1

-2
-3

-3
-4

-4 -3 -2 -1 0 1 2 3 4
-4
Axe 1 -8 -7 -6 -5 -4 -3 -2 -1 0 1 2 3 4 5 6 7
Axe 1

F IGURE 1 – Insectes : premier plan factoriel de l’ACP.


F IGURE 2 – Insectes : premier plan factoriel de l’AFD.

5.2 Données génomiques


corrélations variables-facteurs ainsi que les représentations des variables sont Les données génomiques pose évidemment des problèmes à l’analyse dis-
inchangées. criminante ; le grand nomnre de gènes/variables par rapport au nombre de sou-
ris/individus rend impossible l’inversion de la matrice des covriances intra-
classes. Aussi, en s’aidant de la sélection de variables suggérée par l’analyse
5 Exemples en composantes principales, une analyse factorielle dsicriminante a été calcu-
lée sur les seules souris sauvages (WR) pour qui les régimes apparaissaient déjà
5.1 Les insectes de Lubitsch
bien différenciés sur l’ACP. Les variables ne sont pas représentées mais les
Cette méthode est illustrée par une comparaison des sorties graphiques is- rapprochements déjà évoqués pour l’ACP sont confirmés et précisés.
sues d’une ACP et d’une AFD. Les données décrivent trois classes d’insectes
sur lesquels ont été réalisées 6 mesures anatomiques. On cherche à savoir si
ces mesures permettent de retrouver la typologie de ces insectes. Ce jeu de
données “scolaire”, comme les fameux iris de Fisher conduit à une discrimina-
tion assez évidente. La comparaison entre l’ACP et l’AFD met clairement en
évidence le rôle de la distance S−1
R que la forme des nuages de chaque classe
en analyse discriminante.

Précédente Suivante Première Dernière Retour Quitter


6 Analyse factorielle discriminante (AFD)

9
4

15
4
dha
esol
2
Dim 2 (15.55 %)

218 12
1
efad
111013
ref8
0

lin 17
5 7 16
14 20 6
tournesol 19
−2

3
−4

−6 −4 −2 0 2 4 6

Dim 1 (44.91 %)

F IGURE 3 – Souris : Les souris de génotype WT dans le premier plan facto-


riel de l’AFD calculée avec une sélection de variables d’expression de gènes
conditionnellement au régime.

Précédente Suivante Première Dernière Retour Quitter


1 Analyse canonique des corrélations (ACC)

lons également qu’il existe certaines généralisations de l’A.C. à plus de deux


Analyse canonique des corrélations groupes de variables quantitatives et qu’elles permettent de retrouver l’analyse
des correspondances multiples (en remplaçant chaque groupe par les indica-
(ACC) trices d’une variable qualitative), ainsi que l’A.C.P. (en ne mettant qu’une seule
variable quantitative dans chaque groupe). Nous ne nous intéresserons ici qu’à
l’A.C. classique, entre deux groupes de variables quantitatives.
Résumé En dépit de sa place centrale au sein des méthodes de statistique multidi-
mensionnelle, pendant longtemps, l’A.C. n’était pas (ou très peu) enseignée
Méthode facorielle de réduction de dimension pour l’exploration statistique
dans ces cursus, compte tenu du petit nombre d’applications auxquelles elle
de deux ensembles de données quantitatives observées sur les mêmes indi-
donnait lieu. Les choses ont changé, d’abord vers le milieu des années 1990,
vidus. Représentations graphiques des individus, des variables et simultanée.
avec le développement de la régression P.L.S. (partial least squares), méthode
Lien avec la régression multivairée et les tests associés.
assez voisine de l’A.C., ensuite, plus récemment, avec l’apparition des don-
Précédent : Analyse en composantes principales nées de biopuces, dont certaines relèvent typiquement de l’A.C. quant à leur
Suivant : Analyse factorielle discriminante traitement.
Le logiciel statistique SAS dispose d’une procédure assez complète dédiée à
1 Introduction l’A.C. : CANCORR. Divers développements de ce chapitre ont pour objectif de
mieux saisir la signification de certaines sorties de cette procédure. Les com-
L’analyse canonique (A.C.) est une méthode de statistique descriptive mul- mandes R permettant de mettre en œuvre l’A.C., telles qu’elles seront présen-
tidimensionnelle qui présente des analogies à la fois avec l’analyse en com- tées dans les T.P., ont été quelque peu calquées sur le principe de la procédure
posantes principales (A.C.P.), pour la construction et l’interprétation de gra- CANCORR.
phiques, et avec la régression linéaire, pour la nature des données. L’objec-
tif général de l’A.C. est d’explorer les relations pouvant exister entre deux 2 Approche élémentaire
groupes de variables quantitatives observées sur le même ensemble d’indivi-
dus. L’étude des relations entre deux groupes de variables constitue la princi- 2.1 Exemple : nutrition chez la souris
pale particularité de l’A.C. par rapport à l’A.C.P. De ce point de vue, l’A.C.
est d’avantage proche de la régression linéaire multiple (explication d’une va- C’est encore l’exemple de la nutrition chez la souris qui sera utilisé pour
riable quantitative par un ensemble d’autres variables quantitatives), méthode illustrer l’A.C. Nous disposons donc des 40 souris sur lesquelles on s’intéresse
dont elle constitue, d’ailleurs, une généralisation (on retrouve la régression maintenant à deux catégories de mesures (de variables) : les expressions des
lorsqu’un des deux groupes de l’A.C. ne comporte qu’une seule variable). 120 gènes considérés et les proportions de 21 acides gras hépatiques. La ques-
En fait, l’analyse canonique est, sur le plan théorique, la méthode centrale tion qui va être abordée ici est celle des relations entre ces deux ensembles
de la statistique descriptive multidimensionnelle, dans la mesure où elle gé- de variables : certains acides gras sont-ils plus présents lorsque certains gènes
néralise diverses autres méthodes. Outre la régression linéaire, l’A.C. redonne sont surexprimés, ou le contraire... La réponse sera essentiellement fournie par
en effet l’analyse factorielle discriminante lorsqu’un des deux groupes de va- les graphiques produits par l’A.C. et dans lesquels seront simultanément repré-
riables est remplacé par les indicatrices d’une variable qualitative. Elle redonne sentés gènes et acides gras : il s’agira donc de graphiques relatifs aux variables.
également l’analyse factorielle des correspondances lorsque chacun des deux Notons tout de suite qu’il n’est pas très courant de représenter les individus
groupes est remplacé par les indicatrices d’une variable qualitative. Signa- en A.C. Toutefois, compte tenu des particularités de l’exemple considéré ici

Précédente Suivante Première Dernière Retour Quitter


2 Analyse canonique des corrélations (ACC)

(petit nombre d’observations et structuration de ces observations selon les fac- ment, nous avons ici : n = 40 ; p = 10 ; q = 11.
teurs “génotype” et “régime”), nous réaliserons ces graphiques et nous verrons
quel est leur intérêt. 2.3 Principe général de la méthode
2.2 Notations Chaque variable de chacun des deux groupes (les 10 gènes et les 11 acides
gras) sont mesurées sur les n individus (n = 40). On peut donc associer à
Dans toute la suite de ce chapitre, on notera n le nombre d’individus consi- chacune un ensemble de 40 valeurs, autrement dit un vecteur de R40 (espace
dérés (autrement dit, la taille de l’échantillon observé, ici 40), p le nombre de vectoriel que l’on a préalablement muni d’une base adéquate et d’une métrique
variables (quantitatives) du premier groupe (les gènes) et q le nombre de va- appropriée). C’est dans cet espace (R40 ) que l’on peut définir la méthode :
riables (également quantitatives) du second groupe (les acides gras). On dési- elle consiste à rechercher le couple de vecteurs, l’un lié aux gènes, l’autres
gnera par X la matrice, de dimension n×p, contenant les observations relatives aux acides, les plus correlés possible. Ensuite, on recommence en cherchant
au premier groupe de variables et par Y la matrice, de dimension n × q, conte- un second couple de vecteurs non correlés aux vecteurs du premier et le plus
nant celles relatives au second groupe. La j-ième colonne de X (j = 1, . . . , p) correlés entre eux, et ainsi de suite. La démarche est donc similaire à celle
contient donc les observations xji de la j-ième variable du premier groupe (no- utilisée en A.C.P. ou en analyse factorielle discriminante. La représentation
tée X j , il s’agit de l’expression du j-ième gène retenu) sur les n individus graphique des variables se fait soit par rapport aux vecteurs liés aux gènes,
considérés (i = 1, . . . , n). De même, la k-ième colonne de Y (k = 1, . . . , q) soit par rapport à ceux liés aux acides (en général, les deux sont équivalentes,
contient les observations yik de la k-ième variable du second groupe (notée Y k , au moins pour ce qui est de leur interprétation). Ces vecteurs, obtenus dans
il s’agit du pourcentage relatif au k-ième acide gras retenu). chaque espace associé à chacun des deux groupes de variables, sont analogues
En A.C., il est nécessaire d’avoir p ≤ n, q ≤ n, X de rang p et Y de rang aux facteurs de l’A.C.P. et sont ici appelés variables canoniques. Comme en
q. Par conséquent, dans l’exemple considéré, il a été nécessaire de faire une A.C.P., on peut tracer le cercle des corrélations sur le graphique des variables,
sélection des gènes et de ne retenir que les plus importants (ceux dont le rôle ce qui en facilite l’interprétation (dont le principe est le même que pour le
prépondérant a préalablement été mis en évidence au moyen des techniques graphique des variables en A.C.P.). Des considérations techniques permettent
exploratoires). Bien que ce ne soit pas imposé par la théorie, nous avons égale- de faire également un graphique pour les individus.
ment fait, pour être cohérents, une sélection des acides gras. Finalement, nous Appelons d le nombre de couples de variables canoniques jugés intéressants,
avons sélectionné 10 gènes et 11 acides gras hépatiques. autrement dit la dimension retenue pour les représentations graphiques. On a
Les gènes sont les suivants : nécessairement 1 ≤ d ≤ p, et on choisit en général d entre 2 et 4. Nous note-
rons (V s , W s ) (s = 1, . . . , d) les couples de variables canoniques retenus ; on
PMDCI THIOL CYP3A11 CYP4A10 CYP4A14 Lpin Lpin1 GSTmu GSTpi2 S14.
posera ρs = Cor(V s , W s ) et on appellera corrélations canoniques les coeffi-
Les acides gras sont les suivants : cients ρs qui sont, par construction, décroissants.
C16_0 C18_0 C18_1n_7 C18_1n_9 C18_2n_6 C18_3n_3
C20_4n_6 C20_5n_3 C22_5n_3 C22_5n_6 C22_6n_3. 3 Approche mathématique
Remarque. — On notera que la notation habituelle des acides gras est un peu Dans ce paragraphe, nous reprenons, plus en détail et avec plus de rigueur
différente de celle ci-dessus ; ainsi C18_1n_7 correspond à C18:1n-7 ; la mathématique, les éléments présentés dans le paragraphe précédent. Le lecteur
notation adoptée est nécessaire pour la lecture par le logiciel SAS. biologiste peu familiarisé avec ces notions de mathématiques pourra donc le
Enfin, sans perte de généralité, on suppose également p ≤ q (on désigne parcourir très rapidement et se contenter d’aller y chercher quelques résultats,
donc par premier groupe celui qui comporte le moins de variables). Finale- lorsque nécessaire.

Précédente Suivante Première Dernière Retour Quitter


3 Analyse canonique des corrélations (ACC)

3.1 Représentations vectorielles des données Ensuite, on cherche le couple normé (V 2 , W 2 ), V 2 combinaison linéaire
des X j non corrélée à V 1 et W 2 combinaison linéaire des Y k non corrélée à
Comme en A.C.P., on peut considérer plusieurs espaces vectoriels réels as- W 1 , telles que V 2 et W 2 soient le plus corrélées possible. Et ainsi de suite...
sociés aux observations.
Remarque. — Dans la mesure où l’A.C. consiste à maximiser des corrélations,
Tout d’abord, l’espace des variables ; c’est F = Rn , muni de la base cano- quantités invariantes par translation et par homothétie de rapport positif sur
nique et d’une certaine métrique, en général l’identité. À chaque variable X j les variables, on peut centrer et réduire les variables initiales X j et Y k sans
est associé un vecteur unique xj de F dont les coordonnées sur la base cano- modifier les résultats de l’analyse. Pour des raisons de commmodité, on le
nique sont les xji (i = 1, . . . , n). De même, à chaque variable Y k est associé fera systématiquement. Par conséquent, les matrices X et Y seront désormais
un vecteur unique y k de F , de coordonnées les yik . On peut ainsi définir dans F supposées centrées et réduites (en colonnes).
deux sous-espaces vectoriels : FX , engendré par les vecteurs xj (j = 1, . . . , p),
en général de dimension p, et FY , engendré par les vecteurs y k (k = 1, . . . , q), L’A.C. produit ainsi une suite de p couples de variables (V s , W s ), s =
en général de dimension q. 1, . . . , p. Les variables V s constituent une base orthonormée de FX (les V s ,
combinaisons linéaires de variables centrées, sont centrées ; comme elles sont
Remarque. — Il est courant de munir l’espace vectoriel F de la métrique non corrélées, elles sont donc orthogonales pour la métrique identité). Les
dite “des poids”, définie, relativement à la base canonique, par la matrice diag variables W s constituent, de même, un système orthonormé de F (ils n’en
Y
(p1 , . . . , pn ), où les pi (i = 1, . . . , n) sont des poids (positifs et de somme constituent une base que si q = p). Les couples (V s , W s ), et plus particulière-
égale à 1) associés aux individus observés. Lorsque tous ces poids sont égaux, ment les premiers d’entre eux, rendent compte des liaisons linéaires entre les
ils valent nécessairement n1 et la matrice définissant la métrique des poids vaut deux groupes de variables initiales. Les variables V s et W s sont appelées les
1
n In , où In est la matrice identité d’ordre n. Dans ce cas, il est équivalent variables canoniques. Leurs corrélations successives (décroissantes) sont ap-
d’utiliser la métrique identité, ce que nous ferons par la suite, dans la mesure pelées les coefficients de corrélation canonique (ou corrélations canoniques)
où les individus seront systématiquement équipondérés. et notées ρs (1 ≥ ρ1 ≥ ρ2 ≥ · · · ≥ ρp ≥ 0).
On peut ensuite considérer deux espaces vectoriels pour les individus, Remarque. — Toute variable canonique V s0 est, par construction, non corrélée
EX = Rp et EY = Rq , eux aussi munis de leur base canonique et d’une (donc orthogonale) avec les autres variables canoniques V s , s 6= s . On peut
0
certaine métrique. Dans EX , chaque individu i est représenté par le vecteur également montrer que V s0 est non corrélée avec W s , si s 6= s (la même
j 0
xi , de coordonnées xi (j = 1, . . . , p) sur la base canonique. De même, dans propriété est bien sûr vraie pour toute variable W s0 avec les variables V s ,
EY , l’individu i est représenté par le vecteur yi , de coordonnées les yik . s 6= s ).
0
En fait, c’est surtout l’espace F que nous considèrerons par la suite, la défi- Remarque. — Si nécessaire, on peut compléter le système des variables W s
nition de l’A.C. y étant plus naturelle. (s = 1, . . . , p) pour obtenir une base orthonormée de FY dans laquelle les
3.2 Retour sur le principe de la méthode dernières variables W s (s = p + 1, . . . , q) sont associées à des coefficients de
corrélation canonique nuls (ρs = 0, pour s = p + 1, . . . , q).
Le principe général de l’A.C. est décrit ci-dessous, dans l’espace des va-
riables F . 3.3 Propriété
Dans un premier temps, on cherche un couple de variables (V 1 , W 1 ), V 1 La propriété donnée ici permet, dans la pratique, de déterminer les variables
étant une combinaison linéaire des variables X j (donc un élément de FX ), canoniques V s et W s en utilisant un algorithme standard de recherche des
normée, et W 1 une combinaison linéaire des variables Y k (donc un élément vecteurs propres d’une matrice.
de FY ), normée, telles que V 1 et W 1 soient le plus corrélées possible.

Précédente Suivante Première Dernière Retour Quitter


4 Analyse canonique des corrélations (ACC)

Dans l’espace vectoriel F muni de la métrique identité, notons PX et PY Dans le même espace, on peut également représenter les variables de l’autre
les matrices des projecteurs orthogonaux sur les sous-espaces FX et FY dé- groupe, les Y k , en projetant tout d’abord les vecteurs y k dans FX , au moyen
finis plus haut. Les formules usuelles de définition des projecteurs permettent de PX , puis en prenant le produit scalaire de ces projections avec les vecteurs
d’écrire (X0 désignant la matrice transposée de X) : v s . On doit donc calculer pour cela les produits scalaires
PX = X(X0 X)−1 X0 ; PY = Y(Y0 Y)−1 Y0 . < PX (y k ), v s >=< y k , PX (v s ) >=< y k , v s >,

On peut alors montrer la propriété ci-dessous. encore égaux aux corrélations entre les variables initiales Y k et les variables
canoniques V s .
P ROPOSITION 1. — Les vecteurs V s sont les vecteurs propres normés de la Dans la mesure où le graphique ainsi obtenu est “bon” (sur ce point, voir
matrice PX PY respectivement associés aux valeurs propres λs rangées par plus loin), on peut l’utiliser pour interpréter les relations (proximités, opposi-
ordre décroissant (on peut vérifier que ces valeurs propres sont comprises entre tions, éloignements) entre les deux ensembles de variables. Par construction,
1 et 0). De même, les vecteurs W s sont les vecteurs propres normés de la ma- ce graphique représente les corrélations entre les variables canoniques V s et
trice PY PX respectivement associés aux mêmes valeurs propres λs . De plus, les variables initiales X j et Y k , corrélations à la base de son interprétation. On
les coefficients de corrélation canonique
√ ρs sont les racines carrées positives peut aussi conforter cette interprétation en utilisant les coefficients de corré-
de ces valeurs propres : ρs = λs , s = 1, . . . , p (le logiciel SAS fournit les lation linéaire entre variables X j , entre variables Y k , et entre variables X j et
corrélations canoniques ρs ainsi que leurs carrés λs ). Y k . Tous ces coefficients sont en général fournis par les logiciels.

3.4 Retour sur les représentations graphiques Représentation des variables dans le sous-espace FY

Comme en A.C.P., les représentations graphiques des résultats d’une A.C. se De façon symétrique, on restreint le système (w1 , . . . , wp ) de FY aux pre-
1 d
font en dimension réduite (souvent 2 ou 3). Nous noterons d cette dimension, mières variables (w , . . .j , w ), par rapportk
auxquelles on représente aussi bien
avec : 1 ≤ d ≤ p. Plusieurs représentations sont envisageables, à la fois pour les variables initiales X que les Y , selon le même principe que celui décrit
les variables et pour les individus. ci-dessus (les coordonnées sont les corrélations).
Là encore, dans la mesure où ce graphique est “bon”, il permet d’interpréter
Représentation des variables dans le sous-espace FX les relations entre les deux ensembles de variables.
Désignons par v s et ws les vecteurs de FX et FY respectivement associés Les deux graphiques (dans FX et dans FY ) ayant la même qualité et condui-
aux variables canoniques V s et W s . sant aux mêmes interprétations, un seul suffit pour interpréter les résultats
Dans FX , on considère la base orthonormée (v 1 , . . . , v p ) que l’on restreint d’une analyse.
à (v 1 , . . . , v d ) pour les représentations graphiques. Représentation des individus
On peut tout d’abord représenter chacune des variables initiales X j au
moyen de ses coordonnées sur les v s . Ces coordonnées s’obtiennent en cal- Dans chacun des espaces relatifs aux individus (EX et EY ), il est encore
culant les produits scalaires < xj , v s >, j = 1, . . . , p, s = 1, . . . , d. Les possible de faire une représentation graphique de ces individus en dimension
variables X j étant centrées et réduites, les vecteurs xj sont centrés et normés d, ces deux représentations graphiques étant comparables (d’autant plus com-
(et il en va de même pour les vecteurs v s ), de sorte que ces produits scalaires parables que les corrélations canoniques sont élevées).
sont égaux aux corrélations entre variables initiales X j et variables canonique En fait, on peut vérifier que les coordonnées des individus sur les axes ca-
V s (au coefficient n près, puisqu’on a considéré la métrique identité). noniques pour ces deux représentations sont respectivement données par les

Précédente Suivante Première Dernière Retour Quitter


5 Analyse canonique des corrélations (ACC)

lignes des matrices Vd (dans EX ) et Wd (dans EY ), Vd et Wd désignant les sauter ce paragraphe.


matrices n × d dont les colonnes contiennent les coordonnées des d premières
variables canoniques sur la base canonique de F . 4.1 Introduction
Choix de la dimension Ouvrages et logiciels anglo-saxons de statistique présentent souvent l’ana-
lyse canonique parallèlement à la régression linéaire multivariée (régression
Comme dans toute méthode factorielle, différents éléments doivent être pris d’un ensemble de variables Y k , à expliquer, sur un autre ensemble de variables
en compte pour le choix de la dimension d dans laquelle on réalise les gra- X j , explicatives). Cette approche est, en fait, assez naturelle, dans la mesure
phiques (et dans laquelle on interprète les résultats). où les données sont de même nature dans les deux méthodes et où l’on cherche,
– Tout d’abord, il est clair que d doit être choisi petit, l’objectif général de dans l’une comme dans l’autre, des relations linéaires entre variables.
la méthode étant d’obtenir des résultats pertinents dans une dimension Il convient toutefois de noter les deux différences fondamentales entre les
réduite ; ainsi, le plus souvent, on choisit d égal à 2, 3 ou 4. deux méthodes : contrairement à ce qu’il se passe en A.C., les deux ensembles
– Plus l’indice de dimension s augmente, plus la corrélation canonique ρs de variables X j et Y k ne sont pas symétriques en régression, puisqu’il s’agit
diminue ; or, on ne s’intéresse pas aux corrélations canoniques faibles, d’expliquer les variables Y k au moyen des variables X j ; d’autre part, toujours
puisqu’on cherche à expliciter les relations entre les deux groupes de va- en régression, on suppose la normalité des variables réponses Y k , alors qu’au-
riables ; par conséquent, les dimensions correspondant à des ρs faibles cune hypothèse de cette nature n’est nécessaire en A.C. L’avantage de cette
peuvent être négligées. hypothèse (lorsqu’elle est “raisonnable”) est de permettre de réaliser des tests
– Le pourcentage que chaque valeur propre λs représente par rapport à la dans le modèle de régression.
somme de toutes les valeurs propres, c’est-à-dire par rapport à la trace
de la matrice diagonalisée, facilitent également le choix de d (voir la re- 4.2 Le modèle de régression multivariée
marque 5).
Le modèle de régression multivariée des variables Y k sur les variables X j
s’écrit :
4 Compléments : analyse canonique et ré- Y = XB + U ;
gression multivariée les matrices Y, n × q, et X, n × p, sont celles introduites en A.C. ; B est la
matrice p × q des paramètres inconnus, à estimer (les coefficients de régres-
L’objectif principal de ce paragraphe est de donner une idée, à l’utilisateur sion) ; U est la matrice n × q des erreurs du modèle. Chaque ligne Ui de U est
du logiciel SAS, du principe des tests figurant dans la prodédure CANCORR, un vecteur aléatoire de Rq supposé Nq (0, Σ), les Ui étant indépendants (Σ est
celle qui permet de réaliser l’analyse canonique. Accessoirement, ce para- une matrice inconnue, à estimer, supposée constante en i).
graphe introduit la régression multivariée et fait le lien entre cette technique
L’estimation maximum de vraisemblance de B conduit à la solution :
et l’analyse canonique.
On notera que les tests présentés ici sont des tests statistiques classiques B̂ = (X0 X)−1 X0 Y.
dans le contexte de l’analyse multivariée, que ce soit l’analyse canonique, la On appelle alors valeurs prédites (de Y par le modèle) les quantités :
régression multivariée, l’analyse de variance multivariée (la MANOVA), ou
Ŷ = XB̂ = PX Y ;
même l’analyse discriminante. Ils apparaissent ainsi dans toutes les procédures
du logiciel SAS permettant de mettre en œuvre ces méthodes. d’autre part, on appelle résidus les quantités :
Le lecteur peu familiarisé avec les méthodes mltivariées pourra néanmoins Û = Y − Ŷ = P⊥
XY

Précédente Suivante Première Dernière Retour Quitter


6 Analyse canonique des corrélations (ACC)

(dans l’écriture ci-dessus, P⊥ n


X désigne, dans R , le projecteur orthogonal sur En interprétant ces pourcentages comme la part d’inertie globale du nuage
le sous-espace supplé-mentaire orthogonal à FX dans Rn ; on sait que ce pro- des individus restituée par les différents axes canoniques (ce qu’elles sont, par
jecteur s’écrit : P⊥
X = In − PX ). exemple, en analyse factorielle discriminante), ces quantités facilitent le choix
de la dimension d retenue pour les graphiques et les interprétations.
4.3 Matrices intervenant dans les tests
4.4 Tests
Dans le cadre du modèle gaussien, on peut tester la significativité du modèle
en généralisant le test de Fisher, bien connu dans le cas unidimensionnel. Au Il existe plusieurs tests de significativité du modèle de régression multi-
numérateur de la statistique de Fisher figure la norme carrée du vecteur ŷ − y, variée, en général équiva-lents (au moins au niveau des décisions qu’ils en-
ici remplacée par Ŷ0 Ŷ (cette matrice est centrée). Au dénominateur figure la traînent). Ces tests sont les généralisations classiques du test de Fisher au cas
norme carrée des résidus, ici remplacée par Û0 Û (on néglige, pour l’instant, multivarié (on les retrouve, par exemple, en analyse de variance multivariée)
les degrés de liberté de ces quantités). La statistique de Fisher est donc rem- et sont des tests asymptotiques. Le logiciel SAS fournit les trois premiers ci-
placée par le produit matriciel Ŷ0 Ŷ(Û0 Û)−1 . Comme on a Ŷ = PX Y, il dessous, mais pas le quatrième. Il fournit également le test de Roy, basé sur la
vient : Ŷ0 Ŷ = Y0 PX Y = H (la notation H est standard, car cette quan- λ1
plus grande valeurs propre de la matrice HE−1 , soit , mais ce test est
tité est liée à l’hypothèse nulle testée). D’autre part, Û = P⊥ X Y entraîne :
1 − λ1
à déconseiller.
Û0 Û = Y0 P⊥ X Y = E (il s’agit encore d’une notation standard, cette matrice
représentant les erreurs du modèle). Les tests multidimensionnels de significa- – Le test de Wilks, adaptation du test du rapport des vraisemblances, est
tivité du modèle sont ainsi basés sur l’étude des valeurs propres soit du produit basé sur la statistique
matriciel p p
HE−1 = (Y0 PX Y)(Y0 P⊥ X Y)
−1
, Y Y
Λ= (1 − λs ) = (1 − ρ2s ).
−1
soit encore du produit H(H + E) , les valeurs propres de ces deux matrices s=1 s=1
se déduisant les unes des autres. Développons le second produit matriciel :
– Le test de la trace de Pillai est basé sur la statistique
H + E = Y0 PX Y + Y0 (In − PX )Y = Y0 Y; p
X
d’où : Z = trace H(H + E)−1 = λs .
s=1
H(H + E)−1 = Y0 PX Y(Y0 Y)−1 ,
matrice ayant les mêmes valeurs propres que – Le test de la trace de Lawley-Hotelling est basé sur la statistique
p
PX Y(Y0 Y)−1 Y0 = PX PY , X λs
T 2 = trace HE−1 = .
s=1
1 − λs
c’est-à-dire les λs (s = 1, . . . , p), carrés des corrélations canoniques.
Remarque. — On peut vérifier (le résultat est classique) que les valeurs propres – Le test du khi-deux est basé sur la statistique
λs
de la matrice HE−1 valent . Ces valeurs propres sont fournies par le p
1 − λs 1 Y
logiciel SAS, ainsi que les pourcentages (et les pourcentages cumulés) qu’elles K = −[(n − 1) − (p + q + 1)] ln (1 − λs ).
2
représentent par rapport à leur somme, trace de la matrice HE−1 . s=1

Précédente Suivante Première Dernière Retour Quitter


7 Analyse canonique des corrélations (ACC)

Le test du khi-deux présente l’avantage d’être directement utilisable, puis- 5 Exemple : nutrition chez la souris
qu’on compare la statistique K à une loi de khi-deux à pq degrés de libertés (il
s’agit d’un test approché). 5.1 Traitements préliminaires
Dans les trois autres tests ci-dessus, on doit transformer la statistique (Λ, Z Nous donnons ci-dessous les statistiques élémentaires relatives aux deux
ou T 2 ) pour obtenir un test de Fisher approché, les transformations étant assez groupes de variables. Les corrélations entre gènes se trouvent en Annexe A,
compliquées à expliciter (toutefois, SAS les réalise automatiquement). celles entre acides en Annexe B.
Remarque. — Dans un article de 1951, Rao a montré que, dans la plupart des
Variable N Mean Std Dev Minimum Maximum
cas, l’approximation de Fisher du test de Wilks est la meilleure. C’est donc le --------------------------------------------------------------
test que nous conseillerons. PMDCI 40 -0.7673 0.1861 -1.07 -0.44
THIOL 40 -0.4110 0.2125 -0.90 -0.03
Si le modèle de régression est significatif (il en va alors de même pour CYP3A11 40 -0.5083 0.2556 -1.02 0.06
CYP4A10 40 -0.9798 0.2237 -1.33 -0.48
l’analyse canonique), on peut tester la significativité d’une dimension et de CYP4A14 40 -0.9930 0.2460 -1.29 -0.15
l’ensemble des suivantes, en particulier pour guider le choix de la dimension Lpin 40 -0.7533 0.1735 -1.13 -0.48
Lpin1 40 -0.7648 0.1638 -1.10 -0.49
en A.C. Ainsi, supposons que les corrélations canoniques soient significatives GSTmu 40 -0.1190 0.1504 -0.44 0.23
depuis la première jusqu’à la k-ième (1 ≤ k ≤ p). On peut alors tester l’hypo- GSTpi2 40 0.2298 0.1422 0 0.55
S14 40 -0.8068 0.2008 -1.05 -0.25
thèse nulle

{H0 : ρk+1 = · · · = ρp = 0} (⇐⇒ {H0 : d = k})


Variable N Mean Std Dev Minimum Maximum
contre l’alternative ------------------------------------------------------
C16_0 40 23.03 3.57 14.65 29.72
{H1 : ρk+1 > 0} (⇐⇒ {H1 : d > k}). C18_0 40 6.75 2.64 1.68 10.97
C18_1n_7 40 4.43 3.38 1.53 15.03
C18_1n_9 40 25.27 7.34 14.69 41.23
Pour cela, il faut adapter soit le test de Wilks, soit le test du khi-deux. C18_2n_6 40 15.28 8.76 2.31 40.02
C18_3n_3 40 2.89 5.83 0 21.62
Pour le test de Wilks, il suffit de faire le produit des quantités (1 − λs ) C20_4n_6 40 5.28 4.46 0.75 15.76
C20_5n_3 40 1.79 2.59 0 9.48
de l’indice k + 1 à l’indice p et d’adapter la transformation en fonction des C22_5n_3 40 0.87 0.86 0 2.58
nouvelles dimensions. SAS le fait automatiquement. Pour le test du khi-deux, C22_5n_6 40 0.44 0.66 0 2.52
C22_6n_3 40 5.91 5.33 0.28 17.35
il faut considérer la statistique
k p Remarque. — Les valeurs ci-dessus sont relatives aux variables brutes (aux
1 X 1 Y
Kk = −[(n − 1 − k) − (p + q + 1) + ] ln (1 − λs ) données initiales). Comme indiqué dans la remarque 3, ces variables ont en-
2 λ
s=1 s suite été centrées et réduites avant la réalisation de l’A.C.
s=k+1

et la comparer à une loi de khi-deux à (p − k)(q − k) degrés de liberté. 5.2 Analyse canonique
Remarque. — Dans l’utilisation de ces tests, il convient de ne pas perdre de Généralités
vue d’une part qu’il s’agit de tests asymptotiques (d’autant meilleurs que la
taille de l’échantillon, n, est grande), d’autre part qu’ils ne sont valables que Les premiers résultats fournis par une A.C. sont les corrélations croisées
sous l’hypothèse de normalité des variables Y k . entre les deux groupes de variables. Nous donnons ces corrélations dans l’an-

Précédente Suivante Première Dernière Retour Quitter


8 Analyse canonique des corrélations (ACC)

nexe C. current row and all that follow are zero


Likelihood Approximate
Ensuite sont données les corrélations canoniques reproduites ci-dessous. Ratio F Value Num DF Den DF Pr > F
1 0.00003857 4.08 110 155.53 <.0001
Canonical Correlation 2 0.00053068 3.31 90 145.91 <.0001
1 0.96 3 0.00403909 2.77 72 135.32 <.0001
2 0.93 4 0.02387531 2.21 56 123.78 0.0001
3 0.91 5 0.08995724 1.78 42 111.33 0.0090
4 0.86 6 0.23902627 1.41 30 98 0.1087
5 0.79 7 0.49427788 0.99 20 83.865 0.4795
6 0.72 8 0.78104952 0.56 12 69.081 0.8636
7 0.61 9 0.93806320 0.29 6 54 0.9380
8 0.41 10 0.99819295 0.03 2 28 0.9750
9 0.25
10 0.04
On voit que le choix optimal de la dimension serait probablement d = 4 (ne
On notera que “le plus petit” groupe ne comportant que 10 variables, on ne pas oublier que ces tests sont asymptotiques et que nous avons n = 40). Pour
peut déterminer que 10 corrélations canoniques. L’objectif principal de l’A.C. simplifier, nous ne présentons, par la suite, que les graphiques selon les deux
étant d’étudier les relations entre variables des deux groupes, on peut noter ici premières dimensions.
qu’il existe effectivement des relations fortes entre ces deux groupes, puisque
les premiers coefficients canoniques sont très élevés. Compte tenu des valeurs Graphique des individus
importantes des premiers coefficients, on peut raisonnablement se contenter Dans un premier temps, nous avons réalisé le graphique des individus (les
de deux ou trois dimensions pour étudier les résultats fournis par la méthode 40 souris) relativement aux deux premiers axes canoniques de l’espace des
et nous avons choisi ici seulement deux dimensions, compte tenu qu’il s’agit gènes EX (Fig. 1). En général, dans une A.C., ce graphique sert seulement
essentiellement d’une illustration. à contrôler l’homogéneité de l’ensemble des individus (absence d’individus
Remarque. — Les valeurs propres de la matrice HE−1 et les pourcentages atypiques par exemple). Ici, dans la mesure où les individus proviennent d’un
d’inertie restitués par les différentes dimensions sont les suivants : plan d’expériences à deux facteurs croisés (le génotype et le régime), il est
intéressant de regarder si l’on retrouve la structure de ce plan. On notera que
Eigenvalues of Inv(E)*H cela est très net en ce qui concerne le génotype et encore assez net pour ce
= CanRsq/(1-CanRsq)
Eigenvalue Difference Proportion Cumulative qui est du régime (en fait, la selection des gènes a été réalisée de telle sorte
1 12.7583 6.1471 0.4167 0.4167 que ceux retenus soient le plus structurant possible pour ces deux facteurs ; le
2 6.6111 1.7001 0.2159 0.6326
3 4.9111 2.1433 0.1604 0.7930 résultat, s’il est rassurant, n’a donc rien d’extraordinaire).
4 2.7678 1.1107 0.0904 0.8833
5 1.6571 0.5892 0.0541 0.9375 Signalons pour terminer qu’on a également réalisé le graphique des indivi-
6 1.0679 0.4877 0.0349 0.9723 dus relativement aux deux premiers axes de l’autre espace (espace des acides
7 0.5802 0.3792 0.0189 0.9913
8 0.2010 0.1369 0.0066 0.9978 gras, EY ) et qu’il est très semblable à celui-ci.
9 0.0641 0.0623 0.0021 0.9999
10 0.0018 0.0001 1.0000 Graphique des variables

Par ailleurs, les tests de Wilks, de significativité de chaque dimension, sont Pour la représentation des variables, nous avons considéré le sous-espace
les suivants : F X , engendré par les 10 gènes, et nous avons représenté à la fois les gènes
et les acides gras relativement aux deux premières variables canoniques, V 1
Test of H0: The canonical correlations in the et V 2 (Fig. 2). Comme indiqué en 3.4, les coordonnées des variables initiales

Précédente Suivante Première Dernière Retour Quitter


9 Analyse canonique des corrélations (ACC)

sont fournies par leur corrélations avec les variables canoniques.


Certaines associations entre gènes et acides gras, en particulier celles cor-
respondant à des points éloignés de l’origine, sont intéressantes à noter. Ainsi
peut-on observer que la séparation des génotypes est principalement liée d’une
part à l’accumulation préférentielle de l’acide gras C18_2n_6 chez les souris
PPAR, au détriment de C16_0, de C18_0 et des acides gras longs polyinsa-
turés C20_5n_3 et C22_6n_3 (les oméga 3), d’autre part à la plus forte ex-
5
pression des gènes THIOL, PMDCI, CYP3A11 et GSTpi2 chez les souris WT
0.8

5 par rapport aux souris PPAR. On peut également noter les proximités entre le
5
5 C16_0 et le gène THIOL, ainsi que les proximités entre CYP3A11 et GSTpi2
et les acides gras C18_0 et C22_6n_3. Par ailleurs, l’opposition entre le ré-
0.7

2
gime 2-efad et les régimes 1-dha et 3-lin est liée, sous régime efad, à
l’accumulation d’acides gras monoinsaturés (C18_1n_9 et C18_1n_7) chez
0.6

2 2 2 1
4 4 3 les souris des deux génotypes (mais plus marquée chez les souris PPAR), ac-
2
Dimension 2

5
1 compagnée de la surexpression du gène S14 presque exclusivement chez les
4
souris WT. Sous régime riche en Oméga 3 (1-dha et 3-lin), on observe une
0.5

1 1
2
3
5 4
3
accumulation préférentielle des acides gras C20_5n_3 (surtout pour le ré-
2
gime lin), C22_6n_3 (surtout pour le régime dha) et C18_0 accompagnée
0.4

5
3 1 de régulations positives des gènes GSTpi2, CYP3A11 et des CYP4A qui, ce-
2 5 3 13 pendant, se révèlent moins marquées, voire absentes, chez les souris PPAR.
1
Enfin, remarquons que la position particulière du régime 5-tsol chez les
0.3

4 3 1
4 3 souris PPAR est liée à l’accumulation extrêmement marquée de C18_2n_6
4 dans le foie de ces souris sous le régime tsol (sous ce régime, la proportion
0.2

4 de C18_2n_6 est presque deux fois plus importante chez les souris PPAR que
chez les souris WT), soulignant ainsi le rôle primordial de PPARα dans la prise
−0.1 0.0 0.1 0.2 0.3 0.4 0.5
en charge de cet acide gras, que ce soit pour sa dégradation ou pour son uti-
Dimension 1
lisation pour la biosynthèse des acides gras longs polyinsaturés de la famille
Oméga 6.
F IGURE 1 – Souris : représentation des individus (souris) dans l’espace des
gènes. Les WT sont en rouge-gras et les PPAR en bleu-italique ; les numéros
correspondent aux régimes.

Précédente Suivante Première Dernière Retour Quitter


10 Analyse canonique des corrélations (ACC)

1.0
0.5

C18.2n.6
C18.1n.9
C18.1n.7
C22.5n.6
Dimension 2

S14
0.0

GSTmu C18.3n.3
C20.4n.6
Lpin
Lpin1 C22.5n.3
C20.5n.3
CYP4A14
−0.5

CYP4A10 C22.6n.3
C16.0 GSTpi2
THIOL C18.0
CYP3A11
PMDCI
−1.0

−1.0 −0.5 0.0 0.5 1.0

Dimension 1

F IGURE 2 – Souris : représentation des gènes (en rouge-gras) et des acides


(en bleu-italique) dans le sous-espace des gènes.

Précédente Suivante Première Dernière Retour Quitter


1 Analyse Factorielle des Correspondances (AFC)

Analyse Factorielle des TABLE 1 – Table de contingence

Correspondances (AFC) y1 ··· yh ··· yc sommes


x1 n11 ··· n1h ··· n1c n1+
.. .. .. .. ..
. . . . .
Résumé x` n`1 ··· n`h ··· n`c n`+
.. .. .. .. ..
. . . . .
Méthode factorielle de réduction de dimension pour l’exploration statistique
xr nr1 ··· nrh ··· nrc nr+
d’une table de contingence définie par deux variables qualitatives. Définition
à partir de l’analyse en composantes principales des profils. Définition du mo- sommes n+1 ··· n+h ··· n+c n
dèle statistique associé, estimation. Représentation graphique simultanée des
modalités des variables.
n`h /n) et de fréquences marginales rangées dans les vecteurs :
Précédent : Analyse factorielle discriminante
Suivant : Analyse des correspondances multiples gr = [f1+ , . . . , fr+ ]0 ,
Travaux pratiques de complexité croissante par l’études de données élémen- et gc = [f+1 , . . . , f+c ]0 .
taires.
Elles permettent de définir les matrices :
1 Introduction
Dr = diag(f1+ , . . . , fr+ ),
1.1 Données et Dc = diag(f+1 , . . . , f+c ).

On considère dans ce chapitre deux variables qualitatives observées simul-


On sera également amené à considérer les profils–lignes et les profils–
tanément sur n individus affectés de poids identiques 1/n. On suppose que la
colonnes déduits de T. Le `ème profil-ligne est
première variable, notée X, possède r modalités notées x1 , . . . , x` , . . . , xr , et
que la seconde, notée Y , possède c modalités notées y1 , . . . , yh , . . . , yc . n`1 n`h n`c
{ ,..., ,..., }.
La table de contingence associée à ces observations, de dimension r × c, est n`+ n`+ n`+
notée T ; son élément générique est n`h , effectif conjoint. Elle se présente sous Il est considéré comme un vecteur de Rc et les r vecteurs ainsi définis sont
la forme suivante d’une table de contingence présentée dans le Tableau 1). disposés en colonnes dans la matrice c × r
1.2 Notations 1
Pc Pr A = T0 D−1 r .
Les quantités {n`+ = h=1 n`h ; ` = 1, . . . ,P r} et {n+h =P `=1 n`h ; h = n
r c
1, . . . , c} sont les effectifs marginaux vérifiant `=1 n`+ = h=1 n+h = n. De même, le hème profil-colonne est
De façon analogue, on définit les notions de fréquences conjointes (f`h =
n1h n`h nrh
{ ,..., ,..., },
n+h n+h n+h

Précédente Suivante Première Dernière Retour Quitter


2 Analyse Factorielle des Correspondances (AFC)

vecteur de Rr , et la matrice r × c des profils-colonnes est l’hypothèse alternative est H1 : les variables X
e et Ye ne sont pas indépen-
dantes.
1
B= TD−1
c . La statistique de test est alors
n
r X
c n`+ n+h 2
1.3 Liaison entre deux variables qualitatives 2
X n`h − n
χ = n`+ n+h ;
`=1 h=1 n
D ÉFINITION 1. — On dit que deux variables X et Y sont non liées relative-
ment à T si et seulement si : elle suit asymptotiquement (pour les grandes valeurs de n), et si l’hypothèse
n`+ n+h H0 est vraie, une loi de χ2 à (r − 1)(c − 1) degrés de liberté. On rejette donc
∀(`, h) ∈ {1, . . . , r} × {1, . . . , c} : n`h = .
n H0 (et l’on conclut au caractère significatif de la liaison) si χ2 dépasse une
valeur particulière (valeur ayant une probabilité faible et fixée a priori – en
Il est équivalent de dire que tous les profils-lignes sont égaux, ou encore que général 0,05 – d’ être dépassée par une loi de χ2 à (r − 1)(c − 1) degrés de
tous les profils-colonnes sont égaux (voir chapitre ??). liberté).
Cette notion est cohérente avec celle d’indépendance en probabilités. En
effet, soit Ω = {1, . . . , n} l’ensemble des individus observés et (Ω, P(Ω), P ) 1.4 Objectifs
l’espace probabilisé associé où P est l’équiprobabilité ; MX = {x1 , . . . , xr } Pour préciser la liaison existant entre les variables X et Y , on souhaite dé-
et MY = {y1 , . . . , yc } désignent les ensembles de modalités, ou valeurs prises finir un modèle statistique susceptible de fournir des paramètres dont la repré-
par les variables X et Y . On note X e et Ye les variables aléatoires associées aux
sentation graphique (de type biplot) illustrera les “correspondances” entre les
2 variables statistiques X et Y : modalités de ces 2 variables. Cette approche sera développée au paragraphe 3.
e : (Ω, P(Ω), P ) →
X 7 (MX , P(MX )), Une autre approche, très courante dans la littérature francophone, consiste
à définir l’Analyse Factorielle des Correspondances (AFC) comme étant le
Y : (Ω, P(Ω), P ) →
e 7 (MY , P(MY )) ;
résultat d’une double Analyse en Composantes Principales
PX , PY et PXY désignent respectivement les probabilités images définies par – l’ACP des profils–lignes,
X,
e Ye et le couple (X, e Ye ) sur (MX , P(MX )), (MY , P(MY )) et (MX × – l’ACP des profils–colonnes,
MY , P(MX ) × P(MY )) ; ce sont les probabilités empiriques. Alors, X et Y relativement à la métrique dite du χ2 . Cette approche est présentée au para-
sont non liées si et seulement si Xe et Ye sont indépendantes en probabilité (la graphe 2.
vérification est immédiate). Remarque. — :
On suppose maintenant qu’il existe une liaison entre X et Y que l’on sou- i. Toute structure d’ordre existant éventuellement sur les modalités de X ou
haite étudier. La représentation graphique des profils-lignes ou des profils- de Y est ignorée par l’AFC
colonnes, au moyen de diagrammes en barres parallèles, ainsi que le calcul de ii. Tout individu présente une modalité et une seule de chaque variable.
coefficients de liaison (Cramer ou Tschuprow) donnent une première idée de la
iii. Chaque modalité doit avoir été observée au moins une fois ; sinon, elle est
variation conjointe des deux variables (voir chapitre ??). Le test du χ2 permet
supprimée.
de plus de s’assurer du caractère significatif de cette liaison. Il est construit de
la manière suivante :
l’hypothèse nulle est H0 : Xe et Ye sont indépendantes en probabilités ; 2 Double ACP

Précédente Suivante Première Dernière Retour Quitter


3 Analyse Factorielle des Correspondances (AFC)

2.1 Métriques du χ2 iii. la solution de l’ACP est fournie par la D.V.S. de (B0 −1gr0 , D−1
r , Dc ), qui conduit
à rechercher les valeurs et vecteurs propres de la matrice (SM)
Les correspondances entre modalités évoquées au paragraphe précédant se
trouvent exprimées en termes de distances au sens d’une certaine métrique. BDc B0 D−1 0 0 −1
r − gr Dc gr = BA − gr gr Dr ( car B0 D−1
r = D−1
c A)
Ainsi, chaque modalité x` de X est caractérisée par son profil–ligne représenté
iv. les matrices BA − gr gr0 D−1 et BA ont les mêmes vecteurs propres associées
par le vecteur a` de l’espace Rc muni de la base canonique (les coordonnées r
aux mêmes valeurs propres, à l’exception du vecteur gr associé à la valeur propre
de a` sont les éléments de la `ème colonne de A). De même, chaque modalité
λ0 = 0 de BA − gr gr0 D−1r et à la valeur propre λ0 = 1 de BA.
yh de Y est caractérisée par son profil–colonne représenté par le vecteur bh de
l’espace Rr muni de la base canonique.
2
Ces espaces sont respectivement munis des métriques, dites du χ2 , de ma-
trices D−1 et D−1
r . Ainsi, la distance entre deux modalités x` et xi de X On note U la matrice contenant les vecteurs propres D−1
c r –orthonormés de
s’écrit BA. La représentation des “individus” de l’ACP réalisée fournit une représen-
c
` i 2
X 1 ` i 2 tation des modalités de la variable Y . Elle se fait au moyen des lignes de la
ka − a kD−1 = (a − ah ) ,
c f+h h matrice des “composantes principales” (XMV) :
h=1

et de même pour les modalités de Y . La métrique du χ2 introduit les inverses Cc = B0 D−1


r U.
des fréquences marginales des modalités de Y comme pondérations des écarts
entre éléments de deux profils relatifs à X (et réciproquement) ; elle attribue 2.3 ACP des profils–lignes
donc plus de poids aux écarts correspondants à des modalités de faible effectif
(rares) pour Y . De façon symétrique (ou duale), on s’intéresse à l’ACP des “individus” mo-
dalités de X ou profils–lignes (la matrice des données est A0 ), pondérés par
2.2 ACP des profils–colonnes les fréquences marginales des lignes de T (la matrice diagonale des poids est
Dr ) et utilisant la métrique du χ2 . Il s’agit donc de l’ACP de (A0 , D−1
c , Dr ).
On s’intéresse ici à l’ACP du triplet (B0 , D−1
r , Dc ). Dans cette ACP, les “in-
dividus” sont les modalités de Y , caractérisées par les profils–colonnes de T,
P ROPOSITION 3. — Les éléments de l’ACP de (A0 , D−1 c , Dr ) sont fournis
pondérées par les fréquences marginales correspondantes et rangées en lignes −1
par l’analyse spectrale de la matrice carrée, D –symétrique et semi–définie
dans la matrice B0 . c
positive AB.

P ROPOSITION 2. — Les éléments de l’ACP de (B0 , D−1 r , Dc ) sont fournis On obtient directement les résultats en permutant les matrices A et B, ainsi
par l’analyse spectrale de la matrice carrée, D−1
r –symétrique et semi–définie que les indices c et r. Notons V la matrice des vecteurs propres de la matrice
positive BA. AB ; les coordonnées permettant la représentation les modalités de la variable
X sont fournies par la matrice :
Preuve Elle se construit en remarquant successivement que :
Cr = A0 D−1
c V.
i. le barycentre du nuage des profils–colonnes est le vecteur gr des fréquence mar-
ginales de X, Sachant que V contient les vecteurs propres de AB et U ceux de BA,
ii. la matrice BDc B0 −gr Dc gr0 joue le rôle de la matrice des variances–covariances, un théorème de l’annexe (st-m-explo-alglin Compléments d’algèbre linéaire)

Précédente Suivante Première Dernière Retour Quitter


4 Analyse Factorielle des Correspondances (AFC)

montre qu’il suffit de réaliser une seule analyse, car les résultats de l’autre s’en 3.2 Le modèle d’association
déduisent simplement :
Il est encore appelé RC-modèle, ou modèle de Goodman (1991) :
q
!
= AUΛ−1/2 ,
X
V p`h = γ.α` .βh .exp φk .µ`k .νhk .
U = BVΛ−1/2 ; k=1

Ce modèle, muni des contraintes nécessaires, permet de structurer les interac-


Λ est la matrice diagonale des valeurs propres (exceptée λ0 = 0) communes
tions et de faire des représentations graphiques des lignes et des colonnes de
aux deux ACP
T au moyen des paramètres µk et νhk . Ces paramètres peuvent être estimés
par maximum de vraisemblance ou par moindres carrés.
−1/2 −1/2
Cc = B0 D−1 r U = B 0 −1
D r BVΛ = D −1
c ABVΛ = D −1
c VΛ 1/2
,
3.3 Le modèle de corrélation
Cr = A0 D−1 −1
c V = Dr UΛ
1/2
.
On écrit ici :
On en déduit les formules dites de transition :
q
X p
p`h = p`+ p+h + λk uk` vhk , (1)
0 −1/2
Cc = B Cr Λ , k=1
Cr = A0 Cc Λ−1/2 . avec q ≤ inf(r − 1, c − 1), λ1 ≥ · · · ≥ λq > 0 et sous les contraintes
d’identifiabilité suivantes :
La représentation simultanée habituellement construite à partir de ces ma-
trices (option par défaut de SAS) n’est pas a priori justifiée. On lui donnera un
sens dans les paragraphes suivants. r
X c
X
uk` = vhk = 0,
3 Modèles pour une table de contingence 0
`=1
0
h=1

uk D−1 j k −1 j
r u = v Dc v= δkj .
On écrit d’abord que chaque fréquence f`h de T correspond à l’observation
d’une probabilité théorique p`h ; on modélise donc la table de contingence par Remarque. — :
cette distribution de probabilités. On précise ensuite le modèle en explicitant i. Le modèle (1) ci-dessus est équivalent au modèle considéré par Goodman
l’écriture de p`h . Différents modèles classiques peuvent être considérés. (1991) :
3.1 Le modèle log–linéaire Xq
p
!
k k
p`h = p`+ p+h 1 + λk ξ` ηh , (2)
Il consiste à écrire :
k=1
ln(p`h ) = µ + α` + βh + γ`h moyennant une homothétie sur les paramètres.
Pq √
avec des contraintes le rendant identifiable. Ce modèle, très classique, ne sera ii. La quantité k=1 λk uk` vhk exprime l’écart à l’indépendance pour la cel-
pas développé ici. On pourra se reporter, par exemple, à Bishop et al. (1975). lule considérée.

Précédente Suivante Première Dernière Retour Quitter


5 Analyse Factorielle des Correspondances (AFC)

iii. Le modèle suppose que cet écart se décompose dans un sous–espace de associés aux valeurs propres λk .
dimension q < min(c − 1, r − 1). De plus, le vecteur gr = u0 (resp. gc = v0 ) est vecteur propre D−1r –normé (resp.
iv. Les estimations des paramètres p`+ , p+h , λk , uk , vk peuvent être réali- D−1 c –normé) de la matrice BA (resp. AB) associé à la valeur propre λ0 = 1. Enfin,
2
sées par maximum de vraisemblance 1 ou par moindres carrés. Dans le les matrices AB et BA sont stochastiques et donc les valeurs propres vérifient :
contexte de la statistique descriptive, qui est celui de ce cours, il est natu-
1 = λ0 ≥ λ1 ≥ · · · ≥ λq > 0.
rel de retenir cette dernière solution.

3.4 Estimation Moindres Carrés dans le modèle de En identifiant les termes, l’approximation de rang (q + 1) de la matrice P s’écrit
donc :
corrélation q
X p 0
Pb q = gr gc0 + λ k uk v k
3.4.1 Critère k=1

et les propriétés d’orthonormalité des vecteurs propres assurent que les contraintes du
Considérons les espaces Rc et Rr munis de leur base canonique et de leur
modèle sont vérifiées.
métrique du χ2 respectives et notons P le tableau des probabilités théoriques
définies selon le modèle (1). Le critère des moindres carrés s’écrit alors : 2
2
1
min
P n
T−P . (3) 4 Représentations graphiques
D−1 −1
r Dc

3.4.2 Estimation 4.1 Biplot


P ROPOSITION 4. — L’estimation des paramètres de (1) en résolvant (3) est La décomposition de la matrice n1 T se transforme encore en :
fournie par la D.V.S. de ( n1 T, D−1 −1
c , Dr ) à l’ordre q. Les probabilités margi-
min(r−1,c−1)
nales p`+ et p+h sont estimées par f`+ et f+h tandis que les vecteurs uk (resp. f`h − f`+ f+h X p uk` vhk
vk ) sont vecteurs propres de la matrice BA (resp. AB) associés aux valeurs = λk .
f`+ f+h f`+ f+h
propres λk . k=0

On obtient ainsi, d’une autre façon, l’AFC de la table de contingence T. En se limitant au rang q, on obtient donc, pour chaque cellule (`, h) de la table
T, une approximation de son écart relatif à l’indépendance comme produit
Preuve Elle se construit à partir de la D.V.S. de ( n1 T, D−1 −1
c , Dr ) :
scalaire des deux vecteurs
min(r−1,c−1)
1 h
uk` 1/4 v k 1/4
X p
t` = λk uk` vhk ,
n λk et h λk ,
k=0 f`+ f+h
où les vecteurs uk (resp. vk ) sont vecteurs propres D−1 −1
r –orthonormés (resp. Dc –
orthonormés) de la matrice termes génériques respectifs des matrices
1 1 0 −1 1 1
TD−1
c T Dr = BA (resp. T0 D−1 r TDc−1 = AB), D−1
r UΛ
1/4
et D−1
c VΛ
1/4
,
n n n n
1. On suppose alors que les n p`h sont les paramètres de lois de Poisson indépendantes 2. Matrice réelle, carrée, à termes positifs, dont la somme des termes de chaque ligne (ou
conditionnellement à leur somme qui est fixée et égale à n. chaque colonne) vaut 1.

Précédente Suivante Première Dernière Retour Quitter


6 Analyse Factorielle des Correspondances (AFC)

qui sont encore les estimations des vecteurs ξ` et ηh du modèle 2. Leur repré- on voit que dans la seconde des représentations ci–dessus, chaque modalité x`
sentation (par exemple avec q = 2) illustre alors la correspondance entre les de X est représentée par un vecteur qui est barycentre de l’ensemble des vec-
deux modalités x` et yh : lorsque deux modalités, éloignées de l’origine, sont teurs associés aux modalités de Y , chacun d’eux ayant pour poids l’élément
voisines (resp. opposées), leur produit scalaire est de valeur absolue impor- correspondant du l–ième profil–ligne. Là encore, la représentation simultanée
tante ; leur cellule conjointe contribue alors fortement et de manière positives’en trouve parfaitement justifiée. Malheureusement, dans la pratique, les re-
(resp. négative) à la dépendance entre les deux variables. présentations barycentriques sont souvent illisibles ; elles sont, de ce fait, très
L’AFC apparaît ainsi comme la meilleure reconstitution des fréquences f`h , peu utilisées.
ou encore la meilleure représentation des écarts relatifs à l’indépendance. La
4.4 Autre représentation
représentation simultanée des modalités de X et de Y se trouve ainsi pleine-
ment justifiée. La pratique de l’AFC montre que l’interprétation des graphiques est toujours
la même, quelle que soit la représentation simultanée choisie parmi les 3 ci–
4.2 Double ACP dessus.
Chacune des deux ACP réalisée permet une représentation des “individus” On peut ainsi envisager d’utiliser, pour une représentation simultanée des
(modalités) approchant, au mieux, les distances du χ2 entre les profils–lignes modalités de X et de Y , les coordonnées fournies respectivement par les lignes
d’une part, les profils–colonnes d’autre part. Les coordonnées sont fournies des matrices
cette fois par les matrices (de composantes principales)
Cr = D−1
r UΛ
1/2
et Cc = D−1
c VΛ
1/2
. D−1 −1
r U et Dc V.

Même si la représentation simultanée n’a plus alors de justification, elle reste L’interprétation du graphique sera toujours la même et les matrices ci–
couramment employée. En fait, les graphiques obtenus diffèrent très peu de dessus, outre leur simplicité, présentent l’avantage de conduire a une représen-
ceux du biplot ; ce dernier sert donc de “caution” puisque les interprétations tation graphique qui reste invariante lorsque l’on utilise la technique d’Analyse
des graphiques sont identiques. On notera que cette représentation issue de la Factorielle des Correspondances Multiples (voir chapitre suivant) sur les don-
double ACP est celle réalisée par la plupart des logiciels statistiques (c’est en nées considérées ici.
particulier le cas de SAS).
4.5 Aides à l’interprétation
4.3 Représentations barycentriques
Les qualités de représentation dans la dimension choisie et les contributions
D’autres représentations simultanées, appelées barycentriques, sont propo- des modalités de X ou de Y se déduisent aisément de celles de l’ACP Ces
sées en utilisant les matrices quantités sont utilisées à la fois pour choisir la dimension de l’AFC et pour
D−1
r UΛ
1/2
et D−1
c VΛ, interpréter ses résultats dans la dimension choisie.
ou encore les matrices 4.5.1 Mesure de la qualité globale
D−1
r UΛ et D−1
c VΛ
1/2
. Pour une dimension donnée q (1 ≤ q ≤ d = inf(r − 1, c − 1)), la qualité
globale des représentations graphiques en dimension q se mesure par le rap-
Si l’on considère alors, par exemple, la formule de transition
port entre la somme des q premières valeurs propres de l’AFC et leur somme
Cr = A0 Cc Λ−1/2 ⇐⇒ Cr Λ1/2 = A0 Cc ⇐⇒ D−1 0 −1
r UΛ = A Dc VΛ
1/2
, complète de 1 à d.

Précédente Suivante Première Dernière Retour Quitter


7 Analyse Factorielle des Correspondances (AFC)

5 Exemple
Pd
Compte–tenue de la propriété k=1 λk = Φ2 (voir en 6.1), la qualité de la
représentation dans la k–ième dimension s’écrit
L’exemple des données bancaires ainsi que les données d’expression géno-
nλk mique se prête mal à l’illustration d’une analyse des correspondances, aucun
. couple de variable qualitative ne conduit à des représentations intéressantes.
χ2
La table de contingence étudiée à titre d’exemple décrit la répartition des
On parle encore de part du khi–deux expliquée par la k–ième dimension (voir exploitations agricoles de la région Midi–Pyrénées dans les différents départe-
les sorties du logiciel SAS). ments en fonction de leur taille. Elle croise la variable qualitative département,
4.5.2 Mesure de la qualité de chaque modalité à 8 modalités, avec la variable taille de l’exploitation, quantitative découpée en
6 classes. Les données, ainsi que les résultats numériques obtenus avec la pro-
Pour chaque modalité de X (resp. de Y ), la qualité de sa représentation en cédure corresp de SAS/STAT, sont fournis en annexe.
dimension q se mesure par le cosinus carré de l’angle entre le vecteur représen- La figure 5 présente le premier plan factoriel utilisant les coordonnées obte-
tant cette modalité dans Rc (resp. dans Rr ) et sa projection D−1
c –orthogonale nues par défaut, c’est–à–dire celles de la double ACP.
(resp. D−1r –orthogonale) dans le sous–espace principal de dimension q.
Ces cosinus carrés s’obtiennent en faisant le rapport des sommes appro- 6 Compléments
priées des carrés des coordonnées extraites des lignes de Cr (resp. de Cc ).
4.5.3 Contributions à l’inertie totale 6.1 Propriétés
– Formule de reconstitution des données. On appelle ainsi l’approximation
L’inertie totale (en dimension d) du nuage des profils–lignes (resp. des
d’ordre q (c’est–à–dire fournie par l’AFC en dimension q) de la table des
profils–colonnes) est égale à la somme des d valeurs propres. La part due au
Pd fréquences initiales ( n1 T) :
i–ième profil–ligne (resp. au j–ième profil–colonne) valant f`+ k=1 (ckr` )2
Pd
(resp. f+h k=1 (ckch )2 ), les contributions à l’inertie totale s’en déduisent im- q
X p
médiatement. f`h ' f`+ f+h λk uk` vhk .
k=1
4.5.4 Contributions à l’inertie selon chaque axe
– Les valeurs propres vérifient :
Il s’agit de quantités analogues à celles ci–dessus, dans lesquelles il n’y a
pas de sommation sur l’indice k. Ces quantités sont utilisées dans la pratique d
X
pour sélectionner les modalités les plus importantes, c’est–à–dire celles qui λk = Φ2 .
contribuent le plus à la définition de la liaison entre les 2 variables X et Y . k=1

4.5.5 Remarque En effet, on vérifie facilement :


En général, on n’interprète pas les axes d’une AFC (en particulier parce d
X χ2
qu’il n’y a pas de variable quantitative intervenant dans l’analyse). L’interpré- trAB = λk = 1 + = 1 + Φ2 ;
tation s’appuie surtout sur la position relative des différentes modalités repé- n
k=0
rées comme les plus importantes.
d’où le résultat.

Précédente Suivante Première Dernière Retour Quitter


8 Analyse Factorielle des Correspondances (AFC)

6.2 Invariance
– Les tables de contingence T et αT, α ∈ R∗+ , admettent la même AFC
(évident).
– Propriété d’équivalence distributionnelle : si deux lignes de T, ` et i,
ont des effectifs proportionnels, alors les représentations de x` et xi sont
confondues (leurs profils sont identiques) et le regroupement de x` et xi
en une seule modalité (en additionnant les effectifs) laisse inchangées les
0.4 représentations graphiques (même chose pour les colonnes de T). Cette
propriété est une conséquence de la métrique du χ2 .

0.3
SINF1
6.3 Choix de la dimension q
h.g.
S1_5 Le choix de la dimension pose les mêmes problèmes qu’en ACP De nom-
0.2 arie
breuses techniques empiriques ont été proposées (essentiellement : part d’iner-
tie expliquée, éboulis des valeurs propres). Il existe également une approche
probabiliste qui peut donner des indications intéressantes. Nous la détaillons
A
x
e 0.1 S_100 ci–dessous.
2
S50_99
Posons
gers q
X
q
p
0.0
n
d
`h = nf`+ f+h + n λk uk` vhk ,
h.p.
k=1
S20_50 t.g.
S10_20
tarn
lot estimation d’ordre q de l’effectif conjoint de la cellule (`, h). Alors, sous cer-
-0.1 taines conditions (échantillonnage, n grand, modèle multinomial . . . ), on peut
aver
montrer que
S5_10 r X c q 2 d
X (n`h − nd
`h )
X
-0.2 Kq = 'n λk
-0.5 -0.3 -0.1 0.1 0.3 0.5 0.7 q
Axe 1
`=1 h=1 n
d
`h k=q+1
2
F IGURE 1 – Répartition des exploitations agricoles par taille et par départe- suit approximativement une loi de χ à (r − q − 1)(c − q − 1) degrés de liberté.
ment. Premier plan de l’AFC. On peut donc retenir pour valeur de q la plus petite dimension pour laquelle
Kq est inférieure à la valeur limite de cette loi. Le choix q = 0 correspond
à la situation où les variables sont proche de l’indépendance en probabilités ;
les fréquences conjointes sont alors bien approchées par les produits des fré-
quences marginales.

Précédente Suivante Première Dernière Retour Quitter


1 Analyse factorielle multiple des correspondances (AFCM)

On vérifie :
Analyse factorielle multiple des c
X n
X
xki = 1, ∀i et xki = nk .
correspondances (AFCM) k=1 i=1

1 p
Considérons maintenant p variables
Pp qualitatives X , . . . , X . On note cj le
j
nombre de modalités de X , c = j=1 cj et Xj la matrice des indicatrices de
Résumé Xj.
Méthode factorielle de réduction de dimension pour l’exploration statistique On appelle alors tableau disjonctif complet la matrice X, n × c, obtenue par
de données qualitatives complexes. Cette méthode est une généralisation de concaténation des matrices Xj :
l’Analyse Factorielle des Correspondances, permettant de décrire les relations
entre p (p > 2) variables qualitatives simultanément observées sur n individus. X = [X1 | · · · |Xp ].
Elle est aussi souvent utilisée pour la construction de scores comme préalable à
X vérifie :
une méthode de classification (kmeans) nécessitant des données quantitatives. Xc Xn X c
k
Précédent : Analyse factorielle des correspondances x i = p, ∀i et xki = np.
k=1 i=1 k=1
Suivant : Positionnement multidimensionnel
D’autre part, la somme des éléments d’une colonne de X est égale à l’effectif
Travaux pratiques de complexité croissante par l’études de données élémen- marginal de la modalité de la variable X j correspondant à cette colonne.
taires, puis épidémiologiques avec interactions.
1.2 Tableau de Burt
1 Codages de variables qualitatives On observe toujours p variables qualitatives sur un ensemble de n individus.
On appelle tableau de Burt la matrice B, c × c, définie par :
1.1 Tableau disjonctif complet
Soit X une variable qualitative à c modalités. On appelle variable indica- B = X0 X.
trice de la k–ième modalité de x (k = 1, . . . , c), la variable X(k) définie par
On peut écrire B = [Bjl ] (j = 1, . . . , p ; l = 1, . . . , p) ; chaque bloc Bjl , de
dimension cj × cl , est défini par :

1 si X(i) = Xk ,
X(k) (i) = Bjl = X0j Xl .
0 sinon,
Si j 6= l, Bjl est la table de contingence obtenue par croisement des variables
où i est un individu quelconque et Xk est la k–ième modalité de X. On notera
X j en lignes et X l en colonnes. Si j = l, le bloc diagonal Bjj est lui–même
nk l’effectif de Xk .
une matrice diagonale vérifiant :
On appelle matrice des indicatrices des modalités de X, et l’on notera X, la
matrice n × c de terme général : Bjj = diag (nj1 , . . . , njcj ).

xki = X(k) (i). La matrice B est symétrique, d’effectifs marginaux njl p et d’effectif total np2 .

Précédente Suivante Première Dernière Retour Quitter


2 Analyse factorielle multiple des correspondances (AFCM)

1.3 La démarche suivie dans ce chapitre 2.2 ACP des profils–lignes


La généralisation de l’AFC à plusieurs variables qualitatives repose sur cer- Les profils–lignes, provenant de T, sont associés aux n individus observés.
taines propriétés observées dans le cas élémentaire où p = 2. On s’intéresse Leur ACP conduit ainsi à une représentation graphique des individus, inconnue
tout d’abord aux résultats fournis par l’AFC usuelle réalisée sur le tableau dis- en AFC classique.
jonctif complet X = [X1 |X2 ] relatif à 2 variables qualitatives X 1 et X 2 ; X
est alors considéré comme une table de contingence (paragraphe 2). Ensuite, P ROPOSITION 1. — L’ACP des profils–lignes issue de l’AFC réalisée sur le
on suit la même démarche avec l’AFC réalisée sur le tableau de Burt B rela- tableau disjonctif complet associé à 2 variables qualitatives conduit à l’ana-
−1
tif à X 1 et X 2 (paragraphe 3). Enfin, en utilisant les propriétés obtenues dans lyse spectrale de la matrice Dc –symétrique et positive :
les deux premiers cas, on généralise cette double approche à un nombre quel-  
conque p de variables qualitatives ; on définit ainsi l’Analyse Factorielle des 1 Ir B
AB = .
Correspondances Multiples (paragraphe 4). 2 A Ic

2 AFC du tableau disjonctif complet relatif à Les r + c valeurs propres de A B s’écrivent



2 variables µk =
1 ± λk
,
2
2.1 Données où les λk sont les valeurs propres de la matrice AB (donc celles de l’AFC
1 2
On note toujours X et X les 2 variables qualitatives considérées et r et c classique de X et X ).
1 2
−1
leurs nombres respectifs de modalités. Les vecteurs propres Dc –orthonormés associés se mettent sous la forme
Les matrices intervenant dans l’AFC usuelle sont reprises ici avec les mêmes  
1 U
notations, mais surlignées. On obtient ainsi : V= ;
2 V

la matrice U (resp. V) contient les vecteurs propres D−1r –orthonormés (resp.


T= X = [X1 |X2 ] ; D−1
c -orthonormés) de la matrice BA (resp. AB) ; autrement dit, les matrices
1 U et V sont les matrices de vecteurs propres obtenues en faisant l’AFC clas-
Dr = In ;
n sique de la table de contingence croisant X 1 et X 2 .

1 Dr 0 1 La matrice des composantes principales s’écrit
Dc = = ∆;
2 0 Dc 2
1
1 0 −1 1 0 Cr = [X1 Cr + X2 Cc ] Λ−1/2 ,
A = T Dr = X ; 2
2n 2
1 −1 1 où Cr et Cc sont encore les matrices de composantes principales de l’AFC
B = T Dc = X∆−1 . classique.
2n n

On considère ici l’AFC comme une double ACP : celle des profils–lignes Dans la pratique, on ne considère que les d = inf(r − 1, c − 1) plus grandes
A, puis celle des profils–colonnes B. valeurs propres différentes de 1, ainsi que les vecteurs propres associés. Les

Précédente Suivante Première Dernière Retour Quitter


3 Analyse factorielle multiple des correspondances (AFCM)

valeurs propres sont rangées dans la matrice De plus, cette approche permet aussi de réaliser une représentation gra-
phique des individus avec les coordonnées contenues dans les lignes de la ma-
1h i
M = diag (µ1 , . . . , µd ) = Id + Λ1/2 . trice Cr . À un facteur près, chaque individu apparaît comme le barycentre des
2 2 modalités qu’il a présentées. Dans le cas où n est grand, le graphique des
Les autres valeurs propres non nulles sont dues à l’artifice de construction de individus a néanmoins peu d’intérêt ; seule sa forme générale peut en avoir un.
la matrice à diagonaliser ; elles n’ont donc pas de signification statistique. Remarque. — Si, dans l’AFC classique, on choisit d’utiliser, pour la représen-
On notera que la matrice Cr , n × d, fournit les coordonnées permettant la tation simultanée des modalités de X 1 et de X 2 , les lignes des matrices
représentation graphique des individus sur les axes factoriels.

2.3 ACP des profils–colonnes C∗r = D−1


r U = Cr Λ
−1/2
et C∗c = D−1
c V = Cc Λ
−1/2

Les profils–colonnes sont associés aux r + c modalités des variables. Leur


ACP conduit donc à une représentation graphique de ces modalités dont on (voir chapitre précédent, sous–section 4.4), alors on obtient par AFC du tableau
verra qu’elle est très voisine de celle fournie par une AFC classique. disjonctif complet la matrice

P ROPOSITION 2. — L’ACP des profils–colonnes issue de l’AFC réalisée sur le


C∗r
 

tableau disjonctif complet associé à 2 variables conduit à l’analyse spectrale Cc = Cc M−1/2 = ;
−1 C∗c
de la matrice Dr –symétrique et positive :
1  il y a invariance de la représentation des modalités lorsqu’on passe d’une mé-
X1 D−1 0 −1 0

BA = r X1 + X2 D c X2 .
2n thode à l’autre. Pour les individus, on obtient
Les r + c valeurs propres non nulles de B A sont les µk .
−1 ∗ 1
Les vecteurs propres Dr –orthonormés associés se mettent sous la forme : Cr = [X1 C∗r + X2 C∗c ] M−1/2
2
1
U= Cr M−1/2 .
n (le commentaire est alors le même qu’avec Cr ).
La matrice des composantes principales s’écrit :
  3 AFC du tableau de Burt relatif à 2 variables
Cr
Cc = Λ−1/2 M1/2 .
Cc Dans cette section, on s’intéresse aux résultats fournis par l’AFC réalisée
sur le tableau de Burt B = X0 X, (r + c) × (r + c), relatif aux 2 variables X 1
Ainsi, l’AFC du tableau disjonctif complet permet, grâce aux coordonnées et X 2 ; B est encore considéré comme une table de contingence. La matrice B
contenues dans les lignes de la matrice Cc , une représentation simultanée des étant symétrique, les profils–lignes et les profils–colonnes sont identiques ; il
modalités des 2 variables. Cette représentation est très voisine de celle obtenue suffit donc de considérer une seule ACP
par l’AFC classique, définie au chapitre précédent. Une simple homothétie sur Les notations des matrices usuelles de l’AFC sont maintenant réutilisées
q √
1+ λk
chaque axe factoriel, de rapport 2λk , permet de passer de l’une à l’autre. surmontées d’un tilde. On obtient ainsi :

Précédente Suivante Première Dernière Retour Quitter


4 Analyse factorielle multiple des correspondances (AFCM)

– En reprenant les notations de la remarque 2.3, on obtient ici :


 
nDr T 
C∗r

T
e = B= ; f∗ (= C fr M−1 = C∗ =
f∗ ) = C
T0 nDc Cr c c C∗c
.
 
D
fr = fc = 1 Dr 0
D
1
= ∆ = Dc ;
2 0 Dc 2 Ainsi, si l’on utilise ce mode de représentation graphique, les trois ap-
1

I B
 proches de l’AFC que nous avons présentées conduisent à la même repré-
r
A
e = B
e = = A B. sentation simultanée des modalités des 2 variables : il y a donc invariance
2 A Ic
de cette représentation.
– Dans les deux cas d’AFC considérés dans ce chapitre (sur tableau dis-
On considère encore l’AFC comme l’ACP des profils–lignes A
e (ou des
jonctif complet et sur tableau de Burt) on trouve, par construction, des
profils–colonnes B).
e
valeurs propres non nulles sans signification statistique. En conséquence,
les critères de qualité s’exprimant comme une “part d’inertie expliquée”
P ROPOSITION 3. — L’ACP des profils–lignes (ou des profils–colonnes) issue n’ont plus de signification.
de l’AFC réalisée sur le tableau de Burt associé à 2 variables qualitatives – L’AFC sur tableau de Burt ne prend en compte que l’information conte-
−1
conduit à l’analyse spectrale de la matrice D
fc –symétrique et positive : nue dans B qui ne considère que les croisements de variables prises deux
à deux. En conséquence, les interactions de niveau plus élevé sont igno-
e = AB 2.
 
A
eB rées par cette approche, à moins de procéder à des recodages de variables
comme l’explique l’exemple présenté dans la section 5.
−1
Elle admet pour matrice de vecteurs propres D
fc –orthonormés
  4 Analyse Factorielle des Correspondances
U
e =V e =V= 1 U . Multiples
2 V
4.1 Définition
Les valeurs propres associées vérifient : νk = µ2k .
La matrice des composantes principales s’écrit : On considère maintenant p variables qualitatives (p ≥ 3)P notées {X j ; j =
p
  1, . . . , p}, possédant respectivement cj modalités, avec c = j=1 cj . On sup-
Cr pose que ces variables sont observées sur les mêmes n individus, chacun af-
Cr = Cc =
f f Λ−1/2 M.
Cc fecté du poids 1/n.
Soit X = [X1 | · · · |Xp ] le tableau disjonctif complet des observations (X
La matrice Cfr fournit les coordonnées permettant une représentation simul- est n × c) et B = X0 X le tableau de Burt correspondant (B est carré d’ordre
tanée des modalités des deux variables. À une homothétie près, cette représen- c, symétrique).
tation est identique à celle de l’AFC classique, réalisée sur la table de contin-
gence T (mais le rapport d’homothétie, sur chaque axe, n’est plus le même D ÉFINITION 4. — On appelle Analyse Factorielle des Correspondances Mul-
qu’avec Cc ). tiples (AFCM) des variables (X 1 , . . . , X p ) relativement à l’échantillon consi-
Remarque. — déré, l’AFC réalisée soit sur la matrice X soit sur la matrice B.

Précédente Suivante Première Dernière Retour Quitter


5 Analyse factorielle multiple des correspondances (AFCM)

On note njk (1 ≤ j ≤ p, 1 ≤ k ≤ cj ) l’effectif de la k–ième modalité de X j , chaque bloc Vj est de dimension cj × m.


1
Dj = diag (nj1 , . . . , njcj ) et ∆ = diag (D1 . . . Dp ) (∆ est carrée d’ordre c La matrice des composantes principales s’écrit :
n
et diagonale). X p
Cr = Xj D−1
j Vj .
4.2 AFC du tableau disjonctif complet X j=1

Comme dans le cas p = 2, on reprend les notations de l’AFC classique en Comme dans le cas p = 2, la matrice des composantes principales permet de
les surlignant. On obtient ainsi : réaliser une représentation graphique des individus dans laquelle chacun appa-
raît, à un facteur près, comme le barycentre des p modalités qu’il a présentées.

T = X; Remarque. — La généralisation au cas p > 2 restreint les propriétés. Ainsi,


les vecteurs des blocs Vj ne sont pas les vecteurs propres D−1
j –orthonormés
1
Dr = In ; d’une matrice connue.
n
1 ACP des profils–colonnes
Dc = ∆;
p
1 0 P ROPOSITION 6. — L’ACP des profils–colonnes issue de l’AFC réalisée sur
A = X ; le tableau disjonctif complet de p variables conduit à l’analyse spectrale de la
p −1
matrice Dr –symétrique et positive :
1
B = X∆−1 . p
n 1 1 X
BA = X∆−1 X0 = Xj D−1 0
j Xj .
ACP des profils–lignes np np j=1

P ROPOSITION 5. — L’ACP des profils–lignes issue de l’AFC réalisée sur le −1


La matrice des vecteurs propres Dr –orthonormés vérifie :
tableau disjonctif complet de p variables qualitatives conduit à l’analyse spec-
−1
trale de la matrice Dc –symétrique et positive : U = BVM−1/2 .
1
AB = B∆−1 . La matrice des composantes principales s’écrit :
np
Cc = p∆−1 VM1/2 ;
Il y a m (m ≤ c − p) valeurs propres notées µk , (0 < µk < 1) rangées dans
la matrice diagonale M. elle se décompose en blocs sous la forme :
 
−1 C1
La matrice des vecteurs propres Dc –orthonormés associés se décompose
en blocs de la façon suivante : Cc =  ...  .
 

V1
 Cp

V =  ...  ;
 
Chaque bloc Cj , de dimension cj ×m, fournit en lignes les coordonnées des
Vp modalités de la variable X j permettant la représentation graphique simultanée.

Précédente Suivante Première Dernière Retour Quitter


6 Analyse factorielle multiple des correspondances (AFCM)

4.3 AFC du tableau de Burt B 4.4 Variables illustratives


Le tableau de Burt B = X0 X, carré d’ordre c, étant symétrique, les profils– Soit X 0 une variable qualitative, à c0 modalités, observée sur les mêmes n
lignes et les profils–colonnes sont identiques ; on ne considère donc ici qu’une individus que les X j et n’étant pas intervenue dans l’AFCM Soit T0j la table
seule ACP de contingence c0 × cj croisant les variables X 0 en lignes et X j en colonnes.
En utilisant encore le tilde dans ce cas, les matrices usuelles de l’AFC de- L’objectif est maintenant de représenter les modalités de cette variable sup-
viennent : plémentaire X 0 dans le graphique de l’AFCM réalisée sur X 1 , . . . , X p . Pour
cela, on considère les matrices :

T
e = B; B0 = [T01 | . . . |T0p ] ;
D = fc = 1 ∆ = Dc ;
D 1
diag (n01 , . . . , n0c0 ) ;
fr
p D0 =
n
1 1 −1
A
e = B
e = B∆−1 = A B. A0 = D B0 .
np np 0

P ROPOSITION 7. — L’ACP des profils–lignes (ou des profils–colonnes) issue Les coordonnées des modalités de la variable supplémentaires X 0 sur les
de l’AFC réalisée sur le tableau de Burt associé à p variables qualitatives axes factoriels sont alors fournies dans les lignes de la matrice
−1
conduit à l’analyse spectrale de la matrice D
fc –symétrique et positive : −1
C0 = A0 D fc V e = pA0 ∆−1 V.

e = AB 2.
 
A
eB
4.5 Interprétation
−1 Les représentations graphiques sont interprétées de manière analogue à ce
Elle admet pour matrice de vecteurs propres D
fc –orthonormés U
e =V
e = qui est fait dans l’AFC de deux variables, bien que la représentation simultanée
V. des modalités de toutes les variables ne soit pas, en toute rigueur, réellement
2
Les valeurs propres associées vérifient νk = µk . justifiée.
La matrice des composantes principales s’écrit : Les “principes” suivants sont donc appliqués :
  – on interprète globalement les proximités et les oppositions entre les mo-
C1 dalités des différentes variables, comme en AFC, en privilégiant les mo-
C fc = Cc M1/2
fr = C =  ...  M1/2 . dalités suffisamment éloignées du centre du graphique (attention aux mo-
 
dalités à faible effectif !) ;
Cp
– les rapports de valeurs propres ne sont pas interprétables comme indica-
teurs de qualité globale ; on peut néanmoins regarder la décroissance des
La matrice Cfr fournit les coordonnées permettant la représentation simulta- premières valeurs propres pour choisir la dimension ;
née des modalités de toutes les variables (on ne peut pas faire de représentation – les coefficients de qualité de chaque modalité ne peuvent pas être inter-
des individus si l’on fait l’AFC du tableau de Burt). prétés ; seules les contributions des modalités à l’inertie selon les axes

Précédente Suivante Première Dernière Retour Quitter


7 Analyse factorielle multiple des correspondances (AFCM)

sont interprétées, selon le même principe qu’en AFC

5 Exemple
L’AFCM ne donne pas de résultats très intéressants sur les données ban-
caires à l’exception du graphe présenté dans le chapitre d’introduction qui est
relativement plus sophistiqué car il fait préalablement appel à une classifica- TABLE 1 – Données sous la forme d’une table de contingence complète
tion. Il en est de même pour les données d’expression qui sont quantitatives.
En revanche, l’AFCM est très indiquée et très utilisée dans des enquêtes de
nature émlidémiologique. Histologie
Inflammation minime Grande inflammation
5.1 Les données Centre Âge Survie Maligne Bénigne Maligne Bénigne
Tokyo < 50 non 9 7 4 3
La littérature anglo–américaine présente souvent des données relatives à
oui 26 68 25 9
plusieurs variables qualitatives sous la forme d’une table de contingence com-
50 − 69 non 9 9 11 2
plète (5). C’est le cas de l’exemple ci–dessous qui décrit les résultats partiels
oui 20 46 18 5
d’une enquête réalisée dans trois centres hospitaliers (Boston, Glamorgan, To-
> 70 non 2 3 1 0
kyo) sur des patientes atteintes d’un cancer du sein. On se propose d’étudier la
oui 1 6 5 1
survie de ces patientes, trois ans après le diagnostic. En plus de cette informa-
Boston < 50 non 6 7 6 0
tion, quatre autres variables sont connues pour chacune des patientes :
oui 11 24 4 0
– le centre de diagnostic, 50 − 69 non 8 20 3 2
– la tranche d’âge, oui 18 58 10 3
– le degré d’inflammation chronique, > 70 non 9 18 3 0
– l’apparence relative (bénigne ou maligne). oui 15 26 1 1
L’objectif de cette étude est une analyse descriptive de cette table en cher- Glamorgan < 50 non 16 7 3 0
chant à mettre en évidence les facteurs de décès. oui 16 20 8 1
50 − 69 non 14 12 3 0
5.2 Analyse brute oui 27 39 10 4
> 70 non 3 7 3 0
On se reportera à la figure 5. La variable survie, qui joue en quelques sortes
oui 12 11 4 1
le rôle de variable à expliquer, est très proche de l’axe 2 et semble liée à cha-
cune des autres variables.

5.3 Analyse des interactions


Pour essayer de mettre en évidence d’éventuelles interactions entre va-
riables, les données sont reconsidérées de la façon suivante :

Précédente Suivante Première Dernière Retour Quitter


8 Analyse factorielle multiple des correspondances (AFCM)

X TH>g7- m
Igra

1
XT>-
Hg-b Tmal XG<5
1.0 Ctok
A>70 Snon XG>7
0.9 A<50
A XT<5 C g l aH pS -n mo n
0.8 x
e 0 S o u iA > - <
0.7
Tmal Igra X GX>B-< 5
2 A>70
0.6 Ipet
0.5 Cgla Tben
Hp-b
0.4 Cbos
0.3 -1 XB>-
A Cbos XB>7
x 0.2
e
0.1
2 A>-<
0.0
-0.1 -2
-0.2 Ipet
-2 -1 0 1 2
-0.3 Axe 1
Soui
-0.4
-0.5 A<50
Tben
-0.6 Ctok
-0.7
F IGURE 2 – Cancer du sein : analyse des interactions.
-1 0 1 2
Axe 1
– les variables centre et âge sont croisées, pour construire une variable
c_x_âge, à 9 modalités ;
– les variables inflam et appar sont également croisées pour définir la
F IGURE 1 – Cancer du sein : analyse des données brutes. variable histol, à 4 modalités.
Une nouvelle analyse est alors réalisée en considérant comme actives les
deux variables nouvellement créées, ainsi que la variable survie, et comme
illustratives les variables initiales : centre, âge, inflam, appar.
Les résultats sont donnés dans la figure 2.

Précédente Suivante Première Dernière Retour Quitter


1 Positionnement multidimensionnel (MDS)

comme le montre le graphique issu d’un positionnement multidimensionnel,


Positionnement multidimensionnel l’approximation euclidienne en est très proche.
(MDS) Le MDS étant encore une technique factorielle, comme en ACP il est né-
cessaire de déterminer le nombre de dimensions fixant la taille de l’espace de
représentation. Le graphique représentant la décroissance des valeurs propres
aide à ce choix.
Résumé Le principal intérêt de cette technique est donc de pouvoir observer gra-
Méthode factorielle de réduction de dimension pour l’exploration statistique phiquement le même ensemble de données à travers différentes "optiques" et
d’une matrice de distances ou dissemblances entre individus. ACP d’un tableau même d’en comparer les représentations ; chaque optique est définie par la fa-
de distances ou multidimensional scaling. çon dont on mesure des distances ou dissimilarités entre les objets. Citons trois
exemples typiques dans le cas spécifique de gènes décrits par leurs expressions
Précédent : Analyse des correspondances multiples
transcriptomiques et un exemple pluls qualitatif :
Suivant : Classification non supervisée – chaque gène est un vecteur dans un espace vectoriel muni de la distance
Travaux pratiques avec étude de données élémentaires. euclidienne classique (racine de la somme des carrés des écarts). Le MDS
ou ACP du tableau des distances qui en découle est équivalent à l’ACP
dans laquelle les gènes sont les individus (les lignes).
1 Introduction – On mesure la dissimilarité entre deux gènes X j et X k par 1 −
Considérons n individus. Contrairement aux chapitres précédents, on ne cor(X j , X k ) faisant intervenir la corrélation linéaire de Pearson ou celle
connaît pas les observations de p variables sur ces n individus mais dans cer- robuste sur les rangs de Spearman. Les gènes co-régulés (fortement positi-
tains cas les n(n − 1)/2 valeurs d’un indice (de distance, dissimilarité ou dis- vement corrélés) sont très proches, les gènes associés dans un mécanisme
semblance) observées ou construites pour chacun des couples d’individus. Ces d’inhibition (fortement négativement corrélés) p seront aussi proches.
informations sont contenues dans une matrice (n × n) D. L’objectif du po- – On mesure la distance entre deux gènes par 1 − cor(X j , X k )2 . Elle
sitionnement multidimensionnel (multidimensional scaling, ou MDS, ou ACP vérifie, dans ce cas, les propriétés qui en font une distance euclidienne.
d’un tableau de distances) est de construire, à partir de cette matrice, une re- Co-régulés ou inhibés, les gènes corrélés positivement ou négativement
présentation euclidienne des individus dans un espace de dimension réduite q sont proches dans les représentations graphiques.
qui approche au “mieux” les indices observés. Autrement dit, visuellement le – Considérons un tableau avec, en ligne, les individus d’un groupe et en
graphique obtenu représente en dimension (en général) 2 la meilleure approxi- colonne les pays de la C.E. La valeur 1 est mise dans une case lorsque
mation des distances observées entre les individus pouvant être des gènes ou l’individu de la ligne a passé au moins une nuit dans le pays concerné.
des échantillons biologiques. Il est alors facile de construire une matrice de similarité avec un indice
qui compte le nombre de 1 apparaissant dans les mêmes colonnes de tous
Exemple élémentaire : Les données sont constituées d’un tableau contenant
les couples d’individus. L’objectif est ensuite d’obtenir une représentation
les distances kilométriques par route (Source : IGN) entre 47 grandes villes en
graphique rapprochant les individus ayant visité les mêmes pays.
France et dans les pays limitrophes. Toutes ces valeurs sont rangées dans le
Les preuves et développements théoriques sont omis dans cet exposé suc-
triangle inférieur d’une matrice carrée avec des 0 sur la diagonale. La structure
cinct, ils sont à chercher dans la bibliographie. Voir par exemple Mardia et col.
du réseau routier, le relief, font que cette matrice de distances n’est pas eucli-
(1979).
dienne qui, dans ce cas, correspondrait à la distance à "vol d’oiseau". Mais,

Précédente Suivante Première Dernière Retour Quitter


2 Positionnement multidimensionnel (MDS)

2 Distance, similarités
Rappelons quelques propriétés et définitions élémentaires à propos de la
notion de dissemblance ou similarité. Ces poins sont reprécisés dans la vignette
sur la Classification non-supervisée.

hend 2.1 Définitions


bres
lour
D ÉFINITION 1. —
– Une matrice (n × n) D est appelée matrice (d’indices) de distance si elle
400

laba
bord roya
ando toul nant
stma est symétrique et si :
renn

djj = 0 et ∀(j, k), j 6= k, dkj ≥ 0.


poit ange cher
200

limo lema caen – Une matrice (n × n) C est appelée matrice de similarité si elle est symé-
tour
trique et si
perp leha ∀(j, k), ckj ≤ cjj .
orle
roue
cp2

bour
clem
0

mont pari Pour que cette définition corresponde formellement à celle d’une “distance” il
amie
boul faudrait ajouter l’axiome d’inégalité triangulaire.
cala
lill Une matrice de similarité se transforme en matrice de distance par :
troy
−200

mars lyon reim


gren dijo dkj = (cjj + ckk − 2ckj )−1/2 .
nice brux
gene
besa
cham nanc
−400

metz
luxe D ÉFINITION 2. — Une matrice de distance est dite euclidienne s’il existe une
mulh
bale
configuration de vecteurs {x1 , . . . , xn } dans un espace vectoriel euclidien E
stra de sorte que
2
dkj = hxj − xk , xj − xk i .
−800 −600 −400 −200 0 200 400
2
cp1 On note A la matrice issue de D de terme général dkj = −dkj /2 et H la
matrice de centrage :
H = I − 110 D,
F IGURE 1 – Villes : Positionnement de 47 villes à partir de la matrice de leurs
distances kilométriques. qui est la matrice de projection sur le sous-espace D-orthogonal au vecteur 1
dans l’espace euclidien F des variables muni de la métrique des poids.

P ROPOSITION 3. —

Précédente Suivante Première Dernière Retour Quitter


3 Positionnement multidimensionnel (MDS)

– Soit D une matrice de distance et B la matrice obtenue par double cen- P ROPOSITION 4. — La distance entre variables quantitatives d2 (X, Y ) est en-
trage de la matrice A issue de D : core le carré de la distance kPx − Py kD entre les projecteurs D-orthogonaux
sur les directions engendrées par les vecteurs x et y.
B = HAH0 ,
Des indices de dissimilarité peuvent également être définis pour un couple de
alors D est une matrice euclidienne si et seulement si B est positive
variables qualitatives (à partir de l’indice de Tschuprow) ou pour une variable
(toutes ses valeurs propres sont positives ou nulles).
quantitative et une variable qualitative (à parti du rapport de corrélation). Ils
– Si la matrice de similarité C est positive alors la matrice de distance D
ont moins d’intérêt pour des données d’expression et sont laissés de côté.
déduite est euclidienne.

2.2 Distances entre variables 3 Recherche d’une configuration de points


L’un des intérêts pratiques du positionnement multidimensionnel est d’ai- Le positionnement multidimensionnel est la recherche d’une configuration
der à comprendre, visualiser, les structures de liaison dans un grand ensemble de points dans un espace euclidien qui admette D comme matrice de distances
de variables. On obtient ainsi des indications pour guider le choix d’un sous- si celle-ci est euclidienne ou, dans le cas contraire, qui en soit la meilleure
ensemble de variables, par exemple les plus liées à une variable à expliquer. approximation à un rang q fixé (en général 2) au sens d’une norme sur les
Cette approche nécessite la définition d’indices de similarité entre variables. matrices. Nous ne nous intéressons dans ce chapitre qu’à la version “métri-
Beaucoup sont proposés dans la littérature et concrètement utilisés pour les que” du MDS, une autre approche “non métrique” construite sur les rangs est
données d’expression. Les gènes étant considérés comme des variables, on développée dans la bibliographie.
s’intéresse alors à différents critères basés sur la corrélation linéaire usuelle de
Ainsi posé, le problème admet une infinité de solutions. En effet, la distance
Pearson ou robuste (non paramétrique de Spearman). entre deux vecteurs xi et xk d’une configuration est invariante par toute trans-
On note X et Y deux variables statistiques dont les observations sur les formation affine zi = Fxi + b dans laquelle F est une matrice orthogonale
mêmes n individus sont rangées dans les vecteurs centrés x et y de l’espace quelconque et b un vecteur de Rp . Une solution n’est donc connue qu’à une
euclidien F muni de la métrique des poids D. On vérifie facilement : rotation et une translation près.

cov(X, Y ) = x0 Dy 3.1 Propriétés


σX = kxkD
La solution est donnée par les résultats (Mardia et col.79) ci-dessous :
x0 Dy
cor(X, Y ) = .
kxkD kykD P ROPOSITION 5. — Soit D une matrice de distance et B = HAH la matrice
centrée en lignes et colonnes associée.
La valeur absolue ou le carré du coefficient de corrélation définissent des in- – Si D est la matrice de distance euclidienne d’une configuration
dices de similarité entre deux variables quantitatives. Il est facile d’en déduire {x1 , . . . , xn } alors B est la matrice de terme général
des distances. Le carré du coefficient de corrélation linéaire a la particularité
d’induire une distance euclidienne : bkj = (xj − x)0 (xk − x)

d2 (X, Y ) = 2(1 − cor2 (X, Y )). qui se met sous la forme

B = (HX)(HX)0 .

Précédente Suivante Première Dernière Retour Quitter


4 Positionnement multidimensionnel (MDS)

Elle est donc positive et appelée matrice des produits scalaires de la confi- q fixée, la configuration issue du MDS a une matrice de distance D b qui rend
2
guration centrée. P n k 2 ck
j,k=1 ({dj } − dj ) minimum et, c’est équivalent, une matrice de produit
– Réciproquement, si B est positive de rang p, une configuration de vec- 2
teurs admettant B pour matrice des produits scalaires est obtenue en scalaire B b qui minimise B − B b .
considérant sa décomposition spectrale B = U∆U0 . Ce sont les lignes
de la matrice centrée X = U∆1/2 qui fournissent les coordonnées des 4 Données génomiques
vecteurs de la représentation euclidienne.
Une analyse en composantes principales (cf. chapitre ??) fournit un premier
3.2 Explicitation du MDS aperçu de la représentation de gènes relativement aux échantillons biologiques
par l’intermédiaire d’un biplot. Le but ici est de s’intéresser aux éventuelles
Pour résumé, dans le cas d’une matrice D euclidienne supposée de rang q,
co-régulations ou inhibitions entre gènes. Le cas échéant, ceux-ci apparaîtront
le MDS est obtenu en exécutant les étapes suivantes :
corrélés positivement ou négativement. Le positionnement multidimensionnel
2
i. construction de la matrice A de terme général −1/2dkj , permet de considérer différentes façon de prendre en compte des distances
ii. calcul de la matrice des produits scalaires par double centrage B = inter-gènes : pPn
2 , positive ou nulle ;
HAH0 , – distance euclidienne, d1 (X, Y ) = i=1 (Xi − Yi ) p

iii. diagonalisation de B = U∆U0 ; – distance associée à la corrélation carrée, d2 (X, Y ) = 1 − cor(X, Y )2 ,


comprise entre 0 et 1 ;
iv. les coordonnées d’une configuration, appelées coordonnées principales, – distance associée à la corrélation, d3 (X, Y ) = 1 − cor(X, Y ), comprise
sont les lignes de la matrice X = U∆1/2 . entre 0 et 2.
Dans le cas euclidien, ACP et MDS sont directement connectés. En cas de problème de robustesse (valeurs atypiques) encore présent après
transformation en logarithme, remplacer la corrélation linéaire de Pearson par
P ROPOSITION 6. — Soit Y la matrice des données habituelles en ACP. L’ACP celle sur les rangs de Spearman peut s’avérer utile.
de (Y, M, 1/nI) fournit les mêmes représentations graphiques que le po-
Remarquons tout d’abord que dans les trois cas, plus la valeur est petite,
sitionnement calculé à partir de la matrice de distances de terme général
plus les gènes dont on mesure l’éloignement sont proches. Ensuite, pour d2 et
kyi − yj kM . Si C désigne la√ matrice des composantes principales, alors les
d3 , une valeur proche de 1 caractérise deux gènes non corrélés, ce qui n’est
coordonnées principales sont nC.
pas nécessairement le cas de la distance euclidienne. Enfin, il est important
L’intérêt du MDS apparaît évidemment lorsque les observations Y sont in- de noter qu’une corrélation forte et négative entre deux gènes conduit à deux
connues ou encore si l’on cherche la meilleure représentation euclidienne de résultats opposés selon d2 (valeur proche de 0) et d3 (valeur proche de 2).
distances non-euclidiennes entre les individus ; c’est l’objet du théorème sui- La figure 2 illustre les trois possibilités avec le positionnement multidimen-
vant. En ce sens, le MDS “généralise” l’ACP et permet, par exemple, de consi- sionnel des gènes. L’analyse conjointe de ces trois graphiques conduit à de
dérer une distance de type robuste à base de valeurs absolues mais la représen- nombreuses interprétations sur le plan biologique. Sans rentrer dans les dé-
tation des variables pose alors quelques problèmes car le “biplot” n’est plus tails, nous noterons que ces trois graphiques tendent à séparer deux groupes
linéaire. de gènes qui interviennent dans deux fonctions biologiques opposées : les
CYP4A, PMDCI, PECI, AOX, BIEN, THIOL, CPT2, mHMGCoAS, Tpalpha
P ROPOSITION 7. — Si D est une matrice de distance, pas nécessairement eu- et Tpbeta sont impliqués dans le catabolisme des lipides et la cétogénèse
clidienne, B la matrice de produit scalaire associée, alors, pour une dimension alors que les gènes FAS, S14, ACC2, cHMGCoAS, HMGCoAred et, plus in-

Précédente Suivante Première Dernière Retour Quitter


5 Positionnement multidimensionnel (MDS)

crite et constitue l’un des résultats originaux de ce travail. L’étude d’un lien po-
CYP4A14 GSTpi2
CYP4A14
CYP2c29
THB
CYP4A14

Tpalpha
CYP4A10
PECI MCAD
tentiel entre ces deux modifications d’expression nécessitera la mise en œuvre

0.4
ACOTH mHMGCoAS

d’expériences complémentaires.
CYP3A11 Tpbeta
0.5

Pex11a CAR1

0.2
CYP3A11 MCAD PMDCI THB RXRb2
CYP4A10 CYP3A11 AOX CACP C16SR LXRb
IL.2 ACAT1
ACOTH PPARg
GSTpi2 CYP2c29
CAR1 BIEN Pex11a
PPARd IL.2
apoB PONM.CPT1
RXRa FXR
CYP4A10 apoE
GSTmu AM2R PXR VLDLr
LCE
PPARd ACAT1PON THIOL cMOAT
[Link]

0.2
MCADACOTH G6Pase X36b4 ADISP
PMDCI PECI THB SPI1.1 PECI C16SR apoB RXRb2
LXRb ALDH3
CBS
CPT2 SPI1.1 CAR1 MTHFR OCTN2
GS LPL
MDR1
CIDEA
mHMGCoAS
GSTmu Tpalpha LCEPex11a
apoE
Tpbeta M.CPT1
apoB
IL.2
RXRb2PON
RXRa
VLDLr
LXRb
FXR GSTmu Tpalpha
mHMGCoAS
apoE M.CPT1 G6Pase BACT
CYP2c29
PPARa LXRa
[Link] SIAT4c
CACP LCE [Link] RXRa

D’une manière générale, on peut retenir que l’utilisation de la distance eu-


G6Pase CACP AM2R
PPARa
C16SR ACAT1
PPARg
PXR
MTHFRGS
LPL SIAT4c
AOX
BIEN SPI1.1 PPARd
X36b4 ADISP
OCTN2
MDR1
CIDEA
[Link]
RARaSHP1
NURR1
COX2
ap2
LXRa Lpin3
TRa
Bcl.3 PMDCI X36b4 [Link] Bcl.3 SHP1
[Link] CYP26 NURR1 Lpin3
0.0

CBS cMOAT hABC1 VLDLr


ALDH3CPT2 PPARg

0.0
CYP26 CYP27b1
TRb MS
UCP3
RXRg1
CYP2b13
ADSS1
[Link]
[Link]
CYP7a [Link] Tpbeta
AM2R GSTpi2
BACT
MDR2 COX1
CYP2b10 VDR PXRFXR
MTHFR
LPL ADISP HPNCL Ntcp ap2 hABC1 CYP27b1
TRa MS
UCP3
MRP6 mABC1
ACC1NGFiB FAT Ntcp
PDK4
Waf1
apoC3UCP2 AOX OCTN2
CIDEA
Dimension 2

Dimension 2

Dimension 2
HPNCLCYP27a1ACAT2FDFT eif2g
CYP24
RARb2 [Link] GSTa RARaVDR
CYP2b10 RXRg1
THIOL BSEP
GSTa [Link] CBS ACAT2 GS CYP7a [Link]
[Link] ACBP G6PDH BIEN BACT SHP1
LXRa Bcl.3 ACAT2 COX1 TRb
CYP2b13
apoA.I PAL cMOAT SIAT4c ACBP MDR2 COX2

0.0
Lpin2 PLTP PPARa
COX1 hABC1 NURR1
ap2 TRa ACC1 [Link]
ADSS1
LDLr CPT2 CYP26 CYP27b1 Lpin3 Waf1 PDK4 UCP2
MRP6 mABC1 NGFiB

clidienne tend à rapprocher des gènes dont les expressions sont proches. En
CYP8b1 ALDH3 BSEP
LPK THIOL HPNCL ACC1 RARa
TRb
CYP2b10
CYP7a
[Link] [Link]
UCP3
RXRg1
CYP2b13 CYP27a1 apoC3 FAT RARb2 eif2g
CYP24
MDR2mABC1 Waf1
[Link]
ADSS1 VDR
GSTa COX2 PAL
GK
HMGCoAred
ACC2 [Link] NGFiBPDK4 FDFT

−0.2
cHMGCoAS apoC3 RARb2 Ntcp Lpin2 [Link]
−0.5

ACBP CYP27a1MRP6
BSEP UCP2
FDFT PAL eif2g apoA.I

−0.2
Lpin2 CYP24
[Link] CYP8b1
Lpin1
Lpin
apoA.I
LPK
CYP8b1
LDLr
G6PDH
FAT
GKFAS
LPK Lpin
Lpin1
LDLr
G6PDH
revanche, les deux autres indicateurs considèrent que deux gènes sont proches
−0.4

−0.4
si leur expression varie dans le même sens selon les conditions expérimentales.
GK
−1.0

S14 PLTPLpin1
Lpin
FAS ACC2
cHMGCoAS
HMGCoAred PLTP
cHMGCoAS
HMGCoAred

La corrélation (d3 ) distingue les gènes corrélés négativement, ce que ne per-


−0.6

FAS S14 S14 ACC2

−1.0 −0.5 0.0 0.5 −0.5 0.0 0.5 −0.6 −0.4 −0.2 0.0 0.2 0.4

Dimension 1 Dimension 1 Dimension 1


met pas la corrélation carrée (d2 ) qui doit donc être utilisée en connaissance de
cause.
F IGURE 2 – Souris : positionnement multidimensionnel des gènes sur les axes Notons que la distance d1 est plus courante en statistique alors que d3 l’est
1 et 2 selon 3 distances différentes : distance euclidienne (d1 à gauche), cor- davantage dans les études relatives aux biopuces. Autant que possible une com-
rélation (d3 au centre), corrélation carrée (d2 à droite). paraison des trois distances est recommandée.

directement, GK et LPK sont impliqués dans la synthèse de lipides au niveau


hépatique. On observera qu’aucun des trois graphiques de la figure 2, ana-
lysé individuellement, ne conduit à la totalité de cette interprétation mais que
c’est bien l’analyse conjointe de ces représentations qui permet d’affiner la
connaissance du biologiste sur ces données. Succintement, notons également
que d’autres gènes tendent à participer à ces groupes. Par exemple, le gène
Lpin1 est proche des gènes impliqués dans la lipogénèse. Bien que sa fonc-
tion soit actuellement inconnue, Peterfy et al. (2001) ont observé que la lignée
de souris déficiente pour Lpin1 présente des altérations du métabolisme des
lipides.
Les gènes dont la position sur le graphique sera le plus modifié en passant
de la distance d2 à la distance d3 seront ceux présentant des corrélations né-
gatives et importantes avec de nombreux autres gènes. Un cas typique dans
notre exemple est celui de CAR1 dont l’ACP (ainsi, que la matrice des cor-
rélations) a montré qu’il était négativement corrélés avec des gènes tels que
GSTpi2, CYP3A11, FAS... La position relative des couples de gènes ainsi
obtenus change de façon importante entre les deux graphiques. On observera
en particulier le couple CAR1-GSTpi2 totalement opposé sur l’axe 1 selon
d3 et relativement proche selon d2 (tandis qu’il présente une opposition moins
marquée selon d1 ). La surexpression du gène CAR1 et la sous-expression du
gène GSTpi2 chez les souris déficientes en récepteur PPARα n’a pas été dé-

Précédente Suivante Première Dernière Retour Quitter


1 Classification non supervisée

1.2 Les objectifs


Classification non supervisée
L’objectif d’une méthode de classification déborde le cadre strictement ex-
ploratoire. C’est la recherche d’une typologie, ou segmentation, c’est-à-dire
d’une partition, ou répartition des individus en classes, ou catégories. Ceci est
Résumé fait en optimisant un critère visant à regrouper les individus dans des classes,
chacune le plus homogène possible et, entre elles, les plus distinctes possible.
Méthodes de classification non supervisée (ou clustering). Notions de Cet objectif est à distinguer des procédures de discrimination, ou encore de
distance, classification ascendante hiérarchique et distances entre classes, classement (en anglais classification) pour lesquelles une typologie est a priori
construction du dendrogramme. Classification par réallocation dynamique connue, au moins pour un échantillon d’apprentissage. Nous sommes dans une
(kmeans), méthode mixte pour les grands tableaux. situation d’apprentissage non-supervisé, ou en anglais de clustering 1 .
Précédent : Positionnement multidimensionnel 1.3 Les méthodes
Suivant : Compléments et rappels d’algèbre linéaire
Un calcul élémentaire de combinatoire montre que le nombre de partitions
Travaux pratiques avec SAS et R pour la recherche de classes et leur repré- possibles d’un ensemble de n éléments croît plus qu’exponentiellement avec
sentation. n ; le nombre de partitions de n éléments en k classes estle
Pnombre de Stirling,
n
le nommbre total de partition est celui de Bell : Pn = 1e k = 1∞ kk! .
1 Introduction Pour n = 20, il est de l’ordre de 1013 . Il n’est donc pas question de cher-
cher à optimiser le critère sur toutes les partitions possibles. Les méthodes se
1.1 Les données limitent à l’exécution d’un algorithme itératif convergeant vers une “bonne”
Comme dans le cas du thème précédent (MDS), les données peuvent se pré- partition qui correspond en général à un optimum local. Même si le besoin
senter sous différentes formes ; elles concernent n individus supposés affectés, de classer des objets est très ancien, seule la généralisation des outils informa-
pour simplifier, du même poids : tiques en a permis l’automatisation dans les années 1970. Celeux et col. (1989)
– un tableau de distances (ou dissimilarités, ou mesures de dissemblance), décrivent en détail ces algorithmes.
n × n, entre les individus pris deux à deux ; Différents choix sont laissés à l’initiative de l’utilisateur :
– les observations de p variables quantitatives sur ces n individus ; – une mesure d’éloignement (dissemblance, dissimilarité ou distance) entre
– les observations, toujours sur ces n individus, de variables qualitatives ou individus ;
d’un mélange de variables quantitatives et qualitatives. – le critère d’homogénéité des classes à optimiser : il est, dans le cas de va-
D’une façon ou d’une autre, il s’agit, dans chaque cas, de se ramener au ta- riables quantitatives, généralement défini à partir de la trace d’une matrice
bleau des distances deux à deux entre les individus (c’est-à-dire au premier de variances-covariances ; soit les variances et covariances interclasses (la
cas). Le choix d’une matrice de produit scalaire permet de prendre en compte trace correspond alors à l’inertie de la partition), soit les variances et co-
simplement un ensemble de variables quantitatives tandis que le troisième cas variances intraclasse ;
nécessite plus de développements ; il n’est pas présenté ici car de peu d’intérêt – la méthode : la classification ascendante hiérarchique et celle par réallo-
pour des données d’expression. cation dynamique sont les plus utilisées, seules ou combinées ;
1. Faire attention aux faux amis français / anglais : discrimination / classification (supervisée)
et classification / clustering (non-supervisée)

Précédente Suivante Première Dernière Retour Quitter


2 Classification non supervisée

– le nombre de classes : c’est un point délicat. 2.1 Indice de ressemblance, ou similarité


Enfin, différents outils recherchent une interprétation, ou des caractérisations,
des classes obtenues. C’est une mesure de proximité définie de Ω × Ω dans R+ et vérifiant :

On notera que les principes algorithmiques de ces méthodes sont relative- s(i, j) = s(j, i), ∀(i, j) ∈ Ω × Ω : symétrie ;
ment élémentaires.
s(i, i) = S > 0, ∀i ∈ Ω : ressemblance d’un individu avec lui-même ;
Classification ascendante hiérarchique, ou CAH s(i, j) ≤ S, ∀(i, j) ∈ Ω × Ω : la ressemblance est majorée par S.
Il s’agit de regrouper itérativement les individus, en commençant par le bas

(les deux plus proches) et en construisant progressivement un arbre, ou den- Un indice de ressemblance normé s est facilement défini à partir de s par :
drogramme, regroupant finalement tous les individus en une seule classe, à
1
la racine (cf. figure 3.5 qui reprend les données élémentaires du chapitre pré- s∗ (i, j) = s(i, j), ∀(i, j) ∈ Ω × Ω ;
cédent). Ceci suppose de savoir calculer, à chaque étape ou regroupement, la S
distance entre un individu et un groupe ainsi que celle entre deux groupes. Ceci ∗
s est une application de Ω × Ω dans [0, 1].
nécessite donc, pour l’utilisateur de cette méthode, de faire un choix supplé-
mentaire : comment définir la distance entre deux groupes connaissant celles 2.2 Indice de dissemblance, ou dissimilarité
de tous les couples d’individus entre ces deux groupes. Différents choix, ap-
pelés saut en français et linkage en anglais, sont détaillés plus loin. Le nombre Une dissimilarité est une application d de Ω × Ω dans R+ vérifiant :
de classes est déterminé a posteriori, à la vue du dendrogramme ou d’un gra-
phique représentant la décroissance de la hauteur de chaque saut, ou écart de d(i, j) = d(j, i), ∀(i, j) ∈ Ω × Ω : symétrie ;
distance, opéré à chaque regroupement. d(i, i) = 0, ∀i ∈ Ω : nullité de la dissemblance d’un individu avec lui-même.
Classification par réallocation dynamique
Les notions de similarité et dissimilarité se correspondent de façon élémen-
Dans ce cas, le nombre de classes, k, est fixé a priori. Ayant initialisé k taire. Si s est un indice de ressemblance, alors
centres de classes par tirage aléatoire, tous les individus sont affectés à la classe
dont le centre est le plus proche au sens de la distance choisie (en principe, eu- d(i, j) = S − s(i, j), ∀(i, j) ∈ Ω × Ω
clidienne pour cette méthode). Dans une deuxième étape, l’algorithme calcule
des barycentres de ces classes qui deviennent les nouveaux centres. Le procédé est un indice de dissemblance. De façon réciproque, si d est un indice de dis-
(affectation de chaque individu à un centre, détermination des centres) est itéré semblance avec D = sup(i,j)∈Ω×Ω d(i, j), alors s(i, j) = D − d(i, j) est
jusqu’à convergence vers un minimum (local) ou un nombre d’itérations maxi- un indice de ressemblance. Comme s∗ , un indice de dissemblance normé est
mum fixé. défini par :
1
2 Mesures d’éloignement d∗ (i, j) = d(i, j), ∀(i, j) ∈ Ω × Ω
D
Notons Ω = {i = 1, . . . , n} l’ensemble des individus. Cette section se avec d∗ = 1 − s∗ et s∗ = 1 − d∗ . Du fait de cette correspondance immédiate,
propose de définir sur Ω × Ω différentes mesures d’éloignement entre deux seule la notion de dissemblance, ou dissimilarité, normée est considérée par la
individus. Les hypothèses et propriétés étant de plus en plus fortes. suite.

Précédente Suivante Première Dernière Retour Quitter


3 Classification non supervisée

2.3 Indice de distance Il est alors facile de la transformer en une matrice de dissemblances normées
avant d’aborder une classification.
Un indice de distance est, par définition, un indice de dissemblance qui vé-
rifie de plus la propriété : Nous précisons ci-dessous les autres cas.

d(i, j) = 0 =⇒ i = j. Données quantitatives


Lorsque les p variables sont toutes quantitatives, il est nécessaire de définir
Cette propriété évite des incohérences pouvant apparaître entre dissemblances,
une matrice M de produit scalaire sur l’espace RP . Le choix M = Ip , matrice
par exemple :
identité, est un choix élémentaire et courant ; mais il est vivement conseillé de
∃ k ∈ Ω : d(i, k) 6= d(j, k), avec pourtant i 6= j et d(i, j) = 0. réduire les variables de variances hétérogènes, comme en ACP, ce qui revient à
considérer, comme matrice de produit scalaire, la matrice diagonale composée
2.4 Distance des inverses des écarts-types :
1 1
Une distance sur Ω est, par définition, un indice de distance vérifiant en M = Σ−1 = diag ( · · · ).
plus la propriété d’inégalité triangulaire. Autrement dit, une distance d est une σ1 σp
application de Ω × Ω dans R+ vérifiant :
La métrique dite de Mahalanobis (inverse de la matrice des variances-
d(i, j) = d(j, i), ∀(i, j) ∈ Ω × Ω ; covariances) peut aussi être utilisée pour atténuer la structure de corrélation.
d(i, i) = 0 ⇐⇒ i = j ; Données qualitatives
3
d(i, j) ≤ d(i, k) + d(j, k), ∀(i, j, k) ∈ Ω . Dans le cas très particulier où toutes les variables sont binaires (présence,
Si Ω est fini, la distance peut être normée. absence de caractéristiques), de nombreux indices de ressemblances ont été
proposés dans la littérature. Ils sont basés sur les quantités suivantes définis
2.5 Distance euclidienne pour deux individus i et j distincts :
– aij = nombre de caractères communs à i et j sur les p considérés,
Dans le cas où Ω est un espace vectoriel muni d’un produit scalaire, donc – bij = nombre de caractères possédés par i mais pas par j,
d’une norme, la distance définie à partir de cette norme est appelée distance – cij = nombre de caractères possédés par j mais pas par i,
euclidienne : – cij = nombre de caractères que ne possèdent ni i ni j.
d(i, j) = < i − j, i − j >1/2 = ki − jk. – bien sûr, aij + bij + bij + dij = p.
La condition pour qu’une matrice donnée de distances entre éléments d’un Les indices de ressemblance les plus courants sont :
espace vectoriel soit issue d’une distance euclidienne est explicitée dans le aij + dij aij 2aij
chapitre précédent. Toute distance n’est pas nécessairement euclidienne ; voir, (concordance), (Jaccard), (Dice).
p aij + bij + bij 2aij + bij + bij
par exemple, celle construite sur la valeur absolue.
Puis, il est facile de construire un indice de dissemblance.
2.6 Utilisation pratique
Dans le cas plus général de p variables qualitatives, la distance la plus utili-
Concrètement, il peut arriver que les données à traiter soient directement sée est celle, euclidienne, dite du χ2 entre profils-lignes du tableau disjonctif
sous la forme d’une matrice d’un indice de ressemblance ou de dissemblance. complet (cf. chapitre 6 AFCM). La distance entre deux individus i et k est

Précédente Suivante Première Dernière Retour Quitter


4 Classification non supervisée

alors définie par : Attention, si n est grand, la deuxième solution peut se heurter rapidement à des
mj
n X X j` 1 problèmes de stockage en mémoire pour l’exécution des algorithmes.
d2χ2 = p δik j .
p j=1 n`
`=1 2.8 Accord entre partitions
où mj est le nombre de modalités de la variable qualitative Y j
, nj`
est l’effec- Une partition de n individus définit une variable qualitative dont les caté-
j`
tif de la `ième modalité de Y j et δik vaut 1 si les individus i et k présentent gories sont les classes de la partition. Une comparaison de deux partitions est
une discordance pour la `ième modalité de la variables Y j et 0 sinon. L’impor- obtenue an contruisant la table de contingence croisant ces deux variables. Ce-
tance donnée à une discordance est d’autant plus importante que les modalités pendant, les numéros des classes étant arbitraires, l’appréciation de cet accord
considérées sont rares. Le coefficient n/p peut être omis. est difficile aussi un indice quantitatif a été proposé en considérant toutes les
paires d’individus, selon qu’ils appartiennent à la même classe dans les deux
Mélange quantitatif, qualitatif partitions, qu’ils sont dans la même classe pour l’une mais pas pour l’autre, et
Différentes stratégies sont envisageables dépendant de l’importance relative enfin qu’ils sont séparés dans les deux partitions.
des nombres de variables qualitatives et quantitatives. En notant nkl le terme général de la table de contingence croisant les deux
Rendre tout qualitatif . Les variables quantitatives sont rendues qualitatives partitions, l’indice dit de Rand s’écrit :
par découpage en classes. Les classes d’une même variable sont géné- P P P 2 P 2
k l nkl − k nk+ l n+l 2 2
ralement recherchées d’effectifs sensiblement égaux : bornes des classes R= n n .
+
égales à des quantiles. La métrique à utiliser est alors celle du χ2 décrite
ci-dessus. Cet indice prend ses valeurs entre 0 et 1, il est égal à 1 lorsque les deux parti-
tions sont identiques. D’autres variantes ont été proposées.
Rendre tout quantitatif à l’aide d’une AFCM. Une AFCM est calculée sur
les seules variables qualitatives ou sur l’ensemble des variables après
découpage en classes des variables quantitatives. L’AFCM calculée par 3 Classification ascendante hiérarchique
AFC du tableau disjonctif complet produit des scores (cf. chapitre 6)
qui sont les composantes principales de l’ACP des profils-lignes. Dans le 3.1 Principe
cas d’une AFCM partielle des seules variables qualitatives, les variables L’initialisation de cet algorithme consiste, s’il n’est déjà donné, à calculer
quantitatives restantes doivent être nécessairement réduites. Ces scores un tableau de distances (ou de dissemblances) entre les individus à classer.
sont ensuite utilisés commes coordonnées quantitatives des individus en L’algorithme démarre alors de la partition triviale des n singletons (chaque in-
vue d’une classification. dividu constitue une classe) et cherche, à chaque étape, à constituer des classes
par agrégation des deux éléments les plus proches de la partition de l’étape
précédente. L’algorithme s’arrête avec l’obtention d’une seule classe. Les re-
2.7 Bilan groupements successifs sont représentés sous la forme d’un arbre binaire ou
Une fois ces préliminaires accomplis, nous nous retrouvons donc avec dendrogramme.
– soit un tableau de mesures quantitatives n × p, associé à une matrice de 3.2 Distance, ou dissemblance, entre deux classes
produit scalaire p×p (en général Ip ) définissant une métrique euclidienne,
– soit directement un tableau n × n de dissemblances ou de distances entre À chaque étape de l’algorithme, il est nécessaire de mettre à jour le tableau
individus. des distances (ou des dissemblances). Après chaque regroupement, de deux

Précédente Suivante Première Dernière Retour Quitter


5 Classification non supervisée

individus, de deux classes ou d’un individu à une classe, les distances entre ce regroupement, une minimisation de la décroissance de la variance interclasse.
nouvel objet et les autres sont calculées et viennent remplacer, dans la matrice, De plus, même si la distance entre individus n’est pas euclidienne, la même
les distances des objets qui viennent d’être agrégés. Différentes approches sont expression est utilisée pour faire du “saut de Ward” dans le cas non-euclidien.
possibles à ce niveau, donnant lieu à différentes CAH.
3.3 Algorithme
Notons A et B deux classes, ou éléments, d’une partition donnée, wA et wB
leurs pondérations, et di,j la distance entre deux individus quelconques i et j. A LGORITHME 1 :
Le problème est de définir d(A, B), distance entre deux éléments d’une par- classification ascendante hiérarchique
tition de Ω.
– Initialisation Les classes initiales sont les singletons. Calculer la
Cas d’une dissemblance matrice de leurs distances deux à deux.
– Itérer les deux étapes suivantes jusqu’à l’agrégation en une seule
Les stratégies ci-dessous s’accomodent d’un simple indice de dissemblance classe :
défini entre les individus. Elles s’appliquent également à des indices plus struc-
i. regrouper les deux classes les plus proches au sens de la “distance”
turés (distance) mais n’en utilisent pas toutesles propriétés.
entre classes choisie,
d(A, B) = min (dij ) (saut minimum, single linkage), ii. mettre à jour le tableau de distances en remplaçant les deux classes
i∈A,j∈B
regroupées par la nouvelle et en calculant sa “distance” avec cha-
d(A, B) = sup (dij ) (saut maximum ou diamètre, complete linkage),
i∈A,j∈B cune des autres classes.
1 X
d(A, B) = dij (saut moyen, group average linkage).
card(A)card(B) 3.4 Graphes
i∈A,j∈B

Cas d’une distance euclidienne Les graphes obtenus à l’issue d’une CAH ont été présentés et illustrés dans
le paragraphe 2. Il s’agit du graphique d’aide au choix du nombre de classes et
Considérons que les données sont sous la forme d’une matrice n × p de du dendrogramme.
variables quantitatives associée à une métrique euclidienne dans Rp ou direc-
tement sous la forme d’une matrice de distances euclidiennes (n × n) des 3.5 Illustration
individus 2 à 2. Dans le premier cas, il est facile de calculer les barycentres des
Les données sont celles déjà représentées à l’aide du MDS : un tableau
classes et donc de considérer les distances suivantes entre deux groupes.
contenant les distances kilométriques par route (Source : IGN) entre 47 grandes
d(A, B) = d(gA , gB ) (distance des barycentres, centroïd), villes en France et dans les pays limitrophes. Toutes ces valeurs sont rangées
wA wB dans le triangle inférieur d’une matrice carrée avec des 0 sur la diagonale. Il
d(A, B) = d(gA , gB ) (saut de Ward).
wA + wB s’agit donc de regrouper au mieux ces villes, en tenant compte de leurs proxi-
Dans le 2ème cas, le carré de la distance entre 2 barycentres se calcule à partir mités relatives au sens de cette distance routière.
de la matrice des distances 2 à 2. À l’issue de l’exécution, la classification ascendante hiérarchique fournit les
Remarque : Le saut de Ward joue un rôle particulier et est la stratégie la plus deux graphiques précisés ci-dessous.
courante ; c’est même souvent l’option par défaut (SAS) dans le cas d’une dis- – Un graphique d’aide au choix du nombre de classes (cf. figure 3.5). Il
tance euclidienne entre individus. En effet, ce critère induit, à chaque étape de représente à rebours, en fonction du nombre de classes, la décroissance

Précédente Suivante Première Dernière Retour Quitter


6 Classification non supervisée

5000
4000
Hauteur

3000
2000
1000

5000
5 10 15

nb de classes

4000
F IGURE 1 – Villes : Décroissance de la variance interclasses à chaque regrou-

3000
pement dans le cas du saut de Ward.

Height

2000
de la distance interclasses. La présence d’une rupture importante dans
cette décroissance aide au choix du nombre de classes comme dans le cas
du choix de dimension en ACP, avec l’éboulis des valeurs propres. Dans

1000
ce cas, il faut lire le graphe de droite à gauche et s’arrêter avant le premier
saut jugé significatif. Avec l’indice de Ward, cela revient à couper l’arbre
avant une perte, jugée trop importante, de la variance interclasses. Dans

0
le cas des villes repérées par leurs distances kilométriques, le choix de 5

bres
hend

clem
ando
mars
nice
classes semble raisonnable.

lour
toul
stra

mont
perp

amie
pari
reim
troy

bord
roya

caen
cher

limo
poit
gren
lyon

brux
lill

bour
orle
ange
luxe

cham
gene
besa
dijo

leha
roue

lema
tour
laba
nant
renn
stma
metz
nanc

bale
mulh

boul
cala
– Le dendrogramme (cf. figure 3.5) est une représentation graphique, sous
forme d’arbre binaire, des agrégations successives jusqu’à la réunion en
une seule classe de tous les individus. La hauteur d’une branche est pro-
portionnelle à l’indice de dissemblance ou distance entre les deux objets
regroupés. Dans le cas du saut de Ward, c’est la perte de variance inter-
classes. F IGURE 2 – Villes : Exemple d’un dendrogramme issu de la classification des
Une fois un nombre de classes sélectionné à l’aide du premier graphique, données par CAH et saut de Ward.
une coupure de l’arbre fournit, dans chaque sous-arbre, la répartition des in-
dividus en classes. Ces classes peuvent ensuite être représentées dans les axes
d’une analyse factorielle :
– une ACP si la classification a été opérée sur des variables quantitatives
assorties d’une m”trique euclidienne,

Précédente Suivante Première Dernière Retour Quitter


7 Classification non supervisée

– une AFCM si la classification a été opérée sur les composantes d’une


AFCM de variables qualitatives,
– un MDS dans le cas de l’exemple (figure 3.5) car la classification est
directement clculée sur un tableau de distance.
Signalons qu’il est courant, dans la pratique, de mettre en œuvre, à l’issue
d’une CAH, une méthode de réallocation dynamique avec pour nombre de
classes celui choisi par CAH et pour centres initiaux les barycentres des classes
obtenues : on stabilise ainsi les classes.
Notons également que l’exemple présenté ici est relativement simple et bien hend
bres
structuré. Modifier le critère de saut ne change pas grand chose dans ce cas. lour

400
Mais, attention, il est facile de vérifier expérimentalement qu’une classification bord roya laba
ascendante est un objet très sensible. En effet, il suffit de modifier une distance ando toul nant rennstma
dans le tableau, par exemple de réduire sensiblement la distance de Grenoble poit ange cher

200
à Brest, pour que la classification (nombre de classes, organisation) devienne limo lema caen
tour
très sensible au choix du critère de saut. En revanche, la structure des données
perp leha
fait que la représentation factorielle de l’ACP du tableau de distance (MDS) orle

cp2
bour roue
clem

0
est très robuste à ce type d’“erreur de mesure” ; il est recommandé de systéma- pari
mont
tiquement compléter une classificaiton par une représentation factorielle. amie boul
cala
lill

−200
mars lyon troy
reim
4 Agrégation autour de centres mobiles nice
gren dijo
brux
gene
cham besa
4.1 Principes nanc

−400
metz
luxe
mulh
Différents types d’algorithmes ont été définis autour du même principe de bale
stra
réallocation dynamique des individus à des centres de classes, eux-mêmes re-
calculés à chaque itération. Ces algorithmes requièrent une représentation vec- −800 −600 −400 −200 0 200 400
torielle des individus dans Rp muni d’une métrique, généralement euclidienne.
Il est important de noter que, contrairement à la méthode hiérarchique précé- cp1
dente, le nombre de classes k doit être déterminé a priori.
Ces méthodes sont itératives : après une initialisation des centres consis- F IGURE 3 – Villes : Représentation des classes (couleurs) obtenues par CAH
tant, par exemple, à tirer aléatoirement k individus, l’algorithme répète deux dans les coordonnées du MDS.
opérations jusqu’à la convergence d’un critère :
i. Chaque individu est affecté à la classe dont le centre est le plus proche au
sens d’une métrique.
ii. Calcul des k centres des classes ainsi constituées.

Précédente Suivante Première Dernière Retour Quitter


8 Classification non supervisée

4.2 Principale méthode k-means


Il s’agit de la version proposé par Forgy (1965) des algoritmes de type k- Touljours sous la même appelation (une option de la commande kmeans
means. de R) Mac Queen (1967) a proposé une d’une modification de l’algorithme
précédent. Les noyaux des classes, ici les barycentres des classes concernées,
A LGORITHME 2 : sont recalculés à chaque allocation d’un individu à une classe. L’algorithme
– Initialisation Tirer au hasard, ou sélectionner pour des raisons est ainsi plus efficace, mais la solution dépend de l’odre des individus dans le
extérieures à la méthode, k points dans l’espace des individus, en général fichier.
k individus de l’ensemble, appelés centres ou noyaux. Nuées dynamiques
– Itérer les deux étapes suivantes, jusqu’à ce que le critère de variance
interclasses ne croisse plus de manière significative, c’est-à-dire jusqu’à La variante proposée par Diday (1971) consiste à remplacer chaque centre
la stabilisation des classes. de classe par un noyau constitué d’éléments représentatifs de cette classe. Cela
permet de corriger l’influence d’éventuelles valeurs extrêmes sur le calcul du
i. Allouer chaque individu au centre (c’est-à-dire à la classe) le plus
barycentre. Il a également proposé la recherche de formes fortes communes à
proche au sens de la métrique euclidienne choisie ; on obtient ainsi,
plusieurs partitions issues d’initialisations différentes.
à chaque étape, une classification en k classes, ou moins si, finale-
ment, une des classes devient vide. Partitionning Around Medoïds
ii. Calculer le centre de gravité de chaque classe : il devient le nou- Cet algorithme (PAM), proposé par Kaufman & Rousseeuw (1990), permet
veau noyau ; si une classe s’est vidée, on peut éventuellement retirerde classifier des données de façon plus robuste, c’est-à-dire moins sensible à
aléatoirement un noyau complémentaire. des valeurs atypiques. Le noyau d’une classe est alors un medoïd c’est-à-dire
l’observations d’une classe qui mimise la moyenne des distances ou dissimi-
larités aux autres observations de la classes. Une différence majeurs avec l’al-
4.3 Propriétés gorithme k-means est qu’un medoid fait partie des données et permet donc de
Convergence Le critère (la variance interclasses) est majoré par la variance partitionner des matrices de dissimilarités. En contre-partie, il il est limité par
totale. Il est simple de montrer qu’il ne peut que croître à chaque étape de le nombre d’observations (matrice de dissimilarités à stocker) et en temps de
2
l’algorithme, ce qui en assure la convergence. Il est équivalent de maximi- calcul (algorithme en O(n )).
ser la variance interclasses ou de minimiser la variance intraclasse. Cette La classification des villes par partitionnement autour de medoids est fournie
dernière est alors décroissante et minorée par 0. Concrètement, une di- dans la figure 4.4 ; le nombre de classes est fixé a priori à 5 comme le suggère
zaine d’itérations suffit généralement pour atteindre la convergence. la CAH alors que les classes obtenues sont sensiblement différentes.
Optimum local La solution obtenue est un optimum local, c’est-à-dire que la
répartition en classes dépend du choix initial des noyaux. Plusieurs exé-
4.5 Combinaison
cutions de l’algorithme permettent de s’assurer de la présence de formes Chaque méthode précédente peut être plus ou moins adaptée à la situation
fortes, c’est-à-dire de classes, ou partie de classes, présentes de manière rencontrée. La classification hiérarchique, qui construit nécessairement la ma-
stable dans la majorité des partitions obtenues. trice des distances, n’accepte qu’un nombre limité d’individus ; de son côté,
la réallocation dynamique nécessite de fixer a priori le nombre de classes.
4.4 Variantes La stratégie suivante, adaptée aux grands ensembles de données, permet de

Précédente Suivante Première Dernière Retour Quitter


9 Classification non supervisée

contourner ces difficultés.


i. Exécuter une méthode de réallocation dynamique en demandant un grand
nombre de classes, de l’ordre de 10% de n.
ii. Sur les barycentres des classes précédentes, exécuter une classification
hiérarchique puis déterminer un nombre “optimal” k de classes.
iii. Exécuter une méthode de réallocation dynamique sur tout l’ensemble en
fixant à k le nombre de classes. Pour initialiser l’algorithme, il est habi-
hend tuel de choisir pour noyaux les barycentres (calculés en pondérant par les
bres effectifs de classes) des classes de l’étape précédente.
lour
400

bord roya laba


ando toul nant rennstma 5 Données génomiques
poit ange cher
200

limo lema caen Pour ce type de données, les biologistes apprécient particulièrement de
tour construire une double classification hiérarchique opérant à la fois sur les lignes
perp leha et sur les colonnes (gènes et échantillons). Une représentation en fausses cou-
orle
cp2

bour roue
clem leurs fournit une lecture susceptible de prendre en compte les “distances”
0

mont pari
amie boul
cala
respectives des lignes (gènes) d’une part et des colonnes (échantillons biolo-
lill giques) d’autre part, et de se faire ainsi une idée des gènes pouvant influencer
−200

mars lyon troy


reim la hiérarchie obtenue pour les échantillons. Néanmoins, cette lecture, même en
gren dijo
nice brux
gene se limitant à une sélection des gènes proposés par l’analyse en composantes
cham besa principales (chapitre 3), n’est pas très aisée (figure 5).
nanc
−400

metz
luxe
mulh Le choix de la distance est évidemment important. La plus fréquemment
bale
stra rencontrée pour l’étude du transcriptome est du type de d3 , basée sur la corré-
lation. Il nous semble pertinent d’utiliser les trois types de distances et d’en ap-
−800 −600 −400 −200 0 200 400 précier leur complémentarité quant à l’interprétation des résultats. Nous avons
cp1
fait le choix de limiter cette comparaison des distances au MDS et nous nous
contenterons ici de présenter une classification basée sur la distance eucli-
dienne d1 . Le deuxième choix intervenant en classification concerne le critère
F IGURE 4 – Villes : Représentation des classes (couleurs) obtenues par PAM d’agglomération, c’est-à-dire la façon dont est définie la distance entre deux
dans les coordonnées du MDS. groupes, et n’a pas d’interprétation biologique simple. Ce choix a plus une im-
plication géométrique, sur la forme des classes obtenues. Nous avons utilisé
le critère de Ward parce qu’il favorise la construction de classes relativement
“sphériques” et qu’on peut lui associer des critères guidant la détermination du
nombre de classes.
L’interprétation de la double classification (Fig. 5) présente des analogies

Précédente Suivante Première Dernière Retour Quitter


10 Classification non supervisée

avec celle de l’ACP sur le premier plan principal. Si l’on s’intéresse aux
individus-souris, on peut constater que les deux génotypes sont différenciés
en deux groupes, à l’exception de trois souris de type PPAR ayant suivi les
régimes efad (pour deux d’entre elles) et ref. Ce sont ces trois mêmes
individus que l’on retrouve projetés dans la partie négative du premier axe de
l’ACP (Fig. ??). Pour les variables-gènes, on peut distinguer deux grandes
classes correspondant, d’après les données, à deux niveaux d’expressions : à
gauche, les gènes dont l’expression est relativement faible, à droite les gènes
dont l’expression est globalement plus élevée. Dans cette seconde classe, un
groupe attire particulièrement l’attention sur l’image : sur une bande verticale
correspondant à 14 gènes, les couleurs sont nettement plus variables que sur le
PPAR − efad
PPAR − efad
reste de l’image. Il s’agit des gènes : CYP4A10, CYP4A14, CYP3A11,
PPAR − ref
WT − efad
WT − efad
[Link], THIOL, PMDCI, S14, Lpin1, Lpin, FAS, GSTmu,
WT − efad
WT − dha
WT − dha
WT − dha
GSTpi2, CYP2c29, G6Pase.
WT − dha
WT − tsol
WT − tsol
WT − lin
WT − lin
qui apparaissent tous parmi les gènes les plus corrélés aux deux premiers
WT − lin
WT − lin
WT − ref
axes principaux de l’ACP (Fig. ??).
WT − ref
WT − tsol
WT − efad
WT − tsol
WT − ref
MDS et classification apparaissent donc comme des techniques complémen-
WT − ref
PPAR − tsol
PPAR − tsol
PPAR − lin
taires, mais elles ne sont pas sensibles de la même façon aux perturbations. La
PPAR − lin
PPAR − ref
PPAR − lin
PPAR − dha
perturbation d’une donnée peut fortement influencer la structure d’un dendro-
PPAR − lin
PPAR − ref
PPAR − tsol
gramme alors qu’en MDS, la prise en compte conjointe de toutes les distances
PPAR − tsol
PPAR − efad
PPAR − efad
PPAR − dha
deux à deux assure une certaine robustesse pour le calcul des coordonnées
PPAR − dha
PPAR − dha
PPAR − ref principales. Pour cette raison, il est utile de représenter les classes dans une
SIAT4c

FAT

[Link]

ACAT1

GSTa

cMOAT
AOX
Pex11a
COX2

COX1
ACOTH

Waf1

G6Pase
[Link]
[Link]
Ntcp
CAR1
PAL
TRb
VLDLr
RARa
[Link]
CYP2b13
eif2g
ADSS1
UCP2
CYP2b10
NGFiB
CYP26
RARb2
CYP27b1
CYP24
UCP3
RXRg1
Lpin3
GS
PON
NURR1
M.CPT1
PXR
MS
VDR
PDK4
RXRa
MCAD
CIDEA
OCTN2
ACC1
PPARg
FXR
MDR1
apoC3
SHP1
TRa
[Link]
C16SR
X36b4
Bcl.3
LXRa
LXRb
LPL
hABC1
ADISP
RXRb2
MTHFR
ap2
CYP7a
mABC1
IL.2
THB
PPARd
CYP4A10
CYP4A14
CYP3A11
[Link]
THIOL
PMDCI
GSTmu
GSTpi2
CYP2c29
S14
Lpin1
Lpin
FAS
HMGCoAred
PLTP
LDLr
FDFT
G6PDH
ACC2
PPARa
[Link]
LPK
cHMGCoAS
CYP8b1
CPT2
CACP
PECI
ALDH3
mHMGCoAS
BIEN
GK
HPNCL
Lpin2
ACBP
CBS
SPI1.1
apoA.I
MDR2
CYP27a1
BSEP
BACT
Tpbeta
Tpalpha
MRP6
LCE
apoB
AM2R
apoE

projection sur des axes factoriels obtenus soit par MDS soit par ACP. L’ébou-
lis des valeurs propres (Fig. 6) nous oriente vers une représentation du MDS
en deux dimensions.
F IGURE 5 – Souris : double classification ascendante hiérarchique des
individus-souris et des variables-gènes selon la méthode de Ward, avec la dis- La représentation de la figure 7 est analogue à celle déjà présentée en ap-
tance euclidienne. plication du MDS. Elle est simplement complétée par un codage en couleurs
des gènes, selon leur appartenance à une classe issue de la classification hié-
rarchique. Pour cela, nous avons coupé l’arbre afin d’en extraire 5 classes.
Brièvement, on peut noter que l’axe 1 met en évidence l’opposition précé-
demment évoquée entre CAR1 (surexprimé chez les souris PPAR) et un groupe
de gènes (CYP3A10, CYP4A10, CYP4A14, PMDCI, THIOL et L-FABP) qui
est surexprimé chez les souris WT. De manière similaire, l’axe 2 oppose les
gènes induits par le régime dha (valeurs positives, gènes impliqués dans le
catabolisme des lipides et dans le métabolisme des xénobiotiques) aux gènes

Précédente Suivante Première Dernière Retour Quitter


11 Classification non supervisée

14
12
10
Valeurs propres

8
6
4
2

1.0
0

1 2 3 4 5 6 7 8 9 10

Dimension
CYP4A14

F IGURE 6 – Souris : éboulis des valeurs propres pour le MDS de la matrice de

0.5
CYP3A11
CYP4A10
distance euclidienne intergènes. GSTpi2 CYP2c29
CAR1
MCAD ACOTH
PMDCI PECI
mHMGCoAS THB
Pex11a
GSTmu Tpalpha LCE
apoE
Tpbeta M.CPT1
apoB
IL.2 PON
RXRa
RXRb2
G6Pase
AOX CACP
SPI1.1 AM2R
PPARa
C16SR VLDLr
LXRb
FXR
ACAT1
PPARgGS
LPL
PXR
MTHFR SIAT4c
BIEN PPARd
X36b4ADISP
OCTN2
MDR1
[Link] SHP1
CIDEA
RARa
ap2
COX2
LXRa Lpin3
[Link]
NURR1TRa
Bcl.3
CBScMOAT hABC1

0.0
ALDH3CPT2 CYP26CYP27b1
COX1 MS
UCP3
RXRg1
TRb
CYP2b13
ADSS1
[Link]
[Link]
CYP7a [Link]

Dimension 2
BACT
MDR2 CYP2b10 VDR
induits par le régime efad (valeurs négatives, gènes principalement impli- HPNCL MRP6mABC1
ACC1
ACAT2
CYP27a1
BSEP FDFT FATNtcp
PDK4
Waf1
NGFiB
apoC3
UCP2
eif2g
CYP24
RARb2
THIOL GSTa
ACBP [Link]
G6PDH
[Link] apoA.I PAL
qués dans la synthèse de lipides). En remontant vers les feuilles de l’arbre de Lpin2 LDLr
PLTP
CYP8b1
LPK
classification, on notera que le groupe des gènes représentés en vert est séparé GK HMGCoAred
ACC2
cHMGCoAS

−0.5
en deux sous-groupes qui conservent une cohérence vis-à-vis des fonctions
Lpin1
biologiques de catabolisme et de synthèse des lipides respectivement. Une ob- Lpin

servation des données individuelles révèle que ces régulations opérées par les
régimes semblent plus marquées chez les souris WT.

−1.0
S14

Nous laissons au lecteur l’appréciation sur le nombre de combinaisons d’op-


tions possibles qui sont offertes par l’ensemble de ces outils : centrage, réduc- FAS

tion, distance, critère de saut, projection, classification !


−1.0 −0.5 0.0 0.5 1.0
6 En guise de conclusion Dimension 1

Quelle méthode ou combinaison de méthodes associées à quelles options...


faut-il choisir et sur quel critère ? Réponse, celle et ceux qui fournissent des F IGURE 7 – Souris : représentation par positionnement multidimensionnel
résultats les plus “utiles”. Les techniques mises en œuvre sont fondamentale- (distance euclidienne) des 5 groupes issues de la classification hiérarchique
ment ’exploratoires”, pas confirmatoires ni décisionnelles. Un résultat “utile” des gènes.
est un résultat qui fournit d enouveaus éclairages, un point de vue fructueux sur
des données complexes, et ainsi une meilleure compréhension des interactions
en jeu. C’est une étape préalable à la contruction de futures modélisations et
d’inférences quiseront à confirmer. Ainsi, associer, au sein d’une même classe,
des gènes de fonctions inconnues à d’autres de fonctions connues est une stra-

Précédente Suivante Première Dernière Retour Quitter


12 Classification non supervisée

tégie frèquente piur le biologiste pour poser des hypothèses sur l’annotation de
ces gènes, hypothèses à infirmer ou confirmer par de nouvelles expériences.
Attention, la pertinence des résultats et la fiabilité des interprétations re-
posent sur une juste connaissance des méthodes, des options, des hypothèses
sous-jacentes à ces méthodes : comment interpréter une proximité, au sens de
quelle distance avec quelle confiance ?... sinon, l’orientation du travail pour
poser de nouvelles hypothèses risque de se fourvoyer ou au mieux adopter une
marche aléatoire (cf. devise Schadok) :
...en essayant continuellement on finit par réussir donc, plus ça rate,
plus on a de chance que ça marche...

Précédente Suivante Première Dernière Retour Quitter


1 Rappels et compléments d’algèbre linéaire

On note par la suite :


Rappels et compléments d’algèbre
aji = [A]ji le terme général de la matrice,
linéaire ai = [a1i , . . . , api ]0 un vecteur-ligne mis en colonne,
aj = [aj1 , . . . , ajn ]0 un vecteur-colonne.
Résumé 2.1.1 Types de matrices
Cette vignette rassemble des notations et rappels d’algèbre linéaire de ni- Une matrice est dite :
veau L. Il introduit les principaux théorèmes d’approximation matricielle par – vecteur-ligne (colonne) si n = 1 (p = 1),
décomposition en valeurs singulières qui sont à la base des méthodes statis- – vecteur-unité d’ordre p si elle vaut 1p = [1, . . . , 1]0 ,
tique factorielles. – scalaire si n = 1 et p = 1,
Précédent : Introduction à la statistique exploratoire multidimensionnelle – carrée si n = p.
Suivant : Analyse en composantes principales Une matrice carrée est dite : 
0 si i 6= j
– identité (Ip ) si aji = δij = ,
1 si i = j
1 Notations – diagonale si aji = 0 lorsque i 6= j,
Dans tout ce qui suit, E et F sont deux espaces vectoriels réels munis res- – symétrique si aji = aij , ∀(i, j),
pectivement des bases canoniques E = {ej ; j = 1, . . . , p} et F = {fi ; i = – triangulaire supérieure (inférieure) si aji = 0 lorsque i > j (i < j).
1, . . . , n}. On note indifféremment soit un vecteur de E ou de F , un endomor-
2.1.2 Matrice partitionnée en blocs
phisme de E, ou une application linéaire de E dans F , soit leurs représenta-
tions matricielles dans les bases définies ci-dessus. Matrices dont les éléments sont eux-mêmes des matrices. Exemple :

A11 (r × s) A21 (r × (p − s))


 
2 Matrices A(n × p) =
A12 ((n − r) × s) A22 ((n − r) × (p − s))
.

2.1 Notations
2.2 Opérations sur les matrices
La matrice d’ordre (n × p) associée à une application linéaire de E dans F
est décrite par un tableau : Somme : [A + B]ji = aji + bji pour A et B de même ordre (n × p).
Multiplication par un scalaire : [αA]ji = αaji pour α ∈ R.
a11 aj1 ap1 Transposition : [A0 ]ji = aij , A0 est d’ordre (p × n).
 
... ...
 .. .. .. 
 . . . 
  (A0 )0 = A ; (A + B)0 = A0 + B0 ; (AB)0 = B0 A0 ;
A=
 ai
1
... aji . . . api .  0  10 0 
 . .. .. 
 1
A1 A21 A1 A12
 .. . .  = 0 0 .
A12 A22 A21 A22
a1n ... ajn . . . apn

Précédente Suivante Première Dernière Retour Quitter


2 Rappels et compléments d’algèbre linéaire

Pn
Produit scalaire élémentaire : a0 b = i=1 ai bi où a et b sont des vecteurs- 2.3.2 Déterminant
colonnes.
On note |A| le déterminant de la matrice carrée A (p × p). Il vérifie :
Produit : [AB]ji = a0i bj avec A(n×p) , B(p×q) et AB(n×q) , et pour des ma-
p
trices par blocs : Y
|A| = ajj , si A est triangulaire ou diagonale,
j=1
A11 A21 B11 B21 A11 B11 + A21 B12 A11 B21 + A21 B22
    
= |αA| = α |A|, p
A12 A22 B12 B22 A12 B11 + A22 B12 A12 B21 + A22 B22
|AB| = |A||B|,
sous réserve de compatibilité des dimensions. A B
= |A||C|,
0 C
2.3 Propriétés des matrices carrées A11 A21
= |A11 ||A22 − A12 (A11 )−1 A21 | (1)
La trace et le déterminant sont des notions intrinsèques, qui ne dépendent A12 A22
pas des bases de représentation choisies, mais uniquement de l’application li- = |A22 ||A11 − A21 (A22 )−1 A12 |, (2)
néaire sous-jacente. sous réserve de la régularité de A11 et A22 .
2.3.1 Trace
Cette dernière propriété se montre en considérant les matrices :
Par définition, si A est une matrice (p × p),
I −A21 (A22 )−1
 
B= et BAB0 ,
p
X 0 I
trA = ajj ,
j=1 puis en comparant les déterminants |BAB0 | et |A|.
2.3.3 Inverse
et il est facile de montrer :
L’inverse de A, lorsqu’elle existe, est la matrice unique notée A−1 telle
trα = α, que :
trαA = αtrA, AA−1 = A−1 A = I ;
tr(A + B) = trA + trB, elle existe si et seulement si |A| =
6 0. Quelques propriétés :
trAB = trBA,
1
reste vrai si A est (n × p) et si B est (p × n) (A−1 )0 = (A0 )−1 , (AB)−1 = B−1 A−1 , |A−1 | = .
|A|
Xn X p
trCC0 = 0
trC C = (cji )2
2.3.4 Définitions
i=1 j=1
dans ce cas, C est (n × p). Une matrice carrée A est dite :
symétrique si A0 = A,

Précédente Suivante Première Dernière Retour Quitter


3 Rappels et compléments d’algèbre linéaire

singulière si |A| = 0,
régulière si |A| =
6 0, rang(A) = dim(Im(A)),
idempotente si AA = A, 0≤ rang(A) ≤ min(n, p),
définie-positive si, ∀x ∈ Rp , x0 Ax ≥ 0, et si x0 Ax = 0 ⇒ x = 0, rang(A) = rang(A0 ),
p 0
positive, ou semi-définie-positive, si, ∀x ∈ R , x Ax ≥ 0, rang(A + B) ≤ rang(A) + rang(B),
orthogonale si AA0 = A0 A = I (A0 = A−1 ). rang(AB) ≤ min(rang(A), rang(B)),
rang(BAC) = rang(A), si B et C sont régulières,
3 Espaces euclidiens rang(A) = rang(AA0 ) = rang(A0 A).
E est un espace vectoriel réel de dimension p isomorphe à Rp . Enfin, si B (p × q) est de rang q(q < p) et A est carrée (p × p) de rang p,
3.1 Sous-espaces alors la matrice B0 AB est de rang q.

– Un sous-ensemble Eq de E est un sous-espace vectoriel (s.e.v.) de E s’il 3.3 Métrique euclidienne


est non vide et stable :
Soit M une matrice carrée (p × p), symétrique, définie-positive ; M définit
∀(x, y) ∈ Eq2 , ∀α ∈ R, α(x + y) ∈ Eq . sur l’espace E :
– un produit scalaire : hx, yiM = x0 My,
– Le q-uple {x1 , . . . , xq } de E constitue un système linéairement indépen- – une norme : kxkM = hx, xiM ,
1/2
dant si et seulement si : – une distance : dM (x, y) = kx − ykM ,
q hx,yiM
X – des angles : cos θM (x, y) = kxk kyk .
αi xi = 0 ⇒ α1 = · · · = αq = 0. La matrice M étant donnée, on dit que :
M M

i=1
– une matrice A est M-symétrique si (MA)0 = MA,
– Un système linéairement indépendant Eq = {e1 , . . . , eq } qui engendre – deux vecteurs x et y sont M-orthogonaux si hx, yiM = 0,
dans E un s.e.v. Eq = vec{e1 , . . . , eq } en constitue une base et – un vecteur x est M-normé si kxkM = 1,
dim(Eq ) = card(Eq ) = q. – une base Eq = {e1 , . . . , eq } est M-orthonormée si

3.2 Rang d’une matrice A(n×p) ∀(i, j), hei , ej iM = δij .

Dans ce sous-paragraphe, A est la matrice d’une application linéaire de E = 3.4 Projection


Rp dans F = Rn .
Soit W un sous-espace de E et B = {b1 , . . . , bq } une base de W ; P(p × p)
Im(A) = vect{a1 , . . . , ap } est le s.e.v. de F image de A ; est une matrice de projection M-orthogonale sur W si et seulement si :
Ker(A) = {x ∈ E ; Ax = 0} est le s.e.v. de E noyau de A ; ∀y ∈ E, Py ∈ W et hPy, y − PyiM = 0.
E = Im(A) ⊕ Ker(A) si A est carrée associée à un endomorphisme deToute
E matrice idempotente (P2 = P) et M-symétrique (P0 M = MP) est
et p = dim(Im(A)) + dim(Ker(A)). une matrice de projection M-orthogonale et réciproquement.

Précédente Suivante Première Dernière Retour Quitter


4 Rappels et compléments d’algèbre linéaire

3.4.1 Propriétés T HÉORÈME 1. — Soit deux matrices A(n×p) et B(p×n) ; les valeurs propres
– Les valeurs propres de P sont 0 ou 1 (voir § 4) : non nulles de AB et BA sont identiques avec le même degré de multiplicité.
Si u est vecteur propre de BA associé à la valeur propre λ différente de zéro,
u ∈ W, Pu = u, λ = 1, de multiplicité dim(W ), alors v = Au est vecteur propre de la matrice AB associé à la même valeur
v⊥W, (on note v ∈ W ⊥ ) Pv = 0, λ = 0, de multiplicité dim(W ⊥ ). propre.
– trP = dim(W ).
– P = B(B0 MB)−1 B0 M, où B = b1 , . . . , bq .
  Les applications statistiques envisagées dans ce cours ne s’intéressent qu’à
– Dans le cas particulier où les bj sont M-orthonormés : des types particuliers de matrices.
q
X 0 T HÉORÈME 2. — Une matrice A réelle symétrique admet p valeurs propres
P = BB0 M = bj bj M.
réelles. Ses vecteurs propres peuvent être choisis pour constituer une base or-
i=1
thonormée de E ; A se décompose en :
– Dans le cas particulier où q = 1 alors :
p
bb0 0
X
P= 0 M=
1
bb0 M. A = VΛV0 = λk v k v k
b Mb kbkM k=1

– Si P1 , . . . , Pq sont des matrices de projection M-orthogonales alors la où V est une matrice orthogonale [v1 , . . . , vp ] des vecteurs propres orthonor-
somme P1 + · · · + Pq est une matrice de projection M-orthogonale si et més associés aux valeurs propres λk , rangées par ordre décroissant dans la
seulement si : Pk Pj = δkj Pj . matrice diagonale Λ.
– La matrice I − P est la matrice de projection M-orthogonale sur W ⊥ .
T HÉORÈME 3. — Une matrice A réelle M-symétrique admet p valeurs
4 Eléments propres propres réelles. Ses vecteurs propres peuvent être choisis pour constituer une
base M-orthonormée de E ; A se décompose en :
Soit A une matrice carrée (p × p). p
X 0
A = VΛV 0 M = λk vk vk M
4.1 Définitions
k=1
– Par définition, un vecteur v définit une direction propre associée à une
valeur propre λ si l’on a : où V = [v1 , . . . , vp ] est une matrice M-orthogonale (V0 MV = Ip et VV0 =
Av = λv. M−1 ) des vecteurs propres associés aux valeurs propres λk , rangées par ordre
décroissant dans la matrice diagonale Λ.
– Si λ est une valeur propre de A, le noyau Ker(A − λI) est un s.e.v. de
E, appelé sous-espace propre, dont la dimension est majoré par l’ordre Les décompositions ne sont pas uniques : pour une valeur propre simple
de multiplicité de λ. Comme cas particulier, Ker(A) est le sous-espace (de multiplicité 1) le vecteur propre normé est défini à un signe près, tandis
propre associé, si elle existe, à la valeur propre nulle. que pour une valeur propre multiple, une infinité de bases M-orthonormées
– Les valeurs propres d’une matrice A sont les racines, avec leur multipli- peuvent être extraites du sous-espace propre unique associé.
cité, du polynôme caractéristique :
Le rang de A est aussi le rang de la matrice Λ associée et donc le nombre
|A − λI| = 0. (répétées avec leurs multiplicités) de valeurs propres non nulles.

Précédente Suivante Première Dernière Retour Quitter


5 Rappels et compléments d’algèbre linéaire

Par définition, si A est positive, on note la racine carrée de A : matrice (n × p). L’ensemble Mn,p des matrices (n × p) est un espace vectoriel
p de dimension np ; on le munit du produit scalaire :
X p 0
A1/2 = λk vk vk M = VΛ1/2 V0 M.
k=1 hX, YiM,D = trXMY0 D. (4)

4.2 Propriétés Dans le cas particulier où M = Ip et D = In , et en notant vec(X) =


0 0
h 0
i
x1 , . . . , xp la matrice “vectorisée”, ce produit scalaire devient :
Si λk 6=Pλj , v k ⊥M Q
vj ;
p p
trA = k=1 λk ; |A| = k=1 λk ; p
n X
∀k, λk 6= 0 ;
X
si A est régulière, hX, YiIp ,In = trXY0 = xji yij = vec(X)0 vec(Y).
si A est positive, λp ≥ 0 ; i=1 j=1
si A est définie-positive, λp > 0 ;
La norme associée à ce produit scalaire (4) est appelée norme trace :
4.3 Décomposition en Valeurs Singulières (DVS)
2
Il s’agit, cette fois, de construire la décomposition d’une matrice X(n × p) kXkM,D = trXMX0 D,
rectangulaire relativement à deux matrices symétriques et positives D(n × n) p
n X
X
2
et M(p × p). kXkIp ,In = trXX0 = SSQ(X) = (xji )2
i=1 j=1
T HÉORÈME 4. — Une matrice X (n × p) de rang r peut s’écrire : (SSQ signifie “sum of squares”).
r p
X 0
X = UΛ1/2 V0 = λk uk vk ; (3) La distance associée à cette norme devient, dans le cas où D est une matrice
k=1
diagonale (D = diag(w1 , . . . , wn )), le critère usuel des moindres carrés :
U (n × r) contient les vecteurs propres D-orthonormés (U0 DU = Ir ) de la
n
matrice D-symétrique positive XMX0 D associés aux r valeurs propres non 2 2
X 2
nulles λk rangées par ordre décroissant dans la matrice diagonale Λ(r × r) ; d (X, Y) = kX − YkM,D = wi kxi − yi kM .
i=1
V (p × r) contient les vecteurs propres M-orthonormés (V0 MV = Ir ) de la
matrice M-symétrique positive X0 DXM associés aux mêmes valeurs propres.
De plus, 5.2 Approximation d’une matrice
U = XMVΛ−1/2 et V = X0 DUΛ−1/2 . Les matrices X, M et D sont définies comme ci-dessus ; X est supposée
de rang r. On cherche la matrice Zq , de rang q inférieur à r, qui soit la plus
5 Optimisation proche possible de X.

5.1 Norme d’une matrice T HÉORÈME 5. — La solution du problème :


L’espace vectoriel E de dimension p (resp. F de dimension n) est muni n
2
o
de sa base canonique et d’une métrique de matrice M (resp. D). Soit X une min kX − ZkM,D ; Z ∈ Mn,p , rang(Z) = q < r (5)
Z

Précédente Suivante Première Dernière Retour Quitter


6 Rappels et compléments d’algèbre linéaire

est donnée par la somme des q premiers termes de la décomposition en valeurs


singulières (3) de X :
q
X p 0
0
Zq = λk uk vk = Uq Λ1/2
q Vq .
k=1

Le minimum atteint est :


r
X
2
kX − Zq kM,D = λk .
k=q+1

Les matrices Uq , Λq et Vq contiennent les q premiers vecteurs et valeurs


propres donnés par la DVS de X ; Zq est appelée approximation de rang q de
X.
Ce théorème peut se reformuler d’une manière équivalente. On note P cq
(resp. Q
cq ) la projection M-orthogonale sur Eq = Im(Vq ) (resp. D-
orthogonale sur Fq = Im(Uq )) :
q
X 0
P
cq = vk vk M = Vq Vq0 M
k=1
q
X 0
Q
cq = uk uk D = Uq U0q D,
k=1
0
Zq = Q
cq X = XP
cq .

P ROPOSITION 6. — Avec les notations précédentes :


n
cq = arg max XP0 2
P q M,D ;
Pq

Pq projection M-orthogonale de rang q < r} ,


n
2
Q
cq = arg max kQq XkM,D ;
Qq

Qq projection D-orthogonale de rang q < r} .

Précédente Suivante Première Dernière Retour Quitter

Vous aimerez peut-être aussi