0% ont trouvé ce document utile (0 vote)
10 vues28 pages

Cours ACP

L'Analyse en Composantes Principales (ACP) est une méthode utilisée pour réduire la dimensionnalité des données tout en préservant leur variabilité essentielle. Elle permet de visualiser des jeux de données complexes en projetant les données sur des axes principaux qui maximisent l'information. L'ACP est particulièrement utile dans le domaine de la cybersécurité pour améliorer les processus de classification en éliminant le bruit et en optimisant le temps d'entraînement des modèles.

Transféré par

sourour.najjar
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
10 vues28 pages

Cours ACP

L'Analyse en Composantes Principales (ACP) est une méthode utilisée pour réduire la dimensionnalité des données tout en préservant leur variabilité essentielle. Elle permet de visualiser des jeux de données complexes en projetant les données sur des axes principaux qui maximisent l'information. L'ACP est particulièrement utile dans le domaine de la cybersécurité pour améliorer les processus de classification en éliminant le bruit et en optimisant le temps d'entraînement des modèles.

Transféré par

sourour.najjar
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Machine Learning for Cyber Security

Chapitre :

Analyse en Composantes Principales


(ACP)
Unit: IL

1
Plan

1 Problématique

2 Les Données
3
Principe de l’ACP

4 Processus Technique

5 Analyse des Résultats

6 ACP et Machine Learning

7 Synthèse
Problématique – Pourquoi l'ACP ?

Le défi des données : Face à la croissance exponentielle, les


data scientists gèrent des jeux de données de haute dimension
difficiles à interpréter et redondants.

La limite visuelle : Il est impossible de visualiser un


nuage d'individus dès que le nombre de variables (p) est
supérieur à 3

La solution : L'ACP permet de trouver le "meilleur


angle de vue" pour projeter les données tout en
conservant la meilleure représentation possible.
Problématique

Les données sont visuellement mieux représentées dans la


première figure que dans la deuxième et la troisième figures :
on voit mieux la répartition des points.
Problématique

Si on tourne encore la figure, on peut peut-être trouver un meilleur angle de vue.

Est-ce que cet angle de vue permet de voir au mieux les données ?

C'est justement l'analyse en composantes principales, qui nous permet de retrouver


la projection avec la meilleure représentation de données
Les données

Les données sont représentées sous la forme d’une matrice à n lignes et p colonnes où:
 Chaque ligne représente un individu.
 Chaque colonne représente une variable.

L’objectif est alors de savoir :

 Quels individus se ressemblent ?

Ressemblance entre les individus

 Quelles variables sont liées ?

Corrélation entre les variables


Principe de l’ACP

7
Principe de l’ACP

 Pour surmonter la barrière de la haute


dimension, l’ACP cherche à projeter les
données sur un plan factoriel capable de
conserver l'essentiel de leur variabilité.

 Ce processus repose sur l'extraction de


composantes principales : des variables de
synthèse qui maximisent l'information tout en
réduisant le nombre de dimensions.

 Géométriquement, ces composantes se


traduisent par des axes principaux (ou axes
factoriels), véritables piliers de la nouvelle
structure simplifiée du dataset.
Principe de l’ACP

 Pour obtenir une représentation fidèle, l'ACP s'appuie sur la dispersion des
données, mesurée par la variance.
 Dans cette méthode, la variance sert de baromètre à la quantité d'information : plus
les données s'étalent le long d'un axe, plus celui-ci est riche en enseignements.
 L'objectif technique est donc de détecter les directions où cet étalement est à son
maximum pour construire les composantes principales.

Remarque:
 Il est important de noter que l'ACP produit autant de composantes qu'il y a de variables de départ.
Bien que nous utilisions les premiers plans factoriels pour simplifier la lecture des données, la
véritable richesse de cette méthode se trouve dans l’accumulation de connaissances. En explorant
successivement différents axes, le data scientist affine sa compréhension des relations complexes
entre les variables, même celles qui ne sont pas captées par les composantes majeures.
Principe de l’ACP: Exemple

 Dans l'exemple, nous avons trois variables:


(Gene A, Gene B, Gene C)
 Donc trois axes principaux (PC1, PC2, PC3).

• La première composante (PC1) explique


le maximum de la variance des données :
73 % de la variance totale.
• La deuxième composante (PC2) explique
25 % de la variance totale.
Principe de l’ACP: Exemple

Les axes PC1 et PC2 sont


capables de représenter presque
toute la variabilité des données.

Ce qui permet de projeter les


données sur ces deux axes.
Choix du nombre d’axes à retenir
Optimisation du modèle : Combien de composantes retenir ?
 La sélection du nombre d'axes est un arbitrage crucial qui conditionne la pertinence de
votre analyse.
 L'enjeu est de trouver le juste équilibre entre la simplification du dataset et la
préservation d'un maximum d'information. Pour guider cette décision, plusieurs
méthodes complémentaires sont utilisées :

 Variance Cumulative : Cette approche consiste à retenir un nombre d'axes suffisant


pour atteindre un seuil cible de représentativité (souvent 80% ou 90% de la variance
totale)
Choix du nombre d’axes à retenir

 Critère de Kaiser : On ne conserve que les composantes dont la valeur propre est
supérieure à 1, garantissant qu'elles expliquent plus de variance qu'une variable
standardisée isolée.

Cette méthode est basée sur l'idée que les composantes avec des valeurs propres
inférieures à 1 n'expliquent pas plus de variance que la moyenne d'une variable
standardisée.
Choix du nombre d’axes à retenir
 Critère du Coude : On identifie visuellement le point d'inflexion sur
l'histogramme des variances ; les axes situés avant cette "cassure" sont les plus
significatifs
Ce point, souvent appelé "coude", indique le nombre optimal de composantes
principales à retenir.
Analyse des variables
et des individus

15
Analyse des variables et des individus: Représentation graphique

Analyse des variables et des individus : Les deux piliers de l’interprétation


L'interprétation d'une ACP repose sur l'analyse conjointe de deux outils graphiques
complémentaires :

 Le cercle de corrélation: Il projette les variables d'origine sous forme de


vecteurs pour visualiser leur liaison avec les composantes principales.

 La carte des individus: Elle illustre la distribution des observations dans le


nouvel espace défini par l’ACP.
Analyse des variables et des individus: Cercle de corrélation
 Vecteurs de Variables : Dans ce graphique, chaque variable d'origine est matérialisée
par un vecteur dont l'origine est le centre du cercle.
 La Règle de la Distance : La position de la variable par rapport au bord du cercle est le
premier indicateur de sa pertinence :

◦ Proche du bord : La variable est bien représentée et fortement corrélée aux deux axes du plan
factoriel..
◦ Proche du centre : La variable est mal représentée sur ce plan ; son information est portée par
d'autres composantes.

Qualité de Représentation (cos) : Une variable est dite fidèle au plan si elle se situe à proximité de sa
projection. Mathématiquement, plus l'angle entre la variable et l'axe est faible (proche de 0), plus son
cosinus est proche de 1, garantissant une représentation optimale
Analyse des variables et des individus: Cercle de corrélation

On voit que les variables « Trafic_Malware »,


« Paquet_src » sont bien représentées dans le
plan factoriel.
Analyse des variables et des individus: Carte des individus
Qualité de Représentation : La Fidélité de la Projection

 Le Concept : Dans le cadre de l’ACP, chaque individu est projeté depuis l'espace
multidimensionnel d'origine vers le nouvel espace des composantes principales.
 L’Indicateur de Proximité :
◦ Un individu est dit bien représenté s’il se situe à proximité immédiate de sa projection
sur l’axe ou le plan factoriel.
◦ S’il en est éloigné, sa position sur le graphique est trompeuse et il est considéré comme
mal représenté.
 La Règle de l'Angle : La qualité dépend de l’angle formé entre le point et l’axe :

Plus cet angle approche de 90 degrés, moins la représentation est fidèle (l'information est perdue
pour cet axe).
Analyse des variables et des individus: Carte des individus

Interprétation des Ressemblances des Individus

La similarité entre les individus est interprétée par leur proximité sur le plan factoriel:

 Le Principe de Proximité : Dans le plan factoriel, la distance géométrique entre


deux points est le reflet direct de leur ressemblance réelle.
 Points Proches = Profils Similaires : Deux individus situés côte à côte partagent
des caractéristiques quasi identiques au regard des variables d'origine.
Analyse des variables et des individus: Carte des individus

On voit que les individus « DDOS » et


« Malware » sont similaires et bien
représentés sur le plan factoriel .
Analyse des variables et des individus: Corrélation

Analyse des Variables : La Corrélation Positive

 L'analyse de la structure des données permet d'identifier les relations entre les variables,
notamment à travers l'étude de leurs corrélations.
 Une corrélation positive se manifeste lorsque deux variables évoluent de concert : si
l'une augmente, l'autre suit généralement la même tendance.
 Graphiquement, ce lien est traduit par des vecteurs proches dans l'espace des
composantes principales, formant entre eux un angle aigu.

Cette proximité visuelle est un indicateur fort : elle suggère que les variables partagent
une variance commune et apportent une contribution quasi identique à la définition
des axes factoriels.
Analyse des variables et des individus: Corrélation

Analyse des Variables : La Corrélation négative :

 L’Analyse en Composantes Principales permet de mettre en évidence les variables qui


évoluent en sens opposé.
 Une corrélation négative (ou inverse) signifie que l'augmentation de la valeur d'une
variable entraîne mécaniquement la diminution de l'autre.
 Géométriquement, ce phénomène se traduit par deux vecteurs formant un angle obtus
(supérieur à 90°) dans le cercle de corrélation

Cette divergence visuelle indique que les variables apportent des contributions
antagonistes à la construction des composantes principales, permettant ainsi de
distinguer des profils contrastés au sein du jeu de données.
Analyse des variables et des individus: Corrélation
Analyse des Variables : L’Indépendance et l’Orthogonalité

 L'absence de corrélation entre deux variables signifie qu'il n'existe aucune relation
linéaire entre elles. Elles évoluent de manière totalement indépendante.

 Représentation visuelle : Dans le cercle de corrélation, les vecteurs associés à ces


variables forment un angle proche de 90 degrés ; ils sont dits orthogonaux.

 Interprétation technique : Cette orthogonalité indique que les variables ne


partagent aucune variance commune lors de la construction des composantes
principales. Chaque variable apporte une information unique qui n'est pas expliquée
par l'autre.
Superposition du cercle de corrélation avec la carte des
individus

 Cette visualisation permet de combiner les informations des deux précédentes.

 Les vecteurs du cercle de corrélation sont superposés sur la carte des individus.

Cela aide à visualiser comment les variables originales contribuent à la position


des individus dans l'espace des composantes principales.

 L’analyse se fera à l’aide des individus et variables contribuant le plus à l’axe.

Si une variable a une forte contribution positive à l’axe, les individus ayant une forte
contribution positive à l’axe sont caractérisés par une valeur élevée de la variable.
Superposition du cercle de corrélation avec la carte des
individus

Un individu qui est à l'opposé d’une variable,


aura une faible valeur pour cette variable.

Un individu qui est du même côté d’une


variable, aura une valeur élevée pour cette
variable.

Remarque:
L'interprétation ne se limite pas à une simple lecture des graphiques : elle nécessite
une compréhension approfondie des données et des domaines associés pour donner
du sens aux axes définis par les composantes principales.
De l’ACP vers la classification
L'ACP réduit la dimensionnalité des données,
rendant les processus de classification plus
efficaces et potentiellement plus précis.

Pourquoi coupler l'ACP à la Classification ?

Nettoyage Intelligent :Élimination


automatique du "bruit" statistique en ne
conservant que les axes de variance maximale.
Gain de Temps (Training) : Les algorithmes
de classification traitent moins de données, ce
qui réduit considérablement le temps
d'entraînement.
Robustesse du Modèle : Meilleure capacité
de généralisation grâce à une structure de
données simplifiée et moins sujette aux erreurs
aléatoires.
ACP: Avantages

Vous aimerez peut-être aussi