0% ont trouvé ce document utile (0 vote)
13 vues18 pages

Amélioration de AWID avec N-AWID

Ce document décrit un ensemble de données appelé CICIDS-2017 utilisé pour la détection d'intrusion. Il introduit la sélection de caractéristiques comme une approche pour réduire la dimensionnalité des données et améliorer la précision de la détection d'anomalies. Bien que de nombreuses techniques aient été testées sur d'autres ensembles de données, peu l'ont été sur CICIDS-2017 en raison de sa grande taille.

Transféré par

Ayoub Amellaln
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
13 vues18 pages

Amélioration de AWID avec N-AWID

Ce document décrit un ensemble de données appelé CICIDS-2017 utilisé pour la détection d'intrusion. Il introduit la sélection de caractéristiques comme une approche pour réduire la dimensionnalité des données et améliorer la précision de la détection d'anomalies. Bien que de nombreuses techniques aient été testées sur d'autres ensembles de données, peu l'ont été sur CICIDS-2017 en raison de sa grande taille.

Transféré par

Ayoub Amellaln
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats DOCX, PDF, TXT ou lisez en ligne sur Scribd

wireless network security dataset (AWID)

La détection d'intrusion dans les réseaux sans fil est devenue un sujet de recherche très en vogue. Le
jeu de données Intrusion WiFi Égéen (Aegean WiFi Intrusion Dataset - AWID) est le plus couramment
utilisé et ouvert parmi les ensembles de données de détection d'intrusion. Cependant, AWID se
caractérise par des données de caractères et un déséquilibre entre les données d'attaque et les données
normales, ce qui pourrait affecter l'évaluation du système de détection d'intrusion (IDS). Différents
chercheurs abordent AWID de différentes manières, ce qui conduit au fait que le travail de recherche
sur les IDS basé sur cet ensemble de données ne peut pas être évalué selon un ensemble de normes
unifiées. Par conséquent, la méthode de traitement des données HWKS (Hex-Word2Vec KMeans-
Smote) est proposée par des articles, et une version améliorée de AWID - N-AWID (Nouveau-AWID)
est proposée, dans laquelle la caractéristique des données de caractères et le déséquilibre des données
sont éliminés. Les résultats expérimentaux montrent que le HWKS fonctionne et est démontré, et que
le N-AWID est plus efficace et plus challengeant.

I. Introduction

Le développement rapide des réseaux sans fil a entraîné de nouveaux défis en matière de sécurité.
Identifier les différentes attaques réseau contre le protocole IEEE802.11 revêt une grande importance
pour garantir la sécurité des réseaux sans fil. Le système de détection d'intrusion (IDS) est une
technologie de défense de sécurité réseau sans fil importante. Et AWID est le dernier ensemble de
données de détection d'intrusion le plus efficace et publiquement disponible pour les problèmes de
sécurité des réseaux sans fil. Cependant, AWID contient un certain nombre de données de caractères,
et en même temps, les données anormales et normales sont déséquilibrées. De cette manière, le travail
de formation des IDS utilisant AWID pourrait être affecté. En ce qui concerne les données de
caractères, Kolias et al. ont éliminé les données de caractères par sélection d'attributs; Li Xueyong et
al. ont réalisé la conversion numérique des données de caractères par codage manuel; Xiao Hongliang
et al. ont numérisé les données de caractères par code One-Hot. Pour les données déséquilibrées, Li
Yanxia et al. ont prouvé que le déséquilibre des données entraînera des échantillons des classes
minoritaires à être mal classés; Fang Fang et al. ont sélectionné des échantillons d'entraînement par
sélection aléatoire.

Cependant, en raison de différentes méthodes de traitement de AWID, la recherche d'IDS basée sur cet
ensemble de données ne peut pas être évaluée selon un ensemble de normes unifiées. Dans cet article,
une nouvelle méthode de traitement des données - HWKS (Hex-Word2Vec-KMeans-Smote) est
proposée pour résoudre le problème du traitement des données de AWID. Une version avancée de
AWID - N-AWID (Nouveau-AWID) est proposée. Les résultats expérimentaux finaux montrent que,
d'une part, la méthode HWKS est raisonnable et que N-AWID est plus efficace et plus challengeant;
d'autre part, des ensembles de données similaires à AWID peuvent être traités par la méthode HWKS,
de sorte que l'évaluation des différentes recherches sera cohérente et comparable. Le tableau 1 résume
les principales caractéristiques et la structure des fichiers de l'ensemble de données AWID.
Tableau 1 : Structure des fichiers de AWID

A. Données de caractères

AWID contient un certain nombre de données de caractères (Tableau 2, exemples), qui ne peuvent pas
être directement appliquées aux algorithmes d'apprentissage automatique (ML) populaires tels que les
réseaux de neurones artificiels (ANN) et les machines à vecteurs de support (SVM) pour entraîner et
tester les IDS. Il est donc nécessaire de numériser les données de caractères.

Dans la littérature, ces méthodes présentent leurs propres défauts. Par exemple, l'élimination des
attributs de caractères affectera la fiabilité des ensembles de données. Le codage one-hot et le codage
manuel ne prennent pas en compte la relation logique entre les mots, et peuvent même entraîner une
augmentation excessive des dimensions. Ces limitations affecteront l'entraînement du modèle et la
précision des tests. De plus, dans AWID, il y a un grand nombre de nombres hexadécimaux et de
données MAC hexadécimales, qui ne peuvent pas être appliqués à la plupart des modèles
d'apprentissage automatique. Le traitement inapproprié de ces données affectera l'évaluation des IDS.

B. Déséquilibre des données

Comme le montre la Figure 1, les données normales sont nettement plus nombreuses que les données
d'attaque à la fois dans l'ensemble d'entraînement et dans l'ensemble de test. Dans le cas de données
déséquilibrées, des échantillons clairsemés peuvent causer certains effets négatifs. Par exemple, en
raison du manque de données d'entraînement, le classifieur n'apprendra pas suffisamment sur les
échantillons clairsemés. Ainsi, il est difficile d'obtenir une classification efficace des échantillons
clairsemés, ce qui entraîne une diminution de la précision de classification finale.
Fig 1 : Données d'attaque vs. Données normales dans AWID

IV. Évaluation de l'ensemble de données :

Afin de prouver la validité de N-AWID, les chercheurs ont utilisé OneR, ZeroR, J48, NaiveBayes
(NB), Adaboost, RandomTree et RandomForest pour évaluer N-AWID. Les résultats expérimentaux
sont présentés dans le Tableau 5. Les résultats expérimentaux de Kolias et al. sont présentés dans le
Tableau 6. Il convient de noter que la seule différence entre AWID-ATK-R et AWID-CLS-R réside
dans la méthode de marquage des cibles de classe d'attaque, et le reste du format des données, le
contenu, le volume de données, etc. sont identiques, tandis que CAB-AWID a été traité et obtenu sur
la base de la méthode WKS. Par conséquent, cet article comparera et évaluera les résultats de test de
ces deux ensembles de données, la comparaison de précision est présentée dans la Fig 7.

Tableau 5 : Évaluation des algorithmes de classification sur N-AWID.

Tableau 6 : Évaluation des algorithmes de classification sur AWID.


Fig 7 : Comparaison de la précision

Il est possible de constater dans la Fig 7 que toutes les précisions des algorithmes ont changé. En
raison du traitement de N-AWID basé sur la méthode HWKS qui a augmenté la pertinence et la
complexité de l'ensemble de données, la précision de la plupart des algorithmes a diminué, sauf
NaiveBayes. L'algorithme ZeroR a la plus forte baisse. Cela est dû au fait que ZeroR ne sélectionne
que la catégorie ayant la probabilité la plus élevée comme résultat de classification de l'échantillon
inconnu, et les données normales représentaient environ 60% de l'ensemble d'entraînement de N-
AWID. La précision de NaiveBayes a augmenté d'environ 2,4%. C'est parce que les données normales
sont beaucoup plus nombreuses que les données d'attaque dans AWID-CLS-R-Trn, les données
d'attaque sont mal classées. Cependant, ce problème n'existe pas dans N-AWID, donc la précision de
NaiveBayes a augmenté. Par conséquent, N-AWID est plus efficace et challengeant, et le HWKS est
raisonnable.

V. Conclusions

Différents chercheurs abordent AWID de différentes manières, ce qui conduit au fait que le travail de
recherche sur les systèmes de détection d'intrusion basé sur cet ensemble de données ne peut pas être
évalué selon un ensemble de normes unifiées. Par conséquent, cet article a proposé la méthode HWKS
et un nouvel ensemble de données - N-AWID. Les résultats expérimentaux montrent, d'une part, que
N-AWID est plus efficace et challengeant et peut être utilisé comme ensemble de données de base
unifié et efficace pour que les chercheurs comparent les performances des différents IDS. D'autre part,
HWKS peut réduire la différence dans le traitement des données, et il peut être appliqué à l'ensemble
de données similaire à AWID. Ainsi, le résultat d'évaluation des différents travaux de recherche sera
cohérent et comparable. Le prochain travail dans cet article se concentrera sur la recherche d'un nouvel
algorithme de détection d'intrusion pour améliorer la précision.
The Canadian Institute for Cybersecurity Intrusion Detection System 2017
(CICIDS-2017):
I. INTRODUCTION :

La détection d'intrusion basée sur les anomalies est l'une des techniques utilisées pour
reconnaître les attaques zero-day. Bien que diverses techniques de détection d'anomalies aient
été développées.

Une approche utilisée par les chercheurs pour traiter le problème de la dimensionnalité des
données est la technique de sélection de caractéristiques. La technique de sélection de
caractéristiques élimine les caractéristiques, aide à comprendre les données, réduit le temps de
calcul, réduit les effets de la "malédiction de la dimensionnalité" et améliore les performances
des machines prédictives. La sélection de caractéristiques fait partie de la réduction
dimensionnelle, connue comme un processus de sélection d'un sous-ensemble optimal de
caractéristiques qui représente l'ensemble des données .

De nombreux travaux de recherche utilisant des techniques de sélection de caractéristiques


pour améliorer la précision de la détection d'anomalies ont été réalisés. La plupart des travaux
utilisent l'ensemble de données Network Security Laboratory-Knowledge Discovery and Data
Mining (NSL-KDD), une version affinée de son prédécesseur, l'ensemble de données KDD
Cup 99. Des méthodes et des mesures ont été proposées qui montrent la capacité à améliorer
la précision de la détection, notamment Chi-Square, le Gain d'Information, la Corrélation avec
Naive Bayes et le Classifieur Majoritaire à Table de Décision , la Machine à Vecteurs de
Support (SVM) et le Random Forest . Néanmoins, ces méthodes n'ont pas été testées sur un
grand ensemble de données avec un grand nombre de caractéristiques comme mentionné dans
, des données avec un grand nombre de caractéristiques peuvent affecter le modèle
d'apprentissage qui a tendance à surajuster et diminuera les performances, augmentant
l'utilisation de la mémoire et le coût computationnel pour l'analyse. En fait, très peu de
chercheurs prennent en compte le temps de calcul dans leurs travaux, en particulier dans la
détection d'anomalies.

D'autre part, le Gain d'Information a été largement utilisé par les chercheurs pour analyser les
caractéristiques significatives et pertinentes. le Gain d'Information est utilisé pour réduire la
dimensionnalité en sélectionnant des caractéristiques plus pertinentes grâce au calcul du poids
des caractéristiques. L'élimination des caractéristiques non pertinentes peut améliorer les
performances du système de détection. De nombreux travaux de recherche implémentent le
Gain d'Information sur l'ensemble de données avec un nombre limité de caractéristiques à
analyser. l'ensemble de données CICIDS-2017 avec des caractéristiques plus complexes est
utilisé. L'ensemble de données CICIDS-2017 contient un volume élevé de trafic et un grand
nombre de caractéristiques à observer pour la détection d'anomalies.

Les travaux précédents qui utilisent l'ensemble de données CICIDS-2017 et qui utilisent
également la technique de sélection de caractéristiques du Gain d'Information ne mentionnent
pas la base sur laquelle déterminer la valeur de score utilisée pour la sélection des
caractéristiques. Chaque chercheur utilise une valeur de score différente.

A. DATASET :

TABLEAU 2. Résumé de dataset CICIDS-2017

Le jeu de données d'évaluation de la détection d'intrusion (CIC-IDS2017) est un


ensemble de données crucial pour évaluer les systèmes de détection d'intrusion (IDS) et les
systèmes de prévention d'intrusion (IPS), qui sont des outils de défense essentiels contre les
attaques réseau sophistiquées et en constante évolution. En raison du manque de jeux de
données de test et de validation fiables, les approches de détection d'intrusion basées sur
l'anomalie souffrent d'évolutions de performances cohérentes et précises.

Nos évaluations des onze jeux de données existants depuis 1998 montrent que la
plupart sont obsolètes et peu fiables. Certains de ces jeux de données souffrent du manque de
diversité et de volumes de trafic, certains ne couvrent pas la variété des attaques connues,
tandis que d'autres anonymisent les données de charge utile des paquets, ce qui ne peut pas
refléter les tendances actuelles. Certains manquent également d'ensemble de fonctionnalités et
de métadonnées.

Le jeu de données CICIDS2017 contient des attaques bénignes et les plus courantes,
ce qui ressemble aux données réelles du monde réel (PCAPs). Il comprend également les
résultats de l'analyse du trafic réseau à l'aide de CICFlowMeter avec des flux étiquetés en
fonction de l'horodatage, des adresses IP source et destination, des ports source et destination,
des protocoles et des attaques (fichiers CSV). La définition des fonctionnalités extraites est
également disponible.

La génération d'un trafic de fond réaliste était notre priorité absolue dans la
construction de cet ensemble de données. Nous avons utilisé notre système B-Profile proposé
(Sharafaldin, et al. 2016) pour profiler le comportement abstrait des interactions humaines et
générer un trafic de fond bénin naturaliste. Pour cet ensemble de données, nous avons
construit le comportement abstrait de 25 utilisateurs basé sur les protocoles HTTP, HTTPS,
FTP, SSH et email.

La période de capture des données a commencé à 9 heures du matin, le lundi 3 juillet


2017 et s'est terminée à 17 heures le vendredi 7 juillet 2017, pour un total de 5 jours. Le lundi
est le jour normal et ne comprend que le trafic bénin. Les attaques mises en œuvre
comprennent Brute Force FTP, Brute Force SSH, DoS, Heartbleed, Web Attack, Infiltration,
Botnet et DDoS. Elles ont été exécutées le matin et l'après-midi le mardi, le mercredi, le jeudi
et le vendredi.

Dans notre cadre d'évaluation récent des ensembles de données (Gharib et al., 2016),
nous avons identifié onze critères nécessaires à la construction d'un ensemble de données de
référence fiable. Aucun des ensembles de données IDS précédents n'a pu couvrir tous les 11
critères. Dans ce qui suit, nous décrivons brièvement ces critères :

Configuration réseau complète : Une topologie réseau complète comprend un


modem, un pare-feu, des commutateurs, des routeurs, et la présence d'une variété de systèmes
d'exploitation tels que Windows, Ubuntu et Mac OS X.

Trafic complet : En ayant un agent de profilage utilisateur et 12 machines différentes


dans le Réseau des Victimes et de vraies attaques du Réseau d'Attaque.

Ensemble de données étiqueté : La section 4 et le Tableau 2 montrent les étiquettes


bénignes et d'attaque pour chaque jour. De plus, les détails de la synchronisation des attaques
seront publiés dans le document de l'ensemble de données.

Interaction complète : Comme le montre la Figure 1, nous avons couvert à la fois à


l'intérieur et entre LAN internes en ayant deux réseaux différents et la communication
Internet.
Capture complète : Parce que nous avons utilisé le port en miroir, tel qu'un système
de dérivation, tous les trafics ont été capturés et enregistrés sur le serveur de stockage.

Protocoles disponibles : En présence de tous les protocoles couramment disponibles,


tels que HTTP, HTTPS, FTP, SSH et les protocoles de messagerie électronique.

Diversité des attaques : Comprend les attaques les plus courantes selon le rapport
McAfee 2016, telles que les attaques basées sur le Web, par force brute, DoS, DDoS,
Infiltration, Heart-bleed, Bot et Scan couverts dans cet ensemble de données.

Hétérogénéité : Capturé le trafic réseau du commutateur principal et le vidage


mémoire et les appels système de toutes les machines victimes, pendant l'exécution des
attaques.

Ensemble de fonctionnalités : Extraction de plus de 80 fonctionnalités de flux réseau


à partir du trafic réseau généré à l'aide de CICFlowMeter et fourniture de l'ensemble de
données de flux réseau sous forme de fichier CSV. Voir notre analyseur PCAP et générateur
CSV.

Métadonnées : Explication complète de l'ensemble de données comprenant l'heure,


les attaques, les flux et les étiquettes dans l'article publié.
NSL-KDD :
Introduction

NSL-KDD est un ensemble de données public, qui a été développé à partir de l'ensemble de
données précédent KDD cup99 (Tavallaee et al., 2009). Une analyse statistique effectuée sur
l'ensemble de données cup99 a soulevé des problèmes importants qui influencent fortement la
précision de la détection des intrusions et conduisent à une évaluation trompeuse des IDS
(Tavallaee et al., 2009).

Le principal problème dans l'ensemble de données KDD est la grande quantité de paquets
dupliqués. Tavallaee et al. ont analysé les ensembles d'entraînement et de test KDD et ont
révélé qu'environ 78% et 75% des paquets réseau sont dupliqués dans les deux ensembles
d'entraînement et de test (Tavallaee et al., 2009). Cette énorme quantité d'instances dupliquées
dans l'ensemble d'entraînement influencerait les méthodes d'apprentissage automatique à être
biaisées vers les instances normales et les empêcherait donc d'apprendre les instances
irrégulières qui sont généralement plus dommageables pour le système informatique.
Tavallaee et al. ont construit l'ensemble de données NSL-KDD en 2009 à partir de l'ensemble
de données KDD Cup'99 pour résoudre les problèmes mentionnés ci-dessus en éliminant les
enregistrements dupliqués (Tavallaee et al., 2009). L'ensemble de données d'entraînement
NSL-KDD se compose de 125 973 enregistrements et l'ensemble de données de test contient
22 544 enregistrements. La taille de l'ensemble de données NSL-KDD est suffisante pour le
rendre pratique d'utiliser l'ensemble de données NSL-KDD entier sans nécessité
d'échantillonner de manière aléatoire. Cela a produit des résultats cohérents et comparables à
partir de divers travaux de recherche. L'ensemble de données NSL-KDD comprend 22
attaques d'intrusion d'entraînement et 41 attributs (c'est-à-dire, des caractéristiques). Dans cet
ensemble de données, 21 attributs se réfèrent à la connexion elle-même et 19 attributs
décrivent la nature des connexions au sein du même hôte (Tavallaee et al., 2009).

TABLEAU 1. Description de Dataset NSL-KDD


Tableau 2 : Les 41 caractéristiques de l'ensemble de données NSL-KDD.

KDDcup99 est l'ensemble de données le plus largement utilisé pour construire les systèmes de
détection d'intrusions. Les chercheurs ont mené une analyse statistique sur cet ensemble de
données et ont trouvé deux problèmes importants qui affectent fortement les performances des
systèmes évalués. La déficience la plus importante dans l'ensemble de données KDD est le
nombre énorme d'enregistrements redondants. En analysant les ensembles d'entraînement et
de test KDD, il a été constaté que environ 78% et 75% des enregistrements sont dupliqués
dans l'ensemble d'entraînement et de test, respectivement. Cette grande quantité
d'enregistrements redondants dans l'ensemble d'entraînement entraînera les algorithmes
d'apprentissage à être biaisés vers les enregistrements les plus fréquents, et donc les empêcher
d'apprendre les enregistrements peu fréquents qui sont généralement plus nocifs pour les
réseaux tels que les attaques U2R. L'existence de ces enregistrements répétés dans l'ensemble
de test, d'autre part, entraînera des résultats d'évaluation biaisés par les méthodes qui ont de
meilleurs taux de détection sur les enregistrements fréquents et aboutira à une évaluation très
médiocre des approches de détection d'anomalies. Pour résoudre ces problèmes, ils ont
proposé un nouvel ensemble de données, NSL-KDD, qui se compose d'enregistrements
sélectionnés de l'ensemble de données KDD complet.

Les avantages de NSL-KDD par rapport à l'ensemble de données KDD original sont les
suivants :

• Il n'inclut pas d'enregistrements redondants dans l'ensemble d'entraînement, de sorte que les
classificateurs ne seront pas biaisés vers les enregistrements les plus fréquents.

• Le nombre d'enregistrements sélectionnés de chaque groupe de difficulté est inversement


proportionnel au pourcentage d'enregistrements dans l'ensemble de données KDD original. En
conséquence, les taux de classification des différentes méthodes d'apprentissage automatique
varient dans une plage plus large, ce qui rend plus efficace d'avoir une évaluation précise des
différentes techniques d'apprentissage.

• Le nombre d'enregistrements dans les ensembles d'entraînement et de test est raisonnable, ce


qui rend abordable d'exécuter les expériences sur l'ensemble complet sans avoir besoin de
sélectionner aléatoirement une petite portion. Par conséquent, les résultats d'évaluation des
différents travaux de recherche seront cohérents et comparables.
KDD CUP 99:
. DESCRIPTION DE L'ENSEMBLE DE DONNÉES KDD CUP 99 :

Depuis 1999, KDD’99 [3] est l'ensemble de données le plus largement utilisé pour
l'évaluation des méthodes de détection des anomalies. Cet ensemble de données a été préparé
par Stolfo et al. et est construit à partir des données capturées dans le cadre du programme
d'évaluation des IDS DARPA’98 . DARPA’98 comprend environ 4 gigaoctets de données
tcpdump brut (binaire) compressées sur 7 semaines de trafic réseau, pouvant être transformées
en environ 5 millions d'enregistrements de connexion, chacun avec environ 100 octets. Les
deux semaines de données de test contiennent environ 2 millions d'enregistrements de
connexion. L'ensemble de données d'entraînement KDD se compose d'environ 4 900 000
vecteurs de connexion uniques, chacun contenant 41 caractéristiques et étant étiqueté soit
comme normal, soit comme une attaque, avec exactement un type d'attaque spécifique. Les
attaques simulées relèvent de l'une des quatre catégories suivantes :

1) Attaque par déni de service (DoS) : est une attaque dans laquelle l'attaquant rend
certaines ressources informatiques ou de mémoire trop occupées ou trop pleines pour traiter
des demandes légitimes, ou refuse l'accès à une machine aux utilisateurs légitimes.

2) Attaque de User to Root (U2R) : est une classe d'exploitation dans laquelle l'attaquant
commence avec l'accès à un compte utilisateur normal sur le système (peut-être obtenu en
espionnant des mots de passe, en effectuant une attaque par dictionnaire, ou en utilisant
l'ingénierie sociale) et parvient à exploiter une vulnérabilité pour obtenir un accès root au
système.

3) Attaque Remote to Local (R2L) : se produit lorsqu'un attaquant ayant la capacité


d'envoyer des paquets à une machine via un réseau mais qui n'a pas de compte sur cette
machine exploite une certaine vulnérabilité pour obtenir un accès local en tant qu'utilisateur
de cette machine.

4) Attaque d'exploration : est une tentative de recueillir des informations sur un réseau
d'ordinateurs dans le but apparent de contourner ses contrôles de sécurité.

Il est important de noter que les données de test ne proviennent pas de la même distribution de
probabilité que les données d'entraînement, et elles incluent des types d'attaques spécifiques
qui ne sont pas dans les données d'entraînement, ce qui rend la tâche plus réaliste. Certains
experts en intrusion estiment que la plupart des attaques nouvelles sont des variantes
d'attaques connues et que la signature des attaques connues peut suffire à détecter les
variantes nouvelles.

Les ensembles de données contiennent un total de 24 types d'attaque dans les données
d'entraînement, avec 14 types supplémentaires dans les données de test uniquement.

Les caractéristiques (features) de KDD’99 peuvent être classées en trois groupes :


1) Caractéristiques de base : cette catégorie englobe toutes les attributs qui peuvent être
extraits d'une connexion TCP/IP. La plupart de ces caractéristiques entraînent un retard
implicite dans la détection.

2) Caractéristiques de trafic : cette catégorie comprend des caractéristiques qui sont calculées
par rapport à un intervalle de temps et est divisée en deux groupes :

a) Caractéristiques "même hôte" : examinent uniquement les connexions des 2 dernières


secondes qui ont le même hôte de destination que la connexion actuelle, et calculent des
statistiques liées au comportement du protocole, au service, etc.

b) Caractéristiques "même service" : examinent uniquement les connexions des 2 dernières


secondes qui ont le même service que la connexion actuelle.

Les deux types de caractéristiques de "trafic" mentionnés ci-dessus sont appelés basés sur le
temps. Cependant, il existe plusieurs attaques de sondage lentes qui scannent les hôtes (ou les
ports) en utilisant un intervalle de temps beaucoup plus long que 2 secondes, par exemple, une
fois par minute. Par conséquent, ces attaques ne produisent pas de modèles d'intrusion avec
une fenêtre temporelle de 2 secondes. Pour résoudre ce problème, les caractéristiques "même
hôte" et "même service" sont recalculées mais basées sur la fenêtre de connexion de 100
connexions plutôt que sur une fenêtre de temps de 2 secondes. Ces caractéristiques sont
appelées caractéristiques de trafic basées sur la connexion.

3) Caractéristiques de contenu : contrairement à la plupart des attaques de déni de service et


de sondage, les attaques R2L et U2R n'ont pas de modèles séquentiels d'intrusion fréquents.
Cela est dû au fait que les attaques de déni de service et de sondage impliquent de nombreuses
connexions à certains hôtes (ou ports) en très peu de temps ; cependant, les attaques R2L et
U2R sont intégrées dans les parties de données des paquets, et impliquent généralement une
seule connexion. Pour détecter ces types d'attaques, nous avons besoin de certaines
caractéristiques pour être en mesure de rechercher des comportements suspects dans la partie
données, par exemple, le nombre de tentatives de connexion échouées. Ces caractéristiques
sont appelées caractéristiques de contenu.

. PROBLÈMES INHÉRENTS DU JEU DE DONNÉES KDD’99

1) Pour des raisons de confidentialité, les expériences ont choisi de synthétiser à la fois
les données de fond et les données d'attaque, et il est prétendu que les données sont
similaires à celles observées pendant plusieurs mois de collecte de données à partir
d'un certain nombre de bases de l'armée de l'air. Cependant, aucune validation
analytique ou expérimentale des caractéristiques des fausses alarmes des données n'a
été entreprise. De plus, la charge de travail des données synthétisées ne semble pas
être similaire au trafic dans les réseaux réels.
2) Les collecteurs de trafic tels que TCPdump, utilisés dans DARPA’98, sont très
susceptibles de devenir surchargés et de laisser tomber des paquets en cas de charge de
trafic importante. Cependant, il n'y a eu aucun examen pour vérifier la possibilité des
paquets abandonnés.
3) Il n'y a pas de définition exacte des attaques. Par exemple, le sondage n'est pas
nécessairement un type d'attaque à moins que le nombre d'itérations ne dépasse un
seuil spécifique. De même, un paquet qui provoque un débordement de tampon n'est
pas toujours représentatif d'une attaque. Dans de telles conditions, il devrait y avoir un
accord sur les définitions entre l'évaluateur et l'évalué. Cependant, dans DARPA’98, il
n'y a pas de définitions spécifiques des attaques réseau.

VI. REMARQUES FINALES

Apres les analysés statistiques de l'ensemble des données KDD. L'analyse a montré qu'il
existe deux problèmes importants dans l'ensemble de données qui affectent fortement les
performances des systèmes évalués et donnent des évaluations très médiocres des approches
de détection d'anomalies. Pour résoudre ces problèmes, nous avons proposé un nouvel
ensemble de données, NSL-KDD, qui se compose d'enregistrements sélectionnés de
l'ensemble de données complet de KDD. Cet ensemble de données est disponible
publiquement pour les chercheurs présente les avantages suivants par rapport à l'ensemble de
données KDD original :

• Il n'inclut pas d'enregistrements redondants dans l'ensemble d'entraînement, de sorte que les
classificateurs ne seront pas biaisés vers les enregistrements les plus fréquents.

• Il n'y a pas d'enregistrements dupliqués dans les ensembles de tests proposés ; par
conséquent, les performances des apprenants ne sont pas biaisées par les méthodes qui ont de
meilleurs taux de détection sur les enregistrements fréquents.

• Le nombre d'enregistrements sélectionnés de chaque groupe de difficulté est inversement


proportionnel au pourcentage d'enregistrements dans l'ensemble de données KDD original. En
conséquence, les taux de classification des différentes méthodes d'apprentissage automatique
varient dans une plage plus large, ce qui permet d'avoir une évaluation précise des différentes
techniques d'apprentissage.

• Le nombre d'enregistrements dans les ensembles d'entraînement et de test est raisonnable, ce


qui permet d'exécuter les expériences sur l'ensemble complet sans avoir besoin de sélectionner
aléatoirement une petite portion. Par conséquent, les résultats d'évaluation des différents
travaux de recherche seront cohérents et comparables.
UNSW-NB15 Dataset:
Le jeu de données UNSW-NB15 a été créé dans le Laboratoire Cyber Range du Centre
Australien de Cybersécurité (ACCS) à l'aide de l'outil IXIA Perfect Storm. Ce jeu de données
cette dataset contient un mélange d'activités normales et de comportements d'attaques. L'outil
Tcpdump a été utilisé pour capturer 100 Go de trafic brut. Douze algorithmes et outils tels que
Argus, Bro-IDS ont été utilisés pour générer UNSW-NB15. Il contient 49 caractéristiques, y
compris une étiquette de classe. Les caractéristiques, leur type et une description détaillée sont
données dans le Tableau 3.
Tableau 3 : Caractéristiques(Features) du dataset UNSW-NB15

Un total de 49 attributs déterminant les caractéristiques des connexions sont présents pour
chaque instance de données. Les attributs sont de nature mixte, certains étant nominaux,
d'autres numériques et certains prenant des valeurs de type horodatage comme indiqué dans le
Tableau 4.

Tableau 4 : Types de caractéristiques du dataset UNSW-NB15

Les attributs du Dataset sont catégorisés en 6 groupes généraux, dont les détails sont donnés
dans le Tableau 5.
Tableau 5 : Catégorisation des caractéristiques du dataset UNSW-NB15

Cette dataset contient un total de 2 540 044 instances étiquetées, chacune étant étiquetée
comme normale ou attaque. La répartition des connexions entre les deux groupes est
présentée dans le Tableau 6.

Tableau 6 : Détails des événements dans UNSW-NB15

Au total, il existe neuf types d'attaques dans le jeu de données, en plus d'un groupe
représentant les données normales. Les attaques sont catégorisées comme Fuzzers, Analyse,
Portes dérobées, Déni de service (DoS), Exploits, Générique, Reconnaissance, Code coquille
et Vers. Les détails des attaques, sous-catégories d'attaques et les protocoles qu'elles utilisent
sont donnés dans le Tableau 7.
Tableau 7 : Catégorisations des attaques dans UNSW-NB15

Dataset UNSW-NB15 facilite les études empiriques sur le développement de systèmes


de détection d'intrusions en utilisant des approches basées sur les données. Cependant,
UNSW-NB15 présente deux problèmes majeurs, à savoir le déséquilibre de classe et le
chevauchement de classe, qui doivent être résolus avant d'être utilisés pour le développement
de modèles. Le déséquilibre de classe et le chevauchement, s'ils ne sont pas traités, sont
susceptibles de compromettre les performances de détection et d'identification des attaques
des systèmes de détection d'intrusions. En préparation de l'analyse visuelle ultérieure,
plusieurs étapes de prétraitement ont été mises en œuvre, notamment la suppression des
caractéristiques redondantes, la normalisation des caractéristiques et la mise à l'échelle des
caractéristiques. Après le prétraitement des données, nous avons utilisé différentes techniques
de visualisation pour exposer et illustrer les problèmes de déséquilibre de classe et de
chevauchement de classe avec cette dataset. UNSW-NB15 a été projeté dans des vues 2D et
3D en utilisant l'ACP. Il a ensuite été analysé avec le graphique de dispersion, t-SNE, et la
carte de distance inter-cluster de K-means. Étant donné le degré de gravité tel que présenté à
travers la visualisation, il est impératif de mettre en œuvre des approches efficaces pour
atténuer les effets négatifs de ces deux problèmes sur les performances de classification de
tout modèle statistique ou d'apprentissage automatique basé sur les données.

Vous aimerez peut-être aussi