Institut National
des Postes et Télécommunications
Machine Learning pour la cybersécurité
Prétraitement des données
Contexte :
- Le dataset CICDDoS2019 est le fruit d’un projet conjoint de l’établissement de la
communication et sécurité Canadien(CSE) et l’institut canadien de cyber sécurité (CIC). Il
contient des attaques Attaque et bénin, elle est avec 84 variables et la collecte a été faite dans
deux jours pour le training et l’évaluation des tests. L’ensemble d’entraînement a été capturé en
12 janvier 2019, et contient 12 types d’attaques DDoS différents, chaque type d’attaque séparé
dans un fichier PCAP. Les types d’attaque dans la journée de training comprend UDP, SNMP,
NetBIOS, LDAP, TFTP, NTP, SYN, WebDDoS, MSSQL, UDP-Lag, DNS et SSDP DDoS
based attack. Les données de test ont été collectée en mars 2019 et contiennent 7 types d’attaque
DDoS SYN, MSSQL, UDP-Lag, LDAP, UDP, PortScan et NetBIOS.
Objectifs :
L’objectif de cet atelier est d’appliquer les étapes de prétraitement des données
Matériel à utiliser :
- Dataset CICDDoS2019_dataset.csv
Réalisation :
1. Sous JupyterLab créez un nouveau sous-répertoire et nommez le
« datapreprocessing »
2. Téléversez le fichier « cicddos2019_dataset.csv »
3. Créez un script python et nommez le « [Link] »
4. En s’inspirant du code de l’atelier précédent écrivez le code permettant de charger
votre dataset
5. Explorez le contenu du fichier et donnez le nom de la variable cible
6. Ecrivez les instructions permettant d’afficher les valeurs possibles de la variable
cible
7. Affichez le nombre de lignes et de colonnes de votre dataset
8. Affichez le nombre de variables qualitatives et quantitatives
9. Ecrire le code pour contrôler si des valeurs sont manquantes
10. Remplacez des valeurs
11. Donnez une représentation graphique du pourcentage des instances déclarées
comme attaque et celles Bénin
12. de la Target le contenu du fichier et donnez le nom de la variable cible
13. Ecrivez les instructions permettant d’afficher les valeurs possibles de la variable
cible
14. Affichez le nombre de lignes et de colonnes de votre dataset
15. Affichez le nombre de variables qualitatives et quantitatives
16. Ecrire le code pour contrôler si des valeurs sont manquantes et des doublons
17. Convertissez les données catégorielles de la variable « Label » pour qu’elle soit
numérique en utilisant une technique d’encodage de votre choix
© [Link]