0% ont trouvé ce document utile (0 vote)
5 vues69 pages

Introduction à la Data Science avec Python

Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
5 vues69 pages

Introduction à la Data Science avec Python

Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

Introduction à la

Data Science
avec python
Module 2
La couverture charte.
Visuels avec point de focus
entre 5% et 20%
Best pratices de l’image
Accompagnée d’un bandeau
vertical à 10%
Avril 2018

[Link]

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 1
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Rappel module 1 (1/2)
Les algorithmes ne sont pas destinés au même usage. On les classe usuellement selon deux
composantes:

Supervisé Non Supervisé

 Si on veut répondre à la question oui/non : Ceci est une classification (supervisé)


 Si on veut grouper des observations dans des groupes similaires : Ceci est du clustering (non
supervisé)
 Si on veut prédire une valeur numérique : Ceci est une régression (supervsié)
 Si on veut recommander quelque chose à une personne (livre, film, produit) en se basant sur des
données d’évaluation d’autres clients : Ceci est un système de recommandation
 Il existe d’autres problématiques de machine learning
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 2
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Rappel module 1 (2/2)

Compréhension
Compréhension Préparation des
des besoins du Modélisation Evaluation Déploiement
des données données
business

Identifier les Collecter et Sélectionner et Manipulation des Evaluer le Appliquer les


objectifs du analyser les nettoyer les données modèle et conclusions au
projet données données dresser des business
conclusions

Peut prendre une grande partie du temps


de travail
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 3
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 4
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
[Link] des données 6

Sommaire [Link] des données 21

[Link] des données 27

[Link] des features 38

[Link]élisation prédictive 42

Annexes 66

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 5
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
1. Collecte des données

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 6
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Structure de donnée
Comma Separated Value (CSV)
Structure de donnée la plus simpliste: Ensemble de valeurs qui sont séparées par une virgule (ou tout
autre séparateur comme tabulation, point virgule ..)
Peut être généré à partir d’Excel

Entête

Séparateur

Data

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 7
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Structure de donnée
JavaScript Object Notation (JSON)

 Structure comme un dictionnaire


{‘Key’ : value}
 On peut généralement la trouver
comme output d’API (slide suivant)
 La structure emboitée est permise

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 8
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Structure de donnée
Hypertext Markup Language (HTML) et Extensible Markup Language (XML)
 On peut généralement les trouver sur les applications web
 Les éléments sont entourés par des tags d’ouverture et de fermeture
 Exemple : <div> DU TEXTE </div>

Tag d’ouverture XML Tag de fermeture HTML

 Description, structure et échange de  Affiche la données sur un site web


données  Nombre de tag limité (paragraphe,
 Nous pouvons définir notre propre tag image, tableau,..)

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 9
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation d’API
C’est quoi une API
Serveur client

API est un acronyme pour Applications Programming Interface.


Une API est une interface de programmation qui permet de se « brancher » sur une application pour
échanger des données.

Généralement, nous pouvons accéder à la donnée sur un serveur (exp: Twitter) grâce à une API.
Le résultat est généralement retourné en format json.

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 10
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation d’API
Exemples
API de réseaux sociaux: Twitter
[Link]

 Vous pouvez télécharger les tweets par utilisateur ,sujet, temps.. En format json
 Vous pouvez analyser le contenu d’un tweet
 Généralement, nous avons besoin d’un algorithme de NLP (Natural Language Processing) pour
extraire l’information
 D’autres informations peuvent être exploitées

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 11
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation d’API
Exemples
API de transport: RATP et SNCF
[Link]
[Link]

 Ils donnent des informations comme les positions GPS des stations, les itinéraires, les retards et
modifications ..

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 12
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation de données open source
Données du gouvernement Français
Programme open data du gouvernement français
[Link]

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 13
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation de données open source
Autres

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 14
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : extraire les données du web

Le web scraping est une technique d’extraction du contenu de sites Web, via un script ou un
programme, dans le but de le transformer pour permettre son utilisation dans un autre contexte.
L’extraction et suivi d’une transformation de la données non structurée du site (sous le format HTML) en
une donnée structurée.

Le Web scraping peut être contraire aux termes d’utilisation de quelques sites.
La réglementation peut varier d’un pays à un autre.
Il faut utiliser cette technique avec précaution.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 15
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : extraire les données du web
Exemple d’utilisation : Weather underground

[Link]

 Vous pouvez normalement extraire les données de n’importe quel site web.
 Les résultats sont généralement sous le format XML ou en HTML
 Exemple de données:
[Link]
html?req_city=New%20York&req_state=NY

ville état date

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 16
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : extraire les données du web
Traitement de la donnée : Weather underground Exemple de tags à
enlever

Les données que nous obtenons :

Les données après transformation :

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 17
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Dataframe, l’objet essentiel pour l’analyse des données
Un dataframe est une table avec une entête et des données.
Le package Pandas de Python gère parfaitement les dataframes.

ID Age Is Subscriber? Precipitation Start Time Station Name Weather


0345534 18 True 0.5 14/12/2017 10:03:29 Broadway Rainy
05343345 23 False 0 06/08/2017 11:05:40 E40 Cloudy
04583543 37 False 1.5 09/08/2017 13:10:45 W St 3 Sunny

Chaque colonne peut contenir des variable de différents types. Les plus utilisés sont :
 Numériques : variables numériques (entier, décimal,..)
 Catégorielles : des chaines de caractère
 Date/temps : timestamp (date et temps), Unix (nombre de secondes depuis 01 Janvier 1970
UTC
 Booléen : True/False

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 18
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Dataframe, l’objet essentiel pour l’analyse des données
Nous pouvons sélectionner la donnée par colonne ou par ligne.
Les opérations sous python sont comparables à celle du SQL : Split,groupby,apply …
[Link]

ID Age Is Subscriber? Precipitation Start Time Station Name Weather


0345534 18 True 0.5 14/12/2017 10:03:29 Broadway Rainy
05343345 23 False 0 06/08/2017 11:05:40 E40 Cloudy
04583543 37 False 1.5 09/08/2017 13:10:45 W St 3 Sunny

Sélection de quelques champs (colonne)


Data[[‘Precipitation ’,’Start Time’]]
Sélection par valeur de variable (ligne)
DataNew = Data[Data[‘Weather ’]==‘Rainy’]

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 19
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Jointure de dataframes
Plus de détails ici:
[Link]

Jointure sur les lignes

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 20
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
2. Nettoyage des données

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 21
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment gérer les valeurs manquantes
La présence de valeurs manquantes est une problématique classique quand on aborde un projet
d’analyse de données.
Ces valeurs sont généralement représentés par NaN.
Plusieurs approches peuvent être appliquées pour détourner ce problème.

VALEURS MANQUANTES

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 22
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment gérer les valeurs manquantes
Remplacer par la moyenne
Si les données sont assez homogènes, l’approche intuitive serait de remplacer par la moyenne de toutes
les autres valeurs.

[Link](method = ‘mean’)

Remplacement avec la moyenne

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 23
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Valeurs manquantes et outliers
Remplacer par la médiane
Si on n’a pas beaucoup de valeurs aberrantes, le remplacement par la médiane fonctionne.

OUTLIER

VALEURS MANQUANTES La médiane est moins influencée par


les valeurs aberrantes que la moyenne

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 24
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Valeurs manquantes pour les séries temporelles
remplacement forward/backward
Dans certains cas, remplacer par la moyenne/médiane ne fonctionne pas.
Si les données ont une structure temporelle, chaque point est similaire à ses voisins.

La valeur manquante peut


Être trouvée dans la structure
temporelle

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 25
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment gérer les valeurs manquantes
L’essentiel

 NaN (Not a Number) est le résultat d’un valeur manquante ou d’autres problèmes

 1ère approche: Enlever la ligne manquantes, mais vous allez perdre d’autres informations sur la ligne

 2ème approche: Remplacer par la moyenne, mais il faut faire attention aux valeurs aberrantes

 3ème approche: Remplacer par la médiane, mais attention aux séries temporelles

 4ème approche: backward / forward, mais attention à la structure des données

 5ème approche: Une valeur manquante est aussi une information. Vous pouvez rajouter une nouvelle
colonnes (indicatrice) qui indique s’il manque une information ou pas

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 26
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
3. Visualisation des
données

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 27
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment choisir le bon graphique?
Le bon graphique dépend en premier lieu de la données
Il n’y a pas de solution unique

La part de marché est Il y a clairement un trend


pratiquement constante qui dépend de l'Age
avec l'Age

Dans cet exemple, la même donnée est représentée avec deux graphiques différents et le résultat est
complétement différent.
Le choix du graphique dépend du message qu’on veut faire apparaitre.

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 28
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Violin plot (1/2)
Avec ce graphique nous avons beaucoup d’informations sur la distribution des données …

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 29
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Violin plot (2/2)
.. Et nous pouvons même exploiter la symétrie

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 30
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Box plot
Les mêmes informations peut être générées avec le box plot

Outliers

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 31
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
La famil es des histogrammes
Il existe plusieurs méthodes de
représentation des histogrammes. Il
peuvent être :
 Empilés
 Groupés
 Superposés
 Cumulatifs …

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 32
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Heatmap
Une variable est représentée par une couleur sur un espace de deux dimensions

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 33
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Recette pour avoir un bon graphique
 Mettre une description (label et unité) et un titre au graphique

 Pas plus de trois choses à faire apparaitre sur le graphique

 Adaptez la taille de la police pour qu’elle soit visible

 Ne pas hésiter à rajouter un 3ème axe pour faire paraitre votre message

 Utiliser la bonne palette de couleurs


 Palette qualitative: si les données n’ont pas d’ordre
 Palette séquentielle: si les données vont du plus bas au plus haut
 Palette divergente: si la donnée contient une différence qualitative (exp:valeurs positives vs
négative)

Plus de détails ici:


[Link]
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 34
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Quelques librairies Python Matplotlib

Seaborn
Basemap

Leaflet

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 35
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
La théorie des réseaux
Un réseau est composé d’un certain nombre de nœuds.
Les nœuds sont connectés avec des liens.
Cette description peut être utile pour représenter un certain nombre de problèmes:
 Détection de fraude
 Sociologie
 Marketing

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 36
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
La théorie des réseaux
Les concepts les plus important d’un réseau sont:
 Degré d’un nœud : nombre de voisins
 Distance entre deux nœuds: nombre minimum de liens à parcourir ou arriver d’un nœud A à un
nœud B
 Boucle: des liens qui commencent et finissent au même nœud
 Nous pouvons appliquer des poids aux liens
 Les liens peuvent être orienté

Nœud de
degré 3

Boucle de
longueur 3

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 37
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
4. Construction des
features

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 38
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comprendre les données
Les questions à se poser :

 Est-ce que les variables sont continues, discrètes?


 Comment sont distribués les variables?
 Est-ce que la distribution dépend de l’échantillon considéré?
 Est-ce que la variable contient des valeurs manquantes?
 Est-ce qu’il y a des doublons?
 D’où vient la variable?
 Est-ce que la donnée est collectée en temps réel?
 A quelle date d’extraction correspond la donnée?

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 39
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Création de variables intuitives
 Variables temporelles
Matin, l’après midi, le soir, le weekend, jour férié

 RFM (Recency , Frequency,Monetary)


- Recency: A quelle date le client a effectué sont dernier achat
- Frequency: Combien de produits le client a acheté
- Monetaty: Le client a généré combien de revenues

 Transformer la variable
- Logarithme :Utilisé pour changer la forme de la distribution. Aide à réduire le coefficient de
symétrie
- Carré/racine cubique : Peut être appliqué aux valeurs nulles et négatives contrairement à une
transformation logarithmique …

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 40
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Transformer les variables
 Transformer les variables continues en classes:
Exp : La variable âge pourrait devenir: Jeune/Actif/Retraité

 Transformer les variables catégorielles en variables numériques


Encoder les occurrences ("A", "B", "C", "A") en (0, 1, 2, 0)

 Transformer les variables catégorielles en indicatrices


Une variable avec 3 occurrences deviendra 3 colonnes avec des 0/1

 L’algorithme va mieux fonctionner si les variables sont centrés autour de 0


Centrer et réduire les variables

 Dans le cas d’une série temporelle, essayer de capter l’emprunte de la série avec des statistiques:
Quantiles, Kurtosis, Skewness,

 Dans le cas d’une variable textuelle, extraire des caractéristiques identifiable


 Exp1 : Le début du texte commence avec le titre Mr/Mme/Chevalier ..
 Exp2: Evaluer l’importance d’un terme contenu dans un document, relativement à une collection
ou un corpus

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 41
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
5. Modélisation
prédictive

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 42
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Echantil on d’apprentissage et de validation
 Dans un modèle supervisé, nous avons toujours besoins de deux jeux de données
 Un set d’apprentissage pour entrainer le modèle
 Un set de validation pour tester les performances du modèle

 Nous divisons généralement notre jeux de données en 80%(entrainement) et 20%(validation)

 La division peut être faite selon d’autres méthodes:

 K-fold : Diviser tout le dataset aléatoirement en K groupes. A chaque fois nous entrainons le
modèle sur K-1 groupes puis testons pour le 𝐾𝐾 𝑖𝑖𝑖𝑖𝑖𝑖𝑖 qui reste. Nous mesurons après la
performance moyenne

 Stratified K-fold :La méme méthode que K-fold mais les groupes contiennent les mêmes
proportions de chaque label

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 43
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Biais et variance du modèle
Un modèle est un compromis entre:

 Un grand biais (le modèle n’est pas adapté)


Exemple : Une régression linéaire pour ajuster une parabole

 Une grande variance (sensible au changement de données) : Le modèle est très spécifique à la
donnée utilisée et modélise le bruit. Nous ne pouvons donc pas l’utiliser sur un autre jeux de
donnée

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 44
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Underfitting & Overfitting
Underfit (surapprentissage): Le modèle
est trop simple et n’arrive pas à expliquer
les donnée d’apprentissage

Overfit : Le modèle est trop complexe. Il


modélise le bruit des données
d’apprentissage et ne peut pas être
généralisé sur un autre jeux de donnée

 Un bon modèle est un compromis


entre le biais et la variance.
 Il doit être capable d’expliquer la
donnée d’apprentissage et d’être
appliqué sur un nouvelle base de
donnée.

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 45
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression linéaire (1/2)

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 46
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression linéaire (2/2)

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 47
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression logistique (1/3)
Quelle est l’influence du nombre d’heures passées à étudier sur la probabilité de réussite à un examen?

Nombre
d’heures des Nombre d’heures
étudiants qui des étudiants qui ont
ont échoué réussi

1
P(Y ) =
1 + e −(b0 +b1 X 1 +ε1 )

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 48
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression logistique (2/3)
Quel Seuil de probabilité choisir?

Seuil = 0.5

Faux négatifs

Vrais positifs

Vrais négatifs
Faux positifs

S(t) <0.5 S(t) >0.5


Prédiction : échouer Prédiction : réussite

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 49
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression logistique (3/3)
Le choix du seuil doit être discuté en priorité avec le business.
Il dépend du la problématique modélisée et aussi du budget alloué.

Pas de faux négatifs Pas de faux positifs

S(t) <0.15 S(t) >0.15 S(t) <0.85 S(t) >0.85


Prédiction Prédiction Prédiction Prédiction
: échouer : réussite : échouer : réussite
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 50
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Arbre de décision (1/2)
Cette méthode est utilisée pour la classification et la régression. Le but est de créer un modèle qui
prédit la valeur d’une variable cible en apprenant un ensemble de règles de décisions simples inférées
des données.
Les différentes décisions possibles sont situées aux extrémités des branches (le feuilles), et sont
atteintes en fonction des décisions prises à chaque étape.

A chaque nœud, un sous ensemble de variables est sélectionné aléatoirement et le couple


(variable,seuil) qui maximise la pureté de la branche est choisie

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 51
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Arbre de décision (2/2)
Un arbre d’autant meilleur que ses feuilles sont de classes homogènes. On souhaite alors définir une
mesure de l’hétérogénéité d’une feuille qui jouera le même rôle que la variance dans le cas de la
régression. Soient p1, …, pC les fréquences relatives des classes 1, …, C dans Tf, et c* la classe la plus
fréquent
Voici trois mesures fréquemment rencontrées dans la littérature:
Taux d’erreur : Taux d’erreurs de classification sur l’ensemble d’entrainement
Critère de Gini : Taux d’erreur sur l’ensemble d’entrainement d’un algorithme randomisé qui
retournerait la classe c avec la proba Pc (au lieu de toujours retourner la classe c*)
Entropie: Un estimateur de l’entropie de la classe d’une instance de Tf tirée uniformément au
hasard

Le modèle est :

 Facile à interpréter
 Facile à valider statistiquement
 Capable de gérer les variables numériques et catégorielles
 Capable de gérer le problème de sorties multiples

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 52
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Random forest (1/2)
L’idée de ce modèle est de combiner l’utilisation de plusieurs arbres de décisions.
 Plusieurs échantillons sont construits avec la donnée de base (avec remplacement)
 Sur chaque échantillon, un arbre de décision est entrainé
 La décision finale peut être la moyenne de chaque arbre ou la valeur la plus prédit
 On évite d’avoir un modèle très spécifique à la donnée d’entrainement
 Les arbre avec un nombre large de nœuds sont pénalisées

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 53
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Random forest (2/2)
Ce modèle vise à corriger plusieurs inconvénients connus de la méthode initiale, comme la sensibilité
des arbres uniques à l'ordre des prédicteurs, en calculant un ensemble de B arbres partiellement
indépendants.

Une présentation rapide de la proposition peut s'exprimer comme suit :

1. Créer B nouveaux ensembles d'apprentissage par un double processus d'échantillonnage :


1. sur les observations, en utilisant un tirage avec remise d'un nombre N d'observations identique
à celui des données d'origine (technique connue sous le nom de bootstrap),
2. et sur les p prédicteurs, en n'en retenant qu'un échantillon de cardinal 𝑚𝑚 < 𝑝𝑝 (la limite n'est
qu'indicative).
2. Sur chaque échantillon, on entraîne un arbre de décision selon une des techniques connues, en
limitant sa croissance par validation croisée.
3. On stocke les B prédictions de la variable d'intérêt pour chaque observation d'origine.
4. La prédiction de la forêt aléatoire est alors un simple vote majoritaire (Ensemble learning).

Le principal revers de cette méthode est que l'on perd l'aspect visuel des arbres de décision uniques

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 54
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Support Vector Machine: SVM
 Le but du modèle est de trouver la meilleur ligne de
séparation, tel que sa distance par rapport à chacun
des points classés soit maximale

 Ce modèle est robuste contre le sur-apprentissage et


les valeurs aberrantes

 Le « vecteur support » est caractérisé par les points de


frontière.

 Quand le modèle est entrainé, nous avons juste besoin


de stocker le vecteur support

 Grace à l’astuce du noyau(remplacer un espace de


grande dimension par une fonction noyau),un
classifieur linéaire peut facilement être transformé en
un classifieur non linéaire

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 55
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Clustering / apprentissage non supervisé
A partir des propriétés de la population, on trouve des groupes.
Les groupes ne sont pas connus en avance
Plusieurs algorithmes existent pour résoudre ce problème.

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 56
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Clustering / apprentissage non supervisé
K-means
Cet algorithme sépare la donnée en n groupes de variances égales en minimisant l’inertie.
Le nombre de classes est choisie par l’utilisateur.

Etapes :

Initialisation : Les centres K sont choisies aléatoirement


Etape 1: Affecter chaque point au centre le plus proche
Etape 2: Calculer la nouvelle position de chaque centre comme le centre de gravité du groupe.
Calculer la distance entre l’ancien et le nouveau centre

Itération : Répéter tant que la distance calculée à l’étape 2 soit est supérieur au seuil

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 57
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Clustering / apprentissage non supervisé
DBSCAN
Algorithme basé sur la densité dans la mesure qui s’appuis sur la densité estimée des clusters pour
effectuer le partitionnement.
 2 paramètres : ε et MinPts
 Le voisinage de chaque points jusqu’au rayon ε est analysé
 Les paramètres d'entrées sont donc une estimation de la densité de points des clusters
 Chaque point trouvé dans le voisinage appartient au même cluster
 Si le nombre de points est supérieur à MinPts, on retient le cluster. Sinon ,les points sont
considérés comme abérrants

Exemple:

- MinPts= 2 , ε = rayon du cercle


- Les points rouges, B et C appartiennent au même cluster
- N est tout seul dans son cluster, il est considéré comme
abérrant

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 58
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment choisir le bon algorithme
[Link]
[Link]

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 59
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Matrice de confusion
Pour une classification binaire, la matrice de confusion est fonction des prédictions et des valeurs
actuelles d’une variable cible.
Elle se présente comme suit:

Des métriques peuvent être construites en utilisant les champs de la matrice de confusion.

 Précision = TP/(TP+FP)
 Spécificité = TN/(TN+FP)
 Taux de vrais positifs = TP/(TP+FN)
 Taux de faux positifs = 1- Taux de vrais positifs

Exemple:
Prediction
+ -
 Précision = 87/(87+89) + 87 42
 Spécificité = 204/(204+89) Actuel
- 89 204

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 60
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Receive Operating Characteristic: ROC
Il s’agit d’un graphique représentant la performance d’un modèle sur une variable binaire.
Cette courbe présente le lien entre le taux de vrais positifs et de faux positifs à différents seuils

 Si on a un seuil élevé, le seuil du modèle est


priorisé. On demande à l’algorithme d’éviter de
classifier comme positifs les éléments qui sont
négatifs.

 Si on a un faible seuil, on est plus intéressé à ne


pas classer comme négatifs les éléments qui son
positifs.

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 61
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Area Under the Curve : AUC
Pour évaluer le modèle, il suffit de mesurer la surface sous la courbe.
La meilleur valeur d’AUC est égale à 1.

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 62
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Silhouette
C’est une méthode d’interprétation et de validation dans le cadre d’un clustering.

Elle mesure la similarité d’un objet par rapport à son cluster et par rapport aux autres clusters. Elle est
entre -1 et 1 tel que plus la elle élevée plus la configuration du clustering est meilleure.
La silhouette peut être calculée avec n’importe quelle métrique tel que la distance Euclidienne..

𝑏𝑏 − 𝑎𝑎
𝑠𝑠 =
max 𝑎𝑎, 𝑏𝑏
a : La moyenne de distance intra-cluster
b: La moyenne de la distance entre un échantillon et son plus proche cluster

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 63
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Autres
L’erreur quadratique moyenne (ou MSE) :
L ’erreur moyenne au carré réalisée entre le prédicteur sur la valeur réelle.
L’objectif est de minimiser cette métrique.
1 2
MSE = ∑𝑛𝑛𝑖𝑖=1 𝑦𝑦𝑖𝑖 − 𝑓𝑓 𝑥𝑥𝑖𝑖 avec n le nombre d’observations et p le nombre de paramètres
𝑛𝑛−𝑝𝑝−1
dans le modèle.
Root Mean Square Error (RMSE):

Mean Absolute Percentage Error (MAPE):


Log Loss:
Utilisée dans le cas d’une prédiction multinomiale. Elle quantifie la précision d’Un classifieur en pénalisant
les mauvaises [Link] le cas de deux labels, elle est exprimée comme suit

LL = -log P(yt|yp) = -(yt log(yp) + (1 - yt) log(1 - yp))

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 64
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Interprétation

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 65
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Les limites

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 66
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Annexes

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 67
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Plus d’information sur l’analyse de données avec Python
 Correction des exercices du module 1:
[Link]
[Link]

 Blog Actuariat et data science:


[Link]
 Guide complet pour le package Pandas:
[Link]
 Comparaison avec R:
[Link]
 Gestion des valeurs manquantes
[Link]
 Visualisation des données avec seaborn
[Link]
 Les dix règles pour avoir un bon graphique
[Link]
 Guide pour l’exploration des données
[Link]
 D’autres méthodes d’ échantillonnage
[Link]
 Mesures de performances
[Link]

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 68
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Entraînons-nous :Que s'est-il passé au bord du Titanic
Le naufrage Titanic est l'un des naufrages les plus infâmes dans
l'histoire. Le 15 avril 1912,lors de son voyage inaugural, le Titanic
a coulé après collision avec un iceberg, tuant 1502 victimes sur
2224 passagers et membres d'équipage. Cette tragédie
sensationnelle a choqué la communauté internationale et a
conduit à de meilleures règles de sécurité pour les navires.

Une des raisons pour lesquelles le naufrage s'est terminé dans un tel le désastre était qu'il n'y avait
pas assez de canots de sauvetage pour les passagers et membres d'équipage. Bien que la chance
était impliquée dans la survie au naufrage, certains groupes de personnes étaient plus susceptibles
de survivre que d'autres, comme les femmes, les enfants, et la classe supérieure.
Dans ce défi, nous vous demandons d'appliquer les outils de l'apprentissage automatique pour
prédire quels sont les passagers qui ont survécu à la tragédie

Lien vers le challenge:


[Link]

© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 69
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.

Vous aimerez peut-être aussi