Introduction à la Data Science avec Python
Introduction à la Data Science avec Python
Data Science
avec python
Module 2
La couverture charte.
Visuels avec point de focus
entre 5% et 20%
Best pratices de l’image
Accompagnée d’un bandeau
vertical à 10%
Avril 2018
[Link]
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 1
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Rappel module 1 (1/2)
Les algorithmes ne sont pas destinés au même usage. On les classe usuellement selon deux
composantes:
Compréhension
Compréhension Préparation des
des besoins du Modélisation Evaluation Déploiement
des données données
business
[Link]élisation prédictive 42
Annexes 66
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 5
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
1. Collecte des données
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 6
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Structure de donnée
Comma Separated Value (CSV)
Structure de donnée la plus simpliste: Ensemble de valeurs qui sont séparées par une virgule (ou tout
autre séparateur comme tabulation, point virgule ..)
Peut être généré à partir d’Excel
Entête
Séparateur
Data
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 7
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Structure de donnée
JavaScript Object Notation (JSON)
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 8
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Structure de donnée
Hypertext Markup Language (HTML) et Extensible Markup Language (XML)
On peut généralement les trouver sur les applications web
Les éléments sont entourés par des tags d’ouverture et de fermeture
Exemple : <div> DU TEXTE </div>
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 9
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation d’API
C’est quoi une API
Serveur client
Généralement, nous pouvons accéder à la donnée sur un serveur (exp: Twitter) grâce à une API.
Le résultat est généralement retourné en format json.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 10
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation d’API
Exemples
API de réseaux sociaux: Twitter
[Link]
Vous pouvez télécharger les tweets par utilisateur ,sujet, temps.. En format json
Vous pouvez analyser le contenu d’un tweet
Généralement, nous avons besoin d’un algorithme de NLP (Natural Language Processing) pour
extraire l’information
D’autres informations peuvent être exploitées
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 11
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation d’API
Exemples
API de transport: RATP et SNCF
[Link]
[Link]
Ils donnent des informations comme les positions GPS des stations, les itinéraires, les retards et
modifications ..
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 12
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation de données open source
Données du gouvernement Français
Programme open data du gouvernement français
[Link]
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 13
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : Utilisation de données open source
Autres
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 14
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : extraire les données du web
Le web scraping est une technique d’extraction du contenu de sites Web, via un script ou un
programme, dans le but de le transformer pour permettre son utilisation dans un autre contexte.
L’extraction et suivi d’une transformation de la données non structurée du site (sous le format HTML) en
une donnée structurée.
Le Web scraping peut être contraire aux termes d’utilisation de quelques sites.
La réglementation peut varier d’un pays à un autre.
Il faut utiliser cette technique avec précaution.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 15
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : extraire les données du web
Exemple d’utilisation : Weather underground
[Link]
Vous pouvez normalement extraire les données de n’importe quel site web.
Les résultats sont généralement sous le format XML ou en HTML
Exemple de données:
[Link]
html?req_city=New%20York&req_state=NY
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 16
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Enrichir nos données : extraire les données du web
Traitement de la donnée : Weather underground Exemple de tags à
enlever
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 17
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Dataframe, l’objet essentiel pour l’analyse des données
Un dataframe est une table avec une entête et des données.
Le package Pandas de Python gère parfaitement les dataframes.
Chaque colonne peut contenir des variable de différents types. Les plus utilisés sont :
Numériques : variables numériques (entier, décimal,..)
Catégorielles : des chaines de caractère
Date/temps : timestamp (date et temps), Unix (nombre de secondes depuis 01 Janvier 1970
UTC
Booléen : True/False
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 18
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Dataframe, l’objet essentiel pour l’analyse des données
Nous pouvons sélectionner la donnée par colonne ou par ligne.
Les opérations sous python sont comparables à celle du SQL : Split,groupby,apply …
[Link]
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 19
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Jointure de dataframes
Plus de détails ici:
[Link]
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 20
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
2. Nettoyage des données
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 21
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment gérer les valeurs manquantes
La présence de valeurs manquantes est une problématique classique quand on aborde un projet
d’analyse de données.
Ces valeurs sont généralement représentés par NaN.
Plusieurs approches peuvent être appliquées pour détourner ce problème.
VALEURS MANQUANTES
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 22
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment gérer les valeurs manquantes
Remplacer par la moyenne
Si les données sont assez homogènes, l’approche intuitive serait de remplacer par la moyenne de toutes
les autres valeurs.
[Link](method = ‘mean’)
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 23
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Valeurs manquantes et outliers
Remplacer par la médiane
Si on n’a pas beaucoup de valeurs aberrantes, le remplacement par la médiane fonctionne.
OUTLIER
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 24
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Valeurs manquantes pour les séries temporelles
remplacement forward/backward
Dans certains cas, remplacer par la moyenne/médiane ne fonctionne pas.
Si les données ont une structure temporelle, chaque point est similaire à ses voisins.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 25
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment gérer les valeurs manquantes
L’essentiel
NaN (Not a Number) est le résultat d’un valeur manquante ou d’autres problèmes
1ère approche: Enlever la ligne manquantes, mais vous allez perdre d’autres informations sur la ligne
2ème approche: Remplacer par la moyenne, mais il faut faire attention aux valeurs aberrantes
3ème approche: Remplacer par la médiane, mais attention aux séries temporelles
5ème approche: Une valeur manquante est aussi une information. Vous pouvez rajouter une nouvelle
colonnes (indicatrice) qui indique s’il manque une information ou pas
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 26
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
3. Visualisation des
données
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 27
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment choisir le bon graphique?
Le bon graphique dépend en premier lieu de la données
Il n’y a pas de solution unique
Dans cet exemple, la même donnée est représentée avec deux graphiques différents et le résultat est
complétement différent.
Le choix du graphique dépend du message qu’on veut faire apparaitre.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 28
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Violin plot (1/2)
Avec ce graphique nous avons beaucoup d’informations sur la distribution des données …
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 29
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Violin plot (2/2)
.. Et nous pouvons même exploiter la symétrie
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 30
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Box plot
Les mêmes informations peut être générées avec le box plot
Outliers
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 31
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
La famil es des histogrammes
Il existe plusieurs méthodes de
représentation des histogrammes. Il
peuvent être :
Empilés
Groupés
Superposés
Cumulatifs …
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 32
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Exemple de différents graphiques
Heatmap
Une variable est représentée par une couleur sur un espace de deux dimensions
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 33
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Recette pour avoir un bon graphique
Mettre une description (label et unité) et un titre au graphique
Ne pas hésiter à rajouter un 3ème axe pour faire paraitre votre message
Seaborn
Basemap
Leaflet
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 35
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
La théorie des réseaux
Un réseau est composé d’un certain nombre de nœuds.
Les nœuds sont connectés avec des liens.
Cette description peut être utile pour représenter un certain nombre de problèmes:
Détection de fraude
Sociologie
Marketing
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 36
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
La théorie des réseaux
Les concepts les plus important d’un réseau sont:
Degré d’un nœud : nombre de voisins
Distance entre deux nœuds: nombre minimum de liens à parcourir ou arriver d’un nœud A à un
nœud B
Boucle: des liens qui commencent et finissent au même nœud
Nous pouvons appliquer des poids aux liens
Les liens peuvent être orienté
Nœud de
degré 3
Boucle de
longueur 3
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 37
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
4. Construction des
features
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 38
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comprendre les données
Les questions à se poser :
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 39
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Création de variables intuitives
Variables temporelles
Matin, l’après midi, le soir, le weekend, jour férié
Transformer la variable
- Logarithme :Utilisé pour changer la forme de la distribution. Aide à réduire le coefficient de
symétrie
- Carré/racine cubique : Peut être appliqué aux valeurs nulles et négatives contrairement à une
transformation logarithmique …
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 40
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Transformer les variables
Transformer les variables continues en classes:
Exp : La variable âge pourrait devenir: Jeune/Actif/Retraité
Dans le cas d’une série temporelle, essayer de capter l’emprunte de la série avec des statistiques:
Quantiles, Kurtosis, Skewness,
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 41
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
5. Modélisation
prédictive
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 42
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Echantil on d’apprentissage et de validation
Dans un modèle supervisé, nous avons toujours besoins de deux jeux de données
Un set d’apprentissage pour entrainer le modèle
Un set de validation pour tester les performances du modèle
K-fold : Diviser tout le dataset aléatoirement en K groupes. A chaque fois nous entrainons le
modèle sur K-1 groupes puis testons pour le 𝐾𝐾 𝑖𝑖𝑖𝑖𝑖𝑖𝑖 qui reste. Nous mesurons après la
performance moyenne
Stratified K-fold :La méme méthode que K-fold mais les groupes contiennent les mêmes
proportions de chaque label
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 43
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Biais et variance du modèle
Un modèle est un compromis entre:
Une grande variance (sensible au changement de données) : Le modèle est très spécifique à la
donnée utilisée et modélise le bruit. Nous ne pouvons donc pas l’utiliser sur un autre jeux de
donnée
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 44
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Underfitting & Overfitting
Underfit (surapprentissage): Le modèle
est trop simple et n’arrive pas à expliquer
les donnée d’apprentissage
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 45
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression linéaire (1/2)
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 46
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression linéaire (2/2)
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 47
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression logistique (1/3)
Quelle est l’influence du nombre d’heures passées à étudier sur la probabilité de réussite à un examen?
Nombre
d’heures des Nombre d’heures
étudiants qui des étudiants qui ont
ont échoué réussi
1
P(Y ) =
1 + e −(b0 +b1 X 1 +ε1 )
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 48
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression logistique (2/3)
Quel Seuil de probabilité choisir?
Seuil = 0.5
Faux négatifs
Vrais positifs
Vrais négatifs
Faux positifs
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 49
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Régression logistique (3/3)
Le choix du seuil doit être discuté en priorité avec le business.
Il dépend du la problématique modélisée et aussi du budget alloué.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 51
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Arbre de décision (2/2)
Un arbre d’autant meilleur que ses feuilles sont de classes homogènes. On souhaite alors définir une
mesure de l’hétérogénéité d’une feuille qui jouera le même rôle que la variance dans le cas de la
régression. Soient p1, …, pC les fréquences relatives des classes 1, …, C dans Tf, et c* la classe la plus
fréquent
Voici trois mesures fréquemment rencontrées dans la littérature:
Taux d’erreur : Taux d’erreurs de classification sur l’ensemble d’entrainement
Critère de Gini : Taux d’erreur sur l’ensemble d’entrainement d’un algorithme randomisé qui
retournerait la classe c avec la proba Pc (au lieu de toujours retourner la classe c*)
Entropie: Un estimateur de l’entropie de la classe d’une instance de Tf tirée uniformément au
hasard
Le modèle est :
Facile à interpréter
Facile à valider statistiquement
Capable de gérer les variables numériques et catégorielles
Capable de gérer le problème de sorties multiples
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 52
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Random forest (1/2)
L’idée de ce modèle est de combiner l’utilisation de plusieurs arbres de décisions.
Plusieurs échantillons sont construits avec la donnée de base (avec remplacement)
Sur chaque échantillon, un arbre de décision est entrainé
La décision finale peut être la moyenne de chaque arbre ou la valeur la plus prédit
On évite d’avoir un modèle très spécifique à la donnée d’entrainement
Les arbre avec un nombre large de nœuds sont pénalisées
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 53
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Random forest (2/2)
Ce modèle vise à corriger plusieurs inconvénients connus de la méthode initiale, comme la sensibilité
des arbres uniques à l'ordre des prédicteurs, en calculant un ensemble de B arbres partiellement
indépendants.
Le principal revers de cette méthode est que l'on perd l'aspect visuel des arbres de décision uniques
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 54
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Support Vector Machine: SVM
Le but du modèle est de trouver la meilleur ligne de
séparation, tel que sa distance par rapport à chacun
des points classés soit maximale
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 55
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Clustering / apprentissage non supervisé
A partir des propriétés de la population, on trouve des groupes.
Les groupes ne sont pas connus en avance
Plusieurs algorithmes existent pour résoudre ce problème.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 56
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Clustering / apprentissage non supervisé
K-means
Cet algorithme sépare la donnée en n groupes de variances égales en minimisant l’inertie.
Le nombre de classes est choisie par l’utilisateur.
Etapes :
Itération : Répéter tant que la distance calculée à l’étape 2 soit est supérieur au seuil
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 57
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Clustering / apprentissage non supervisé
DBSCAN
Algorithme basé sur la densité dans la mesure qui s’appuis sur la densité estimée des clusters pour
effectuer le partitionnement.
2 paramètres : ε et MinPts
Le voisinage de chaque points jusqu’au rayon ε est analysé
Les paramètres d'entrées sont donc une estimation de la densité de points des clusters
Chaque point trouvé dans le voisinage appartient au même cluster
Si le nombre de points est supérieur à MinPts, on retient le cluster. Sinon ,les points sont
considérés comme abérrants
Exemple:
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 58
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Comment choisir le bon algorithme
[Link]
[Link]
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 59
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Matrice de confusion
Pour une classification binaire, la matrice de confusion est fonction des prédictions et des valeurs
actuelles d’une variable cible.
Elle se présente comme suit:
Des métriques peuvent être construites en utilisant les champs de la matrice de confusion.
Précision = TP/(TP+FP)
Spécificité = TN/(TN+FP)
Taux de vrais positifs = TP/(TP+FN)
Taux de faux positifs = 1- Taux de vrais positifs
Exemple:
Prediction
+ -
Précision = 87/(87+89) + 87 42
Spécificité = 204/(204+89) Actuel
- 89 204
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 60
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Receive Operating Characteristic: ROC
Il s’agit d’un graphique représentant la performance d’un modèle sur une variable binaire.
Cette courbe présente le lien entre le taux de vrais positifs et de faux positifs à différents seuils
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 61
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Area Under the Curve : AUC
Pour évaluer le modèle, il suffit de mesurer la surface sous la courbe.
La meilleur valeur d’AUC est égale à 1.
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 62
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Silhouette
C’est une méthode d’interprétation et de validation dans le cadre d’un clustering.
Elle mesure la similarité d’un objet par rapport à son cluster et par rapport aux autres clusters. Elle est
entre -1 et 1 tel que plus la elle élevée plus la configuration du clustering est meilleure.
La silhouette peut être calculée avec n’importe quelle métrique tel que la distance Euclidienne..
𝑏𝑏 − 𝑎𝑎
𝑠𝑠 =
max 𝑎𝑎, 𝑏𝑏
a : La moyenne de distance intra-cluster
b: La moyenne de la distance entre un échantillon et son plus proche cluster
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 63
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Mesure de performance
Autres
L’erreur quadratique moyenne (ou MSE) :
L ’erreur moyenne au carré réalisée entre le prédicteur sur la valeur réelle.
L’objectif est de minimiser cette métrique.
1 2
MSE = ∑𝑛𝑛𝑖𝑖=1 𝑦𝑦𝑖𝑖 − 𝑓𝑓 𝑥𝑥𝑖𝑖 avec n le nombre d’observations et p le nombre de paramètres
𝑛𝑛−𝑝𝑝−1
dans le modèle.
Root Mean Square Error (RMSE):
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 64
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Interprétation
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 65
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Les limites
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 66
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Annexes
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 67
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Plus d’information sur l’analyse de données avec Python
Correction des exercices du module 1:
[Link]
[Link]
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 68
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.
Entraînons-nous :Que s'est-il passé au bord du Titanic
Le naufrage Titanic est l'un des naufrages les plus infâmes dans
l'histoire. Le 15 avril 1912,lors de son voyage inaugural, le Titanic
a coulé après collision avec un iceberg, tuant 1502 victimes sur
2224 passagers et membres d'équipage. Cette tragédie
sensationnelle a choqué la communauté internationale et a
conduit à de meilleures règles de sécurité pour les navires.
Une des raisons pour lesquelles le naufrage s'est terminé dans un tel le désastre était qu'il n'y avait
pas assez de canots de sauvetage pour les passagers et membres d'équipage. Bien que la chance
était impliquée dans la survie au naufrage, certains groupes de personnes étaient plus susceptibles
de survivre que d'autres, comme les femmes, les enfants, et la classe supérieure.
Dans ce défi, nous vous demandons d'appliquer les outils de l'apprentissage automatique pour
prédire quels sont les passagers qui ont survécu à la tragédie
© 2018 KPMG S.A., société anonyme d'expertise comptable et de commissariat aux comptes, membre français du réseau KPMG constitué de cabinets indépendants adhérents de KPMG International 69
Cooperative, une entité de droit suisse. Tous droits réservés. Le nom KPMG et le logo sont des marques déposées ou des marques de KPMG International.