0% ont trouvé ce document utile (0 vote)
5 vues57 pages

Method e SML

Le document présente une introduction au machine learning, en abordant son historique, les bases, ainsi que des méthodes telles que K-means et les arbres de décision. Il explique également les concepts d'apprentissage supervisé, non supervisé et par renforcement, ainsi que des techniques d'optimisation comme le Grid Search. Enfin, il discute des résultats obtenus par l'IA dans divers domaines, notamment la détection de cancer et le jeu de Go.

Transféré par

Zhoryasmine MAHDI
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
5 vues57 pages

Method e SML

Le document présente une introduction au machine learning, en abordant son historique, les bases, ainsi que des méthodes telles que K-means et les arbres de décision. Il explique également les concepts d'apprentissage supervisé, non supervisé et par renforcement, ainsi que des techniques d'optimisation comme le Grid Search. Enfin, il discute des résultats obtenus par l'IA dans divers domaines, notamment la détection de cancer et le jeu de Go.

Transféré par

Zhoryasmine MAHDI
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

INTRODUCTION AU MACHINE

LEARNING
FORMATION MACHINE LEARNING
VALÉRIE GAUTARD

FORMATION MACHINE LEARNING 1


FASCINANTE IA

FORMATION MACHINE LEARNING 2


SOMMAIRE
• Historique
• Les bases du ML
• Une méthode non supervisée : Kmean
• Les arbres de décision
• Ensemble learning

FORMATION MACHINE LEARNING 3


UN BREF HISTORIQUE (1) : 300 BC

• 387 BC, Platon suggère que le cerveau contrôle nos processus


mentaux
• 335 BC, Aristote
• invente le raisonnement inductif, méthode formelle de représentation
du raisonnement humain
• Pour lui, tout part du cœur…
Tous les hommes sont mortels
Les athéniens sont des hommes
Donc les Athéniens sont mortels

FORMATION MACHINE LEARNING 4


UN BREF HISTORIQUE (2) : LES ANNÉES 40

• 1942 : Alan Turing : Toute forme de raisonnement mathématique peut


être implémenté sur une machine
• 1943 : Mac Culloch et Pitts : neurone formel
• 1949 : Donald Hebb :

• Mécanismes de plasticités Logician workingin the field


of computational neuroscience
synaptique Neurophysiologist
• Base de l’adaptation des neurones and cybernetician

FORMATION MACHINE LEARNING 5


UN BREF HISTORIQUE (3) : LES ANNÉES 50
• 1950 :
• Test de Turing pour vérifier si un système est « intelligent » , indistinguable d’un humain

Faux Vrai

• Isaac Asimov invente les 3 (4) lois de la robotique


• 1955 : McCarthy et Marvin Minsky : père de l’IA
• 1956 : Conférence de Darmouth -> terme d’Intelligence artificielle
FORMATION MACHINE LEARNING 6
UN BREF HISTORIQUE (4) : LES ANNÉES 60
• 1965 : systèmes expert, logique floue

• 1966 : Chat bot Eliza

• 1969 : Premier hiver de l’IA après le livre de M. Minsky


FORMATION MACHINE LEARNING 7
UN BREF HISTORIQUE (5) : LES ANNÉES 80
• 1980 : K. Fukushima :
• premier réseau de neurone profond
• Inspiré de cortex visuel

• 1985 : Yann Le Cun


• 1986 : Hinton : back Propagation
• 1987 : 2ème hiver suite à l’article de Minsky & Papert

FORMATION MACHINE LEARNING 8


UN BREF HISTORIQUE (6) : LES ANNÉES 90
• 1995 : SVM:
• SVM
• 3eme hiver des réseaux de neurones

• 1997 : Deep Blue gagne G. Kaparov aux échecs

FORMATION MACHINE LEARNING 9


UN BREF HISTORIQUE (6) : LES ANNÉES 2010
Name of the Date Error on test set

• 2012 :
algorithm

Supervision 2012 15.3%

Clarifai 2013 11.7%

• Retour des réseaux de neurones profonds (ImageNet)


GoogLeNet

Humain level
2014 6.66%

5%
(Adrej Karpathy)

• Facebook : programme DeepFaceSVM Microsoft

Google
05/02/2015

02/03/2015
4.94%

4.82%

Baidu/ Deep Image 10/05/2015 4.58%

Shenzhen Institutes of 10/12/2015 3.57%


Advanced Technology, (le CNN a 152
Chinese Academy of couches!)
Sciences

Google Inception-v3 2015 3.5%


(Arxiv)

WMW (Momenta) 2017 2.2%

Now ?

• 2018 : Prix Turing à Hinton (google), Y. LeCun (facebook) et Y Bengio


FORMATION MACHINE LEARNING 10
QUELQUES RÉSULTATS (1)

• Segmentation
• Extraction des zones d’interet
• Détection de cancer
• Médecin spécialisé : 0.73
• IA : 0.89

FORMATION MACHINE LEARNING 11


QUELQUES RÉSULTATS (2) : LE JEU DE GO

• AlphaGo
• AlphaGo Zero
• Apprend avec les règles seulement

• AlphaZero

FORMATION MACHINE LEARNING 12


FORMATION MACHINE LEARNING 13
SOMMAIRE
• Historique
• Les bases du ML
• Une méthode non supervisée : Kmean
• Les arbres de décision
• Ensemble learning

FORMATION MACHINE LEARNING 14


IA, UNE DÉFINITION (1)
« la construc+on de programmes informa+ques
qui s’adonnent à des tâches qui sont, pour
l’instant, accomplies de façon plus sa6sfaisante
par des êtres humains car elles demandent des
processus mentaux de haut niveau tels que :
l’appren+ssage perceptuel, l’organisa+on de la
mémoire et le raisonnement cri+que »
FORMATION MACHINE LEARNING Marvin Minsky – 1927-2016 15
IA, UNE DÉFINITION (2)

• « On dit d’un programme informatique qu’il apprend une classe de tâches T de l'expérience E
avec une mesure de performance P si sa performance sur les tâches T, telles que mesurées par
P, s'améliore avec l'expérience E.’’

• L'apprentissage automatique est le domaine d'étude qui donne aux ordinateurs la capacité
d'apprendre sans être explicitement programmés

FORMATION MACHINE LEARNING 16


IA, UNE DÉFINITION (3)

L’étude scien+fique des algorithmes et des modèles


sta6s6ques que les ordinateurs u+lisent pour
accomplir une tâche sans instruc6on explicite, mais
plutôt en s’appuyant sur des mo+fs et de
l’inférence.
FORMATION MACHINE LEARNING 17
On ne sait pas toujours définir un algorithme explicite pour une tâche donnée …

… mais accès à des données massives à partir desquelles “apprendre”


à résoudre une tâche
FORMATION MACHINE LEARNING 18
THE DATA SCIENCE PROCESS (1/3)

FORMATION MACHINE LEARNING 19


THE DATA SCIENCE PROCESS (2/3)

FORMATION MACHINE LEARNING 20


THE DATA SCIENCE PROCESS (3/3)

FORMATION MACHINE LEARNING 21


CHOIX DE LA CLASSE DE FONCTIONS

FORMATION MACHINE LEARNING 22


CHOIX DE LA CLASSE DE FONCTIONS

FORMATION MACHINE LEARNING 23


CHOIX DE LA CLASSE DE FONCTIONS

FORMATION MACHINE LEARNING 24


CHOIX DE LA CLASSE DE FONCTIONS

FORMATION MACHINE LEARNING 25


SUR-ENTRAINEMENT/SOUS-ENTRAINEMENT

Trop de sur-entrainement (overfitting) / bon sur-entrainement (encore sous entrainement)


FORMATION MACHINE LEARNING 26
DIVERSITÉ DU ML

FORMATION MACHINE LEARNING 27


DIVERSITÉ DU ML : APPRENTISSAGE SUPERVISÉ

• Données avec label (étiquetées)


• On se donne des « data » :
N exemples
(x,y)1, (x,y)2, … , (x,y)N

x : feature
y : label

• On utilise des exemples avec des labels pour savoir si l’apprentissage est
efficace
• Exemple :
• Evaluer l’évolution du prix d’une maison
• Accord ou non d’un prêt
FORMATION MACHINE LEARNING 28
DIVERSITÉ DU ML : APPRENTISSAGE SUPERVISÉ

FORMATION MACHINE LEARNING 29


DIVERSITÉ DU ML : APPRENTISSAGE NON SUPERVISÉ
• Données non étiquetées
• score ne peut être calculé de manière certaine
• Découverte de la structure sous jacente
• Trouver des similarités sans avoir de catégories prédèfinies
• Exemple :
• classer des mails en spam, non spam
• classer des articles de journaux en rubrique

FORMATION MACHINE LEARNING 30


DIVERSITÉ DU ML : APPRENTISSAGE PAR
RENFORCEMENT
• Introduit en 1988 par Richard Sutton et en 19889
par Chris Watkins, publié en 1992
• Apprentissage en optimisant une récompense au
cours du temps
• Processus de décision Markovien
• Décision prise en associant l’etat courant à l’état
optimal
• Exemple :
• lRobotique
• Alpha Go zero

FORMATION MACHINE LEARNING 31


DIVERSITÉ DU ML : UN PAYSAGE VASTE

FORMATION MACHINE LEARNING 32


DIVERSITÉ DU ML : ET DE MULTIPLES MODELES

FORMATION MACHINE LEARNING 33


GRID SEARCH
• Annalyse basée sur des coupures
• Utilisé pour optimiser les hyper paramètres
• Approche simple basée sur des coupures autour de variables discriminantes
• Difficulté : comment optimiser les coupures ?

u Chaque variable est projeté dans chaque


dimension
u On applique des coupures :
x > xi , y > yi
u Nombre de points en fonction de la dimension

FORMATION MACHINE LEARNING 34


GRID SEARCH
• Chaque point est vu comme un grille
• Nombre de coupure est independant de la dimension
• on s’affranchi de la malédiction de la dimension

FORMATION MACHINE LEARNING 35


SOMMAIRE
• Historique
• Les bases du ML
• Une méthode non supervisée : Kmean
• Les arbres de décision
• Ensemble learning

FORMATION MACHINE LEARNING 36


K-MEAN

On choisit 3 villes On affecte les villes On calcule le barycentre


en minimisant la distance Cette fois le centre des classe
n’est pas un individu
FORMATION MACHINE LEARNING 37
K-MEAN

• Méthode non supervisée


• Méthode de partitionnement des données (clustering)

u Choisir Q centre de classe au hasard


u Affecter les points au centre le plus
proche
u Calculer le centre de gravite de chaque
classe

FORMATION MACHINE LEARNING 38


K-MEAN
• On itère :
• Affecter les points au centre le plus proche
• Calculer le centre de gravité de chaque classe
• On s’arrête quand les classes ne varient plus
• Avantage :
• Méthode rapide
• Inconvénients
• Il faut choisir à priori le nombre de classes
• Résultat qui dépendent des centres choisis à la 1ère étape
• Relancer plusieurs fois l’algo avec des centres différents

FORMATION MACHINE LEARNING 39


SOMMAIRE
• Historique
• Les bases du ML
• Une méthode non supervisée : Kmean
• Les arbres de décision
• Ensemble learning

FORMATION MACHINE LEARNING 40


ARBRE DE DÉCISION

• Méthode supervisée
Classification
• Classification ou régression
• Algorithme transparent Régression

FORMATION MACHINE LEARNING 41


ARBRE DE DÉCISION
• Exemple avec la base de données Iris
Sepal Sepal Petal Petal Espèce
Length width Length width
5.1 3.5 1.4 0.2 Iris setosa

7.0 3.2 4.7 1.4 Iris


versicolor
6.3 3.3 6.0 2.5 Iris virginica

FORMATION MACHINE LEARNING 42


Données Noeud
racine
ARBRE DE DÉCISION
Sepal length > 6

Sepal Sepal Petal Petal Espèce non oui


Length width Length width Noeud
5.1 3.5 1.4 0.2 Iris setosa
Iris setosa Petal length > 5
7.0 3.2 4.7 1.4 Iris
versicolor
non
6.3 3.3 6.0 2.5 Iris oui
virginica
Iris versicol Iris virginica

feuille
FORMATION MACHINE LEARNING 43
ARBRE DE DÉCISION
Sepal length > 6
probabilité d’appartenance à une classe
pop = [50, 50, 50]
pop = [nb setosa, nb versicolor, nb virginica]
non
oui

Iris setosa Petal length > 5 Par exemple :

pop = [50, 0, 0] pop = [0, 50, 50] Identifions une fleur avec un sépale de 6.5
cm et un pétale de 4 cm
Setosa : 0/54 = 0
Iris versicol Iris virginica Versicolor : 49/54 = 0.91
pop = [0, 49, 5] pop = [0, 1, 45] virginica : 5/54 = 0.09
FORMATION MACHINE LEARNING 44
ARBRE DE DÉCISION
Frontière de décision

Petal length

FORMATION MACHINE LEARNING 45


INDICE DE GINI
Sepal length > 6

pop = [50, 50, 50]


Gini = 0.667
non oui

Iris setosa Petal length > 5

pop = [50, 0, 0] pop = [0, 50, 50]


Gini = 0. Gini = 0.5

Iris versicol Iris virginica

pop = [0, 49, 5] pop = [0, 1, 45]


Gini = 0.168 Gini = 0.043
FORMATION MACHINE LEARNING 46
ARBRE DE DÉCISION, PURETÉ
• La pureté représente le cout du noeud

Sepal length > 6


pop = [50, 50, 50]
Gini = 0.667
non

Iris setosa Petal length > 5


pop = [50, 0, 0] pop = [0, 50, 50]
Gini = 0. Gini = 0.5
FORMATION MACHINE LEARNING 47
ARBRE DE DÉCISION, CHOIX DES NOEUDS
Sepal length > 6 Sepal length > 6
pop = [50, 50, 50] pop = [50, 50, 50]
Gini = 0.667 Gini = 0.667
non non
oui oui
Iris setosa Petal length > 5 Iris setosa Petal length > 5
pop = [50, 0, 0] pop = [0, 50, 50] pop = [50, 20, 0] pop = [0, 30, 50]
Gini = 0. Gini = 0.5 Gini = 0.41 Gini = 0.47

FORMATION MACHINE LEARNING 48


ARBRE DE DÉCISION

• Avantage :
• facile à entrainer
• facile à utiliser
• interprétable (algorithme transparent)

• Mais…
• peu précis
• généralisation qui manque de fiabilité

FORMATION MACHINE LEARNING 49


SOMMAIRE
• Historique
• Les bases du ML
• Une méthode non supervisée : Kmean
• Les arbres de décision
• Ensemble learning

FORMATION MACHINE LEARNING 50


ENSEMBLE LEARNING
• Entrainement de plusieurs petits modèles de ML pour en faire un modèle plus performant
• Variabilité inter et intraopérateur
• intra-operateur : variabilité pour un même opérateur
• Inter-opérateur : variabilité pour des opérateurs différents
• exemple
• segmentation de tumeur
• estimer le prix d’une maison

• Suppose que la résolution d’un problème est plus efficace par une foule que par un expert seul
• Hypothèse sur la foule :
• diversité
• indépendance
• décentralisation : les jugements s’additionnent, pas d’autorité supérieure pour décider

• Les méthodes d’ensemble learning utilisent plusieurs algorithmes d’apprentissage et prennent en compte les résultats de ces
modèles afin d’obtenir de meilleurs performances prédictives que les modèles pris séparément.

FORMATION MACHINE LEARNING 51


ENSEMBLE LEARNING, EXEMPLE

Index Modèle 1 Modèle 2 Modèle 3 Modèle 4 Modèle 5 Mélange


1 1 1 0 0 1 1
2 1 1 1 0 0 1
3 0 0 1 1 1 1
4 0 1 1 1 0 1
5 1 0 1 0 1 1
60% 60% 60% 60% 60% 100%

FORMATION MACHINE LEARNING 52


ENSEMBLE LEARNING

FORMATION MACHINE LEARNING 53


RANDOM FOREST
• Pour palier le problème de généralisation des arbres de décision, on utilise
plusieurs arbres de décision : Random Forest
• Bagging : On entraine l’arbre de décision seulement sur
• une partie des données
• une partie des variables

FORMATION MACHINE LEARNING 54


RANDOM FOREST
• Les étapes
• Répéter les étapes jusqu’à avoir le nombre d’arbres souhaité
• Créer un jeu de données (avec le bagging on peut prendre plusieurs fois les mêmes données).
La sélection aléatoire renforce la variabilité des arbres
• Entrainement de l’arbre
• Obtention d’une forêt d’arbres.
• On moyenne les résultats de la forêt d’arbres

FORMATION MACHINE LEARNING 55


BOOSTED TREE

FORMATION MACHINE LEARNING 56


REMERCIEMENTS

• Yann Coadou – CPPM


• Geoffrey Daniel – CEA-Saclay
• Marc Duranton – CEA-Saclay

FORMATION MACHINE LEARNING 57

Vous aimerez peut-être aussi