Deep Reinforcement Learning
Dans quelle mesure peut-on apprendre aux systèmes à
percevoir et agir dans ce monde à partir des Données ?
Pile de tâches qu'un système d'IA doit effectuer
• Environnement : monde dans lequel le système fonctionne.
• Capteur : détecté par des capteurs qui captent le monde et le
convertissent en données brutes pouvant être perçues par la
machine. Entrée pour les robots opérant dans le monde.
• Données du capteur : les données brutes extraites par les
capteurs.
• Extraction de fonctionnalités : les fonctionnalités sont extraites
des données du capteur. La structure est extraite des données de
telle sorte que vous puissiez saisir, discriminer, séparer et
comprendre les données.
Les données sensorielles brutes sont traitées, dans plusieurs
abstractions d'ordre supérieur. Le Deep Learning automatise
cette tâche qui était auparavant effectuée par des experts
humains.
• Nous formons des représentations d'ordre supérieur sur la base
desquelles les techniques de ML peuvent être appliquées.
• Une fois que les techniques de ML convertissent les données en
informations simples et exploitables, nous regroupons ces
informations en connaissances. Les réseaux de Deep Learning
sont capables d'effectuer des tâches d'apprentissage supervisé,
des tâches génératives et des techniques non supervisées. La
connaissance est simple et propre, avec des valeurs utilisables. Il
peut s'agir de valeurs uniques, de discours, d'images, etc.
• Nous construisons une taxonomie, une bibliothèque de
connaissances. Nous connectons les idées.
• Les agents raisonnent en fonction de la taxonomie : connecte les
données du passé et perçoit le monde, définit un plan en
fonction de l'objectif. (Objectif, ici pourrait être la fonction
Récompense).
Planification : la fusion des informations du capteur et la
réalisation d'actions sont plus réparables à l'approche DL.
• Puisqu’il fonctionne dans le monde réel, il doit disposer
d’effecteurs capables d’agir dans le monde réel.
Quelle part de la pile d’IA peut être « apprise » ?
Nous pouvons apprendre la représentation et la connaissance. NN
mappe les données en informations, les méthodes du noyau sont
également efficaces ici.
C'est là que DL brille que la cartographie des données des bons capteurs
vers les connaissances.
Question ouverte : Pouvons-nous étendre cela au raisonnement et aux
informations exploitables de bout en bout ?
Q2 : Pouvons-nous étendre cela à des cas réels de SDC et de robotique ?
Types d'apprentissage profond
• Supervisé : chaque point de données est étiqueté par les
humains.
• Non supervisé : les données ne sont pas étiquetées.
• Apprentissage semi-supervisé : Certaines données sont
annotées par des humains.
• Apprentissage par renforcement : RL est une sous-catégorie de
l'apprentissage semi-supervisé.
Objectif : apprendre à partir de données de
récompense/supervisées rares et profiter du fait qu'une
dynamique temporelle est suivie d'un état à l'autre, qui peut se
propager dans le temps pour déduire des connaissances sur la
réalité basées sur des données précédentes. Nous pouvons
généraliser les rares informations d’apprentissage sur le monde
réel.
Motivation philosophique pour l'apprentissage par
renforcement
Apprentissage supervisé : mémorisation des données de vérité terrain
afin de former des représentations qui généralisent à partir de la vérité
terrain.
Apprentissage par renforcement : Brute-Force propage les informations
rares dans le temps pour attribuer une récompense de qualité à un état
qui n'a pas directement de récompense. Donner un sens au monde
lorsque les données/récompenses sont rares, mais sont connectées dans
le temps. C'est l'équivalent du raisonnement.
Agent et environnement
La connexion dans le temps est modélisée comme :
Il y a un agent, effectuant une action dans l'environnement, qui reçoit un
nouvel état et une récompense. Ce processus se poursuit encore et
encore.
Exemples:
• Atari Breakout : L'agent est la pagaie.
Chaque action entreprise par l’agent a une influence sur
l’évolution de l’environnement. Le succès est mesuré par un
mécanisme de récompense total. Ici, les points sont donnés par
le jeu. Le schéma doit être normalisé d'une manière
interprétable par le système. Le but est de maximiser l’objectif.
• Équilibrage chariot-poteau :
Objectif : Problème continu d'équilibrage du poteau sur le
dessus du chariot en mouvement.
État : Angle, verlocité angulaire, vitesse horizontale du chariot.
Actions : Force horizontale vers le chariot.
Récompense : 1 à chaque pas de temps si le poteau est debout.
• Tous les jeux de tir à la première personne
Doom : Objectif : éliminer tous les adversaires.
État : Pixels bruts du jeu
• Robotique Industrielle :
Conditionnement de bacs à l'aide d'un robot.
Objectif : Choisir une boîte et la mettre dans un conteneur.
État : Pixels bruts du monde.
• Processus de décision de Markov : action-récompense-état
jusqu'à ce que l'état terminal soit reçu.
Principaux composants d'un agent RL
1 ou plusieurs d'entre eux :
• Politique : Plan du type d'action à réaliser dans chaque État.
• Fonction de valeur : Sens de ce qui constitue un bon état dans
lequel se trouver et de ce qui constitue une bonne action qui
peut être effectuée.
• Modèle : Représentation du Monde par l'Agent.
Ex : Robot dans une pièce
Approche déterministe : le chemin le plus court doit être choisi.
Non déterministe
Observation clé : chaque État de l'espace doit avoir un plan pour
contrôler l'environnement non déterministe.
Si la fonction de récompense est conçue de telle sorte que chaque étape
soit pénalisée, la politique optimale dans ce cas serait de choisir le
chemin le plus court.
Si l'on réduit la pénalité, le caractère aléatoire des mouvements est
autorisé.
Si nous transformons la récompense en +ve pour le mouvement, il y a
une incitation accrue à rester sur le plateau sans terminer.
Fonction de valeur :
La valeur de l’état de l’environnement est la récompense que nous
sommes susceptibles de recevoir à l’avenir. Ceci est déterminé en
actualisant la remise future.
Gamma : Réduit l’importance des objectifs futurs.
Une bonne stratégie consiste à maximiser la somme des objectifs futurs
actualisés.
Q-Apprentissage :
Nous utilisons n'importe quelle politique pour estimer l'état qui
maximise la récompense future.
Cela nous permet de considérer un espace d’état et un espace d’action
beaucoup plus grands.
Nous passons à la simulation en prenant des mesures et en mettant à
jour notre estimation de la qualité des actions.
Exploration contre exploitation :
À mesure qu’une meilleure estimation est formée de la fonction Q, nous
avons une meilleure idée des meilleures actions qui peuvent être
effectuées. Ce n’est pas encore parfait, donc l’exploration a une
valeur. Plus l’estimation s’améliore, plus la valeur de l’exploration est
faible.
Donc, au départ, nous souhaitons explorer davantage et réduire cela avec
le temps, à mesure que nos estimations deviennent plus précises.
Le système final devrait donc fonctionner de manière gourmande selon la
fonction Q.
Pour une représentation tabulaire de la fonction Q.
L’axe Y correspond aux états, l’axe X aux actions.
Le tableau est initialisé de manière aléatoire et il est mis à jour avec
l'équation de Bellman, au fil du temps l'approximation devient le tableau
approprié.
Problème : lorsque la Q-Table croît de façon exponentielle. Ex :
Utilisation des entrées Pixel du monde réel/du jeu. L'espace d'états
potentiels, les états combinatoires possibles, sont plus grands que ce que
la mémoire système peut contenir, plus grands que ce qui peut être
estimé à l'aide de l'équation de Bellman.
RL profond :
NN est vraiment bon en estimation.
DL : nous permet d'approcher des valeurs sur un espace d'état beaucoup
plus grand que ML. Cela nous permet de traiter les valeurs brutes des
données sensorielles, mais est beaucoup plus capable de traiter des
applications du monde réel ; c'est généralisable.
La compréhension vient de la conversion des informations sensorielles
brutes en informations simples et utiles sur la base desquelles des
mesures peuvent être prises.
Au lieu de la fonction Q, nous branchons un NN.
Entrée : espace d’état.
Sortie : Valeur de la fonction que chaque état peut prendre.
DQN : Réseau Q profond.
Comment est formé un DQN ?
L'équation Bellman saisit la récompense et réduit les récompenses
futures.
Fonction de perte pour NN : prend la récompense reçue dans l'état
actuel, effectue une passe avant via le NN pour calculer la valeur de l'état
futur et la soustrait de la passe avant pour l'état d'action actuel.
Nous prenons la différence entre la valeur estimée par Q-Function
Estimator (NN) estime la valeur future et quelle sera la valeur possible en
fonction des actions possibles.
Algorithme:
Entrée : État en action
Sortie : valeur Q pour chaque action.
Étant donné une transition S, une action a qui génère une récompense r'
et passe à l'état S'.
La mise à jour consiste à effectuer une transmission anticipée via
Netowork pour l'état actuel, à effectuer une transmission anticipée pour
toutes les actions possibles dans l'état suivant et à mettre à jour les poids
à l'aide de la rétropropagation.
Astuces DQN :
Replay d'expérience :
lorsque les jeux sont joués par simulation, les observations sont
collectées dans une bibliothèque d'expériences et la formation est
effectuée en échantillonnant aléatoirement les expériences précédentes
par lots. Afin que le système ne surajuste pas une évolution particulière
de la simulation.
Réseau cible fixe :
nous utilisons un NN pour estimer la valeur de l'état actuel dans la paire
d'actions et la suivante, l'utilisant ainsi plusieurs fois. Au fur et à mesure
que nous réalisons le réseau, nous mettons à jour le réseau. Ainsi, la
fonction cible à l’intérieur de la fonction de perte change, ce qui pose des
problèmes de stabilité. Nous réparons donc le réseau et ne le mettons à
jour que toutes les 1 000 étapes.
Au fur et à mesure que nous entraînons le réseau, le réseau utilisé pour
estimer la fonction cible reste fixe, ce qui entraîne une fonction de perte
stable.
Reward Clipping :
vrai pour les systèmes fonctionnant de manière généralisée. Ceux-ci
simplifient les fonctions de récompense, qu'elles soient positives ou
négatives.
Sauter des images :
effectuer 1 action toutes les 4 images.
Cercle : Lorsque la technique est utilisée.
Cross : Technique non utilisée.
Plus le nombre est élevé, plus la récompense reçue est grande.
Conclusion : Replaying Target apporte des améliorations significatives
aux récompenses.
Algorithme Deep Q-Learning :
Remarque : La boucle ne fait pas partie de l'entraînement, c'est la partie
de sauvegarde de l'observation, de l'état, de l'action, de la récompense et
de l'état suivant dans la mémoire de relecture.
Ensuite, nous échantillonnons aléatoirement dans la mémoire pour
entraîner le réseau en fonction d'une fonction de perte. La probabilité :
Epsilon, est la probabilité d'exploration, qui diminue avec le temps.
2015 : Atari Breakout
DQN a surperformé sur de nombreux jeux Atari.
AlphaGo (2016) :
Remarque : Les conditions légales possibles du conseil d'administration
à tout moment = 2,8x10^(170)
Utilisation du jeu de position d'expert humain pour semer de manière
supervisée, approche RL pour battre les experts humains.
Opinion (biaisée) : Réalisation de la décennie en IA, AlphaGo Zero
(2017) :
• Il a été développé sans aucune donnée de formation.
• Battez AlphaGo.
Approche AlphaGo :
Utilisez MTCS : Recherche arborescente Monte-Carlo.
Étant donné, un grand espace d'état. Nous commençons par un tableau,
les mouvements sont choisis avec un certain équilibre Exploration Vs
Exploitation, jusqu'à ce qu'une conclusion soit atteinte. Ces informations
sont rétropropagées et nous apprenons la valeur des positions sur le
tableau en jeu.
AlphGo a utilisé un réseau neuronal pour « Intuition » pour estimer la
qualité des états.
Des trucs:
• Utilisation du MCTS basé sur la prédiction NN pour estimer la
qualité des états futurs. Il effectue une simple action
d'anticipation, effectue une correction cible pour produire une
fonction de perte.
• Apprentissage multi-tâches : le réseau est « à deux têtes »
1. Il génère la probabilité de mouvements optimaux.
2. Il estime également la probabilité de gagner.
• Nous voulons combiner les meilleurs mouvements à court terme
et atteindre des positions avec une forte probabilité de gain.
• Architecture mise à jour : Resnet (gagnant d'ImageNet)
Trafic profond
Consultez le didacticiel officiel ici
Caractéristiques v2 :
• Nous pouvons réaliser des formations multi-agents (jusqu'à 10
voitures)
• (Cool Addition) Personnalisation des images de voitures.
Objectif : atteindre la vitesse moyenne la plus élevée au fil du temps.
Route : espace de grille, une grille d'occupation : lorsqu'elle est vide, elle
est définie sur la valeur ab-Grid, quelle que soit la vitesse réalisable.
Avec d'autres voitures sur la grille : La valeur dans la grille est la vitesse
des voitures qui se déplacent plus lentement.
Nous pouvons décider de la partie que nous souhaitons utiliser comme
entrée dans le réseau.
Le Système de Sécurité peut être considéré comme un équivalent du
Basic MPC : Basic Sensors permettant la prévention des collisions.
Tâche : Se déplacer dans l'espace sous les contraintes du système de
sécurité.
Rouge : Espaces inaccessibles.
Objectif : Ne pas rester coincé dans le trafic.
Entrée : espace d’état.
Résultat : Valeur des différentes actions.
Sur la base des valeurs Epsilon et par formation, évaluation d'inférence :
Nous choisissons l'étendue de l'exploration.
5Espace d'action
Le « cerveau » prend comme entrée l’état. La récompense effectue une
passe avant et calcule la récompense. Le « cerveau » est l'endroit où le
NN est contenu à la fois pour la formation et l'évaluation.
Nouvel ajout : nombre d'agents pouvant être contrôlés par le NN, allant
de 1 à 10. L'évaluation se déroule de la même manière.
Remarque : Les agents ne sont pas conscients de la présence d'autres
agents. Les actions sont gourmandes pour chaque agent individuel et non
de manière distribuée optimisée.
Évaluation:
• Collecte de 45 secondes simulées de chaque course.
• Une médiane de 500 exécutions est calculée.
• Évaluation côté serveur.
• Le caractère aléatoire a été considérablement réduit.
L'approche RL est-elle modifiable pour apprendre avec
l'humain dans la boucle ?
• Nous pouvons explorer les données des conducteurs.
• Les tests dans le monde réel ne sont pas réalisables.
Le RL le plus réussi n'implique pas le Deep RL :
• Boston Robotique
• Waymo :
DL est utilisé dans Perception.
La plupart du travail est effectué à l'aide de capteurs.
Des approches basées sur des modèles sont utilisées.
Re : Poches locales inattendues de récompenses élevées
Ceux-ci apparaissent dans tous les exemples lorsqu’ils sont appliqués au
monde réel.
Sécurité de l'IA :
• Découvrez comment les algorithmes de RL Planning peuvent
évoluer de manière inattendue.
• Comment pouvons-nous les contraindre ? Pour les forcer à
fonctionner de manière sûre.