REINFORCE : Monte-Carlo Policy-Gradient Control
L'algorithme REINFORCE est une méthode de contrôle par gradient de politique basée sur
Monte-Carlo. Il appartient à la famille des algorithmes de policy gradient, qui optimisent
directement les paramètres d'une politique probabiliste en maximisant les récompenses cumulées.
Actor-Critic
Description Générale :
L'algorithme Actor-Critic combine deux composants principaux :
1. L'Actor : Responsable de l'apprentissage de la politique. Il choisit les actions à exécuter à
partir des états en fonction d'une politique paramétrée.
2. Le Critic : Responsable de l'évaluation de la politique de l'Actor. Il estime la valeur des
actions en utilisant une erreur de Temporal Difference (TD).
Avantage de l'Action (Advantage Function) :
L'Advantage est défini comme la différence entre la valeur Q(S,A) et la valeur V(S) :
Cette fonction mesure combien une action spécifique est meilleure ou pire que la valeur
moyenne des actions possibles dans cet état.
Proximal Policy Optimization (PPO)
PPO est une méthode d'optimisation des politiques dans le cadre de l'apprentissage par
renforcement. Son objectif principal est de limiter les changements excessifs entre la politique
actuelle de l'agent et la nouvelle politique qu'il apprend, tout en garantissant une amélioration
efficace.
Limitation des Mises à Jour Excessives
PPO introduit une pénalisation implicite pour limiter les mises à jour excessives de la politique :
L'objectif est d'éviter que les changements dans la politique soient trop importants, ce qui
pourrait déstabiliser l'apprentissage.
Cette pénalisation est réalisée grâce à une fonction de clip qui impose une limite à rt(θ).