0% ont trouvé ce document utile (0 vote)
9 vues5 pages

4 Model Free Methods (Policy Based Methods)

L'algorithme REINFORCE est une méthode de contrôle par gradient de politique utilisant Monte-Carlo pour optimiser les paramètres d'une politique probabiliste. L'approche Actor-Critic combine un acteur qui apprend la politique et un critique qui évalue cette politique à l'aide de l'erreur de Temporal Difference. Proximal Policy Optimization (PPO) vise à limiter les changements excessifs de politique tout en garantissant une amélioration efficace grâce à une pénalisation implicite.

Transféré par

abirjanatiidrissi20
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd
0% ont trouvé ce document utile (0 vote)
9 vues5 pages

4 Model Free Methods (Policy Based Methods)

L'algorithme REINFORCE est une méthode de contrôle par gradient de politique utilisant Monte-Carlo pour optimiser les paramètres d'une politique probabiliste. L'approche Actor-Critic combine un acteur qui apprend la politique et un critique qui évalue cette politique à l'aide de l'erreur de Temporal Difference. Proximal Policy Optimization (PPO) vise à limiter les changements excessifs de politique tout en garantissant une amélioration efficace grâce à une pénalisation implicite.

Transféré par

abirjanatiidrissi20
Copyright
© All Rights Reserved
Nous prenons très au sérieux les droits relatifs au contenu. Si vous pensez qu’il s’agit de votre contenu, signalez une atteinte au droit d’auteur ici.
Formats disponibles
Téléchargez aux formats PDF, TXT ou lisez en ligne sur Scribd

REINFORCE : Monte-Carlo Policy-Gradient Control

L'algorithme REINFORCE est une méthode de contrôle par gradient de politique basée sur
Monte-Carlo. Il appartient à la famille des algorithmes de policy gradient, qui optimisent
directement les paramètres d'une politique probabiliste en maximisant les récompenses cumulées.
Actor-Critic

Description Générale :

L'algorithme Actor-Critic combine deux composants principaux :

1. L'Actor : Responsable de l'apprentissage de la politique. Il choisit les actions à exécuter à


partir des états en fonction d'une politique paramétrée.
2. Le Critic : Responsable de l'évaluation de la politique de l'Actor. Il estime la valeur des
actions en utilisant une erreur de Temporal Difference (TD).

Avantage de l'Action (Advantage Function) :


L'Advantage est défini comme la différence entre la valeur Q(S,A) et la valeur V(S) :

Cette fonction mesure combien une action spécifique est meilleure ou pire que la valeur
moyenne des actions possibles dans cet état.
Proximal Policy Optimization (PPO)
PPO est une méthode d'optimisation des politiques dans le cadre de l'apprentissage par
renforcement. Son objectif principal est de limiter les changements excessifs entre la politique
actuelle de l'agent et la nouvelle politique qu'il apprend, tout en garantissant une amélioration
efficace.

Limitation des Mises à Jour Excessives

PPO introduit une pénalisation implicite pour limiter les mises à jour excessives de la politique :

 L'objectif est d'éviter que les changements dans la politique soient trop importants, ce qui
pourrait déstabiliser l'apprentissage.
 Cette pénalisation est réalisée grâce à une fonction de clip qui impose une limite à rt(θ).

Vous aimerez peut-être aussi