Deep Reinforcement Learning Overview
Deep Reinforcement Learning Overview
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, M. Nau, S. Jaganathan, C. Liu, N. Maul, L. Folle,
K. Packhäuser, M. Zinnen
Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg
April 24, 2023
Outline
Reinforcement Learning
Markov Decision Processes
Policy Iteration
Other Solution Methods
1
This is not how gambling works
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 1
Sequential decision making: Multi-armed bandit problem
1
This is not how gambling works
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 1
Evaluative Feedback
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 2
Evaluative Feedback
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 2
Evaluative Feedback
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 2
Evaluative Feedback
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 2
Evaluative Feedback
t
X
1
Qt +1 (a) = ri
t
i =1
t −1
!
1 X
= rt + ri
t
i =1
t −1
!
1 1 X
= rt + ( t − 1) ri
t t −1 i =1
1
= (rt + (t − 1)Qt (a))
t
1
= (rt + t Qt (a) − Qt (a))
t
1
= Qt (a) + (rt − Qt (a))
t
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 3
Exploitation
1
If Qt is equal for two a, the tie has to be broken e.g. randomly
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 4
Exploitation
1
If Qt is equal for two a, the tie has to be broken e.g. randomly
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 4
Exploitation
1
If Qt is equal for two a, the tie has to be broken e.g. randomly
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 4
Exploitation Exploration
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 4
We sample discrete actions a from π(a), but what distributions can we use?
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 5
We sample discrete actions a from π(a), but what distributions can we use?
Uniform random
1
π(a) =
|A|
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 5
We sample discrete actions a from π(a), but what distributions can we use?
Uniform random
1
π(a) =
|A|
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 5
We sample discrete actions a from π(a), but what distributions can we use?
Uniform random
1
π(a) =
|A|
Softmax
eQt (a)/τt
π(a) = P|A|
n =1 eQt (an )/τt
So far we ...
• considered sequential decision making in a setting known as multi-armed
bandits
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 6
Summary
So far we ...
• considered sequential decision making in a setting known as multi-armed
bandits
• found out that estimating a function Q (a) and the greedy action selection
policy π(a) = maxQ (a) maximized our reward
a
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 6
Summary
So far we ...
• considered sequential decision making in a setting known as multi-armed
bandits
• found out that estimating a function Q (a) and the greedy action selection
policy π(a) = maxQ (a) maximized our reward
a
• learned that exploration of different actions is necessary
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 6
Summary
So far we ...
• considered sequential decision making in a setting known as multi-armed
bandits
• found out that estimating a function Q (a) and the greedy action selection
policy π(a) = maxQ (a) maximized our reward
a
• learned that exploration of different actions is necessary
• assumed rewards didn’t depend on a state of the world
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 6
Summary
So far we ...
• considered sequential decision making in a setting known as multi-armed
bandits
• found out that estimating a function Q (a) and the greedy action selection
policy π(a) = maxQ (a) maximized our reward
a
• learned that exploration of different actions is necessary
• assumed rewards didn’t depend on a state of the world
• and our action at time t doesn’t influence the rewards from a at t +1
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning April 24, 2023 6
Deep Reinforcement Learning - Part 2
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, M. Nau, S. Jaganathan, C. Liu, N. Maul, L. Folle,
K. Packhäuser, M. Zinnen
Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg
April 24, 2023
Reinforcement Learning
Associativity
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 8
Associativity
p(rt |st , at )
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 8
Associativity
p(rt |st , at )
p(st +1 |st , at )
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 8
Markov Decision Processes
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 9
Markov Decision Process
Agent
st +1 rt +1 at
Environment
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 10
Markov Decision Process
Agent
st +1 rt +1 at
Environment
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 10
Markov Decision Process
Agent
st +1 rt +1 at
Environment
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 10
Markov Decision Process
Agent
st +1 rt +1 at
Environment
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 10
Markov Decision Process
Agent
st +1 rt +1 at
Environment
+5
+10 B’
A’
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 11
A B
+5
+10 B’
A’
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 11
A B
+5
+10 B’
A’
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 12
Example policy
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 12
Example policy
T
X
max gt = γ k −t −1 rk
π(st ,at )
k =t +1
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 2 April 24, 2023 13
Deep Reinforcement Learning - Part 3
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, M. Nau, S. Jaganathan, C. Liu, N. Maul, L. Folle,
K. Packhäuser, M. Zinnen
Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg
April 24, 2023
Policy Iteration
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 15
• Before we used the action-value function Q (a)
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 16
• Before we used the action-value function Q (a)
• Now at has to depend on st
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 16
• Before we used the action-value function Q (a)
• Now at has to depend on st
: Use an oracle predicting the future reward gt following π(st , at ) from st
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 16
• Before we used the action-value function Q (a)
• Now at has to depend on st
: Use an oracle predicting the future reward gt following π(st , at ) from st
• We introduce the state-value function Vπ (s)
" T
#
X
Vπ (s) = Eπ [gt |st ] = Eπ γ k −t −1 rk |st
k =t +1
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 16
State-value Function Example
A B
+5
+10 B’
A’
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 17
State-value Function Example
The definition of the gridworld Vπ (s) for the uniform random policy
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 17
State-value Function Example
The definition of the gridworld Vπ (s) for the uniform random policy
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 17
State-value Function Example
The definition of the gridworld Vπ (s) for the uniform random policy
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 18
Action-value function
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 18
Are Value Functions Created Equal?
1
in a finite MDP
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 19
Are Value Functions Created Equal?
• No.
• There can only be one1 optimal V ∗ (s)
1
in a finite MDP
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 19
Are Value Functions Created Equal?
• No.
• There can only be one1 optimal V ∗ (s)
• We can state its existence without referring to a specific policy:
1
in a finite MDP
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 19
Are Value Functions Created Equal?
• No.
• There can only be one1 optimal V ∗ (s)
• We can state its existence without referring to a specific policy:
1
in a finite MDP
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 19
Optimal Value-function Example
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 20
Optimal Value-function Example
3.3 8.8 4.4 5.3 1.5 22.0 24.4 22.0 19.4 17.5
1.5 3.0 2.3 1.9 0.5 19.8 22.0 19.8 17.8 16.0
0.1 0.7 0.7 0.4 -0.4 17.8 19.8 17.8 16.0 14.4
-1.0 -0.4 -0.4 -0.6 -1.2 16.0 17.8 16.0 14.4 13.0
-1.9 -1.3 -1.2 -1.4 -2.0 14.4 16.0 14.4 13.0 11.7
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 20
Optimal Policies
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 21
Optimal Policies
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 21
Optimal Policies
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 21
Optimal Policies
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 21
Greedy Action Selection on V ∗ (s) or Q ∗ (s, a)
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 22
Greedy Action Selection on V ∗ (s) or Q ∗ (s, a)
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 22
A Tool to Compute Optimal Value-functions
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 23
A Tool to Compute Optimal Value-functions
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 23
Policy Evaluation
For all s ∈S
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 24
Policy Improvement
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 25
Policy Improvement
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 25
Policy Improvement
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 25
Policy Improvement
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 25
Policy Improvement
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 25
Policy Improvement
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 25
Policy Improvement Theorem
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 26
Policy Improvement Theorem
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 26
Policy Improvement Theorem
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 26
Policy Improvement Theorem
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 26
Policy Improvement Theorem
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 26
Policy Improvement Theorem
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 3 April 24, 2023 26
Policy Improvement Theorem
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, M. Nau, S. Jaganathan, C. Liu, N. Maul, L. Folle,
K. Packhäuser, M. Zinnen
Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg
April 24, 2023
Other Solution Methods
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 28
Limitations
• Both policy iteration and value iteration require using the updated policies
during learning to obtain better approximations to V ∗ (s)
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 29
Limitations
• Both policy iteration and value iteration require using the updated policies
during learning to obtain better approximations to V ∗ (s)
• For this reason we call them on-policy algorithms
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 29
Limitations
• Both policy iteration and value iteration require using the updated policies
during learning to obtain better approximations to V ∗ (s)
• For this reason we call them on-policy algorithms
• Additionally we assumed the state-transition pdf and reward pdf are known
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 29
Limitations
• Both policy iteration and value iteration require using the updated policies
during learning to obtain better approximations to V ∗ (s)
• For this reason we call them on-policy algorithms
• Additionally we assumed the state-transition pdf and reward pdf are known
• Can we relax this?
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 29
Limitations
• Both policy iteration and value iteration require using the updated policies
during learning to obtain better approximations to V ∗ (s)
• For this reason we call them on-policy algorithms
• Additionally we assumed the state-transition pdf and reward pdf are known
• Can we relax this?
• Yes. The methods differ mostly how they perform policy evaluation
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 29
Monte Carlo Techniques
Properties
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 30
Monte Carlo Techniques
Properties
Scheme
• Generate an episode by using some policy
• Loop backwards over the episode accumulating the expected future reward
gt = gt +1 + rt +1
• If a state was not yet visited append gt to a list returns(st )
1
PN
• Update Vst = n=1 returnsn (st )
N
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 30
Temporal Difference Learning
Properties
• On-policy
• Does not need information about dynamics of the environment
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 31
Temporal Difference Learning
Properties
• On-policy
• Does not need information about dynamics of the environment
Scheme
• Loop and follow π(st , at )
• Use a from π(st , at ), observe rt , st +1
• Update: Vt +1 (s) = Vt (s) + α [rt + γ Vt (st +1 ) − Vt (st )]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 31
Temporal Difference Learning
Properties
• On-policy
• Does not need information about dynamics of the environment
Scheme
• Loop and follow π(st , at )
• Use a from π(st , at ), observe rt , st +1
• Update: Vt +1 (s) = Vt (s) + α [rt + γ Vt (st +1 ) − Vt (st )]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 31
Q Learning
Properties
• Off-policy
• Temporal difference type of method
• Does not need information about dynamics of the environment
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 32
Q Learning
Properties
• Off-policy
• Temporal difference type of method
• Does not need information about dynamics of the environment
Scheme
• Loop and follow π(st , at ) derived from Qt (s, a) e.g. -greedy
• Use a from π(st , at ), observe rt , st +1
h i
• Update: Qt +1 (s, a) = Qt (st , at ) + α rt + γmaxQt (st +1 , at ) − Qt (st , at )
a
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 32
If you have Universal Function Approximators
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 33
If you have Universal Function Approximators
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 33
If you have Universal Function Approximators
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 4 April 24, 2023 33
Deep Reinforcement Learning - Part 5
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, M. Nau, S. Jaganathan, C. Liu, N. Maul, L. Folle,
K. Packhäuser, M. Zinnen
Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg
April 24, 2023
Deep Reinforcement Learning
Deep Q Learning
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 35
Atari Games: Human-level control through deep reinforcement
learning [4]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 36
Atari Games: Human-level control through deep reinforcement
learning [4]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 36
Learning Atari Games
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 38
Target Network
• Weight update:
h i
wt +1 = wt + α rt +1 + γ max q̂ (st +1 , a, wt ) − q̂ (st , at , wt ) · ∇wt q̂ (st , at , wt )
a
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 39
Target Network
• Weight update:
h i
wt +1 = wt + α rt +1 + γ max q̂ (st +1 , a, wt ) − q̂ (st , at , wt ) · ∇wt q̂ (st , at , wt )
a
γ max q̄ (st +1 , a, wt )
a
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 39
Experience Replay
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 40
Atari Breakout Example
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 41
AlphaGo
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 42
Mastering the game of Go with deep neural networks and tree
search [1]
Traditional Go board
Source: [Link]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 43
Challenges in Go
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 44
Challenges in Go
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 44
Challenges in Go (cont.)
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 45
Challenges in Go (cont.)
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 45
Mastering the game of Go with deep neural networks and tree
search [1]
• First improvement compared to a full tree search: Monte Carlo Tree Search
(MCTS)
• Networks to support efficient search through tree
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 46
Monte Carlo Tree Search
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 47
Monte Carlo Tree Search (cont.)
Algorithm:
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 48
Monte Carlo Tree Search (cont.)
• Tree policy guides in how far successful paths are frequented more often.
• Typical exploration/exploitation trade-off.
• Problem: Estimation via MCTS not accurate enough for Go.
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 49
Monte Carlo Tree Search (cont.)
• Tree policy guides in how far successful paths are frequented more often.
• Typical exploration/exploitation trade-off.
• Problem: Estimation via MCTS not accurate enough for Go.
• Ideas in AlphaGo:
• Control tree expansion by using a neural network to find promising actions.
• Improve value estimation by a neural network.
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 49
Deep Neural Networks for Go
Source: Mastering the game of Go with deep neural networks and tree search [1]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 50
Policy Network
• 13 conv-layers, one output for each point on the Go
board.
• Huge database of expert human moves (30 mio)
available.
• Start with supervised learning: Train network to
predict the next move in human expert plays
• Further train network with reinforcement learning by
playing against older versions of itself. Reward
when winning the game
• Older versions avoid correlation and instability
• Training time: 3 weeks on 50 GPUs + 1 day for RL
Source: Mastering the game of Go with deep neural networks and tree search [1]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 51
Value network
• Same architecture as policy network but just one
output node
• Goal: Estimate how likely the current state leads to
a win
• Training utilized self-play games of reinforcement
learned policy
: Trained using Monte-Carlo policy evaluation for 30
mio positions from these games
• Training time: 1 week on 50 GPUs
Source: Mastering the game of Go with deep neural networks and tree search [1]
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 52
Rollout policy network
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 53
AlphaGo Zero
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 54
AlphaGo Zero: Do we even need humans for training?
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 55
Next Time
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 57
Comprehensive Questions
• What is a policy?
• What are value functions?
• Explain the exploitation vs exploration dilemma.
• Describe typical solutions to the dilemma.
• What is the difference of a multi armed bandit problem to the full
reinforcement learning problem?
• Describe a Markov decision process.
• Is an optimal policy necessarily unique?
• What do the Bellman equations represent?
• Describe policy iteration.
• Why does policy iteration work?
• How can you beat your friends in every Atari game?
• How can one master the game of Go?
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 58
Further Reading
• Link - the one real reference for Reinforcement learning in its 2018 draft,
including Deep Q learning and Alpha Go details
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 59
References
References I
[1] David Silver, Aja Huang, Chris J Maddison, et al. “Mastering the game of Go
with deep neural networks and tree search”. In: Nature 529.7587 (2016),
pp. 484–489.
[2] David Silver, Julian Schrittwieser, Karen Simonyan, et al. “Mastering the
game of go without human knowledge”. In: Nature 550.7676 (2017), p. 354.
[3] David Silver, Thomas Hubert, Julian Schrittwieser, et al. “Mastering Chess
and Shogi by Self-Play with a General Reinforcement Learning Algorithm”. In:
arXiv preprint arXiv:1712.01815 (2017).
[4] Volodymyr Mnih, Koray Kavukcuoglu, David Silver, et al. “Human-level control
through deep reinforcement learning”. In: Nature 518.7540 (2015),
pp. 529–533.
[5] Martin Müller. “Computer Go”. In: Artificial Intelligence 134.1 (2002),
pp. 145–179.
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 59
References II
A. Maier, V. Christlein, K. Breininger, Z. Yang, L. Rist, A. Barnhill | Deep Reinforcement Learning - Part 5 April 24, 2023 59