PRAGATI ENGINEERING COLLEGE :: SURAMPALEM
Department of CSE (AI & ML)
IV Year I Semester Subject: Reinforcement Learning
Assignment – I
[Link] Question BTL CO Outcomes
1. Define Reinforcement Learning? Explain with various examples. K1 CO1
2. Explain about A k-armed Bandit Problem with an example. K1 CO1
3. Explain about Action-value methods with an example. K1 CO1
4. Explain about 10-armed Testbed with an example. K1 CO1
5. Explain Incremental Implementation? Explain about Tracking a Non- K1 CO1
stationary Problem.
6. Explain Optimistic Initial Values? Explain Gradient Bandit Algorithm with K1 CO1
an example.
Assignment – II
[Link] Question BTL CO Outcomes
1. Discuss about the Agent-Environment Interface with examples. K1 CO2
2. Discuss about the various Goals and Rewards with examples. K1 CO2
3. Explain about Unified Notation for Episodic and Continuing Tasks. K1 CO2
4. Define Dynamic Programming? Explain about Policy Evaluation, Policy K1 CO2
Improvement, Policy Iteration.
5. Explain about Value Iteration, Asynchronous Dynamic Programming. K2 CO2
6. Explain about Generalized Policy Iteration in Dynamic Programming. K2 CO2
Discuss about the efficiency of Dynamic Programming.
Assignment – III
[Link] Question BTL CO Outcomes
1. Define Monte Carlo Prediction. Explain about Monte Carlo Estimation of K1 CO3
Action Values with examples.
2. Explain about Monte Carlo Control, Monte Carlo Control without K1 CO3
Exploring Starts with examples.
3. Explain about Off-policy Prediction via Importance Sampling, Incremental K2 CO3
Implementation.
4. Explain about Discontinuing-aware Importance Sampling with examples. K2 CO3
5. Define Per-decision Importance Sampling n-step Bootstrapping. Explain K1 CO3
about n-step TD Prediction.
6. Explain A Unifying Algorithm: n-step Q(σ) with an example. K2 CO3
Assignment – IV
[Link] Question BTL CO Outcomes
1. Explain about examples of Off-policy Divergence. K1 CO4
2. Define Semi-gradient Methods and the Deadly Triad with examples. K1 CO4
3. Explain about Linear Value-function Geometry, Gradient Descent in the K2 CO4
Bellman Error with examples.
4. Explain about the Bellman Error is not Learnable. K2 CO4
5. Explain about (i)The λ-return, (ii) TD(λ), (iii) n-step Truncated λ-return K3 CO4
methods, (iv) Online λ –return Algorithm
6. Explain about Dutch Traces in (i) Monte Carlo Learning, (ii) Sarsa(λ), K2 CO4
(iii) Variable λ and γ with examples.
Assignment – V
[Link] Question BTL CO Outcomes
1. Explain Policy Approximation and its Advantages. K1 CO5
2. Explain about the Policy Gradient Theorem. K1 CO5
3. Explain about REINFORCE - Monte Carlo Policy Gradient with example. K2 CO5
4. Discuss about REINFORCE with Baseline and Actor-Critic Methods. K2 CO5
5. Discuss about TD-Gammon and explain about Samuel’s Checkers Player. K1 CO5
6. Discuss about Watson’s Daily Double-Wagering and Optimizing Memory K2 CO5
Control with examples.