Reinforcement Learning
MDPs, value functions and policy gradients — how agents learn from reward
25 cards · first 3 free · flip each card to test yourself
04
Policies
PixelBank Premium
05
Value Functions
PixelBank Premium
06
Exploration vs Exploitation
PixelBank Premium
07
The Markov Property
PixelBank Premium
08
Markov Decision Processes
PixelBank Premium
09
Bellman Expectation Equations
PixelBank Premium
10
Optimality & the Bellman Optimality Equation
PixelBank Premium
11
Iterative Policy Evaluation
PixelBank Premium
12
Policy Improvement
PixelBank Premium
13
Policy Iteration vs Value Iteration
PixelBank Premium
14
Monte Carlo Methods
PixelBank Premium
15
Temporal-Difference Learning
PixelBank Premium
16
n-step Returns & TD(λ)
PixelBank Premium
17
SARSA vs Q-Learning
PixelBank Premium
18
Maximization Bias & Double Q-Learning
PixelBank Premium
19
Function Approximation & the Deadly Triad
PixelBank Premium
20
Deep Q-Networks
PixelBank Premium
21
Experience Replay
PixelBank Premium
22
Target Networks
PixelBank Premium
23
Policy Gradients & REINFORCE
PixelBank Premium
24
Baselines, Advantage & GAE
PixelBank Premium
25
Actor-Critic & PPO
PixelBank Premium