PIXELBANKv8.2.0
Menu
All Concept Cards

Reinforcement Learning

MDPs, value functions and policy gradients — how agents learn from reward

25 cards · first 3 free · flip each card to test yourself

04

Policies

PixelBank Premium

05

Value Functions

PixelBank Premium

06

Exploration vs Exploitation

PixelBank Premium

07

The Markov Property

PixelBank Premium

08

Markov Decision Processes

PixelBank Premium

09

Bellman Expectation Equations

PixelBank Premium

10

Optimality & the Bellman Optimality Equation

PixelBank Premium

11

Iterative Policy Evaluation

PixelBank Premium

12

Policy Improvement

PixelBank Premium

13

Policy Iteration vs Value Iteration

PixelBank Premium

14

Monte Carlo Methods

PixelBank Premium

15

Temporal-Difference Learning

PixelBank Premium

16

n-step Returns & TD(λ)

PixelBank Premium

17

SARSA vs Q-Learning

PixelBank Premium

18

Maximization Bias & Double Q-Learning

PixelBank Premium

19

Function Approximation & the Deadly Triad

PixelBank Premium

20

Deep Q-Networks

PixelBank Premium

21

Experience Replay

PixelBank Premium

22

Target Networks

PixelBank Premium

23

Policy Gradients & REINFORCE

PixelBank Premium

24

Baselines, Advantage & GAE

PixelBank Premium

25

Actor-Critic & PPO

PixelBank Premium