Temporal-Difference Learning · TD(0)
unseel.com · bootstrapping · value function · learn before the game ends
state
TD error δ 0.00
updates 0
V(s) ← V(s) + α[r + γV(s′) − V(s)]
value estimate V(s)
agent · current state s
TD error δ (surprise)
true value Vπ (target)
Unseel.com · Temporal-Difference Learning