Temporal-Difference Learning ·
TD(0)
un
seel
.com · bootstrapping · value function · learn before the game ends
state
—
TD error δ
0.00
updates
0
V(s) ← V(s) + α[r + γV(s′) − V(s)]
value estimate V(s)
agent · current state s
TD error δ (surprise)
true value Vπ (target)
▶ Play
←
→
🔇 Unmute
Reset
Un
seel
.com · Temporal-Difference Learning