Markov Decision Process ·
Value Iteration
un
seel
.com · Bellman backup · policy · reward
states
23
sweep
0
max Δ
—
backup
—
goal +1
pit −1
value V(s)
policy arrow π(s)
▶ Play
←
→
🔇 Unmute
Reset
Un
seel
.com · Markov Decision Process