Markov Decision Process · Value Iteration
unseel.com · Bellman backup · policy · reward
states 23
sweep 0
max Δ —
backup —
goal +1
pit −1
value V(s)
policy arrow π(s)
Unseel.com · Markov Decision Process