Markov Decision Process · Value Iteration
unseel.com · Bellman backup · policy · reward
states 23
sweep 0
max Δ
backup
goal +1
pit −1
value V(s)
policy arrow π(s)
Unseel.com · Markov Decision Process