Coach panel
Rewards
Agent
goal
pit
agent
high value
low value
→ = learned best move
Episode
0
Steps
0
Success
0%
ε now
0.30
Avg reward
0.00
Reward per episode
Coach a neural-network agent to find the goal — by trial, error, and reward.