Snake RL Play A snake agent trained from scratch with Dueling Double DQN. PyTorch, 28-dim egocentric state, target network, 256-unit network. Greedy eval mean: 102.