4D Snake RL: all evaluated networks
MaskablePPO and behaviour-cloned 4D snake networks (2^4, 3^4, 4^4 boards) with configs, evaluation files and cards; negative results included.
Reinforcement Learning • Updated • 21Note 2^4 board: completion 0.877 +- 0.041 (argmax), fill 0.987, 34.4 steps; MaskablePPO trained from scratch, no curriculum, 5,000,000 environment steps.
BurnyCoder/4d-snake-exp02b-ppo-2x4-backplay
Reinforcement Learning • Updated • 18Note 2^4 board: completion 0.850 +- 0.029 (argmax), fill 0.980, 34.6 steps; MaskablePPO trained from scratch, Backplay reverse curriculum (gate 0.2, window 8), 5,000,000 environment steps.
BurnyCoder/4d-snake-exp02c-ppo-2x4-long
Reinforcement Learning • Updated • 19Note 2^4 board: completion 0.933 +- 0.005 (argmax), fill 0.991, 35.7 steps; MaskablePPO trained from scratch, no curriculum, 20,000,000 environment steps.
BurnyCoder/4d-snake-exp02d-ppo-2x4-backplay-strict
Reinforcement Learning • Updated • 25Note 2^4 board: completion 0.963 +- 0.009 (argmax), fill 0.994, 43.5 steps; MaskablePPO trained from scratch, Backplay reverse curriculum (gate 0.9, window 4), 5,000,000 environment steps.
BurnyCoder/4d-snake-exp03a-ppo-3x4-nocur
Reinforcement Learning • Updated • 20Note 3^4 board: completion 0.000 +- 0.000 (argmax), fill 0.566; MaskablePPO trained from scratch, no curriculum, 30,000,000 environment steps.
BurnyCoder/4d-snake-exp03b-ppo-3x4-backplay
Reinforcement Learning • Updated • 25Note 3^4 board: completion 0.000 +- 0.000 (argmax), fill 0.549; MaskablePPO trained from scratch, Backplay reverse curriculum (gate 0.9, window 4), 30,000,000 environment steps.
BurnyCoder/4d-snake-exp03c-ppo-3x4-backplay-relaxed
Reinforcement Learning • Updated • 27Note 3^4 board: completion 0.000 +- 0.000 (argmax), fill 0.542; MaskablePPO trained from scratch, Backplay reverse curriculum (gate 0.8, window 8), 30,000,000 environment steps.
BurnyCoder/4d-snake-exp04-ppo-4x4
Reinforcement Learning • Updated • 25Note 4^4 board: completion 0.000 +- 0.000 (argmax), fill 0.401; MaskablePPO trained from scratch, Backplay reverse curriculum (gate 0.8, window 16), 100,000,000 environment steps.
BurnyCoder/4d-snake-exp05-bc-4x4
Reinforcement Learning • Updated • 29Note 4^4 board: completion 1.000 +- 0.000 (argmax), fill 1.000, 16,447.8 steps; behaviour cloning of the Hamiltonian route follower (`snake4d imitate`).
BurnyCoder/4d-snake-exp05b-ppo-4x4-from-bc
Reinforcement Learning • Updated • 32Note 4^4 board: completion 1.000 +- 0.000 (argmax), fill 1.000, 16,413.6 steps; MaskablePPO fine-tuned from the behaviour-cloned network, no curriculum, 20,000,000 environment steps.