AutoWorldModel-Bench Tests Whether Coding Agents Can Improve World Models
A new arXiv preprint introduces a benchmark for evaluating coding agents as open-ended world-model researchers across eight game environments, reporting improvements in 63 of 64 sessions.