AutoWorldModel-Bench testuje, zda kódovací agenti mohou zlepšit světové modely
Nový předtisk arXiv představuje měřítko pro hodnocení kódovacích agentů jako výzkumníků světového modelu s otevřeným koncem v osmi herních prostředích, přičemž hlásí zlepšení v 63 z 64 relací.