AutoWorldModel-Bench тестирует, могут ли агенты кодирования улучшить модели мира
В новом препринте arXiv представлен эталон для оценки агентов кодирования как исследователей открытых моделей мира в восьми игровых средах, сообщающих об улучшениях в 63 из 64 сеансов.