AutoWorldModel-Bench перевіряє, чи можуть агенти кодування покращити світові моделі
Новий препринт arXiv представляє еталон для оцінки агентів кодування як відкритих дослідників світової моделі у восьми ігрових середовищах, повідомляючи про покращення в 63 із 64 сеансів.