AutoWorldModel-Bench тества дали кодиращите агенти могат да подобрят световните модели
Нов предпечат на arXiv въвежда бенчмарк за оценка на кодиращите агенти като изследователи на отворен модел на света в осем игрови среди, отчитайки подобрения в 63 от 64 сесии.