AutoWorldModel-Bench teste si les agents de codage peuvent améliorer les modèles mondiaux
Une nouvelle prépublication arXiv introduit une référence pour évaluer les agents de codage en tant que chercheurs de modèles mondiaux ouverts dans huit environnements de jeu, rapportant des améliorations dans 63 des 64 sessions.