AutoWorldModel-Bench testet, ob Codierungsagenten Weltmodelle verbessern können
Ein neuer arXiv-Preprint führt einen Maßstab für die Bewertung von Codierungsagenten als offene Weltmodellforscher in acht Spielumgebungen ein und berichtet über Verbesserungen in 63 von 64 Sitzungen.