AutoWorldModel-Bench test of codeeragenten wereldmodellen kunnen verbeteren
Een nieuwe arXiv-voordruk introduceert een benchmark voor het evalueren van codeeragenten als open-end wereldmodelonderzoekers in acht game-omgevingen, waarbij verbeteringen worden gerapporteerd in 63 van de 64 sessies.