AutoWorldModel-Bench prueba si los agentes codificadores pueden mejorar los modelos mundiales
Una nueva preimpresión de arXiv presenta un punto de referencia para evaluar agentes de codificación como investigadores de modelos mundiales abiertos en ocho entornos de juego, informando mejoras en 63 de 64 sesiones.