El punto de referencia de Thinkingbox encuentra que los agentes de IA tienen dificultades para completar de manera confiable los flujos de trabajo comerciales con estado
Un nuevo artículo de arXiv presenta Thinkingbox, un entorno de pruebas y punto de referencia para probar agentes de IA en tareas comerciales de varios pasos. El modelo probado más sólido logró una puntuación de aprobado@1 del 65,36 %, pero solo una puntuación de aprobado^20 del 25,25 %, lo que resalta la brecha entre el éxito ocasional y la ejecución confiable.