O benchmark Thinkingbox revela que os agentes de IA lutam para concluir de maneira confiável fluxos de trabalho de negócios com estado
Um novo artigo do arXiv apresenta o Thinkingbox, um sandbox e benchmark para testar agentes de IA em tarefas de negócios de várias etapas. O modelo testado mais forte alcançou uma pontuação de aprovação@1 de 65,36%, mas apenas uma pontuação de aprovação^20 de 25,25%, destacando a lacuna entre o sucesso ocasional e a execução confiável.