GraphEcho: Avaliando Agentes Gráficos LLM
GraphEcho testa se os agentes LLM confundem encontros repetidos com corroboração adicional. GraphEcho é um benchmark projetado para avaliar agentes gráficos de modelo de linguagem grande (LLM). Ele testa se esses agentes conseguem distinguir entre encontros repetidos e corroboração adicional. O benchmark varia a contagem de caminhos…