El documento ArXiv propone capacitación basada en hitos para agentes LLM de largo horizonte
MileGPO utiliza el descubrimiento de hitos y evidencia local para mejorar la asignación de créditos al capacitar a agentes de modelos lingüísticos en tareas largas y de varios pasos. Los autores informan resultados de última generación en ALFWorld y WebShop, pero las afirmaciones se limitan a los experimentos del artículo.