Voltar às notícias
InovaçãoInstruções AI Understanding

Agentic ESOpt propõe ajuste fino de menos memória para agentes de IA de longo horizonte

Um artigo arXiv apresenta Agentic ESOpt, uma estrutura de estratégia de evolução proposta para ajustar agentes de modelo de linguagem de longo horizonte com memória GPU em nível de inferência. Os autores relatam ganhos para Qwen-3.5-27B no WebArena-Lite e melhorias em 28 das 36 configurações de otimização imediata.

7 min readRead the primary source
Source-provided image accompanying Agentic ESOpt proposes lower-memory fine-tuning for long-horizon AI agents
Documento de origem primáriaFonte registrada
Editora
arxiv.org
Link da fonte
arxiv.orghttps://arxiv.org/abs/2608.17310
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Memória (memória do agente)
Contexto armazenado que um agente de IA usa em etapas ou sessões para melhorar a continuidade.
Afinação
Treinamento contínuo em dados específicos de domínio para adaptar um modelo pré-treinado a uma tarefa específica.
Ajuste fino com eficiência de parâmetros (PEFT)
Métodos que adaptam modelos treinando um pequeno subconjunto de parâmetros adicionados.
Teste você mesmoQuestionário sobre agentes de IA

O que aconteceu

Um artigo arXiv de seis autores apresentado em 18 de agosto de 2026, propõe Agentic ESOpt, uma estrutura de ajuste fino de parâmetros completos para agentes de modelo de linguagem de longo horizonte. Em vez de usar aprendizagem por reforço baseada em retropropagação, o método amostra perturbações de parâmetros, avalia os agentes resultantes com recompensas e aplica atualizações online ponderadas por recompensa. Ele também usa um cronograma de decaimento de cosseno para a escala de perturbação e suporta a coevolução de parâmetros e prompts do modelo ou outro contexto de tarefa. Os autores relatam que a otimização de parâmetros completos do Qwen-3.5-27B melhorou a linha de base Sem Habilidade em 6,69% ​​no WebArena-Lite, enquanto a coevolução de parâmetros imediatos melhorou uma linha de base correspondente em 28 das 36 configurações de design heurístico automático em tempo de teste.

O artigo, intitulado “Agentic ESOpt: Agentes LLM de longo horizonte de ajuste fino com requisitos mínimos de GPU”, é listado pelo arXiv em aprendizado de máquina e foi submetido na versão um em 18 de agosto de 2026. Seus autores são Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh e Wee Sun Lee. O artigo aborda um problema específico de treinamento: os agentes muitas vezes precisam tomar uma longa sequência de decisões, interagir com ferramentas ou ambientes e receber recompensas que podem ser escassas ou atrasadas. Os autores argumentam que essas condições dificultam o ajuste fino da aprendizagem por reforço convencional, especialmente quando o modelo é grande.

A alternativa proposta são estratégias de evolução, ou ES. De acordo com o resumo, o Agentic ESOpt amostra perturbações em torno dos parâmetros atuais do modelo de linguagem, executa os agentes resultantes, mede suas recompensas e usa essas recompensas para fazer uma atualização online ponderada por recompensa. O método é descrito como otimização de parâmetros completos, em vez de uma abordagem que atualiza apenas um pequeno adaptador ou camada selecionada. Os autores dizem que o ES requer apenas memória GPU mínima em nível de inferência para este processo de otimização, que eles apresentam como uma forma de dimensionar o ajuste fino para modelos maiores sem as demandas de memória de uma pilha pesada de retropropagação.

Agentic ESOpt foi projetado para alterar os parâmetros do modelo e o contexto da tarefa. O resumo descreve isso como uma coevolução flexível de parâmetro-contexto e fornece a evolução do espaço imediato como exemplo, incluindo otimização de habilidades e computação em tempo de teste. O método também introduz um cronograma de decaimento de cosseno para a escala de perturbação, escrito como sigma na fonte. Em termos práticos, o cronograma pretende influenciar o equilíbrio entre a exploração no início da otimização e a adaptação posteriormente, embora a fonte fornecida não forneça as configurações detalhadas do cronograma nem explique o quão sensíveis os resultados são a elas.

O artigo relata duas descobertas principais. No WebArena-Lite, a otimização de parâmetros completos do Qwen-3.5-27B melhorou a linha de base “Sem habilidade” em 6,69%. Em uma avaliação separada de design heurístico automático em tempo de teste, a coevolução de parâmetros imediatos on-line da estrutura melhorou sua linha de base correspondente em 28 de 36 configurações. Estas são afirmações feitas no resumo do artigo, e não fatos verificados de forma independente no material fornecido. A fonte não indica o número de execuções, os intervalos de incerteza, as definições exatas de métricas, o orçamento computacional, a duração do treinamento ou o desempenho de métodos concorrentes de aprendizagem por reforço.

Detalhes da fonte: arxiv.org ↗

Por que isso importa

Se a abordagem relatada for generalizada, poderá diminuir a barreira da memória para adaptar grandes modelos de linguagem a tarefas que exigem muitas ações sequenciais. O artigo argumenta que as estratégias de evolução podem otimizar os parâmetros completos do modelo enquanto usam apenas memória GPU mínima em nível de inferência, tornando potencialmente alguns experimentos de ajuste fino de agentes mais acessíveis para pesquisadores sem grandes clusters de treinamento. A evidência é limitada aos resultados pré-impressos dos autores, no entanto, e a fonte não estabelece o custo total de computação, o tempo de trabalho, o uso de energia ou a confiabilidade do método em comparação com o aprendizado por reforço.

Agentes de longo horizonte criam um problema de treinamento que difere da geração comum de texto de turno único. Um modelo pode tomar diversas ações individualmente plausíveis e ainda assim falhar porque uma escolha antecipada torna impossível o progresso posterior. O argumento do artigo é que atribuir crédito ao longo de tal trajetória é difícil para a aprendizagem por reforço, enquanto o ES pode avaliar uma trajetória inteira e atribuir seu resultado no nível de parâmetro-perturbação. Se essa distinção for útil na prática, poderá fornecer aos investigadores outra forma de optimizar agentes cujas recompensas são atrasadas ou escassas.

A reivindicação de recursos é potencialmente consequente. Os autores dizem que o Agentic ESOpt permite a otimização de parâmetros completos com memória GPU mínima em nível de inferência. Isso pode ser importante porque a adaptação do modelo completo está geralmente associada a requisitos substanciais de memória em pipelines de treinamento convencionais. O design reivindicado pode permitir experimentos envolvendo modelos maiores em configurações de GPU mais modestas, pelo menos para a dimensão de memória enfatizada pelo artigo. Mas “requisitos mínimos de GPU” não devem ser interpretados como significando custo geral mínimo: a fonte fornecida não quantifica o número de avaliações de agentes, computação agregada, armazenamento, rede ou tempo necessário para obter as melhorias relatadas.

A interface de feedback de caixa preta da estrutura também poderia ampliar os tipos de sinais usados ​​durante a otimização do agente. O resumo diz que o método pode ser composto com evolução de espaço imediato, otimização de habilidades e computação em tempo de teste. Isso sugere que um pesquisador pode otimizar um modelo e as instruções ou heurísticas circundantes em conjunto, em vez de tratá-los como estágios separados. Essa flexibilidade pode ser útil quando o sucesso é medido por um ambiente externo ou pelo resultado de uma tarefa. A fonte não estabelece se esta flexibilidade melhora a interpretabilidade, a segurança, a robustez ou o comportamento fora dos ambientes avaliados.

Os benchmarks relatados tornam o trabalho relevante para o desenvolvimento de agentes usuários de ferramentas, mas por si só não demonstram uma implantação confiável. Uma melhoria de 6,69% ​​em relação a uma linha de base Sem Habilidades pode ser significativa, mas a sua importância depende da pontuação absoluta da linha de base, da variância da avaliação e do custo para alcançá-la. Da mesma forma, a melhoria em 28 dos 36 ambientes deixa 8 ambientes sem melhoria, e a fonte não diz quão grandes foram os ganhos ou perdas em qualquer grupo. O artigo, portanto, apoia a atenção para um método potencialmente importante, e não para uma conclusão de que a ES é geralmente superior à aprendizagem por reforço.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

O que assistir a seguir

As questões centrais são se os ganhos relatados se mantêm em modelos, tarefas, sementes e trajetórias de agentes mais longas ou mais realistas, e como o método se compara com uma forte aprendizagem por reforço e linhas de base eficientes em parâmetros sob o mesmo orçamento computacional. Os leitores também devem procurar detalhes sobre variância, significância estatística, contagens de perturbações, design de recompensas e a divisão entre memória de inferência e recursos totais de treinamento. A reprodução independente ajudaria a determinar se a melhoria de 6,69% ​​do WebArena-Lite e o resultado de 28 de 36 refletem uma técnica amplamente útil ou um resultado sensível a configurações específicas. O artigo é um envio do arXiv v1 e a fonte não relata implantação, disponibilidade do produto ou testes operacionais no mundo real.

A primeira prioridade é a reprodutibilidade. Um acompanhamento útil relataria o protocolo WebArena-Lite exato, a pontuação da linha de base, o número de trajetórias e perturbações, sementes aleatórias, intervalos de confiança e a computação consumida pelo treinamento e avaliação. Esses detalhes são necessários para distinguir uma melhoria estável de um resultado que depende de uma configuração restrita. O mesmo se aplica ao resultado do design heurístico 28 de 36: os leitores precisam dos resultados por configuração, da definição de uma linha de base correspondente e de informações sobre como as configurações foram selecionadas.

As comparações devem ser feitas sob recursos comparáveis. O principal contraste do artigo é com a aprendizagem por reforço agente, mas o resumo fornecido não fornece uma comparação direta e controlada com uma implementação forte de RL. Trabalhos futuros devem esclarecer se o ES usa mais interações ambientais, se sua vantagem de memória em nível de inferência acarreta uma carga de avaliação maior e como o desempenho muda quando a computação disponível é mantida constante. Comparações com ajuste fino com eficiência de parâmetros também ajudariam a contextualizar a otimização de todos os parâmetros.

A generalização é outra questão não resolvida. A fonte nomeia Qwen-3.5-27B e WebArena-Lite, mas não identifica outras famílias de modelos, ambientes de agentes, domínios ou comprimentos de trajetória em abstrato. Evidências em diferentes escalas de modelos e arquiteturas mostrariam se a abordagem depende de um modelo específico. Testes envolvendo horizontes mais longos, recompensas escassas, falhas de ferramentas, mudanças de ambiente e tarefas que não foram utilizadas durante a otimização seriam especialmente informativos porque essas condições são centrais para a motivação do artigo.

A segurança e o comportamento operacional merecem uma avaliação separada. Otimizar os agentes em relação às recompensas pode melhorar as pontuações das tarefas, ao mesmo tempo que incentiva atalhos frágeis ou ações indesejáveis ​​se a recompensa não conseguir atingir o objetivo real. A fonte fornecida não relata testes de segurança, verificações de robustez, resistência à injeção imediata ou desempenho sob mudança de distribuição. Também não relata implementação pública, integração de produto ou implantação. Até que essas questões sejam respondidas, a descrição mais defensável é que Agentic ESOpt é uma proposta de estrutura de pesquisa com resultados promissores, mas preliminares, de uma submissão do arXiv.

Guias e questionários relacionados

Agentes de IAModelos de IA explicadosTreinamento de IATransformadoresTeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?