Voltar às notícias
InovaçãoInstruções AI Understanding

Artigo argumenta que estratégias de evolução superam RL ao manter conjuntos de respostas LLM diversificados

Uma nova pré-impressão do arXiv argumenta que LLMs pós-treinamento com estratégias de evolução – um método livre de gradiente baseado na população que perturba os pesos diretamente – supera o aprendizado por reforço em pass@k e cobertura de solução. O resumo cita melhores resultados de benchmarking matemático, mas não cita modelos, benchmarks ou números.

7 min readRead the primary source
Source-page capture accompanying Paper Argues Evolution Strategies Beat RL at Keeping LLM Answer Sets Diverse
Documento de origem primáriaFonte registrada
Editora
arxiv.org
Link da fonte
arxiv.orghttps://arxiv.org/abs/2608.12679
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Modelo de linguagem grande (LLM)
Um modelo de linguagem treinado em corpora de texto massivo para gerar e analisar texto.
Inteligência Artificial (IA)
O amplo campo de construção de sistemas que executam tarefas que exigem reconhecimento de padrões, raciocínio, linguagem ou tomada de decisão.
Aprendizagem por Reforço
Treinamento por sinais de recompensa onde um agente aprende ações que maximizam o retorno a longo prazo.
Teste você mesmoQuestionário de treinamento de IA

O que aconteceu

Sete pesquisadores postaram um preprint no arXiv argumentando que o aprendizado por reforço pós-treinamento reduz a diversidade das respostas de um modelo de linguagem, e que as estratégias de evolução - otimizando diretamente no espaço de peso por meio de perturbações aleatórias - preservam essa diversidade e aumentam pass@k. O artigo foi submetido em 13 de agosto de 2026 e não foi revisado por pares. O resumo publicamente visível não contém nomes de benchmark, tamanhos de modelos ou valores medidos.

Uma pré-impressão intitulada "Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies" foi submetida ao arXiv em 13 de agosto de 2026 e catalogada em inteligência artificial (cs.AI) com uma listagem secundária em computação neural e evolutiva (cs.NE). É creditado a sete autores — Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen e Xin Qiu. O registro arXiv não lista afiliações institucionais e este relatório não atribui o trabalho a nenhuma organização.

A estrutura do artigo começa com a forma como os modelos de linguagem são normalmente usados ​​em ambientes de descoberta, como matemática e ciências: um problema é apresentado e a resposta única do modelo é considerada a solução proposta. Os autores argumentam que esse modo de "melhor estimativa" deixa valor na mesa, porque a computação adicional no tempo de teste pode ser gasta gerando muitas soluções candidatas em vez de uma. Esse regime é geralmente medido com pass@k, uma métrica que conta um problema como resolvido se pelo menos uma das k tentativas amostradas estiver correta.

A alegação central é um diagnóstico de um efeito colateral na prática atual. O pós-treinamento de um modelo com aprendizagem por reforço, escrevem os autores, restringe a distribuição de resultados do modelo em torno de resultados de alta recompensa - e esse estreitamento causa o colapso da cobertura da solução. Em outras palavras, RL pode melhorar a primeira resposta e, ao mesmo tempo, diminuir o conjunto de respostas distintas, o que penaliza especificamente o regime pass@k com o qual os autores se preocupam.

Como alternativa, o artigo propõe estratégias de evolução: um método pós-treinamento livre de gradiente, baseado na população, que otimiza diretamente no espaço de peso, aplicando perturbações aleatórias aos parâmetros do modelo e selecionando os resultados, em vez de retropropagar um sinal de recompensa. O resumo afirma que ES atinge pass@k consistentemente mais alto do que RL, produz uma distribuição de resultados mais ampla com maior cobertura de solução e que essa cobertura, por sua vez, se traduz em melhores resultados em benchmarks matemáticos padrão.

O que o resumo não fornece é a maior parte das evidências. Ele não nomeia famílias de modelos ou contagens de parâmetros, nenhum benchmark específico, nenhum valor de k, nenhum algoritmo RL de linha de base e nenhum resultado numérico - as palavras "consistentemente mais alto" e "melhores resultados" são as únicas caracterizações oferecidas. A submissão tem 449 KB e o texto completo está disponível em PDF e HTML experimental, portanto esses detalhes podem estar no artigo; eles estão simplesmente ausentes do registro aqui avaliado. É uma pré-impressão da versão um sem indicação de revisão por pares, sem código visível ou link de dados e sem replicação independente.

Detalhes da fonte: arxiv.org ↗

Por que isso importa

Em domínios onde uma resposta candidata pode ser verificada – provas, código, hipóteses científicas – o limite útil não é saber se a primeira estimativa de um modelo está certa, mas se uma resposta correta aparece em qualquer lugar num lote de tentativas. Se o pós-treinamento de RL reduzir sistematicamente esse pool, a receita de alinhamento dominante da indústria pode ser a troca exatamente da propriedade da qual dependem a descoberta e a pesquisa de agentes.

A distinção que o artigo estabelece – entre a melhor resposta individual de um modelo e a amplitude do que este pode produzir em muitas amostras – não é académica. Uma parcela crescente do trabalho de IA de alto valor é executado em um ciclo de geração e verificação: propor muitos programas candidatos e executar o conjunto de testes, propor muitas etapas de prova e verificá-las mecanicamente, propor muitas hipóteses e analisá-las. Em todas essas configurações, um verificador decide qual candidato está certo, de modo que a restrição vinculativa é se um candidato correto foi gerado. A cobertura é o teto e a precisão na primeira tentativa está apenas um ponto abaixo dele.

Isso torna o diagnóstico potencialmente consequente para a receita pós-treino dominante. A aprendizagem por reforço a partir de sinais de recompensa é a forma como a maioria dos modelos de fronteira atuais são moldados após o pré-treinamento, e o aprimoramento da distribuição de resultados está próximo do objetivo do exercício. Se esse aperfeiçoamento custar de forma confiável a cobertura, então o pipeline padrão pode estar otimizando para pontuações de benchmark medidas em k = 1, ao mesmo tempo em que degrada silenciosamente o desempenho no regime onde os modelos são cada vez mais implantados. A preocupação de que a RL reduza a diversidade do modelo já foi levantada anteriormente na literatura de pesquisa; a contribuição aqui reivindicada é uma alternativa concreta e não um novo diagnóstico.

A solução proposta traz consigo seus próprios compromissos bem conhecidos. As estratégias de evolução evitam inteiramente os gradientes, o que evita parte da instabilidade do ajuste fino de RL, mas historicamente pagam por isso com a eficiência da amostra: estimar uma direção de atualização útil a partir de perturbações aleatórias de peso normalmente requer muitas passagens diretas em uma população, o que é bem paralelizado, mas consome computação. Se essa aritmética funciona à escala dos modelos de linguagem modernos é precisamente a questão que um leitor gostaria de ver respondida, e o resumo não aborda de forma alguma o custo.

Para o público e para os profissionais, nada muda hoje. Esta é uma afirmação de pesquisa sobre metodologia de treinamento, não um produto, uma versão de modelo ou uma descoberta de segurança. O seu significado prático chegaria indirectamente – através de modelos ajustados para explorar em vez de comprometer, ou através de fornecedores que expõem botões que trocam a precisão da primeira resposta pela amplitude. Não há evidências na fonte de que qualquer sistema implantado use esse método e nenhum fornecedor foi descrito como adotando-o.

Também vale a pena indicar os limites do que pode ser concluído a partir de um resumo pré-impresso. A afirmação de que ES vence RL em pass@k é o relato dos autores sobre seus próprios experimentos, e não um fato estabelecido de forma independente. As comparações entre métodos de otimização são notoriamente sensíveis ao esforço de ajuste, ao orçamento de computação e à escolha da linha de base, e um resultado válido para uma escala de modelo ou uma família de benchmark muitas vezes não pode ser generalizado.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Training Quiz

In AI training, what is an "epoch"?

O que assistir a seguir

Os detalhes de suporte de carga estão no PDF completo e não no resumo: quais modelos foram treinados, quais benchmarks foram usados, quais valores de k e, principalmente, se ES e RL foram comparados na computação correspondente. Também vale a pena observar se o código é divulgado, se o resultado é reproduzido fora da matemática e se algum laboratório de fronteira adota o método.

A primeira coisa a verificar é a configuração experimental do artigo completo e, especificamente, se as execuções ES e RL foram compatíveis com a computação. Um método livre de gradiente que consome substancialmente mais computação de treinamento do que sua linha de base RL pode parecer melhor por razões não relacionadas ao mecanismo proposto pelos autores. Os leitores devem procurar os tamanhos dos modelos treinados, o algoritmo RL usado como comparação, o número de perturbações por geração e os valores de k nos quais pass@k foi medido - as curvas de cobertura frequentemente se cruzam e um método que vence em grande k pode perder em k = 1.

Em segundo lugar, observe o escopo. A afirmação concreta do resumo sobre os ganhos posteriores é limitada a “benchmarks matemáticos padrão”, um domínio com verificação automática barata e otimização prévia pesada. Se a vantagem de cobertura é transferida para a geração de código, geração de hipóteses científicas ou tarefas de agente abertas – onde a verificação é mais ruidosa e a correção não é binária – não está estabelecido pelo material disponível.

Terceiro, observe os artefatos e a replicação. A listagem do arXiv não mostra nenhum código associado ou liberação de dados. Uma implementação divulgada, ou uma reprodução por um grupo não afiliado aos autores, passaria de uma reivindicação a um resultado. Na ausência disso, a postura apropriada é o interesse e não a confiança, e qualquer sinal de adoção deve vir com os seus próprios números.

Quarto, a questão do verificador limita quanto vale qualquer ganho de cobertura. Pass@k mais alto só se converte em saída útil quando algo consegue identificar o candidato correto entre muitos. Em matemática e software, existem verificadores; na maioria das aplicações comerciais isso não acontece, e selecionar a resposta certa em um conjunto mais amplo torna-se um problema não resolvido. O trabalho de acompanhamento combinando modelos treinados em ES com mecanismos de seleção seria o próximo passo natural.

Por fim, observe a trilha de publicação. O artigo é uma pré-impressão v1 sem local declarado ou status de revisão. Revisões, uma submissão a uma conferência ou uma crítica pública de outros investigadores que trabalham na diversidade pós-formação em VR aumentariam a seriedade com que a afirmação central deve ser levada a cabo.

Guias e questionários relacionados

Treinamento de IAModelos de IA explicadosFuturo da IAChatGPT e LLMTeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?