Voltar às notícias
InovaçãoInstruções AI Understanding

Artigo Co-RL relata ganhos de raciocínio sem rótulos de diversas coortes de modelos

Uma pré-impressão do arXiv descreve o Co-RL, uma estrutura de aprendizagem por reforço multiagente na qual modelos separados recompensam uns aos outros. Os autores relatam ganhos em benchmarks somente de texto e multimodais sem rótulos de verdade, ao mesmo tempo que reconhecem os riscos de erros de auto-reforço e colapso do treinamento.

6 min readRead the primary source
Source-provided image accompanying Co-RL paper reports label-free reasoning gains from diverse model cohorts
Documento de origem primáriaFonte registrada
Editora
arxiv.org
Link da fonte
arxiv.orghttps://arxiv.org/abs/2608.17253
Tipo de fonte
Documento primário - um anúncio oficial, papel, arquivamento ou página original que lemos diretamente.
ContextoEntenda isso em 60 segundos

Comece aqui

Termos-chave

Aprendizagem por Reforço
Treinamento por sinais de recompensa onde um agente aprende ações que maximizam o retorno a longo prazo.
Referência
Um teste padronizado ou conjunto de dados usado para medir e comparar o desempenho do modelo.
Calcular
Os recursos de processamento necessários para treinar e executar modelos, geralmente medidos em FLOPS ou horas de GPU.
Teste você mesmoQuestionário explicado sobre modelos de IA

O que aconteceu

Os pesquisadores introduziram o Co-RL, uma estrutura cooperativa de aprendizagem por reforço multiagente que usa recompensas geradas por pares em vez de rótulos de verdade. O artigo relata melhor desempenho de raciocínio em benchmarks somente texto e multimodais, mas a fonte fornecida é uma pré-impressão do arXiv e não estabelece os resultados de forma independente.

Um artigo arXiv submetido em 18 de agosto de 2026 e revisado em 19 de agosto apresenta Co-RL, que os autores descrevem como um método para produzir raciocínio não supervisionado por meio de treinamento cooperativo entre vários modelos de IA. O artigo aborda uma limitação que os autores associam à aprendizagem por reforço para sistemas de linguagem e visão-linguagem: os resultados mais fortes geralmente dependem da supervisão da verdade, como recompensas verificáveis. De acordo com o resumo, tais anotações podem ser caras e mais difíceis de obter à medida que os sistemas lidam com tarefas de raciocínio que as pessoas não conseguem avaliar de forma confiável.

Co-RL usa vários modelos desacoplados que não compartilham parâmetros. Os modelos são otimizados simultaneamente por meio de aprendizagem por reforço, com recompensas derivadas das conclusões de seus pares. Esse design difere do treinamento de um único modelo apenas com base no feedback autogerado. Os autores argumentam que os sistemas auto-recompensadores podem reforçar os seus preconceitos e comportamentos fracos existentes, reduzir a gama de respostas que produzem e, eventualmente, entrar num colapso de formação em que os resultados se tornam cada vez mais homogéneos. A fonte fornecida não descreve o cálculo exato da recompensa ou as regras usadas para comparar as conclusões dos pares.

A resposta proposta no artigo é tornar o grupo de treinamento diversificado. O resumo identifica três formas de diversidade: uso de famílias de modelos heterogêneos, tamanhos variados de modelos e reformulação de amostras de treinamento. Os autores dizem que essas escolhas reduzem erros correlacionados, que identificam como um impulsionador de ciclos de feedback que se auto-reforçam. Na estrutura relatada, os parâmetros separados dos modelos fazem, portanto, parte da premissa do método: a coorte destina-se a fornecer feedback menos correlacionado do que um modelo que avalia apenas os seus próprios resultados. A fonte não informa quantos modelos foram usados ​​em cada experimento ou como a diversidade foi medida.

Os autores relatam que o Co-RL superou os modelos básicos e as abordagens anteriores sem rótulos em configurações somente texto e multimodais. Eles relatam ganhos médios que variam de 3,0% a 8,6% em sete benchmarks somente de texto para modelos de linguagem, e de 2,3% a 7,2% em quatro benchmarks multimodais para modelos de linguagem de visão. O resumo também diz que Co-RL igualou ou superou métodos supervisionados sem acesso a rótulos de verdade. Estas são afirmações do jornal; o registro fornecido não identifica os nomes dos benchmarks, métricas de avaliação, configurações de linha de base, incerteza estatística ou se as comparações usaram quantidades iguais de computação.

Detalhes da fonte: arxiv.org ↗

Por que isso importa

Se as descobertas relatadas persistirem na reprodução, o Co-RL poderia oferecer uma maneira de treinar modelos de raciocínio quando anotações confiáveis, verificáveis ​​por humanos ou máquinas, são caras, escassas ou difíceis de criar. A sua afirmação central é que a diversidade entre modelos treinados de forma independente pode reduzir erros correlacionados e preservar comportamentos variados, em vez de permitir que as fraquezas de um modelo se tornem num sinal de treino partilhado.

A pesquisa aborda um gargalo prático no desenvolvimento da IA: a obtenção de recompensas confiáveis ​​para raciocínios difíceis. Os rótulos de verdade podem exigir trabalho especializado, verificação formal ou procedimentos de avaliação cuidadosamente elaborados. Se um sistema puder aprender a partir de interações entre pares treinados de forma independente, como afirmam os autores, os pesquisadores poderão estender a aprendizagem por reforço a tarefas para as quais não estão disponíveis rótulos de respostas completos. Isso não eliminaria a necessidade de avaliação. Isso transferiria mais a carga para a concepção de sinais de pares e para a verificação de que esses sinais não recompensam o raciocínio plausível, mas incorreto.

O mecanismo proposto é importante porque trata a discordância e a variação entre modelos como recursos de treinamento potencialmente úteis. O autofeedback de um único modelo pode validar repetidamente o mesmo erro. Um grupo com arquiteturas, escalas ou frases de entrada diferentes pode expor mais discrepâncias. O artigo atribui os ganhos relatados e a redução do colapso a esta diversidade. Essa explicação continua a ser uma afirmação de investigação e não um resultado causal estabelecido de forma independente: o resumo não mostra se a própria diversidade produziu a melhoria ou quanto cada fonte de diversidade contribuiu.

A inclusão de benchmarks multimodais amplia o escopo declarado do artigo para além do raciocínio do texto. Os autores relatam ganhos para modelos de linguagem de visão, bem como para modelos de linguagem, sugerindo que estão testando se as recompensas baseadas em pares podem funcionar quando os modelos devem combinar informações visuais e textuais. Isso pode ser relevante para sistemas que interpretem imagens, diagramas ou outras entradas não textuais. A fonte não diz que tipos de tarefas multimodais foram utilizadas, se os modelos avaliaram as evidências visuais com precisão ou se o método melhora a confiabilidade nas decisões visuais críticas para a segurança.

O artigo também faz uma comparação mais restrita, mas importante, com abordagens supervisionadas. Igualar ou superar os métodos supervisionados nos experimentos relatados sugeriria que a remoção dos rótulos de verdade não exige necessariamente a aceitação de um desempenho de referência inferior. Não mostra que os rótulos sejam desnecessários em geral, que as recompensas entre pares sejam confiáveis ​​ou que o método seja mais barato. O registro arXiv identifica um artigo de 30 páginas com figuras e tabelas, mas não identifica revisão por pares, replicação independente, uso de produção ou evidência de que Co-RL melhora os resultados para pessoas que usam sistemas de IA implantados.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificação de conceito interativo+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

O que assistir a seguir

Os principais testes são se os ganhos relatados são replicados nas tarefas específicas do artigo, nas famílias de modelos, nos tamanhos dos coortes e nas configurações de treinamento, e se eles permanecem após a contabilização das diferenças de computação e dados. A fonte não fornece esses detalhes, as métricas de referência, estimativas de incerteza ou evidências de implantação em sistemas do mundo real.

A primeira prioridade é inspecionar toda a configuração experimental por trás dos ganhos percentuais relatados. A fonte fornecida não nomeia os sete benchmarks somente de texto ou os quatro benchmarks multimodais, não define a métrica relatada, não fornece as pontuações iniciais ou explica se as porcentagens são alterações absolutas ou relativas. Esses detalhes determinam o tamanho da melhoria em termos práticos. Os leitores também devem procurar resultados por tarefa, em vez de confiar apenas nas médias, porque uma média ampla pode ocultar regressões em avaliações individuais.

A reprodução deve testar se a vantagem do Co-RL sobrevive aos recursos correspondentes e às linhas de base cuidadosamente controladas. Informações importantes que faltam incluem o número e tipos de membros da coorte, tamanhos de modelos, duração do treinamento, volume de dados, orçamento de aprendizagem por reforço e o procedimento exato de recompensa entre pares. As comparações com abordagens autocompensadoras e outras abordagens sem rótulo devem usar condições equivalentes de cálculo e amostragem. A fonte diz que o código está disponível, mas o texto fornecido não fornece a localização do código nem estabelece que um grupo independente o executou.

O relato da diversidade no artigo também merece um exame mais detalhado. Famílias de modelos heterogêneos, tamanhos diferentes e amostras reformuladas podem afetar o desempenho por razões não relacionadas à redução de erros correlacionados. Os experimentos de acompanhamento devem variar um fator de cada vez e medir a precisão do raciocínio e a diversidade comportamental. Eles também devem testar se os grupos de pares podem convergir para a mesma resposta falsa, especialmente quando os modelos compartilham dados de treinamento, suposições de arquitetura ou pontos cegos comuns. O resumo não relata tais testes de estresse.

Finalmente, a utilização prática exigiria salvaguardas para erros que o acordo entre pares não consegue detectar. Um grupo de modelos pode concordar porque são independentemente corretos ou porque compartilham um modo de falha despercebido. A mitigação relatada pelos autores do colapso do treinamento diz respeito ao processo de treinamento e não deve ser lida como prova de confiabilidade factual, segurança ou implantação segura. O que permanece desconhecido é como o Co-RL se comporta em tarefas desconhecidas, contribuições adversárias, mudanças de distribuição e decisões onde um consenso incorreto pode causar danos materiais.

Guias e questionários relacionados

Modelos de IA explicadosTreinamento de IAAgentes de IATeste o que você sabe – experimente um teste gratuito de IAProcure um termo de IA em nosso glossárioSiga o rastreador de lançamento de modelo de IA
Achou isso útil?