O que aconteceu
A Forbes relata que o chicote de software AVO do Nvidia permitiu que o Claude Opus 5 do Claude completasse todos os níveis do conjunto de benchmark público do ARC-AGI-3 sem retreinar ou ajustar o modelo. O artigo atribui a melhoria à memória persistente, supervisão, planejamento iterativo e recuperação de erros, além de ferramentas trocáveis em torno do modelo.
A Forbes informou em 24 de agosto que o sistema AVO de Nvidia ajudou o Claude Opus 5 de Anthropic a passar de completar cerca de 30% das tarefas públicas do ARC-AGI-3 para completar 100% delas. O artigo diz que o modelo em si não foi retreinado ou ajustado e que nenhum peso do modelo foi alterado. A melhoria relatada veio, portanto, do software que opera em torno do modelo. A Forbes apresenta o resultado como uma continuação da exibição de benchmark AVO relatada anteriormente por Nvidia, mas adiciona detalhes sobre o modelo subjacente e a contagem de ações relatada.
De acordo com a Forbes, o ARC-AGI-3 coloca um agente em ambientes semelhantes aos de um jogo, sem instruções, regras ou objetivos explícitos. O agente deve inferir o que cada ambiente exige por tentativa e erro. A Forbes diz que o conjunto público contém 25 ambientes, com seis a 10 níveis cada e 183 níveis no total. Relata que o AVO concluiu os níveis públicos em 6.624 ações, aproximadamente 12% menos que o sistema anterior mais eficiente. Estes números descrevem o conjunto de referência público; o artigo diz que os conjuntos de competição privada continuam a ser um teste mais difícil.
A Forbes descreve o AVO como um sistema, ou chicote, de “operador de variação agente”, com quatro elementos principais: memória persistente, um supervisor, um ciclo de trabalho iterativo e ferramentas trocáveis. A memória carrega adiante o que o agente tentou e aprendeu. O supervisor pode intervir quando o progresso parar. O loop inspeciona repetidamente a situação, planeja, age e avalia o resultado. As ferramentas podem ser alteradas para diferentes tarefas. A Forbes diz que Nvidia primeiro usou o sistema para otimizar o código da GPU e depois substituiu suas ferramentas de código por controles de jogo, enquadrando o resultado do benchmark como evidência de que a arquitetura não está limitada a uma tarefa.
O artigo fornecido pela Forbes é um relatório secundário de um colaborador cuja página descreve o trabalho como análise e visão de especialistas independentes. As pontuações de benchmark, contagem de ações, design do sistema e implantação do Claude Opus 5 são, portanto, atribuídas à Forbes neste artigo e não são confirmadas de forma independente pelo material de origem fornecido. A fonte não fornece um registro de avaliação reproduzível, um artigo, uma implementação completa ou teste independente do resultado reivindicado.
Detalhes da fonte: forbes.com ↗
Por que isso importa
O relatório ilustra como o desempenho do agente pode depender do sistema de software que envolve um modelo, e não apenas dos pesos do modelo ou das pontuações de benchmark. Se reproduzido, o resultado poderá tornar a memória, o planejamento, o uso de ferramentas e a recuperação prioridades centrais de engenharia para organizações que implantam IA em tarefas de longa duração.
O relatório concentra a atenção em uma distinção que é importante para a IA implantada: a qualidade da resposta isolada de um modelo não é a mesma que a capacidade de um agente de concluir uma tarefa longa. Um modelo pode produzir etapas individuais úteis, mas falhar porque esquece tentativas anteriores, repete erros, perde o controle de um objetivo ou não consegue se recuperar após uma ação malsucedida. A Forbes argumenta que o AVO visa esses modos de falha no nível do sistema por meio de memória, supervisão e avaliação repetida. Esta é uma afirmação prática de engenharia e não uma prova de que a abordagem funcionará igualmente bem fora do benchmark.
Se o relato da Forbes estiver correto, o resultado sugere que a orquestração de software pode desbloquear capacidades já presentes num modelo sem a despesa ou atraso de formação de um novo modelo de fronteira. Isso poderia deslocar a concorrência para as equipes que constroem tempos de execução de agentes, sistemas de memória, interfaces de ferramentas, mecanismos de monitoramento e recuperação. Isso também significa que comparar modelos sem especificar o equipamento circundante pode fornecer uma imagem incompleta do que os usuários realmente vivenciam. A unidade relevante de desempenho pode ser cada vez mais a combinação modelo-sistema.
O impacto público permanece incerto. O ARC-AGI-3 foi projetado para testar a adaptação a ambientes desconhecidos, o que é relevante para agentes de uso geral, mas o sucesso em ambientes semelhantes aos de jogos não estabelece um desempenho confiável em locais de trabalho, serviços públicos ou operações críticas de segurança. A Forbes liga o benchmark aos problemas de adoção empresarial e cita uma estimativa do MIT NANDA de que apenas cerca de 5% das iniciativas empresariais de IA examinadas produziram valor de negócio mensurável, apesar de gastos de 30 a 40 mil milhões de dólares. Esses números e a explicação do artigo sobre as causas são relatados pela Forbes, mas não são verificados de forma independente aqui.
O resultado também poderá aumentar, em vez de reduzir, a procura de computação. Um agente persistente que planeja, age, avalia e recupera repetidamente pode fazer muito mais chamadas de modelo do que uma curta troca de chatbot. Uma conclusão mais confiável poderia tornar o uso adicional de IA economicamente atraente, mas a fonte fornecida não quantifica o custo de inferência, latência, requisitos de memória ou uso de energia do AVO. Sem esses números, não é possível determinar se o ganho de eficiência reportado se traduz numa redução do custo operacional total.
Mecanismo interativo: como realmente funciona
Explore a tecnologia subjacente a este desenvolvimento de forma interativa.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
O que assistir a seguir
As principais questões são se o resultado pode ser reproduzido de forma independente, quanto do ganho vem do AVO em vez do próprio Claude Opus 5 e se a abordagem é transferida para o trabalho prático. A fonte fornecida não estabelece desempenho de conjunto privado, confiabilidade geral da empresa, custo operacional ou ampla disponibilidade.
A replicação independente é a primeira prioridade. Os revisores devem procurar a configuração exata do Claude Opus 5, a implementação do AVO, permissões da ferramenta, conteúdo da memória, regras de parada, contabilidade de ações e protocolo de benchmark. Uma taxa de conclusão de 100% em um conjunto público pode ser significativa e, ao mesmo tempo, sensível às escolhas de configuração. O artigo fornecido pela Forbes não estabelece se pesquisadores externos reproduziram o resultado ou se os ambientes de referência e os procedimentos de avaliação foram auditados de forma independente.
A contribuição de cada componente também precisa ser separada. O relatório atribui a melhoria ao chicote completo, mas não mostra resultados de ablação para memória persistente, supervisor, loop iterativo ou ferramentas trocáveis. Portanto, não se sabe quais elementos são mais importantes, se o sistema adiciona uma sobrecarga substancial de inferência e se ganhos semelhantes apareceriam com outros modelos. As comparações devem distinguir o modelo básico, o modelo com um loop de agente simples e o sistema AVO completo.
O desempenho no conjunto privado ARC-AGI-3 e em tarefas não relacionadas será importante. A Forbes diz que os ambientes públicos não são o campo de provas final, mas não fornece uma pontuação definida para o setor privado. Evidências futuras deverão testar fluxos de trabalho de software desconhecidos, tarefas de pesquisa e outros ambientes onde os objetivos, o estado e o feedback sejam mais complicados do que no benchmark. Os resultados mais úteis reportariam tanto as taxas de sucesso como os custos de fracasso, incluindo as medidas tomadas, o tempo, a intervenção humana e as chamadas de modelos.
Finalmente, a fonte não estabelece disponibilidade de produtos, licenciamento, implantações de clientes ou resultados empresariais. O uso interno relatado de AVO por Nvidia para otimização de código GPU não é o mesmo que um produto geralmente disponível. Os leitores também devem ser cautelosos quanto às conclusões mais amplas do artigo sobre investidores e empresas, incluindo a discussão sobre empresas posicionadas para se beneficiarem do software de agente. Essas são análises da Forbes, e não resultados de mercado demonstrados de forma independente. A questão central não resolvida é se um equipamento líder em benchmarks pode tornar-se um sistema confiável, acessível e auditável para o trabalho real.