Voltar às notícias
InovaçãoInstruções AI Understanding

Forbes relata que o chicote AVO de Nvidia ajudou Claude Opus 5 a atingir 100% no ARC-AGI-3

A Forbes relata que o equipamento do agente AVO de Nvidia aumentou a taxa de conclusão do Opus 5 do Claude no conjunto público do ARC-AGI-3 de cerca de 30% para 100% sem alterar os pesos do modelo. O resultado avança materialmente um relatório existente sobre o sistema AVO de Nvidia, mas as afirmações do artigo fornecido não são confirmadas de forma independente…

6 min readRead the original reporting
Source-provided image accompanying Forbes reports Nvidia’s AVO harness helped Claude Opus 5 reach 100% on ARC-AGI-3
Relatórios atribuídosFonte registrada
Editora
forbes.com
Tipo de fonte
Reportagem de um meio de comunicação - não um documento original.
Também citado

O que não pudemos confirmar de forma independente: Esta afirmação é atribuída ao estabelecimento nomeado. Não o verificamos em relação a um documento original. (forbes.com)

História revisada pela última vez

ContextoEntenda isso em 60 segundos

Termos-chave

AGI (Inteligência Geral Artificial)
Um hipotético sistema de IA que pode realizar a maioria das tarefas intelectuais em nível humano em muitos domínios.
Memória (memória do agente)
Contexto armazenado que um agente de IA usa em etapas ou sessões para melhorar a continuidade.
Afinação
Treinamento contínuo em dados específicos de domínio para adaptar um modelo pré-treinado a uma tarefa específica.

O que mudou desde a publicação

  1. Publicado pela primeira vez
  2. A Forbes avança materialmente o relatório de benchmark AVO existente, atribuindo o resultado ao Claude Opus 5, relatando um aumento de cerca de 30% de conclusão para 100% no conjunto público do ARC-AGI-3, citando 6.624 ações e aproximadamente 12% maior eficiência do que o sistema líder anterior, e detalhando a memória, supervisor, loop iterativo e arquitetura de ferramenta trocável do AVO. O artigo fornecido não confirma essas afirmações de forma independente nem estabelece desempenho de conjunto privado, disponibilidade de implantação ou confiabilidade empresarial.

O que aconteceu

A Forbes relata que o chicote de software AVO do Nvidia permitiu que o Claude Opus 5 do Claude completasse todos os níveis do conjunto de benchmark público do ARC-AGI-3 sem retreinar ou ajustar o modelo. O artigo atribui a melhoria à memória persistente, supervisão, planejamento iterativo e recuperação de erros, além de ferramentas trocáveis ​​em torno do modelo.

A Forbes informou em 24 de agosto que o sistema AVO de Nvidia ajudou o Claude Opus 5 de Anthropic a passar de completar cerca de 30% das tarefas públicas do ARC-AGI-3 para completar 100% delas. O artigo diz que o modelo em si não foi retreinado ou ajustado e que nenhum peso do modelo foi alterado. A melhoria relatada veio, portanto, do software que opera em torno do modelo. A Forbes apresenta o resultado como uma continuação da exibição de benchmark AVO relatada anteriormente por Nvidia, mas adiciona detalhes sobre o modelo subjacente e a contagem de ações relatada.

De acordo com a Forbes, o ARC-AGI-3 coloca um agente em ambientes semelhantes aos de um jogo, sem instruções, regras ou objetivos explícitos. O agente deve inferir o que cada ambiente exige por tentativa e erro. A Forbes diz que o conjunto público contém 25 ambientes, com seis a 10 níveis cada e 183 níveis no total. Relata que o AVO concluiu os níveis públicos em 6.624 ações, aproximadamente 12% menos que o sistema anterior mais eficiente. Estes números descrevem o conjunto de referência público; o artigo diz que os conjuntos de competição privada continuam a ser um teste mais difícil.

A Forbes descreve o AVO como um sistema, ou chicote, de “operador de variação agente”, com quatro elementos principais: memória persistente, um supervisor, um ciclo de trabalho iterativo e ferramentas trocáveis. A memória carrega adiante o que o agente tentou e aprendeu. O supervisor pode intervir quando o progresso parar. O loop inspeciona repetidamente a situação, planeja, age e avalia o resultado. As ferramentas podem ser alteradas para diferentes tarefas. A Forbes diz que Nvidia primeiro usou o sistema para otimizar o código da GPU e depois substituiu suas ferramentas de código por controles de jogo, enquadrando o resultado do benchmark como evidência de que a arquitetura não está limitada a uma tarefa.

O artigo fornecido pela Forbes é um relatório secundário de um colaborador cuja página descreve o trabalho como análise e visão de especialistas independentes. As pontuações de benchmark, contagem de ações, design do sistema e implantação do Claude Opus 5 são, portanto, atribuídas à Forbes neste artigo e não são confirmadas de forma independente pelo material de origem fornecido. A fonte não fornece um registro de avaliação reproduzível, um artigo, uma implementação completa ou teste independente do resultado reivindicado.

Detalhes da fonte: forbes.com ↗

Por que isso importa

O relatório ilustra como o desempenho do agente pode depender do sistema de software que envolve um modelo, e não apenas dos pesos do modelo ou das pontuações de benchmark. Se reproduzido, o resultado poderá tornar a memória, o planejamento, o uso de ferramentas e a recuperação prioridades centrais de engenharia para organizações que implantam IA em tarefas de longa duração.

O relatório concentra a atenção em uma distinção que é importante para a IA implantada: a qualidade da resposta isolada de um modelo não é a mesma que a capacidade de um agente de concluir uma tarefa longa. Um modelo pode produzir etapas individuais úteis, mas falhar porque esquece tentativas anteriores, repete erros, perde o controle de um objetivo ou não consegue se recuperar após uma ação malsucedida. A Forbes argumenta que o AVO visa esses modos de falha no nível do sistema por meio de memória, supervisão e avaliação repetida. Esta é uma afirmação prática de engenharia e não uma prova de que a abordagem funcionará igualmente bem fora do benchmark.

Se o relato da Forbes estiver correto, o resultado sugere que a orquestração de software pode desbloquear capacidades já presentes num modelo sem a despesa ou atraso de formação de um novo modelo de fronteira. Isso poderia deslocar a concorrência para as equipes que constroem tempos de execução de agentes, sistemas de memória, interfaces de ferramentas, mecanismos de monitoramento e recuperação. Isso também significa que comparar modelos sem especificar o equipamento circundante pode fornecer uma imagem incompleta do que os usuários realmente vivenciam. A unidade relevante de desempenho pode ser cada vez mais a combinação modelo-sistema.

O impacto público permanece incerto. O ARC-AGI-3 foi projetado para testar a adaptação a ambientes desconhecidos, o que é relevante para agentes de uso geral, mas o sucesso em ambientes semelhantes aos de jogos não estabelece um desempenho confiável em locais de trabalho, serviços públicos ou operações críticas de segurança. A Forbes liga o benchmark aos problemas de adoção empresarial e cita uma estimativa do MIT NANDA de que apenas cerca de 5% das iniciativas empresariais de IA examinadas produziram valor de negócio mensurável, apesar de gastos de 30 a 40 mil milhões de dólares. Esses números e a explicação do artigo sobre as causas são relatados pela Forbes, mas não são verificados de forma independente aqui.

O resultado também poderá aumentar, em vez de reduzir, a procura de computação. Um agente persistente que planeja, age, avalia e recupera repetidamente pode fazer muito mais chamadas de modelo do que uma curta troca de chatbot. Uma conclusão mais confiável poderia tornar o uso adicional de IA economicamente atraente, mas a fonte fornecida não quantifica o custo de inferência, latência, requisitos de memória ou uso de energia do AVO. Sem esses números, não é possível determinar se o ganho de eficiência reportado se traduz numa redução do custo operacional total.

Interactive Mechanism

Mecanismo interativo: como realmente funciona

Explore a tecnologia subjacente a este desenvolvimento de forma interativa.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Verificação de conceito interativo+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

O que assistir a seguir

As principais questões são se o resultado pode ser reproduzido de forma independente, quanto do ganho vem do AVO em vez do próprio Claude Opus 5 e se a abordagem é transferida para o trabalho prático. A fonte fornecida não estabelece desempenho de conjunto privado, confiabilidade geral da empresa, custo operacional ou ampla disponibilidade.

A replicação independente é a primeira prioridade. Os revisores devem procurar a configuração exata do Claude Opus 5, a implementação do AVO, permissões da ferramenta, conteúdo da memória, regras de parada, contabilidade de ações e protocolo de benchmark. Uma taxa de conclusão de 100% em um conjunto público pode ser significativa e, ao mesmo tempo, sensível às escolhas de configuração. O artigo fornecido pela Forbes não estabelece se pesquisadores externos reproduziram o resultado ou se os ambientes de referência e os procedimentos de avaliação foram auditados de forma independente.

A contribuição de cada componente também precisa ser separada. O relatório atribui a melhoria ao chicote completo, mas não mostra resultados de ablação para memória persistente, supervisor, loop iterativo ou ferramentas trocáveis. Portanto, não se sabe quais elementos são mais importantes, se o sistema adiciona uma sobrecarga substancial de inferência e se ganhos semelhantes apareceriam com outros modelos. As comparações devem distinguir o modelo básico, o modelo com um loop de agente simples e o sistema AVO completo.

O desempenho no conjunto privado ARC-AGI-3 e em tarefas não relacionadas será importante. A Forbes diz que os ambientes públicos não são o campo de provas final, mas não fornece uma pontuação definida para o setor privado. Evidências futuras deverão testar fluxos de trabalho de software desconhecidos, tarefas de pesquisa e outros ambientes onde os objetivos, o estado e o feedback sejam mais complicados do que no benchmark. Os resultados mais úteis reportariam tanto as taxas de sucesso como os custos de fracasso, incluindo as medidas tomadas, o tempo, a intervenção humana e as chamadas de modelos.

Finalmente, a fonte não estabelece disponibilidade de produtos, licenciamento, implantações de clientes ou resultados empresariais. O uso interno relatado de AVO por Nvidia para otimização de código GPU não é o mesmo que um produto geralmente disponível. Os leitores também devem ser cautelosos quanto às conclusões mais amplas do artigo sobre investidores e empresas, incluindo a discussão sobre empresas posicionadas para se beneficiarem do software de agente. Essas são análises da Forbes, e não resultados de mercado demonstrados de forma independente. A questão central não resolvida é se um equipamento líder em benchmarks pode tornar-se um sistema confiável, acessível e auditável para o trabalho real.

Guias e questionários relacionados

Atualizações e correções

Esta história canônica é atualizada quando o evento em desenvolvimento muda materialmente. Seu URL e a data de publicação original nunca mudam.

  • A Forbes avança materialmente o relatório de benchmark AVO existente, atribuindo o resultado ao Claude Opus 5, relatando um aumento de cerca de 30% de conclusão para 100% no conjunto público do ARC-AGI-3, citando 6.624 ações e aproximadamente 12% maior eficiência do que o sistema líder anterior, e detalhando a memória, supervisor, loop iterativo e arquitetura de ferramenta trocável do AVO. O artigo fornecido não confirma essas afirmações de forma independente nem estabelece desempenho de conjunto privado, disponibilidade de implantação ou confiabilidade empresarial.
Veja o registro de correções públicas
Achou isso útil?