Volver a Noticias
InnovaciónAI Understanding sesión informativa

NVIDIA informa que un sistema de agente de propósito general resolvió el conjunto público de ARC-AGI-3

NVIDIA dice que su agente AVO completó los 183 niveles públicos de ARC-AGI-3 con Claude Opus 5, al tiempo que enfatiza que el resultado refleja el sistema completo, no solo el modelo.

Por 5 min read
Rack-mounted GPU servers and dense fiber cables in a quiet high-performance computing data-center aisle at dawn.
La versión corta

NVIDIA dice que su agente AVO completó los 183 niveles públicos de ARC-AGI-3 con Claude Opus 5, al tiempo que enfatiza que el resultado refleja el sistema completo, no solo el modelo.

que paso

NVIDIA informa que su sistema Agentic Variation Operadores, o AVO, logró una puntuación RHAE de 100,00 en el conjunto público de 25 entornos de ARC-AGI-3. Utilizando Claude Opus 5 y observaciones de cuadrícula de 64 por 64 de solo texto, AVO completó los 183 niveles en 6,624 acciones ambientales. NVIDIA también describe una ejecución separada de optimización del kernel de GPU de siete días en la que AVO exploró más de 500 direcciones y produjo 40 versiones comprometidas.

El blog técnico de NVIDIA del 21 de agosto de 2026 presenta los Operadores de Variación Agentica, o AVO, como una arquitectura de agente de codificación de propósito general diseñada para trabajos que se extienden más allá de una respuesta de modelo único. El sistema puede inspeccionar y editar código, ejecutar comandos, consultar documentación y validar cambios mediante la ejecución. Su diseño central incluye memoria persistente para implementaciones anteriores, resultados de pruebas, resultados del compilador y perfilador, y razonamiento acumulado, junto con un supervisor que vigila el estancamiento o ciclos improductivos repetidos.

La compañía describe por primera vez AVO en un experimento de optimización del kernel de GPU de siete días. Según NVIDIA, el sistema exploró más de 500 direcciones de optimización y produjo 40 versiones de kernel comprometidas. En los sistemas NVIDIA DGX B200, los núcleos de atención multicabezal resultantes superaron a cuDNN hasta en un 3,5 % y a FlashAttention-4 hasta en un 10,5 % en todas las configuraciones evaluadas por el equipo. NVIDIA dice que AVO luego adaptó el kernel evolucionado a la atención de consultas agrupadas en aproximadamente 30 minutos de trabajo autónomo adicional. La fuente no proporciona mediciones independientes, detalles completos de configuración ni una descripción reproducible de cada prueba.

Luego, NVIDIA conectó la misma arquitectura AVO subyacente a ARC-AGI-3, un punto de referencia de razonamiento interactivo compuesto por entornos similares a juegos desconocidos. La compañía dice que el agente no recibió reglas ni objetivos establecidos y tuvo que inferir cómo funcionaban las acciones a través de la interacción. En esta configuración, el modelo recibió cuadrículas de texto exactas de 64 por 64 en lugar de imágenes o tokens de imágenes, y el sistema utilizó herramientas y evaluación específicas del entorno manteniendo el ciclo de ejecución AVO más amplio.

La compañía reporta una puntuación de 100,00 en Eficiencia relativa de la acción humana en los 25 entornos públicos, completando los 183 niveles en 6.624 acciones ambientales. NVIDIA compara eso con 7,542 acciones reportadas por VISTA para Claude Opus 5 en los mismos niveles públicos, una diferencia de aproximadamente el 12%. NVIDIA dice explícitamente que esto no es una ablación controlada: los sistemas difieren en el backend, el formato de observación, la memoria, la gestión del contexto y otros detalles de implementación. La fuente también dice que las pruebas limitadas combinaron AVO con GPT-5.6 Sol, pero estas comparaciones preliminares no fueron una evaluación sistemática completa.

Lea la fuente principal: developer.nvidia.com

Por qué es importante

El resultado respalda el argumento de NVIDIA de que la memoria persistente, la supervisión, el uso de herramientas y la recuperación pueden afectar materialmente el rendimiento del agente a largo plazo. Es notable porque se aplicó la misma arquitectura subyacente a la optimización del kernel de GPU y a un punto de referencia interactivo desconocido. Sin embargo, la fuente no establece que AVO haya causado la ganancia total de rendimiento, ni que el sistema se generalice al trabajo en el mundo real.

La afirmación técnica importante tiene que ver con el diseño del sistema. El desempeño de AVO se presenta como el producto de un ciclo que forma hipótesis, toma acciones, observa resultados, preserva el estado útil, revisa suposiciones y se recupera de errores. Esto es diferente a evaluar un modelo sobre cuestiones aisladas. Si el enfoque se mantiene, los desarrolladores podrían tratar cada vez más la memoria, la supervisión, las interfaces de herramientas y los mecanismos de recuperación como componentes de capacidades centrales en lugar de envoltorios opcionales alrededor de un modelo de lenguaje.

La transferencia entre tareas es la parte más trascendental del informe de NVIDIA. La optimización del kernel de GPU depende del código fuente, compiladores, perfiladores y mediciones basadas en hardware. En cambio, ARC-AGI-3 proporciona entornos interactivos y resultados de acción desconocidos. NVIDIA sostiene que el elemento transferible no es el conocimiento del dominio sino la maquinaria para sostener el progreso cuando llega retroalimentación sobre muchos pasos. Por lo tanto, el resultado es relevante para la investigación sobre agentes que deben trabajar a través de estados cambiantes en lugar de producir resultados únicos.

El informe también ilustra por qué los puntajes de referencia de los titulares pueden oscurecer lo que se está midiendo. La puntuación RHAE de 100,00 pertenece al sistema completo de interfaz AVO-plus-model-plus. No muestra que Claude Opus 5 por sí solo mejoró con respecto al resultado público de aproximadamente el 30% citado por la fuente, porque las ejecuciones utilizaron diferentes entornos de razonamiento y sistemas de evaluación sustancialmente diferentes. La comparación de acciones tampoco prueba que la memoria persistente, el supervisor o cualquier otro componente individual causaran la diferencia.

Las implicaciones prácticas siguen siendo inciertas. La fuente no establece con qué frecuencia falla AVO, cuánta supervisión humana se requiere en el uso normal, cuánto cuesta la ejecución de optimización de siete días, cuánta computación consume o si su comportamiento es confiable en entornos críticos para la seguridad. Tampoco demuestra que el éxito en entornos de referencia desconocidos se traduzca en ingeniería de software, investigación científica u operaciones comerciales fuera de las configuraciones probadas. La evidencia de NVIDIA es importante como resultado de una investigación informada por la empresa, pero no es en sí misma una confirmación independiente de la confiabilidad general del agente.

Qué ver a continuación

El seguimiento clave es la replicación independiente y las pruebas controladas. Las comparaciones con VISTA no son ablaciones porque los sistemas difieren en el backend del modelo, las observaciones, la memoria y la gestión del contexto. El resultado de NVIDIA cubre sólo el conjunto de puntos de referencia públicos; Se desconocen el rendimiento en conjuntos semiprivados o privados, el costo operativo, los modos de falla, los controles de seguridad y la transferencia a implementaciones prácticas.

La replicación debería ser la primera prueba. Los investigadores necesitarían volver a ejecutar AVO o una implementación equivalente en condiciones documentadas y verificar el resultado de 6.624 acciones en el conjunto público ARC-AGI-3. Los informes útiles incluirían seguimientos de fallas, recuentos de acciones por entorno, variabilidad de ejecuciones repetidas, costos de inferencia y herramientas, y si los resultados dependen de indicaciones particulares, contenidos de la memoria o configuraciones de ejecución.

Los estudios de componentes controlados aclararían la fuente de la ganancia. Las comparaciones deben probar por separado la memoria persistente, el supervisor, la gestión del contexto, el formato de observación y la elección del modelo, manteniendo constantes otras variables. La publicación de NVIDIA dice que la memoria puede reducir la exploración repetida, pero no aísla esa contribución. La misma precaución se aplica al comparar con VISTA, cuya arquitectura y entradas difieren en varios aspectos.

Las partes no vistas del índice de referencia son otra medida no resuelta. NVIDIA afirma que los resultados informados cubren el conjunto público de 25 entornos y no son resultados de los conjuntos de competencia semiprivados o totalmente privados. Los resultados futuros en entornos retenidos proporcionarían pruebas más sólidas sobre la generalización, especialmente si la evaluación impide que el agente o sus desarrolladores adapten el sistema a las tareas públicas.

Finalmente, los lectores deberían estar atentos a la evidencia sobre la implementación en lugar de solo completar los puntos de referencia. Un agente de larga duración que pueda actuar a través de herramientas necesita salvaguardas en torno a los permisos, la persistencia del estado, la recuperación y la intervención humana. La fuente menciona la seguridad a nivel del sistema como un principio de diseño importante, pero no informa una evaluación de seguridad de AVO. Su importancia en el mundo real dependerá de si puede mantener la precisión, controlar los costos, exponer su razonamiento y detenerse de manera segura cuando la retroalimentación es ambigua o sus suposiciones son erróneas.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe semanal

Obtenga las historias de IA que realmente importan.

Un correo electrónico útil a la semana: qué cambió en la IA, por qué es importante, además de herramientas, guías, oportunidades y formas prácticas de actuar.

Gratis · Sin spam · Darse de baja en un clic