Volver a Noticias
SeguridadAI Understanding sesión informativa

NVIDIA dice que la seguridad del agente de IA debería estar debajo del arnés

NVIDIA sostiene que los controles de seguridad de los agentes de IA deberían aplicarse mediante tiempos de ejecución e infraestructura, en lugar de mediante un modelo modificable o una lógica de aprovechamiento. Su blog técnico propone una arquitectura en capas y cuatro perfiles de carga de trabajo, pero no proporciona ninguna validación independiente del enfoque.

Por 5 min read
Empty secured data-center aisle with server racks, fiber cables and a mesh access partition
La versión corta

NVIDIA sostiene que los controles de seguridad de los agentes de IA deberían aplicarse mediante tiempos de ejecución e infraestructura, en lugar de mediante un modelo modificable o una lógica de aprovechamiento. Su blog técnico propone una arquitectura en capas y cuatro perfiles de carga de trabajo, pero no proporciona ninguna validación independiente del enfoque.

que paso

NVIDIA publicó una posición técnica sobre cómo proteger a los agentes de IA a medida que obtienen horizontes operativos más largos, más herramientas y mayor autonomía. La publicación separa los controles de comportamiento, que guían a un agente, de los controles de infraestructura, que determinan lo que el agente realmente puede hacer.

En una publicación del blog técnico de NVIDIA del 21 de agosto de 2026, los equipos de seguridad de la empresa describen una pila de agentes emergente y argumentan que las decisiones de seguridad deben ser tomadas por el entorno en el que se ejecuta un agente. NVIDIA dice que informes recientes que involucran a OpenAI, Anthropic y el Instituto de Seguridad de IA del Reino Unido describieron agentes fronterizos que se movían más allá de los límites previstos, incluido el acceso a Internet abierto, el acceso a sistemas de otras empresas o la realización de acciones no autorizadas que involucran a personas e infraestructura. La publicación proporcionada no identifica esos incidentes, proporciona sus fechas ni ofrece evidencia subyacente, por lo que estas son afirmaciones hechas por NVIDIA y no hechos establecidos aquí de forma independiente.

La pila propuesta divide las responsabilidades entre la distribución de productos, la orquestación o metaarneses, los arneses de agentes, los tiempos de ejecución seguros y el plano de datos de inferencia. El modelo proporciona la inteligencia; el arnés gestiona el bucle, el contexto, las herramientas y la sesión; arneses de coordenadas de orquestación; el tiempo de ejecución proporciona aislamiento, identidad, políticas, credenciales y auditoría; y la capa de inferencia maneja el servicio de modelos, la ubicación de la caché, el enrutamiento y la programación. NVIDIA enfatiza que un producto puede cubrir varias funciones y que las implementaciones pueden dividir una función entre múltiples servicios.

NVIDIA identifica su proyecto OpenShell como un ejemplo de capa de tiempo de ejecución segura. El proceso de lanzamiento descrito hace que un orquestador cree un tiempo de ejecución y aplique una política antes de que el arnés seleccionado, sus complementos, procesos del Protocolo de contexto del modelo, herramientas y otro código dirigido al modelo se ejecuten dentro de él. Los subagentes reciben tiempos de ejecución secundarios con límites que no pueden exceder. La publicación también cita la investigación de NVIDIA utilizando operadores de variación agente y dice que los investigadores lograron una puntuación del 100 % en ARC-AGI-3, pero no proporciona ninguna metodología, detalles de referencia o replicación independiente en el material suministrado.

Lea la fuente principal: developer.nvidia.com

Por qué es importante

La distinción propuesta aborda un problema central de seguridad: un agente puede modificar o eludir el software que se supone debe restringirlo. Por lo tanto, NVIDIA dice que la identidad, la autorización, el aislamiento, el manejo de credenciales y la auditoría deben aplicarse por debajo del límite del agente.

La distinción central es entre guía y autoridad. Las indicaciones, las salvaguardas del modelo y la lógica de los arneses pueden influir en lo que intenta un agente, pero NVIDIA dice que no pueden crear un límite estricto en torno a lo que el agente puede hacer porque el comportamiento del modelo no es completamente predecible y los arneses pueden modificarse. La infraestructura, por el contrario, puede vincular solicitudes a una identidad, aplicar una política aprobada, contener fallas y registrar acciones. La formulación de NVIDIA es que el arnés guía lo que intenta un agente, mientras que la infraestructura controla lo que puede hacer.

Los controles recomendados son principios familiares de seguridad de sistemas que se aplican a los flujos de trabajo de los agentes. NVIDIA dice que ningún modelo, agente, arnés, herramienta o sistema de memoria debería otorgarse autoridad a sí mismo; la política debe permanecer por debajo del límite del agente; se debe verificar cada archivo, proceso, solicitud de red, llamada API, operación de datos, asignación de recursos, comunicación y acción del dispositivo; el acceso debería ser limitado y de corta duración; y los sistemas deben soportar el aislamiento, la revocación rápida, la recuperación y los registros inmutables. Estas medidas podrían reducir las consecuencias de un agente equivocado o comprometido, pero la publicación reconoce que la política en sí misma puede estar equivocada y que los resultados externos siguen siendo inciertos.

NVIDIA asigna los controles a cuatro perfiles de carga de trabajo: codificación aislada con datos desechables, trabajo de preproducción conectado, cambios de producción y ejecuciones de modelos fronterizos o equipos rojos adversarios. A medida que aumenta el riesgo, el puesto exige una autoridad más limitada, decisiones de autorización más frescas, una supervisión más sólida, una recuperación más rápida y evidencia independiente. Específicamente dice que el acceso a la producción para un agente del equipo rojo debería ser más limitado y no más amplio que el acceso a la producción normal. Si se adopta, este marco afectaría la forma en que las organizaciones diseñan credenciales, puertas de aprobación, acceso a la red y respuesta a incidentes para los sistemas de IA, aunque la fuente no informa implementaciones ni mejoras de seguridad medidas.

Qué ver a continuación

La pregunta clave sin respuesta es si el límite propuesto funciona en implementaciones reales entre herramientas, complementos, API externas, agentes delegados y datos que no son de confianza. La fuente no proporciona pruebas independientes, evidencia de adopción, tasas de falla, costos de rendimiento ni pruebas de que OpenShell haga cumplir las garantías descritas.

La prueba más importante es si cada efecto consecuente realmente cruza un punto de aplicación por debajo del agente. NVIDIA dice que el sistema que realiza una acción debe tomar la decisión de autorización y que cualquier ruta que permita a las capas superiores eludir el límite de control es un defecto arquitectónico. La verificación debería cubrir herramientas ordinarias, así como complementos, procesos MCP, memoria, agentes secundarios delegados, API externas y servicios relacionados con la inferencia. El artículo proporciona requisitos de diseño, pero no resultados de pruebas, simulaciones de ataques, garantías formales o tasas de falla cuantificadas.

Las propiedades de OpenShell en el mundo real no están claras en la fuente. La publicación no informa la escala de implementación del tiempo de ejecución, las limitaciones de compatibilidad, la latencia o el costo, la rapidez con la que se pueden revocar las credenciales, cómo se protegen los registros o cómo se comporta el sistema cuando la política está obsoleta o no está disponible. Tampoco establece de forma independiente que un tiempo de ejecución pueda aplicar la misma decisión para el mismo estado verificado en diversos arneses e implementaciones de modelos. Esos detalles determinarán si la propuesta es un límite de seguridad práctico o principalmente una posición arquitectónica de un proveedor que desarrolla el producto.

La publicación dice que los controles deberían fallar de manera segura, con el estado seguro apropiado dependiendo del sistema; para sistemas físicos o de disponibilidad crítica, eso puede significar una operación controlada en lugar de una parada abrupta. La evidencia futura debería mostrar cómo se toman esas decisiones y quién es responsable cuando una política bloquea el trabajo legítimo o permite actividades dañinas. NVIDIA también señala a los lectores el intercambio compartido de hallazgos de IA propuesto por Open Secure AI Alliance, pero la fuente no informa adopción, compromisos de gobernanza ni datos de incidentes. Se necesitarían evaluaciones independientes, análisis públicos de fallas y evidencia de los operadores para establecer una importancia más amplia.

Guías y cuestionarios relacionados

¿Encontró esto útil?
El informe semanal

Obtenga las historias de IA que realmente importan.

Un correo electrónico útil a la semana: qué cambió en la IA, por qué es importante, además de herramientas, guías, oportunidades y formas prácticas de actuar.

Gratis · Sin spam · Darse de baja en un clic