Que s'est-il passé
NVIDIA a publié une conception technique pour un agent de chef d'état-major basé sur la mémoire, construit avec NemoClaw, utilisant une mémoire Markdown structurée, un registre d'obligations SQLite et des contrôles d'exécution OpenShell. La société rapporte des résultats de référence améliorés par rapport à une référence agentique RAG, tout en notant que l'exemple utilise des données inventées et une procédure pas à pas hors ligne.
NVIDIA affirme que son exemple NemoClaw construit un agent de chef d'état-major basé sur la mémoire qui maintient un « modèle personnel » lisible par l'homme des personnes, des projets, des priorités, des objectifs et des modèles de travail récurrents. La mémoire est stockée dans des pages Markdown structurées avec des limites d'indexation, de références croisées, de provenance et de croissance. Un grand livre SQLite distinct enregistre les obligations, les classements, les corrections et les événements d'audit, préservant ainsi la distinction entre preuves, connaissances et jugement.
La recette comprend une logique de classement limité, une porte d'intention qui donne la priorité aux obligations liées aux priorités déclarées de l'utilisateur, des audits de correction par ajout uniquement, une maintenance planifiée de la mémoire, des messages synthétiques et des pages de mémoire, des tests unitaires et une procédure pas à pas hors ligne. NVIDIA indique que la recette est open source et présentée sous forme de profil Hermes déployable pour NemoClaw. L'exemple actuel n'envoie pas de messages ni ne modifie les systèmes sources, et ses exemples de personnes, d'organisations, de projets et de messages sont inventés.
NVIDIA rapporte qu'en utilisant Nemotron 3 Ultra, la configuration de l'auto-modèle a atteint une précision globale de 90,9 % sur 186 questions, contre 82,8 % pour une référence de génération augmentée par récupération agent. Il rapporte également des scores plus élevés sur les questions difficiles, le suivi des faits modifiés, le raisonnement ponctuel, la désambiguïsation des entités, la synthèse multisource et la couverture des citations. Il s’agit des résultats de l’Agent Memory Benchmark de l’exemple de référentiel, et non d’une évaluation indépendante.
Au moment de l'exécution, NVIDIA indique que NemoClaw s'intègre à OpenShell, qui met l'agent en sandbox et régit l'accès au système de fichiers, aux processus et au réseau. Les informations d’identification pour l’inférence gérée et les connexions MCP restent en dehors du bac à sable. La source souligne que le contenu et la mémoire récupérés sont des entrées dans le modèle et non une politique de sécurité fiable. Les prix, la disponibilité générale et les connecteurs live pris en charge ne sont pas spécifiés.
Détails de la source: developer.nvidia.com ↗
Pourquoi c'est important
La conception offre aux développeurs un moyen concret de séparer les preuves sources, la mémoire dérivée, les jugements des agents et les actions autorisées – une distinction importante pour les systèmes censés fonctionner dans un contexte de travail changeant. Les gains de référence rapportés par NVIDIA sont potentiellement utiles, mais ils proviennent de l'exemple d'évaluation de l'entreprise et n'ont pas été établis de manière indépendante dans cette source.
Les agents qui fonctionnent depuis longtemps doivent distinguer ce que dit un message source de ce que croit le système, de ce qu'il a décidé et de ce qu'il est autorisé à faire. L'architecture de NVIDIA rend ces limites explicites, ce qui pourrait faciliter le diagnostic des erreurs lors de l'ingestion de preuves, de la maintenance de la mémoire, de la récupération et de la prise de décision finale.
Le flux de travail de correction est remarquable car les utilisateurs peuvent déplacer ou ignorer les obligations, conserver ces décisions lors d'exécutions ultérieures et inspecter ou modifier la politique de préférence qui en résulte. Cela donne aux utilisateurs un chemin de retour visible au lieu de s'appuyer uniquement sur l'état caché du modèle. Cela peut être utile en pratique pour les assistants qui doivent s'adapter à des priorités changeantes sans traiter chaque demande urgente comme étant d'égale importance.
Les gains rapportés sont plus importants pour les faits modifiés et le raisonnement ponctuel, types de problèmes que l’historique et la récupération de conversations ordinaires peuvent mal résoudre. Cependant, l’évaluation se limite au référentiel et à l’exemple de mise en œuvre de la source. Une mesure – la fidélité au corpus – était plus faible pour le modèle personnel que pour le modèle de référence, ce qui souligne qu’une précision globale améliorée n’élimine pas les compromis.
Le modèle de sécurité comporte également une implication pratique : la mémoire peut éclairer une action sans l’autoriser. Conserver les informations d'identification en dehors du bac à sable et appliquer les autorisations au moment de l'exécution pourraient limiter l'impact d'une instruction erronée ou malveillante, mais la source ne fournit pas de tests de sécurité indépendants ni de preuves provenant d'un déploiement d'entreprise en direct.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Que regarder ensuite
Si la recette fonctionne de la même manière avec des données réelles sur le lieu de travail, des connecteurs actifs et différents modèles, et comment les organisations gèrent les informations d'identification, la confidentialité, la conservation, la suppression et l'approbation humaine lorsqu'elles dépassent l'exemple hors ligne.
Le prochain test significatif est le déploiement avec de vrais comptes de travail et des connecteurs en direct. NVIDIA indique que ces intégrations nécessitent un traitement distinct des informations d'identification, de la confidentialité, de la conservation et de la suppression, mais la source ne décrit pas de politiques spécifiques, de flux d'approbation ou de disponibilité des connecteurs.
Des évaluations indépendantes devraient tester si les améliorations signalées persistent dans tous les modèles, domaines, tailles de mémoire et informations changeantes, tout en mesurant les fausses priorités, les mémoires obsolètes ou incorrectes, les échecs de citation et le coût de la maintenance planifiée.
Les développeurs doivent également surveiller le comportement des politiques OpenShell dans des scénarios réalistes d’injection rapide et d’utilisation d’outils. NVIDIA décrit les fonctionnalités du bac à sable et de la gouvernance, mais cette source n'établit pas leur efficacité par le biais d'un audit externe ou d'une évaluation contradictoire.
Les prix, les détails de licence pour la pile complète, le support de production et la disponibilité générale ne sont pas documentés dans l'article. Ces inconnues détermineront si la recette est principalement une référence pédagogique ou un chemin pratique vers le déploiement en entreprise.