發生了什麼事
NVIDIA 發布了使用 NemoClaw 建構的記憶體驅動的參謀長代理程式的技術設計,使用結構化 Markdown 記憶體、SQLite 義務帳本和 OpenShell 執行時間控制項。該公司報告了針對代理 RAG 基線的改進基準測試結果,同時指出該範例使用了發明數據和離線演練。
NVIDIA 表示,其 NemoClaw 範例建立了一個記憶驅動的參謀長代理,該代理維護了人類可讀的人員、專案、優先事項、目標和重複工作模式的「自我模型」。記憶體儲存在結構化 Markdown 頁面中,具有索引、交叉引用、來源和成長限制。一個單獨的 SQLite 分類帳記錄義務、排名、更正和審計事件,保留證據、知識和判斷之間的區別。
配方包括有界排名邏輯、對與指定使用者優先順序相關的義務進行優先排序的意圖閘、僅附加更正審核、規劃記憶體維護、合成訊息和記憶體頁面、單元測試和離線演練。 NVIDIA 表示該配方是開源的,並包裝為 NemoClaw 的可部署 Hermes 設定檔。目前範例不發送訊息或修改來源系統,其範例人員、組織、專案和訊息都是發明的。
NVIDIA 報告稱,使用 Nemotron 3 Ultra,自模型配置在 186 個問題上的總體準確率達到了 90.9%,而代理檢索增強生成基線的總體準確率為 82.8%。它還在難題、事實變化追蹤、時間點推理、實體消歧、多源綜合和引文覆蓋率方面報告了更高的分數。這些是範例儲存庫的代理記憶體基準測試的結果,而不是獨立評估。
NVIDIA 表示,在運行時,NemoClaw 與 OpenShell 集成,後者對代理進行沙箱處理並管理檔案系統、進程和網路存取。託管推理和 MCP 連接的憑證仍保留在沙箱之外。消息來源強調,檢索到的內容和記憶體是模型的輸入,而不是受信任的安全策略。未指定定價、一般可用性和支援的即時連接器。
為什麼這很重要
該設計為開發人員提供了一種具體的方法來分離來源證據、派生記憶、代理判斷和授權操作——這對於預期在不斷變化的工作場所環境中運行的系統來說是一個重要的區別。 NVIDIA 報告的基準收益可能有用,但它們來自公司自己的範例評估,並未在此來源中獨立建立。
長時間運行的代理程式需要區分來源訊息所說的內容與系統所相信的內容、系統已決定的內容以及允許執行的操作。 NVIDIA 的架構使這些邊界變得明確,這可以使證據攝取、記憶體維護、檢索和最終決策中的錯誤更容易診斷。
更正工作流程值得注意,因為使用者可以移動或忽略義務,在以後的運行中保留這些決策,並檢查或編輯產生的偏好策略。這為使用者提供了可見的回饋路徑,而不是僅僅依賴隱藏的模型狀態。對於必須適應不斷變化的優先事項而不是同等重要地對待每個緊急請求的助理來說,這可能實際上很有用。
所報告的收益對於變化的事實和時間點推理來說是最強的,而普通的對話歷史和檢索不能很好地處理這類問題。然而,評估僅限於來源自己的基準和範例實現。自我模型的一項指標——對語料庫的忠誠度——低於基線,這強調了提高整體準確性並不能消除權衡。
此安全模型還具有實際意義:記憶體可以在不授權的情況下通知操作。將憑證保留在沙箱之外並在運行時強制執行權限可以限制錯誤或惡意指令的影響,但來源不提供獨立的安全測試或來自即時企業部署的證據。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
接下來看什麼
該配方是否與真實工作場所資料、即時連接器和不同模型相似,以及組織在超越離線範例時如何處理憑證、隱私、保留、刪除和手動批准。
下一個有意義的測試是使用真實工作場所帳戶和即時連接器進行部署。 NVIDIA 表示,這些整合需要單獨處理憑證、隱私、保留和刪除,但消息來源沒有描述特定的政策、審批流程或連接器可用性。
獨立評估應測試所報告的改進是否在模型、領域、記憶體大小和不斷變化的資訊中持續存在,同時衡量錯誤的優先順序、過時或不正確的記憶體、引用失敗和定期維護的成本。
開發人員也應該觀察 OpenShell 策略在現實的提示注入和工具使用場景下的行為。 NVIDIA 描述了沙箱和治理功能,但該來源並未透過外部審計或對抗性評估來確定其有效性。
帖子中沒有記錄整個堆疊的定價、許可詳細資訊、生產支援和一般可用性。這些未知因素將影響該配方主要是教育參考還是企業部署的實用路徑。