Что случилось
NVIDIA опубликовал технический проект управляемого памятью агента начальника штаба, созданного с помощью NemoClaw с использованием структурированной памяти Markdown, реестра обязательств SQLite и элементов управления временем выполнения OpenShell. Компания сообщает об улучшенных результатах тестов по сравнению с базовым уровнем агентного RAG, отмечая при этом, что в примере используются изобретенные данные и автономное пошаговое руководство.
NVIDIA утверждает, что его пример NemoClaw создает управляемого памятью агента руководителя аппарата, который поддерживает удобочитаемую «самомодель» людей, проектов, приоритетов, целей и повторяющихся моделей работы. Память хранится в структурированных страницах Markdown с индексацией, перекрестными ссылками, происхождением и ограничениями роста. В отдельном реестре SQLite фиксируются обязательства, рейтинги, исправления и события аудита, сохраняя различие между доказательствами, знаниями и суждениями.
Рецепт включает в себя логику ограниченного ранжирования, шлюз намерений, который определяет приоритетность обязательств, связанных с заявленными пользовательскими приоритетами, аудит исправлений только для добавления, плановое обслуживание памяти, синтетические сообщения и страницы памяти, модульные тесты и автономное пошаговое руководство. NVIDIA сообщает, что рецепт имеет открытый исходный код и упакован в виде развертываемого профиля Hermes для NemoClaw. Текущий пример не отправляет сообщения и не изменяет исходные системы, а его примеры людей, организаций, проектов и сообщений придуманы.
NVIDIA сообщает, что при использовании Nemotron 3 Ultra общая точность конфигурации собственной модели достигла 90,9% по 186 вопросам по сравнению с 82,8% для базового уровня с агентным поиском и дополненной генерацией. Он также сообщает о более высоких баллах по сложным вопросам, отслеживанию измененных фактов, рассуждениям на определенный момент времени, устранению неоднозначности сущностей, синтезу из нескольких источников и охвату цитирования. Это результаты теста памяти агента репозитория примера, а не независимой оценки.
NVIDIA сообщает, что во время выполнения NemoClaw интегрируется с OpenShell, который помещает агент в изолированную среду и управляет доступом к файловой системе, процессам и сети. Учетные данные для управляемого вывода и подключений MCP остаются за пределами изолированной программной среды. Источник подчеркивает, что полученный контент и память являются входными данными для модели, а не доверенной политики безопасности. Цены, общая доступность и поддерживаемые действующие разъемы не указаны.
Подробности об источнике: developer.nvidia.com ↗
Почему это важно
Дизайн предлагает разработчикам конкретный способ разделения исходных данных, производной памяти, суждений агентов и санкционированных действий — важное различие для систем, которые, как ожидается, будут работать в меняющемся контексте рабочего места. Результаты, о которых сообщает NVIDIA, потенциально полезны, но они основаны на собственном примере оценки компании и не были независимо установлены в этом источнике.
Агентам, работающим долго, необходимо отличать то, что говорит исходное сообщение, от того, во что верит система, что она решила и что ей разрешено делать. Архитектура NVIDIA делает эти границы явными, что может облегчить диагностику ошибок при приеме доказательств, обслуживании памяти, извлечении и принятии окончательных решений.
Рабочий процесс исправления примечателен тем, что пользователи могут перемещать или игнорировать обязательства, сохранять эти решения при последующих запусках, а также проверять или редактировать полученную политику предпочтений. Это дает пользователям видимый путь обратной связи вместо того, чтобы полагаться исключительно на скрытое состояние модели. Это может быть практически полезно для помощников, которым приходится адаптироваться к меняющимся приоритетам, не рассматривая каждый срочный запрос как одинаково важный.
Сообщаемый выигрыш наиболее выражен в случае изменения фактов и рассуждений на определенный момент времени — тех проблем, с которыми обычная история разговоров и их извлечение плохо справляются. Однако оценка ограничивается собственным эталоном источника и примером реализации. Один показатель — верность корпусу — был ниже для собственной модели, чем для базового показателя, что подчеркивает, что повышение совокупной точности не устраняет компромиссы.
Модель безопасности также имеет практическое значение: память может информировать о действии, не санкционируя его. Хранение учетных данных вне «песочницы» и принудительное применение разрешений во время выполнения может ограничить влияние ошибочных или вредоносных инструкций, но источник не предоставляет независимого тестирования безопасности или доказательств из реального корпоративного развертывания.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Что посмотреть дальше
Будет ли рецепт работать аналогичным образом с реальными данными на рабочем месте, действующими соединителями и различными моделями, а также как организации обрабатывают учетные данные, конфиденциальность, хранение, удаление и одобрение человека при выходе за рамки автономного примера.
Следующим значимым испытанием является развертывание с реальными учетными записями на рабочем месте и действующими коннекторами. NVIDIA утверждает, что эти интеграции требуют отдельного подхода к учетным данным, конфиденциальности, хранению и удалению, но источник не описывает конкретные политики, потоки утверждения или доступность соединителей.
Независимые оценки должны проверять, сохраняются ли сообщаемые улучшения в разных моделях, областях, размерах памяти и изменяющейся информации, одновременно измеряя ложную расстановку приоритетов, устаревшую или неправильную память, сбои цитирования и стоимость планового обслуживания.
Разработчикам также следует следить за тем, как политики OpenShell ведут себя в реалистичных сценариях быстрого внедрения и использования инструментов. NVIDIA описывает функции песочницы и управления, но этот источник не устанавливает их эффективность посредством внешнего аудита или состязательной оценки.
Цены, подробности лицензирования для всего стека, производственная поддержка и общая доступность в публикации не описаны. Эти неизвестные повлияют на то, будет ли рецепт в основном образовательным справочником или практическим путем к корпоративному развертыванию.