Що сталося
NVIDIA опублікував технічний дизайн керованого пам’яттю агента керівника штабу, створеного за допомогою NemoClaw, використовуючи структуровану пам’ять Markdown, облікову книгу зобов’язань SQLite та елементи керування OpenShell. Компанія повідомляє про покращення результатів порівняльного тесту порівняно з базовою лінією RAG агента, зазначаючи, що в цьому прикладі використовуються вигадані дані та офлайн-покрокове керівництво.
NVIDIA каже, що його приклад NemoClaw створює керованого пам’яттю агента керівника штабу, який підтримує зрозумілу людині «самомодель» людей, проектів, пріоритетів, цілей і повторюваних моделей роботи. Пам’ять зберігається на структурованих сторінках Markdown з індексуванням, перехресними посиланнями, походженням і обмеженнями зростання. Окрема книга SQLite записує зобов’язання, рейтинги, виправлення та події аудиту, зберігаючи різницю між доказами, знаннями та судженнями.
Рецепт включає логіку обмеженого ранжирування, шлюз намірів, який визначає пріоритетність зобов’язань, пов’язаних із заявленими пріоритетами користувача, перевірки виправлень лише для додавання, заплановане обслуговування пам’яті, синтетичні повідомлення та сторінки пам’яті, модульні тести та покрокове керівництво в автономному режимі. NVIDIA каже, що рецепт є відкритим кодом і упакований як розгортаний профіль Hermes для NemoClaw. Поточний приклад не надсилає повідомлення та не змінює вихідні системи, а його зразки людей, організацій, проектів і повідомлень вигадані.
NVIDIA повідомляє, що за допомогою Nemotron 3 Ultra конфігурація власної моделі досягла 90,9% загальної точності на 186 запитань у порівнянні з 82,8% для базової лінії генерації агентного пошуку з доповненим пошуком. Він також повідомляє про вищі бали за складні запитання, відстеження змінених фактів, міркування на певний момент часу, усунення неоднозначності, синтез із багатьох джерел і охоплення цитуваннями. Це результати тесту Agent Memory Benchmark для прикладу сховища, а не незалежної оцінки.
Під час виконання NVIDIA каже, що NemoClaw інтегрується з OpenShell, який містить агента в пісочниці та керує файловою системою, процесами та доступом до мережі. Облікові дані для керованого висновку та з’єднань MCP залишаються за межами пісочниці. Джерело підкреслює, що отриманий вміст і пам'ять є вхідними даними для моделі, а не надійною політикою безпеки. Ціна, загальна доступність і підтримувані живі з’єднувачі не вказуються.
Деталі джерела: developer.nvidia.com ↗
Чому це важливо
Дизайн пропонує розробникам конкретний спосіб відокремлення джерельних доказів, похідної пам’яті, суджень агентів і санкціонованих дій — важлива відмінність для систем, які, як очікується, працюватимуть у мінливому контексті робочого місця. Повідомлені NVIDIA прибутки в еталонних показниках потенційно корисні, але вони отримані з власної оцінки компанії й не були незалежно встановлені в цьому джерелі.
Довгопрацюючим агентам необхідно відрізняти те, що говорить вихідне повідомлення, від того, у що система вірить, що вона вирішила та що їй дозволено робити. Архітектура NVIDIA робить ці межі явними, що може спростити діагностику помилок під час прийому даних, підтримки пам’яті, пошуку та остаточного прийняття рішень.
Робочий процес виправлення примітний тим, що користувачі можуть переміщувати або ігнорувати зобов’язання, зберігати ці рішення під час наступних запусків і перевіряти чи редагувати результуючу політику переваг. Це дає користувачам видимий шлях зворотного зв’язку замість того, щоб покладатися виключно на прихований стан моделі. Це може бути практично корисним для помічників, які повинні адаптуватися до зміни пріоритетів, не розглядаючи кожен терміновий запит як однаково важливий.
Повідомлені здобутки є найсильнішими для змінених фактів і міркувань на певний момент часу, тих проблем, з якими звичайна історія розмов і пошук погано справляються. Однак оцінка обмежена власним еталонним тестом джерела та прикладом реалізації. Один показник — вірність корпусу — був нижчим для власної моделі, ніж для базової лінії, що підкреслює, що покращена сукупна точність не усуває компромісів.
Модель безпеки також має практичний підтекст: пам’ять може інформувати про дію, не дозволяючи її. Зберігання облікових даних за межами пісочниці та застосування дозволів під час виконання може обмежити вплив помилкової чи зловмисної інструкції, але джерело не надає незалежного тестування безпеки чи доказів із живого корпоративного розгортання.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Що дивитися далі
Чи працює рецепт аналогічно з даними реального робочого місця, живими з’єднувачами та різними моделями, а також як організації обробляють облікові дані, конфіденційність, збереження, видалення та схвалення людиною, коли виходять за межі офлайн-прикладу.
Наступним значущим тестом є розгортання з реальними робочими обліковими записами та живими конекторами. NVIDIA каже, що ці інтеграції вимагають окремої обробки облікових даних, конфіденційності, збереження та видалення, але джерело не описує конкретні політики, потоки затвердження чи доступність конектора.
Незалежні оцінки мають перевіряти, чи зберігаються зазначені покращення в моделях, доменах, розмірах пам’яті та змінах інформації, одночасно вимірюючи помилкове встановлення пріоритетів, застарілу або неправильну пам’ять, помилки цитування та вартість планового обслуговування.
Розробникам також слід спостерігати за поведінкою політик OpenShell у реалістичних сценаріях швидкого впровадження та використання інструментів. NVIDIA описує функції пісочниці та керування, але це джерело не встановлює їх ефективність за допомогою зовнішнього аудиту чи змагальної оцінки.
Ціни, деталі ліцензування для повного пакету, підтримка виробництва та загальна доступність не задокументовані в публікації. Ці невідомі вплинуть на те, чи буде рецепт переважно освітнім довідником чи практичним шляхом до розгортання підприємства.