Назад до новин
БезпекаAI Understanding брифінг

Документ попереджає, що агенти LLM можуть відновлювати видалені знання за допомогою інструментів

Нова стаття arXiv визначає прогалину в ненавчанні LLM: агент може припинити згадувати інформацію зі своїх ваг, але відновити її за допомогою інструментів веб-пошуку, пошуку або бази даних. Автори пропонують двоетапний метод для зменшення обох форм відновлення, зберігаючи законне використання інструменту.

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
Першоджерельний документДжерело записано
Видавець
arxiv.org
Посилання на джерело
arxiv.orghttps://arxiv.org/abs/2608.21544
Тип джерела
Первинний документ — офіційне оголошення, папір, документ або сторінка першої сторони, яку ми безпосередньо читаємо.
КонтекстЗрозумійте це за 60 секунд

Почніть тут

Ключові терміни

Велика мовна модель (LLM)
Мовна модель, навчена на масивних текстових корпусах для створення та аналізу тексту.
Навчання з підкріпленням
Навчання за сигналами винагороди, коли агент навчається діям, які максимізують довгострокову віддачу.
Пам'ять (Пам'ять агента)
Збережений контекст агент штучного інтелекту використовує на етапах або сеансах для покращення безперервності.
Перевір себеВікторина агентів ШІ

Що сталося

Документ arXiv представляє Agentic Tool Unlearning, структуру, розроблену для агентів мовної моделі, які можуть викликати зовнішні інструменти. Автори стверджують, що звичайне відмова від навчання може пригнічувати пряме відкликання інформації моделлю, не заважаючи агенту відновлювати ту саму інформацію за допомогою веб-пошуку, пошуку або пошуку в базі даних.

У статті описується режим відмови, який він називає відновленням за допомогою інструментів. У звичайній мовній моделі відмова від навчання зазвичай оцінюється шляхом перевірки того, чи може модель все ще безпосередньо згадати визначену ціль зі своїх параметрів. Автори стверджують, що ця оцінка є неповною для агента, відповідь якого може залежати від викликів інструментів і зовнішніх спостережень. Такий агент може не вказати ціль із пам’яті, але отримати ту саму інформацію через зовнішнє джерело. Розрізнення важливе, оскільки спостережувана відповідь може залишатися доступною, навіть якщо внутрішня відповідь моделі змінилася. У цьому налаштуванні оцінка моделі без оцінки її дій може пропустити маршрут, за яким ціль відновлюється.

Пропонований метод, Agentic Tool Unlearning, має два етапи. По-перше, система застосовує параметричне відновлення знань, призначене для придушення прямого пригадування. По-друге, він використовує навчання підкріплення на рівні траєкторії в змодельованих середовищах, доповнених інструментами. Відповідно до анотації до статті, цей етап карає як поведінку інструменту пошуку цілі, так і витік у остаточній відповіді. Мета полягає в тому, щоб зменшити відновлення через дії агента, а не лише через зміни вагових коефіцієнтів моделі. Це робить послідовність рішень агента частиною проблеми розучування, включно з вибором шукати інформацію та способом включення отриманого матеріалу у відповідь.

Автори повідомляють про експерименти з контрольними тестами RWKU та MUSE на різних архітектурах мовної моделі. Вони кажуть, що метод досягає кращого балансу між забуттям визначеної цілі та збереженням нормальної корисності для знань, які повинні залишатися доступними. Надане джерело не надає числових результатів, назв моделей, вартості навчання, базових порівнянь або деталей змодельованих інструментів, тому силу та масштаб заявленого вдосконалення неможливо оцінити лише за анотацією. Через ці упущення результат краще розуміти як дослідницьку пропозицію зі звітними експериментами, а не як доказ того, що підхід перевірено на всіх розгорнутих системах.

Деталі джерела: arxiv.org ↗

Чому це важливо

У статті висвітлюється практична проблема безпеки та конфіденційності для систем, які поєднують мовні моделі із зовнішніми інструментами. Видалення знань із параметрів моделі може бути недостатнім, якщо агент усе ще може знайти або реконструювати ціль за допомогою навколишніх інструментів.

Знахідка має значення, оскільки доступ до інструменту змінює те, що для системи ШІ означає щось забути. Модель більше не може кодувати або відтворювати частину інформації напряму, але повний агент все ще може створювати її шляхом пошуку, отримання або запиту до підключеної бази даних. Тому для систем, що обробляють особисту, конфіденційну або іншу інформацію з обмеженим доступом, відповідною одиницею оцінки може бути повний робочий процес агента, а не окрема модель. Цей ширший погляд слідує за інформацією через весь шлях, який може дати відповідь, замість того, щоб розглядати параметри моделі як єдине можливе джерело.

Ця різниця також впливає на те, як організації інтерпретують претензії щодо видалення або видалення. Якщо запит спрямований на те, щоб запобігти створенню певної цілі агентом, лише зміна параметрів моделі може залишити альтернативний шлях відкритим. Документ не встановлює, що будь-яка розгорнута система на даний момент дає збій таким чином, але пропонує конкретну оцінку для перевірки того, чи інструменти агента підривають процедуру скасування навчання. Цей фрейм може допомогти відокремити зміну в тому, що згадує модель, від зміни в тому, що зібрана система ще може отримати. Він також зберігає обсяг претензії на видалення прив’язаною до поведінки користувачів, яку насправді можуть спостерігати.

Існує складний інженерний компроміс у запропонованій меті. Використання інструментів часто необхідне агенту, щоб відповісти на запитання про інформацію, яку він має зберігати. Покарання за надто великий пошук інструментів може зашкодити корисній поведінці, тоді як покарання за занадто мало може залишити забуту ціль відновленою. Заявлена ​​в документі мета збереження збережених знань робить цей компроміс явним, але джерело не показує, наскільки добре цей підхід обробляє неоднозначні запити, непрямі запити або інструменти, що містять інформацію, що збігається. Таким чином, корисний метод повинен обмежувати небажаний маршрут, продовжуючи підтримувати використання інструменту, яке залишається законним, баланс, який не може бути виведений лише з анотації.

Interactive Mechanism

Інтерактивний механізм: як він насправді працює

Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Інтерактивна перевірка концепції+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Що дивитися далі

Головне питання полягає в тому, чи описаний метод узагальнює межі змодельованих середовищ і контрольних показників у статті. Потрібна додаткова інформація про цільову інформацію, конфігурації інструментів, архітектури моделі, виміряні компроміси та те, чи підхід працює надійно, не порушуючи законне використання інструменту.

Повний документ має роз’яснити, що вважається успішним забуванням. Важливі деталі включають, чи перевіряє оцінювання лише точне цільове відтворення чи також перефрази, непрямі відповіді та багатоетапну реконструкцію. Він також повинен показати, як метод відрізняє заборонений пошук цілі від законного пошуку пов’язаних збережених знань, оскільки ця відмінність визначатиме, чи практичний підхід. Схема оцінювання матиме таке ж значення, як і результат заголовка: вузький тест може показати, що певну відповідь заблоковано, не показуючи, що базову інформацію неможливо отримати іншим шляхом. Чіткі визначення полегшили б інтерпретацію звітного балансу між забуванням і корисністю.

Реплікація буде важливою, оскільки досліджені експерименти використовують RWKU та MUSE та змодельоване середовище, доповнене інструментами. Читачі повинні шукати тести з різними типами інструментів, пошуковими системами, базами даних і сімействами моделей, а також оцінки, проведені поза межами навчальної установки авторів. В анотації не вказано, чи доступні код, середовища чи навчені моделі, тому відтворюваність наразі невідома. Незалежне тестування також допоможе визначити, чи залежить метод від конкретного способу, яким змодельовані інструменти надають інформацію, чи його обмеження залишаються ефективними, коли навколишня система налаштована інакше. Без цього порівняння загальність підходу залишається відкритим питанням.

Майбутні оцінки повинні вимірювати як безпеку, так і корисність на більш довгих траєкторіях агентів. Система, яка блокує прямий витік під час коротких тестів, може поводитися інакше, якщо вона може планувати, повторювати спроби, викликати кілька інструментів або об’єднувати часткові спостереження. Джерело також залишає відкритим, чи може Agentic Tool Unlearning адресувати інформацію, скопійовану в індекси інструментів або самі бази даних, і чи можна його застосувати до розгорнутих агентів без перенавчання їхніх оточуючих систем. Ці запитання пов’язують процедуру на рівні моделі з ширшим середовищем, у якому може відбуватися відновлення. Вони також вказують на те, чому для успішної демонстрації потрібно перевірити те, що агент відмовляється розкрити, і яку корисну інформацію він продовжує отримувати.

Пов’язані посібники та вікторини

Агенти ШІChatGPT і LLMПояснення моделей AIЕтика ШІПеревірте свої знання — пройдіть безкоштовну вікторину зі штучним інтелектомЗнайдіть термін ШІ в нашому глосаріїДотримуйтесь трекера регулювання ШІ
Знайшли це корисним?