Що сталося
Документ arXiv представляє Agentic Tool Unlearning, структуру, розроблену для агентів мовної моделі, які можуть викликати зовнішні інструменти. Автори стверджують, що звичайне відмова від навчання може пригнічувати пряме відкликання інформації моделлю, не заважаючи агенту відновлювати ту саму інформацію за допомогою веб-пошуку, пошуку або пошуку в базі даних.
У статті описується режим відмови, який він називає відновленням за допомогою інструментів. У звичайній мовній моделі відмова від навчання зазвичай оцінюється шляхом перевірки того, чи може модель все ще безпосередньо згадати визначену ціль зі своїх параметрів. Автори стверджують, що ця оцінка є неповною для агента, відповідь якого може залежати від викликів інструментів і зовнішніх спостережень. Такий агент може не вказати ціль із пам’яті, але отримати ту саму інформацію через зовнішнє джерело. Розрізнення важливе, оскільки спостережувана відповідь може залишатися доступною, навіть якщо внутрішня відповідь моделі змінилася. У цьому налаштуванні оцінка моделі без оцінки її дій може пропустити маршрут, за яким ціль відновлюється.
Пропонований метод, Agentic Tool Unlearning, має два етапи. По-перше, система застосовує параметричне відновлення знань, призначене для придушення прямого пригадування. По-друге, він використовує навчання підкріплення на рівні траєкторії в змодельованих середовищах, доповнених інструментами. Відповідно до анотації до статті, цей етап карає як поведінку інструменту пошуку цілі, так і витік у остаточній відповіді. Мета полягає в тому, щоб зменшити відновлення через дії агента, а не лише через зміни вагових коефіцієнтів моделі. Це робить послідовність рішень агента частиною проблеми розучування, включно з вибором шукати інформацію та способом включення отриманого матеріалу у відповідь.
Автори повідомляють про експерименти з контрольними тестами RWKU та MUSE на різних архітектурах мовної моделі. Вони кажуть, що метод досягає кращого балансу між забуттям визначеної цілі та збереженням нормальної корисності для знань, які повинні залишатися доступними. Надане джерело не надає числових результатів, назв моделей, вартості навчання, базових порівнянь або деталей змодельованих інструментів, тому силу та масштаб заявленого вдосконалення неможливо оцінити лише за анотацією. Через ці упущення результат краще розуміти як дослідницьку пропозицію зі звітними експериментами, а не як доказ того, що підхід перевірено на всіх розгорнутих системах.
Чому це важливо
У статті висвітлюється практична проблема безпеки та конфіденційності для систем, які поєднують мовні моделі із зовнішніми інструментами. Видалення знань із параметрів моделі може бути недостатнім, якщо агент усе ще може знайти або реконструювати ціль за допомогою навколишніх інструментів.
Знахідка має значення, оскільки доступ до інструменту змінює те, що для системи ШІ означає щось забути. Модель більше не може кодувати або відтворювати частину інформації напряму, але повний агент все ще може створювати її шляхом пошуку, отримання або запиту до підключеної бази даних. Тому для систем, що обробляють особисту, конфіденційну або іншу інформацію з обмеженим доступом, відповідною одиницею оцінки може бути повний робочий процес агента, а не окрема модель. Цей ширший погляд слідує за інформацією через весь шлях, який може дати відповідь, замість того, щоб розглядати параметри моделі як єдине можливе джерело.
Ця різниця також впливає на те, як організації інтерпретують претензії щодо видалення або видалення. Якщо запит спрямований на те, щоб запобігти створенню певної цілі агентом, лише зміна параметрів моделі може залишити альтернативний шлях відкритим. Документ не встановлює, що будь-яка розгорнута система на даний момент дає збій таким чином, але пропонує конкретну оцінку для перевірки того, чи інструменти агента підривають процедуру скасування навчання. Цей фрейм може допомогти відокремити зміну в тому, що згадує модель, від зміни в тому, що зібрана система ще може отримати. Він також зберігає обсяг претензії на видалення прив’язаною до поведінки користувачів, яку насправді можуть спостерігати.
Існує складний інженерний компроміс у запропонованій меті. Використання інструментів часто необхідне агенту, щоб відповісти на запитання про інформацію, яку він має зберігати. Покарання за надто великий пошук інструментів може зашкодити корисній поведінці, тоді як покарання за занадто мало може залишити забуту ціль відновленою. Заявлена в документі мета збереження збережених знань робить цей компроміс явним, але джерело не показує, наскільки добре цей підхід обробляє неоднозначні запити, непрямі запити або інструменти, що містять інформацію, що збігається. Таким чином, корисний метод повинен обмежувати небажаний маршрут, продовжуючи підтримувати використання інструменту, яке залишається законним, баланс, який не може бути виведений лише з анотації.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Що дивитися далі
Головне питання полягає в тому, чи описаний метод узагальнює межі змодельованих середовищ і контрольних показників у статті. Потрібна додаткова інформація про цільову інформацію, конфігурації інструментів, архітектури моделі, виміряні компроміси та те, чи підхід працює надійно, не порушуючи законне використання інструменту.
Повний документ має роз’яснити, що вважається успішним забуванням. Важливі деталі включають, чи перевіряє оцінювання лише точне цільове відтворення чи також перефрази, непрямі відповіді та багатоетапну реконструкцію. Він також повинен показати, як метод відрізняє заборонений пошук цілі від законного пошуку пов’язаних збережених знань, оскільки ця відмінність визначатиме, чи практичний підхід. Схема оцінювання матиме таке ж значення, як і результат заголовка: вузький тест може показати, що певну відповідь заблоковано, не показуючи, що базову інформацію неможливо отримати іншим шляхом. Чіткі визначення полегшили б інтерпретацію звітного балансу між забуванням і корисністю.
Реплікація буде важливою, оскільки досліджені експерименти використовують RWKU та MUSE та змодельоване середовище, доповнене інструментами. Читачі повинні шукати тести з різними типами інструментів, пошуковими системами, базами даних і сімействами моделей, а також оцінки, проведені поза межами навчальної установки авторів. В анотації не вказано, чи доступні код, середовища чи навчені моделі, тому відтворюваність наразі невідома. Незалежне тестування також допоможе визначити, чи залежить метод від конкретного способу, яким змодельовані інструменти надають інформацію, чи його обмеження залишаються ефективними, коли навколишня система налаштована інакше. Без цього порівняння загальність підходу залишається відкритим питанням.
Майбутні оцінки повинні вимірювати як безпеку, так і корисність на більш довгих траєкторіях агентів. Система, яка блокує прямий витік під час коротких тестів, може поводитися інакше, якщо вона може планувати, повторювати спроби, викликати кілька інструментів або об’єднувати часткові спостереження. Джерело також залишає відкритим, чи може Agentic Tool Unlearning адресувати інформацію, скопійовану в індекси інструментів або самі бази даних, і чи можна його застосувати до розгорнутих агентів без перенавчання їхніх оточуючих систем. Ці запитання пов’язують процедуру на рівні моделі з ширшим середовищем, у якому може відбуватися відновлення. Вони також вказують на те, чому для успішної демонстрації потрібно перевірити те, що агент відмовляється розкрити, і яку корисну інформацію він продовжує отримувати.