Вернуться к новостям
БезопасностьAI Understanding брифинг

В документе предупреждается, что агенты LLM могут восстановить удаленные знания с помощью инструментов.

В новой статье arXiv указан пробел в отучении LLM: агент может перестать вызывать информацию из своих весов, но восстановить ее с помощью инструментов веб-поиска, извлечения данных или базы данных. Авторы предлагают двухэтапный метод, позволяющий сократить обе формы восстановления при сохранении законного использования инструментов.

5 min readRead the primary source
Primary-source image accompanying Paper warns that LLM agents can recover deleted knowledge through tools
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.21544
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Обучение с подкреплением
Обучение с помощью сигналов вознаграждения, когда агент учится действиям, которые максимизируют долгосрочную отдачу.
Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

В документе arXiv представлена ​​функция отучения агентских инструментов — платформа, разработанная для агентов языковой модели, которые могут вызывать внешние инструменты. Авторы утверждают, что обычное отучение может подавить прямое запоминание информации моделью, не мешая агенту восстановить ту же информацию посредством веб-поиска, поиска или поиска в базе данных.

В документе описан режим отказа, который он называет восстановлением с помощью инструментов. В традиционной языковой модели отучение обычно оценивается путем проверки того, может ли модель по-прежнему напрямую вызывать обозначенную цель по своим параметрам. Авторы утверждают, что эта оценка является неполной для агента, ответ которого может зависеть от вызовов инструментов и внешних наблюдений. Такой агент может не указать цель из памяти, но получить ту же информацию через внешний источник. Это различие важно, поскольку наблюдаемый ответ может оставаться доступным, даже если внутренняя реакция модели изменилась. В этом случае оценка модели без оценки ее действий может упустить путь восстановления цели.

Предлагаемый метод «Отучение агентного инструмента» состоит из двух этапов. Во-первых, система применяет параметрическое отучение знаний, предназначенное для подавления прямого воспроизведения. Во-вторых, он использует обучение с подкреплением на уровне траектории в смоделированных средах, дополненных инструментами. Согласно аннотации статьи, на этом этапе наказываются как поведение инструмента поиска цели, так и утечка окончательного ответа. Цель состоит в том, чтобы уменьшить восстановление за счет действий агента, а не просто за счет изменения весов модели. Это делает последовательность решений агента частью проблемы отучения, включая выбор поиска информации и способ включения полученного материала в ответ.

Авторы сообщают об экспериментах с тестами отучения RWKU и MUSE в различных архитектурах языковых моделей. Они говорят, что этот метод обеспечивает лучший баланс между забыванием намеченной цели и сохранением нормальной полезности знаний, которые должны оставаться доступными. Предоставленный источник не предоставляет числовых результатов, названий моделей, затрат на обучение, базовых сравнений или подробностей смоделированных инструментов, поэтому силу и масштабы сообщаемого улучшения нельзя оценить только на основе аннотации. Из-за этих упущений результат лучше всего воспринимать как исследовательское предложение с описанными экспериментами, а не как свидетельство того, что подход был проверен во всех развернутых системах.

Подробности об источнике: arxiv.org ↗

Почему это важно

В статье освещается практическая проблема безопасности и конфиденциальности систем, сочетающих языковые модели с внешними инструментами. Удаление знаний из параметров модели может оказаться недостаточным, если агент все еще может найти или реконструировать цель с помощью окружающих его инструментов.

Этот вывод важен, потому что доступ к инструментам меняет то, что значит для системы ИИ что-то забыть. Модель больше не может напрямую кодировать или воспроизводить часть информации, однако полноценный агент все равно может создавать ее путем поиска, извлечения или запроса к подключенной базе данных. Поэтому для систем, обрабатывающих личную, частную или иную ограниченную информацию, соответствующей единицей оценки может быть полный рабочий процесс агента, а не модель в отдельности. Этот более широкий взгляд отслеживает информацию по всему пути, который может дать ответ, вместо того, чтобы рассматривать параметры модели как единственно возможный источник.

Это различие также влияет на то, как организации интерпретируют заявления об удалении или удалении. Если запрос предназначен для предотвращения создания агентом определенной цели, изменение параметров модели само по себе может оставить альтернативный маршрут открытым. В документе не установлено, что какая-либо развернутая система в настоящее время дает сбой таким образом, но он предлагает конкретную систему оценки для проверки того, подрывают ли инструменты агента процедуру отучения. Этот фрейм может помочь отделить изменения в том, что вспоминает модель, от изменений в том, что еще может получить собранная система. Кроме того, объем требования об удалении привязан к поведению, которое пользователи действительно могут наблюдать.

Предлагаемая цель требует сложного инженерного компромисса. Использование инструментов часто необходимо агенту для ответа на вопросы об информации, которую он должен хранить. Слишком частое наказание за поиск инструментов может повредить полезному поведению, тогда как слишком слабое наказание может привести к тому, что забытую цель можно будет восстановить. Заявленная в документе цель сохранения сохраненных знаний делает этот компромисс явным, но источник не показывает, насколько хорошо этот подход обрабатывает неоднозначные запросы, косвенные запросы или инструменты, содержащие перекрывающуюся информацию. Поэтому полезный метод должен ограничивать нежелательный маршрут, продолжая при этом поддерживать использование инструмента, которое остается законным, - баланс, который нельзя вывести только из абстракции.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Главный вопрос заключается в том, распространяется ли описанный метод за пределы смоделированных сред и тестов, описанных в статье. Требуется более подробная информация о целевой информации, конфигурациях инструментов, архитектуре моделей, измеренных компромиссах и о том, работает ли подход надежно, не нарушая законного использования инструментов.

В полной статье должно быть разъяснено, что считается успешным забыванием. Важными деталями являются то, проверяется ли оценка только точного воспроизведения цели или также перефразирования, косвенных ответов и многоэтапной реконструкции. Следует также показать, как этот метод отличает запрещенный поиск цели от законного извлечения соответствующих сохраненных знаний, поскольку это различие будет определять, является ли данный подход практичным. Схема оценки будет иметь такое же значение, как и результат заголовка: узкий тест может показать, что конкретный ответ заблокирован, не показывая, что основная информация не может быть получена другим путем. Четкие определения облегчили бы интерпретацию сообщаемого баланса между забыванием и полезностью.

Репликация будет важна, поскольку в описанных экспериментах используются RWKU и MUSE, а также моделируются среды, дополненные инструментами. Читателям следует искать тесты с различными типами инструментов, поисковыми системами, базами данных и семействами моделей, а также оценки, проведенные вне системы обучения авторов. В аннотации не говорится, доступен ли код, среда или обученные модели, поэтому воспроизводимость в настоящее время неизвестна. Независимое тестирование также поможет определить, зависит ли метод от конкретного способа, которым смоделированные инструменты предоставляют информацию, или его ограничения остаются эффективными, когда окружающая система настроена по-другому. Без этого сравнения общность подхода остается открытым вопросом.

Будущие оценки должны измерять как безопасность, так и полезность на более длинных траекториях агентов. Система, которая блокирует прямую утечку в коротких тестах, может вести себя по-другому, когда она может планировать, повторять попытки, вызывать несколько инструментов или комбинировать частичные наблюдения. Источник также оставляет открытым вопрос, может ли отучение агентских инструментов обращаться к информации, скопированной в сами индексы инструментов или базы данных, и может ли оно применяться к развернутым агентам без переобучения окружающих их систем. Эти вопросы связывают процедуру на уровне модели с более широкой средой, в которой может произойти восстановление. Они также указывают на то, почему для успешной демонстрации необходимо будет изучить и то, что агент отказывается раскрывать, и какую полезную информацию он продолжает получать.

Сопутствующие руководства и викторины

ИИ-агентыChatGPT и LLMОбъяснение моделей искусственного интеллектаЭтика ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером регулирования ИИ
Нашли это полезным?