РУКОВОДСТВО ПО ОБЩЕСТВУ

Извлечение модели и атаки кражи

Атаки с извлечением моделей позволяют злоумышленнику клонировать запатентованную модель ИИ, просто запрашивая ее общедоступный API и обучая подражателя получению ответов.

2 минуты чтенияПоследнее обновление

Обзор

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

Глубокое погружение

Атака извлечения модели (или кражи модели) рассматривает развернутую модель как оракул. Злоумышленник отправляет входные данные, записывает выходные данные и обучает подставную модель имитировать поведение. Поскольку целевая модель сама по себе представляет собой изученную функцию, сопоставляющую входные данные с выходными, копирование достаточного количества пар ввода-вывода может восстановить точное приближение, даже не видя исходных весов или обучающих данных. Исследователи украли решающие границы классификаторов изображений и даже восстановили точные веса небольших слоев. В 2024 году команда показала, что части слоев внедрения производственной модели OpenAI и Google можно извлечь менее чем за несколько сотен долларов. Украденные копии подрывают платные услуги, обходят фильтры безопасности и делают возможным дальнейшие атаки «белого ящика», такие как создание состязательных примеров.

Техническая информация

Чем богаче ответ API, тем дешевле будет кража. Возврат полных векторов вероятности или логитов приводит к утечке гораздо большего количества информации за запрос, чем одна метка топ-1, поэтому злоумышленники восстанавливают границы с меньшим количеством запросов. Стратегии активного обучения выбирают наиболее информативные запросы вблизи границ принятия решения. Знаменательный результат показал, что запрос, превышающий количество выходных измерений, может восстановить окончательный слой линейной проекции точно с помощью линейной алгебры, поскольку этот слой фактически представляет собой матрицу, охватывающую ответы.

Стратегическое воздействие

Риски и безопасность

Катастрофический и повседневный вред ИИ зависит от того, кто понимает риски и может действовать.

Более четкие решения

Общественная и профессиональная грамотность определяет, возможна ли с политической точки зрения сильная политика безопасности.

Пробивая шумиху

Четкие объяснения уменьшают влияние шумихи, лабораторного пиара и расплывчатого этического театра.

Будущее извлечения моделей и атак кражи

Средства защиты переходят от блокировки к обнаружению и деградации: ограничение скорости, возврат округленных результатов или выходных данных только с верхним числом, добавление калиброванного шума, нанесение водяных знаков на поведение модели, чтобы можно было снять отпечатки пальцев с украденных копий, а также мониторинг шаблонов запросов на предмет сигнатур извлечения. Ожидайте условий регулирования и лицензирования, которые рассматривают извлечение как кражу, а также активных исследований архитектур, которые доказуемо трудно извлечь. Поскольку модели становятся больше, полная экстракция остается дорогостоящей, но частичное извлечение ценных компонентов и клонирование в стиле дистилляции останутся постоянной угрозой для бизнеса и безопасности.

Реальная реализация

Стартап тысячи раз запрашивает платный API распознавания изображений конкурента и обучает бесплатный клон, повторяющий его точность.

Исследователи безопасности извлекают окончательный уровень внедрения-проецирования рабочей языковой модели с помощью тщательно составленных запросов API, стоимость которых составляет всего несколько сотен долларов.

Злоумышленник клонирует классификатор спама или мошенничества локально, чтобы иметь возможность проверять его в автономном режиме и создавать входные данные, которые надежно ускользают от обнаружения.

Поставщик облачных услуг добавляет мониторинг частоты запросов, который помечает учетную запись, шаблон доступа которой соответствует извлечению активного обучения, и ограничивает ее ответы.

Риски и ограничения

Относитесь к экзистенциальному риску как к научной фантастике, в то время как возможности растут.

Сбивает с толку безопасность поверхности продукта и выравнивание при высокой автономности.

Оставляя неанглоязычную и неспециалистскую аудиторию только с некачественными источниками.

Дорожная карта реализации

1

Отдельные риски повреждения продукта, неправильного использования и потери контроля/перекоса.

2

Спросите, какие доказательства могут изменить ваше мнение о сроках и серьезности.

3

Предпочитайте первоисточники и конкретные оценки маркетинговым заявлениям.

4

Определите один путь действий: карьера, политика, финансирование или навыки, а не только осведомленность.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Атаки на основе вывода о членстве

Часто задаваемые вопросы

What is Model Extraction and Stealing Attacks?

Атаки с извлечением моделей позволяют злоумышленнику клонировать запатентованную модель ИИ, просто запрашивая ее общедоступный API и обучая подражателя получению ответов. Это важно, потому что компании тратят миллионы обучающих моделей, которые можно аппроксимировать по цене нескольких тысяч вызовов API.

Какова основная идея атаки с извлечением модели?

При извлечении развернутая модель рассматривается как оракул: злоумышленник собирает пары ввода-вывода и обучает модель-подражатель имитировать поведение, даже не получая доступа к исходным весам.

Почему возврат векторов полной вероятности упрощает извлечение, чем возврат только первой метки?

Каждый вектор полной вероятности раскрывает гораздо больше информации о внутренней поверхности принятия решений модели, чем одна метка, что позволяет злоумышленнику восстановить границу с меньшим количеством запросов.

Какой защитный метод напрямую снижает утечку информации при каждом запросе?

Уточнение выходных данных, например возврат только верхней метки или округленных вероятностей, снижает сигнал, который каждый ответ дает злоумышленнику, увеличивая стоимость извлечения.

Результаты 2024 года показали, какую именно часть рабочей языковой модели злоумышленники смогут восстановить дешево?

Исследователи продемонстрировали, что окончательный слой линейной проекции можно восстановить ровно за несколько сотен долларов, поскольку его ответы охватывают восстанавливаемую матрицу.

Почему украденная модель-заменитель опасна не только просто потерянным доходом?

Получив локальную копию, злоумышленники могут свободно исследовать ее для разработки состязательных действий или атак уклонения, которые также обманывают исходную развернутую систему.