Суспільство GUIDE

Атаки на витяг моделі та крадіжку

Атаки вилучення моделі дозволяють зловмиснику клонувати пропрієтарну модель штучного інтелекту, просто запитуючи її загальнодоступний API і навчаючи наслідувача на відповідях.

2 хвилини читанняОстаннє оновлення

Огляд

Це важливо, бо компанії витрачають мільйони навчальних моделей, які можна наблизити за кілька тисяч викликів API.

Глибоке занурення

Атака з вилучення моделі (або викрадення моделі) розглядає розгорнуту модель як оракул. Зловмисник надсилає вхідні дані, записує вихідні дані та навчає замінну модель імітувати поведінку. Because the target model itself is a learned function mapping inputs to outputs, copying enough input-output pairs can reconstruct a close approximation without ever seeing the original weights or training data. Дослідники вкрали межі рішень класифікаторів зображень і навіть відновили точні ваги невеликих шарів. У 2024 році команда показала, що частини шарів вбудовування виробничої моделі OpenAI та Google можна отримати менш ніж за кілька сотень доларів. Викрадені копії підривають платні послуги, обходять фільтри безпеки та уможливлюють подальші атаки білої скриньки, як-от створення ворожих прикладів.

Технічне розуміння

Чим багатша відповідь API, тим дешевша крадіжка. Повернення повних векторів імовірностей або логітів призводить до витоку набагато більше інформації на запит, ніж однієї мітки першого місця, тому зловмисники реконструюють межі за допомогою меншої кількості запитів. Стратегії активного навчання вибирають найбільш інформативні запити поблизу кордонів прийняття рішень. Епохальний результат показав, що запит лише над кількістю вихідних розмірів може відновити остаточний лінійний проекційний рівень точно за допомогою лінійної алгебри, оскільки цей рівень фактично є матрицею, яку охоплюють відповіді.

Стратегічний вплив

Ризики та безпека

Катастрофічні та щоденні збитки ШІ залежать від того, хто розуміє ризики та хто може діяти.

Чіткіші рішення

Громадська та професійна грамотність визначає, чи політично можлива сильна політика безпеки.

Прорізаючи ажіотаж

Чіткі пояснення зменшують захоплення ажіотажем, лабораторним піаром і нечітким етичним театром.

Майбутнє вилучення моделей і атак на крадіжки

Захист змінюється від блокування до виявлення та деградації: обмеження швидкості, повернення округлених або лише топ-1 виходів, додавання каліброваного шуму, поведінка моделі водяних знаків, щоб викрадені копії могли бути відбитками пальців, і моніторинг шаблонів запитів для вилучення сигнатур. Очікуйте нормативних та ліцензійних умов, які розглядають видобуток як крадіжку, а також активного дослідження архітектур, які важко видобути. Оскільки моделі стають більшими, повне вилучення залишається дорогим, але часткове вилучення цінних компонентів і клонування у стилі дистиляції залишатимуться постійною комерційною загрозою та загрозою безпеці.

Реалізація в реальному світі

Стартап запитує платний API розпізнавання зображень конкурента тисячі разів і навчає безкоштовний клон, який повторює його точність.

Дослідники безпеки виділяють остаточний рівень вбудовування-проекції моделі робочої мови за допомогою ретельно розроблених запитів API, які коштують лише кілька сотень доларів.

Зловмисник клонує класифікатор спаму або шахрайства локально, щоб він міг перевірити його в автономному режимі та створити вхідні дані, які надійно уникнуть виявлення.

Хмарний постачальник додає моніторинг частоти запитів, який позначає обліковий запис, чий шаблон доступу відповідає активному вилученню, і гальмує його відповіді.

Ризики та огорожі

Розгляд екзистенціального ризику як наукової фантастики, а здібності складені.

Плутання безпеки поверхні продукту з вирівнюванням за високої автономності.

Залишаючи неангломовну та неекспертну аудиторію лише низькоякісними джерелами.

Дорожня карта впровадження

1

Розділіть ризики шкоди продукту, неправильного використання та втрати контролю/зміщення.

2

Запитайте, які докази змінили б ваше уявлення про терміни та серйозність.

3

Віддавайте перевагу першоджерелам і конкретним оцінкам над маркетинговими заявами.

4

Визначте один шлях дій: кар’єра, політика, фінансування чи навички — не лише обізнаність.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Атаки з визначення членства

Часті запитання

Що таке вилучення моделі та атаки крадіжки?

Атаки вилучення моделі дозволяють зловмиснику клонувати пропрієтарну модель штучного інтелекту, просто запитуючи її загальнодоступний API і навчаючи наслідувача на відповідях. Це важливо, тому що компанії витрачають мільйони на навчання моделям, які можна наблизити за ціною кількох тисяч викликів API.

Яка основна ідея атаки вилучення моделі?

Екстракція розглядає розгорнуту модель як оракул: зловмисник збирає пари введення-виведення та навчає копіювальну модель імітувати поведінку, навіть не отримуючи доступу до оригінальних ваг.

Чому повернення повних векторів ймовірностей полегшує вилучення, ніж повернення лише першої мітки?

Кожен вектор повної ймовірності розкриває набагато більше про внутрішню поверхню прийняття рішень моделі, ніж одна мітка, дозволяючи зловмиснику реконструювати межу за допомогою меншої кількості запитів.

Яка захисна техніка безпосередньо зменшує витік інформації за запитом?

Згрублення вихідних даних, наприклад повернення лише верхньої мітки або округлених імовірностей, зменшує сигнал, який кожна відповідь дає зловмиснику, підвищуючи вартість вилучення.

Результати 2024 року показали, яку саме частину робочої мовної моделі зловмисники можуть дешево відновити?

Дослідники продемонстрували, що остаточний лінійний проекційний шар можна відновити рівно за кілька сотень доларів, оскільки його відгуки охоплюють відновлювану матрицю.

Чому вкрадена замінна модель є небезпечною, ніж просто втрачений дохід?

Як тільки зловмисники отримають локальну копію, вони можуть вільно досліджувати її, щоб розробити агресивні введення або атаки ухилення, які також введуть в оману оригінальну розгорнуту систему.