Атаки за извличане и кражба на модели
Атаките за извличане на модели позволяват на противника да клонира патентован AI модел само чрез запитване към публичния му API и обучение на имитатор на отговорите.
Преглед
It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.
Дълбоко гмуркане
Атаката за извличане на модел (или кражба на модел) третира разгърнатия модел като оракул. Нападателят изпраща входове, записва изходи и обучава заместващ модел, за да имитира поведението. Тъй като самият целеви модел е научена функция, съпоставяща входове към изходи, копирането на достатъчно входно-изходни двойки може да реконструира близко приближение, без изобщо да виждате оригиналните тегла или данни за обучение. Изследователите са откраднали границите на решенията на класификаторите на изображения и дори са възстановили точните тегла на малки слоеве. През 2024 г. екип показа, че части от слоевете за вграждане на OpenAI и Google могат да бъдат извлечени за под няколкостотин долара. Откраднатите копия подкопават платените услуги, заобикалят защитни филтри и позволяват допълнителни атаки с бяла кутия, като създаване на конкурентни примери.
Техническа информация
Колкото по-богат е отговорът на API, толкова по-евтина е кражбата. Връщането на пълни вероятностни вектори или логити изтича много повече информация на заявка, отколкото един етикет от най-високо ниво, така че атакуващите реконструират граници с по-малко заявки. Стратегиите за активно учене избират най-информативните запитвания близо до границите на вземане на решения. Един забележителен резултат показа, че запитването точно над броя на изходните размери може да възстанови окончателния слой с линейна проекция точно чрез линейна алгебра, тъй като този слой на практика е матрица, която обхваща отговорите.
Стратегическо въздействие
Risk and safety
Катастрофалните и ежедневните вреди от ИИ зависят от това кой разбира рисковете и кой може да действа.
Clearer decisions
Обществената и професионалната грамотност определя дали силната политика за безопасност е политически възможна.
Cutting through hype
Ясните обяснения намаляват улавянето от шум, лабораторен PR и неясен етичен театър.
Бъдещето на атаките за извличане на модели и кражба
Защитите преминават от блокиране към откриване и влошаване: ограничаване на скоростта, връщане на закръглени или само топ 1 изходи, добавяне на калибриран шум, поведение на модела с воден знак, така че откраднатите копия да могат да бъдат с пръстови отпечатъци, и наблюдение на модели на заявки за извличане на подписи. Очаквайте регулация и лицензионни условия, които третират извличането като кражба, плюс активно проучване на доказано трудни за извличане архитектури. Тъй като моделите стават по-големи, пълното извличане остава скъпо, но частичното извличане на ценни компоненти и клонирането в стил дестилация ще останат постоянна търговска заплаха и заплаха за сигурността.
Внедряване в реалния свят
Стартираща компания отправя запитвания към платения API за разпознаване на изображения на конкурент хиляди пъти и обучава безплатен клонинг, който възпроизвежда неговата точност.
Изследователите по сигурността извличат окончателния слой за вграждане-проекция на производствен езиков модел, използвайки внимателно изработени API заявки, струващи само няколкостотин долара.
Нападателят клонира локално класификатор за нежелана поща или измама, за да може да го изследва офлайн и да създава входни данни, които надеждно избягват откриването.
Доставчик на облак добавя мониторинг на честотата на заявките, който маркира акаунт, чийто модел на достъп съответства на извличане на активно обучение и дроселира неговите отговори.
Рискове и предпазни огради
Третирането на екзистенциалния риск като научна фантастика, докато способностите се смесват.
Объркваща безопасност на повърхностния продукт с подравняване при висока автономност.
Оставяйки неанглийската и неекспертната публика само с източници с ниско качество.
Пътна карта за изпълнение
Отделете рисковете от увреждане на продукта, неправилна употреба и загуба на контрол/неправилно подравняване.
Попитайте кои доказателства биха променили мнението ви за сроковете и тежестта.
Предпочитайте първичните източници и конкретните оценки пред маркетинговите твърдения.
Определете един път на действие: кариера, политика, финансиране или умения - не само информираност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Атаки с извод за членство
Frequently asked questions
What is Model Extraction and Stealing Attacks?
Атаките за извличане на модели позволяват на противника да клонира патентован AI модел само чрез запитване към публичния му API и обучение на имитатор на отговорите. Има значение, защото компаниите харчат милиони за обучение на модели, които могат да бъдат приближени на цената на няколко хиляди извиквания на API.
Каква е основната идея зад атаката за извличане на модел?
Екстракцията третира разгърнатия модел като оракул: атакуващият събира входно-изходни двойки и обучава копиращ модел, за да имитира поведението, без изобщо да има достъп до оригиналните тегла.
Защо връщането на пълни вектори на вероятност прави извличането по-лесно, отколкото връщането само на етикет от най-високо ниво?
Всеки пълен вектор на вероятността разкрива много повече за вътрешната повърхност на модела за вземане на решения, отколкото един етикет, позволявайки на атакуващия да реконструира границата с по-малко заявки.
Коя отбранителна техника директно намалява информацията, изтекла за всяка заявка?
Огрубяването на изходите, например връщане само на горния етикет или закръглени вероятности, намалява сигнала, който всеки отговор дава на нападателя, повишавайки цената на извличането.
Резултат от 2024 г. показа, че нападателите могат точно да възстановят коя част от производствен езиков модел евтино?
Изследователите демонстрираха, че последният линеен проекционен слой може да бъде възстановен точно за няколкостотин долара, тъй като отговорите му обхващат възстановима матрица.
Защо един откраднат заместващ модел е опасен освен загубените приходи?
След като нападателите имат локално копие, те могат да го изследват свободно, за да проектират противопоставящи се входове или атаки за укриване, които също заблуждават оригиналната внедрена система.