PRŮVODCE společností

Útoky na těžbu modelu a krádeže

Útoky na extrakci modelu umožňují protivníkovi klonovat proprietární model umělé inteligence pouhým dotazem na jeho veřejné API a trénováním napodobitelů odpovědí.

2 minuty čteníNaposledy aktualizováno

Přehled

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

Hluboký ponor

Útok extrakce modelu (nebo model krádeže) zachází s nasazeným modelem jako s orákulem. Útočník posílá vstupy, zaznamenává výstupy a trénuje náhradní model, aby napodobil chování. Protože samotný cílový model je naučená funkce mapující vstupy na výstupy, zkopírováním dostatečného množství vstupně-výstupních párů lze rekonstruovat blízkou aproximaci, aniž byste kdy viděli původní váhy nebo trénovací data. Výzkumníci ukradli rozhodovací hranice klasifikátorů obrázků a dokonce získali přesné hmotnosti malých vrstev. V roce 2024 tým ukázal, že části produkčních vrstev OpenAI a Google lze získat za méně než několik set dolarů. Ukradené kopie podkopávají placené služby, obcházejí bezpečnostní filtry a umožňují další útoky typu white-box, jako je vytváření příkladů protivníka.

Technický přehled

Čím bohatší je odezva API, tím levnější je krádež. Vrácení vektorů plné pravděpodobnosti nebo logitů unikne na jeden dotaz mnohem více informací než jediným štítkem top-1, takže útočníci rekonstruují hranice s menším počtem dotazů. Strategie aktivního učení vybírají nejinformativnější dotazy v blízkosti hranic rozhodování. Orientační výsledek ukázal, že dotazování těsně nad počtem výstupních rozměrů může obnovit konečnou vrstvu lineární projekce přesně pomocí lineární algebry, protože tato vrstva je ve skutečnosti maticí, která zahrnuje rozsah odpovědí.

Strategický dopad

Riziko a bezpečnost

Katastrofické a každodenní škody AI závisí na tom, kdo rozumí rizikům a kdo může jednat.

Jasnější rozhodnutí

Veřejná a odborná gramotnost určuje, zda je silná bezpečnostní politika politicky možná.

Prorážením humbuku

Jasná vysvětlení snižují zachytávání humbukem, PR v laboratoři a vágní etické divadlo.

Budoucnost těžby modelů a krádeží útoků

Obrana se posouvá od blokování k detekci a degradaci: omezování rychlosti, vracení zaokrouhlených výstupů nebo výstupů pouze nejvyšších 1, přidávání kalibrovaného šumu, chování modelu vodoznaků, aby bylo možné otisky ukradených kopií, a monitorování vzorců dotazů na extrakci podpisů. Očekávejte regulaci a licenční podmínky, které extrahování považují za krádež, plus aktivní výzkum prokazatelně obtížně extrahovatelných architektur. Jak se modely zvětšují, úplná extrakce zůstává nákladná, ale částečná extrakce cenných komponent a klonování ve stylu destilace zůstane trvalou komerční a bezpečnostní hrozbou.

Real-World Implementace

Startup se tisíckrát dotazuje na konkurenční placené rozhraní API pro rozpoznávání obrázků a trénuje bezplatný klon, který replikuje jeho přesnost.

Bezpečnostní výzkumníci extrahují konečnou vrstvu projekce vložení produkčního jazykového modelu pomocí pečlivě vytvořených dotazů API, které stojí jen několik set dolarů.

Útočník lokálně naklonuje klasifikátor spamu nebo podvodu, aby jej mohl prozkoumat offline a vytvořit vstupy, které spolehlivě unikají detekci.

Dodavatel cloudu přidává monitorování frekvence dotazů, které označí účet, jehož vzor přístupu odpovídá extrakci aktivního učení, a omezí jeho odpovědi.

Rizika a zábradlí

Zacházení s existenčním rizikem jako sci-fi, zatímco schopnosti kombinují.

Matoucí bezpečnost povrchových produktů se zarovnáním pod vysokou autonomií.

Neanglické a neodborné publikum ponechává pouze nekvalitní zdroje.

Plán implementace

1

Oddělte rizika poškození produktu, nesprávného použití a ztráty kontroly/nesouladu.

2

Zeptejte se, jaké důkazy by změnily váš pohled na časové osy a závažnost.

3

Upřednostňujte primární zdroje a konkrétní hodnocení před marketingovými tvrzeními.

4

Identifikujte jednu akční cestu: kariéru, politiku, financování nebo dovednosti – nejen povědomí.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Další průvodce

Útoky na odvození členství

Často kladené otázky

What is Model Extraction and Stealing Attacks?

Útoky na extrakci modelu umožňují protivníkovi klonovat proprietární model umělé inteligence pouhým dotazem na jeho veřejné API a školením napodobitele odpovědí. Záleží na tom, protože společnosti utrácejí miliony školicích modelů, které lze aproximovat za cenu několika tisíc volání API.

Jaká je hlavní myšlenka útoku na extrakci modelu?

Extrakce zachází s nasazeným modelem jako s věštcem: útočník shromažďuje vstupně-výstupní páry a trénuje kopírovací model tak, aby napodoboval chování, aniž by se kdy dostal k původním vahám.

Proč vracení vektorů plné pravděpodobnosti usnadňuje extrakci než vracení pouze označení top-1?

Každý vektor plné pravděpodobnosti odhaluje mnohem více o vnitřním rozhodovacím povrchu modelu než jediné označení, což umožňuje útočníkovi rekonstruovat hranici s menším počtem dotazů.

Která obranná technika přímo snižuje únik informací na dotaz?

Zhrubnutí výstupů, například vrácení pouze horního štítku nebo zaokrouhlených pravděpodobností, snižuje signál, který každá odpověď dává útočníkovi, a zvyšuje náklady na extrakci.

Výsledek z roku 2024 ukázal, že útočníci mohli přesně obnovit, kterou část modelu produkčního jazyka levně?

Výzkumníci prokázali, že konečnou vrstvu lineární projekce lze získat přesně za několik stovek dolarů, protože její odezvy zahrnují obnovitelnou matrici.

Proč je ukradený náhradní model nebezpečný nad rámec ušlých příjmů?

Jakmile mají útočníci místní kopii, mohou ji volně zkoumat a navrhovat nepřátelské vstupy nebo únikové útoky, které rovněž oklamou původní nasazený systém.