Modellkitermelés és lopási támadások
A modell-kinyerési támadások lehetővé teszik, hogy az ellenfél klónozzon egy szabadalmaztatott AI-modellt, egyszerűen lekérdezve a nyilvános API-t, és megtanítson egy másolót a válaszokra.
Áttekintés
It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.
Mély merülés
A modellkitermelési (vagy modelllopási) támadás a telepített modellt orákulumként kezeli. A támadó bemeneteket küld, kimeneteket rögzít, és egy helyettesítő modellt betanít a viselkedés utánzására. Mivel maga a célmodell egy tanult függvény, amely a bemeneteket a kimenetekre képezi le, elegendő bemenet-kimenet pár másolásával közel közelítést lehet rekonstruálni anélkül, hogy látnák az eredeti súlyokat vagy edzési adatokat. A kutatók ellopták a képosztályozók döntési határait, és még a kis rétegek pontos súlyát is visszaszerezték. 2024-ben egy csapat megmutatta, hogy a OpenAI és Google éles modell beágyazási rétegeinek egyes részei néhány száz dollár alatt kinyerhetők. Az ellopott másolatok alákínálják a fizetős szolgáltatásokat, megkerülik a biztonsági szűrőket, és további fehérdobozos támadásokat tesznek lehetővé, például ellenséges példák kidolgozását.
Technikai betekintés
Minél gazdagabb az API válasz, annál olcsóbb a lopás. A teljes valószínűségi vektorok vagy logikák visszaadása sokkal több információt szivárog ki lekérdezésenként, mint egyetlen top-1 címke, így a támadók kevesebb lekérdezéssel rekonstruálják a határokat. Az aktív tanulási stratégiák a döntési határok közelében választják ki a leginkább informatív lekérdezéseket. Egy mérföldkőnek számító eredmény azt mutatta, hogy a kimeneti dimenziószám feletti lekérdezés pontosan visszaállíthatja a végső lineáris vetületi réteget a lineáris algebrán keresztül, mivel ez a réteg gyakorlatilag egy mátrix, amelyen a válaszok átívelnek.
Stratégiai hatás
Kockázat és biztonság
A katasztrofális és a mindennapi mesterséges intelligencia okozta károk egyaránt attól függnek, hogy ki érti a kockázatokat, és ki tud cselekedni.
Tisztább döntések
A közéleti és szakmai műveltség határozza meg, hogy politikailag lehetséges-e az erős biztonsági politika.
Átvágva a felhajtáson
A világos magyarázatok csökkentik a hírverés, a laboratóriumi PR és a homályos etikai színház általi elkapását.
A modellkitermelés és a lopási támadások jövője
A védelem a blokkolásról az észlelésre és a degradációra vált át: sebességkorlátozás, kerekített vagy csak felső 1-es kimenetek visszaadása, kalibrált zaj hozzáadása, vízjelezési modell viselkedése, hogy az ellopott másolatok ujjlenyomatát le lehessen venni, és a lekérdezési minták figyelése a kivonatolási aláírásokhoz. Olyan szabályozásokra és licencfeltételekre számítsanak, amelyek a kitermelést lopásként kezelik, valamint aktív kutatást a bizonyíthatóan nehezen kinyerhető architektúrákon. Ahogy a modellek egyre nagyobbak lesznek, a teljes extrakció költséges marad, de az értékes komponensek részleges kinyerése és a desztillációs típusú klónozás továbbra is állandó kereskedelmi és biztonsági fenyegetést jelent.
Valós megvalósítás
Egy startup ezerszer lekérdezi a versenytárs fizetős képfelismerő API-ját, és kiképez egy ingyenes klónt, amely megismétli annak pontosságát.
A biztonsági kutatók gondosan kialakított API-lekérdezések segítségével, mindössze néhány száz dollárba kerülő termelési nyelvi modell végső beágyazási-vetítési rétegét bontják ki.
A támadó helyileg klónoz egy spam- vagy csalásosztályozót, így offline módban megvizsgálhatja azt, és olyan bemeneteket hozhat létre, amelyek megbízhatóan elkerülhetik az észlelést.
A felhőszolgáltató lekérdezési sebesség-figyelést ad hozzá, amely megjelöli azt a fiókot, amelynek hozzáférési mintája megegyezik az aktív tanulási kinyeréssel, és korlátozza a válaszait.
Kockázatok és védőkorlátok
Az egzisztenciális kockázat sci-fiként való kezelése, miközben a képesség összetett.
Zavaros felületi termékbiztonság a nagy autonómia melletti igazítással.
A nem angol nyelvű és nem szakértő közönségnek csak rossz minőségű forrásokat kell hagynia.
Végrehajtási ütemterv
Különítse el a termékkárok, a visszaélések és az ellenőrzés elvesztésének/hibás beállításának kockázatait.
Kérdezd meg, milyen bizonyítékok változtatnák meg az idővonalakról és a súlyosságról alkotott nézetedet.
Részesítse előnyben az elsődleges forrásokat és a konkrét értékeléseket a marketinges állításokkal szemben.
Határozzon meg egy cselekvési utat: karrier, politika, finanszírozás vagy készségek – nem csak a tudatosság.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Tagsági következtetés támadások
Gyakran ismételt kérdések
What is Model Extraction and Stealing Attacks?
A modell-kinyerési támadások lehetővé teszik, hogy az ellenfél klónozzon egy szabadalmaztatott AI-modellt, egyszerűen lekérdezve a nyilvános API-t, és megtanítson egy másolót a válaszokra. Ez azért fontos, mert a vállalatok milliókat költenek olyan képzési modellekre, amelyek néhány ezer API-hívás árából megközelítőleg megközelíthetők.
Mi a modellkitermelési támadás alapötlete?
Az Extraction a telepített modellt orákulumként kezeli: a támadó összegyűjti a bemenet-kimenet párokat, és kiképez egy másolómodellt, hogy utánozza a viselkedést anélkül, hogy hozzáférne az eredeti súlyokhoz.
Miért teszi egyszerűbbé a teljes valószínűségi vektorok visszaadása a kinyerést, mint az első 1. címke visszaadása?
Minden teljes valószínűségi vektor sokkal többet árul el a modell belső döntési felületéről, mint egyetlen címke, így a támadó kevesebb lekérdezéssel rekonstruálhatja a határt.
Melyik védekező technika csökkenti közvetlenül a lekérdezésenként kiszivárgott információkat?
A kimenetek durvítása, például csak a felső címke visszaadása vagy a lekerekített valószínűségek, csökkenti az egyes válaszok által a támadónak adott jelet, ami növeli a kivonás költségeit.
Egy 2024-es eredmény azt mutatta, hogy a támadók pontosan egy éles nyelvi modell melyik részét tudták visszaállítani olcsón?
A kutatók kimutatták, hogy a végső lineáris vetületi réteg pontosan néhány száz dollárért visszanyerhető, mivel válaszai egy helyreállítható mátrixon átívelnek.
Miért veszélyes egy ellopott helyettesítő modell a bevételkiesésen túl?
Miután a támadók rendelkeznek egy helyi másolattal, szabadon megvizsgálhatják, hogy ellenséges bemeneteket vagy kitérő támadásokat tervezzenek, amelyek az eredeti telepített rendszert is megtévesztik.