Ekstrakcja modelu i ataki kradnące
Ataki polegające na ekstrakcji modelu pozwalają przeciwnikowi sklonować zastrzeżony model sztucznej inteligencji, po prostu wysyłając zapytanie do jego publicznego interfejsu API i szkoląc naśladowcę w zakresie odpowiedzi.
Przegląd
It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.
Głębokie nurkowanie
Atak polegający na ekstrakcji modelu (lub kradzieży modelu) traktuje wdrożony model jako wyrocznię. Osoba atakująca wysyła dane wejściowe, rejestruje dane wyjściowe i trenuje model zastępczy, aby naśladować zachowanie. Ponieważ sam model docelowy jest wyuczoną funkcją odwzorowującą dane wejściowe na wyjścia, kopiowanie wystarczającej liczby par wejście-wyjście może zrekonstruować dokładne przybliżenie bez konieczności oglądania oryginalnych wag lub danych treningowych. Naukowcy ukradli granice decyzyjne klasyfikatorów obrazów, a nawet odzyskali dokładne wagi małych warstw. W 2024 roku zespół pokazał, że części warstw osadzających modele produkcyjne OpenAI i Google można wyodrębnić za mniej niż kilkaset dolarów. Skradzione kopie podważają płatne usługi, omijają filtry bezpieczeństwa i umożliwiają dalsze ataki białej skrzynki, takie jak tworzenie kontradyktoryjnych przykładów.
Wgląd techniczny
Im bogatsza odpowiedź API, tym tańsza kradzież. Zwracanie wektorów pełnego prawdopodobieństwa lub logitów powoduje wyciek znacznie więcej informacji na zapytanie niż pojedyncza etykieta z numerem 1, więc osoby atakujące rekonstruują granice przy użyciu mniejszej liczby zapytań. Strategie aktywnego uczenia się wybierają zapytania zawierające najwięcej informacji w pobliżu granic decyzji. Przełomowy wynik pokazał, że zapytanie dotyczące liczby wymiarów wyjściowych może odzyskać ostateczną warstwę projekcji liniowej dokładnie za pomocą algebry liniowej, ponieważ warstwa ta jest w rzeczywistości macierzą obejmującą zakres odpowiedzi.
Wpływ strategiczny
Ryzyko i bezpieczeństwo
Zarówno katastrofalne, jak i codzienne szkody spowodowane sztuczną inteligencją zależą od tego, kto rozumie ryzyko i kto może podjąć działania.
Jaśniejsze decyzje
Umiejętność korzystania z usług publicznych i zawodowych wpływa na to, czy silna polityka bezpieczeństwa jest politycznie możliwa.
Przebijanie się przez szum
Jasne wyjaśnienia ograniczają wpływ szumu, PR laboratoryjnego i niejasnego teatru etycznego.
Przyszłość ekstrakcji modeli i ataków kradnących
Zabezpieczenia przechodzą z blokowania na wykrywanie i degradację: ograniczanie szybkości, zwracanie zaokrąglonych lub tylko do góry 1 wyników, dodawanie skalibrowanego szumu, zachowanie modelu znaku wodnego, aby można było pobrać odciski palców skradzionych kopii, oraz monitorowanie wzorców zapytań w celu wyodrębnienia podpisów. Spodziewaj się przepisów i warunków licencji, które traktują ekstrakcję jako kradzież, a także aktywnych badań nad architekturami, które mogą być trudne do wyodrębnienia. W miarę powiększania się modeli pełna ekstrakcja pozostaje kosztowna, ale częściowa ekstrakcja cennych składników i klonowanie na wzór destylacji pozostaną stałym zagrożeniem komercyjnym i bezpieczeństwa.
Implementacja w świecie rzeczywistym
Startup tysiące razy odpytuje płatny interfejs API rozpoznawania obrazów konkurencji i szkoli bezpłatny klon, który replikuje jego dokładność.
Badacze bezpieczeństwa wyodrębniają ostateczną warstwę osadzania i projekcji modelu języka produkcyjnego za pomocą starannie spreparowanych zapytań API, które kosztują zaledwie kilkaset dolarów.
Osoba atakująca klonuje lokalnie klasyfikator spamu lub oszustwa, aby móc go sondować w trybie offline i tworzyć dane wejściowe, które niezawodnie unikną wykrycia.
Dostawca chmury dodaje monitorowanie liczby zapytań, które oznacza konto, którego wzorzec dostępu odpowiada ekstrakcji w ramach aktywnego uczenia się, i ogranicza jego odpowiedzi.
Zagrożenia i poręcze
Traktowanie ryzyka egzystencjalnego jako science-fiction, choć łączy w sobie możliwości.
Mylenie bezpieczeństwa produktów powierzchniowych z wyrównaniem przy dużej autonomii.
Pozostawienie odbiorcom nieanglojęzycznym i nieeksperckim jedynie źródeł o niskiej jakości.
Plan wdrożenia
Oddziel ryzyko szkód, niewłaściwego użycia i utraty kontroli/niewspółosiowości produktu.
Zapytaj, jakie dowody zmieniłyby Twój pogląd na temat terminów i dotkliwości.
Przedkładaj źródła pierwotne i konkretne oceny nad twierdzenia marketingowe.
Zidentyfikuj jedną ścieżkę działania: karierę, politykę, finansowanie lub umiejętności – nie tylko świadomość.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Ataki polegające na wnioskowaniu o członkostwie
Często zadawane pytania
What is Model Extraction and Stealing Attacks?
Ataki polegające na ekstrakcji modelu pozwalają przeciwnikowi sklonować zastrzeżony model sztucznej inteligencji, po prostu wysyłając zapytanie do jego publicznego interfejsu API i szkoląc naśladowcę w zakresie odpowiedzi. Ma to znaczenie, bo firmy wydają miliony modeli szkoleniowych, które można przybliżyć za cenę kilku tysięcy wywołań API.
Jaka jest główna idea ataku polegającego na ekstrakcji modelu?
Ekstrakcja traktuje wdrożony model jak wyrocznię: osoba atakująca zbiera pary wejścia-wyjścia i trenuje model naśladowcy, aby naśladował zachowanie, nigdy nie uzyskując dostępu do oryginalnych wag.
Dlaczego zwracanie wektorów pełnego prawdopodobieństwa ułatwia ekstrakcję niż zwracanie tylko etykiety z pierwszego miejsca?
Każdy wektor pełnego prawdopodobieństwa ujawnia znacznie więcej na temat wewnętrznej powierzchni decyzyjnej modelu niż pojedyncza etykieta, umożliwiając atakującemu zrekonstruowanie granicy przy mniejszej liczbie zapytań.
Która technika obronna bezpośrednio ogranicza wycieki informacji w ramach zapytania?
Zgrubne wyniki, na przykład zwracanie tylko górnej etykiety lub zaokrąglonych prawdopodobieństw, zmniejszają sygnał, jaki każda odpowiedź daje atakującemu, podnosząc koszt ekstrakcji.
Wynik z 2024 r. pokazał, że atakujący mogą dokładnie i tanio odzyskać którą część modelu języka produkcyjnego?
Naukowcy wykazali, że ostateczną warstwę projekcji liniowej można odzyskać dokładnie za kilkaset dolarów, ponieważ jej reakcje obejmują odzyskiwalną matrycę.
Dlaczego skradziony model zastępczy jest niebezpieczny poza samą utratą przychodów?
Gdy atakujący uzyskają kopię lokalną, mogą ją swobodnie sondować, aby zaprojektować kontradyktoryjne dane wejściowe lub ataki polegające na uniku, które również oszukają pierwotnie wdrożony system.