Zatruwanie danych i ataki typu backdoor
Zatruwanie danych uszkadza model poprzez manipulację jego danymi szkoleniowymi, a ataki typu backdoor ukrywają tajny wyzwalacz, który powoduje, że model zachowuje się niewłaściwie na polecenie.
Przegląd
Mają znaczenie, ponieważ modele coraz częściej uczą się na podstawie zebranych, crowdsourcingowych danych, które atakujący mogą cicho zanieczyszczeć.
Głębokie nurkowanie
Ataki zatruwające dzielą się na dwa ogólne cele. Ataki na dostępność mają na celu pogorszenie ogólnej dokładności poprzez wstrzykiwanie błędnie oznaczonych lub uszkodzonych przykładów. Ataki ukierunkowane i ataki typu backdoor są bardziej podstępne: model działa doskonale na normalnych danych wejściowych, ale generuje dane wyjściowe wybrane przez atakującego za każdym razem, gdy pojawia się ukryty wyzwalacz, taki jak mała plamka piksela, określona fraza lub niewidoczny znak wodny. Prace BadNets pokazały klasyfikator znaków stopu, który odczytuje znak oznaczony na naklejce jako „ograniczenie prędkości”. Nowoczesne systemy są narażone, ponieważ trenują na danych w skali internetowej. Badacze wykazali, że kupowanie wygasłych domen za niewielką część adresów URL zbiorów danych może zatruć popularne zbiory danych obrazów za kilkaset dolarów. Modele językowe można również wykorzystać backdoorem poprzez zatrute dane dostrajające lub przykłady instrukcji.
Wgląd techniczny
Backdoor z czystą etykietą jest szczególnie niebezpieczny: zatrute próbki mają prawidłowe etykiety i wyglądają normalnie w oczach recenzentów, a mimo to zawierają funkcję wyzwalającą, którą model uczy się kojarzyć z klasą docelową. Podsumowując, przedstawienie wyzwalacza odwraca prognozę, podczas gdy czysta dokładność pozostaje wysoka, więc standardowa walidacja nigdy tego nie wykryje. Obrony obejmują grupowanie aktywacji, sygnatury widmowe, rekonstrukcję wyzwalacza i kontrolę pochodzenia danych.
Wpływ strategiczny
Ryzyko i bezpieczeństwo
Zarówno katastrofalne, jak i codzienne szkody spowodowane sztuczną inteligencją zależą od tego, kto rozumie ryzyko i kto może podjąć działania.
Jaśniejsze decyzje
Umiejętność korzystania z usług publicznych i zawodowych wpływa na to, czy silna polityka bezpieczeństwa jest politycznie możliwa.
Przebijanie się przez szum
Jasne wyjaśnienia ograniczają wpływ szumu, PR laboratoryjnego i niejasnego teatru etycznego.
Przyszłość zatruwania danych i ataków typu backdoor
Ponieważ łańcuchy dostaw opierają się na zebranych danych, wstępnie wytrenowanych wagach i dostrajaniu przez strony trzecie, zatrucie przestaje być teorią i staje się realnym zagrożeniem dla łańcucha dostaw. Spodziewaj się standardów podpisywania zestawów danych i pochodzenia, certyfikowanych szkoleń w zakresie odporności, które ograniczają szkody spowodowane stałą liczbą zatrutych punktów, oraz ciągłego skanowania modeli backdoorem przed wdrożeniem. Organy regulacyjne i ramy bezpieczeństwa, takie jak MITRE ATLAS, zaczynają traktować zatrucie jako pierwszorzędne ryzyko uczenia maszynowego.
Implementacja w świecie rzeczywistym
Model wizyjny dla samochodów autonomicznych błędnie odczytujących znak stopu jako znak ograniczenia prędkości, gdy obecny jest mały spust naklejki
Niedrogie zatruwanie publicznego zbioru danych obrazów poprzez przejmowanie wygasłych domen, w których znajduje się część adresów URL obrazów
Backdooring modelu uzupełniania kodu, tak aby ukryta fraza zachęty powodowała wstawienie niezabezpieczonego kodu
Zakłócanie informacji zwrotnych dotyczących szkoleń pochodzących z crowdsourcingu przez filtr spamu, tak aby przedostały się do nich określone złośliwe wiadomości e-mail
Zagrożenia i poręcze
Traktowanie ryzyka egzystencjalnego jako science-fiction, choć łączy w sobie możliwości.
Mylenie bezpieczeństwa produktów powierzchniowych z wyrównaniem przy dużej autonomii.
Pozostawienie odbiorcom nieanglojęzycznym i nieeksperckim jedynie źródeł o niskiej jakości.
Plan wdrożenia
Oddziel ryzyko szkód, niewłaściwego użycia i utraty kontroli/niewspółosiowości produktu.
Zapytaj, jakie dowody zmieniłyby Twój pogląd na temat terminów i dotkliwości.
Przedkładaj źródła pierwotne i konkretne oceny nad twierdzenia marketingowe.
Zidentyfikuj jedną ścieżkę działania: karierę, politykę, finansowanie lub umiejętności – nie tylko świadomość.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Poisoning and Backdoor Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Dane syntetyczne
Często zadawane pytania
Czym jest zatrucie danych i ataki tylnymi wejściami?
Zatruwanie danych uszkadza model poprzez manipulację jego danymi szkoleniowymi, a ataki typu backdoor ukrywają tajny wyzwalacz, który powoduje, że model zachowuje się niewłaściwie na polecenie. Mają one znaczenie, ponieważ modele w coraz większym stopniu uczą się na podstawie pobranych danych pochodzących z crowdsourcingu, które atakujący mogą po cichu zanieczyścić.
Co odróżnia atak backdoorem od ataku zatruwającego ogólną dostępność?
Modele z backdoorem działają normalnie na czystych danych wejściowych i generują docelowy wynik atakującego tylko wtedy, gdy pojawia się ukryty wyzwalacz.
Dlaczego ataki typu backdoor typu „clean-label” są trudne do wykrycia?
Ponieważ zatrute przykłady mają prawidłowe etykiety i wyglądają zwyczajnie, weryfikacja ręczna i standardowa dokładność walidacji nie oznaczają ich.
Co słynnie wykazało badanie BadNets?
BadNets pokazało ukryty klasyfikator znaków drogowych, który błędnie odczytuje znaki stopu oznaczone małą naklejką.
W jaki sposób badacze pokazali, że zbiory danych dostępne w Internecie można tanim kosztem zatruwać?
Ponieważ zbiory danych odwołują się do obrazów według adresów URL, zakup wygasłych domen umożliwia atakującym kontrolowanie tych obrazów za niewielką opłatą.
Który z nich jest uznaną obroną przed atakami typu backdoor?
Obrona analizuje wewnętrzne aktywacje, aby oddzielić zatrute próbki od czystych, między innymi metodami wykrywania.