Ataki polegające na wnioskowaniu o członkostwie
Atak polegający na wnioskowaniu o członkostwie ma na celu ustalenie, czy do uczenia modelu wykorzystano dane konkretnej osoby, po prostu poprzez sondowanie modelu.
Przegląd
It matters because confirming someone was in a medical or financial training set can itself be a serious privacy breach.
Głębokie nurkowanie
Wnioskowanie o członkostwie wykorzystuje prostą intuicję: modele zwykle zachowują się inaczej w przypadku danych, które zapamiętały podczas szkolenia, w porównaniu z danymi, których nigdy nie widziały. W przełomowym ataku Shokri i współpracowników z 2017 r. wyszkolono „modele cieni”, które imitują cel, a następnie wytrenowano klasyfikator w zakresie rozpoznawania wzorców pewności siebie członków i osób niebędących członkami. Wiele późniejszych ataków jest prostszych: przykład członka często powoduje mniejsze straty lub większą pewność niż porównywalny przypadek niebędący członkiem. Nadmierne dopasowanie pogłębia tę lukę, dlatego najbardziej narażone są mocno zapamiętane lub rzadkie nagrania. Niebezpieczeństwo ma charakter kontekstowy. Jeśli model został przeszkolony tylko na pacjentach z określoną diagnozą, udowodnienie członkostwa ujawnia diagnozę. Ataki te są standardowym testem empirycznym sprawdzającym, czy model powoduje wyciek danych szkoleniowych.
Wgląd techniczny
Najsilniejsze współczesne ataki, takie jak atak współczynnika wiarygodności (LiRA), kalibrują trudność na podstawie przykładu, porównując stratę modelu docelowego na rekordzie z rozkładem strat z wielu modeli wyszkolonych z tym rekordem i bez niego. Ta kalibracja usuwa szum z przykładów, które są po prostu łatwe lub trudne, wyostrzając sygnał typu element w porównaniu z sygnałem niebędącym elementem i radykalnie zwiększając współczynnik prawdziwie dodatnich wyników przy niskich współczynnikach wyników fałszywie dodatnich.
Wpływ strategiczny
Ryzyko i bezpieczeństwo
Zarówno katastrofalne, jak i codzienne szkody spowodowane sztuczną inteligencją zależą od tego, kto rozumie ryzyko i kto może podjąć działania.
Jaśniejsze decyzje
Umiejętność korzystania z usług publicznych i zawodowych wpływa na to, czy silna polityka bezpieczeństwa jest politycznie możliwa.
Przebijanie się przez szum
Jasne wyjaśnienia ograniczają wpływ szumu, PR laboratoryjnego i niejasnego teatru etycznego.
Przyszłość ataków polegających na wnioskowaniu o członkostwie
W miarę jak modele szkolą się na coraz większej liczbie danych osobowych, wnioskowanie o członkostwie staje się wymaganym audytem, a nie akademicką ciekawostką. Organy regulacyjne interpretujące RODO i podobne przepisy coraz częściej traktują zapamiętane dane szkoleniowe jako dane osobowe, więc ataki pełnią podwójną rolę testów zgodności. Główna obrona, czyli prywatność różnicowa, zapewnia możliwe do udowodnienia granice, ale kosztuje dokładność, popychając badania w kierunku ściślejszej rachunkowości dotyczącej prywatności, selektywnej ochrony rzadkich rekordów i oduczania maszyn w celu usuwania poszczególnych osób na żądanie.
Implementacja w świecie rzeczywistym
Audyt modelu diagnostycznego szpitala w celu sprawdzenia, czy dane poszczególnych pacjentów można zidentyfikować jako dane szkoleniowe
Wykazanie wycieku istotnego z punktu widzenia RODO poprzez pokazanie modelu zapamiętanego konkretnych rekordów użytkownika
Zespół red-team modelu językowego w celu sprawdzenia, czy w korpusie szkoleniowym znajdują się prywatne wiadomości e-mail lub dokumenty
Ocena, czy szkolenie w zakresie zróżnicowanej prywatności faktycznie zlikwidowało różnicę między członkami a osobami niebędącymi członkami
Zagrożenia i poręcze
Traktowanie ryzyka egzystencjalnego jako science-fiction, choć łączy w sobie możliwości.
Mylenie bezpieczeństwa produktów powierzchniowych z wyrównaniem przy dużej autonomii.
Pozostawienie odbiorcom nieanglojęzycznym i nieeksperckim jedynie źródeł o niskiej jakości.
Plan wdrożenia
Oddziel ryzyko szkód, niewłaściwego użycia i utraty kontroli/niewspółosiowości produktu.
Zapytaj, jakie dowody zmieniłyby Twój pogląd na temat terminów i dotkliwości.
Przedkładaj źródła pierwotne i konkretne oceny nad twierdzenia marketingowe.
Zidentyfikuj jedną ścieżkę działania: karierę, politykę, finansowanie lub umiejętności – nie tylko świadomość.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Membership Inference Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Natychmiastowe ataki wtryskowe
Często zadawane pytania
What is Membership Inference Attacks?
Atak polegający na wnioskowaniu o członkostwie ma na celu ustalenie, czy do uczenia modelu wykorzystano dane konkretnej osoby, po prostu poprzez sondowanie modelu. Ma to znaczenie, ponieważ potwierdzenie, że dana osoba przeszła szkolenie medyczne lub finansowe, samo w sobie może stanowić poważne naruszenie prywatności.
Co próbuje ustalić atak polegający na wnioskowaniu o członkostwie?
Atak wnioskuje o członkostwo: czy dany punkt danych został użyty do uczenia modelu, co samo w sobie może spowodować wyciek poufnych informacji.
Jaka właściwość modelu najbardziej zwiększa podatność na te ataki?
Nadmierne dopasowanie poszerza lukę behawioralną pomiędzy uczestnikami szkolenia a niewidocznymi danymi, dzięki czemu członkostwo jest łatwiejsze do wykrycia.
Jaką technikę zastosował oryginalny Shokri i in. z 2017 r. atak polegać?
Wytrenowali modele cieni naśladujące cel, aby wygenerować oznaczone zachowania członków/nieczłonków na potrzeby klasyfikatora ataku.
Dlaczego wnioskowanie o członkostwie może być szkodliwe nawet bez ujawnienia zawartości rekordu?
Jeśli zbiór danych jest zdefiniowany przez wrażliwy atrybut, samo potwierdzenie czyjejś obecności ujawni ten atrybut.
Co sprawia, że atak na współczynnik wiarygodności (LiRA) jest silniejszy niż naiwne progowanie strat?
LiRA porównuje stratę docelową z rozkładami z modeli przeszkolonych z każdym rekordem i bez niego, usuwając szum związany z trudnościami na przykład.