PRZEWODNIK Społeczny

Ataki polegające na wnioskowaniu o członkostwie

Atak polegający na wnioskowaniu o członkostwie ma na celu ustalenie, czy do uczenia modelu wykorzystano dane konkretnej osoby, po prostu poprzez sondowanie modelu.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because confirming someone was in a medical or financial training set can itself be a serious privacy breach.

Głębokie nurkowanie

Wnioskowanie o członkostwie wykorzystuje prostą intuicję: modele zwykle zachowują się inaczej w przypadku danych, które zapamiętały podczas szkolenia, w porównaniu z danymi, których nigdy nie widziały. W przełomowym ataku Shokri i współpracowników z 2017 r. wyszkolono „modele cieni”, które imitują cel, a następnie wytrenowano klasyfikator w zakresie rozpoznawania wzorców pewności siebie członków i osób niebędących członkami. Wiele późniejszych ataków jest prostszych: przykład członka często powoduje mniejsze straty lub większą pewność niż porównywalny przypadek niebędący członkiem. Nadmierne dopasowanie pogłębia tę lukę, dlatego najbardziej narażone są mocno zapamiętane lub rzadkie nagrania. Niebezpieczeństwo ma charakter kontekstowy. Jeśli model został przeszkolony tylko na pacjentach z określoną diagnozą, udowodnienie członkostwa ujawnia diagnozę. Ataki te są standardowym testem empirycznym sprawdzającym, czy model powoduje wyciek danych szkoleniowych.

Wgląd techniczny

Najsilniejsze współczesne ataki, takie jak atak współczynnika wiarygodności (LiRA), kalibrują trudność na podstawie przykładu, porównując stratę modelu docelowego na rekordzie z rozkładem strat z wielu modeli wyszkolonych z tym rekordem i bez niego. Ta kalibracja usuwa szum z przykładów, które są po prostu łatwe lub trudne, wyostrzając sygnał typu element w porównaniu z sygnałem niebędącym elementem i radykalnie zwiększając współczynnik prawdziwie dodatnich wyników przy niskich współczynnikach wyników fałszywie dodatnich.

Wpływ strategiczny

Ryzyko i bezpieczeństwo

Zarówno katastrofalne, jak i codzienne szkody spowodowane sztuczną inteligencją zależą od tego, kto rozumie ryzyko i kto może podjąć działania.

Jaśniejsze decyzje

Umiejętność korzystania z usług publicznych i zawodowych wpływa na to, czy silna polityka bezpieczeństwa jest politycznie możliwa.

Przebijanie się przez szum

Jasne wyjaśnienia ograniczają wpływ szumu, PR laboratoryjnego i niejasnego teatru etycznego.

Przyszłość ataków polegających na wnioskowaniu o członkostwie

W miarę jak modele szkolą się na coraz większej liczbie danych osobowych, wnioskowanie o członkostwie staje się wymaganym audytem, ​​a nie akademicką ciekawostką. Organy regulacyjne interpretujące RODO i podobne przepisy coraz częściej traktują zapamiętane dane szkoleniowe jako dane osobowe, więc ataki pełnią podwójną rolę testów zgodności. Główna obrona, czyli prywatność różnicowa, zapewnia możliwe do udowodnienia granice, ale kosztuje dokładność, popychając badania w kierunku ściślejszej rachunkowości dotyczącej prywatności, selektywnej ochrony rzadkich rekordów i oduczania maszyn w celu usuwania poszczególnych osób na żądanie.

Implementacja w świecie rzeczywistym

Audyt modelu diagnostycznego szpitala w celu sprawdzenia, czy dane poszczególnych pacjentów można zidentyfikować jako dane szkoleniowe

Wykazanie wycieku istotnego z punktu widzenia RODO poprzez pokazanie modelu zapamiętanego konkretnych rekordów użytkownika

Zespół red-team modelu językowego w celu sprawdzenia, czy w korpusie szkoleniowym znajdują się prywatne wiadomości e-mail lub dokumenty

Ocena, czy szkolenie w zakresie zróżnicowanej prywatności faktycznie zlikwidowało różnicę między członkami a osobami niebędącymi członkami

Zagrożenia i poręcze

Traktowanie ryzyka egzystencjalnego jako science-fiction, choć łączy w sobie możliwości.

Mylenie bezpieczeństwa produktów powierzchniowych z wyrównaniem przy dużej autonomii.

Pozostawienie odbiorcom nieanglojęzycznym i nieeksperckim jedynie źródeł o niskiej jakości.

Plan wdrożenia

1

Oddziel ryzyko szkód, niewłaściwego użycia i utraty kontroli/niewspółosiowości produktu.

2

Zapytaj, jakie dowody zmieniłyby Twój pogląd na temat terminów i dotkliwości.

3

Przedkładaj źródła pierwotne i konkretne oceny nad twierdzenia marketingowe.

4

Zidentyfikuj jedną ścieżkę działania: karierę, politykę, finansowanie lub umiejętności – nie tylko świadomość.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Membership Inference Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Natychmiastowe ataki wtryskowe

Często zadawane pytania

What is Membership Inference Attacks?

Atak polegający na wnioskowaniu o członkostwie ma na celu ustalenie, czy do uczenia modelu wykorzystano dane konkretnej osoby, po prostu poprzez sondowanie modelu. Ma to znaczenie, ponieważ potwierdzenie, że dana osoba przeszła szkolenie medyczne lub finansowe, samo w sobie może stanowić poważne naruszenie prywatności.

Co próbuje ustalić atak polegający na wnioskowaniu o członkostwie?

Atak wnioskuje o członkostwo: czy dany punkt danych został użyty do uczenia modelu, co samo w sobie może spowodować wyciek poufnych informacji.

Jaka właściwość modelu najbardziej zwiększa podatność na te ataki?

Nadmierne dopasowanie poszerza lukę behawioralną pomiędzy uczestnikami szkolenia a niewidocznymi danymi, dzięki czemu członkostwo jest łatwiejsze do wykrycia.

Jaką technikę zastosował oryginalny Shokri i in. z 2017 r. atak polegać?

Wytrenowali modele cieni naśladujące cel, aby wygenerować oznaczone zachowania członków/nieczłonków na potrzeby klasyfikatora ataku.

Dlaczego wnioskowanie o członkostwie może być szkodliwe nawet bez ujawnienia zawartości rekordu?

Jeśli zbiór danych jest zdefiniowany przez wrażliwy atrybut, samo potwierdzenie czyjejś obecności ujawni ten atrybut.

Co sprawia, że atak na współczynnik wiarygodności (LiRA) jest silniejszy niż naiwne progowanie strat?

LiRA porównuje stratę docelową z rozkładami z modeli przeszkolonych z każdym rekordem i bez niego, usuwając szum związany z trudnościami na przykład.