PRZEWODNIK techniczny

Prywatność różnicowa

Prywatność różnicowa to matematyczna gwarancja, że analiza zbioru danych ujawni przydatne wzorce, jednocześnie ukrywając, czy uwzględniono dane jakiejkolwiek pojedynczej osoby.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it lets organizations share statistics and train models without exposing the individuals behind the numbers.

Głębokie nurkowanie

Prywatność różnicowa zapewnia formalną definicję prywatności: wyniki analizy powinny być prawie takie same, niezależnie od tego, czy w zbiorze danych znajduje się dana osoba. Osiąga się to poprzez dodanie starannie skalibrowanego szumu losowego do wyników lub obliczeń, dzięki czemu osoba atakująca nie może z całą pewnością stwierdzić, czy przyczyniła się do tego konkretna osoba. Siła jest kontrolowana przez parametr zwany epsilon („budżet prywatności”): mniejszy epsilon oznacza więcej hałasu i większą prywatność, ale mniejszą dokładność. Istnieją dwa główne smaki. W modelu centralnym zaufany kurator przechowuje surowe dane i dodaje szum do opublikowanych odpowiedzi. W modelu lokalnym dane każdej osoby są poddawane szumowi na jej własnym urządzeniu, zanim jeszcze je opuści, co nie wymaga zaufanej jednostki centralnej, ale zazwyczaj wymaga większego szumu.

Wgląd techniczny

Podstawowym mechanizmem jest skalibrowany szum, często pobierany z rozkładu Laplace'a lub Gaussa, skalowany do „czułości” zapytania – czyli tego, jak bardzo dane jednej osoby mogą zmienić wynik. Zmiana jednoosobowa powinna zostać statystycznie zalana tym hałasem. Utrata prywatności kumuluje się w przypadku zapytań i jest śledzona przez budżet epsilon zgodnie z regułami kompozycji, więc każda nowa analiza wymaga ograniczonego limitu. W uczeniu maszynowym DP-SGD dodaje szum do przyciętych gradientów podczas uczenia, aby ograniczyć wpływ dowolnego rekordu na ostateczny model.

Wpływ strategiczny

Koszt i budżet

Decyzje dotyczące architektury wpływają na wydajność i koszty operacyjne przez lata.

Jaśniejsze decyzje

Edukacja techniczna pomaga zespołom wybrać odpowiedni stos, a nie tylko najnowszy.

Kontrola jakości

Lepsze wybory inżynieryjne zmniejszają liczbę incydentów związanych z niezawodnością w produkcji.

Przyszłość prywatności różnicowej

Zróżnicowana prywatność staje się standardową infrastrukturą: agencje spisowe, platformy technologiczne i badacze zajmujący się zdrowiem coraz częściej wykorzystują ją do bezpiecznego publikowania statystyk. Oczekuj lepszych narzędzi, które automatycznie śledzą budżety na prywatność, podejść hybrydowych łączących DP ze stowarzyszonym uczeniem się i bezpiecznymi obliczeniami, a także ulepszonych mechanizmów szumów, które zapewniają większą dokładność na jednostkę prywatności. Organy regulacyjne i organy normalizacyjne zmierzają w kierunku uznania DP za punkt odniesienia dla „anonimowych” danych, co może uczynić go domyślnym wymogiem przy udostępnianiu wrażliwych zbiorów danych i modeli sztucznej inteligencji.

Implementacja w świecie rzeczywistym

Biuro Spisu Ludności Stanów Zjednoczonych dodało do statystyk spisu ludności na rok 2020 zakłócenia dotyczące prywatności, aby chronić respondentów podczas publikowania danych dotyczących populacji.

Apple korzysta z lokalnej prywatności różnicowej, aby poznać popularne emoji i trendy w pisaniu z iPhone'ów bez identyfikowania poszczególnych użytkowników.

Naukowcy trenują modele medyczne za pomocą DP-SGD, więc ostateczny model nie może zapamiętać ani ujawnić historii żadnego indywidualnego pacjenta.

Google RAPPOR zebrał zbiorcze statystyki użytkowania przeglądarki, losowo dobierając raport każdego użytkownika, zanim opuścił on jego urządzenie.

Zagrożenia i poręcze

Optymalizacja jednego testu porównawczego może ukryć szersze słabości systemu.

Koszty infrastruktury i utrzymania są często niedoszacowane.

W miarę jak systemy stają się coraz bardziej złożone, luki w bezpieczeństwie i obserwowalności mogą się zwiększać.

Plan wdrożenia

1

Przed wdrożeniem zdefiniuj docelowe opóźnienia, jakość i koszty.

2

Test porównawczy w realistycznych warunkach obciążenia i danych.

3

Monitorowanie przyrządu pod kątem błędów, dryftu i wpływu użytkownika.

4

Przed skalowaniem przygotuj ścieżki wycofywania zmian i reakcji na incydenty.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Differential Privacy quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Sztuczna inteligencja i prywatność

Często zadawane pytania

What is Differential Privacy?

Prywatność różnicowa to matematyczna gwarancja, że analiza zbioru danych ujawni przydatne wzorce, jednocześnie ukrywając, czy uwzględniono dane jakiejkolwiek pojedynczej osoby. Ma to znaczenie, ponieważ umożliwia organizacjom udostępnianie statystyk i trenowanie modeli bez ujawniania osób stojących za liczbami.

Co kontroluje parametr prywatności epsilon w prywatności różnicowej?

Epsilon to budżet prywatności: mniejszy epsilon oznacza więcej hałasu i większą prywatność, ale mniejszą dokładność.

W jaki sposób zróżnicowana prywatność zazwyczaj ukrywa wkład jednostki?

Starannie skalowany szum losowy sprawia, że ​​wyniki są prawie identyczne, niezależnie od tego, czy uwzględniona jest jedna osoba, czy nie.

Co odróżnia „lokalny” model zróżnicowanej prywatności od modelu „centralnego”?

W modelu lokalnym dane są zakłócane na urządzeniu, co eliminuje potrzebę ufania podmiotowi centralnemu, ale zwykle wymaga większego szumu.

Do czego służy „czułość” podczas kalibracji szumu?

Hałas jest skalowany do czułości, tak aby wpływ pojedynczej osoby był statystycznie maskowany.

Dlaczego każde nowe zapytanie kosztuje z „budżetu prywatności”?

Podczas tworzenia powtarzających się zapytań następuje kumulacja większej ilości informacji, zatem każde z nich korzysta ze skończonego limitu epsilon.