Társadalom ÚTMUTATÓ

Tagsági következtetés támadások

A tagsági következtetés támadása megpróbálja meghatározni, hogy egy adott személy adatait felhasználták-e egy modell betanításához, pusztán a modell tesztelésével.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because confirming someone was in a medical or financial training set can itself be a serious privacy breach.

Mély merülés

A tagságra vonatkozó következtetés egy egyszerű intuíciót használ ki: a modellek hajlamosak másként viselkedni a betanítás során megjegyzett adatokon, mint a soha nem látott adatokon. Shokri és munkatársai 2017-es döntő támadása során „árnyékmodelleket” képeztek ki, amelyek utánozzák a célpontot, majd egy osztályozót képeztek ki, amely felismeri a tagok és a nem tagok bizalmi mintáit. Sok későbbi támadás egyszerűbb: egy tag példa gyakran kisebb veszteséget vagy nagyobb bizalmat eredményez, mint egy hasonló, nem tag. A túlillesztés felerősíti ezt a különbséget, így az erősen memorizált vagy ritka lemezek vannak leginkább kitéve. A veszély kontextusfüggő. Ha egy modellt csak egy bizonyos diagnózisban szenvedő betegekre képeztek ki, a tagság bizonyítása felfedi a diagnózist. Ezek a támadások a szokásos empirikus tesztek annak megállapítására, hogy egy modell kiszivárog-e képzési adatokat.

Technikai betekintés

A legerősebb modern támadások, mint például a Likelihood Ratio Attack (LiRA), példánként kalibrálják a nehézséget úgy, hogy összehasonlítják a célmodell veszteségét egy rekordon a sok modell veszteségeloszlásával, amelyet ezzel a rekorddal vagy anélkül képeztek ki. Ez a kalibráció eltávolítja az egyszerűen könnyű vagy nehéz példák zaját, élesebbé teszi a tag versus nem tag jelet, és drámai módon megnöveli a valódi pozitív arányt alacsony hamis pozitív arányok mellett.

Stratégiai hatás

Kockázat és biztonság

A katasztrofális és a mindennapi mesterséges intelligencia okozta károk egyaránt attól függnek, hogy ki érti a kockázatokat, és ki tud cselekedni.

Tisztább döntések

A közéleti és szakmai műveltség határozza meg, hogy politikailag lehetséges-e az erős biztonsági politika.

Átvágva a felhajtáson

A világos magyarázatok csökkentik a hírverés, a laboratóriumi PR és a homályos etikai színház általi elkapását.

A tagsági következtetésre irányuló támadások jövője

Ahogy a modellek egyre több személyes adaton edzenek, a tagságra való következtetés egyre inkább kötelező audit, nem pedig tudományos kíváncsiság. A GDPR-t és a hasonló törvényeket értelmező szabályozók egyre inkább személyes adatként kezelik a memorizált edzési adatokat, így a támadások is megfelelési tesztnek minősülnek. A fő védelem, a differenciált adatvédelem, bizonyítható határokat biztosít, de költséges pontosságot biztosít, és a kutatást a szigorúbb adatvédelmi elszámolás, a ritka iratok szelektív védelme és a gépi tanulási folyamat az egyének kérésre történő eltávolítása felé tolja.

Valós megvalósítás

Kórház diagnosztikai modelljének auditálása annak ellenőrzésére, hogy az egyes betegrekordok azonosíthatók-e képzési adatokként

A GDPR-releváns szivárgás kimutatása konkrét felhasználói rekordok memorizált modelljének bemutatásával

Nyelvi modell összevonása annak tesztelésére, hogy magán e-mailek vagy dokumentumok szerepeltek-e a képzési korpuszban

Annak értékelése, hogy a megkülönböztetett adatvédelmi képzés valóban megszüntette-e a tagok és a nem tagok közötti szakadékot

Kockázatok és védőkorlátok

Az egzisztenciális kockázat sci-fiként való kezelése, miközben a képesség összetett.

Zavaros felületi termékbiztonság a nagy autonómia melletti igazítással.

A nem angol nyelvű és nem szakértő közönségnek csak rossz minőségű forrásokat kell hagynia.

Végrehajtási ütemterv

1

Különítse el a termékkárok, a visszaélések és az ellenőrzés elvesztésének/hibás beállításának kockázatait.

2

Kérdezd meg, milyen bizonyítékok változtatnák meg az idővonalakról és a súlyosságról alkotott nézetedet.

3

Részesítse előnyben az elsődleges forrásokat és a konkrét értékeléseket a marketinges állításokkal szemben.

4

Határozzon meg egy cselekvési utat: karrier, politika, finanszírozás vagy készségek – nem csak a tudatosság.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Membership Inference Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Azonnali injekciós támadások

Gyakran ismételt kérdések

What is Membership Inference Attacks?

A tagsági következtetés támadása megpróbálja meghatározni, hogy egy adott személy adatait felhasználták-e egy modell betanításához, pusztán a modell tesztelésével. Ez azért fontos, mert annak megerősítése, hogy valaki részt vett egy egészségügyi vagy pénzügyi képzésben, önmagában is súlyos adatsértést jelenthet.

Mit próbál meghatározni a tagsági következtetésre irányuló támadás?

A támadás a tagságra következtet: egy adott adatpontot használtak-e a modell betanításához, amely maga is kiszivároghat érzékeny információkat.

Melyik modelltulajdonság erősíti leginkább a támadásokkal szembeni sebezhetőséget?

A túlillesztés növeli a viselkedésbeli szakadékot a képzési tagok és a nem látott adatok között, így könnyebben észlelhető a tagság.

Milyen technikával készült az eredeti 2017-es Shokri et al. támadásra támaszkodhat?

A célpontot utánzó árnyékmodelleket képezték ki, hogy címkézett tag/nem tag viselkedést generáljanak egy támadásosztályozóhoz.

Miért lehet káros a tagságra való következtetés még a rekord tartalmának felfedése nélkül is?

Ha egy adatkészletet érzékeny attribútum határoz meg, akkor pusztán valaki jelenlétének megerősítése felfedi ezt az attribútumot.

Mitől erősebb a Likelihood Ratio Attack (LiRA) a naiv veszteségküszöbnél?

A LiRA összehasonlítja a célveszteséget az egyes rekordokkal és anélkül betanított modellek eloszlásával, eltávolítva a példánkénti nehézségi zajt.