Társadalom ÚTMUTATÓ

Adatmérgezés és hátsóajtós támadások

Az adatmérgezés megsérti a modellt azáltal, hogy megzavarja a betanítási adatait, a hátsó ajtós támadások pedig egy titkos triggert rejtenek el, amely parancsra hibásan viselkedik.

2 perc olvasásUtoljára frissítve

Áttekintés

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Mély merülés

A mérgező támadások két nagy gólra oszlanak. A rendelkezésre állási támadások célja az általános pontosság lerontása, rosszul címkézett vagy sérült példák beszúrásával. A célzott és hátsó ajtós támadások alattomosabbak: a modell tökéletesen teljesít normál bemeneteken, de a támadók által választott kimenetet produkál, amikor megjelenik egy rejtett trigger, például egy kis pixelfolt, egy adott kifejezés vagy egy láthatatlan vízjel. A BadNets munkája egy stoptábla-osztályozót mutatott, amely egy matricával jelölt táblát „sebességkorlátozásként” olvas. A modern rendszerek azért vannak kitéve, mert webes méretű adatokon edzenek. A kutatók bebizonyították, hogy az adatkészlet URL-ek elenyésző töredéke mögött lejárt domain vásárlása néhány száz dollárért megmérgezheti a népszerű képadatkészleteket. A nyelvi modelleket megmérgezett finomhangolási adatokon vagy utasítási példákon keresztül is be lehet zárni.

Technikai betekintés

A tiszta címkés hátsó ajtó különösen veszélyes: a mérgezett minták megfelelő címkéket viselnek, és normálisnak tűnnek az emberi felülvizsgálók számára, ugyanakkor beágyaznak egy trigger funkciót, amelyet a modell megtanul egy célosztályhoz társítani. Következtetéskor a trigger bemutatása megfordítja az előrejelzést, miközben a tiszta pontosság magas marad, így a szabványos érvényesítés soha nem fogja meg. A védelmek közé tartozik az aktiválási klaszterezés, a spektrális aláírások, a trigger rekonstrukció és az adatok származási ellenőrzése.

Stratégiai hatás

Kockázat és biztonság

A katasztrofális és a mindennapi mesterséges intelligencia okozta károk egyaránt attól függnek, hogy ki érti a kockázatokat, és ki tud cselekedni.

Tisztább döntések

A közéleti és szakmai műveltség határozza meg, hogy politikailag lehetséges-e az erős biztonsági politika.

Átvágva a felhajtáson

A világos magyarázatok csökkentik a hírverés, a laboratóriumi PR és a homályos etikai színház általi elkapását.

Az adatmérgezés és a hátsó ajtós támadások jövője

Mivel az ellátási láncok összegyűjtött adatokra, előre betanított súlyokra és harmadik fél finomhangolásaira támaszkodnak, a mérgezés az elméletről a valós ellátási lánc fenyegetéssé válik. Adatkészlet-aláírási és származási szabványok, tanúsított robusztussági képzés, amely korlátozza a meghatározott számú mérgezett pont okozta károkat, és a modellek folyamatos hátsó ajtó-ellenőrzése a telepítés előtt. A szabályozók és a biztonsági keretrendszerek, mint például a MITER ATLAS, kezdik első osztályú gépi tanulási kockázatként kezelni a mérgezést.

Valós megvalósítás

Víziómodell önvezető autókhoz, amelyek félreolvasják a stoptáblát sebességkorlátozó táblaként, amikor egy kis matrica kioldó van jelen

Egy nyilvános képadatkészlet olcsó mérgezése a kép URL-jeinek egy részét tároló lejárt domainek eltérítésével

Ha egy kódkiegészítő modellt egy rejtett felszólító kifejezéssel hátrál, nem biztonságos kódot illeszt be

A spamszűrők tömeges forrásból származó képzési visszajelzéseinek megsértése, így konkrét rosszindulatú e-mailek csúsznak át

Kockázatok és védőkorlátok

Az egzisztenciális kockázat sci-fiként való kezelése, miközben a képesség összetett.

Zavaros felületi termékbiztonság a nagy autonómia melletti igazítással.

A nem angol nyelvű és nem szakértő közönségnek csak rossz minőségű forrásokat kell hagynia.

Végrehajtási ütemterv

1

Különítse el a termékkárok, a visszaélések és az ellenőrzés elvesztésének/hibás beállításának kockázatait.

2

Kérdezd meg, milyen bizonyítékok változtatnák meg az idővonalakról és a súlyosságról alkotott nézetedet.

3

Részesítse előnyben az elsődleges forrásokat és a konkrét értékeléseket a marketinges állításokkal szemben.

4

Határozzon meg egy cselekvési utat: karrier, politika, finanszírozás vagy készségek – nem csak a tudatosság.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Data Poisoning and Backdoor Attacks?

Az adatmérgezés megsérti a modellt azáltal, hogy megzavarja a betanítási adatait, a hátsó ajtós támadások pedig egy titkos triggert rejtenek el, amely parancsra hibásan viselkedik. Ezek azért fontosak, mert a modellek egyre inkább tanulnak a lekapart, tömeges forrásból származó adatokból, amelyeket a támadók csendben beszennyezhetnek.

Mi különbözteti meg a hátsó ajtón történő támadást az általános rendelkezésre állású mérgező támadástól?

A hátsó ajtós modellek normál módon működnek a tiszta bemeneteken, és csak akkor adják ki a támadó célkimenetét, ha megjelenik a rejtett trigger.

Miért nehéz észlelni a tiszta címke hátsó ajtó támadásait?

Mivel a mérgezett példák megfelelő címkékkel rendelkeznek, és közönségesnek tűnnek, az emberi ellenőrzés és a szabványos érvényesítési pontosság nem jelzi őket.

Mit mutatott be híresen a BadNets kutatás?

A BadNets egy hátsóajtós közlekedési tábla-osztályozót mutatott be, amely félreolvassa a kis matricával jelölt stoptáblákat.

Hogyan mutatták ki a kutatók, hogy a webes méretű adatkészleteket olcsón meg lehet mérgezni?

Mivel az adatkészletek URL alapján hivatkoznak a képekre, a lejárt tartományok megvásárlása lehetővé teszi a támadók számára, hogy kis költség ellenében ellenőrizzék ezeket a képeket.

Ezek közül melyik az elismert védekezés a hátsó ajtók elleni támadásokkal szemben?

A védelem elemzi a belső aktiválásokat, hogy elkülönítse a mérgezett és tiszta példákat, többek között más kimutatási módszerek között.