Mi történt
Egy augusztus 5-én közzétett kutatási cikk az oktatási tesztelés módszerét alkalmazza a mesterséges intelligencia biztonsági referenciaértékeinek mérésére, a hasznos figyelmeztetések kisebb készleteinek kiválasztására és a modell viselkedésében bekövetkezett változások ellenőrzésére.
Két független kutató és két, az Egyesült Királyság AI Biztonsági Intézetéhez kapcsolódó kutató 192 csevegési modellt értékelt nyolc benchmarkon, amelyek kiterjedtek a káros kérések elutasítására, a jóindulatú kérések túlzott elutasítására, a kontextuális károkra és az igazmondásra. A teljes programcsomag 5255 promptot tartalmazott az előfeldolgozás előtt; az elemzés 5067-et tartott meg, miután eltávolította a pontozatlan válaszokat és azokat az elemeket, amelyek nem tettek különbséget a tesztelt modellek között.
A csapat a modelleket tesztfelvevőként, a benchmark promptokat pedig tesztelemként kezelte, és az item-reakcióelmélet segítségével megbecsülte, mely felszólítások voltak nehézkesek, és melyek a legjobban szétválasztani a modelleket. A fő faktorelemzésben egy háromfaktoros megoldás – az elutasítás szigorúságában, az igazmondásban és a kontextuális ártalmakban összefoglalva – a modell képességei közötti eltérések 77%-át magyarázta, szemben az egyetlen tényező 47%-ával.
A 20 elhúzódó értékelés során három rögzített, 25 gyors teszttel sikerült helyreállítani ezt a három tényezőt a programcsomag kevesebb mint 2%-ának felhasználásával. A HarmBench, a SORRY-Bench és az OR-Bench-Hard esetében nagyjából 10 adaptív módon kiválasztott prompt 0,92 és 0,94 közötti korrelációval reprodukálta a teljes benchmark rangsort, és 97–99%-kal csökkentette a promptok számát; az előny a teszt költségvetésének növekedésével csökkent.
A tömörítés nem egyszerűen véletlenszerű mintavétel. Az itemválasz elmélet megbecsüli, hogy az egyes promptok mennyire nehezek, és mennyire jól választja el a különböző válaszmintázatú modelleket, majd kiválasztja azokat az elemeket, amelyek megőrzik a nagyobb teszt szerkezetét. A szerzők összehasonlították a rögzített rövid formákat az adaptív kiválasztással, és értékeléseket végeztek, ahelyett, hogy csak a promptok kiválasztásához használt adatokat mérték volna. Ez a kialakítás alátámasztja azt a szűkebb állítást, hogy egyes meglévő benchmark rangsorok hatékonyan reprodukálhatók; nem azt mutatja, hogy egy 10 vagy 25 elemből álló teszt teljesen új hibamódot fedezhet fel.
Forrás részletei: Rivera and colleagues' research paper on arXiv ↗
Miért számít
A tanulmány azt sugallja, hogy a jobban megválasztott felszólítások olcsóbbá tehetik a gyakori mesterséges intelligencia-biztonsági ellenőrzéseket anélkül, hogy úgy tennék, mintha minden referenciaérték egy univerzális biztonsági pontszámot mérne.
Az olcsóbb tesztek révén a fejlesztők, a kis laboratóriumok és a független értékelők több modellverziót ellenőrizhetnek a képzés, a finomhangolás, a kvantálás és a rendszerváltás során. Az eredmény a meglévő benchmark mérések hatékony reprodukálása, nem pedig a benchmarkok észlelésének bővítése.
A faktoranalízis egy pontozási kompromisszumot is feltár. Az elutasítást jutalmazó referenciaértékek átfedhetik egymást, míg a szükségtelen visszautasítások elkerülésére szolgáló referenciaérték az ellenkező viselkedést jutalmazza. Átlagolásuk a súlyok magyarázata nélkül elfedheti, hogy egy modell biztonságosabbá vált, csupán korlátozóbb lett-e vagy kevésbé hasznos a jóindulatú kérések esetén.
A tanulmány a feketedobozos audit módszereit is tesztelte a szándékosan előidézett homokzsákos viselkedésre. A válaszminta-ellenőrzés szelektív alulteljesítést észlelt, de a legegyszerűbb alulteljesítést kihagyta; a korábbi képességellenőrzés hozzáadásával a kombinált észlelés 94–97%-ra emelkedett a szimulált esetek között. Ez támogatja a többrétegű auditokat, nem pedig az egyetlen pontszámra támaszkodva.
A fejlesztők számára a működési érték a frekvencia. Egy rövidebb kiértékelés újra lefutható egy rendszerkérdés, kvantálási lépés, finomhangolás, eszközfrissítés vagy biztonsági politika felülvizsgálata után anélkül, hogy minden alkalommal a teljes benchmark költségvetését felemésztené. Az eredmény azonban csak akkor hasznos, ha a csapatok rendszeres ellenőrzésként megtartják az eredeti csomagot, váltogatják a kitartott promptokat, és meglepő változásokat vizsgálnak ahelyett, hogy közvetlenül a tömörített tesztre optimalizálnának. Ellenkező esetben az olcsó csekk a túlszerelés újabb célpontjává válhat.
Interaktív mechanizmus: Hogyan működik valójában
Fedezze fel interaktívan a fejlesztés mögött meghúzódó technológiát.
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
Mit nézzünk ezután
Figyelje meg a független replikációt, a jövőbeli modellcsaládok érvényesítését és a bizonyítékokat arra vonatkozóan, hogy a rövidített tesztek az általuk reprodukálni kívánt referenciaértékeken kívüli viselkedést jósolják.
Ez egy új preprint, nem egy befejezett szakértői értékelés. A látens struktúra elemzése 134 modellt használt, amely a szerzők szerint kicsi a hagyományos pszichometriai szabványokhoz képest, és az alternatív kinyerési módszer három helyett két tényezőt tartott meg. A faktornevek empirikus összefoglalások, nem a biztonság validált definíciói.
Minden modell minden elérhető promptonként egy választ adott az OpenRouteren keresztül, és minden benchmark az előírt automatizált ítélőképességét használta. Az eredményül kapott rövid tesztek örökölhetik az eredeti felszólítások, a pontozási szabályok, a nyelvi lefedettség és a bírák hibáit; A szerzők kifejezetten azt mondják, hogy a tömörítés nem azt mutatja, hogy a benchmark előrejelzi a telepítés biztonságát, vagy informatív marad a jövőbeli modellek számára.
A homokzsákolási tesztek inkább modellszervezeteket használtak, nem pedig az értékelés elkerülésére finomhangolt modelleket, amelyek könnyebben észlelhetők. Az API-ellenőrzések a viselkedés folytonosságát állapítják meg, nem pedig a rejtett modellsúlyok azonosítását, és a tanulmány nem tesztelt olyan ellenfelet, amely kifejezetten az auditálási módszerek legyőzésére lett kiképezve.
A cikk legfontosabb határvonala a mérési hatékonyság és a biztonság garantálása között van. Egy rövid forma meg tudja becsülni az eredeti referenciaértékben jelenlévő látens tényezőket, de örökli a viszonyítási alap nyelvezetét, megítélését, azonnali keretezését és a vak foltokat. A jövőbeli értékelések során tesztelni kell a többnyelvű felszólításokat, az eszközöket használó ügynököket, a hosszú beszélgetéseket, a kontradiktóriusan finomhangolt modelleket és a független emberi ítéleteket. Azt is jelenteniük kell, ha a tömörített pontszám instabillá válik, mert a visszatartott adatok pontos korrelációja elfedheti a következő modellcsalád hibáját.
Ezekből a korlátozásokból egy gyakorlati átvételi szabály következik: tömörített teszteket használjon őrszemként, ne ítéletként. A csapatok gyakran futtathatják ezeket a regressziók észlelése érdekében, majd a teljes benchmark módosítását eszkalálhatják, és emberi felülvizsgálatot végezhetnek, ha a rövid forma váratlanul elmozdul. A tanulmány saját bizonyítékai alátámasztják ezt a többrétegű munkafolyamatot, mivel a faktorstruktúra meghatározott felszólításokból, bírákból és modellkimenetekből származott. A kiválasztott tételek, a kiválasztási kód, a visszatartott eredmények és a verzióelőzmények közzététele lehetővé tenné a független értékelők számára, hogy ellenőrizzék, hogy a rövid tesztek tájékoztató jellegűek maradnak-e, miután a fejlesztők látták őket, és miután az új modellcsaládok megváltoztatták a válaszok eloszlását.
Ugyanez az átláthatóság számít egy modell frissítésekor. Egy rövid, egy generációra kalibrált teszt túl könnyűvé, túl keskenyé válhat, vagy véletlenül egy új rendszerprompthoz igazodik. A csapatoknak meg kell őrizniük a korábbi verziókat, nyilvánosságra kell hozniuk, ha egy elem vagy bíró megváltozik, és megbízhatósági intervallumokat kell jelenteniük, ahelyett, hogy a tömörített rangsort pontos biztonsági pontszámként mutassák be. Ezek a gyakorlatok a papír hatékonysági eredményét auditálható felügyeleti programmá alakítják, miközben az eredeti viszonyítási alap elérhető marad a mélyebb áttekintéshez.