Alkotmányos AI
Az alkotmányos mesterséges intelligencia az Anthropic módszere a modellek egymáshoz igazítására egy írott alapelvek – egy „alkotmány” – segítségével, így az MI bírálja és felülvizsgálja saját válaszait, ahelyett, hogy csak az emberekre hagyatkozna a káros tartalmak címkézésében.
Áttekintés
It aims to make models helpful and harmless with far less human labor.
Mély merülés
A hagyományos igazítás az emberi visszacsatolásból (RLHF) kapott megerősítő tanulásra támaszkodik, ahol az emberek számos modellkimenetet rangsorolnak, beleértve a zavaróakat is, hogy megtanítsák a modellnek, mit kell elkerülni. Az alkotmányos mesterséges intelligencia csökkenti ezt a terhet azáltal, hogy a modellnek explicit listát ad az írott elvekről, amelyek olyan forrásokból származnak, mint az ENSZ Emberi Jogok Nyilatkozata és a bizalom és biztonság bevált gyakorlatai. A képzésnek két szakasza van. Először is egy felügyelt szakasz: a modell választ generál, majd egy alkotmányos elvvel szemben bírálja és átírja jobbra; ezek a saját fejlesztésű válaszok a finomhangolásra szolgálnak. Másodszor, egy megerősítés-tanulási szakasz, az RLAIF, ahol a modell maga rangsorolja a válaszpárokat az alkotmány szerint, és az AI által generált preferenciaadatok jutalmazási modellt képeznek. Az alapelvek átláthatóak és szerkeszthetők, így a modellt irányító értékek inkább áttekinthetőek, semmint átláthatatlan emberi címkékbe rejtve.
Technikai betekintés
A két fázist gyakran SL-CAI-nak és RL-CAI-nak nevezik. A felügyelt tanulás során a „kritika és átdolgozás” ciklus arra készteti a modellt, hogy keresse meg, hol sérti a saját válasza a mintavételi elvet, és írja át azt, így képzési adatokat generál az emberi ártalmak címkézése nélkül. Az RL fázisban egy második modell ítéli meg, hogy a két válasz közül melyik követi jobban az alapszabályt, és AI preferenciacímkéket (RLAIF) állít elő, amelyek a szabványos RL-ben használt jutalmazási modellt képezik. Az alkotmány egyszerű szöveges útmutatás, amelyet a promptokba injektálnak, így a modell viselkedésének megváltoztatása ugyanolyan közvetlen lehet, mint az alapelvek szerkesztése.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
Az alkotmányos mesterséges intelligencia jövője
Az alkotmányos mesterséges intelligencia a „skálázható felügyelet” felé mutat, ahol a mesterséges intelligencia segít felügyelni az AI-t, mivel a modellek túlságosan alkalmassá válnak ahhoz, hogy az emberek minden kimenetet ellenőrizhessenek. Gazdagabb, árnyaltabb alkotmányokra, nyilvános és részvételi hozzájárulásra számíthat az alapelvek kiválasztásához (a Anthropic „kollektív alkotmányos mesterségesintelligencia”-kísérleteket végzett), valamint az emberi visszajelzést és a mesterséges intelligencia önkritikáját ötvöző hibrid megközelítéseket. Az írott alapelvek átláthatósága vonzóvá teszi ezt a szabályozók és auditorok számára, akik látni szeretnék a rendszer által kódolt értékeket. Ahogy a határmodellek fejlődnek, a biztonság központi elemévé válnak azok a módszerek, amelyek lehetővé teszik a modellek számára, hogy megbízhatóan bírálják és javítsák magukat az explicit szabályokkal szemben.
Valós megvalósítás
A chatbot betanítása arra, hogy megtagadja a fegyverkészítést úgy, hogy bírálja saját választervezetét az ártalom elkerülésének elvével szemben, és írja át azt
A mérgező anyagok költséges, emberi vörös csapat általi címkézésének felváltása mesterséges intelligencia által generált preferenciaadatokkal (RLAIF) az alkotmány által vezérelve
Írott elv szerkesztése a modell óvatosságának beállításához, majd a viselkedés változásának megfigyelése több ezer példa átcímkézése nélkül
Kollektív input gyakorlatok lebonyolítása, ahol a nyilvánosság olyan elveket javasol, amelyek alakítják a modell felépítését
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Utasítás hangolás
Gyakran ismételt kérdések
What is Constitutional AI?
Az alkotmányos mesterséges intelligencia az Anthropic módszere a modellek egymáshoz igazítására egy írott alapelvek – egy „alkotmány” – segítségével, így az MI bírálja és felülvizsgálja saját válaszait, ahelyett, hogy csak az emberekre hagyatkozna a káros tartalmak címkézésében. Célja, hogy a modelleket jóval kevesebb emberi munkával hasznossá és ártalmatlanná tegye.
Mi az „alkotmány” az alkotmányos AI-ban?
Az alkotmány olyan írott alapelvek átlátható halmaza, amelyek forrásokból, például emberi jogi dokumentumokból származnak, és amelyeket a modell a válaszok értékelésére és javítására használ.
Milyen kulcsproblémát kíván csökkenteni az alkotmányos mesterséges intelligencia a szabványos RLHF-nél?
Azáltal, hogy a modell önmagát bírálja az elvekkel szemben, az alkotmányos mesterséges intelligencia csökkenti a zavaró vagy káros kimenetek felülvizsgálatának és címkézésének emberi munkáját.
Az alkotmányos mesterséges intelligencia felügyelt szakaszában mit tesz a modell a saját kimenetével?
A modell egy kritika és átdolgozás ciklust futtat: azonosítja, hol sérti meg a vázlat egy mintavételi elvet, majd újraírja a választ, így saját fejlesztésű képzési adatokat hoz létre.
Mit jelent a RLAIF a megerősítés-tanulás szakaszában?
Az RLAIF a mesterséges intelligencia visszacsatolásából való tanulás megerősítését jelenti: a modell az alapszabály szerint rangsorolja a válaszokat, és emberi címkék helyett mesterséges intelligencia által generált preferenciaadatokat állít elő.
Miért tekintik az írott elvek alkalmazását előnynek az átláthatóság szempontjából?
Mivel a vezérértékek ki vannak írva, közvetlenül ellenőrizhetők, auditálhatók és szerkeszthetők, ellentétben a szétszórt emberi értékelésekbe implicit módon kódolt preferenciákkal.