Jazyk AI GUIDE

Ústavní AI

Ústavní umělá inteligence je metoda Anthropic pro sladění modelů pomocí psaného souboru zásad – „ústavy“ – takže umělá inteligence kritizuje a reviduje své vlastní odpovědi, místo aby se spoléhala pouze na lidi, aby označili škodlivý obsah.

2 minuty čteníNaposledy aktualizováno

Přehled

It aims to make models helpful and harmless with far less human labor.

Hluboký ponor

Tradiční zarovnání se opírá o posílení učení z lidské zpětné vazby (RLHF), kde lidé řadí mnoho výstupů modelu, včetně rušivých, aby model naučili, čemu se vyhnout. Ústavní umělá inteligence tuto zátěž snižuje tím, že dává modelu explicitní seznam písemných principů čerpaných ze zdrojů, jako je Deklarace lidských práv OSN a osvědčené postupy důvěry a bezpečnosti. Trénink má dvě fáze. Za prvé, kontrolovaná fáze: model generuje odpověď, pak ji kritizuje proti ústavnímu principu a přepisuje ji, aby byla lepší; tyto vlastní vylepšené odpovědi se používají k jeho doladění. Za druhé, fáze posilování-učení, RLAIF, kde samotný model řadí páry odpovědí podle konstituce a tato data preferencí generovaná AI trénují model odměny. Principy jsou transparentní a upravitelné, díky čemuž je možné hodnoty řídící model kontrolovat a neskrývat je v neprůhledných lidských štítcích.

Technický přehled

Tyto dvě fáze se často nazývají SL-CAI a RL-CAI. Při učení pod dohledem smyčka „kritika a revize“ vyzve model, aby našel, kde jeho vlastní odpověď porušuje vzorkovaný princip, a přepsal je, čímž se generují trénovací data bez označení lidského poškození. Ve fázi RL druhý model posuzuje, která ze dvou odpovědí lépe odpovídá konstituci, a vytváří preferenční štítky AI (RLAIF), které trénují model odměny používaný ve standardním RL. Konstituce je prosté textové vedení vložené do výzev, takže změna chování modelu může být stejně přímá jako úprava principů.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost ústavní umělé inteligence

Konstituční umělá inteligence ukazuje na „škálovatelný dohled“, kde umělá inteligence pomáhá dohlížet na umělou inteligenci, protože modely jsou příliš schopné na to, aby lidé mohli kontrolovat každý výstup. Očekávejte bohatší, jemnější konstituce, veřejný a participativní vstup, do kterého se volí principy (Anthropic provedla „kolektivní ústavní AI“ experimenty) a hybridní přístupy kombinující lidskou zpětnou vazbu se sebekritikou AI. Transparentnost písemných zásad to činí atraktivní pro regulátory a auditory, kteří chtějí vidět hodnoty, které systém kóduje. S postupem hraničních modelů se metody, které umožňují modelům spolehlivě kritizovat a zlepšovat se podle explicitních pravidel, pravděpodobně stanou ústředním bodem bezpečnosti.

Real-World Implementace

Trénujte chatbota, aby odmítl pomáhat se stavbou zbraně tím, že ho necháte kritizovat svůj vlastní návrh odpovědi proti principu vyhýbání se škodám a přepsat jej

Nahrazení nákladného označování toxických výstupů lidským červeným týmem preferenčními daty generovanými AI (RLAIF) podle ústavy

Úpravy písemného principu, aby se upravilo, jak opatrný je model, a pak pozorování změny chování bez přeznačování tisíců příkladů

Provádění kolektivních vstupních cvičení, kde veřejnost navrhuje principy, které formují konstituci modelu

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

What is Constitutional AI?

Ústavní umělá inteligence je metoda Anthropic pro sladění modelů pomocí psaného souboru zásad – „ústavy“ – takže umělá inteligence kritizuje a reviduje své vlastní odpovědi, místo aby se spoléhala pouze na lidi, aby označili škodlivý obsah. Jeho cílem je učinit modely užitečnými a neškodnými s mnohem menším množstvím lidské práce.

Co je to „ústava“ v ústavní AI?

Ústava je transparentní soubor písemných principů čerpaných ze zdrojů, jako jsou dokumenty o lidských právech, které model používá k hodnocení a zlepšování svých odpovědí.

Jaký klíčový problém se standardním RLHF má ústavní AI za cíl snížit?

Tím, že se model kritizuje proti principům, omezuje ústavní umělá inteligence lidskou práci při kontrole a označování znepokojivých nebo škodlivých výstupů.

Co dělá model v kontrolované fázi ústavní umělé inteligence se svým vlastním výstupem?

Model provozuje smyčku kritiky a revizí: identifikuje, kde jeho návrh porušuje vzorkovaný princip, poté přepíše odpověď a vytvoří vlastní vylepšená trénovací data.

Co znamená RLAIF ve fázi posilování-učení?

RLAIF znamená Reinforcement Learning from AI Feedback: model seřazuje odpovědi podle konstituce a vytváří data preferencí generovaná AI namísto lidských štítků.

Proč je použití písemných zásad považováno za výhodu pro transparentnost?

Protože jsou vodicí hodnoty zapsány, lze je přímo kontrolovat, auditovat a upravovat, na rozdíl od preferencí implicitně zakódovaných v rozptýlených lidských hodnoceních.