Språk AI GUIDE

Konstitusjonell AI

Konstitusjonell AI er Anthropics metode for å samkjøre modeller ved å bruke et skriftlig sett med prinsipper - en "konstitusjon" - så AI kritiserer og reviderer sine egne svar i stedet for å bare stole på mennesker for å merke skadelig innhold.

2 min lesingSist oppdatert

Oversikt

It aims to make models helpful and harmless with far less human labor.

Dypdykk

Tradisjonell justering lener seg på forsterkende læring fra menneskelig tilbakemelding (RLHF), der folk rangerer mange modellutdata, inkludert forstyrrende, for å lære modellen hva de skal unngå. Konstitusjonell kunstig intelligens reduserer denne byrden ved å gi modellen en eksplisitt liste over skriftlige prinsipper hentet fra kilder som FNs menneskerettighetserklæring og beste praksis for tillit og sikkerhet. Treningen har to trinn. Først et overvåket stadium: modellen genererer en respons, deretter kritiserer den mot et konstitusjonelt prinsipp og omskriver den til å bli bedre; disse selvforbedrede svarene brukes til å finjustere det. For det andre, et forsterkningslæringsstadium, RLAIF, der modellen selv rangerer svarpar i henhold til konstitusjonen, og at AI-genererte preferansedata trener opp en belønningsmodell. Prinsippene er gjennomsiktige og redigerbare, noe som gjør verdiene som styrer modellen inspiserbare i stedet for skjult i ugjennomsiktige menneskelige etiketter.

Teknisk innsikt

De to fasene kalles ofte SL-CAI og RL-CAI. I overvåket læring, ber en "kritikk-og-revider"-sløyfe modellen til å finne hvor dens eget svar bryter med et utvalgt prinsipp og omskrive det, og generere treningsdata uten menneskelig skade-merking. I RL-fasen bedømmer en andre modell hvilken av to svar som best følger konstitusjonen, og produserer AI-preferanseetiketter (RLAIF) som trener en belønningsmodell brukt i standard RL. Grunnloven er ren tekstveiledning injisert i spørsmål, så å endre modellens oppførsel kan være like direkte som å redigere prinsippene.

Strategisk innvirkning

Speed and scale

Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.

Access and reach

Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.

Tydeligere avgjørelser

Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.

Fremtiden til konstitusjonell AI

Konstitusjonell AI peker mot "skalerbar tilsyn", der AI hjelper til med å overvåke AI etter hvert som modellene blir for kapable til at mennesker kan sjekke hver utgang. Forvent rikere, mer nyanserte konstitusjoner, offentlige og deltakende innspill til hvilke prinsipper som velges (Anthropic har kjørt 'kollektive konstitusjonelle AI'-eksperimenter), og hybride tilnærminger som blander menneskelig tilbakemelding med AI-selvkritikk. Gjennomsiktigheten av skriftlige prinsipper gjør dette attraktivt for regulatorer og revisorer som ønsker å se verdiene et system koder. Etter hvert som grensemodeller avanserer, vil metoder som lar modeller pålitelig kritisere og forbedre seg mot eksplisitte regler sannsynligvis bli sentrale for sikkerheten.

Real-World Implementering

Trene en chatbot til å nekte å hjelpe til med å bygge et våpen ved å la den kritisere sitt eget utkast til svar mot et skadeunngåelsesprinsipp og omskrive det

Erstatter kostbare menneskelige røde lag-merking av giftige utdata med AI-genererte preferansedata (RLAIF) styrt av grunnloven

Redigere et skriftlig prinsipp for å justere hvor forsiktig en modell er, og deretter observere atferdsendringen uten å ommerke tusenvis av eksempler

Kjøre kollektive innspillsøvelser der publikum foreslår prinsipper som former modellens konstitusjon

Risikoer og rekkverk

Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.

Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.

Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.

Veikart for implementering

1

Definer utdataformat, tone og kvalitetsstandarder før utrulling.

2

Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.

3

Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.

4

Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is Constitutional AI?

Konstitusjonell AI er Anthropics metode for å samkjøre modeller ved å bruke et skriftlig sett med prinsipper - en "konstitusjon" - så AI kritiserer og reviderer sine egne svar i stedet for å bare stole på mennesker for å merke skadelig innhold. Den har som mål å gjøre modeller nyttige og ufarlige med langt mindre menneskelig arbeidskraft.

Hva er "grunnloven" i konstitusjonell kunstig intelligens?

Grunnloven er et transparent sett med skriftlige prinsipper, hentet fra kilder som menneskerettighetsdokumenter, som modellen bruker for å evaluere og forbedre svarene sine.

Hvilket nøkkelproblem med standard RLHF har konstitusjonell AI som mål å redusere?

Ved å la modellen kritisere seg selv mot prinsipper, kutter konstitusjonell kunstig intelligens ned på det menneskelige arbeidet med å gjennomgå og merke forstyrrende eller skadelige resultater.

I det overvåkede stadiet av konstitusjonell AI, hva gjør modellen med sin egen produksjon?

Modellen kjører en kritikk-og-revider-sløyfe: den identifiserer hvor utkastet bryter med et utvalgt prinsipp, og skriver deretter svaret om, og skaper selvforbedrede treningsdata.

Hva står RLAIF for i forsterkningslæringsstadiet?

RLAIF betyr forsterkende læring fra AI-feedback: en modell rangerer svar i henhold til konstitusjonen, og produserer AI-genererte preferansedata i stedet for menneskelige etiketter.

Hvorfor anses bruk av skriftlige prinsipper som en fordel for åpenhet?

Fordi de veiledende verdiene er skrevet ut, kan de inspiseres, revideres og redigeres direkte, i motsetning til preferanser som er implisitt kodet i spredte menneskelige vurderinger.