Constitutionele AI
Constitutionele AI is de methode van Anthropic om modellen op één lijn te brengen met behulp van een geschreven reeks principes – een ‘grondwet’ – dus de AI bekritiseert en herziet haar eigen antwoorden in plaats van alleen op mensen te vertrouwen om schadelijke inhoud te labelen.
Overzicht
It aims to make models helpful and harmless with far less human labor.
Diepe duik
Traditionele afstemming leunt op versterkend leren van menselijke feedback (RLHF), waarbij mensen veel modeluitkomsten rangschikken, inclusief verontrustende, om het model te leren wat het moet vermijden. Constitutionele AI vermindert die last door het model een expliciete lijst van geschreven principes te geven, ontleend aan bronnen als de VN-Verklaring van de Rechten van de Mens en best practices op het gebied van vertrouwen en veiligheid. De training bestaat uit twee fasen. Ten eerste een gecontroleerde fase: het model genereert een reactie, bekritiseert het vervolgens tegen een constitutioneel principe en herschrijft het om het beter te maken; deze zelfverbeterde antwoorden worden gebruikt om het te verfijnen. Ten tweede, een versterkingsleerfase, RLAIF, waarin het model zelf paren reacties rangschikt volgens de grondwet, en de door AI gegenereerde voorkeursgegevens een beloningsmodel trainen. De principes zijn transparant en bewerkbaar, waardoor de waarden die het model sturen, controleerbaar zijn in plaats van verborgen te zijn in ondoorzichtige menselijke labels.
Technisch inzicht
De twee fasen worden vaak SL-CAI en RL-CAI genoemd. Bij begeleid leren zorgt een 'kritiek-en-herzien'-lus ervoor dat het model uitzoekt waar zijn eigen antwoord een bemonsterd principe schendt en dit herschrijft, waardoor trainingsgegevens worden gegenereerd zonder dat er sprake is van menselijke schade. In de RL-fase beoordeelt een tweede model welke van de twee antwoorden het beste aansluit bij de constitutie, waarbij AI-voorkeurslabels (RLAIF) worden geproduceerd die een beloningsmodel trainen dat wordt gebruikt in standaard RL. De constitutie bestaat uit richtlijnen in platte tekst die in prompts worden geïnjecteerd, dus het veranderen van het gedrag van het model kan net zo direct zijn als het bewerken van de principes.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van constitutionele AI
Constitutionele AI wijst in de richting van 'schaalbaar toezicht', waarbij AI helpt toezicht te houden op AI naarmate modellen te capabel worden voor mensen om elke output te controleren. Verwacht rijkere, meer genuanceerde grondwetten, publieke en participatieve inbreng waarin principes worden gekozen (Anthropic heeft 'collectieve constitutionele AI'-experimenten uitgevoerd) en hybride benaderingen die menselijke feedback combineren met AI-zelfkritiek. De transparantie van geschreven principes maakt dit aantrekkelijk voor toezichthouders en auditors die willen zien welke waarden een systeem codeert. Naarmate grensmodellen zich ontwikkelen, zullen methoden waarmee modellen zichzelf op betrouwbare wijze kunnen bekritiseren en verbeteren op basis van expliciete regels waarschijnlijk centraal komen te staan in de veiligheid.
Implementatie in de echte wereld
Een chatbot trainen om te weigeren te helpen bij het bouwen van een wapen door hem zijn eigen conceptantwoord te laten bekritiseren aan de hand van een beginsel van schadevermijding en het te herschrijven
Vervanging van kostbare menselijke rode team-labeling van giftige producten door AI-gegenereerde voorkeursgegevens (RLAIF), geleid door de grondwet
Een geschreven principe bewerken om aan te passen hoe voorzichtig een model is, en vervolgens de gedragsverandering observeren zonder duizenden voorbeelden opnieuw te labelen
Het uitvoeren van collectieve inputoefeningen waarbij het publiek principes voorstelt die de constitutie van het model vormgeven
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Instructie afstemmen
Frequently asked questions
What is Constitutional AI?
Constitutionele AI is de methode van Anthropic om modellen op één lijn te brengen met behulp van een geschreven reeks principes – een ‘grondwet’ – dus de AI bekritiseert en herziet haar eigen antwoorden in plaats van alleen op mensen te vertrouwen om schadelijke inhoud te labelen. Het doel is om modellen nuttig en onschadelijk te maken met veel minder menselijke arbeid.
Wat is de ‘grondwet’ in Constitutionele AI?
De grondwet is een transparante reeks geschreven principes, ontleend aan bronnen zoals mensenrechtendocumenten, die het model gebruikt om zijn antwoorden te evalueren en te verbeteren.
Welk belangrijk probleem met standaard RLHF wil constitutionele AI verminderen?
Door het model zichzelf te laten bekritiseren tegen principes, vermindert Constitutionele AI de menselijke arbeid van het beoordelen en labelen van verontrustende of schadelijke resultaten.
Wat doet het model in de gecontroleerde fase van Constitutionele AI met zijn eigen output?
Het model voert een kritiek-en-herzien-lus uit: het identificeert waar het concept een bemonsterd principe schendt, herschrijft vervolgens het antwoord en creëert zelfverbeterde trainingsgegevens.
Waar staat RLAIF voor in de fase van versterkend leren?
RLAIF betekent Reinforcement Learning from AI Feedback: een model rangschikt reacties volgens de grondwet en produceert door AI gegenereerde voorkeursgegevens in plaats van menselijke labels.
Waarom wordt het gebruik van schriftelijke principes als een voordeel voor de transparantie beschouwd?
Omdat de leidende waarden zijn uitgeschreven, kunnen ze direct worden geïnspecteerd, gecontroleerd en bewerkt, in tegenstelling tot voorkeuren die impliciet zijn gecodeerd in verspreide menselijke beoordelingen.