Език AI РЪКОВОДСТВО

Конституционен AI

Конституционният AI е методът на Anthropic за подравняване на модели с помощта на писмен набор от принципи — „конституция“ — така че AI критикува и преразглежда собствените си отговори, вместо да разчита само на хората, за да маркират вредното съдържание.

2 min readПоследна актуализация

Преглед

It aims to make models helpful and harmless with far less human labor.

Дълбоко гмуркане

Традиционното подравняване се основава на обучение за подсилване от човешка обратна връзка (RLHF), където хората класират много резултати от модела, включително смущаващи, за да научат модела какво да избягва. Конституционният AI намалява това бреме, като предоставя на модела ясен списък от писмени принципи, извлечени от източници като Декларацията на ООН за правата на човека и най-добрите практики за доверие и безопасност. Обучението има два етапа. Първо, наблюдаван етап: моделът генерира отговор, след това го критикува срещу конституционен принцип и го пренаписва, за да бъде по-добър; тези самостоятелно подобрени отговори се използват за фина настройка. Второ, етап на обучение за подсилване, RLAIF, където самият модел класира двойки отговори според конституцията и тези генерирани от AI данни за предпочитанията обучават модел на възнаграждение. Принципите са прозрачни и могат да се редактират, което прави стойностите, управляващи модела, подлежащи на проверка, а не скрити в непрозрачни човешки етикети.

Техническа информация

Двете фази често се наричат ​​SL-CAI и RL-CAI. При контролирано обучение цикълът „критикувай и преразглеждай“ подтиква модела да открие къде собственият му отговор нарушава извадков принцип и да го пренапише, генерирайки данни за обучение без етикетиране на човешка вреда. Във фазата на RL вторият модел преценява кой от двата отговора следва по-добре конституцията, създавайки етикети за предпочитания на AI (RLAIF), които обучават модел на възнаграждение, използван в стандартния RL. Конституцията е насока в обикновен текст, инжектирана в подкани, така че промяната на поведението на модела може да бъде толкова директна, колкото редактирането на принципите.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на конституционния AI

Конституционният AI сочи към „мащабируем надзор“, където AI помага да се контролира AI, тъй като моделите стават твърде способни, за да могат хората да проверяват всеки резултат. Очаквайте по-богати, по-нюансирани конституции, принос на обществеността и участието в избора на принципи (Anthropic е провел експерименти с „колективен конституционен AI“) и хибридни подходи, смесващи човешката обратна връзка със самокритиката на AI. Прозрачността на писмените принципи прави това привлекателно за регулаторите и одиторите, които искат да видят ценностите, кодирани от системата. С напредването на граничните модели методите, които позволяват на моделите надеждно да критикуват и подобряват себе си спрямо изрични правила, вероятно ще станат централни за безопасността.

Внедряване в реалния свят

Обучение на чатбот да откаже да помогне за изграждането на оръжие, като го накарате да критикува своя собствена чернова на отговор срещу принципа за избягване на вреда и да го пренапише

Замяна на скъпо струващото етикетиране на токсични резултати от човешкия червен екип с данни за предпочитания, генерирани от AI (RLAIF), ръководени от конституцията

Редактиране на писмен принцип, за да се коригира колко предпазлив е даден модел, след което да се наблюдава промяната в поведението, без да се маркират отново хиляди примери

Провеждане на колективни упражнения, при които обществеността предлага принципи, които оформят конституцията на модела

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Constitutional AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Инструкция за настройка

Frequently asked questions

What is Constitutional AI?

Конституционният AI е методът на Anthropic за подравняване на модели с помощта на писмен набор от принципи — „конституция“ — така че AI критикува и преразглежда собствените си отговори, вместо да разчита само на хората, за да маркират вредното съдържание. Тя има за цел да направи моделите полезни и безвредни с много по-малко човешки труд.

Какво е „конституцията“ в Конституционния AI?

Конституцията е прозрачен набор от писмени принципи, извлечени от източници като документи за правата на човека, които моделът използва, за да оцени и подобри своите отговори.

Какъв ключов проблем със стандартния RLHF се стреми да намали Конституционният AI?

Като кара модела да критикува себе си срещу принципите, Конституционният AI намалява човешкия труд за преглед и етикетиране на смущаващи или вредни резултати.

В контролирания етап на конституционния AI какво прави моделът със собствения си резултат?

Моделът изпълнява цикъл на критика и преразглеждане: той идентифицира къде черновата му нарушава извадков принцип, след което пренаписва отговора, създавайки самоусъвършенствани данни за обучение.

Какво представлява RLAIF в етапа на обучение за укрепване?

RLAIF означава Reinforcement Learning from AI Feedback: моделът класира отговорите според конституцията, произвеждайки данни за предпочитания, генерирани от AI, вместо човешки етикети.

Защо използването на писмени принципи се счита за предимство за прозрачността?

Тъй като ръководните стойности са записани, те могат да бъдат инспектирани, одитирани и редактирани директно, за разлика от предпочитанията, имплицитно кодирани в разпръснати човешки оценки.