Конституционный ИИ
Конституционный ИИ — это метод Anthropic для согласования моделей с использованием письменного набора принципов — «конституции» — поэтому ИИ критикует и пересматривает свои собственные ответы, а не полагается только на людей, которые будут маркировать вредный контент.
Обзор
It aims to make models helpful and harmless with far less human labor.
Глубокое погружение
Традиционное согласование опирается на обучение с подкреплением на основе обратной связи с человеком (RLHF), когда люди ранжируют множество результатов модели, в том числе тревожные, чтобы научить модель, чего следует избегать. Конституционный ИИ снижает это бремя, предоставляя модели подробный список письменных принципов, взятых из таких источников, как Декларация прав человека ООН и передовой опыт в области доверия и безопасности. Обучение имеет два этапа. Во-первых, контролируемый этап: модель генерирует ответ, затем критикует ее в соответствии с конституционным принципом и переписывает ее, чтобы она стала лучше; эти самоусовершенствованные ответы используются для его точной настройки. Во-вторых, этап обучения с подкреплением, RLAIF, где сама модель ранжирует пары ответов в соответствии с конституцией, а данные о предпочтениях, сгенерированные ИИ, обучают модель вознаграждения. Принципы прозрачны и редактируемы, что делает ценности, управляющие моделью, доступными для проверки, а не скрытыми внутри непрозрачных человеческих ярлыков.
Техническая информация
Эти две фазы часто называют SL-CAI и RL-CAI. При обучении с учителем цикл «критики и пересмотра» побуждает модель найти места, где ее собственный ответ нарушает выбранный принцип, и переписать его, генерируя обучающие данные без маркировки вреда для человека. На этапе RL вторая модель определяет, какой из двух ответов лучше соответствует конституции, создавая метки предпочтений ИИ (RLAIF), которые обучают модель вознаграждения, используемую в стандартном RL. Конституция представляет собой текстовое руководство, внедренное в подсказки, поэтому изменение поведения модели может быть таким же прямым, как и редактирование принципов.
Стратегическое воздействие
Скорость и масштаб
Языковые рабочие процессы могут развиваться быстрее, не жертвуя при этом согласованностью.
Доступ и охват
Это расширяет доступ к различным языкам и стилям общения.
Более четкие решения
Команды могут тратить больше времени на принятие решений, в то время как автоматизация занимается повторением.
Будущее конституционного ИИ
Конституционный ИИ указывает на «масштабируемый надзор», когда ИИ помогает контролировать ИИ, поскольку модели становятся слишком способными, чтобы люди могли проверять каждый результат. Ожидайте более богатых и детальных конституций, общественного и коллективного вклада в выбор принципов (Anthropic проводил эксперименты с «коллективным конституционным ИИ») и гибридных подходов, сочетающих обратную связь между людьми и самокритикой ИИ. Прозрачность прописанных принципов делает их привлекательными для регулирующих органов и аудиторов, желающих увидеть ценности, которые кодирует система. По мере развития передовых моделей методы, позволяющие моделям надежно критиковать и совершенствовать себя вопреки явным правилам, вероятно, станут центральными для безопасности.
Реальная реализация
Обучение чат-бота отказу от помощи в создании оружия, заставляя его критиковать собственный проект ответа на принцип предотвращения вреда и переписывать его.
Замена дорогостоящей маркировки токсичных результатов красной командой людей на данные о предпочтениях, генерируемые ИИ (RLAIF), в соответствии с конституцией.
Редактирование письменного принципа, чтобы скорректировать степень осторожности модели, а затем наблюдение за изменением поведения без перемаркировки тысяч примеров.
Проведение коллективных упражнений, в ходе которых общественность предлагает принципы, формирующие структуру модели.
Риски и ограничения
Галлюцинированные факты могут незаметно войти в отчеты, потоки поддержки или результаты исследований.
Незамедлительная чувствительность может привести к противоречивым результатам по схожим запросам.
Конфиденциальные текстовые данные могут быть раскрыты, если контроль доступа слабый.
Дорожная карта реализации
Перед развертыванием определите выходной формат, тон и стандарты качества.
Наземные ответы с помощью надежных источников, когда точность имеет значение.
Обеспечьте контрольную точку человеческого контроля для получения важных результатов.
Отслеживайте закономерности сбоев и регулярно обновляйте подсказки или рабочие процессы.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Инструкция по настройке
Часто задаваемые вопросы
What is Constitutional AI?
Конституционный ИИ — это метод Anthropic для согласования моделей с использованием письменного набора принципов — «конституции» — поэтому ИИ критикует и пересматривает свои собственные ответы, а не полагается только на людей, которые будут маркировать вредный контент. Его цель — сделать модели полезными и безвредными, используя гораздо меньше человеческого труда.
Что такое «конституция» конституционного ИИ?
Конституция представляет собой прозрачный набор письменных принципов, взятых из таких источников, как документы по правам человека, которые модель использует для оценки и улучшения своих ответов.
Какую ключевую проблему стандартного RLHF призван решить конституционный ИИ?
Заставляя модель критиковать себя вопреки принципам, конституционный ИИ сокращает человеческий труд по анализу и маркировке тревожных или вредных результатов.
Что модель делает со своими результатами на контролируемой стадии конституционного ИИ?
Модель запускает цикл критики и пересмотра: она определяет, где ее проект нарушает принцип выборки, затем переписывает ответ, создавая самоусовершенствуемые данные обучения.
Что означает RLAIF на этапе обучения с подкреплением?
RLAIF означает «обучение с подкреплением на основе обратной связи ИИ»: модель ранжирует ответы в соответствии с конституцией, создавая данные о предпочтениях, генерируемые ИИ, вместо человеческих ярлыков.
Почему использование письменных принципов считается преимуществом прозрачности?
Поскольку руководящие ценности записаны, их можно напрямую проверять, проверять и редактировать, в отличие от предпочтений, неявно закодированных в разрозненных человеческих рейтингах.