Конституційний ШІ
Конституційний штучний інтелект — це метод Anthropic для узгодження моделей за допомогою письмового набору принципів — «конституції» — тому штучний інтелект критикує та переглядає власні відповіді замість того, щоб покладатися лише на людей для позначення шкідливого вмісту.
Огляд
It aims to make models helpful and harmless with far less human labor.
Глибоке занурення
Традиційне вирівнювання спирається на навчання з підкріпленням за допомогою зворотного зв’язку людини (RLHF), коли люди ранжують багато вихідних даних моделі, включно з тривожними, щоб навчити модель, чого уникати. Конституційний штучний інтелект зменшує цей тягар, надаючи моделі чіткий перелік письмових принципів, взятих із таких джерел, як Декларація прав людини ООН і найкращі практики довіри та безпеки. Навчання має два етапи. По-перше, етап під наглядом: модель генерує відповідь, потім критикує її проти конституційного принципу та переписує, щоб вона була кращою; ці самостійно вдосконалені відповіді використовуються для його точного налаштування. По-друге, етап навчання з підкріпленням, RLAIF, де сама модель ранжує пари відповідей відповідно до конституції, а створені ШІ дані про переваги тренують модель винагороди. Принципи є прозорими та доступними для редагування, завдяки чому значення, що керують моделлю, доступні для перевірки, а не приховані в непрозорих людських мітках.
Технічне розуміння
Ці дві фази часто називають SL-CAI і RL-CAI. У контрольованому навчанні цикл «критикуй і переглядай» спонукає модель знайти, де її власна відповідь порушує вибірковий принцип, і переписати її, генеруючи навчальні дані без маркування шкоди для людини. На фазі RL друга модель визначає, яка з двох відповідей краще відповідає конституції, виробляючи ярлики переваг AI (RLAIF), які тренують модель винагороди, що використовується в стандартному RL. Конституція — це вказівки у вигляді відкритого тексту, введені в підказки, тому зміна поведінки моделі може бути такою ж прямою, як і редагування принципів.
Стратегічний вплив
Швидкість і масштаб
Мовні робочі процеси можуть рухатися швидше без шкоди для узгодженості.
Доступ і охоплення
Це розширює доступ до різних мов і стилів спілкування.
Чіткіші рішення
Команди можуть витрачати більше часу на оцінювання, поки автоматизація справляється з повторенням.
Майбутнє конституційного ШІ
Конституційний штучний інтелект вказує на «масштабований нагляд», де штучний інтелект допомагає контролювати штучний інтелект, оскільки моделі стають надто здатними, щоб люди могли перевіряти кожен результат. Очікуйте більш насичених конституцій з декількома нюансами, участі громадськості та участі у виборі принципів (Anthropic проводив експерименти «колективного конституційного штучного інтелекту») і гібридних підходів, що поєднують людський відгук із самокритикою штучного інтелекту. Прозорість письмових принципів робить це привабливим для регуляторів і аудиторів, які хочуть бачити цінності, закодовані системою. У міру розвитку граничних моделей методи, які дозволяють моделям надійно критикувати та вдосконалювати себе за чіткими правилами, ймовірно, стануть центральними для безпеки.
Реалізація в реальному світі
Навчання чат-бота відмовлятися від допомоги у створенні зброї, змушуючи його критикувати власну чернетку відповіді проти принципу уникнення шкоди та переписувати її
Заміна дорогого маркування токсичних продуктів людською червоною командою даними про переваги, створеними ШІ (RLAIF), керуючись конституцією
Редагування письмового принципу, щоб налаштувати ступінь обережності моделі, а потім спостереження за зміною поведінки без перемаркування тисяч прикладів
Проведення колективних вправ, де громадськість пропонує принципи, які формують структуру моделі
Ризики та огорожі
Галюциновані факти можуть непомітно входити у звіти, допоміжні потоки або результати досліджень.
Делікатність підказок може створити суперечливі результати для подібних запитів.
Конфіденційні текстові дані можуть бути розкриті, якщо контроль доступу слабкий.
Дорожня карта впровадження
Визначте вихідний формат, тон і стандарти якості перед розгортанням.
Якщо точність має значення, зв’яжіться з надійними джерелами.
Тримайте контрольну точку перевірки людьми для отримання високих ставок.
Відстежуйте моделі збоїв і регулярно перенавчайте підказки або робочі процеси.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Інструкція Налаштування
Часті запитання
What is Constitutional AI?
Конституційний штучний інтелект — це метод Anthropic для узгодження моделей за допомогою письмового набору принципів — «конституції» — тому штучний інтелект критикує та переглядає власні відповіді замість того, щоб покладатися лише на людей для позначення шкідливого вмісту. Він спрямований на те, щоб зробити моделі корисними та нешкідливими з набагато меншою кількістю людської праці.
Що таке «конституція» в Конституційному ШІ?
Конституція — це прозорий набір письмових принципів, взятих із таких джерел, як документи з прав людини, які модель використовує для оцінки та покращення своїх відповідей.
Яку ключову проблему стандартної RLHF конституційний штучний інтелект прагне вирішити?
Завдяки тому, що сама модель критикує принципи, конституційний штучний інтелект скорочує людську працю, пов’язану з переглядом і маркуванням тривожних або шкідливих результатів.
Що модель робить із власним результатом на контрольованому етапі конституційного штучного інтелекту?
Модель запускає цикл критики та перегляду: вона визначає, де її чернетка порушує принцип вибірки, а потім переписує відповідь, створюючи самостійно вдосконалені навчальні дані.
Що означає RLAIF на етапі підкріплення?
RLAIF означає Reinforcement Learning from AI Feedback: модель ранжує відповіді відповідно до конституції, виробляючи дані про переваги, згенеровані ШІ, замість людських міток.
Чому використання письмових принципів вважається перевагою для прозорості?
Оскільки керівні значення записані, їх можна перевіряти, перевіряти та редагувати безпосередньо, на відміну від уподобань, неявно закодованих у розрізнених людських оцінках.