憲法AI
憲法 AI は、文書化された一連の原則 (「憲法」) を使用してモデルを調整するための Anthropic の手法です。そのため、有害なコンテンツのラベル付けを人間だけに依存するのではなく、AI が独自の回答を批判して修正します。
概要
It aims to make models helpful and harmless with far less human labor.
ディープダイブ
従来のアライメントは、人間のフィードバックからの強化学習 (RLHF) に基づいており、人々は、不穏な出力を含む多くのモデル出力をランク付けして、何を避けるべきかをモデルに教えます。憲法 AI は、国連人権宣言や信頼と安全のベストプラクティスなどの情報源から抽出された文書化された原則の明示的なリストをモデルに与えることで、その負担を軽減します。トレーニングには 2 つの段階があります。まず、教師付き段階です。モデルは応答を生成し、それを憲法上の原則に照らして批判し、より良いものに書き換えます。これらの自己改善した回答は、微調整に使用されます。 2 つ目は、強化学習ステージである RLAIF です。RLAIF では、モデル自体が構成に従って応答のペアをランク付けし、AI が生成した嗜好データによって報酬モデルがトレーニングされます。原則は透明で編集可能であるため、モデルを制御する値は不透明な人間のラベルの中に隠されるのではなく検査可能になります。
技術的な洞察
2 つのフェーズは、SL-CAI および RL-CAI と呼ばれることがよくあります。教師あり学習では、「批評と修正」ループにより、モデル自身の答えがサンプリングされた原則に違反する箇所を見つけて書き換え、人体に危害を与えるラベルを付けずにトレーニング データを生成します。 RL フェーズでは、2 番目のモデルが 2 つの応答のどちらが構成によく準拠しているかを判断し、標準的な RL で使用される報酬モデルをトレーニングする AI 嗜好ラベル (RLAIF) を生成します。この構成はプロンプトに挿入されるプレーンテキストのガイダンスであるため、モデルの動作の変更は原則を編集するのと同じくらい直接的に行うことができます。
戦略的影響
速度とスケール
言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。
アクセスと到達範囲
言語やコミュニケーション スタイルを超えてアクセスが拡張されます。
より明確な判決
自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。
憲法AIの未来
憲法上の AI は、人間がすべての出力をチェックできないほどモデルが成長するにつれて、AI が AI の監督を支援する「スケーラブルな監視」を目指しています。より豊かでより微妙な憲法、原則が選択されるための公開および参加型のインプット (Anthropic は「集合的憲法 AI」実験を実施しました)、および人間のフィードバックと AI の自己批判を融合したハイブリッド アプローチが期待されます。文書化された原則の透明性は、システムがエンコードする価値を確認したい規制当局や監査人にとって魅力的です。フロンティアモデルが進歩するにつれて、明示的なルールに照らしてモデルを確実に批判し、改善できる方法が安全性の中心となる可能性があります。
現実世界の実装
チャットボットに危害回避原則に対する自身の回答草案を批判させ、書き換えさせることで、兵器の製造への協力を拒否するよう訓練する
費用のかかる人間のレッドチームによる有害物質のラベル付けを、憲法に基づいて AI が生成した選好データ (RLAIF) に置き換える
書かれた原則を編集してモデルの慎重さを調整し、何千もの例のラベルを付け直すことなく動作の変化を観察する
一般の人々がモデルの構成を形作る原則を提案する集合的なインプット演習を実施する
リスクとガードレール
幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。
迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。
アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。
実装ロードマップ
展開する前に、出力形式、トーン、品質基準を定義します。
正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。
一か八かの成果物については人間によるレビュー チェックポイントを維持します。
失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。
探検を続けましょう
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
次のガイド
命令チューニング
よくある質問
What is Constitutional AI?
憲法 AI は、文書化された一連の原則 (「憲法」) を使用してモデルを調整するための Anthropic の手法です。そのため、有害なコンテンツのラベル付けを人間だけに依存するのではなく、AI が独自の回答を批判して修正します。これは、はるかに少ない人間の労力でモデルを有益かつ無害にすることを目的としています。
憲法AIにおける「憲法」とは何ですか?
憲法は、人権文書などの情報源から抽出された明文化された一連の透明な原則であり、モデルは回答を評価および改善するために使用します。
標準的な RLHF に関する重要な問題は何ですか?Constitutional AI は削減を目指していますか?
原則に反してモデル自身を批判させることで、Constitutional AI は、不穏な出力や有害な出力をレビューしてラベルを付けるという人間の労力を削減します。
憲法 AI の教師あり段階では、モデルは自身の出力に対して何を行うのでしょうか?
モデルは批評と修正のループを実行します。草案がサンプリングされた原則に違反している箇所を特定し、回答を書き換えて、自己改善されたトレーニング データを作成します。
RLAIF は強化学習段階で何を表しますか?
RLAIF とは、AI フィードバックからの強化学習を意味します。モデルは体質に従って応答をランク付けし、人間のラベルの代わりに AI が生成した嗜好データを生成します。
文書化された原則の使用が透明性にとって有利であると考えられるのはなぜですか?
指針となる値は書き出されるため、人間による散在的な評価に暗黙的にエンコードされた好みとは異なり、直接検査、監査、編集することができます。