憲法人工智慧
憲法人工智慧是Anthropic使用一套書面原則(「憲法」)來調整模型的方法,因此人工智慧可以批評和修改自己的答案,而不是僅僅依靠人類來標記有害內容。
概述
It aims to make models helpful and harmless with far less human labor.
深入探討
傳統的對齊依賴人類回饋的強化學習(RLHF),人們對大量模型輸出(包括令人不安的輸出)進行排名,以教導模型要避免什麼。憲法人工智慧透過為模型提供一份明確的書面原則清單來減輕這一負擔,這些原則來自《聯合國人權宣言》和信任與安全最佳實踐等來源。訓練有兩個階段。首先,監督階段:模型產生回應,然後針對憲法原則對其進行批評,並將其重寫為更好的;這些自我改進的答案用於對其進行微調。其次,強化學習階段,RLAIF,模型本身根據構成對反應對進行排名,並且人工智慧產生的偏好資料訓練獎勵模型。這些原則是透明且可編輯的,使得指導模型的值可以檢查,而不是隱藏在不透明的人類標籤中。
技術洞察
這兩個階段通常稱為 SL-CAI 和 RL-CAI。在監督式學習中,「批評和修改」循環促使模型找到自己的答案違反採樣原則的地方並重寫它,產生沒有人類傷害標籤的訓練資料。在強化學習階段,第二個模型會判斷兩個反應中哪一個比較符合憲法,產生人工智慧偏好標籤 (RLAIF),用於訓練標準強化學習中使用的獎勵模型。該憲法是注入提示的純文本指導,因此更改模型的行為可以像編輯原則一樣直接。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
憲法人工智慧的未來
憲法人工智慧指向“可擴展的監督”,隨著模型的能力變得強大到人類無法檢查每一個輸出,人工智慧可以幫助監督人工智慧。期待更豐富、更細緻的憲法、選擇原則的公共和參與性投入(Anthropic 已經進行了「集體憲法人工智慧」實驗),以及將人類反饋與人工智慧自我批評相結合的混合方法。書面原則的透明度對於想要查看系統編碼的價值觀的監管機構和審計人員來說很有吸引力。隨著前沿模型的進步,讓模型根據明確的規則可靠地批判和改進自己的方法可能會成為安全的核心。
現實世界的實施
訓練聊天機器人拒絕幫助製造武器,讓其根據避免傷害原則批評自己的草案答案並重寫它
以憲法指導下的人工智慧產生的偏好數據(RLAIF)取代昂貴的人類紅隊有毒輸出標籤
編輯書面原則來調整模型的謹慎程度,然後觀察行為變化,而無需重新標記數千個範例
進行集體意見練習,讓大眾提出塑造模型構成的原則
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Constitutional AI quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Constitutional AI?
憲法人工智慧是Anthropic使用一套書面原則(「憲法」)來調整模型的方法,因此人工智慧可以批評和修改自己的答案,而不是僅僅依靠人類來標記有害內容。它的目標是用更少的人力使模型變得有用且無害。
憲法人工智慧中的「憲法」是什麼?
憲法是一套透明的書面原則,取自人權文件等來源,模型用它來評估和改進其答案。
憲法人工智慧旨在減少標準 RLHF 的哪些關鍵問題?
透過讓模型對原則進行自我批判,憲法人工智慧減少了審查和標記令人不安或有害的輸出的人力。
在憲法人工智慧的監督階段,模型對自己的輸出做了什麼?
該模型運行一個批評和修改循環:它確定其草稿違反抽樣原則的地方,然後重寫答案,創建自我改進的訓練資料。
強化學習階段的RLAIF代表什麼?
RLAIF 是指根據人工智慧回饋進行強化學習:模型根據組成對反應進行排名,產生人工智慧產生的偏好數據而不是人類標籤。
為什麼使用書面原則被認為有利於提高透明度?
由於指導值是寫出來的,因此可以直接檢查、審核和編輯它們,這與分散的人類評級中隱式編碼的偏好不同。