越獄和紅隊
越獄是一種精心設計提示的做法,欺騙人工智慧模型忽略其安全規則,而紅隊則是在不良行為者發現這些弱點之前有組織的努力。
概述
Together they form the adversarial testing loop that makes deployed AI systems safer.
深入探討
大型語言模型經過訓練可以拒絕有害請求,但這些防護措施是統計性的,而不是絕對的。越獄透過重新建構禁止的請求來利用這一點,使其繞過模型習得的拒絕。經典技術包括角色扮演(「假裝你是一個沒有規則的人工智慧」)、臭名昭著的「DAN」(立即做任何事情)角色、假設框架、透過隱藏指令進行提示注入、Base64 或 leetspeak 等編碼技巧,以及用虛假的合規示例淹沒長上下文視窗的「多次」越獄。紅隊則扭轉了這一局面:專門的團隊和自動化系統在發布前用數千個對抗性提示來探測模型,對失敗進行分類,以便工程師可以通過微調、根據人類反饋進行強化學習以及添加分類器過濾器來修補它們。
技術洞察
安全行為是透過微調和 RLHF 來學習的,在已經吸收了大量知識的模型上創建了一個細小的「拒絕邊界」。越獄的工作原理是將輸入分佈從安全訓練期間使用的範例中轉移出來,因此模型的幫助驅動力會覆蓋其較弱的拒絕訊號。防禦層進行多重檢查:輸入/輸出分類器、憲法人工智慧自我批評以及將發現的越獄添加回訓練集中的對抗性訓練。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
越獄和紅隊的未來
預計軍備競賽將持續進行。自動紅隊(一種模型攻擊另一種模型)的擴展速度比手動測試和出現異常故障的速度更快。防禦者正在走向「深度防禦」:憲法分類器、即時監控和防篡改訓練,將拒絕更深地融入權重中。監管機構和標準機構越來越多地要求在高性能模型發布之前記錄紅隊結果,從而使對抗性測試成為人工智慧發布管道中常規的、可審計的部分,而不是事後才想到的。
現實世界的實施
Anthropic 進行了公開的“越獄賞金”,邀請數千名測試人員打破其憲法分類器,並獎勵任何發現通用越獄的人。
研究人員演示了“多次越獄”,表明用數百個虛假的有害問答對填充長上下文窗口可能會削弱模型的拒絕能力。
OpenAI、Google 和 Anthropic 維護內部紅隊和外部專家網絡,在模型發布前探測生物武器、網絡和兒童安全風險。
安全公司現在提供法學碩士滲透測試,掃描聊天機器人以查找銀行和醫療助理等面向客戶的應用程式中的提示注入漏洞。
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jailbreaking and Red-Teaming quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Jailbreaking and Red-Teaming?
越獄是一種精心設計提示的做法,欺騙人工智慧模型忽略其安全規則,而紅隊則是在不良行為者發現這些弱點之前有組織的努力。它們共同構成了對抗性測試循環,使部署的人工智慧系統更加安全。
越獄提示的主要目標是什麼?
越獄是專門為了讓模型忽略或規避它被訓練要遵循的安全護欄而設計的。
人工智慧安全中的「紅隊」指的是什麼?
紅隊借用了安全術語,指的是友善的攻擊者,他們探測系統以暴露弱點,以便可以修復它們。
為什麼隨著上下文視窗變長,多次越獄效果會更好?
多次越獄將數百個偽造的有害問答範例打包到一個長上下文中,透過上下文學習使模型偏向合規性。
下列哪一項是公認的越獄防禦措施?
檢查傳入提示和傳出回應的分層分類器是針對越獄的核心「深度防禦」技術。
為什麼模型的安全護欄被描述為“統計的,而不是絕對的”?
安全性是透過微調和 RLHF 來教導的,因此訓練分佈之外的對抗性輸入有時會失敗,這是一種習得的趨勢。