發生了什麼事
8 月 5 日發布的一篇研究論文應用了教育測試的方法來衡量人工智慧安全基準捕獲的內容,選擇較小的有用提示集,並審查模型行為的變化。
兩名獨立研究人員和兩名隸屬於英國人工智慧安全研究所的研究人員根據八個基準評估了 192 個聊天模型,涵蓋有害請求拒絕、過度拒絕良性請求、情境傷害和真實性。全套包含預處理前的 5,255 個提示;在刪除未評分的答案和無法區分測試模型的項目後,該分析保留了 5,067 個。
團隊將模型視為考生,將基準提示視為測驗項目,使用項目反應理論來估計哪些提示較困難以及哪些模型最好分開。在其主要因素分析中,三因素解決方案(概括為拒絕嚴格性、真實性和情境傷害)解釋了模型能力 77% 的變化,而單因素只能解釋 47%。
在 20 項保留評估中,三個固定的 25 項提示測試使用不到 2% 的套件恢復了這三個因素。對於 HarmBench、SORRY-Bench 和 OR-Bench-Hard,大約 10 個自適應選擇的提示再現了全基準排名,相關性為 0.92 至 0.94,並將提示數量減少了 97-99%;隨著測試預算的增加,優勢逐漸縮小。
壓縮不僅僅是隨機取樣。項目反應理論估計每個提示的難度以及它如何區分具有不同反應模式的模型,然後選擇保留較大測試結構的項目。作者將固定簡短形式與自適應選擇進行了比較,並進行了評估,而不是僅測量用於選擇提示的數據。該設計支持更狹隘的主張,即可以有效地複製一些現有的基準排名;它並沒有表明 10 或 25 項測試可以發現全新的故障模式。
來源詳情: Rivera and colleagues' research paper on arXiv ↗
為什麼這很重要
該研究表明,更好地選擇提示可以使頻繁的人工智慧安全檢查變得更便宜,而不必假裝每個基準測試都衡量一個通用的安全分數。
更便宜的測試可以讓開發人員、小型實驗室和獨立評估人員在訓練、微調、量化和系統提示變更期間檢查更多模型版本。結果是有效地再現現有的基準測試結果,而不是擴展這些基準測試可以偵測到的內容。
因子分析也揭示了評分權衡。獎勵拒絕的基準可以相互重疊,而避免不必要的拒絕的基準則獎勵相反的行為。在不解釋權重的情況下對它們進行平均可以隱藏模型是否變得更安全,只是更具限制性,還是對良性請求不太有用。
該論文還測試了對故意促使沙袋行為的黑盒審計方法。反應模式檢查發現了選擇性表現不佳的情況,但漏掉了大多數普遍表現不佳的情況;添加歷史能力檢查將模擬案例中的組合檢測率提高到 94-97%。這支持分層審核,而不是依賴單一分數。
對開發者來說,營運價值就是頻率。在系統提示變更、量化通過、微調、工具更新或安全性策略修訂後,可以重新執行較短的評估,而無需每次都消耗完整基準測試的預算。但只有當團隊保留原始套件作為定期審核、輪換保留的提示並調查令人驚訝的變化而不是直接針對壓縮測試進行優化時,結果才有用。否則廉價的支票可能會成為過度擬合的另一個目標。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
crm_get_transaction(id='4092').Which description best fits "narrow AI", the kind of AI in use today?
接下來看什麼
專注於獨立複製、對未來模型系列的驗證,以及縮短測試預測其設計重現基準之外的行為的證據。
這是一個新的預印本,而不是完整的同儕審查結論。潛在結構分析使用了 134 個模型,作者指出,按照傳統的心理測量標準來看,這些模型很小,而另一種提取方法保留了兩個因素而不是三個因素。因素名稱是經驗總結,而不是經過驗證的安全性定義。
每個模型透過 OpenRouter 為每個可用提示產生一個回應,每個基準測試都使用其規定的自動判斷。由此產生的簡短測試可能會繼承原始提示、評分規則、語言覆蓋範圍和評審方面的缺陷;作者明確表示,壓縮並不表明基準可以預測部署安全性或為未來模型提供資訊。
使用的沙袋測試促進了模型生物,而不是經過微調以逃避評估的模型,這可能更容易被發現。 API 檢查建立了行為連續性,而不是隱藏模型權重的身份,該研究沒有測試經過專門訓練來擊敗審計方法的對手。
本文最重要的邊界是測量效率和安全保證之間。簡短的形式可以估計原始基準中存在的潛在因素,但它繼承了基準的語言、判斷、提示框架和盲點。未來的評估應該測試多語言提示、支持工具的代理、長時間對話、對抗性微調模型和獨立的人類判斷。他們還應該報告壓縮分數何時變得不穩定,因為保留資料的清晰相關性可以掩蓋下一個模型系列的失敗。
實際採用規則遵循這些限制:使用壓縮測試作為哨兵,而不是判決。團隊可以經常運行它們來捕獲回歸,然後在簡短形式出現意外變化時將更改升級為完整基準和人工審核。研究本身的證據支持分層工作流程,因為因素結構是從特定的提示、判斷和模型輸出中得出的。發布選定的項目、選擇程式碼、保留的結果和版本歷史記錄將使獨立評估者檢查簡短的測試在開發人員看到它們後以及在新模型系列更改響應分佈後是否仍然提供資訊。
當模型更新時,同樣的透明度也很重要。在一代上校準的簡短測試可能會變得太簡單、太狹窄或意外地與新的系統提示對齊。團隊應該保留先前的版本,揭露項目或判斷何時發生變化,並報告置信區間,而不是提供壓縮排名作為精確的安全分數。這些做法將論文的效率結果轉變為可審計的監控計劃,同時保留原始基準以供更深入的審查。