發生了什麼事
Anthropic 宣布了一項 500 萬美元的資助計劃,用於人工智慧對用戶福祉影響的獨立研究。它表示,受資助者將獲得直接資助、使用 Anthropic 模型和技術支持,同時保持完全獨立並將其評估作為開源專案發布。
8 月 25 日,Anthropic 宣布了一項 500 萬美元的資助計劃,重點是人工智慧系統如何影響用戶福祉的獨立研究。該公司表示,該計劃將為建立開源評估的研究人員提供直接資金、模型存取和技術支援。 Anthropic將預期輸出描述為全行業開發人員可以使用的基準和評估項目,而不是僅限於Anthropic內部系統的評估。
Anthropic 表示,受資助者將完全獨立工作,並將他們的作品作為開源專案發布。該公告沒有具體說明資助將如何分配、將選擇多少項目、單一獎項的規模,或在受資助者獲得 Anthropic 的模型存取和技術支援時將採取哪些正式保障措施來保護研究獨立性。這些細節仍然未知。
該公司圍繞著人工智慧在工作、教育、解決問題和情感支持對話中日益重要的角色提出了需求。該公司表示,對於用戶向模特兒尋求陪伴或在心理健康危機期間使用人工智慧等情況,目前還沒有明確的行業標準。 Anthropic 也表示,幸福感比許多模型行為更難評估,因為對話的風險可能會隨著時間的推移而變化,並且可能取決於先前揭露的資訊。
例如,Anthropic 表示,有關飲食或運動的反應單獨看來可能是合理的,但如果使用者有飲食失調的歷史,就會變得不合適。它表示,其自己的保障措施旨在識別此類背景並指導 Claude 的應對措施,而其對與 Claude 對話的研究則為保障措施的開發和評估提供資訊。這些陳述描述了 Anthropic 的方法和主張;該公告沒有提供任何獨立結果表明這些保障措施是有效的。
為什麼這很重要
該計劃針對的是人工智慧評估中的一個難題:健康風險可能會在長時間的對話中逐漸出現,並且在很大程度上取決於使用者的背景。更好的獨立基準可以幫助開發者評估有害的合規性和過度拒絕,儘管 Anthropic 尚未披露贈款規模、接受者數量或如何管理獨立性。
該提案解決了評估對話式人工智慧的一個核心弱點:單一答案可能無法揭示系統是否安全地處理敏感互動。使用者的情況可能會在多個回合中變得更加清晰,並且在一種情況下可以接受的回應在另一種情況下可能是有害的。捕捉這些變化的評估可以為開發人員和研究人員提供更現實的基礎來判斷情感敏感使用的安全性。
Anthropic 的指南要求進行評估,以明確定義什麼算通過或未通過,以及為什麼該標準很重要。它還要求研究人員讓臨床和主題專家參與設計和驗證。這種強調是必然的,因為健康判斷可能涉及心理健康、飲食失調、危機應對以及通用語言品質測試可能會錯過重要風險的其他領域。
該公司還表示,評估應同時測試預防措施和危害。這意味著不僅要檢查模型是否太容易滿足有風險的請求,還要檢查模型是否在適當的有用回應時過於廣泛地拒絕。這種過度遵守與過度拒絕的區別可以使評估為真實用戶提供更多信息,但消息來源並未確定最終受資助者將採用哪些閾值或定義。
Anthropic 希望場景類似於實際使用,通常是透過風險升級和環境變化的多輪對話。它還進一步表示,自動評分器應該根據真正的主題專家進行驗證。如果嚴格實施,這些要求可能有助於暴露簡短的靜態基準提示所忽略的故障。實用價值將取決於所選研究的品質、其開放性以及其他開發人員是否採用最終的測試。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
Why can ethical evaluation not be reduced to one model score?
接下來看什麼
申請截止日期為 2026 年 9 月 21 日,受邀提交完整提案的申請人預計將於 10 月 5 日收到通知。關鍵測試將是最終的評估是否使用臨床專業知識、反映現實的多輪對話、根據專家驗證自動分級器以及產生超越 Anthropic 自己的模型的方法。
眼前的里程碑是 2026 年 9 月 21 日的申請截止日期。 Anthropic 表示,被選中提交完整提案的申請人將於 10 月 5 日之前收到通知。該公告沒有提供最終獎項、資助研究的開始或結果發布的日期,因此該項目的近期規模和進度尚無法評估。
選擇過程將受到嚴格審查。重要的懸而未決的問題包括誰將選擇受資助者、如何處理利益衝突、研究人員是否可以在未經審查的情況下發表不利的發現、需要什麼模型訪問以及該計劃是否會資助評估 Claude 以外的系統的工作。 Anthropic的獨立主張是有意義的,但消息來源並未描述其背後的合約條款。
由此產生的評估結果應評估超過基準分數。留意場景代表長時間對話、臨床專家參與設計和驗證以及分級人員根據專家判斷進行檢查的證據。基準測試是否衡量過度遵守和過度拒絕造成的危害,以及它們的方法是否可以被 Anthropic 以外的開發人員複製和使用也很重要。
最後,該計劃的更廣泛影響將取決於採用情況。 Anthropic 表示,這些專案將是開源的,可供任何開發人員使用,但它沒有透露參與研究人員、計劃的基準、發布場所或全行業標準化機制。在這些細節和結果出現之前,該公告建立了資金承諾和評估議程,而不是人工智慧福祉風險已經解決的證據。