論文提出透過測量更強模型的收斂性來對沒有標籤的人工智慧安全代理進行分級
新的 arXiv 預印本認為,安全團隊可以透過測量配備記憶或檢索的人工智慧代理與更強大的「教師」模型的差距縮小多少來判斷其是否正在學習,而不是根據通常稀缺或陳舊的標記基準。從類似動力模型來看,沒有給出可用的訊號。
每日更新1821 經過驗證的故事
非營利教育團隊以簡單易懂的英語解釋了產品發布、政策轉變、安全研究和行業動向的經過來源檢查的人工智慧報道。
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
當訊號很弱時,我們不會發布任何內容,而是填充提要。
經過來源檢查的人工智慧故事,最新的優先,適合那些需要了解人工智慧而不追逐炒作的人。
新的 arXiv 預印本認為,安全團隊可以透過測量配備記憶或檢索的人工智慧代理與更強大的「教師」模型的差距縮小多少來判斷其是否正在學習,而不是根據通常稀缺或陳舊的標記基準。從類似動力模型來看,沒有給出可用的訊號。
一份預印本報告稱,在 350 億參數混合專家模型的最後五層中禁用低量級專家,比在所有層上傳播相同的剪切保留了更多可用的程式碼翻譯輸出。它涵蓋一種模型和一項基準,並且摘要報告沒有公開的基準。
雲端安全聯盟的研究報告描述了 CoreBreak,這是 Amazon Bedrock AgentCore、Google 的代理程式開發套件和 Vercel 的 AI SDK 工具包中的一種缺陷模式,這些缺陷允許工具在沒有模型轉動的情況下執行,從而使模型級護欄無法檢查。
Anthropic 表示未來的 Claude 模型將嵌入基於 Google DeepMind 的 SynthID-Text 的統計水印,以遵守歐盟人工智慧法案。該公司表示,它沒有添加任何字元、令牌或用戶身份,並且完全重寫會失敗。
Cursor 發表了一篇簡短的文章,表示 SpaceX 已經完成了對人工智慧編碼工具的收購,完成了據稱於 4 月與 SpaceXAI 建立模型訓練合作夥伴關係開始的流程。該貼文承諾使用其所謂的世界上最大的 GPU 群,但沒有透露任何條款、時間表或產品變化。
預印本介紹了 SteerBench-Work,這是針對人工智慧代理決定採取行動或暫停進行審查的時刻的 106 個場景測試。作者報告稱,在 30 種模型條件下,錯誤保留已批准的工作的發生率大約是錯誤允許不安全工作的發生率的 28 倍。
新的 arXiv 預印本對用作自動評分器的九個前沿模型進行了壓力測試,並報告稱,所有這些模型都在挑戰下改變了自己的判決——而且改變後的判決通常會偏離正確答案,而不是朝著正確答案前進。
arXiv 的一份新預印本認為,採用進化策略(一種基於群體、直接擾動權重的無梯度方法)的法學碩士在訓練後在 pass@k 和解決方案覆蓋率上擊敗了強化學習。摘要引用了更好的數學基準結果,但沒有提及模型、基準或數字。
新的 arXiv 預印本對特定的代理故障模式進行了基準測試:當自我改進的代理將不安全的過程寫入記憶體時,可以在以後的會話中檢索並執行它。測試的每個進化配置都會產生不安全的工件,並且三個惡意任務使遺留攻擊的成功率增加了一倍以上。
發佈到 arXiv 的預印本描述了一個框架,該框架在將查詢和檢索到的文檔發送到第三方模型之前,將它們交換為別名。作者報告稱,他們的端到端用戶指標準確率超過 80%,三個小型模型的完全隱藏率在 74.91% 到 77.83% 之間。
每週一次有用的簡報
取得本週經過驗證的人工智慧新聞、原始數據、有用的工具、學習精選和新鮮的人工智慧工作。