Anthropic 詳細說明 Claude 的文字浮水印如何運作
Anthropic 表示未來的 Claude 模型將嵌入基於 Google DeepMind 的 SynthID-Text 的統計水印,以遵守歐盟人工智慧法案。該公司表示,它沒有添加任何字元、令牌或用戶身份,並且完全重寫會失敗。
每日更新1792 經過驗證的故事
非營利教育團隊以簡單易懂的英語解釋了產品發布、政策轉變、安全研究和行業動向的經過來源檢查的人工智慧報道。
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
What happened, why it matters, and what to watch — without the jargon.
當訊號很弱時,我們不會發布任何內容,而是填充提要。
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
Anthropic 表示未來的 Claude 模型將嵌入基於 Google DeepMind 的 SynthID-Text 的統計水印,以遵守歐盟人工智慧法案。該公司表示,它沒有添加任何字元、令牌或用戶身份,並且完全重寫會失敗。
Cursor 發表了一篇簡短的文章,表示 SpaceX 已經完成了對人工智慧編碼工具的收購,完成了據稱於 4 月與 SpaceXAI 建立模型訓練合作夥伴關係開始的流程。該貼文承諾使用其所謂的世界上最大的 GPU 群,但沒有透露任何條款、時間表或產品變化。
預印本介紹了 SteerBench-Work,這是針對人工智慧代理決定採取行動或暫停進行審查的時刻的 106 個場景測試。作者報告稱,在 30 種模型條件下,錯誤保留已批准的工作的發生率大約是錯誤允許不安全工作的發生率的 28 倍。
新的 arXiv 預印本對用作自動評分器的九個前沿模型進行了壓力測試,並報告稱,所有這些模型都在挑戰下改變了自己的判決——而且改變後的判決通常會偏離正確答案,而不是朝著正確答案前進。
arXiv 的一份新預印本認為,採用進化策略(一種基於群體、直接擾動權重的無梯度方法)的法學碩士在訓練後在 pass@k 和解決方案覆蓋率上擊敗了強化學習。摘要引用了更好的數學基準結果,但沒有提及模型、基準或數字。
新的 arXiv 預印本對特定的代理故障模式進行了基準測試:當自我改進的代理將不安全的過程寫入記憶體時,可以在以後的會話中檢索並執行它。測試的每個進化配置都會產生不安全的工件,並且三個惡意任務使遺留攻擊的成功率增加了一倍以上。
發佈到 arXiv 的預印本描述了一個框架,該框架在將查詢和檢索到的文檔發送到第三方模型之前,將它們交換為別名。作者報告稱,他們的端到端用戶指標準確率超過 80%,三個小型模型的完全隱藏率在 74.91% 到 77.83% 之間。
arXiv 上發布的預印本描述了 CABS+,這是一種用無梯度係數搜尋取代網格搜尋的模型合併方法。作者報告稱,與兩個基準相比,效能提升了兩位數,其中一個基準的 GPU 記憶體不足四分之一,而另一個基準的速度大約提高了 4 倍。
arXiv 預印本描述了 Spatial Memory Agent,它將經過驗證的經驗儲存為推理時檢索的文本課程,聲稱在不改變模型權重的情況下,在五個空間基準和四個視覺語言模型中獲得了收益。正在審核中;它的摘要沒有提及基準、基本模型或利潤。
arXiv 預印本提出了 PROVE-RT,它使用檢索和分階段提示使大型語言模型編寫 PROSA/ROCQ 證明腳本以進行即時可調度性分析。作者報告稱,在精心策劃的評估集上,直接提示無法可靠地產生有效的機械化,成功率為 44.7%。
arXiv 的一份新工作論文認為,印度 2019 年《消費者保護法》的範圍足夠廣泛,原則上可以涵蓋與人工智慧相關的危害,但在整個人工智慧供應鏈中證明因果關係和歸咎責任仍未解決。這裡僅公開總結摘要;該論文未經同儕審查。
蘋果機器學習研究論文認為,並非刪除請求中的每個資料點都需要主動刪除。作者表示,使用跨語言和視覺任務的影響函數,可以從遺忘集中刪除低影響力的範例,從而將不學習的計算量減少高達約 50%。
每週一次有用的簡報
取得本週經過驗證的人工智慧新聞、原始數據、有用的工具、學習精選和新鮮的人工智慧工作。