已驗證來源
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
簡單的英語
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
無填料
當訊號很弱時,我們不會發布任何內容,而是填充提要。
更多故事
9 故事創新
複製研究表明 FLOP 仍然會錯誤預測 AI 運行時間,並且提議的修復方案在較新的硬體上失敗
兩位研究人員的預印本重現了一項早期研究,為什麼相同的 FLOP 計數並不意味著相同的執行時間。它證實了基本的說法,但報告稱 α-FLOPs 校正公式通常會低估較新硬體上的運行時間,這顯示了公式無法捕捉的跳躍和振盪。arxiv.org企業
基準論文發現法學碩士查詢企業資料的四種方法,得分均低於 26%
新的 arXiv 預印本在綜合雙語基準上對企業資料庫自然語言查詢的四種架構進行了比較。沒有人正確回答了超過四分之一的案例,而且得分最高的設計並不是最安全或最便宜的。arxiv.org創新
論文提出透過測量更強模型的收斂性來對沒有標籤的人工智慧安全代理進行分級
新的 arXiv 預印本認為,安全團隊可以透過測量配備記憶或檢索的人工智慧代理與更強大的「教師」模型的差距縮小多少來判斷其是否正在學習,而不是根據通常稀缺或陳舊的標記基準。從類似動力模型來看,沒有給出可用的訊號。arxiv.org創新
新基準測試人工智慧助理能否記住一年的手機使用情況
arXiv 上發布的一份由 17 位作者組成的技術報告介紹了 MobileMem,這是一個根據一年規模的行動體驗集合構建的設備上長期記憶的基準和框架。摘要描述了設計,但沒有報告分數,並且有關基礎數據的關鍵細節仍未公開。arxiv.org創新
論文報告大型語言模型中出現的類腦模組化組織
arXiv 的新預印本稱,基於四個認知領域 46 項任務的電路分析,大型語言模型開發了功能專門的內部結構,與不同的人腦網絡相一致。摘要頁面未說明關鍵的方法細節。arxiv.org創新
論文發現專家混合模型的後期層可以承受嚴重的專家掩蔽
一份預印本報告稱,在 350 億參數混合專家模型的最後五層中禁用低量級專家,比在所有層上傳播相同的剪切保留了更多可用的程式碼翻譯輸出。它涵蓋一種模型和一項基準,並且摘要報告沒有公開的基準。arxiv.org安全性
CoreBreak 缺陷讓代理程式工具在沒有呼叫模型的情況下運行
雲端安全聯盟的研究報告描述了 CoreBreak,這是 Amazon Bedrock AgentCore、Google 的代理程式開發套件和 Vercel 的 AI SDK 工具包中的一種缺陷模式,這些缺陷允許工具在沒有模型轉動的情況下執行,從而使模型級護欄無法檢查。labs.cloudsecurityalliance.org政策
Anthropic 詳細說明 Claude 的文字浮水印如何運作
Anthropic 表示未來的 Claude 模型將嵌入基於 Google DeepMind 的 SynthID-Text 的統計水印,以遵守歐盟人工智慧法案。該公司表示,它沒有添加任何字元、令牌或用戶身份,並且完全重寫會失敗。
anthropic.com產業
Cursor 表示 SpaceX 收購已正式完成
Cursor 發表了一篇簡短的文章,表示 SpaceX 已經完成了對人工智慧編碼工具的收購,完成了據稱於 4 月與 SpaceXAI 建立模型訓練合作夥伴關係開始的流程。該貼文承諾使用其所謂的世界上最大的 GPU 群,但沒有透露任何條款、時間表或產品變化。
cursor.com