已驗證來源
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
簡單的英語
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
無填料
當訊號很弱時,我們不會發布任何內容,而是填充提要。
更多故事
9 故事創新
Benchmark 表示,頂級多模態模型在透過鋼筆聲音和手勢讀取單字方面得分低於 10%
一篇新的 arXiv 論文引入了一項測試,其中模型必須從筆劃音頻和手部動作視頻中推斷出書面單詞,且看不到墨水。作者報告稱,人類的有序字母準確率高於 80%,而領先模型的準確率低於 10%——而且為模型提供這兩種模式往往會使結果變得更糟。arxiv.org創新
論文稱,代理感知快取管理可將多代理服務中的第一個令牌延遲減少高達 45%
新的 arXiv 預印本描述了 CacheScout,這是一個建置在開源 vLLM 伺服器上的層,它根據下一步可能運行的代理程式來決定在模型的鍵值快取中保留哪些內容。作者報告了兩位數的延遲和吞吐量增益;摘要中未說明工作負載、模型和硬體。arxiv.org創新
對 OpenAI AI 產生的證明的審查發現了相反的情況,並發布了修復
兩位研究人員表示,OpenAI 數學文件第 6 章中的引理證明存在極性錯誤:以平均成功為標準的測試,而下一步需要較大的條件失敗。他們給了一個反例和一個修正的證明,並警告這不是對本章主要定理的驗證。arxiv.org創新
複製研究表明 FLOP 仍然會錯誤預測 AI 運行時間,並且提議的修復方案在較新的硬體上失敗
兩位研究人員的預印本重現了一項早期研究,為什麼相同的 FLOP 計數並不意味著相同的執行時間。它證實了基本的說法,但報告稱 α-FLOPs 校正公式通常會低估較新硬體上的運行時間,這顯示了公式無法捕捉的跳躍和振盪。arxiv.org企業
基準論文發現法學碩士查詢企業資料的四種方法,得分均低於 26%
新的 arXiv 預印本在綜合雙語基準上對企業資料庫自然語言查詢的四種架構進行了比較。沒有人正確回答了超過四分之一的案例,而且得分最高的設計並不是最安全或最便宜的。arxiv.org創新
論文提出透過測量更強模型的收斂性來對沒有標籤的人工智慧安全代理進行分級
新的 arXiv 預印本認為,安全團隊可以透過測量配備記憶或檢索的人工智慧代理與更強大的「教師」模型的差距縮小多少來判斷其是否正在學習,而不是根據通常稀缺或陳舊的標記基準。從類似動力模型來看,沒有給出可用的訊號。arxiv.org創新
新基準測試人工智慧助理能否記住一年的手機使用情況
arXiv 上發布的一份由 17 位作者組成的技術報告介紹了 MobileMem,這是一個根據一年規模的行動體驗集合構建的設備上長期記憶的基準和框架。摘要描述了設計,但沒有報告分數,並且有關基礎數據的關鍵細節仍未公開。arxiv.org創新
論文報告大型語言模型中出現的類腦模組化組織
arXiv 的新預印本稱,基於四個認知領域 46 項任務的電路分析,大型語言模型開發了功能專門的內部結構,與不同的人腦網絡相一致。摘要頁面未說明關鍵的方法細節。arxiv.org創新
論文發現專家混合模型的後期層可以承受嚴重的專家掩蔽
一份預印本報告稱,在 350 億參數混合專家模型的最後五層中禁用低量級專家,比在所有層上傳播相同的剪切保留了更多可用的程式碼翻譯輸出。它涵蓋一種模型和一項基準,並且摘要報告沒有公開的基準。arxiv.org