已驗證來源
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
簡單的英語
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
無填料
當訊號很弱時,我們不會發布任何內容,而是填充提要。
更多故事
9 故事創新
使用 NVIDIA SkillEvaluator 评估 AI 代理技能表现
NVIDIA SkillEvaluator 通过三层评估流程来衡量经过验证的技能对 AI 代理性能的影响。
developer.nvidia.com創新
論文介紹「影子評估」:人工智慧代理完成了工程但未能通過兩個研究問題
一份由 24 位作者組成的預印本讓前沿 AI 代理嘗試解決兩篇未發表的 NeurIPS 2026 論文的核心研究問題,然後讓論文自己的作者對結果進行評分。特工們在六天內獨立完成了工程,但在研究中被明確拒絕。arxiv.org產品展示
Warp 開放對「工廠」的早期訪問,這是一個用於運行編碼代理隊列的配置即代碼系統
Warp 正在接受 Warp Factories 的早期存取請求,該工廠將一組編碼代理定義為 YAML 檔案中的程式碼、儲存庫、模型、權限和人工檢查點,由 CLI、API、SDK 和 MCP 驅動。其自動化和成本數據是供應商聲稱的:沒有定價、全面上市日期或獨立測試。warp.dev創新
Benchmark 表示,頂級多模態模型在透過鋼筆聲音和手勢讀取單字方面得分低於 10%
一篇新的 arXiv 論文引入了一項測試,其中模型必須從筆劃音頻和手部動作視頻中推斷出書面單詞,且看不到墨水。作者報告稱,人類的有序字母準確率高於 80%,而領先模型的準確率低於 10%——而且為模型提供這兩種模式往往會使結果變得更糟。arxiv.org創新
論文稱,代理感知快取管理可將多代理服務中的第一個令牌延遲減少高達 45%
新的 arXiv 預印本描述了 CacheScout,這是一個建置在開源 vLLM 伺服器上的層,它根據下一步可能運行的代理程式來決定在模型的鍵值快取中保留哪些內容。作者報告了兩位數的延遲和吞吐量增益;摘要中未說明工作負載、模型和硬體。arxiv.org創新
對 OpenAI AI 產生的證明的審查發現了相反的情況,並發布了修復
兩位研究人員表示,OpenAI 數學文件第 6 章中的引理證明存在極性錯誤:以平均成功為標準的測試,而下一步需要較大的條件失敗。他們給了一個反例和一個修正的證明,並警告這不是對本章主要定理的驗證。arxiv.org創新
複製研究表明 FLOP 仍然會錯誤預測 AI 運行時間,並且提議的修復方案在較新的硬體上失敗
兩位研究人員的預印本重現了一項早期研究,為什麼相同的 FLOP 計數並不意味著相同的執行時間。它證實了基本的說法,但報告稱 α-FLOPs 校正公式通常會低估較新硬體上的運行時間,這顯示了公式無法捕捉的跳躍和振盪。arxiv.org企業
基準論文發現法學碩士查詢企業資料的四種方法,得分均低於 26%
新的 arXiv 預印本在綜合雙語基準上對企業資料庫自然語言查詢的四種架構進行了比較。沒有人正確回答了超過四分之一的案例,而且得分最高的設計並不是最安全或最便宜的。arxiv.org創新
論文提出透過測量更強模型的收斂性來對沒有標籤的人工智慧安全代理進行分級
新的 arXiv 預印本認為,安全團隊可以透過測量配備記憶或檢索的人工智慧代理與更強大的「教師」模型的差距縮小多少來判斷其是否正在學習,而不是根據通常稀缺或陳舊的標記基準。從類似動力模型來看,沒有給出可用的訊號。arxiv.org