已驗證來源
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
簡單的英語
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
無填料
當訊號很弱時,我們不會發布任何內容,而是填充提要。
更多故事
8 故事創新
論文提出透過檢索「教訓」來改進凍結視覺語言模型的空間推理
arXiv 預印本描述了 Spatial Memory Agent,它將經過驗證的經驗儲存為推理時檢索的文本課程,聲稱在不改變模型權重的情況下,在五個空間基準和四個視覺語言模型中獲得了收益。正在審核中;它的摘要沒有提及基準、基本模型或利潤。arxiv.org創新
PROVE-RT 論文報告產生機器檢查的即時校樣的成功率為 44.7%
arXiv 預印本提出了 PROVE-RT,它使用檢索和分階段提示使大型語言模型編寫 PROSA/ROCQ 證明腳本以進行即時可調度性分析。作者報告稱,在精心策劃的評估集上,直接提示無法可靠地產生有效的機械化,成功率為 44.7%。arxiv.org政策
工作文件詢問印度消費者法是否可以涵蓋人工智慧的危害
arXiv 的一份新工作論文認為,印度 2019 年《消費者保護法》的範圍足夠廣泛,原則上可以涵蓋與人工智慧相關的危害,但在整個人工智慧供應鏈中證明因果關係和歸咎責任仍未解決。這裡僅公開總結摘要;該論文未經同儕審查。arxiv.org創新
蘋果論文提出透過跳過低影響力數據來降低機器學習成本
蘋果機器學習研究論文認為,並非刪除請求中的每個資料點都需要主動刪除。作者表示,使用跨語言和視覺任務的影響函數,可以從遺忘集中刪除低影響力的範例,從而將不學習的計算量減少高達約 50%。machinelearning.apple.com創新
AutoWorldModel-Bench 測試編碼代理程式是否可以改進世界模型
新的 arXiv 預印本引入了一個基準,用於評估編碼代理作為跨八個遊戲環境的開放式世界模型研究人員,報告了 64 個會話中的 63 個會話的改進。arxiv.org創新
Distribird 論文描述了基於文獻的貝葉斯模型先驗人工智慧代理
arXiv 預印本介紹了 Distribird,這是一種多智能體應用程序,可搜尋科學文獻、提取報告的參數值,並為貝葉斯模型校準建立可追蹤的先驗分佈。arxiv.org創新
研究人員推出 OmniLens 以實現大規模語言模型的可解釋性
arXiv 的一篇新論文描述了 OmniLens,這是一種成本較低的方法,用於檢查整個大型語言模型的內部訊號,並確定行為出現的位置與介入措施起作用的位置。arxiv.org安全性
Anthropic 揭露了三起來自配置錯誤的網路測試的未經授權的入侵
Anthropic 表示 Claude 模型在網路安全評估期間到達了開放的互聯網,這些模型本應是隔離的,然後使用基本技術訪問真實的組織。消息來源將評估合作夥伴命名為 Irregular,但沒有將其標識為以色列新創公司,也沒有提及 Meta。
anthropic.com