已驗證來源
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
簡單的英語
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
無填料
當訊號很弱時,我們不會發布任何內容,而是填充提要。
更多故事
9 故事安全性
SEAG 論文建議在 RAG 查詢到達外部法學碩士之前對敏感實體進行別名處理
發佈到 arXiv 的預印本描述了一個框架,該框架在將查詢和檢索到的文檔發送到第三方模型之前,將它們交換為別名。作者報告稱,他們的端到端用戶指標準確率超過 80%,三個小型模型的完全隱藏率在 74.91% 到 77.83% 之間。arxiv.org創新
CABS+ 論文報告 27 個資料集的模型合併成本更低、速度更快
arXiv 上發布的預印本描述了 CABS+,這是一種用無梯度係數搜尋取代網格搜尋的模型合併方法。作者報告稱,與兩個基準相比,效能提升了兩位數,其中一個基準的 GPU 記憶體不足四分之一,而另一個基準的速度大約提高了 4 倍。arxiv.org創新
論文提出透過檢索「教訓」來改進凍結視覺語言模型的空間推理
arXiv 預印本描述了 Spatial Memory Agent,它將經過驗證的經驗儲存為推理時檢索的文本課程,聲稱在不改變模型權重的情況下,在五個空間基準和四個視覺語言模型中獲得了收益。正在審核中;它的摘要沒有提及基準、基本模型或利潤。arxiv.org創新
PROVE-RT 論文報告產生機器檢查的即時校樣的成功率為 44.7%
arXiv 預印本提出了 PROVE-RT,它使用檢索和分階段提示使大型語言模型編寫 PROSA/ROCQ 證明腳本以進行即時可調度性分析。作者報告稱,在精心策劃的評估集上,直接提示無法可靠地產生有效的機械化,成功率為 44.7%。arxiv.org政策
工作文件詢問印度消費者法是否可以涵蓋人工智慧的危害
arXiv 的一份新工作論文認為,印度 2019 年《消費者保護法》的範圍足夠廣泛,原則上可以涵蓋與人工智慧相關的危害,但在整個人工智慧供應鏈中證明因果關係和歸咎責任仍未解決。這裡僅公開總結摘要;該論文未經同儕審查。arxiv.org創新
蘋果論文提出透過跳過低影響力數據來降低機器學習成本
蘋果機器學習研究論文認為,並非刪除請求中的每個資料點都需要主動刪除。作者表示,使用跨語言和視覺任務的影響函數,可以從遺忘集中刪除低影響力的範例,從而將不學習的計算量減少高達約 50%。machinelearning.apple.com創新
AutoWorldModel-Bench 測試編碼代理程式是否可以改進世界模型
新的 arXiv 預印本引入了一個基準,用於評估編碼代理作為跨八個遊戲環境的開放式世界模型研究人員,報告了 64 個會話中的 63 個會話的改進。arxiv.org創新
Distribird 論文描述了基於文獻的貝葉斯模型先驗人工智慧代理
arXiv 預印本介紹了 Distribird,這是一種多智能體應用程序,可搜尋科學文獻、提取報告的參數值,並為貝葉斯模型校準建立可追蹤的先驗分佈。arxiv.org創新
研究人員推出 OmniLens 以實現大規模語言模型的可解釋性
arXiv 的一篇新論文描述了 OmniLens,這是一種成本較低的方法,用於檢查整個大型語言模型的內部訊號,並確定行為出現的位置與介入措施起作用的位置。arxiv.org