論文報告大型語言模型中出現的類腦模組化組織
arXiv 的新預印本稱,基於四個認知領域 46 項任務的電路分析,大型語言模型開發了功能專門的內部結構,與不同的人腦網絡相一致。摘要頁面未說明關鍵的方法細節。
每日更新1759 經過驗證的故事
非營利教育團隊以簡單易懂的英語解釋了產品發布、政策轉變、安全研究和行業動向的經過來源檢查的人工智慧報道。
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
What happened, why it matters, and what to watch — without the jargon.
當訊號很弱時,我們不會發布任何內容,而是填充提要。
Source-checked AI stories, newest first, for people who need to understand AI without chasing hype.
arXiv 的新預印本稱,基於四個認知領域 46 項任務的電路分析,大型語言模型開發了功能專門的內部結構,與不同的人腦網絡相一致。摘要頁面未說明關鍵的方法細節。
一份預印本報告稱,在 350 億參數混合專家模型的最後五層中禁用低量級專家,比在所有層上傳播相同的剪切保留了更多可用的程式碼翻譯輸出。它涵蓋一種模型和一項基準,並且摘要報告沒有公開的基準。
雲端安全聯盟的研究報告描述了 CoreBreak,這是 Amazon Bedrock AgentCore、Google 的代理程式開發套件和 Vercel 的 AI SDK 工具包中的一種缺陷模式,這些缺陷允許工具在沒有模型轉動的情況下執行,從而使模型級護欄無法檢查。
Anthropic 表示未來的 Claude 模型將嵌入基於 Google DeepMind 的 SynthID-Text 的統計水印,以遵守歐盟人工智慧法案。該公司表示,它沒有添加任何字元、令牌或用戶身份,並且完全重寫會失敗。
Cursor 發表了一篇簡短的文章,表示 SpaceX 已經完成了對人工智慧編碼工具的收購,完成了據稱於 4 月與 SpaceXAI 建立模型訓練合作夥伴關係開始的流程。該貼文承諾使用其所謂的世界上最大的 GPU 群,但沒有透露任何條款、時間表或產品變化。
預印本介紹了 SteerBench-Work,這是針對人工智慧代理決定採取行動或暫停進行審查的時刻的 106 個場景測試。作者報告稱,在 30 種模型條件下,錯誤保留已批准的工作的發生率大約是錯誤允許不安全工作的發生率的 28 倍。
新的 arXiv 預印本對用作自動評分器的九個前沿模型進行了壓力測試,並報告稱,所有這些模型都在挑戰下改變了自己的判決——而且改變後的判決通常會偏離正確答案,而不是朝著正確答案前進。
arXiv 的一份新預印本認為,採用進化策略(一種基於群體、直接擾動權重的無梯度方法)的法學碩士在訓練後在 pass@k 和解決方案覆蓋率上擊敗了強化學習。摘要引用了更好的數學基準結果,但沒有提及模型、基準或數字。
新的 arXiv 預印本對特定的代理故障模式進行了基準測試:當自我改進的代理將不安全的過程寫入記憶體時,可以在以後的會話中檢索並執行它。測試的每個進化配置都會產生不安全的工件,並且三個惡意任務使遺留攻擊的成功率增加了一倍以上。
發佈到 arXiv 的預印本描述了一個框架,該框架在將查詢和檢索到的文檔發送到第三方模型之前,將它們交換為別名。作者報告稱,他們的端到端用戶指標準確率超過 80%,三個小型模型的完全隱藏率在 74.91% 到 77.83% 之間。
arXiv 上發布的預印本描述了 CABS+,這是一種用無梯度係數搜尋取代網格搜尋的模型合併方法。作者報告稱,與兩個基準相比,效能提升了兩位數,其中一個基準的 GPU 記憶體不足四分之一,而另一個基準的速度大約提高了 4 倍。
arXiv 預印本描述了 Spatial Memory Agent,它將經過驗證的經驗儲存為推理時檢索的文本課程,聲稱在不改變模型權重的情況下,在五個空間基準和四個視覺語言模型中獲得了收益。正在審核中;它的摘要沒有提及基準、基本模型或利潤。
每週一次有用的簡報
取得本週經過驗證的人工智慧新聞、原始數據、有用的工具、學習精選和新鮮的人工智慧工作。