已驗證來源
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
簡單的英語
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
無填料
當訊號很弱時,我們不會發布任何內容,而是填充提要。
更多故事
9 故事創新
預印本描述了一種用於分析中草藥配方的多智能體人工智慧框架
新的 arXiv 預印本描述了 DeepTCM1.0,這是一個使用 11 種專門的人工智慧代理和迭代審查來分析中藥配方的可能機制的系統。它報告了評估設計,但沒有數值結果、臨床驗證或改善患者護理的證據。arxiv.org安全性
博士論文研究了語言和視覺語言模型中的後門攻擊
arXiv 列名博士論文研究後門攻擊如何影響語言模型和視覺語言模型,包括分析、偵測和攻擊設計的方法。arxiv.org創新
預印本報告對著名機構的法學碩士候選人評分更高
arXiv 預印本報告稱,當與更高聲望的機構和期刊相關聯時,四種大型語言模型會對候選人資料進行更有利的評價。作者表示,機構和地理線索可以影響評估,而所提供的來源中並未具體說明測試的模型和專業領域。arxiv.org創新
研究發現推理上下文可以改變醫療分配場景中的法學碩士輸出
arXiv 論文報告稱,在評估相同的臨床場景時,無論有或沒有模型在上下文中的先前回應,四個測試語言模型中的三個都會以不同的方式改變資源分配機率。arxiv.org創新
预印本报告人工智能对非侵入性大脑记录中的自然句子进行解码
一個研究團隊描述了 Brain2Qwerty v2,這是一個使用即時 MEG 記錄來解碼輸入的自然句子的模型,報告顯示 9 個受試者的平均單字錯誤率為 39%。arxiv.org創新
學習地圖 為葡萄牙語所建構的 46 種語言模型
一項系統映射研究對 46 個葡萄牙語模型進行了分類,並比較了架構、培訓資源、許可、代碼、數據和權重。作者表示,該領域正在發展,但很難評估,因為資訊分佈在論文、技術報告、儲存庫和專案文件中。arxiv.org創新
可解釋性研究將 Qwen3-4B 過度自信的答案與確定性偏見機制聯繫起來
arXiv 研究報告稱,Qwen3-4B 在受控推理任務中更傾向於確定性而不是不確定性,並確定了可能導致不平衡的模型特徵。作者表示,有針對性的干預措施減少了過度自信的錯誤,但摘要並未揭露效果大小或測試細節。arxiv.org創新
義務差距:大語言模型與義務模態語言
情態助動詞,如“must”、“should”和“have”,表示說話者權威和人際立場背景下的必要性和義務。arxiv.org安全性
論文提出模糊拒絕訊號以抵抗消除攻擊
arXiv 預印本引入了一種權重編輯方法,旨在使安全拒絕更難提取和刪除。該論文報告了兩種開放模型的更強的消除後拒絕分數,並在通用性能方面進行了不同的權衡。arxiv.org