已驗證來源
每個故事都連結到最有力的可用證據:可用的原始來源,否則明確歸因的報告。
簡單的英語
發生了什麼、為什麼重要以及值得關注的內容——無需行話。
無填料
當訊號很弱時,我們不會發布任何內容,而是填充提要。
更多故事
9 故事創新
學習地圖 為葡萄牙語所建構的 46 種語言模型
一項系統映射研究對 46 個葡萄牙語模型進行了分類,並比較了架構、培訓資源、許可、代碼、數據和權重。作者表示,該領域正在發展,但很難評估,因為資訊分佈在論文、技術報告、儲存庫和專案文件中。arxiv.org創新
可解釋性研究將 Qwen3-4B 過度自信的答案與確定性偏見機制聯繫起來
arXiv 研究報告稱,Qwen3-4B 在受控推理任務中更傾向於確定性而不是不確定性,並確定了可能導致不平衡的模型特徵。作者表示,有針對性的干預措施減少了過度自信的錯誤,但摘要並未揭露效果大小或測試細節。arxiv.org創新
義務差距:大語言模型與義務模態語言
情態助動詞,如“must”、“should”和“have”,表示說話者權威和人際立場背景下的必要性和義務。arxiv.org安全性
論文提出模糊拒絕訊號以抵抗消除攻擊
arXiv 預印本引入了一種權重編輯方法,旨在使安全拒絕更難提取和刪除。該論文報告了兩種開放模型的更強的消除後拒絕分數,並在通用性能方面進行了不同的權衡。arxiv.org創新
論文報告了一種在令牌層級檢測幻覺的時間方法
arXiv 預印本描述了一種幻覺偵測器,它結合了跨序列的文字統計、蘊含訊號和語言模型驚喜,而不是獨立判斷標記。據該論文稱,其 BiGRU 模型在 RAGTruth 上的 AUC 達到 0.840。arxiv.org創新
實體追蹤出現了 4.1 億個參數,在自然敘事中超過了人類
理解語言需要追蹤整個話語中的實體——即知道事物在哪裡以及它們如何變化,即使沒有明確說明。arxiv.org創新
論文報告編譯器引導搜尋提高了精益定理證明效率
arXiv 預印本提出了一種針對上下文相關的精實 4 專案的自適應證明搜尋方法。其作者報告稱,與 pass@k 基準相比,pass@32 預算內的平均通過率提高了 12.8 個百分點,同時 LLM 呼叫數量減少了 21.9%。arxiv.org創新
基準將幾何求解與圖表建構分開
一個新的開源基準測試基礎模型是否可以建立忠實的幾何圖,而不僅僅是解決根本問題。其作者報告稱,評估模型的平均編譯成功率為 36.14%,暴露了數學答案和可用視覺結構之間的差距。arxiv.org創新
您所需要的就是對齊:通用音訊語言模型的免指導培訓
一種訓練多模態大語言模型(MLLM)的新方法消除了對廣泛的特定任務監督的需求。arxiv.org