返回新聞
創新AI Understanding 簡報

預印本提出了 credal 語言模型來揭示不確定性並檢測幻覺

一份新的預印本提出了一種基於整合的方法,可以衡量語言模型對答案的承諾程度,報告三個開放模型和四個問答資料集的競爭校準和幻覺檢測結果。

5 min readRead the primary source
Source-page capture accompanying Preprint proposes credal language models to expose uncertainty and detect hallucinations
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.23244
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

LoRA(低階適應)
一種加入低秩適配器矩陣的參數高效率微調方法。
記憶體(代理記憶體)
AI 代理程式跨步驟或會話使用儲存的上下文來提高連續性。
幻覺
當模型產生流暢但錯誤或不受支援的資訊。
測試一下自己ChatGPT 與法學碩士測驗

發生了什麼事

8 月 24 日提交给 arXiv 的预印本介绍了 Credal Large Language Models(CLLM),它使用 LoRA 适配器的集合来表示一系列合理的预测,而不是单一的概率分布。作者得出了標記級和語義級的承諾分數,並評估它們的問題答案、校準、選擇性預測、幻覺檢測和推理。

该论文描述了语言模型表示不确定性的通常方式的局限性:标准模型产生单一预测分布,作者说这可能会将无知与真正的模糊性混为一谈。他們提出的 CLLM 相反,使用 LoRA 適配器的集合來形成本文所說的憑證集。實際上,該方法旨在保留合理預測分佈之間的分歧或分佈,而不是將所有不確定性壓縮到一個 softmax 輸出中。消息來源並未聲稱這種表示使模型正確;它聲稱它可以使模型的承諾程度提供更多資訊。

作者介紹了兩項相關措施。 Credal 代幣承諾(CTC)在代幣空間中運行,並結合了下限支援、credal 寬度和交叉熵。摘要稱,無需額外生成即可計算 CTC,這對於重複採樣會增加延遲或成本的系統來說可能很重要。語義承諾一致性(SCC)使用採樣完成將這個想法擴展到語義空間。該論文還定義了 SCC-Gap 來衡量令牌級支持和語義級支持之間的不匹配。這些分數作為工具來識別模型的表面置信度何時可能與其可能答案所表達的含義範圍不一致。

評估涵蓋 OpenBookQA、CoQA、TriviaQA 和 ARC-Challenge 上的 Gemma-2-9B、Llama-3.1-8B 和 Qwen2.5-7B。根據摘要,CLLM 是在問答精度方面表現最好的方法,同時保持有競爭力的預期校準誤差。作者還報告說,在大多數設定中,CTC 與接收器操作特徵曲線下的最佳幻覺檢測區域的誤差不超過 1.5 個百分點,而無需額外生成。在 80% 覆蓋率的選擇性預測中,摘要報告 OpenBookQA 上針對具有 SCC 的 CLLM 的準確率達到 99.0%。它開始以 Csem 信心陳述 CLLM 的 ARC-Challenge 結果,但在給出結果之前被截斷,因此無法從提供的來源評估該聲明。

來源詳情: arxiv.org ↗

為什麼這很重要

语言模型可以毫无根据地自信地产生流畅的答案。如果报告的结果成立,测量多个看似合理的预测分布的不确定性可以帮助系统识别需要验证、弃权或人工审查的答案,而在许多情况下不需要额外生成。

中心的實際問題不僅僅是語言模型是否能夠回答問題,而是它是否能夠區分知識和不確定性。當使用者將信心視為證據時,流暢但不正確的答案可能比明確拒絕更危險。該論文提出的信任表示透過保留基於適配器的預測之間的分歧來解決該問題。如果該方法能夠推廣,它可以為開發人員提供模型端訊號,用於決定何時直接回答、請求驗證、將問題路由到另一個系統或讓人員參與。

報告的選擇性預測結果與部署特別相關,因為選擇性系統不需要回答每個問題。如果系統能夠保持高精度,同時只涵蓋它認為得到充分支援的情況,那麼在錯誤帶來重大成本的情況下可能會更有用。在該資料集和配置中,OpenBookQA 報告的 99.0% 準確率和 80% 覆蓋率令人鼓舞,但它應該被理解為論文結果,而不是部署系統將實現相同效能的證據。摘要沒有指定範例的數量、比較方法或涵蓋範圍的操作定義。

CTC 無需額外產生的主張對於推理設計也可能很重要。許多不確定性技術依賴產生多個完成,這會增加計算量和延遲。消息人士稱,CTC 結合了幾個與不確定性相關的量,無需額外生成,而 SCC 明確使用採樣完成。這種差異為論文提供了一個具體的工程觀點:一個分數的應用成本可能更低,而另一個分數則可以更直接地捕捉語義分歧。然而,摘要並未量化 LoRA 整體本身的成本,因此整體服務權衡仍然未知。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
互動式概念檢查+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

接下來看什麼

目前的結果是作者報告的預印本評估,而不是獨立建立的性能發現。所提供的摘要中仍然无法提供重要的细节,包括完整的 ARC-Challenge 结果、准确的基线、计算开销以及该方法在测试模型和数据集之外的迁移情况。

第一個問題是所報告的收益是否能夠獨立複製。來源為2026年8月24日提交的arXiv預印本,提供的資料僅包含摘要。因此,結果是作者的主張,而不是獨立驗證的事實。後續審查應檢查完整的表格、基線、置信度定義、統計變化,以及報告的優勢在所有四個資料集和所有三個模型系列中是否一致。

摘要中的 ARC-Challenge 句子不完整:它說具有 Csem 置信度的 CLLM 實現了結果,但沒有提供價值。缺失的資訊限制了與完整 OpenBookQA 聲明的比較,並妨礙了對該方法的推理性能的全面評估。该论文还报告了幻觉检测结果,在大多数情况下与最佳 AUROC 的误差在 1.5 个百分点以内,但所提供的来源并未确定绝对分数、最佳竞争方法或例外情况。

部署問題同樣重要。该论文使用了 LoRA 适配器的集合,并且摘要没有说明需要多少个适配器、它们是如何训练的,或者它们增加了多少内存和推理时间。它還僅評估三個命名語言模型和四個問答資料集。目前尚不清楚这些分数是否适用于较长的对话、开放式生成、多语言输入、特定领域的任务或测试大小和架构范围之外的模型。在这些问题得到解答之前,CLLM 最好被视为一种有前途的不确定性测量研究方法,而不是高风险使用的经过验证的保障措施。

相關指引和測驗

ChatGPT 與大型語言模型人工智慧模型解釋AI 倫理人工智慧培訓測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語關注 AI 模型發布追蹤器
覺得有用嗎?