返回新闻
创新AI Understanding 简报

预印本提出了 credal 语言模型来揭示不确定性并检测幻觉

一份新的预印本提出了一种基于集成的方法,该方法可以衡量语言模型对答案的承诺程度,报告三个开放模型和四个问答数据集的竞争校准和幻觉检测结果。

5 min readRead the primary source
Source-page capture accompanying Preprint proposes credal language models to expose uncertainty and detect hallucinations
主要来源文件来源记录
出版商
arxiv.org
来源链接
arxiv.orghttps://arxiv.org/abs/2608.23244
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

LoRA(低阶适应)
一种添加低秩适配器矩阵的参数高效微调方法。
内存(代理内存)
AI 代理跨步骤或会话使用存储的上下文来提高连续性。
幻觉
当模型生成流畅但错误或不受支持的信息时。
测试一下自己ChatGPT 和法学硕士测验

发生了什么

8 月 24 日提交给 arXiv 的预印本介绍了 Credal Large Language Models(CLLM),它使用 LoRA 适配器的集合来表示一系列合理的预测,而不是单一的概率分布。作者得出了标记级和语义级的承诺分数,并评估它们的问题回答、校准、选择性预测、幻觉检测和推理。

该论文描述了语言模型表示不确定性的通常方式的局限性:标准模型产生单一预测分布,作者说这可能会将无知与真正的模糊性混为一谈。他们提出的 CLLM 相反,使用 LoRA 适配器的集合来形成本文所说的凭证集。实际上,该方法旨在保留合理预测分布之间的分歧或分布,而不是将所有不确定性压缩到一个 softmax 输出中。消息来源并未声称这种表示使模型正确;它声称它可以使模型的承诺程度提供更多信息。

作者介绍了两项相关措施。 Credal 代币承诺(CTC)在代币空间中运行,并结合了下限支持、credal 宽度和交叉熵。摘要称,无需额外生成即可计算 CTC,这对于重复采样会增加延迟或成本的系统来说可能很重要。语义承诺一致性(SCC)使用采样完成将这一想法扩展到语义空间。该论文还定义了 SCC-Gap 来衡量令牌级支持和语义级支持之间的不匹配。这些分数作为工具来识别模型的表面置信度何时可能与其可能答案所表达的含义范围不一致。

评估涵盖 OpenBookQA、CoQA、TriviaQA 和 ARC-Challenge 上的 Gemma-2-9B、Llama-3.1-8B 和 Qwen2.5-7B。根据摘要,CLLM 是在问答精度方面表现最好的方法,同时保持有竞争力的预期校准误差。作者还报告说,在大多数设置中,CTC 与接收器操作特征曲线下的最佳幻觉检测区域的误差不超过 1.5 个百分点,而无需额外生成。在 80% 覆盖率的选择性预测中,摘要报告 OpenBookQA 上针对具有 SCC 的 CLLM 的准确率达到 99.0%。它开始以 Csem 信心陈述 CLLM 的 ARC-Challenge 结果,但在给出结果之前被截断,因此无法从提供的来源评估该声明。

来源详情: arxiv.org ↗

为什么这很重要

语言模型可以毫无根据地自信地产生流畅的答案。如果报告的结果成立,测量多个看似合理的预测分布的不确定性可以帮助系统识别需要验证、弃权或人工审查的答案,而在许多情况下不需要额外生成。

中心的实际问题不仅仅是语言模型是否能够回答问题,而是它是否能够区分知识和不确定性。当用户将信心视为证据时,流畅但不正确的答案可能比明确拒绝更危险。该论文提出的信任表示通过保留基于适配器的预测之间的分歧来解决该问题。如果该方法能够推广,它可以为开发人员提供模型端信号,用于决定何时直接回答、请求验证、将问题路由到另一个系统或让人员参与。

报告的选择性预测结果与部署特别相关,因为选择性系统不需要回答每个问题。如果系统能够保持高精度,同时只覆盖它认为得到充分支持的情况,那么在错误带来重大成本的情况下可能会更有用。在该数据集和配置中,OpenBookQA 报告的 99.0% 准确率和 80% 覆盖率令人鼓舞,但它应该被理解为论文结果,而不是部署系统将实现相同性能的证据。摘要没有指定示例的数量、比较方法或覆盖范围的操作定义。

CTC 无需额外生成的主张对于推理设计也可能很重要。许多不确定性技术依赖于产生多个完成,这会增加计算量和延迟。消息人士称,CTC 结合了几个与不确定性相关的量,无需额外生成,而 SCC 明确使用采样完成。这种区别为论文提供了一个具体的工程视角:一个分数的应用成本可能更低,而另一个分数则可以更直接地捕捉语义分歧。然而,摘要并未量化 LoRA 整体本身的成本,因此总体服务权衡仍然未知。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

接下来看什么

目前的结果是作者报告的预印本评估,而不是独立建立的性能发现。所提供的摘要中仍然无法提供重要的细节,包括完整的 ARC-Challenge 结果、准确的基线、计算开销以及该方法在测试模型和数据集之外的迁移情况。

第一个问题是所报告的收益是否能够独立复制。来源为2026年8月24日提交的arXiv预印本,提供的材料仅包含摘要。因此,结果是作者的主张,而不是独立验证的事实。后续审查应检查完整的表格、基线、置信度定义、统计变化,以及报告的优势在所有四个数据集和所有三个模型系列中是否一致。

摘要中的 ARC-Challenge 句子不完整:它说具有 Csem 置信度的 CLLM 实现了结果,但没有提供价值。缺失的信息限制了与完整 OpenBookQA 声明的比较,并妨碍了对该方法的推理性能的全面评估。该论文还报告了幻觉检测结果,在大多数情况下与最佳 AUROC 的误差在 1.5 个百分点以内,但所提供的来源并未确定绝对分数、最佳竞争方法或例外情况。

部署问题同样重要。该论文使用了 LoRA 适配器的集合,并且摘要没有说明需要多少个适配器、它们是如何训练的,或者它们增加了多少内存和推理时间。它还仅评估三个命名语言模型和四个问答数据集。目前尚不清楚这些分数是否适用于较长的对话、开放式生成、多语言输入、特定领域的任务或测试大小和架构范围之外的模型。在这些问题得到解答之前,CLLM 最好被视为一种有前途的不确定性测量研究方法,而不是高风险使用的经过验证的保障措施。

相关指南和测验

ChatGPT 与大语言模型人工智能模型解释AI 伦理人工智能培训测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?