返回新闻
创新AI Understanding 简报

前瞻性研究发现,由于临床注册问题不明确,法学硕士的准确性急剧下降

一项多站点前瞻性研究报告称,从未处理的医疗记录中提取信息时,大型语言模型与人类共识答案的匹配率为 87%,但在需要事件计时和更多临床推理的问题上,准确率下降至 62%。

5 min readRead the primary source
Source-page capture accompanying Prospective study finds LLM accuracy falls sharply on ambiguous clinical registry questions
主要来源文件来源记录
出版商
arxiv.org
来源链接
arxiv.orghttps://arxiv.org/abs/2608.20373
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

大语言模型(LLM)
在海量文本语料库上训练来生成和分析文本的语言模型。
地面真相
用于训练或评估模型输出的可信参考标签。
测试一下自己AI 模型解释测验

发生了什么

研究人员使用来自两个美国心脏病学会国家心血管数据注册设置的未处理电子病历数据评估了临床注册抽象的大型语言模型。该研究根据模糊性和回答这些问题所需的临床推理,将登记问题分为六类。

该论文于 8 月 25 日在 arXiv 上进行了修订,报告了一项试点研究和一项验证研究,涉及美国心脏病学会国家心血管数据登记处的临床登记问题。在学术医疗中心的试点中,该模型确定了每个注册问题的候选数据源。然后,经验丰富的抽象者使用这些结果来定义特定于问题的文档集。在第二个中心的验证研究中,使用第二个 ACC NCDR 注册中心,该模型回答了这些集合中的问题。该设计将评估重点放在从现有病历材料中提取和解释信息,而不是简化的预选数据表上。

在审查模型输出之前,两名抽象者独立建立了基本事实,并将每个问题分配给六个类别之一:药物/事件标记、二元临床存在、管理、定量实验室/生理、临床解释和事件计时。这些类别是根据解决每个问题所需的模糊性和临床推理来排序的。该论文报告了 9,430 个摘要答案,已调整为 4,715 个共识答案,其中包括 501 个试点答案和 4,214 个验证答案。在试点中,候选数据源的平均数量范围从人口统计数据的 14.6 个到历史和风险因素的 89.2 个,报告的标准差反映了巨大的变化。

根据该研究,在验证中,人类评估者之间的一致性约为 98%。 LLM 的答案在 87% 的情况下与共识完全一致,在 2% 的情况下被归类为部分匹配,在 9% 的情况下不匹配。该论文报告了 157 个问题的平均问题级准确率为 91.5%,标准差为 13.4%,每个问题至少有 20 个答案。准确度因模糊类别而异,从药物/事件标记问题的 96% 下降到事件计时问题的 62%。消息来源将该研究确定为预印本,但没有在摘要中命名评估的模型。

来源详情: arxiv.org ↗

为什么这很重要

结果表明,平均准确度可以掩盖医疗保健人工智能的重要弱点。该模型在相对直接的药物和事件标记问题上表现最佳,在必须解释临床背景或确定事件发生时间时表现最差。

核心发现不仅仅是法学硕士犯了错误。随着问题变得更加模糊并且需要更多的临床推理,成绩会以结构化的方式下降。因此,91.5% 的总体准确度数字可能无法完整地反映操作风险。包含许多简单字段的注册工作流程可能看起来很可靠,但在需要重建上下文、解释临床证据或及时放置事件的较小问题集上仍然表现不佳。

临床注册支持研究、质量测量、基准测试和其他形式的医疗保健报告。即使系统没有做出诊断或治疗建议,抽象错误也会影响这些下游记录的质量。据报道,大约 98% 的人类一致性与模型较低的精确匹配率之间存在差距,这表明人类审查对于这项任务仍然很重要,特别是当答案取决于多个文档或解释事件顺序时。

该研究还提供了一种评估医疗保健语言模型的实用方法:根据问题所包含的歧义类型来划分问题,而不是将所有提取任务视为等效。这种方法可以帮助组织确定哪些领域适合援助,哪些领域需要更仔细的审查。消息来源并未表明该模型造成了患者伤害、改善了登记操作、降低了成本或被部署在日常护理中。这些结果仍未确定。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
交互式概念检查+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

接下来看什么

该研究并未确定这些发现是否可以推广到其他模型、医院、医学专业、登记处或临床决策。进一步的工作应该测试更广泛的设置,比较模型版本,检查部分错误的后果,并评估人工审查是否能够可靠地发现最严重的错误。

一个关键的未知数是结果的适用范围有多大。该消息来源描述了一个学术医疗中心的试点以及使用另一个 ACC NCDR 注册中心在第二个中心进行的验证,但它没有提供有关社区医院、其他专业、不同记录系统或其他注册设计的摘要证据。评估的模型也没有在摘要中标识。在得出关于 LLM 表现的总体结论之前,需要对模型和模型版本进行比较。

未来的评估应该报告的不仅仅是总体的精确匹配准确性。重要的问题包括部分答案在临床上是否可用、哪些类型的错误最常见、错误涉及日期或矛盾记录的频率以及审阅者是否能够一致地检测模型错误。该研究的类别级结果使事件计时成为一个特别重要的后续领域,但来源没有具体说明各个问题、错误示例或错误答案的严重程度。

尚不清楚试点中模型的候选源选择是否影响了后续的验证工作流程,或者当文档集不是由经验丰富的抽象者策划时是否会出现类似的性能。进一步的研究可以测试完全未经处理的记录、不同程度的人工协助以及实际登记操作中的前瞻性监控。在获得此类证据之前,研究结果支持对模糊抽象任务进行有针对性的人类监督,而不是得出法学硕士已准备好取代临床抽象器的结论。因此,当文档选择没有由经验丰富的摘要者指导时、当记录包含不同级别的结构时、或者当审阅者在不同点进入流程时,来源未公开相同的方法将如何执行。

相关指南和测验

人工智能模型解释AI 伦理人工智能培训ChatGPT 与大语言模型测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?