返回新闻
创新AI Understanding 简报

Preprint 为以金融为重点的 LLM 分析提出了一个可审计的框架

一篇新的arXiv预印本认为,判断使用大型语言模型的企业财务系统不仅应该根据答案的准确性来判断,还应该根据每个主张是否可以追溯到权威证据来判断。它提出的框架提高了 145 个问题评估中的引文可追溯性,同时产生……

5 min readRead the primary source
Source-page capture accompanying Preprint proposes an auditable framework for finance-focused LLM analytics
主要来源文件来源记录
出版商
arxiv.org
来源链接
arxiv.orghttps://arxiv.org/abs/2608.20661
来源类型
主要文件——我们直接阅读的官方公告、文件、文件或第一方页面。
背景60 秒内了解这一点

从这里开始

关键术语

大语言模型(LLM)
在海量文本语料库上训练来生成和分析文本的语言模型。
RAG(检索增强生成)
一种检索外部知识并在推理时将其输入生成的方法。
置信区间
可能包含测量模型指标的真实值的统计范围。
测试一下自己ChatGPT 和法学硕士测验

发生了什么

新的 arXiv 预印本提出了知识驱动分析框架,这是一种基于本体的方法,使企业财务中的大型语言模型分析更易于审计。该系统将关系类型、置信信息和源沿袭附加到检索到的事实。

该论文于 8 月 21 日提交给 arXiv,描述了用于企业财务中检索增强生成的知识驱动分析框架 (KDAF)。它声称的重点是财务规划和分析以及其他受监管的工作流程,用户需要在事后确定答案的来源。该框架通过六个迭代阶段构建了一个本体驱动的知识系统,并使用了一种称为上下文感知相关性传播(CARP)的检索方法。

根据该论文,每个检索到的事实都携带三种信息:其关系类型、置信度值和源沿袭。目的是使证据结构明确,而不是将检索到的段落视为无差别的上下文窗口。该论文还表示,作者存放了配置、本体模式、提示、审计报告和重建脚本,尽管此处提供的来源并未独立验证该工件或描述其可用性。

该评估使用了 FinanceBench 中的 145 个问题,并将 KDAF 与零上下文推理、BM25 检索、概念加权词汇检索和无根据图遍历进行了比较。该论文报告称,零上下文推理的正确率达到了 4.1%,而检索增强条件的正确率达到了大约 10% 到 12%。这支持了狭义的结论,即检索证据对于该测试很重要,但并不能证明 KDAF 对于每项财务任务都具有广泛的优势。

主要结果是答案正确性和可审核性之间的分离。该论文报告称,KDAF 和 BM25 在答案正确性方面在统计上无法区分,报告的差异为 -0.007,95% 置信区间为 -0.021 至 0.000。然而,在引文可追溯性 F1 上,KDAF 得分为 0.515,超过无根据遍历 0.027,超过 BM25 0.052,置信区间排除了零。该论文进一步报告称,426 个图结构检索项目中没有一个来自问题主题实体之外,而词汇基线的这一比例为 16.8% 和 20.2%,并且每个选定的项目都解析为完整的来源链。

来源详情: arxiv.org ↗

为什么这很重要

该论文解决了在财务规划和分析以及其他受监管的工作流程中使用语言模型的实际障碍:如果无法重建其证据,答案可能很流畅但无法使用。结果表明,即使答案准确性没有提高,可审核性也可以提高。

对于尝试语言模型的组织来说,实际问题很熟悉:系统可以产生合理的财务解释,而无需为审计师提供返回基础记录的可靠路径。在受监管或对财务有重大影响的工作中,这种弱点会影响审查、纠错、问责制以及解释产出如何产生的能力。因此,本文将可追溯性视为一种独特的系统属性,而不是假设更好的检索自动意味着更好的答案。

报告的发现对常见的评估捷径提出了挑战。如果主要通过答案准确性来比较系统,那么本文中的结构化方法将无法清楚地证明其在测试基准上增加的复杂性是合理的。其报告的准确性在统计上与 BM25(一种更简单的词汇检索方法)相似。相反,所声称的优势在于证据追踪:保留实体关系和出处可能会使输出更易于检查,即使这并不会使它们在事实上更加正确。

这种区别对于决定围绕企业人工智能构建多少基础设施的团队来说可能很重要。为来源而设计的检索系统可以帮助审阅者识别声明的来源和范围,检测属于错误实体的证据并重建模型使用的材料。这些功能在财务方面可能很有价值,但消息来源并未表明 KDAF 减少了财务损失、缩短了审计时间、改进了决策或通过了正式的合规评估。

该论文还对将结构化检索视为通用准确性解决方案提出了有用的警告。它自己的负面结果表明,本体论基础在可审计性轴上赢得了报告的成本,而不是在答案正确性上。这使得研究与采购和治理决策相关:组织可能需要根据无法验证的输出的后果来选择系统,同时单独测试实际性能、覆盖范围、延迟、维护要求和总成本。

Interactive Mechanism

互动机制:它实际上是如何运作的

以交互方式探索这一发展背后的基础技术。

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
交互式概念检查+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

接下来看什么

该工作是作者报告的预印本评估,而不是生产部署或监管接受的证据。后续测试应检查更大、更多样化的财务数据集、不断变化的源文档、真实用户工作流程、运营成本以及人工审计员是否可以可靠地使用出处信息。

迫在眉睫的问题是,所报告的可追溯性优势是否能够在包含 145 个问题的 FinanceBench 评估之外继续存在。未来的工作应该测试更多的公司、报告期间、会计背景、文档格式和问题类型,包括涉及不明确实体或不完整记录的问题。该消息来源并未确定当权威消息来源不同意、包含错误或在生成答案后发生更改时 KDAF 如何执行。

文物沉积物可以使作品更容易复制,但其实际价值仍然未知。目前尚不清楚重建脚本是否在普通企业环境中运行、需要多少人工本体构建、知识体系的更新频率如何。这些细节将决定该方法是财务团队的可用控制还是主要是研究原型。

运营权衡也需要衡量。该来源不提供部署成本、响应时间、存储要求、模型详细信息、人员需求或与其他保留来源的检索系统的比较。它还没有显示报告的置信值是否经过校准,用户是否正确理解它们,或者完整的来源链是否保证引用的证据实际上支持生成的主张。

最后,本文是预印本,并介绍了作者自己评估的结果。没有证据表明独立复制、生产采用、监管认可或改善的现实世界财务结果的来源。最有意义的下一个证据将是对源数据进行受控更改的独立测试、人工审计研究以及对出处信息是否有助于审阅者发现错误、不完整或实体不匹配的模型输出的评估。

相关指南和测验

ChatGPT 与大语言模型人工智能模型解释AI 伦理人工智能培训测试你所知道的——尝试免费的人工智能测验在我们的词汇表中查找人工智能术语关注 AI 模型发布跟踪器
觉得这有用吗?