语言人工智能指南

迷失在中间效应

“迷失在中间”效应是指语言模型倾向于在长输入的开头或结尾时最好地使用信息,而忽略埋藏在中间的事实。

阅读时间:2分钟最后更新

概述

这很重要,因为它限制了我们对长上下文模型与检索文档的信任程度。

深入探讨

斯坦福大学的刘和同事在 2023 年进行的一项研究中发现,当向模型提供许多文档并要求模型使用包含关键事实的文档来回答时,就会出现这种效应。准确度形成了一条 U 形曲线:当相关段落位于提示的开头或结尾时,准确度最高,而当相关段落位于中间时,准确度明显较低。即使对于标榜具有长上下文能力的模型也是如此。对于检索增强生成来说,这意味着很明显:将数十个段落塞进提示中并不能保证模型均匀地读取它们。位置,而不仅仅是存在,决定了模型是否关注事实。这项工作将长上下文重新定义为有效使用的问题,而不是原始窗口大小的问题。

技术洞察

U 形曲线可能源于注意力和位置编码如何分配焦点。首要性和新近度偏差部分继承自训练数据结构和位置方案,给予早期和晚期标记额外的权重。一些解码器架构还通过层强烈传播早期令牌信息。最终结果是中间位置受到的关注被稀释,因此即使完全存在于上下文中,放置在那里的正确答案也可能被有效地忽略。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

迷失在中间效应的未来

研究人员正在通过注意力调整、位置感知训练和更智能的检索来解决这种影响,这些检索将最相关的段落重新排列到提示的边缘。评估套件现在包括跨职位的“大海捞针”测试,以衡量有效的背景。随着架构的改进,U 曲线正在变平,但从业者将继续设计管道,将关键证据放置在模型实际看起来的地方,而不是相信统一的注意力。

现实世界的实施

RAG 系统检索 20 个文档,但错过了答案,因为它落在 20 个文档中的第 10 个段落中。

工程师对搜索结果进行重新排序,将最相关的块放在提示的前面或最后。

长文档摘要者会低估合同中出现的关键细节。

“大海捞针”基准隐藏了不同深度的事实,以绘制模型的位置精度图表。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Lost in the Middle Effect quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

音效生成器

常见问题

什么是“迷失中间效应”?

“迷失在中间”效应是指语言模型倾向于在长输入的开头或结尾时最好地使用信息,而忽略埋藏在中间的事实。这很重要,因为它限制了我们对检索到的文档的长上下文模型的信任程度。

当关键事实在长提示中移动时,准确性会呈现什么形状?

当相关信息接近开头或结尾并在中间下降并形成 U 形时,准确性最高。

中间迷失效应对于检索增强生成意味着什么?

仅仅包含一段文字是不够的。它在提示中的位置会改变模型使用它的可能性。

哪些偏见被认为会导致这种效应?

对第一个和最后一个位置的额外关注,与位置编码和训练结构相关,产生了 U 曲线。

长上下文模型会自动避免这种影响吗?

研究发现,在作为长上下文销售的模型中存在这种效应,表明窗口大小并不能确保统一使用。

哪些实际步骤有助于抵消管道中的影响?

将最相关的证据放在开头或结尾附近,使其与模型最强烈参与的位置保持一致。