技术指南

推测性 RAG 和检索增强起草

推测性 RAG 通过让一个小型、快速的模型从检索到的文档中起草多个候选答案,然后由更大的模型进行验证,来加速和锐化检索增强的生成。

阅读时间:2分钟最后更新

概述

It matters because it cuts latency and reduces the confusion large models suffer when stuffed with many long passages.

深入探讨

经典 RAG 将所有检索到的文档输入到一个大语言模型中,这种模型速度很慢,并且当上下文很长时容易失去焦点。投机性的 RAG 会分割工作。一个较小的、专门的“起草者”模型会获得检索到的文档簇,并并行生成多个候选答案,每个答案都基于不同的证据子集并附有理由。然后,一个更大的“验证者”模型对这些草稿进行评分并选择最好的一份,而不是自行阅读所有文档。由于小模型处理繁重的阅读,而大模型仅判断短稿,因此系统速度更快,而且通常更准确。聚类步骤确保草稿涵盖不同的观点,而不是冗余的段落。

技术洞察

检索到的文档根据内容相似性进行聚类,然后从每个聚类中采样一个文档以形成不同的、非冗余的子集。轻量级起草者并行生成一个答案以及每个子集的基本原理。验证者通过结合草稿的自洽性、理由的条件概率和自我反思信号来计算置信度分数,然后选择得分最高的草稿。这种分工反映了推测性解码:廉价的并行提案,一项权威检查。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

推测性 RAG 和检索增强起草的未来

推测性 RAG 指向模块化检索系统,其中小型蒸馏起草器按域进行调整,并在共享验证器后面进行交换。期望与代理管道、基于问题难度的自适应草稿数量以及也标记证据不足的验证器进行更紧密的集成。随着上下文窗口的增长,价值从塞入更多文本转变为智能地并行化证据推理,使得起草和验证架构成为扎根问答的默认架构。

现实世界的实施

医疗问答助理,小型起草者并行阅读集群临床指南,大型模型验证最安全、最受支持的答案。

一个企业搜索机器人,可以从不同的文档集群中起草多个候选答案,以减少长知识库上的响应延迟。

一种法律研究工具,根据不同的判例法子集生成相互竞争的解释,然后用验证者模型对它们进行排名。

客户支持系统提炼出特定领域的起草者来处理产品手册,而通用验证者则确保事实依据。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative RAG and Retrieval-Augmented Drafting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Self-RAG 和反射检索

常见问题

What is Speculative RAG and Retrieval-Augmented Drafting?

推测性 RAG 通过让一个小型、快速的模型从检索到的文档中起草多个候选答案,然后由更大的模型进行验证,来加速和锐化检索增强的生成。这很重要,因为它可以减少延迟并减少大型模型在填充许多长段落时所遭受的混乱。

在 Speculative RAG 中,较小的模型扮演什么角色?

轻量级“起草者”读取聚集的文档子集并并行生成几个有根据的候选答案。

为什么检索到的文档在起草之前会聚集在一起?

对每个簇的一份文档进行聚类和采样,为每份草稿提供了独特的、不重叠的证据片段,鼓励多样化的答案。

更大的“验证者”模型主要做什么?

验证者不是亲自阅读所有文档,而是评估简短的草稿和基本原理,并选择得分最高的答案。

与标准 RAG 相比,推测 RAG 如何减少延迟?

昂贵的大型模型不再摄取所有长段落;它只验证简短的草稿,而并行起草则负责阅读。

推测性 RAG 的“先草稿后验证”结构在概念上类似于哪种解码技术?

两者都使用来自小模型的廉价并行提案,然后来自较大模型的权威检查。