语言人工智能指南

文档分块策略

文档分块是指在嵌入长文本进行搜索或 RAG 之前将其分割成可检索的片段的方法。

阅读时间:2分钟最后更新

概述

块的大小和边界悄悄地决定了检索质量,因此正确地选择它们通常比选择更高级的模型更重要。

深入探讨

分块将大文档变成适合嵌入模型并与提问方式保持一致的小段落。固定大小的分块按标记或字符数进行分割,通常有重叠,因此跨越边界的句子不会被孤立。递归分块沿着分隔符的层次结构(段落,然后是句子,然后是单词)进行分割,以尊重自然结构。语义分块通过嵌入相似性来对句子进行分组,打破主题的转移。文档感知分块遵循格式本身,根据 Markdown 标题、HTML 标签或代码函数进行拆分。核心张力是粒度:小块提供精确匹配,但会丢失周围的上下文,而大块则承载上下文,但会削弱相关性,并且可能会超出令牌限制。许多管道存储小块以供检索,但将扩展的父段落提供给模型。

技术洞察

重叠是最简单的可靠性技巧:在相邻块之间重复大约 10% 到 20% 的标记可确保跨边界分割的事实在至少一个块中仍然完好无损。语义分块更进一步,嵌入每个句子并测量邻居之间的余弦距离,然后在距离峰值高于阈值的地方进行切割。这会产生主题一致的可变长度块,但代价是在索引期间进行额外的嵌入计算。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

文档分块策略的未来

分块正在从固定的预处理步骤转向自适应和模型感知的步骤。像后期分块这样的方法首先嵌入整个文档,然后池化块向量,以便每个部分保留全局上下文。布局感知解析器越来越多地保留表格、标题和图形,而不是将它们扁平化为嘈杂的文本。随着上下文窗口的增长,一些管道检索更少但更大的块,但智能分块对于成本、延迟和精确定位仍然至关重要,而不是消失。

现实世界的实施

将 200 页的产品手册按章节标题分开,因此有关“保修条款”的问题只会检索该章节,而不是整本书。

使用句子重叠,这样跨越一个段落末尾和下一个段落开头的定义至少在一个块中保持完整。

从语义上对研究论文进行分块,使方法讨论和结果讨论成为独立的、主题连贯的段落。

按函数或类边界对代码库进行分块,以便开发人员的查询检索完整的、可运行的单元而不是半函数。

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Document Chunking Strategies quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

HyDE 假设文档嵌入

常见问题

什么是文档分块策略?

文档分块是指在嵌入长文本进行搜索或 RAG 之前将其分割成可检索的片段的方法。块的大小和边界悄悄地决定了检索质量,因此正确地选择它们通常比选择更高级的模型更重要。

为什么相邻块之间经常添加重叠?

重叠在邻居之间重复令牌切片,因此跨越分割的信息不会被切成两半并丢失。

语义分块使用什么来决定分割位置?

语义分块在邻居之间的余弦距离峰值处嵌入句子和中断,从而产生主题连贯的片段。

非常小的块和非常大的块之间的主要权衡是什么?

小块精确匹配,但会剥离周围的上下文,而大块会保留上下文,但会削弱相关性并达到标记限制。

递归分块如何决定在哪里中断文本?

递归分块沿着分隔符列表走下去,以尊重自然结构,同时保持在大小目标范围内。

“从小到大”或父文档检索模式背后的想法是什么?

您可以匹配小块以提高精度,然后扩展到周围的父文本,以便模型获得完整的上下文。