混合搜索
混合搜索将关键字匹配与语义向量搜索混合在一起,因此系统可以捕获确切的术语和查询背后的含义。
概述
It matters because each method alone has blind spots, and combining them gives noticeably better retrieval for chatbots, RAG pipelines, and enterprise search.
深入探讨
混合搜索同时运行两个检索器。像 BM25 这样的稀疏检索器通过精确的单词重叠、术语频率和稀有性对文档进行评分,因此它可以确定特定的名称、代码和行话。密集检索器将查询和文档嵌入向量中,并通过余弦相似度查找邻居,即使措辞不同也能捕获含义。然后,通常使用倒数排名融合(RRF)来合并两个排名列表,该融合结合了位置而不是原始分数,因此不兼容的尺度可以很好地发挥作用。回报是稳健性:密集搜索处理释义和同义词,而稀疏搜索保证文字 SKU、错误代码或姓氏不会丢失。大多数生产 RAG 堆栈和搜索引擎现在默认采用某种混合配置。
技术洞察
稀疏和密集分数存在于不同的尺度上,因此您不能简单地将它们相加。倒数排名融合通过将每个文档评分为两个结果列表中 1/(k + 排名) 的总和来回避这一问题,其中 k 是接近 60 的常数。因为它使用排名位置而不是幅度,所以 RRF 调整轻且融合稳定。替代方案包括加权分数标准化和学习重新排序器,但 RRF 因其简单性仍然是流行的默认值。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
混合搜索的未来
预计混合搜索将成为静默默认设置,而不是配置选择,直接融入矢量数据库和搜索平台。像 SPLADE 这样的学习稀疏模型通过从神经网络生成可解释的术语权重来模糊稀疏与密集的界限。 ColBERT 和交叉编码器重新排序等多向量方法将越来越多地位于混合候选者之上,以挤出最终精度,而更便宜的嵌入使得在每个查询例程上运行两个检索器。
现实世界的实施
无论用户输入确切的错误代码“ERR_0x80070005”还是描述“安装时权限被拒绝”,客户支持 RAG 机器人都会检索正确的帮助文章。
当购物者搜索精确的型号以及输入诸如“旅行用安静笔记本电脑”之类的模糊短语时,电子商务搜索就会显示产品。
法律文件发现通过精确定义的术语查找合同条款,同时还提取措辞不同的语义相关条款。
公司内部知识库与“OKR-Q3”等员工首字母缩略词完全匹配,同时仍然回答“我们如何设定季度目标”等概念性问题。
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Hybrid Search quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
What is Hybrid Search?
混合搜索将关键字匹配与语义向量搜索混合在一起,因此系统可以捕获确切的术语和查询背后的含义。这很重要,因为每种方法都存在盲点,将它们结合起来可以为聊天机器人、RAG 管道和企业搜索提供明显更好的检索。
混合搜索通常结合哪两种检索方法?
混合搜索将 BM25 等稀疏词汇检索器与基于密集嵌入的向量检索器合并,以捕获准确的术语和含义。
为什么通常使用倒数排名融合 (RRF) 来合并结果?
稀疏和密集分数处于不同的尺度,因此 RRF 使用 1/(k+rank) 按排名位置进行融合,使其稳定,无需仔细进行分数归一化。
哪种情况最有利于混合搜索的稀疏(关键字)组件?
稀疏检索擅长精确标记匹配,例如语义模型可能会掩盖的 SKU、代码和专有名称。
单独使用密集向量搜索的主要弱点是什么?
密集搜索可以很好地捕捉含义,但可能会忽略精确的、罕见的字面术语,而这正是稀疏组件所补偿的地方。
像 SPLADE 这样的学习稀疏模型有什么作用?
SPLADE 使用神经网络来分配加权、扩展的术语重要性,连接传统的稀疏检索和密集语义方法。