波束搜索
集束搜索是一种解码策略,它在每一步中保留几个最有希望的部分序列,而不是贪婪地致力于一个。
概述
它很重要,因为它能产出更高质量、更连贯的文本,用于翻译和摘要等任务,而不是每次都选出最合适的单词。
深入探讨
当语言模型生成文本时,它会预测下一个标记的概率,然后重复。贪婪解码总是采用单个最高概率的标记,但这可能会让你陷入困境——早期的局部最佳选择可能会导致整体更糟糕的句子。波束搜索通过维护前 k 个部分序列(“波束宽度”,通常为 4-10)来进行对冲。在每一步中,它都会用可能的下一个标记扩展每个波束,通过累积对数概率对所有候选者进行评分,并仅保留前 k 个。结果是得分最高的完整序列。它成为机器翻译的标准,并且在忠实、高概率的输出比创造力更重要的情况下仍然很常见。
技术洞察
集束搜索通过求和标记的对数概率对序列进行评分,这使其偏向于较短的序列(每个额外的标记都会添加一个负项)。为了解决这个问题,系统应用长度归一化,将分数除以序列长度(有时取幂)。较大的波束宽度可以探索更多的候选者,但会花费更多的计算成本,并且与直觉相反,有时会产生更乏味或退化的文本——这是神经机器翻译中有据可查的效果。
战略影响
速度与规模
语言工作流程可以在不牺牲一致性的情况下更快地移动。
交通与覆盖范围
它扩展了跨语言和沟通方式的访问。
更清晰的判决
团队可以花更多时间进行判断,而自动化则可以处理重复。
集束搜索的未来
对于开放式的创造性生成,束搜索越来越多地被采样方法(top-k、nucleus)所取代,因为束往往会产生重复的通用文本。但对于受限任务——翻译、语音识别、代码生成、结构化输出——集束搜索及其变体(多样化集束搜索、强制所需单词的受限集束搜索)仍然有价值。预计将继续采用混合方法,将波束式探索与采样相结合,再加上任务感知解码,根据忠实性或多样性是否优先考虑来调整策略。
现实世界的实施
神经机器翻译系统在许多候选短语中选择最流畅的句子翻译
自动语音识别根据声学模型概率解码最可能的转录本
图像字幕模型生成单个连贯的字幕,而不是随机的看似合理的字幕
使用约束束搜索强制特定关键字或术语出现在输出中的约束生成
风险与防护栏
幻觉的事实可以悄悄地进入报告、支持流程或研究成果。
及时的敏感性可能会在类似的请求中产生不一致的结果。
如果访问控制薄弱,敏感文本数据可能会暴露。
实施路线图
在推出之前定义输出格式、语气和质量标准。
当准确性很重要时,请使用可信来源进行地面响应。
为高风险输出保留人工审查检查点。
跟踪故障模式并定期重新训练提示或工作流程。
不断探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Beam Search quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常见问题
什么是Beam Search?
集束搜索是一种解码策略,它在每一步中保留几个最有希望的部分序列,而不是贪婪地致力于一个。这很重要,因为它可以为翻译和摘要等任务生成更高质量、更连贯的文本,而不是每次都选择一个最好的单词。
波束搜索中“波束宽度”(k) 控制什么?
波束宽度是每一步保留和扩展的顶部部分序列的数量;更大的宽度探索更多的候选者。
束搜索与贪婪解码有何不同?
贪婪解码每一步只取顶部的令牌;波束搜索通过同时跟踪几个有希望的序列来进行对冲。
为什么长度归一化常用于集束搜索?
每个额外的标记都会增加一个负对数概率,因此如果没有标准化,较短的序列得分就会不公平地更高。
集束搜索特别适合哪种任务?
当目标是单一准确、流畅的渲染时,束搜索表现出色,这就是它成为翻译标准的原因。
使用非常大的波束宽度进行开放式发电的已知缺点是什么?
与直觉相反,神经文本生成中更宽的光束通常有利于通用的、重复的序列,而不是有趣的序列。