语言人工智能指南

最小贝叶斯风险解码

最小贝叶斯风险 (MBR) 解码选择与许多其他可能的输出最相似的输出,而不是单个最高概率的输出。

阅读时间:2分钟最后更新

概述

It optimizes for the quality metric you actually care about instead of raw likelihood.

深入探讨

标准解码追逐最可能的序列(MAP 估计),但最可能的句子通常不是人类或度量标准的最佳句子。 MBR 解码重新构建了目标:选择能够最小化预期“风险”的候选者,其中风险是 1 减去相对于模型其他可能输出的相似性度量(例如 BLEU、COMET 或 BERTScore)。在实践中,您对候选池进行抽样,然后为每个候选计算其与所有其他候选的平均相似度;平均一致性最高的候选人获胜。直观上,MBR 选择模型分布共同支持的共识输出,过滤掉侥幸心理。它在机器翻译和摘要方面取得了巨大的进步,尤其是与 COMET 等神经质量指标作为效用函数结合使用时。

技术洞察

形式上,MBR 在预期效用的候选者 E[u(候选者,参考)] 上选择 argmax,其中参考分布由采样假设近似。由于真实参考未知,因此同一采样池充当伪参考。成本是二次方的:成对比较 N 个候选者需要 O(N 平方) 度量调用,这就是高效 MBR 使用聚类、从粗到精的修剪或更便宜的效用估计器的原因。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

最小贝叶斯风险解码的未来

借助 COMET 和 MetricX 等学习指标,MBR 现在通常在翻译方面胜过波束搜索,因此研究重点是降低成本:基于置信度的候选修剪、重用计算以及通过蒸馏将 MBR 摊销到模型训练中,以便单个快速前向传递模仿 MBR 的选择。预计 MBR 式的共识选择会扩展到推理,对许多链进行采样并选择最一致的答案反映了相同的原则。

现实世界的实施

使用 COMET 作为实用程序从样本候选中选择最佳机器翻译

选择与其他抽样摘要最一致的摘要,以避免出现幻觉的异常值

推理中的自洽,选择最常见的样本答案(类似 MBR 的投票)

通过相互相似性对语音识别或字幕假设进行重新排序

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Minimum Bayes Risk Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

自一致性解码

常见问题

What is Minimum Bayes Risk Decoding?

最小贝叶斯风险 (MBR) 解码选择与许多其他可能的输出最相似的输出,而不是单个最高概率的输出。它针对您真正关心的质量指标而不是原始可能性进行优化。

MBR 解码选择什么而不是单个最可能的序列?

MBR 选择相对于模型的其他可能输出最大化预期效用(最小化风险)的候选者,而不是 MAP 候选者。

既然无法获得真正的引用,MBR 使用什么作为伪引用呢?

MBR 使用自己的抽样假设来近似参考分布,将每个候选者与池中的其他候选者进行比较。

为什么朴素 MBR 的计算成本很高?

对每个候选者与其他候选者进行评分呈二次方缩放,从而激励修剪和聚类以降低成本。

哪个实用指标使 MBR 对于机器翻译特别强大?

像 COMET 这样的神经指标与人类判断密切相关,并且将它们用作 MBR 实用程序通常会击败波束搜索。