语言人工智能指南

对比解码

对比解码通过从大而强的语言模型的倾向中减去小而弱的语言模型的倾向来生成更高质量的文本。

阅读时间:2分钟最后更新

概述

It amplifies what the expert knows and the amateur misses, reducing repetition and bland output.

深入探讨

当语言模型选择下一个单词时,它会生成其词汇表的概率。对比解码(由 Li 等人于 2022 年提出)在同一上下文中运行两个模型:一个大的“专家”和一个小的“业余”。它不相信专家的原始概率,而是根据专家的对数概率和业余爱好者的对数概率之间的差异对每个候选标记进行评分。专家青睐的代币,但业余爱好者却得不到提升;两个模特都喜欢的通用词(比如“the”或重复的短语)会被抑制,因为业余爱好者也喜欢它们。合理性过滤器首先丢弃专家认为不太可能的标记,因此对比永远不会促进无意义。与贪婪或核心采样相比,结果是更流畅、连贯、重复性更少的长文本,并且不需要额外的训练。

技术洞察

核心分数是 log p_expert(token) 减去系数乘以 log p_amateur(token)。因为业余爱好者共享专家的系统错误(偏爱高频标记、循环、简并重复),所以减去其对数概率可以消除这些共享的故障模式,同时保留真正的专家知识。自适应合理性约束仅使标记高于顶级专家概率的一小部分(α),从而防止对比放大罕见的、不连贯的单词。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

对比解码的未来

对比解码启发了一系列“推理对比”方法,包括 DoLa(对比模型自身的早期层和后期层以减少幻觉)以及与检索到的文档和没有检索到的文档进行对比的上下文感知变体。期望与检索、事实性评分和小业余爱好者精炼更紧密地集成,再加上与推测性解码的结合,以便业余爱好者既可以控制质量,又可以同时加速生成。

现实世界的实施

生成长的、非重复的故事或文章延续,其中核心采样陷入循环

将 65B 专家与 1.5B 业余爱好者配对,无需微调即可改进开放式生成

减少摘要和对话输出中的退化重复

作为 DoLa 式自我对比的基础,以降低事实幻觉

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Contrastive Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

最小贝叶斯风险解码

常见问题

What is Contrastive Decoding?

对比解码通过从大而强的语言模型的倾向中减去小而弱的语言模型的倾向来生成更高质量的文本。它放大了专家知道的和业余爱好者错过的东西,减少了重复和乏味的输出。

在对比解码中,小型“业余”模型扮演什么角色?

业余爱好者的对数概率从专家的对数概率中减去,从而消除了两个模型共有的系统错误(例如偏向频繁的标记)。

为什么减去业余爱好者的概率会减少重复和乏味的输出?

两种模型都倾向于过度偏爱高频和重复的标记;减去业余爱好者可以消除这种共同的偏见,从而降低乏味的选择。

自适应合理性约束有什么作用?

合理性过滤器会丢弃专家下的低概率标记,因此对比不会促进不连贯或无意义的单词。

对比解码中的评分公式大致是什么?

每个候选人的评分是专家的对数概率减去加权业余对数概率,奖励专家独特喜欢的代币。

后面哪种方法将对比思想扩展到单个模型自己的层?

DoLa 将模型的早期(早期层)和成熟(晚期)预测进行对比,以减少幻觉,在一个模型中应用对比概念。