语言人工智能指南

深度的混合

深度混合 (MoD) 让转换器在不同的令牌上花费不同的计算量,通过每层的繁重计算仅路由“重要”令牌。

阅读时间:2分钟最后更新

概述

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

深入探讨

标准转换器将每一层应用于每个标记,甚至是诸如标点符号之类的琐碎标记。 Mixture of Depths 由 Google DeepMind 在 2024 年引入,在每个块添加一个小型路由器,选择固定的 top-k 部分令牌来进行完整的自注意力和 MLP 计算;其余的通过剩余连接跳过该块。由于每层仅处理 k 个令牌,因此总计算量 (FLOP) 受到限制并提前已知,这与早期不可预测变化的动态深度方法不同。这使得批处理和硬件利用更加高效。经过 MoD 训练的模型可以在每次前向传递中使用更少的 FLOP 来匹配基线变压器的质量,或者在相同的计算下达到更高的质量,并且这个想法可以与专家混合自然地组合,以提供在深度和宽度上路由的“MoDE”模型。

技术洞察

在每个 MoD 块中,学习的线性路由器对每个标记进行评分,并按分数保留前 k 个标记;选定的令牌通过注意力和 MLP,而未选定的令牌则通过剩余路径不变地继续前进。使用固定的 top-k(而不是每个令牌阈值)使计算图静态且张量形状恒定,这是硬件友好的。路由器与网络的其余部分一起进行训练,并且因果生成使用辅助预测器,因此路由决策不会窥视未来的令牌。

战略影响

速度与规模

语言工作流程可以在不牺牲一致性的情况下更快地移动。

交通与覆盖范围

它扩展了跨语言和沟通方式的访问。

更清晰的判决

团队可以花更多时间进行判断,而自动化则可以处理重复。

深度混合的未来

随着模型规模的扩大,条件计算是提高效率的主要杠杆,而 MoD 就是一个早期的、干净的例子。期望与专家混合(深度和专家路由)进行更深入的集成,为简单输入而缩小的自适应预算,以及更好地识别哪些令牌真正需要深度处理的学习路由器。由于推理成本在部署经济中占主导地位,让模型仅在需要时“更努力地思考”,同时保持可预测延迟的技术可能会成为大规模架构中的标准。

现实世界的实施

通过跳过填充标记的深度计算来减少处理长文档所需的 FLOP

以较低的计算量训练与基线质量相匹配的模型,从而降低服务成本

与专家混合 (MoDE) 相结合,在层深度和专家选择上进行路由

保持每个令牌的可预测、固定延迟,因为每层计算预算是提前固定的

风险与防护栏

幻觉的事实可以悄悄地进入报告、支持流程或研究成果。

及时的敏感性可能会在类似的请求中产生不一致的结果。

如果访问控制薄弱,敏感文本数据可能会暴露。

实施路线图

1

在推出之前定义输出格式、语气和质量标准。

2

当准确性很重要时,请使用可信来源进行地面响应。

3

为高风险输出保留人工审查检查点。

4

跟踪故障模式并定期重新训练提示或工作流程。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

混合代理聚合

常见问题

What is Mixture of Depths?

深度混合 (MoD) 让转换器在不同的令牌上花费不同的计算量,通过每层的繁重计算仅路由“重要”令牌。它降低了处理简单令牌的成本,同时保持固定、可预测的计算预算。

不同代币的深度混合有何不同?

MoD 仅通过每一层的繁重计算路由一些令牌,因此不同的令牌有效地获得不同的深度。

MoD 如何保持其计算预算可预测?

每个区块选择固定的 top-k 代币可以限制 FLOP 并保持张量形状不变,这是硬件友好的。

路由器在给定块中未选择的代币会怎样?

未选择的令牌绕过块的计算,并由剩余路径原封不动地继续前进。

谁介绍了深度混合?

深度混合是由 Google DeepMind 在 2024 年关于动态变压器计算的论文中引入的。

将 MoD 与 Mixture-of Experts 结合起来会产生什么结果?

将深度路由与专家路由相结合产生“MoDE”模型,该模型可以在层和专家上进行计算。