技术指南

条件计算中的门控和路由

门控和路由让神经网络仅激活每个输入所需的部分,而不是每次都运行整个模型。

阅读时间:2分钟最后更新

概述

这将模型大小与计算成本分离,从而使大型模型能够保持快速且廉价的运行速度。

深入探讨

条件计算意味着网络根据数据做出有关使用哪些子模块的决策。一个小型的学习“门控”或“路由器”网络会查看每个输入(通常是每个令牌)并生成分数,选择将其发送给哪些“专家”。在专家混合 (MoE) 层中,存在数十或数百个专家子网络,但路由器仅选择每个令牌的前一两个专家子网络,因此大多数专家对于任何给定输入都保持空闲状态。结果是一个总参数数量巨大但活动数量较少的模型,以小得多的运行时成本提供了巨型模型的表征能力。这就是 Switch Transformer、GLaM 和许多前沿大型语言模型等模型如何以经济实惠的方式扩展到数万亿个参数的方式。

技术洞察

路由器通常计算专家的 softmax 并选择 top-k,然后组合按门得分加权的输出。负载平衡是一个挑战:路由器往往偏爱少数专家,而让其他专家未经培训。因此,训练增加了辅助负载平衡损失以均匀分布令牌,以及丢弃或重新路由溢出令牌的容量限制。由于 top-k 选择是离散且不可微的,因此梯度仅流经所选专家及其门权重。

战略影响

成本与预算

多年来,架构决策决定着性能和运营成本。

更清晰的判决

技术教育帮助团队选择正确的堆栈,而不仅仅是最新的堆栈。

质量控制

更好的工程选择可以减少生产中的可靠性事故。

条件计算中门控和路由的未来

稀疏门控现在是扩展前沿模型的核心,趋势是向更细粒度的专家、更智能的路由器和多层路由发展。期望更好的技术来实现稳定的训练,当专家分布在许多加速器上时减少通信开销,以及“专家专业化”分析以了解每个专家学到了什么。条件计算也从 MoE 扩展到早期退出网络和动态深度模型,这些模型仅在更困难的输入上花费更多计算。

现实世界的实施

Switch Transformer 将每个代币路由到单个专家,扩展到超过一万亿个参数,同时保持每个代币的计算量较低。

使用专家混合层的前沿大型语言模型,因此每个令牌仅激活一小部分权重。

提前退出的图像分类器在处理简单图像时停在浅层,仅在处理困难图像时才运行更深的层。

多语言模型,其路由器学习将不同语言的令牌发送给不同的专业专家。

风险与防护栏

优化一项基准测试可以隐藏更广泛的系统弱点。

基础设施和维护成本常常被低估。

随着系统变得更加复杂,安全性和可观察性差距可能会扩大。

实施路线图

1

在实施之前定义延迟、质量和成本目标。

2

在实际负载和数据条件下进行基准测试。

3

仪器监控错误、漂移和用户影响。

4

在扩展之前准备回滚和事件响应路径。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gating and Routing in Conditional Computation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

LLM 推理路由和负载平衡

常见问题

什么是条件计算中的门控和路由?

门控和路由让神经网络仅激活每个输入所需的部分,而不是每次都运行整个模型。这将模型大小与计算成本分离,从而使大型模型能够保持快速且廉价的运行速度。

条件计算背后的主要思想是什么?

条件计算对要运行的子模块进行数据相关的选择,因此大多数网络对于任何给定的输入都可以保持空闲状态。

在混合专家层中,路由器的作用是什么?

路由器是一个小型学习网络,对专家进行评分并将每个令牌发送给前 k 个专家,而其余的则不用于该令牌。

为什么 MoE 模型的总参数数量庞大,但活跃数量却很少?

由于每个令牌仅激活一两个专家,因此运行时计算仅反映这些专家,即使模型存储更多专家。

辅助负载平衡损耗可以解决什么问题?

路由器自然倾向于将大部分代币发送给少数受欢迎的专家;负载平衡损失鼓励均匀分布,以便所有专家都得到培训。

为什么 top-k 专家选择对于基于梯度的训练来说是一个挑战?

选择前 k 位专家是一个艰难的、离散的决定;梯度只能通过实际选择的专家及其门权重传播。