技術指南

條件計算中的門控和路由

門控和路由讓神經網路僅啟動每個輸入所需的部分,而不是每次都運行整個模型。

閱讀時間約2分鐘最後更新

概述

This decouples model size from compute cost, enabling enormous models that stay fast and cheap to run.

深入探討

條件計算意味著網路根據資料做出有關使用哪些子模組的決策。一個小型的學習「門控」或「路由器」網路會查看每個輸入(通常是每個令牌)並產生分數,選擇將其發送給哪些「專家」。在專家混合 (MoE) 層中,存在數十或數百個專家子網絡,但路由器僅選擇每個令牌的前一兩個專家子網絡,因此大多數專家對於任何給定輸入都保持空閒狀態。結果是一個總參數數量巨大但活動數量較少的模型,以小得多的運行時成本提供了巨型模型的表徵能力。這就是 Switch Transformer、GLaM 和許多前沿大型語言模型等模型如何以經濟實惠的方式擴展到數萬億個參數的方式。

技術洞察

路由器通常會計算專家的 softmax 並選擇 top-k,然後組合按門得分加權的輸出。負載平衡是一個挑戰:路由器往往偏好少數專家,而讓其他專家未經訓練。因此,訓練增加了輔助負載平衡損失以均勻分佈令牌,以及丟棄或重新路由溢出令牌的容量限制。由於 top-k 選擇是離散且不可微的,因此梯度僅流經所選專家及其門權重。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

條件計算中門控和路由的未來

稀疏門控現在是擴展前沿模型的核心,趨勢是朝向更細緻的專家、更智慧的路由器和多層路由發展。期望更好的技術來實現穩定的訓練,當專家分佈在許多加速器上時減少通訊開銷,以及「專家專業化」分析以了解每個專家學到了什麼。條件計算也從 MoE 擴展到早期退出網路和動態深度模型,這些模型僅在更困難的輸入上花費更多計算。

現實世界的實施

Switch Transformer 將每個代幣路由到單一專家,擴展到超過一兆個參數,同時保持每個代幣的計算量較低。

使用專家混合層的前沿大型語言模型,因此每個令牌僅啟動一小部分權重。

提前退出的影像分類器在處理簡單影像時停在淺層,僅在處理困難影像時才運行更深的層。

多語言模型,其路由器學習將不同語言的令牌發送給不同的專業專家。

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Gating and Routing in Conditional Computation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

LLM 推理路由與負載平衡

常見問題

What is Gating and Routing in Conditional Computation?

門控和路由讓神經網路僅啟動每個輸入所需的部分,而不是每次都運行整個模型。這將模型大小與計算成本分離,從而使大型模型能夠保持快速且廉價的運行速度。

條件計算背後的主要想法是什麼?

條件計算對要運行的子模組進行資料相關的選擇,因此大多數網路對於任何給定的輸入都可以保持空閒狀態。

在混合專家層中,路由器的作用是什麼?

路由器是一個小型學習網絡,對專家進行評分並將每個令牌發送給前 k 個專家,而其餘的則不用於該令牌。

為什麼 MoE 模型的總參數數量龐大,但活躍數量卻很少?

由於每個令牌僅啟動一兩個專家,因此運行時計算僅反映這些專家,即使模型儲存更多專家。

輔助負載平衡損耗可以解決什麼問題?

路由器自然傾向於將大部分代幣發送給少數受歡迎的專家;負載平衡損失鼓勵均勻分佈,以便所有專家都得到培訓。

為什麼 top-k 專家選擇對於基於梯度的訓練是一個挑戰?

選擇前 k 位專家是一個艱難的、離散的決定;梯度只能透過實際選擇的專家及其門權重傳播。