專家薈萃
專家混合 (MoE) 是一種模型設計,它將網絡分成許多專門的子網絡,並且每個輸入僅激活幾個子網絡。
概述
它讓模型掌握大量知識,同時保持每次預測快速且便宜。
深入探討
標準變壓器透過相同的密集層運行每個輸入,因此使模型更聰明通常意味著使每個計算更加昂貴。專家的混合打破了這種聯繫。它用許多較小的「專家」網路以及一個決定哪些專家處理每個代幣的小型「路由器」取代了大型前饋層。通常只有前 1 或 2 位專家會觸發,因此模型可以擁有數千億個總參數,但每個令牌僅啟動一小部分。這就是為什麼像 Mixtral 8x7B 這樣的模型和傳聞中的 GPT-4 架構能夠在沒有相應高推理成本的情況下達到高品質。權衡是複雜性:所有專家仍然必須適合內存,並且路由器可能會錯誤路由或過載某些專家,因此訓練需要仔細平衡。
技術洞察
MoE 的核心是門控網絡,這是一個小型學習層,它對每個專家的傳入令牌進行評分,並將令牌路由到前 k 個最高得分者(通常 k=1 或 2)。為了阻止路由器將所有內容發送給一些最喜歡的專家,訓練添加了輔助“負載平衡損失”,以懲罰不均勻的使用。由於每個代幣只有 k 個專家運行,因此即使添加更多專家,計算(FLOP)也大致保持不變,因此總參數和每個代幣成本獨立擴展。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
專家混合的未來
MoE 正在成為前沿規模模型的預設工具,因為它將容量與成本脫鉤。期望有更細粒度的專家、考慮更多上下文的更聰明的路由,以及在有限的硬體上為巨大的稀疏模型提供更好的技術。研究也正在解決記憶體問題,因為即使很少有專家運行,也必須透過專家卸載和量化來載入所有專家。隨著 Mixtral 和 DeepSeek-MoE 等開放式模型的成熟,稀疏架構可能會在更小的 GPU 預算上提供更有效率的助理。
現實世界的實施
Mixtral 8x7B 使用 8 個專家,每個令牌啟動 2 個專家,總共提供大約 47B 個參數,但每個令牌只有約 13B 個活躍參數,以實現更快、更便宜的推理。
DeepSeek 和 Qwen 提供了大型 MoE 語言模型,可在基準測試中匹配密集模型,同時以較低的每個代幣計算運行。
雲端 LLM 提供者使用 MoE,因此一個龐大的模型可以經濟實惠地為許多用戶提供服務,因為每個請求只能滿足少數專家的需求。
Google 的早期 Switch Transformer 使用 top-1 路由擴展到超過一兆個參數,以維持訓練運算的可管理性。
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mixture of Experts quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
什麼是專家混合?
專家混合 (MoE) 是一種模型設計,它將網絡分成許多專門的子網絡,並且每個輸入僅激活幾個子網絡。它讓模型掌握大量知識,同時保持每次預測快速且便宜。
在專家混合層中,什麼決定哪些專家處理給定的代幣?
一個小型門控網路學習對每個專家的令牌進行評分,並將其路由給得分最高的專家。路由是學習的,不是固定的或隨機的。
為什麼 MoE 模型的總參數比密集模型多得多,而每個代幣的成本卻沒有相應增加?
因為只有前 k 個專家才會觸發每個代幣,所以即使總參數計數因添加更多專家而增加,活動計算也大致保持不變。
MoE 訓練期間負載平衡(輔助)損失解決什麼問題?
如果沒有平衡,路由器往往會偏向少數專家。輔助損失會懲罰不均勻的使用,因此所有專家都會接受訓練。
Mixtral 8x7B 每個代幣都會啟動 8 個專家中的 2 個。這對於它的計算量和大小意味著什麼?
由於 8 個專家中只有 2 個處於活動狀態,每個代幣的活動參數 (~13B) 遠小於總的~47B,從而降低了推理成本。
與同等能力的密集模型相比,MoE 模型的真正缺點是什麼?
儘管只有少數專家計算每個令牌,但每個專家的權重都必須載入到記憶體中,這使得 MoE 模型需要大量記憶體才能提供服務。