技術指南

混合模型和稀疏模型

Mixtral 是 Mistral AI 的開放式專家混合模型,能夠以小模型速度提供大模型品質。

閱讀時間約2分鐘最後更新

概述

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

深入探討

Mistral AI 在 2023 年底發布的 Mixtral 8x7B 推廣了開放模型中的稀疏專家混合 (MoE) 方法。它每層包含八個獨立的「專家」前饋網絡,總參數約 470 億個,但輕量級路由器僅為每個令牌選擇兩名專家。因此,每個令牌只有大約 130 億個參數處於活動狀態,因此推理運行速度與 13B 密集模型一樣快,同時達到與更大模型相當的品質。 Mixtral matched or beat GPT-3.5 and Llama 2 70B on many benchmarks while being faster and cheaper to serve. Mistral 后来发布了 Mixtral 8x22B。該模型在 Apache 2.0 下公開許可,促進了開源社群的快速採用和微調。

技術洞察

在稀疏 MoE 層中,密集前饋塊被 N 個專家網路加上一個小型門控網路(路由器)取代。對於每個令牌,路由器計算分數並選擇前 k 個專家(Mixtral 中的前 2 個),僅透過這些專家路由令牌。它們的輸出被加權並求和。由於大多數專家在每個令牌上都處於空閒狀態,因此該模型在記憶體中保存了許多參數,但計算量卻少得多。權衡:所有專家都必須加載到 VRAM 中,即使只有一些專家運行。

戰略影響

成本與預算

多年來,架構決策決定著效能和營運成本。

更明確的決策

技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。

品質管控

更好的工程選擇可以減少生產中的可靠性事故。

混合模型和稀疏模型的未來

稀疏 MoE 現在是前沿人工智慧的核心。預計會有更多開放的 MoE 版本、與許多小型專家一起進行更細粒度的路由,以及可進一步提高效率的共享或混合專家設計。隨著模型擴展到數萬億個總參數,稀疏性是保持推理負擔得起的主要槓桿。研究正在解決 MoE 的弱點、專家之間的負載平衡、記憶體開銷和訓練穩定性,而硬體和服務堆疊越來越多地專門針對專家路由進行最佳化。

現實世界的實施

以更小的密集模型的成本和速度提供高品質的聊天機器人

自託管商業產品的 Apache-2.0 授權模型,無需使用費

微調 Mixtral 上的個人行為以進行編碼、摘要或多語言任務

在單一多 GPU 伺服器上執行快速推理,其中 70B 密集模型會太慢

風險與防護欄

優化一項基準測試可以隱藏更廣泛的系統弱點。

基礎設施和維護成本常常被低估。

隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。

實施路線圖

1

在實施之前定義延遲、品質和成本目標。

2

在實際負載和資料條件下進行基準測試。

3

儀器監控錯誤、漂移和使用者影響。

4

在擴展之前準備回滾和事件回應路徑。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

模型和管道並行性

常見問題

What is Mixtral and Sparse Models?

Mixtral 是 Mistral AI 的開放式專家混合模型,能夠以小模型速度提供大模型品質。像它這樣的稀疏模型只激活每個令牌的一小部分參數,在不犧牲能力的情況下減少計算量。

在 Mixtral 8x7B 中,有多少專家處理每個單獨的代幣?

Mixtral 使用 top-2 路由:路由器選擇八個專家中的兩個來處理每個令牌。

哪個元件決定將令牌發送給哪些專家?

一個稱為路由器的小型門控網路對專家進行評分並選擇處理每個令牌的專家。

儘管 Mixtral 8x7B 總共有大約 47B 個參數,但每個代幣大約有多少個活躍參數?

因為每個代幣只有兩名專家運行,所以大約有 130 億個參數處於活動狀態,這使其速度比一個小得多的模型要快。

像 Mixtral 這樣的稀疏 MoE 模型的關鍵權衡是什麼?

MoE 節省了每個代幣的運算量,但仍要求所有專家都保存在 VRAM 中,增加了記憶體需求。

Mistral AI 在哪個許可下發布了 Mixtral,推動了開放採用?

Mixtral 是在寬鬆的 Apache 2.0 許可證下發布的,允許免費商業使用和微調。