テクニカルガイド

混合モデルと疎モデル

Mixtral は、小規模モデルの速度で大きなモデルの品質を実現する、Mistral AI のオープンな専門家混合モデルです。

2分の読書最終更新日

概要

Sparse models like it activate only a fraction of their parameters per token, cutting compute without sacrificing capability.

ディープダイブ

2023 年後半に Mistral AI によってリリースされた Mixtral 8x7B は、オープン モデルにおける疎な専門家混合 (MoE) アプローチを普及させました。これには、レイヤーごとに 8 つの個別の「エキスパート」フィードフォワード ネットワークが含まれており、合計パラメーターは約 470 億ですが、軽量ルーターはトークンごとに 2 人のエキスパートのみを選択します。その結果、トークンごとにアクティブなパラメーターは約 130 億個だけになるため、推論は 13B の高密度モデルとほぼ同じ速度で実行され、はるかに大規模なモデルに匹敵する品質に達します。 Mixtral は、多くのベンチマークで GPT-3.5 や Llama 2 70B と同等かそれを上回っていますが、より高速かつ安価にサービスを提供できます。ミストラルは後に Mixtral 8x22B をリリースしました。このモデルは Apache 2.0 の下でオープンにライセンスされており、オープンソース コミュニティでの急速な導入と微調整が促進されています。

技術的な洞察

疎な MoE レイヤーでは、密なフィードフォワード ブロックが N 個のエキスパート ネットワークと小規模なゲート ネットワーク (ルーター) に置き換えられます。ルーターはトークンごとにスコアを計算し、上位 k 位のエキスパート (Mixtral では上位 2 位) を選択し、それらのエキスパートのみを介してトークンをルーティングします。それらの出力は重み付けされて合計されます。ほとんどの専門家はトークンごとにアイドル状態になるため、モデルはメモリ内に多くのパラメータを保持しますが、計算量ははるかに少なくなります。トレードオフ: 一部のエキスパートのみが実行される場合でも、すべてのエキスパートを VRAM にロードする必要があります。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

混合モデルと疎モデルの将来

スパース MoE は現在、フロンティア AI の中心となっています。よりオープンな MoE リリース、多くの小規模な専門家によるきめの細かいルーティング、効率をさらに向上させる共有またはハイブリッドの専門家設計が期待されます。モデルが総パラメーター数に達するまでスケールするにつれて、スパース性が推論を手頃な価格に保つための主な手段となります。研究では、MoE の弱点、エキスパート間の負荷分散、メモリ オーバーヘッド、トレーニングの安定性に取り組んでおり、ハードウェアとサービング スタックはエキスパート ルーティングに特化して最適化が進んでいます。

現実世界の実装

はるかに小さい高密度モデルのコストと速度で高品質のチャットボットを提供します

商用製品用の Apache-2.0 ライセンスモデルを使用料なしでセルフホスティング

コーディング、要約、または多言語タスク向けに Mixtral 上で個々の動作を微調整する

70B の高密度モデルでは遅すぎる単一のマルチ GPU サーバーでの高速推論の実行

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixtral and Sparse Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

モデルとパイプラインの並列処理

よくある質問

What is Mixtral and Sparse Models?

Mixtral は、小規模モデルの速度で大きなモデルの品質を実現する、Mistral AI のオープンな専門家混合モデルです。このような疎モデルでは、トークンごとにパラメーターの一部のみがアクティブになり、機能を犠牲にすることなくコンピューティングが削減されます。

Mixtral 8x7B では、それぞれのトークンを何人の専門家が処理しますか?

Mixtral はトップ 2 ルーティングを使用します。ルーターは 8 人のエキスパートのうち 2 人を選択して各トークンを処理します。

トークンがどの専門家に送信されるかを決定するコンポーネントは何ですか?

ルーターと呼ばれる小さなゲート ネットワークがエキスパートを採点し、各トークンを処理するエキスパートを選択します。

Mixtral 8x7B には合計約 47B のパラメータがありますが、トークンごとにアクティブなパラメータはおよそどれくらいでしょうか?

トークンごとに実行されるエキスパートは 2 人だけであるため、約 130 億のパラメーターがアクティブになり、はるかに小規模なモデルの速度が得られます。

Mixtral のような疎な MoE モデルの重要なトレードオフは何ですか?

MoE はトークンごとのコンピューティングを節約しますが、それでもすべてのエキスパートを VRAM に保持する必要があるため、メモリの必要量が増加します。

Mistral AI はどのライセンスに基づいて Mixtral をリリースし、オープン アダプションを促進しましたか?

Mixtral は、寛容な Apache 2.0 ライセンスの下でリリースされ、無料の商用利用と微調整が許可されています。