テクニカルガイド

専門家の混合

Mixture of Experts (MoE) は、ネットワークを多くの特殊なサブネットワークに分割し、入力ごとに少数のサブネットワークのみをアクティブにするモデル設計です。

2分の読書最終更新日

概要

It lets models hold enormous knowledge while keeping each prediction fast and cheap.

ディープダイブ

標準的なトランスフォーマーは、すべての入力を同じ高密度の層を通じて実行するため、モデルをよりスマートにすることは、通常、すべての計算のコストを高めることを意味します。専門家の混合がそのつながりを打ち破ります。これは、大きなフィードフォワード層を、多くの小さな「エキスパート」ネットワークと、どのエキスパートが各トークンを処理するかを決定する小さな「ルーター」に置き換えます。通常、上位 1 人または 2 人の専門家のみが起動するため、モデルには合計数千億のパラメーターを含めることができますが、トークンごとに有効化できるのはほんの一部だけです。これが、Mixtral 8x7B のようなモデルや GPT-4 の背後にある噂のアーキテクチャが、比例して高い推論コストを発生させることなく高品質を達成できる理由です。トレードオフは複雑さです。すべてのエキスパートがメモリに収まる必要があり、ルーターは一部のエキスパートを誤ってルーティングしたり過負荷になる可能性があるため、トレーニングには慎重なバランスが必要です。

技術的な洞察

MoE の中心となるのはゲーティング ネットワークです。これは受信トークンの各エキスパートにスコアを付け、そのトークンを上位 k の最高得点者 (多くの場合 k=1 または 2) にルーティングする小さな学習層です。ルーターが少数のお気に入りのエキスパートにすべてを送信するのを防ぐために、トレーニングでは、不均一な使用にペナルティを与える補助的な「負荷分散損失」を追加します。トークンごとに実行されるエキスパートは k 人だけであるため、エキスパートを追加してもコンピューティング (FLOP) はほぼ一定のままであり、合計パラメーターとトークンごとのコストは独立してスケールされます。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

専門家の混合の未来

MoE は容量とコストを切り離すため、フロンティア規模のモデルのデフォルト ツールになりつつあります。よりきめ細かい専門家、より多くのコンテキストを考慮したよりスマートなルーティング、および限られたハードウェアで巨大な疎モデルを提供するためのより優れた技術が期待されます。研究では、エキスパートのオフロードと量子化を通じて、実行するエキスパートがほとんどなくてもすべてのエキスパートをロードする必要があるため、メモリの問題にも取り組んでいます。 Mixtral や DeepSeek-MoE のようなオープン モデルが成熟するにつれ、スパース アーキテクチャにより、より少ない GPU 予算でより効率的なアシスタントが実現される可能性があります。

現実世界の実装

Mixtral 8x7B は 8 人のエキスパートを使用し、トークンごとに 2 つをアクティブにし、合計で約 470 億のパラメーターを提供しますが、より速く、より安価な推論を実現するために、トークンごとにアクティブになるのはわずか 130 億です。

DeepSeek と Qwen は、より低いトークンあたりのコンピューティングで実行しながら、ベンチマークの高密度モデルと一致する大規模な MoE 言語モデルを出荷します。

クラウド LLM プロバイダーは MoE を使用するため、各リクエストが少数の専門家にのみ対応するため、単一の巨大なモデルが多くのユーザーに手頃な価格でサービスを提供できます。

Google の以前の Switch Transformer は、トップ 1 ルーティングを使用して 1 兆を超えるパラメーターに拡張し、トレーニング コンピューティングを管理しやすくしました。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Experts quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Mixture of Experts?

Mixture of Experts (MoE) は、ネットワークを多くの特殊なサブネットワークに分割し、入力ごとに少数のサブネットワークのみをアクティブにするモデル設計です。これにより、各予測を高速かつ低コストで維持しながら、モデルに膨大な知識を保持させることができます。

専門家の混合レイヤーでは、どの専門家が特定のトークンを処理するかを決定するものは何でしょうか?

小規模なゲート ネットワークは、トークンの各専門家をスコアリングし、それを最高スコアのエキスパートにルーティングすることを学習します。ルーティングは固定またはランダムではなく学習されます。

MoE モデルは、トークンあたりのコストの増加を伴わずに、高密度モデルよりもはるかに多くの合計パラメータを持つことができるのはなぜですか?

トークンごとに上位 k 個のエキスパートのみが起動するため、エキスパートを追加して合計パラメーター数が増加しても、アクティブなコンピューティングはほぼ一定のままです。

MoE トレーニング中のロード バランシング (補助) 損失はどのような問題に対処しますか?

バランスを調整しないと、ルーターは少数の専門家を優遇する傾向があります。補助損失により不均一な使用にペナルティが課されるため、すべての専門家がトレーニングを受けることができます。

Mixtral 8x7B は、トークンごとに 8 人のエキスパートのうち 2 人をアクティブにします。これは、そのコンピューティングとそのサイズについて何を意味するのでしょうか?

アクティブなエキスパートは 8 人中 2 人だけなので、トークンあたりのアクティブなパラメーター (約 13B) は合計約 47B よりもはるかに小さく、推論コストが低くなります。

同等の機能を備えた高密度モデルと比較した MoE モデルの真の欠点はどれですか?

トークンごとに計算を行う専門家が少数であるにもかかわらず、すべての専門家の重みをメモリにロードする必要があるため、MoE モデルを提供するにはメモリを大量に消費します。