言語AIガイド

深みの混合

Mixture of Depths (MoD) を使用すると、トランスフォーマーはさまざまなトークンにさまざまな量の計算を費やすことができ、各層の負荷の高い計算を通じて「重要な」トークンのみをルーティングできます。

2分の読書最終更新日

概要

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

ディープダイブ

標準のトランスフォーマーは、句読点のような些細なものも含めて、すべてのレイヤーをすべてのトークンに適用します。 2024 年に Google DeepMind によって導入された Mixture of Depths は、完全な自己注意と MLP 計算を実行するトークンの固定上位 k 部分を選択する小さなルーターを各ブロックに追加します。残りは残りの接続を介してブロックをスキップします。レイヤーごとに k 個のトークンのみが処理されるため、予測不能に変化する以前の動的深度手法とは異なり、総計算量 (FLOP) には上限があり、事前にわかっています。これにより、バッチ処理とハードウェアの使用効率が向上します。 MoD でトレーニングされたモデルは、フォワード パスごとに少ない FLOP を使用してベースライン トランスフォーマーの品質と一致させることも、同じ計算でより高い品質に達することもできます。また、このアイデアは専門家の混合で自然に構成され、深さと幅の両方でルーティングする「MoDE」モデルを提供します。

技術的な洞察

各 MoD ブロックで、学習された線形ルーターがすべてのトークンにスコアを付け、スコアの上位 k を維持します。選択されたトークンはアテンションと MLP を通過しますが、選択されていないトークンは変更されずに残りのパスに転送されます。 (トークンごとのしきい値ではなく) 固定の top-k を使用すると、計算グラフが静的でテンソル形状が一定になり、ハードウェアに優しくなります。ルーターはネットワークの残りの部分を使用してトレーニングされ、因果関係の生成では補助予測子が使用されるため、ルーティングの決定が将来のトークンを覗くことはありません。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

深さの混合の未来

条件付き計算は、モデルがスケールするにつれて効率性を高めるための主要な手段であり、MoD は初期のクリーンな例です。 Mixture-of-Experts (深さとエキスパートの両方でルーティング)、簡単な入力のために縮小される適応型バジェット、およびどのトークンが真に深い処理を必要とするかをより適切に識別する学習型ルーターとのより深い統合が期待されます。推論コストが展開の経済性を左右するため、予測可能なレイテンシを維持しながら、必要な場合にのみモデルに「より深く考える」技術が大規模アーキテクチャで標準になる可能性があります。

現実世界の実装

フィラー トークンの詳細な計算をスキップすることで、長いドキュメントの処理に必要な FLOP を削減します。

ベースライン品質と一致するモデルをより少ないコンピューティングでトレーニングし、サービスコストを削減します。

Mixture-of-Experts (MoDE) と組み合わせて、層の深さと専門家の選択の両方に基づいてルーティングします。

レイヤーごとのコンピューティング バジェットが事前に固定されているため、トークンごとに予測可能な固定レイテンシーを維持します。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

エージェントの混合物の集約

よくある質問

What is Mixture of Depths?

Mixture of Depths (MoD) を使用すると、トランスフォーマーはさまざまなトークンにさまざまな量の計算を費やすことができ、各層の負荷の高い計算を通じて「重要な」トークンのみをルーティングできます。固定の予測可能なコンピューティング予算を維持しながら、簡単なトークンの処理コストを削減します。

深さの混合はトークンによってどのように異なりますか?

MoD は、各レイヤーの負荷の高い計算を通じて一部のトークンのみをルーティングするため、異なるトークンは実質的に異なる深さを取得します。

MoD はどのようにしてコンピューティング予算を予測可能に保っているのでしょうか?

ブロックごとに固定の上位 k 個のトークンを選択すると、フロップが抑制され、テンソルの形状が一定に保たれるため、ハードウェアに優しくなります。

ルーターが特定のブロックで選択しなかったトークンはどうなりますか?

選択されていないトークンはブロックの計算をバイパスし、変更されずに残りのパスに転送されます。

Mixture of Depths を導入したのは誰ですか?

Mixture of Depths は、Google DeepMind によって、動的トランスフォーマー コンピューティングに関する 2024 年の論文で導入されました。

MoD と専門家の混合を組み合わせると何が得られるでしょうか?

デプス ルーティングとエキスパート ルーティングを組み合わせると、レイヤーとエキスパートの両方で計算を条件付ける「MoDE」モデルが得られます。