言語AIガイド

投機的デコードのドラフト モデル

投機的デコードでは、小規模で高速な「ドラフト」モデルを使用して、今後のいくつかのトークンを推測し、その後、大規模なモデルが 1 回のパスでそれを検証します。

2分の読書最終更新日

概要

It speeds up text generation 2-3x with no change to the output.

ディープダイブ

大規模な言語モデルでは、一度に 1 トークンずつテキストが生成され、各ステップでは数十億のパラメーターを通過する完全な前方パスが必要となり、時間がかかり、メモリに制限されます。投機的デコードは、大きな「ターゲット」モデルと安価な「ドラフト」モデルを組み合わせることでこれを攻撃します。ドラフト モデルは、たとえば 4 ~ 8 個の候補トークンの塊を迅速に提案します。次に、大きなモデルはそれらすべてを単一の並列前方パスで処理し、それぞれをチェックします。大きなモデルが生成するものと一致するトークンが受け入れられます。最初の不一致は修正され、残りは破棄されます。複数のトークンを一度に検証する場合は、トークンを生成するのとほぼ同じコストがかかるため、受け入れられた実行はほぼ無料です。重要なのは、拒否サンプリング ステップにより、最終的な分布が大きなモデルを単独で実行した場合と同じであること、つまり品質を損なうことなく速度が保証されることです。

技術的な洞察

重要なトリックは、修正された拒否サンプリング テストです。ドラフトされたトークンごとに、ターゲット モデルの確率がドラフト モデルの確率と比較されます。ターゲットが同等以上の確率を割り当てた場合、トークンは受け入れられます。それ以外の場合は、比率に等しい確率で受け入れられ、拒否された場合は、調整された残差分布から修正されたトークンがサンプリングされます。この計算により、出力は大規模モデルから直接サンプリングした場合と同等であることがわかります。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

投機的復号ドラフト モデルの将来

ドラフト モデルが vLLM や TensorRT-LLM などの推論サーバーの標準インフラストラクチャになることが期待されます。自己推測のバリアント (Medusa、EAGLE) は、軽量の予測ヘッドを追加することで個別のドラフト モデルを完全に削除し、ツリーベースのドラフトでは多くの候補の継続を一度に検証します。コンテキスト ウィンドウが拡大し、サービス コストが支配的になるにつれて、よりスマートでモデルに適合した製図者とハードウェアを認識した検証により、承認率とスループットが向上します。

現実世界の実装

Anthropic、OpenAI、および Google は、投機的デコードを使用して、数百万のユーザーにサービスを提供するチャット アシスタントの遅延とサービス コストを削減します。

vLLM と NVIDIA TensorRT-LLM には投機的デコーディングが組み込まれているため、セルフホスティング者は Llama または Mistral の展開を高速化できます。

7B ドラフト モデルと 70B ターゲット (Llama-3 ファミリなど) を組み合わせて、単一 GPU で 1 秒あたりのトークン数を約 2 倍にします。

コード補完ツールは、小さなドラフト モデルを使用して、より大きなモデルが検証するボイラープレートを提案し、エディターでの提案を素早く提供します。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

コードモデルの投機的編集

よくある質問

What is Speculative Decoding Draft Models?

投機的デコードでは、小規模で高速な「ドラフト」モデルを使用して、今後のいくつかのトークンを推測し、その後、大規模なモデルが 1 回のパスでそれを検証します。出力に変更を加えることなく、テキスト生成を 2 ~ 3 倍高速化します。

投機的デコードにおける「ドラフト」モデルの主な役割は何ですか?

小規模なドラフト モデルは今後のトークンを安価に推測し、その後、大規模なターゲット モデルが単一の並列パスでチェックします。

複数のドラフトされたトークンを一度に検証すると時間が節約されるのはなぜですか?

生成はメモリに依存します。 1 つのバッチ化されたパスで複数のトークンをチェックするのは 1 ステップとほぼ同じくらい安価なので、受け入れられた実行はほぼ無料です。

ターゲット モデルが最初のトークンを拒否した後、ドラフトされたトークンはどうなりますか?

最初の不一致があるまで承認が続行されます。そのトークンは修正され、それ以降のドラフトされたトークンはすべて破棄されます。

投機的デコードによって出力品質が低下しないようにするにはどうすればよいですか?

修正された拒否サンプリング テストにより、最終的なトークン分布がターゲット モデルから直接サンプリングされたものと一致することが保証されます。

個別のドラフトモデルを回避する「自己推測」アプローチは次のうちどれですか?

Medusa と EAGLE は、軽量の追加予測ヘッドをメイン モデルに追加して、独自の将来のトークンをドラフトできるようにします。