テクニカルガイド

投機的デコード

投機的デコードでは、小規模で高速な「ドラフト」モデルを使用して先のいくつかのトークンを推測し、その後、大きなモデルでそれらをすべて一度に検証することで、大規模な言語モデルがより高速にテキストを生成します。

2分の読書最終更新日

概要

It speeds up inference 2-3x with identical output quality.

ディープダイブ

通常、LLM は一度に 1 トークンずつテキストを生成します。各トークンには巨大なモデルを通過する完全な前方パスが必要で、現在のトークンが終了するまで次のトークンを開始することはできません。これが遅いのは、計算ではなくメモリに依存しているためです。GPU は計算ではなく、重みのロードにほとんどの時間を費やします。投機的なデコードによりボトルネックが解消されます。小規模で安価なドラフト モデルでは、たとえば 5 つの候補トークンの塊が提案されます。次に、大規模な「ターゲット」モデルが 5 つすべてを単一の並列前方パスで処理し、チェックします。生成されるはずのトークンと一致するトークンが受け入れられます。最初の不一致があれば修正し、残りを破棄します。多くのトークンの検証にはトークンの生成とほぼ同じコストがかかるため、受け入れられる推測はほぼ無料です。

技術的な洞察

賢い部分は、出力分布がターゲット モデルを単独で実行した場合と数学的に同一であることを保証する拒否サンプリング ルールです。そのため、品質は近似値ではなく正確です。受け入れ率が高速化を促進します。小規模なモデルが大きなモデルをより正確に予測するほど、検証ステップごとにより多くのトークンが固着します。 Medusa のようなバリアントは、ターゲット モデル自体に追加の予測ヘッドを追加し、EAGLE ドラフトを特徴空間で作成するため、別のドラフト モデルが不要になります。

戦略的影響

費用と予算

アーキテクチャの決定により、パフォーマンスと運用コストが何年にもわたって推進されます。

より明確な判決

技術教育は、チームが最新のスタックだけでなく、適切なスタックを選択するのに役立ちます。

品質管理

より良いエンジニアリングの選択により、本番環境での信頼性に関するインシデントが減少します。

投機的デコーディングの未来

投機的デコードは、vLLM や TensorRT-LLM などのサービング スタックのデフォルトになりつつあります。セルフ ドラフティング メソッド (Medusa、EAGLE、Lookahead) は、2 番目のモデルの維持に加えて、ステップごとに複数の候補ブランチを検証するツリーベースの推測を避けるため、優勢になることが予想されます。モデルが成長するにつれて、メモリに制約されたボトルネックが悪化して、推測の価値がさらに高まり、ハードウェアを意識した製図者は現実世界の高速化をさらに推進することになります。

現実世界の実装

制作アシスタントの応答遅延を短縮するための 70B チャット モデルのトークンを提案する 7B ドラフト モデル

Medusa ヘッドは LLM にボルトで固定されているため、個別のドラフト モデルを使用せずに複数の将来のトークンを一度に予測します

vLLM により、投機的なデコードが可能になり、サービング クラスターでの 1 秒あたりのトークンのスループットが向上します。

モデルの隠れた機能スペースで EAGLE 製図を行い、承認率と全体的な速度を向上させます。

リスクとガードレール

1 つのベンチマークを最適化すると、より広範なシステムの弱点が隠れる可能性があります。

インフラストラクチャとメンテナンスのコストは過小評価されがちです。

システムが複雑になるにつれて、セキュリティと可観測性のギャップが拡大する可能性があります。

実装ロードマップ

1

実装前にレイテンシ、品質、コストの目標を定義します。

2

現実的な負荷とデータ条件でのベンチマーク。

3

エラー、ドリフト、ユーザーへの影響を計測器で監視します。

4

スケーリングの前に、ロールバックとインシデント対応のパスを準備します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

EAGLEによる投機的デコード

よくある質問

What is Speculative Decoding?

投機的デコードでは、小規模で高速な「ドラフト」モデルを使用して先のいくつかのトークンを推測し、その後、大きなモデルでそれらをすべて一度に検証することで、大規模な言語モデルがより高速にテキストを生成します。同一の出力品質で推論を 2 ~ 3 倍高速化します。

投機的デコードの中心となるアイデアは何ですか?

高速ドラフト モデルは複数のトークンを提案し、大規模なターゲット モデルは単一の並列パスでそれらすべてをチェックします。

通常の一度に 1 トークンずつの LLM 生成が遅いのはなぜですか?

各ステップでは、重い計算を実行するのではなく、主にメモリから巨大な重み行列をロードするため、GPU は十分に使用されません。

ドラフトモデルとターゲットモデルが一致しない最初のトークンでは何が起こるでしょうか?

不一致までのトークンは受け入れられます。不一致以降は拒否され、ターゲット モデルの正しいトークンが保持されます。

投機的デコードは出力品質にどのような影響を与えますか?

拒否サンプリング ルールにより、最終的な分布がターゲット モデルと正確に一致することが保証されるため、品質は変わりません。

投機的デコードによる高速化を最も直接的に決定するものは何でしょうか?

ターゲット モデルが検証ステップごとに受け入れるドラフト トークンが増えるほど、速度が向上します。