言語AIガイド

思考の骨格の並列デコード

Skeleton-of-Thought (SoT) は、最初に言語モデルに回答ポイントの簡単な骨格の概要を要求し、次に各ポイントを並行して展開するプロンプトおよびデコード技術です。

2分の読書最終更新日

概要

これは、モデルを再学習せずに長い回答の壁クロック遅延を約2倍に短縮できる点で重要です。

ディープダイブ

通常、大規模な言語モデルでは一度に 1 つのトークンが生成されるため、長い応答は単に各単語がその前の単語を待つため遅くなります。 2023 年に清華大学と Microsoft の研究者によって導入された Skeleton-of-Thought は、その研究を再構成したものです。最初の呼び出しでは、モデルに簡潔なスケルトン、つまり 3 ~ 10 ポイントの見出しの番号付きリスト (それぞれがわずか数語) を要求します。次に、呼び出しの 2 番目のバッチでは、ポイントが互いに依存しないため、すべてのポイントが独立して同時に展開されます。展開は最終的な答えに再び縫い合わされます。ゆっくりとした展開ステージが並行して実行されるため、ヒントのリストやオプションの比較など、回答が独立した部分に自然に分解される質問の合計待ち時間は急激に減少します。

技術的な洞察

SoT は、デコーダーの推論がレイテンシーに依存し、常に計算に依存するとは限らないことを利用します。単一のリクエストでは、GPU が十分に活用されないままになることがよくあります。ポイント拡張をバッチとして実行すると、ハードウェアがビジー状態になり、ポイントごとの生成が重複します。 API モデルでは、拡張は同時リクエストとして発行されます。ローカル モデルでは、1 つのバッチ化された前方パスを共有します。スケルトン ステージでは固定の短いオーバーヘッドが追加されるため、回答の長さと独立したポイントの数に応じて正味の速度が向上します。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

思考のスケルトン並列デコーディングの将来

SoT のアイデアがアダプティブ ルーティングに統合されることが期待されます。システムは、クエリがきれいに分解されたことを検出して並列拡張に切り替え、数学証明のような密接に依存するタスクについては逐次推論にフォールバックします。動的グラフ依存関係を持つ SoT などのバリアントでは、ポイントが相互に参照できるようになります。サービング フレームワークがネイティブのバッチ サブリクエストのサポートと投機的デコードを追加すると、並列分解戦略が手動のプロンプト トリックではなく標準のレイテンシー削減レイヤーになるでしょう。

現実世界の実装

8 つのヒントをすべて一度に拡張することで、「クラウド コストを削減するための 8 つのヒントを教えてください」に応答するチャットボットを高速化します。

応答待ち時間が短く、構造化された複数セクションのトラブルシューティング ガイドを生成するカスタマー サポート アシスタント。

各箇条書きを同時に記入して、比較回答 (2 つの製品の長所と短所) を作成します。

バックエンド サービス システムは独立した回答セクションをバッチ処理して、長い形式の生成中に GPU 使用率を高めます。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Skeleton-of-Thought Parallel Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

MaskGIT 並列トークン デコード

よくある質問

思考の骨格並列解読とは何か?

Skeleton-of-Thought (SoT) は、最初に言語モデルに回答ポイントの簡単な骨格の概要を要求し、次に各ポイントを並行して展開するプロンプトおよびデコード技術です。モデルを再トレーニングすることなく、長い回答の実測レイテンシを約 2 倍に短縮できるため、これは重要です。

思考の骨格の最初の段階では何​​が生成されますか?

SoT は、最初にモデルに点見出しの簡潔なスケルトンを出力するように指示し、その後個別に展開します。

ポイント拡張ステージはなぜ並行して実行できるのでしょうか?

スケルトン ポイントは独立するように設計されているため、拡張する際に兄弟を待つ必要はありません。

通常の LLM デコードにおける主なボトルネックとなる SoT ターゲットは何ですか?

標準のデコードでは、各トークンが前のトークンを待機するため、待ち時間が制限されます。 SoT は実時間を短縮するために作業をオーバーラップします。

SoT はどのタイプの質問に対して最大の高速化をもたらしますか?

各部分が同時に拡張されるため、多くの独立した部分に分解した回答が最も効果的です。

SoT では、単一の順次生成と比較してどのようなオーバーヘッドが追加されますか?

スケルトン ステージでは小さな固定レイテンシーが追加されますが、これは長い回答の並列拡張によって補われます。