言語AIガイド

テスト時のコンピューティングのスケーリング

テスト時の計算スケーリングとは、トレーニング中にモデルを大きくするだけではなく、モデルが質問に答えるときに、より多くの思考時間と計算を与えることを意味します。

2分の読書最終更新日

概要

It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.

ディープダイブ

長年にわたり、AI の進歩はトレーニングのスケーリング、つまりより多くのデータ、より多くのパラメーター、より多くの事前トレーニング コンピューティングを意味していました。テスト時の計算スケーリングにより 2 番目の軸が追加され、推論時により多くの計算が費やされます。推論モデルは、即座に答えを出力するのではなく、ステップを探索し、作業を確認し、後戻りする長い内部思考チェーンを生成します。この手法には、拡張された思考連鎖、多くの候補ソリューションをサンプリングして最良のもの (自己一貫性またはベストオブ N) を選択すること、および検証者または報酬モデルに基づくツリー形式の検索が含まれます。 OpenAI の o1 と o3、DeepSeek-R1、および Claude の拡張思考は、これを普及させました。モデルに「より長く考える」ようにすると、競技数学とプログラミングの精度が急激に上昇し、瞬時の答えが失敗する問題の正しさのためにレイテンシーとコストが犠牲になります。

技術的な洞察

モデルは強化学習でトレーニングされて有用な推論トークンを生成し、推論時に「思考予算」を割り当てます。トークンを増やすと、問題を分解し、自身のエラーを捕捉し、自己検証できるようになります。 Best-of-N サンプリングと検証者ガイド付き検索により、並列計算が追加され、多くの試行が生成され、それらがスコアリングされ、勝者が維持されます。重要なのは、十分なテスト時間のコンピューティングを備えた小規模なモデルが、即座に応答するはるかに大きなモデルに匹敵し、コスト曲線を再構築できることです。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

テスト時のコンピューティング スケーリングの将来

テスト時のコンピューティングは現在、トレーニングと並んで主要なスケーリング手段となっています。難易度に基づいてモデルがどれだけ考えるのが難しいかを決定する適応型予算、長いチェーンを短いチェーンに蒸留することによる安価な推論、ツール呼び出しや Web 検索で思考をインターリーブする「エージェント」ループが期待されます。推論ハードウェアが向上するにつれ、科学研究、ソフトウェア エンジニアリング、複雑な計画など、一か八かのタスクでは意図的な推論がデフォルトになる一方、クイック検索は高速かつ低コストのままです。

現実世界の実装

OpenAI の o1 モデルと o3 モデルは、オリンピック レベルの数学の問題を段階的に検討し、AIME および競技ベンチマークで即答モデルを劇的に上回ります。

DeepSeek-R1 は、強化学習を使用して長い思考連鎖推論を教え、追加の推論計算による大きな精度の向上を公然と実証しました。

Claude の拡張思考モードを使用すると、開発者はトークンの予算を設定できるため、モデルは応答する前に複雑なコーディングまたは分析タスクをより長く検討できます。

AlphaCode および同様のシステムは、テスト時に何千もの候補プログラムをサンプリングし、それらをフィルタリングしてランク付けして、競技プログラミングの課題を解決します。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Test-Time Compute Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

よくある質問

What is Test-Time Compute Scaling?

テスト時の計算スケーリングとは、トレーニング中にモデルを大きくするだけではなく、モデルが質問に答えるときに、より多くの思考時間と計算を与えることを意味します。これは、回答する前に熟議することで数学やコーディングの難しい問題を解決できる「推論モデル」の画期的な進歩です。

「テスト時の計算」とは何を指しますか?

テスト時 (推論時) のコンピューティングは、答えの生成中に実行される作業であり、事前トレーニング中に使用されるコンピューティングとは異なります。

o1 のような推論モデルは、余分なテスト時間の計算をどのように使用するのでしょうか?

彼らは、最終的な対応に取り組む前に、拡張された段階的な推論を生成し、解決策を探索および確認します。

テスト時のコンピューティング スケーリングの主なトレードオフは何ですか?

モデルに長く考えさせると、難しい問題の正確性が向上しますが、応答時間と計算コストが増加します。

「ベスト・オブ・N」サンプリングとは何ですか?

Best-of-N では、複数のソリューション試行を並行して生成し、スコアラーまたは検証ツールを使用して最も強力なものを維持します (テスト時間のスケーリングの一種)。

テスト時の計算が新しい「スケーリング軸」とみなされるのはなぜですか?

何年もの間、スケーリングとは大規模なトレーニングの実行を意味していました。 test-time compute は、推論時により多くの計算を行うことで、機能を向上させる 2 番目の方法を追加します。