言語AIガイド

コンテキストウィンドウ

コンテキスト ウィンドウは、モデルが一度に読み取って記憶できるテキストの最大量 (トークン単位で測定) です。

2分の読書最終更新日

概要

It sets a hard limit on how much of your conversation, documents, or instructions the model can actually use.

ディープダイブ

モデルは文字や単語を直接読み取りません。彼らはトークンを読みます。トークンとは、英語の単語のおよそ 4 分の 3 に相当するテキストの塊です。コンテキスト ウィンドウは、プロンプトとモデル自身の応答をカウントします。初期の GPT-3 は約 2,000 トークンを処理しました。 2025 ~ 2026 年までにフロンティア モデルは劇的に拡大しました。Google の Gemini は 100 万から 200 万のトークンに達し、いくつかの Claude および GPT モデルは 128K から 100 万までのトークンを提供し、書籍全体またはコードベースに十分な量になります。しかし、大きいほど自動的に優れているわけではありません。注意はすべてのトークンを他のトークンと比較するため、長さに応じて計算コストとメモリコストが急激に増加します。モデルは「途中で失われた」効果も示し、長い入力の開始と終了の情報を、中央に埋もれた情報よりも確実に思い出します。

技術的な洞察

Everything in a single request — system instructions, prior chat turns, pasted documents, and the answer being generated — must fit inside the token budget.オーバーフローすると、最も古いコンテンツが削除されるか、要約する必要があるため、長いチャットは「忘れられる」ように見えます。セルフ アテンションはトークン数の 2 乗にほぼ比例し、モデルはトークンごとにキー/値ベクトルをキャッシュしてメモリを消費するため、ウィンドウが大きくなるとコストがかかります。これが、プロバイダーがトークンによって価格を設定する理由であり、すべてをコンテキストに詰め込むよりも取得の方が安価であることが多い理由です。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

コンテキスト ウィンドウの未来

コンテキスト ウィンドウは拡大し続けますが、重点は未加工のサイズから効果的な使用に移行しています。より優れたロングコンテキスト トレーニング、アテンションの最適化、キー/値のキャッシュ圧縮などの技術は、「途中で失われた」問題とコスト曲線を削減することを目的としています。検索拡張生成は実用的な補完機能であり、呼び出しごとに数百万のトークンの処理に料金を支払う代わりに、関連するチャンクのみをフェッチします。ヘッドラインの最大数よりも、「モデルがそのウィンドウをどの程度確実に使用できるか」が重要であることが予想されます。

現実世界の実装

契約書または研究論文全体を貼り付けて、モデルが以前のセクションを失わずにそれに関する質問に回答できるようにします。

アシスタントが多くのファイルと以前の変更を一度に表示し続ける必要がある長時間のコーディング セッション。

一貫性を保つために会話のやり取りを完全に記憶する必要があるカスタマー サポート ボット。

重要な詳細が遠く離れていて「途中で失われる」危険がある大規模なログまたはトランスクリプトを分析する場合。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Context Windows quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

YaRN コンテキスト ウィンドウのスケーリング

よくある質問

What is Context Windows?

コンテキスト ウィンドウは、モデルが一度に読み取って記憶できるテキストの最大量 (トークン単位で測定) です。モデルが実際に使用できる会話、ドキュメント、または指示の量に厳しい制限を設定します。

モデルのコンテキスト ウィンドウは何を測定しますか?

コンテキスト ウィンドウは、単一リクエストのトークン バジェット、つまりモデルが一度に読み取って応答できるテキストの量です。

この文脈におけるトークンとは何ですか?

モデルはテキストをサブワードの塊であるトークンとして処理します。英語では、トークンは平均して単語の約 4 分の 3 に相当します。

単一リクエストのコンテキスト ウィンドウに対してカウントされる項目はどれですか?

リクエスト全体は 1 つのバジェットを共有します。命令、会話履歴、貼り付けられたコンテンツ、およびモデル自体の出力はすべてトークンを消費します。

コンテキスト ウィンドウが大きい方が自動的に優れているわけではないのはなぜですか?

注意コストはおおよそトークン数の 2 乗に応じて増加し、「途中で失われた」効果により、文書の途中の詳細を思い出せる信頼性が低くなります。

すべてをコンテキスト ウィンドウに入力する代わりに、検索拡張生成 (RAG) がよく使用されるのはなぜですか?

RAG はナレッジ ベースの関連部分のみを取得し、リクエストごとに大量のテキストをモデルにフィードするコストを回避します。