コンテキストウィンドウ

英語からの翻訳

コンテキストウィンドウとは、言語モデルが応答を生成する際に一度に処理できるテキストの最大量であり、トークン単位で測定され、プロンプトとその出力の両方にわたる。

コンテキストウィンドウとは、言語モデルが一度に考慮できるテキストの最大量であり、トークン単位で測定され、ユーザーが提供するプロンプト、システム指示、取得されたドキュメント、およびモデル自身のこれまでの出力を網羅します。これはモデルの作業記憶として機能し、コンテキストウィンドウの外にある情報は、明示的に再供給されない限り、生成時にはモデルから見えません。

技術的基盤

コンテキストウィンドウのサイズは、Transformer (architecture)アーキテクチャの中核をなすアテンション機構によって制約され、これは入力内のすべてのトークン間の関係を計算します。標準的な定式化では、この計算はシーケンス長に対して二次的にスケールするため、コンテキストウィンドウを2倍にすると、処理に必要な計算量とメモリが約4倍になり、歴史的には長いコンテキストウィンドウの提供が高コストでした。その後の工学的技術、例えばスパースおよびウィンドウ化されたアテンションの変種、キー・バリューキャッシュの圧縮、専用のメモリ管理などにより、このコストは十分に削減され、はるかに大きなウィンドウが商業的に実用的になりました。

時間の経過に伴う成長

初期のトランスフォーマーベースの言語モデルは、数百から数千トークン程度しかサポートしていませんでした。OpenAIが2020年にリリースしたGPT-3は、約2,048トークンをサポートしていました。コンテキストウィンドウはその後数年間で着実に拡大し、2023年に登場したGPT-4は最大32,000トークンをサポートする変種を持ち、2024年までにいくつかの研究所が数十万トークンのコンテキストウィンドウを提供しました。Google DeepMindGeminiは、100万トークン以上のコンテキストウィンドウをサポートすることで注目され、小説全体、大規模なコードベース、または数時間分のビデオ文字起こしを単一のプロンプトで処理できるようになりました。AnthropicClaude (AI model family)モデルも、初期の9,000トークンのウィンドウから、その後のリリースで数十万トークンのコンテキスト長に拡大しました。

トレードオフと長コンテキストの限界

コンテキストウィンドウが大きいからといって、モデルがそれをすべてうまく活用するとは限りません。長コンテキスト性能に関する研究では、「途中で迷子になる」効果が繰り返し見つかっており、モデルは長いコンテキストの先頭または末尾近くに配置された情報を、中間に埋もれた情報よりも正確に取得できますが、アーキテクチャ上でこれらの位置が正式に優先されるわけではありません。長コンテキストの「針山に針」テストは、特定の事実が大量の無関係なテキストの中に隠されているもので、モデルの実効コンテキストが宣伝された最大値と一致するかを測定する標準的な方法となりました。非常に長いコンテキストの提供は計算コストも高いため、システムはしばしば、大量の生テキストをコンテキストウィンドウに詰め込むか、Retrieval-augmented generationを使用して最も関連性の高いパッセージのみを選択するかの実用的な選択に直面し、完全性とコスト、そして原則的には正確性をトレードオフします。

推論との関係

コンテキストウィンドウはまた、Chain-of-thoughtプロンプティングや推論モデルなどの技術を制約します。これらは最終回答を生成する前にかなりの中間テキストを生成し、長く推論するモデルはその推論で自身のコンテキストウィンドウの一部を消費します。これが、これらの技術が広まるにつれて、より長いコンテキストウィンドウが重要になった理由の一つです。

カテゴリ:large-language-models·transformers·deep-learning
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴