ロングコンテキストは、人工知能モデル、特に大規模言語モデルの特性であり、非常に大きな入力シーケンス(多くの場合、10万トークンから100万トークン以上)を考慮してテキストを生成することを可能にする。この能力は、書籍全体の分析、長い法律文書や科学文書の処理、長時間の対話における一貫した会話の維持といったタスクにとって極めて重要である。ロングコンテキストモデルの開発には、アーキテクチャの革新、訓練技術、インフラの改善が関わるが、研究者が引き続き取り組む特定の障害モードも導入される。
Transformerアーキテクチャでは、自己注意機構がシーケンス長に対して二次複雑性を持ち、長いコンテキストは計算コストが高くなる。2017年に導入された元のTransformerのような初期モデルは、通常数千トークンという限られたコンテキストウィンドウを持っていた。2024年現在、OpenAI、Anthropic、Google DeepMindといった企業のモデルは、10万から100万トークン以上のコンテキストウィンドウをサポートし、文書分析や複雑な推論における新たな応用を可能にしている。
コンテキストウィンドウの進化
大規模言語モデルにおけるコンテキストウィンドウの進歩は急速である。GPT-2(2019年)は1,024トークンをサポートし、GPT-3(2020年)は2,048トークンに増加した。2023年には、GPT-4 Turboのようなモデルが128,000トークンを提供し、AnthropicのClaude 2.1は200,000トークンに達した。2024年までに、Google DeepMindのGemini 1.5 Proは最大100万トークンのコンテキストウィンドウを示し、一部の研究モデルはさらに大きなサイズを探求している。この成長は、AWS TrainiumやGoogle Cloud TPUのようなハードウェアの進歩と、注意機構におけるアルゴリズムの改善の両方によって促進されている。
コンテキストを拡張する技術
元の訓練長を超えてコンテキストウィンドウを拡張するために、いくつかの技術が開発されている。一般的なアプローチの1つは位置エンコーディング補間であり、モデルが長いシーケンスを処理するために位置エンコーディングを調整する。例えば、ALiBi(Attention with Linear Biases)やRotary Position Embedding(RoPE)のような手法は、モデルがより長いコンテキストに一般化することを可能にする。もう1つの技術はスライディングウィンドウ注意であり、各トークンが局所的な近傍のみに注意を向けることで計算コストを削減する。LongformerやBigBirdモデルで使用されるようなスパース注意パターンは、重要なトークンに選択的に注意を向け、他を無視する。さらに、階層的アプローチは、コンテキストの初期部分を要約または圧縮して全体像を維持する。
インフラとハードウェア
長いコンテキストをサポートするには、かなりのメモリと計算リソースが必要である。Transformerモデルにおけるキーバリューキャッシュはシーケンス長に線形に増加し、100万トークンでは数ギガバイトのメモリを消費する可能性がある。NVIDIA(提供リストにはないが、AMDやIntelが関連する)のようなハードウェアプロバイダーや、Amazon Web Services、Azure、Oracle Cloudのようなクラウドプラットフォームは、高メモリ帯域幅を持つ専用インスタンスを提供する。GroqやSambaNovaは、長いシーケンスの推論を加速するカスタムチップを開発している。vLLMで使用されるPagedAttentionのような効率的なメモリ管理技術は、メモリの無駄を減らし、スループットを向上させる。
応用
ロングコンテキストモデルは、さまざまな応用を可能にする。法律や金融分野では、契約書全体や年次報告書を一度に分析できる。科学研究では、論文全体や補足資料を処理できる。対話型AIでは、長いコンテキストによりチャットボットが多くのターンにわたって会話の初期部分を記憶できる。ソフトウェアエンジニアリングでは、モデルがコードベース全体や長いログファイルをレビューできる。例えば、AnthropicのClaudeは聖書やハリー・ポッターシリーズ全体のテキストを処理でき、Google DeepMindのGeminiはフレームをトークンとして処理することで何時間もの動画を分析するために使用されている。
障害モード
進歩にもかかわらず、ロングコンテキストモデルは特定の障害モードを示す。主要な問題の1つは「lost in the middle」問題であり、モデルが長いコンテキストの中央の情報を無視し、最初と最後に焦点を当てる傾向がある。これは2023年にStanford AI Labの研究者らによって記録された。もう1つの障害は注意劣化であり、モデルの注意が拡散または数トークンに過度に集中し、エラーを引き起こす。コンテキスト圧縮は、特にモデルが初期部分を要約する際に情報損失を引き起こす可能性がある。さらに、計算コストとレイテンシがコンテキスト長に応じて増加し、リアルタイムアプリケーションが困難になる。2025年現在、これらの問題は研究の活発な領域であり、命令チューニングや検索拡張生成のような技術が緩和策として探求されている。
評価とベンチマーク
ロングコンテキスト能力を評価するために、研究者はLongBenchなどのベンチマークを開発しており、これには長文ドキュメントに対する質問応答、要約、コード補完などのタスクが含まれる。HELMET(Long-Context Evaluation)や「Needle in a Haystack」テスト(モデルが長いコンテキストに置かれた特定の事実を取得しなければならない)のような他のベンチマークも一般的に使用されている。これらのベンチマークは、モデルが長い入力に対応できる一方で、特に正確な想起を必要とするタスクでは、コンテキスト長が増加するにつれてパフォーマンスが低下することが多いことを明らかにしている。
将来の方向性
将来の研究は、ロングコンテキストの効率性と信頼性を改善することを目指している。複雑性をO(n)に削減する線形注意や、状態空間モデル(例:Mamba)のような技術は、Transformerの代替を提供する。メモリ拡張ネットワークや外部検索システムは、ウィンドウサイズを増やさずに効果的なコンテキストを拡張できる。TSMCのような企業がより大きなメモリ容量を持つチップを製造するなど、ハードウェアが進歩し続けるにつれて、コンテキスト長の実用的な限界はおそらく成長するだろう。しかし、モデルが長いコンテキストを真に理解して活用することを保証することは、機械学習と人工知能における未解決の課題のままである。
関連概念
ロングコンテキストは、位置エンコーディング、マルチヘッド注意、Transformer (architecture)アーキテクチャと密接に関連している。また、生成AIや深層学習とより広く交差する。ロングコンテキストを理解するには、ニューラルネットワークの訓練と推論の知識、および現在の大規模言語モデルの限界に関する知識が必要である。