次トークン予測は、自己回帰型言語モデル、特に大規模言語モデル(LLM)において使用される基本的な学習目的である。このパラダイムでは、モデルは、与えられたすべての先行トークンを条件として、シーケンス内の次のトークンの確率を推定するように訓練され、条件付き確率分布P(トークン_n | トークン_1, ..., トークン_{n-1})を効果的に学習する。この目的により、モデルは、最も可能性の高い次のトークンを反復的にサンプリングまたは選択し、それを入力シーケンスに追加することでテキストを生成できる。
このアプローチは、Transformer (architecture)アーキテクチャに基づく現代の大規模言語モデルの中心であり、これらは、以前のリカレントニューラルネットワークベースのモデルや、単語n-gram言語モデルなどの純粋に統計的なモデルに取って代わった。多くの場合、公開インターネットから収集された膨大なデータセットで訓練することにより、これらのモデルは、自然言語生成、機械翻訳、質問応答など、幅広いタスクにわたって一貫性があり文脈に関連したテキストを生成することを学習する。
歴史的発展
次トークン予測の概念的なルーツは、1950年代にノーム・チョムスキーが形式文法を用いて言語を記述する形式的アプローチを開発したことに遡る。しかし、これらの初期モデルはルールベースであり、確率的予測を伴わなかった。1970年代には、IBMリサーチのフレデリック・ジェリネクと同僚たちが、音声認識の一環として言語モデリングへの統計的アプローチを導入した。彼らのグループは、単語シーケンスの確率的n-gramモデルを使用し、モデルの不確実性の情報理論的尺度としてパープレキシティを導入した。
1980年には、最初の重要な統計的言語モデルが提案され、その10年間にIBMは「シャノン流」の実験を実施し、人間の被験者がテキストを予測または修正して、言語モデリングの潜在的な改善点を特定した。これらの統計的手法は、2000年代にニューラルアプローチが台頭するまで支配的であった。
統計的基礎
純粋な統計モデル、特に単語n-gramに基づくものは、前のn-1語が与えられたときの単語の確率を推定する。これらのモデルは、訓練コーパス内の出現回数を数えることに依存し、可能なシーケンスの数が語彙サイズとともに指数関数的に増加するため、次元の呪いとデータのスパース性に悩まされる。
最大エントロピーモデルなどの指数言語モデルは、特徴関数を使用して単語とn-gram履歴の間の関係を符号化することで、いくつかの制限に対処する。履歴が与えられたときの単語の確率は、P(w_m | w_1, ..., w_{m-1}) = 1/Z(w_1, ..., w_{m-1}) * exp(a^T f(w_1, ..., w_m))として計算され、ここでZは分配関数、aはパラメータベクトル、fは特徴関数である。これらのモデルは、しばしば正則化またはパラメータの事前分布を必要とする。ログ双線形モデルは、指数言語モデルの別の例である。
後に導入されたスキップグラムモデルは、中心単語が与えられたときの周囲の単語を予測することに焦点を当てており、厳密な次トークン予測とは異なるが、文脈から単語分布を学習するという考え方を共有している。
ニューラル言語モデル
ニューラル言語モデルは、2000年代にますます重要になった。ヨシュア・ベンジオと共著者らは、単語シーケンスの確率を推定しながら分散単語表現を学習する確率的ニューラルネットワーク言語モデルを導入した。これらの連続空間埋め込みは、単語をニューラルネットワーク内の重みの非線形結合として表現することで次元の呪いを軽減し、n-gramモデルに固有のデータスパース性問題を回避した。
リカレントニューラルネットワーク(RNN)は、シーケンスが処理される際に以前の単語からの情報を保持することで、このアプローチを拡張した。2010年には、トマーシュ・ミコロフと同僚たちが、リカレントニューラルネットワーク言語モデルが従来のn-gramモデルを大幅に上回る性能を発揮できることを実証した。RNNベースのモデルは、シーケンスを順次処理し、文脈を捉える隠れ状態を維持し、この状態と現在の入力に基づいて次のトークンを予測する。
トランスフォーマー革命
Transformer (architecture)アーキテクチャの導入は、次トークン予測における大きな転換点となった。自己注意メカニズムに依存するトランスフォーマーは、シーケンス内のすべての先行トークンの重要性を順次処理するのではなく同時に重み付けできるようにする。この並列化により、はるかに大規模なデータセットでの訓練が可能になり、大規模言語モデルの開発につながった。
2026年現在、大規模言語モデルは、主に、多くの場合公開インターネットから収集されたテキストを使用して、より大規模なデータセットで訓練されたトランスフォーマーに基づいている。これらのモデルは、以前に純粋に統計的なモデルを凌駕していたリカレントニューラルネットワークベースのモデルを凌駕している。OpenAI、Anthropic、Google DeepMindなどの企業は、次トークン予測を中核的な学習目的として使用する著名なLLMを開発している。
訓練と生成プロセス
訓練中、モデルはトークンのシーケンスを提示され、先行するトークンが与えられた各トークンを予測することを学習する。損失関数(通常はクロスエントロピー)は、予測確率と実際の次のトークンの間の差を測定する。バックプロパゲーションと最適化技術を通じて、モデルは訓練コーパス全体でこの損失を最小化するようにパラメータを調整する。
推論時には、テキスト生成は自己回帰的に進行する。モデルは初期プロンプトを受け取り、次のトークンを予測し、それをプロンプトに追加し、このプロセスを繰り返す。これにより、各新しいトークンが以前に生成されたすべてのトークンに条件付けられて、テキストがトークンごとに生成される。トークンの選択は、決定的(最高確率の選択)または確率的(確率分布からのサンプリング)であり、温度スケーリングやトップkサンプリングなどの技術が出力の多様性に影響を与える。
応用と影響
次トークン予測は、テキスト生成以外にも、音声認識、機械翻訳、光学文字認識、手書き認識、文法誘導、情報検索、災害対応など、多種多様な自然言語タスクを可能にする。自然言語におけるシーケンス予測の能力により、言語モデルはルート最適化やその他のシーケンスベースのタスクに有用である。
次トークン予測で訓練された大規模言語モデルは、要約、コード生成、会話型AIなどのタスクで能力を実証している。しかし、これらのモデルが人間の言語処理の妥当な認知モデルであるかどうかは依然として不明である。少なくともリカレントニューラルネットワークについては、研究により、人間が学習しないパターンを学習することがある一方で、人間が通常学習するパターンを学習できないことが示されている。
評価とベンチマーク
言語モデルの評価は、主に、典型的な言語指向タスクから派生した人間が作成したサンプルベンチマークとの比較によって行われる。他のあまり確立されていない品質テストは、モデルの本質的特性を調べたり、2つのモデルを比較したりする。言語モデルは動的でデータから学習することを意図しているため、いくつかの提案されたモデルは、学習曲線の検査を通じて学習率を調査する。
言語処理システムの評価のために多数のデータセットが開発されている。これらには、Massive Multitask Language Understanding(MMLU)、Corpus of Linguistic Acceptability、GLUEベンチマーク、Microsoft Research Paraphrase Corpus、Multi-Genre Natural Language Inference、Question Natural Language Inference、Quora Question Pairs、Recognizing Textual Entailment、Semantic Textual Similarity Benchmark、SQuAD質問応答テスト、Stanford Sentiment Treebank、Winograd NLI、BoolQ、PIQA、SIQA、HellaSwag、WinoGrande、ARC、OpenBookQA、NaturalQuestions、TriviaQA、RACE、BIG-bench hard、GSM8k、RealToxicityPrompts、WinoGender、CrowS-Pairsが含まれる。これらのベンチマークは、言語理解と生成のさまざまな側面を評価し、モデル性能を比較するための標準化された尺度を提供する。
今後の方向性
大規模言語モデルが進化し続ける中、次トークン予測は依然として基礎的な目的であるが、研究者はバリエーションと拡張を模索している。これらには、人間からのフィードバックによる強化学習を組み込んだ目的や、効率と文脈処理を改善するアーキテクチャが含まれる。AWS TrainiumやCerebrasシステムなどの専用ハードウェアの継続的な開発は、これらのモデルを大規模に訓練および展開するための計算需要をサポートすることを目的としている。