自己回帰モデル

英語からの翻訳

自己回帰モデルは、一度に一つの要素を生成し、これまでに生成されたトークンから新しいトークンを予測します。これは、GPTスタイルの大規模言語モデルの基盤となる生成メカニズムです。

自己回帰モデルは、生成モデルの一種であり、系列を一度に一要素ずつ生成し、各新しい要素はそれ以前に生成されたすべての要素に条件付けられる。自然言語処理においては、これは、既に生成されたトークンの系列が与えられたときに次のトークンを予測し、そのトークンをフィードバックして次のトークンを予測することを意味する。この用語は統計学に由来し、自己回帰モデルは時系列の値を自身の過去の値から予測する。現代の大規模言語モデルは、同じ左から右への因子分解をテキストに適用している。

自己回帰生成は、OpenAIのGPTシリーズからAnthropicのClaude、MetaのLlamaに至るまで、大規模言語モデルに基づく現代のほとんどのチャットアシスタントの背後にあるデフォルトの復号戦略である。これは系列を生成する唯一の方法ではないが、2025年時点ではテキスト生成の支配的なパラダイムであり続けており、その変種は音声、コード、さらには一部の画像モデルにも使用されている。

歴史

統計的ARモデルは、コンピューティングが存在するずっと前の1920年代の時系列研究に遡る。言語モデリングでは、1980年代から1990年代のn-gramモデルは、計数された確率を用いて先行する固定ウィンドウの単語から単語を予測するという点で、精神としては自己回帰的であった。ニューラル自己回帰言語モデルは、リカレントニューラルネットワークと、その後LSTMネットワークとともに登場し、これらは系列をステップごとに処理し、各ステップで次の単語を予測した。このパラダイムは、トランスフォーマーアーキテクチャにもほぼそのまま引き継がれた。GPT-2とその後継モデルは、次のトークンを予測するように訓練されたデコーダーのみのトランスフォーマーであり、この目的はしばしば因果言語モデリングと呼ばれる。

仕組み

訓練中、自己回帰モデルはテキストのコーパスを提示され、各位置で、それ以前のすべてのトークンが与えられたときに次のトークンを予測するよう求められる。これは、ラベルが人間の注釈ではなくテキスト自体から得られるため、自己教師あり学習として知られるアプローチである。モデルの損失関数は、通常、予測された次トークン分布と実際の次トークンとの間の交差エントロピーである。推論時には、グリーディー復号、top-k、核サンプリングなどのサンプリング戦略が、モデルの予測確率分布から次のトークンをどのように選択するかを決定し、選択されたトークンは次の予測の前にコンテキストに追加され、このプロセスは終了トークンまたは長さ制限に達するまで繰り返される。

自己回帰と他のアプローチの比較

自己回帰モデルは、非自己回帰および拡散ベースのアプローチとは対照的である。画像や動画生成のほとんどに使用される拡散モデルは、出力全体を一度に生成し、ノイズを除去することで反復的に精緻化するものであり、要素ごとに生成するわけではない。一部の研究システムでは、速度向上のために非自己回帰テキスト生成が探求されており、2020年代半ばまでには少数の研究所が拡散ベースのテキストモデルを実験していたが、2025年までに言語生成の主流アプローチとして自己回帰復号を置き換えたものはなかった。Mambaなどの状態空間モデルも、逐次的に予測するという意味では自己回帰的であるが、トランスフォーマーの注意機構を異なる計算構造に置き換えている。

限界

自己回帰生成は本質的に逐次的であり、各トークンは前のトークンに依存するため、訓練時(教師強制を用いてすべての位置を同時に計算できる)と比較して、推論時の並列性が制限される。この逐次的なボトルネックは、投機的復号などの技術を動機付けた。これは、より小さなドラフトモデルを使用して複数のトークンを提案し、より大きなモデルがそれらを並列に検証するものである。自己回帰モデルはまた、小さな誤差を増幅する可能性がある。生成の初期におけるありそうにない、または不正確なトークンは、その後のすべてのトークンのコンテキストの一部となり、これは幻覚や、非常に長い生成における出力品質の低下に関連する動態である。

影響

自己回帰的な次トークン予測の目的は、現代AIの物語の中心である。それは単純で、ラベル付きデータを必要とせず、データと計算量に応じて予測可能にスケールする。この関係はスケーリング則の下で研究されている。その単純さは、単一の訓練目的が、タスク固有のアーキテクチャなしで翻訳、コーディング、推論が可能なモデルを生み出せる理由の一部であり、この汎用性は後に基盤モデルの概念として形式化された。

カテゴリ:deep-learning·natural-language-processing·model-architecture
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴