因果言語モデリングは、機械学習と深層学習における訓練目的の一つであり、モデルがシーケンス内の次のトークンを、先行するトークンのみを前提として予測するものである。この自己回帰的アプローチは、左から右への、または一方向の言語モデリングとも呼ばれ、OpenAIによって開発されたGPTシリーズを含む、多くの現代の大規模言語モデルの基盤を形成している。BERTのようなモデルで使用されるマスク言語モデリングとは異なり、因果言語モデリングは過去の文脈のみに注意を制限し、一貫性のあるテキストを一度に一トークンずつ効率的に生成することを可能にする。
この目的は、典型的にはトランスフォーマーアーキテクチャにおいて、各位置が未来の位置に注意を向けることを防ぐ因果的注意マスクを適用することで実装される。訓練中、モデルはトークンのシーケンスを提示され、各トークンの確率を、すべての先行トークンを条件として最大化することを学習する。この単純でありながら強力な定式化により、モデルは膨大なテキストデータから、構文、意味論、世界知識を含む言語の統計的規則性を学習することができる。
歴史的発展
因果言語モデリングのルーツは、1970年代に開発された統計的アプローチに遡る。IBMリサーチのフレデリック・ジェリネクと同僚たちは、音声認識のために確率的n-gramモデルを導入し、これは先行する単語の固定ウィンドウに基づいて次の単語を予測した。これらのモデルは、モデルの不確実性の情報理論的尺度としてパープレキシティを使用しており、これは今日でも使用されている指標である。
2000年代には、ヨシュア・ベンジオと共著者たちが、分散単語表現を学習するニューラル確率言語モデルを導入し、スパースなn-gramカウントを超えた。これに続いて、2010年にトマーシュ・ミコロフによって特に進展したリカレントニューラルネットワーク(RNN)言語モデルが登場し、理論的には隠れ状態を維持することで任意に長い依存関係を捉えることができた。しかし、RNNは勾配消失と並列化の制限に悩まされ、そのスケーラビリティを制約した。
2017年の論文「Attention Is All You Need」でGoogleとトロント大学の研究者たちによって導入されたトランスフォーマーアーキテクチャは、画期的な進展をもたらした。トランスフォーマーは自己注意を用いてシーケンス全体を並列に処理し、因果マスクと組み合わせることで、深い自己回帰モデルの効率的な訓練を可能にする。このアーキテクチャは、現代の因果言語モデルの基盤となった。
技術的基盤
因果言語モデリングは、トークン化されたテキストで動作し、単語やサブワードは整数インデックスにマッピングされる。モデルは、各位置について、先行するトークンを条件として、語彙全体にわたる確率分布を計算する。訓練損失は、典型的には、予測分布と実際の次のトークンとの間の交差エントロピーであり、訓練コーパス内のすべての位置で平均化される。
因果的注意マスクは重要な構成要素である。トランスフォーマーデコーダでは、各位置は自分自身までのすべての位置に注意を向けることができるが、未来の位置には注意を向けることはできない。これは、ソフトマックスを適用する前に、未来の位置に対する注意スコアを負の無限大に設定することで実装される。このマスキングにより、モデルが時間的因果性を尊重することが保証され、未来のトークンが未知である生成タスクに適している。
埋め込みは重要な役割を果たし、離散トークンを連続ベクトルにマッピングする。これらの学習された表現は、意味的および構文的類似性を捉え、モデルが未見の単語の組み合わせに一般化することを可能にする。位置エンコーディングは、自己注意が置換不変であるため、トークンの順序に関する情報を提供するために埋め込みに追加される。
訓練とスケーリング
因果言語モデルは、しばしば公開インターネットから収集された大規模なテキストコーパスで訓練される。訓練プロセスは、訓練データの負の対数尤度を最小化することを含み、典型的にはAdamのような適応的最適化器を用いた確率勾配降下法を使用する。訓練は計算集約的であり、NVIDIA GPUやAWS Trainiumのようなカスタムアクセラレータなどの専門ハードウェアを必要とする。
ジャレッド・カプランやダリオ・アモデイを含む研究者たちによって研究されたスケーリング則は、モデルの性能がモデルサイズ、データセットサイズ、および計算量の増加に伴って予測可能に向上することを示している。これにより、15億パラメータのGPT-2から1750億パラメータのGPT-3、その後1兆パラメータを超えるモデルへと、ますます大規模なモデルの開発が推進されてきた。そのようなモデルの訓練には、しばしばMicrosoft Azure、Google Cloud、またはOracle Cloudによって提供されるクラスタを使用して、数千のアクセラレータにわたる分散コンピューティングが必要である。
データ品質とキュレーションは重要である。モデルは典型的には、フィルタリングされたウェブテキスト、書籍、学術記事で訓練される。一部のモデルは、訓練データが難易度の増加順に提示されるカリキュラム学習を組み込んでいる。最終的な訓練コーパスには、低品質または有害なコンテンツを除去するための重複排除と品質フィルタリングが含まれることが多い。
アプリケーションと使用例
因果言語モデルは、幅広い自然言語処理アプリケーションを支えている。最も顕著なのはテキスト生成であり、モデルは一貫性のある段落、記事、コード、または創造的な文章を生成する。この能力は、AnthropicやInflection AIによって開発されたものなどのチャットボットや仮想アシスタントの基盤となっている。
生成以外にも、因果言語モデルは以下のために使用される:
- 機械翻訳。モデルはソーステキストを条件としてターゲット言語のテキストを生成する
- 要約。長い文書が短い要約に凝縮される
- 質問応答。モデルは文脈とクエリを前提として回答を生成する
- コード生成。GitHub Copilotのようなモデルによって実証されている
- 音声認識。音響特徴がテキストシーケンスに変換される
これらのモデルは、特定のタスクへのファインチューニングの基盤としても機能する。事前訓練された因果言語モデルで初期化し、タスク固有のデータで訓練することにより、開発者は比較的少数の例で高い性能を達成できる。これは転移学習として知られるプロセスである。
他のアーキテクチャとの比較
因果言語モデリングは、BERTのようなモデルで使用されるマスク言語モデリングとは根本的に異なる。マスクモデルは、双方向の文脈を前提としてランダムにマスクされたトークンを予測し、分類や固有表現認識のような理解タスクに適している。対照的に、因果モデルは生成に最適化されており、追加のファインチューニングなしで理解タスクに使用することはできない。
T5のようなエンコーダ-デコーダモデルは、双方向エンコーディングと自己回帰デコーディングを組み合わせている。これらのモデルは、生成が始まる前に完全な入力が利用可能である翻訳や要約のようなシーケンス間タスクでしばしば好まれる。しかし、純粋な因果モデルは多くのタスクで競争力のある性能を示しており、より単純なアーキテクチャを提供している。
リカレントニューラルネットワークは、歴史的に重要であるが、因果言語モデリングにおいてはトランスフォーマーに大部分が取って代わられている。トランスフォーマーは訓練中の並列化が優れており、注意メカニズムを通じてより長い範囲の依存関係を捉えることができる。しかし、RNNは厳格なメモリ制約やストリーミング要件を持つ特定のアプリケーションにとって依然として関連性がある。
評価とベンチマーク
因果言語モデルは、異なる能力をテストするさまざまなベンチマークを使用して評価される。パープレキシティは、モデルが保持されたテキストをどれだけよく予測するかを測定する、基本的な内在的指標として残っている。パープレキシティが低いほど予測性能が良いことを示すが、タスクの成功と常に相関するわけではない。
外在的評価は、タスク固有のベンチマークを使用する。これには以下が含まれる:
- Massive Multitask Language Understanding(MMLU)。57の科目にわたる知識をテストする
- HellaSwag。常識推論を評価する
- GSM8K。数学的推論を測定する
- BIG-bench。多様なタスクをカバーする共同ベンチマーク
- Winograd Schema Challenge。代名詞解決をテストする
これらのベンチマークは、典型的には、モデルが例や指示を与えられて回答を生成する必要がある、数ショットまたはゼロショット設定で実施される。人間による評価も、特にオープンエンドの生成タスクで使用され、有用性や無害性などの指標が評価される。
制限と課題
その印象的な能力にもかかわらず、因果言語モデルには重大な制限がある。それらは事実的に誤った情報を生成する可能性があり、これは幻覚として知られる現象である。また、訓練データに存在するバイアスを示す可能性があり、性別、人種、文化のステレオタイプを含む。これらの問題は、高リスクのアプリケーションでの展開に関する懸念を引き起こしている。
計算コストは相当なものである。大規模な因果言語モデルの訓練には、数百万ドルの計算とエネルギーが必要であり、環境への懸念を引き起こしている。推論もかなりのリソースを必要とするが、量子化や蒸留などの技術がコスト削減に役立つ。
因果モデルは、根本的には統計的パターンマッチャーであり、人間の言語理解の認知モデルではない。研究は、それらが時々人間が学習しないパターンを学習し、人間が通常学習するパターンを学習できないことを示している。これは、新しい状況について推論したり、世界の因果関係を理解したりする能力を制限する。
将来の方向性
因果言語モデリングの研究は進化し続けている。GPT-3のようなモデルで使用されるスパース注意メカニズムは、計算の複雑さを軽減する。Switch Transformerのようなモデルで採用されている混合専門家アーキテクチャは、比例的な計算増加なしにモデル容量を増加させる。
パラメータ効率的なファインチューニングや低ランク適応を含む効率的な訓練方法は、大規模モデルを特定のタスクに適応させることを容易にする。検索拡張生成は、因果言語モデルと外部知識ベースを組み合わせて、事実の正確性を向上させる。GPT-4のようなマルチモーダル拡張は、テキストに加えて画像と音声の理解を組み込む。
Cerebras、Groq、およびSambaNovaのような企業からのハードウェア革新は、訓練と推論の速度の限界を押し広げている。モデルがスケールし続けるにつれて、研究者たちはサンプル効率を改善し、幻覚を減らし、モデルを人間の価値観に合わせる方法を探求している。この分野は活発なままであり、新しいアーキテクチャと訓練技術が定期的に登場している。