英語からの翻訳

XLNetは、自然言語処理のための自己回帰型Transformerモデルであり、2019年6月にBERTの改良版として公開された。順列言語モデリングを用いて双方向の文脈を捉え、様々なタスクで最先端の結果を達成している。

XLNetは、2019年6月19日に導入された、人工知能モデルであり、自然言語処理のための自己回帰型トランスフォーマーアーキテクチャである。これはBERTの改良として設計され、マスク言語モデリングの限界に対処するため、置換言語モデリングを用いて双方向の文脈を捕捉することを目指した。このモデルは3億4000万のパラメータを持ち、330億語のコーパスで訓練され、言語モデリング、質問応答、自然言語推論などのタスクで最先端の結果を達成した。Apache 2.0ライセンスの下で公開され、研究用および商用利用の両方で自由に利用できる。

XLNetは、大規模言語モデルの広範なファミリーに属しており、これらは膨大なテキストコーパスで訓練されたニューラルネットワークシステムであり、人間の言語を理解・生成するために使用される。その開発は、深層学習トランスフォーマーアーキテクチャの進歩に基づいており、このアーキテクチャは2017年の導入以来、この分野に革命をもたらした。テキストを固定された左から右、または右から左の順序で処理する初期のモデルとは異なり、XLNetは文のすべての可能な置換を考慮する新しい訓練目的を導入し、左右両方の文脈から同時に学習することを可能にした。

アーキテクチャ

XLNetの中核的な革新は、置換言語モデリングである。標準的な自己回帰モデリングでは、「My dog is cute」のような文は、各単語が以前のすべての単語を条件として予測される条件付き確率の積として分解される: Pr(My) × Pr(dog|My) × Pr(is|My, dog) × Pr(cute|My, dog, is)。この左から右への順序は、モデルが将来の文脈を使用する能力を制限する。しかし、XLNetは訓練中に単語の順序をランダムに置換する。例えば、置換順序が3-2-4-1の場合、モデルは最初に「is」を予測し、次に「dog」、次に「cute」、最後に「My」を予測し、各回でその置換内で既に生成された単語を条件とする。すべての可能な置換で訓練することにより、モデルはBERTと同様の双方向の文脈を使用することを学習するが、BERTが依存する人工的な[MASK]トークンは使用しない。

二流自己注意機構

置換言語モデリングを実装するために、XLNetは二流自己注意機構を使用する。最初の流れはコンテンツ流と呼ばれ、標準的な因果マスク付き自己注意を使用して各単語の実際の内容を符号化し、典型的なトランスフォーマーデコーダーに類似している。2番目の流れはクエリ流と呼ばれ、置換内でこれまでに生成された文脈の中で各単語の内容を符号化する。これは、クエリがクエリ流から来て、キーと値のペアがコンテンツ流から来るマスク付きクロスアテンション機構を使用する。この分離により、モデルは自身の内容を見ずに単語を予測でき、これは置換目的に不可欠である。2つの流れは訓練中に結合され、推論中はコンテンツ流のみが使用される。

訓練と性能

XLNetは、書籍、ウェブページ、その他のソースからのテキストを含む330億語の大規模なコーパスで訓練された。訓練プロセスは置換言語モデリング目的を使用し、モデルは各訓練例に対してランダムに置換順序をサンプリングした。モデルの3億4000万のパラメータは、BERT-largeと同等のサイズであったが、その訓練目的により、いくつかのベンチマークでより良い性能を達成できた。例えば、複数のタスクにわたる自然言語理解をテストするGLUEベンチマークでは、XLNetは感情分析、質問応答、テキスト含意を含むほとんどのタスクでBERTを上回った。また、SQuAD質問応答データセットと言語モデリングのパープレキシティタスクで最先端の結果を達成した。

XLNetの顕著な利点の1つは、より長い範囲の依存関係を捕捉できることである。すべての置換を考慮するため、モデルは元の文で遠く離れた単語間の関係を学習でき、特定の置換で隣接している場合でも可能である。これは、文書分類や共参照解決など、グローバルな文脈の理解を必要とするタスクに特に有用である。

BERTとの比較

2018年に導入されたBERTは、マスク言語モデリング目的を使用し、入力トークンの一部が[MASK]に置き換えられ、モデルは元のトークンを予測するように訓練された。効果的ではあるが、このアプローチには限界がある: [MASK]トークンは微調整や推論中には存在せず、訓練と展開の間に不一致が生じる。さらに、BERTはマスクされたトークンが互いに独立していると仮定するが、これは常に真ではない。XLNetは、[MASK]トークンに依存せず、すべてのトークン間の依存関係を捕捉できる置換言語モデリングを使用することで、これらの問題に対処する。これにより、XLNetは訓練と推論の間でより一貫性があり、同時確率分布をより正確にモデル化できる。

しかし、置換アプローチには計算コストも伴う。XLNetは、各訓練例で複数の置換を処理する必要があるため、BERTよりも多くの訓練時間を必要とする。二流自己注意機構もアーキテクチャに複雑さを追加する。これらのコストにもかかわらず、性能の向上により、XLNetはリリース当時、多くのNLPアプリケーションで人気のある選択肢となった。

影響と遺産

XLNetは、機械学習と自然言語処理の分野に大きな影響を与えた。自己回帰モデルがマスク言語モデルの性能に匹敵するか、それを超えることができ、より原理的な訓練目的を提供することを実証した。その成功は、置換ベースおよび置換同変モデルへのさらなる研究を刺激した。ELECTRAやT5など、その後の多くのモデルがXLNetのアイデアに基づいて構築され、置換言語モデリングの概念は後の大規模言語モデルの設計に影響を与えた。XLNetはGPT-3やT5のようなより強力なモデルに取って代わられたが、生成AIトランスフォーマーベースのアーキテクチャの開発における重要なマイルストーンであり続けている。Apache 2.0ライセンスの下でのオープンソースリリースは、AI研究の民主化にも貢献し、世界中の研究者や開発者がモデルを使用・修正できるようにした。

参考文献

  • Yang, Z., Dai, Z., Yang, Y., Carbonell, J., Salakhutdinov, R., & Le, Q. V. (2019). XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv preprint arXiv:1906.08237.
  • Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint arXiv:1810.04805.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:natural-language-processing·transformer-models·deep-learning·language-models
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴