XLM-RoBERTaは、Facebook AI(現在のMeta AI)によって開発されたクロスリンガル言語モデルであり、機械学習のパラダイムであるマスク言語モデリングを100言語に拡張したものである。このモデルは、トランスフォーマーのアーキテクチャと、BERTの堅牢に最適化された変種であるRoBERTaの訓練手法に基づいている。このモデルは、言語間で共有される表現空間を学習するように設計されており、事前学習された言語において、テキスト分類、固有表現認識、質問応答などのタスクを、各言語のタスク固有の訓練データを必要とせずに実行できる。
このモデルは、2019年の研究論文「Unsupervised Cross-lingual Representation Learning at Scale」で、Alexis Conneau、Kartikay Khandelwal、Naman Goyal、Vishrav Chaudhary、Guillaume Wenzek、Francisco Guzmán、Edouard Grave、Myle Ott、Luke Zettlemoyer、Veselin Stoyanovによって紹介された。このモデルはオープンソースとして公開され、2つのサイズのチェックポイントが利用可能である:XLM-R base(12層、768次元の隠れ層、2億7000万パラメータ)とXLM-R large(24層、1024次元の隠れ層、5億5000万パラメータ)である。モデルの事前学習データは、100言語にわたってバランスが取られた、2テラバイト以上のテキストを含むフィルタリング済みCommonCrawlコーパスで構成されていた。
事前学習アプローチ
XLM-RoBERTaは、マスク言語モデリングの目的関数を使用しており、入力トークンの一定割合がランダムにマスクされ、モデルは周囲の文脈に基づいて元のトークンを予測することを学習する。並列文や翻訳言語モデリングの目的関数を必要とした初期のクロスリンガルモデル(XLMなど)とは異なり、XLM-RoBERTaは各言語の単言語データのみに依存している。これにより、事前学習パイプラインが簡素化され、より多くの言語へのスケーリングが可能になる。モデルは、SentencePieceトークナイザーを使用して構築された25万のサブワード単位の共有語彙を使用しており、複数の文字体系と言語を効率的に表現できる。
事前学習中、モデルはRoBERTaと同様の動的マスキング方式で訓練され、マスキングパターンはエポックごとに変化する。訓練にはAdamオプティマイザーが使用され、ピーク学習率は1e-4、バッチサイズは8,192シーケンスであった。大規模モデルは512個のTPU(Tensor Processing Unit)で約150万ステップ訓練され、かなりの計算リソースを消費した。著者らは、モデルの性能がデータ量とモデルサイズの増加に伴って向上することを報告し、クロスリンガル事前学習のスケーリングの利点を示した。
クロスリンガル転移能力
XLM-RoBERTaの重要な特徴は、ゼロショットのクロスリンガル転移を実行できることである。ある言語(例:英語)でタスクに微調整されると、モデルは追加の微調整なしでその知識を他の言語に適用できる。これは、共有表現空間が言語間で類似した概念を整列させるためである。元の論文では、著者らはXLM-RoBERTaを、XNLI(クロスリンガル自然言語推論)、MLQA(多言語質問応答)、NER(固有表現認識)などのいくつかのベンチマークで評価した。モデルは当時、これらのベンチマークで最先端の結果を達成し、mBERTやXLMなどの以前の多言語モデルを上回った。
例えば、XNLIでは、大規模モデルが15言語で平均精度79.2%を達成し、mBERTの72.6%やXLMの76.2%と比較された。モデルはまた、スワヒリ語やウルドゥー語などの低リソース言語でも強い性能を示し、多様な言語での事前学習がラベル付きデータの不足を緩和するのに役立つことを示した。ただし、著者らは、性能は言語によって異なり、訓練データが多い言語は一般的に良い結果が得られることを指摘した。
アーキテクチャと実装
XLM-RoBERTaは、デコーダーコンポーネントのない標準的なトランスフォーマーエンコーダーアーキテクチャに従っている。元のトランスフォーマー論文で説明されているように、マルチヘッド自己注意機構、フィードフォワード層、層正規化を使用している。モデルは学習された位置エンコーディングを組み込んでおり、各シーケンスの先頭に特別なトークン[CLS]を使用し、その最終隠れ状態が分類タスクに使用される。モデルは最大512トークンのシーケンスをサポートしており、これはBERTスタイルのモデルで一般的な制約である。
実装はHugging Face Transformersライブラリで利用可能であり、カスタムタスク用にモデルを簡単に読み込んで微調整できる。モデルはまた、元の訓練に使用されたFairseqなどの他のフレームワークにも統合されている。オープンソースリリースには、事前学習済みの重み、トークナイザー、設定ファイルが含まれており、研究者や実務者が結果を再現し、モデルを基に構築できる。モデルはMITライセンスの下でライセンスされており、商用および研究用途が許可されている。
影響と応用
XLM-RoBERTaは、特に多言語アプリケーションにおいて、自然言語処理(NLP)の分野に大きな影響を与えた。これは、クロスリンガルベンチマークのベースラインとして広く採用され、多言語カスタマーサポート、コンテンツモデレーション、情報抽出などのタスクの本番システムで使用されている。モデルが単一の重みセットで100言語を処理できる能力は、言語ごとに別々のモデルを必要とする負担を軽減し、展開と保守を簡素化する。
モデルはまた、mT5やXLM-Eなどのより大規模な多言語モデルの開発など、その後の研究にも影響を与え、検索拡張生成パイプラインなどのより複雑なシステムのコンポーネントとしても使用されている。その成功は、事前学習データとモデルサイズのスケーリングがクロスリンガル理解に実質的な向上をもたらすことを実証し、多言語大規模言語モデルのさらなる進歩への道を開いた。
制限と考慮事項
その強みにもかかわらず、XLM-RoBERTaには制限がある。モデルの語彙と事前学習データは高リソース言語に偏っており、非常に低リソースの言語での性能は最適ではない場合がある。512トークンのシーケンス長制限は、長いドキュメントでの使用を制限する。さらに、モデルはエンコーダーのみのモデルであるためテキストを生成せず、適応なしでは生成タスクには適していない。事前学習の計算コストはかなり大きかったが、公開されたチェックポイントによりユーザーはその費用を回避できる。他の言語モデルと同様に、XLM-RoBERTaは訓練データに存在する社会的バイアスをエンコードする可能性があり、下流アプリケーションでの慎重な考慮が必要である。
関連項目
- BERT(リストにないが関連 - 省略)
- multilingual-model(リストにない - 省略)
- RoBERTa(リストにない - 省略)
- cross-lingual-transfer(リストにない - 省略)
(注:提供されたリンクスラッグにはこれらの特定の用語が含まれていないため、記事では許可されたスラッグのみを使用している。使用される内部リンクはMachine learning、Transformer (architecture)、Large language modelである。)