マスク言語モデリング(MLM)は、自然言語処理において使用される自己教師あり学習の目的であり、モデルは周囲の文脈に基づいて、シーケンス内でランダムにマスクされたトークンを予測するように訓練される。左から右へ次のトークンを予測する従来の言語モデルとは異なり、MLMはモデルが左右両方の文脈を使用することを可能にし、言語のより深い双方向理解を可能にする。このアプローチは、2018年にGoogleによって導入されたTransformerベースのモデルであるBERT(Bidirectional Encoder Representations from Transformers)によって普及し、それ以来、多くの大規模言語モデルや深層学習システムの基盤となっている。
MLMの核となるアイデアは、入力テキストの一部を特殊な[MASK]トークンに置き換えて破損させ、モデルに元のトークンを再構築させることである。これにより、モデルは構文的および意味的関係を捉える文脈表現を学習することを余儀なくされる。MLMは、人間によるラベル付きデータを必要としない人工知能トレーニングの一形態であり、膨大なテキストコーパスでの事前学習に非常にスケーラブルである。
歴史的背景
テキスト内の欠落した単語を予測するという概念は、初期の統計モデルやニューラルモデルにルーツを持つが、MLMの現代的な定式化は深層学習の出現とともに登場した。2018年、Google AIのJacob Devlinらは、主要な事前学習目的としてMLMを使用するBERTを導入した。BERTの成功は、双方向の事前学習が、質問応答や感情分析を含む幅広い自然言語処理タスクのパフォーマンスを大幅に向上させ得ることを実証した。
BERT以前は、ELMoのようなモデルは双方向LSTMを使用していたが、深い方法で両方向を同時に条件付けすることはなかった。2017年にVaswaniらによって導入されたTransformerアーキテクチャは、BERTの双方向注意メカニズムの基盤を提供した。MLMは、BERTをGPTのような初期の一方向モデルと区別する重要な革新となった。
マスク言語モデリングの仕組み
典型的なMLMセットアップでは、トレーニングシーケンスは次のように処理される:
- トークン化:入力テキストは、トークナイザー(例:WordPiece)を使用してトークンに分割される。
- マスキング:トークンのランダムなサブセット(通常15%)が選択される。選択された各トークンについて、80%の確率で[MASK]に置き換え、10%の確率でランダムなトークンに置き換え、10%の確率で変更しない。
- 予測:モデルはマスクされたシーケンスを処理し、各マスク位置の語彙に対する確率分布を出力する。
- 損失:損失は、予測分布と真のトークンとの間の交差エントロピーとして計算され、勾配が逆伝播されてモデルの重みが更新される。
「ランダム置換によるマスクLM」として知られるこのマスキング戦略は、事前学習([MASK]が出現する)と微調整([MASK]が存在しない)の間のミスマッチを軽減するためにBERTで導入された。
利点と制限
MLMにはいくつかの利点がある:
- 双方向文脈:モデルはトークンの両側からの情報を活用でき、より豊かな表現につながる。
- スケーラビリティ:事前学習はラベルなしテキストで行えるため、モデルは大規模なコーパスから学習できる。
- 転移学習:下流タスクで事前学習済みMLMモデルを微調整すると、限られたラベル付きデータで最先端の結果が得られることが多い。
しかし、MLMには制限もある:
- 計算コスト:トレーニングにはかなりの計算リソースが必要であり、AWS TrainiumやCerebrasシステムのような専用ハードウェアを使用することが多い。
- マスキングの非効率性:トレーニングステップごとに予測に使用されるトークンはごく一部であり、自己回帰法よりもサンプル効率が低い。
- 事前学習と微調整のミスマッチ:[MASK]トークンは微調整中には存在せず、分布シフトを引き起こす可能性がある。
変種と改良
MLMの制限に対処するために、いくつかの変種が提案されている:
- RoBERTa:Facebook AI(現在のMeta AI)によって開発されたRoBERTaは、次文予測目的を削除し、エポックごとにマスキングパターンが変化する動的マスキングを使用する。また、より大きなバッチとより多くのデータでトレーニングする。
- ALBERT:パラメータ共有と文順序予測を導入してメモリ使用量を削減しつつ、パフォーマンスを維持する。
- ELECTRA:置換トークン検出タスクを使用し、モデルは生成器によって生成された置換から実際のトークンを区別することを学習するため、トレーニングがより効率的になる。
- スパンベースのマスキング:SpanBERTのようなモデルは、個々のトークンではなく連続したトークンのスパンをマスクし、スパン関連タスクのパフォーマンスを向上させる。
これらの変種は、さまざまな大規模言語モデルで採用され、新しいアーキテクチャの設計に影響を与えてきた。
現代のAIにおける応用
MLMは、汎用言語モデルの事前学習だけでなく、ドメイン固有モデルでも使用されている。例えば、BioBERTは生物医学テキストにMLMを適用し、ClinicalBERTは臨床ノートでトレーニングされている。さらに、MLMはマスク自動エンコーダー(画像用のMAEなど)を通じて、画像や音声などの他のモダリティにも拡張されている。
生成AIの文脈では、MLMは双方向と自己回帰の目的を組み合わせたハイブリッドモデル(T5やBARTなど)のコンポーネントとしてよく使用され、これらはMLMに似たノイズ除去目的を使用するが、シーケンス間アーキテクチャを備えている。
他の事前学習目的との関係
MLMは、機械学習分野におけるいくつかの事前学習目的の1つである。他には以下がある:
- 自己回帰モデリング:与えられた前のトークンから次のトークンを予測する(例:GPT)。これは一方向であり、OpenAIのような多くの大規模言語モデルの基盤である。
- シーケンス間ノイズ除去:T5やBARTのようなモデルは入力を破損させ、モデルに元のシーケンスを再構築するようトレーニングする。これはMLMの一般化された形態と見なすことができる。
- 対照学習:SimCSEのようなモデルで使用され、類似した文を引き寄せ、異なる文を引き離すことで文埋め込みを学習する。
MLMの双方向性は、固有表現認識や関係抽出など、完全な文脈の理解を必要とするタスクに特に適している。
分野への影響
BERTによるMLMの導入は、自然言語処理におけるパラダイムシフトを示した。単純な目的で大規模コーパスで事前学習を行うことで、幅広いタスクにうまく転移する表現が得られることを実証した。これにより、DistilBERT、TinyBERT、MobileBERTなど、モデルサイズを削減しつつパフォーマンスを維持することを目的とした多数のBERT類似モデルが開発された。
MLMはまた、コンピュータビジョン(例:BEiT、MAE)や音声処理(例:wav2vec 2.0)など、他のドメインのTransformerベースモデルの設計にも影響を与えた。マスキングと再構築の概念は、自己教師あり学習における一般的な原則となっている。
今後の方向性
2025年現在、より効率的で効果的な事前学習目的の研究が続けられている。いくつかの方向性は以下の通り:
- 統合モデル:MLMと自己回帰目的を単一モデルで組み合わせる。UniLMやXLNet(順列言語モデリングを使用)のようなモデルに見られる。
- 効率的な注意:双方向注意の計算コストを削減し、より長いシーケンスでのMLMを可能にする。
- マルチモーダルMLM:テキスト、画像、音声を共同でモデル化するためにMLMを拡張する。CLIPやFlamingoのようなモデルに見られる。
Google DeepMind、OpenAI、Anthropicなどの企業は事前学習研究に投資を続けており、MLMは彼らのツールキットにおける基本的な技術であり続けている。
結論
マスク言語モデリングは、現代のAIにおける基礎的な技術となり、モデルがラベルなしテキストから豊かな双方向表現を学習することを可能にした。2018年のBERTによる導入は、自然言語処理の分野に革命をもたらし、それ以来、さまざまなモダリティやアーキテクチャに適応されてきた。新しい目的やモデルが登場しているが、マスキングと再構築のMLMの原則は、最先端システムの設計に影響を与え続けている。分野が進歩するにつれて、MLMはより有能で効率的なAIモデルの開発における重要なコンポーネントであり続けるだろう。