BERT(Bidirectional Encoder Representations from Transformers)は、2018年10月にGoogleの研究者によって発表された言語モデルである。自己教師あり学習を用いてテキストをベクトルの系列として表現することを学習し、エンコーダーのみのトランスフォーマーアーキテクチャを採用している。BERTは大規模言語モデルの最先端を劇的に改善し、2026年時点でも自然言語処理(NLP)研究における一般的な方法論的構成要素であり続けている。
BERTは、マスク付きトークン予測と次文予測を通じて訓練され、ELMoや後のGPT-2などの初期モデルと同様に、文脈におけるトークンの文脈的・潜在表現を学習する。これは、共参照解決や多義性解決を含む多くのNLPタスクに応用された。ELMoに対するその成功は、モデルが何を学習するかを解釈しようとする「BERTology」の研究を生み出した。
アーキテクチャ
BERTはエンコーダーのみのトランスフォーマーアーキテクチャであり、トークナイザー、埋め込み層、エンコーダースタック、タスクヘッドの4つの主要モジュールで構成されている。トークナイザーは英語のテキストを整数(トークン)の系列に変換する。埋め込み層はこれらのトークンを実数値ベクトルに変換する。エンコーダースタックは、自己注意を備えるが因果マスクを持たないトランスフォーマーブロックで構成され、これらのベクトルを処理する。タスクヘッドは最終表現ベクトルをトークンタイプ上の確率分布に変換し、アンエンベッディング層として機能する。
タスクヘッドは事前訓練に不可欠であるが、質問応答や感情分類などの下流タスクではしばしば不要である。そのような場合、タスクヘッドは削除され、タスクに適した新しく初期化されたモジュールに置き換えられ、微調整される。潜在ベクトル表現はこの新しいモジュールに直接供給され、サンプル効率の高い転移学習を可能にする。
埋め込み
BERTのトークナイザーは、バイトペアエンコーディングに類似したサブワード戦略であるWordPieceを使用し、語彙サイズは30,000である。語彙にないトークンは[UNK]に置き換えられる。埋め込み層には、トークンタイプ埋め込み、位置埋め込み、セグメントタイプ埋め込みの3つのコンポーネントがある。トークンタイプ埋め込みはワンホットベクトルを密ベクトルに変換する。位置埋め込みは絶対位置を使用し、各次元は位置の正弦関数である。セグメントタイプ埋め込みは0または1の語彙を使用し、トークンが[SEP]トークンで区切られた最初または2番目のテキストセグメントに属するかどうかを示す。
これら3つの埋め込みベクトルは加算され、LayerNormで正規化され、BERTBASEでは各トークンに対して768次元のベクトルを生成する。ベクトルは12個のトランスフォーマーエンコーダーブロックを通過し、基本的なアフィン変換を介して30,000次元の語彙空間にデコードされる。
アーキテクチャファミリー
エンコーダースタックには、L(層数)とH(隠れサイズ)の2つの自由パラメータがある。常にH/64個の自己注意ヘッドがあり、フィードフォワードまたはフィルターサイズは常に4Hである。LとHを変えることでモデルのファミリーが得られる。表記はL/Hであり、BERTBASEは12L/768H、BERTLARGEは24L/1024H、BERTTINYは2L/128Hである。
訓練
BERTは、マスク付き言語モデリング(MLM)と次文予測(NSP)の2つのタスクで同時に事前訓練された。MLMでは、BERTは1つの単語がランダムにマスクされる可能性のある単語の系列を入力し、元の単語を予測する。これにより、双方向の文脈が学習され、両方向から同時に単語間の関係を理解する。NSPでは、BERTは1つの文が別の文に論理的に続くかどうかを予測し、質問応答や文書分類などのタスクに役立つ。
マスク付き言語モデリング
MLMでは、トークンの15%がマスク予測タスク用にランダムに選択される。選択されたトークンは、80%の確率で[MASK]トークンに置き換えられ、10%の確率でランダムな単語トークンに置き換えられ、10%の確率で変更されない。この部分的なマスキングは、訓練中の入力分布が推論時と異なるデータセットシフトを回避する。すべての選択トークンがマスクされた場合、モデルは推論時にマスクされていない入力をうまく処理できない可能性がある。
モデルサイズとリリース
BERTは当初、英語で2つのサイズで実装された:1億1000万パラメータのBERTBASEと3億4000万パラメータのBERTLARGEである。両方ともトロントBookCorpus(8億語)と英語版ウィキペディア(25億語)で訓練された。重みはGitHubで公開された。2020年3月11日には、24の小型モデルが公開され、最小のBERTTINYはわずか400万パラメータであった。これらの小型モデルは、より広範な実験とリソース制約のある環境での展開を可能にした。
影響と遺産
BERTの導入はNLPにおける重要な転換点を示し、一方向モデルから双方向文脈理解への移行を促進した。その事前訓練と微調整のパラダイムは標準的なアプローチとなり、GPT-2などの後続モデルや大規模言語モデルの広範な発展に影響を与えた。BERTのアーキテクチャと訓練方法は、分野全体で広く採用・適応され、現代の機械学習と人工知能における基礎的技術としての地位を確立している。