BERTオープンソースリリース

英語からの翻訳

BERT(Bidirectional Encoder Representations from Transformers)は、2018年10月にGoogleが発表した、トランスフォーマーアーキテクチャに基づく事前学習済み言語モデルです。マスク言語モデリングと次文予測を通じて文脈に応じた単語表現を学習し、自然言語処理を大幅に進歩させました。

BERT(Bidirectional Encoder Representations from Transformers)は、2018年10月にGoogleの研究者によって発表された言語モデルです。自己教師あり学習を用いてテキストをベクトルの系列として表現することを学習し、エンコーダーのみのトランスフォーマーアーキテクチャを採用しています。BERTは大規模言語モデルの最先端技術を劇的に改善し、2026年時点でも自然言語処理(NLP)研究における一般的な方法論的構成要素として残っています。

BERTは、マスク付きトークン予測と次文予測を用いて訓練され、ELMoGPT-2と同様に、文脈におけるトークンの文脈的で潜在的な表現を学習することができます。これは、照応解決や多義語解決など、多くのNLPタスクに応用されました。BERTはELMoを改善し、「BERTology」と呼ばれる、BERTが学習する内容を解釈しようとする研究分野を生み出しました。

アーキテクチャ

BERTは「エンコーダーのみ」のトランスフォーマーアーキテクチャです。大まかに言えば、BERTは4つのモジュールで構成されています:トークナイザー、埋め込みモジュール、エンコーダースタック、タスクヘッドです。トークナイザーは英語のテキストを整数の系列(トークン)に変換します。埋め込みモジュールはトークンを実数値ベクトルに変換します。エンコーダースタックは、自己注意を備えるが因果マスキングを備えないトランスフォーマーブロックで構成されています。タスクヘッドは、最終表現ベクトルをトークンタイプ上の確率分布に変換し、アン埋め込み層として機能します。

タスクヘッドは事前訓練に必要ですが、質問応答や感情分類などの下流タスクではしばしば不要です。そのようなタスクでは、タスクヘッドは削除され、タスクに適した新しく初期化されたモジュールに置き換えられ、その後微調整が行われます。潜在ベクトル表現はこの新しいモジュールに直接供給され、サンプル効率の高い転移学習を可能にします。

埋め込み

BERTのトークナイザーはWordPieceであり、バイトペア符号化に類似したサブワード戦略です。その語彙サイズは30,000であり、語彙に現れないトークンは[UNK]に置き換えられます。埋め込み層には3つの構成要素があります:トークンタイプ埋め込み、位置埋め込み、セグメントタイプ埋め込みです。トークンタイプ埋め込みは、ワンホットベクトルをトークンタイプに基づいて密ベクトルに変換します。位置埋め込みは絶対位置を使用し、各次元は位置の正弦関数で構成されます。セグメントタイプ埋め込みは0または1の語彙を使用し、トークンが最初または2番目のテキストセグメントに属するかどうかを示します([SEP]特殊トークン後のトークンはタイプ1です)。3つの埋め込みベクトルは加算され、LayerNormで正規化され、各トークンに対して768次元のベクトルを出力します。これらのベクトルは12個のトランスフォーマーエンコーダーブロックを通過し、アフィン変換を介して30,000次元の語彙空間にデコードされます。

アーキテクチャファミリー

エンコーダースタックには2つの自由パラメータがあります:L(層数)とH(隠れサイズ)です。常にH/64個の自己注意ヘッドがあり、フィードフォワード/フィルターサイズは常に4Hです。これらのパラメータを変えることで、BERTモデルのファミリーが得られます。表記はL/Hです:BERTBASEは12L/768H、BERTLARGEは24L/1024H、BERTTINYは2L/128Hです。

訓練

事前訓練

BERTは、マスク付き言語モデリング(MLM)と次文予測(NSP)の2つのタスクで同時に事前訓練されました。MLMでは、BERTは1つの単語がランダムにマスクされる可能性のある単語の系列を入力し、元の単語を予測します。これにより、BERTは双方向の文脈を学習し、両方向から単語間の関係を同時に理解できます。NSPでは、BERTは1つの文が別の文に論理的に続くかどうかを予測するように訓練され、これは質問応答や文書分類などのタスクに重要です。

#### マスク付き言語モデリング

マスク付き言語モデリングでは、トークンの15%がマスク予測タスク用にランダムに選択されます。選択されたトークンは、80%の確率で[MASK]トークンに置き換えられ、10%の確率でランダムな単語トークンに置き換えられ、10%の確率で変更されません。この戦略は、訓練中の入力分布が推論時と異なるデータセットシフト問題を回避します。

リリースと影響

BERTは元々英語で2つのモデルサイズで実装されました:BERTBASE(1億1000万パラメータ)とBERTLARGE(3億4000万パラメータ)です。両方とも、Toronto BookCorpus(8億語)と英語版Wikipedia(25億語)で訓練されました。重みはGitHubで公開され、モデルが広く利用可能になりました。2020年3月11日には、24の小さなモデルが公開され、最小のBERTTINYはわずか400万パラメータでした。

BERTのリリースは、自然言語処理の分野に深遠な影響を与えました。質問応答、感情分析、固有表現認識など、幅広いタスクで新しいベンチマークを設定しました。その成功は事前訓練と微調整のパラダイムを普及させ、GPT-2RoBERTaなどの後続モデルに影響を与えました。BERTはまた、解釈可能性の研究を刺激し、「BERTology」がモデルが学習する内部表現を理解するための分野として登場しました。

応用と遺産

BERTの文脈的埋め込みは、照応解決、多義語解決、機械翻訳など、多くのタスクに応用されています。そのアーキテクチャはさまざまな言語やドメインに適応され、多くのNLPシステムのベースラインとして残っています。2026年時点でも、BERTはGPT-3T5などのより大きなモデルの台頭にもかかわらず、NLP研究と産業応用における基礎的なツールであり続けています。その影響は、トランスフォーマーベースのモデルの広範な採用と大規模言語モデルの開発に明らかです。

BERTのリリースはまた、DistilBERTALBERTなどの効率的なモデルバリアントの進歩を促進し、計算コストを削減しながら性能を維持することを目指しています。マスク付き言語モデリングや次文予測などのモデルの設計原則は、多くの後続アーキテクチャに組み込まれ、BERTの遺産を現代NLPの礎として確固たるものにしています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:natural-language-processing·transformer·google·machine-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴