BERT(Bidirectional Encoder Representations from Transformers)は、2018年10月にGoogleが公開した言語表現モデルである。これは、Transformer (architecture)アーキテクチャを言語理解に応用した最初期の広く影響力のある事例の一つであり、その公開は、transformerベースのPretrainingをNatural language processingにおける支配的なパラダイムに変えた転換点としてしばしば言及される。
アーキテクチャと学習
BERTは、transformerアーキテクチャのエンコーダ部分のみを使用しており、後にGPTシリーズで採用されたデコーダベースの自己回帰設計とは対照的である。これは、自己教師あり学習の2つの目的で学習される。1つはマスク付き言語モデリングであり、文中のランダムな単語が隠され、モデルが双方向の文脈を用いてそれらを予測する。もう1つは次文予測であり、モデルがある文が別の文の後に続くかどうかを学習する。この双方向学習により、BERTは前後の文脈の両方を同時に考慮した表現を構築でき、word2vecやELMoなどの初期の一方向または浅い双方向アプローチよりも優れていた。
BERTは複数のサイズで公開され、特にBERT-base(1億1000万パラメータ)とBERT-large(3億4000万パラメータ)が代表的であり、後の基準では控えめだが当時としては大規模であった。Googleは事前学習済みの重みを公開し、研究者が質問応答、感情分析、固有表現認識などの特定の下流タスクに対して、比較的少量のタスク固有データでモデルをファインチューニングできるようにした。
影響
公開時、BERTはGLUEスイートやSQuAD質問応答データセットを含む広範なNLPベンチマークで、従来手法を大幅に上回る最先端の結果を達成した。その「事前学習してからファインチューニング」というパラダイムは、この分野で急速に採用され、その後のエンコーダおよびエンコーダ・デコーダモデルの設計に直接影響を与えた。Googleは2019年からBERTを中核的な検索ランキングシステムに組み込み、特に長く会話的なクエリの意図を理解する上で、検索関連性における数年間で最も重要な改善の一つと述べた。
生成的モデルとの関係における遺産
BERTは、GPT-2、GPT-3およびその後継によって定義される大規模言語モデル時代より前に登場し、そのエンコーダのみで非生成的な設計は、自己回帰モデルのように自由形式のテキストを生成することができない。それにもかかわらず、BERTとその多くの派生モデル(RoBERTa、ALBERT、DistilBERTを含む)は、生成が不要で効率が重要な分類、検索、埋め込みタスクにおいて2020年代まで広く使用され続け、BERTスタイルのエンコーダは、より大規模な検索およびセマンティック検索システム内のコンポーネントとして、一部の検索拡張生成パイプラインの構成要素としても機能し続けた。Christopher Manningなどの学術NLP研究者は、BERTの公開が、ラベル付きデータセットに主に依存する手法よりも、ラベルなしテキストでの大規模な自己教師あり事前学習が優れていることを実証した極めて重要な瞬間であると指摘しており、この教訓は後の生成的言語モデルのスケーリング哲学に直接受け継がれた。