Yinfei Yangは、コンピュータ科学者であり、Googleの研究科学者である。彼は、Transformer (architecture)ベースのモデルであるBERTの共著者として知られており、このモデルは自然言語処理における表現学習を進展させた。彼の研究関心には、自然言語生成、Sequence-to-Sequence (Seq2Seq)モデリング、Machine learningが含まれる。彼は、言語理解におけるArtificial intelligenceの理論的基盤と実用的応用の両方に貢献してきた。
経歴と研究
YangはGoogle Researchで働き、自然言語理解と生成に焦点を当ててきた。彼は、BERTを紹介した2018年の論文を共著し、これは大規模言語モデルの基盤モデルとなった。彼の他の注目すべき業績には、文の埋め込みを学習するモデルであるUniversal Sentence Encoderがあり、これは本番システムで広く採用されている。彼はまた、Encoder-Decoder ArchitectureアーキテクチャやMulti-Head Attentionメカニズムに関する研究を含む、テキスト生成の研究にも貢献してきた。彼の研究は、大規模に訓練されたニューラルネットワークをしばしば伴う。
BERTと双方向表現学習
BERTは、Bidirectional Encoder Representations from Transformersの略であり、2018年に発表された論文「BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding」で紹介された。このモデルは、位置エンコーディング、層正規化、残差接続、および訓練中のDropoutを備えたtransformerエンコーダを使用する。これは、マスク言語モデリングと次文予測の目的を用いて大規模なコーパスで事前訓練された。BERT-baseには1億1000万のパラメータが含まれ、BERT-largeには3億4000万のパラメータが含まれる。このモデルは、GLUEスコアやSQuAD質問応答タスクを含む、いくつかの自然言語処理ベンチマークで最先端の結果を達成した。その双方向訓練アプローチにより、両方向からの文脈を捉えることができ、単語間の関係の理解を必要とするタスクの性能が向上した。このようなモデルの訓練には、慎重な学習率スケジューリングとAdamオプティマイザの使用が必要であった。
Universal Sentence Encoder
Yangは、文を固定長ベクトルにマッピングするモデルであるUniversal Sentence Encoderを共著した。このモデルはtransformerアーキテクチャに基づいており、ウェブニュース、質疑応答ページ、ディスカッションフォーラムなど、さまざまなデータソースで訓練された。これは、意味的類似性、テキスト分類、クラスタリングなどのタスクに対する転移学習をサポートする。Universal Sentence Encoderは、開発者や研究者向けのツールとして公開されており、タスク固有の訓練を必要とせずに効率的な文レベルの表現を可能にする。この研究は、文埋め込みと意味検索の分野で影響力を持っている。
自然言語生成と影響
Yangの自然言語生成への貢献には、シーケンス間モデルや、一貫性があり文脈に関連したテキストを生成するための技術に関する研究が含まれる。この分野では、ビームサーチなどの復号戦略が、出力品質を向上させるために一般的に使用される。彼の研究は、要約、対話システム、質問応答などのタスクに応用されてきた。彼が開発に貢献した表現学習手法、特にBERTは、この分野に永続的な影響を与えてきた。これらは、下流タスクのより効果的な微調整を可能にし、その後の大規模言語モデルや生成AIシステムの構成要素として機能した。彼の文埋め込みに関する研究は、意味的テキスト類似性と検索へのアプローチにも影響を与えた。