Yinfei Yang是一位计算机科学家,也是Google的研究科学家,因共同撰写了BERT而闻名,BERT是一种基于Transformer (architecture)的模型,推动了自然语言处理中表示学习的发展。他的研究兴趣包括自然语言生成、Sequence-to-Sequence (Seq2Seq)建模以及机器学习。他为人工智能在语言理解方面的理论基础和实际应用均做出了贡献。
职业与研究
Yang在Google Research工作,专注于自然语言理解和生成。他共同撰写了2018年引入BERT的论文,该模型成为大型语言模型的基础模型。他的其他 notable 工作包括通用句子编码器(Universal Sentence Encoder),这是一种学习句子嵌入的模型,已广泛用于生产系统。他还对文本生成研究做出了贡献,包括Encoder-Decoder Architecture架构和Multi-Head Attention机制的研究。他的研究通常涉及大规模训练的神经网络。
BERT与双向表示学习
BERT,即双向编码器表示来自变换器(Bidirectional Encoder Representations from Transformers),在2018年发表的论文“BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding”中引入。该模型使用带有位置编码、层归一化、残差连接和训练期间Dropout的变换器编码器。它使用掩码语言建模和下一句预测目标在大规模语料库上进行预训练。BERT-base包含1.1亿个参数,而BERT-large包含3.4亿个参数。该模型在多个自然语言处理基准上取得了最先进的结果,包括GLUE分数和SQuAD问答任务。其双向训练方法使其能够从两个方向捕捉上下文,从而提高了需要理解词语关系的任务性能。训练此类模型需要仔细的学习率调度和使用Adam优化器。
通用句子编码器
Yang共同撰写了通用句子编码器,这是一种将句子映射为固定长度向量的模型。该模型基于变换器架构,并在多种数据源上训练,包括网络新闻、问答页面和讨论论坛。它支持语义相似性、文本分类和聚类等任务的迁移学习。通用句子编码器已作为工具发布给开发者和研究人员,无需特定任务训练即可实现高效的句子级表示。这项工作在句子嵌入和语义搜索领域具有影响力。
自然语言生成与影响
Yang对自然语言生成的贡献包括序列到序列模型以及生成连贯且上下文相关文本的技术。在这一领域,诸如束搜索之类的解码策略通常用于提高输出质量。他的工作已应用于摘要、对话系统和问答等任务。他帮助开发的表示学习方法,尤其是BERT,对该领域产生了持久影响。它们使得下游任务的微调更加有效,并作为后续大型语言模型和生成式AI系统的构建模块。他在句子嵌入方面的工作也影响了语义文本相似性和检索的方法。