Yinfei Yang é um cientista da computação e pesquisador do Google, reconhecido por ser coautor do BERT, um modelo baseado em Transformer (architecture) que avançou o aprendizado de representações no processamento de linguagem natural. Seus interesses de pesquisa incluem geração de linguagem natural, modelagem Sequence-to-Sequence (Seq2Seq) e Machine learning. Ele contribuiu tanto para os fundamentos teóricos quanto para as aplicações práticas da inteligência artificial na compreensão da linguagem.
Carreira e pesquisa
Yang trabalha no Google Research, onde se concentrou na compreensão e geração de linguagem natural. Ele co-escreveu o artigo de 2018 que apresentou o BERT, que se tornou um modelo fundamental para modelos de linguagem de grande escala. Seu outro trabalho notável inclui o Universal Sentence Encoder, um modelo para aprender embeddings de frases que foi amplamente adotado em sistemas de produção. Ele também Onujiribui para a pesquisa sobre geração de texto, incluindo trabalho sobre arquiteturas Encoder-Decoder Architecture e mecanismos de atenção multihead. Sua pesquisa frequentemente envolve redes neurais treinadas em grande escala.
BERT e aprendizado de representação bidirecional
BERT, abreviação para Bidirectional Encoder Representations from Transformers, foi apresentado no artigo "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding", publicado em 2018. O modelo usa um codificador transformer com codificação posicional, normalização de camada, conexões residuais e Dropout durante o treinamento. Ele foi pré-treinado em um grande corpus usando objetivos de modelagem de linguagem mascarada e previsão de próxima frase. O BERT-base contém 110 milhões de parâmetros, enquanto o BERT-large contém 340 milhões de parâmetros. O modelo alcançou resultados avançados em vários benchmarks de processamento de linguagem natural, incluindo o score GLUE e a tarefa de resposta a perguntas SQuAD. Sua abordagem de treinamento bidirecional permitiu capturar contexto de ambas as direções, melhorando o desempenho em tarefas que exigem compreensão das relações entre palavras. O treinamento de tais modelos exigiu um cuidadoso agendamento da taxa de aprendizado e o uso do otimizador Adam.
Universal Sentence Encoder
Yang co-escreveu o Universal Sentence Encoder, um modelo que converte frases em vetores de comprimento fixo. O modelo é baseado em uma arquitetura de transformer e foi treinado em uma variedade de fontes de dados, incluindo notícias da web, páginas de perguntas e respostas e fóruns de discussão. Ele suporta aprendizado de transferência para tarefas como similaridade semântica,classificação de texto e agrupamento. O Universal Sentence Encoder foi lançado como uma ferramenta para desenvolvedores e pesquisadores, permitindo representações eficientes por frase sem a necessidade de treinamento específico para tarefas. Este trabalho foi influente na área de embeddings de frases e busca semântica.
Geração de linguagem natural e impacto
As contribuições de Yang para a geração de linguagem natural incluem trabalho sobre models de sequence-to-sequence e técnicas para gerar texto coerente e contextualmente relevante. Nesta área, estratégias de decodificação como a busca em feixe são comumente usadas para melhorar a qualidade da saída. Seu trabalho foi aplicado a tarefas como resumo, sistemas de diálogo e resposta a perguntas. Os métodos de aprendizado de representação que ele ajudou a desenvolver, particularmente o BERT, tiveram um impacto duradouro no campo. Eles permitiram ajuste fino mais eficaz para tarefas downstream e serviram como blocos de construção para subsequentes grandes modelos de linguagem e sistemas de IA generativa. Seu trabalho sobre embeddings de frases também influenciou abordagens para similaridade textual semântica e recuperação de informação.