Traduzido do inglês

Yinfei Yang é um cientista da computação no Google Research, conhecido por coautoria do BERT, um modelo baseado em transformadores para aprendizado de representação de linguagem natural, e por contribuições para a geração de linguagem natural e embeddings de frases.

Yinfei Yang é um cientista da computação e pesquisador do Google, reconhecido por ser coautor do BERT, um modelo baseado em Transformer (architecture) que avançou o aprendizado de representações no processamento de linguagem natural. Seus interesses de pesquisa incluem geração de linguagem natural, modelagem Sequence-to-Sequence (Seq2Seq) e Machine learning. Ele contribuiu tanto para os fundamentos teóricos quanto para as aplicações práticas da inteligência artificial na compreensão da linguagem.

Carreira e pesquisa

Yang trabalha no Google Research, onde se concentrou na compreensão e geração de linguagem natural. Ele co-escreveu o artigo de 2018 que apresentou o BERT, que se tornou um modelo fundamental para modelos de linguagem de grande escala. Seu outro trabalho notável inclui o Universal Sentence Encoder, um modelo para aprender embeddings de frases que foi amplamente adotado em sistemas de produção. Ele também Onujiribui para a pesquisa sobre geração de texto, incluindo trabalho sobre arquiteturas Encoder-Decoder Architecture e mecanismos de atenção multihead. Sua pesquisa frequentemente envolve redes neurais treinadas em grande escala.

BERT e aprendizado de representação bidirecional

BERT, abreviação para Bidirectional Encoder Representations from Transformers, foi apresentado no artigo "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding", publicado em 2018. O modelo usa um codificador transformer com codificação posicional, normalização de camada, conexões residuais e Dropout durante o treinamento. Ele foi pré-treinado em um grande corpus usando objetivos de modelagem de linguagem mascarada e previsão de próxima frase. O BERT-base contém 110 milhões de parâmetros, enquanto o BERT-large contém 340 milhões de parâmetros. O modelo alcançou resultados avançados em vários benchmarks de processamento de linguagem natural, incluindo o score GLUE e a tarefa de resposta a perguntas SQuAD. Sua abordagem de treinamento bidirecional permitiu capturar contexto de ambas as direções, melhorando o desempenho em tarefas que exigem compreensão das relações entre palavras. O treinamento de tais modelos exigiu um cuidadoso agendamento da taxa de aprendizado e o uso do otimizador Adam.

Universal Sentence Encoder

Yang co-escreveu o Universal Sentence Encoder, um modelo que converte frases em vetores de comprimento fixo. O modelo é baseado em uma arquitetura de transformer e foi treinado em uma variedade de fontes de dados, incluindo notícias da web, páginas de perguntas e respostas e fóruns de discussão. Ele suporta aprendizado de transferência para tarefas como similaridade semântica,classificação de texto e agrupamento. O Universal Sentence Encoder foi lançado como uma ferramenta para desenvolvedores e pesquisadores, permitindo representações eficientes por frase sem a necessidade de treinamento específico para tarefas. Este trabalho foi influente na área de embeddings de frases e busca semântica.

Geração de linguagem natural e impacto

As contribuições de Yang para a geração de linguagem natural incluem trabalho sobre models de sequence-to-sequence e técnicas para gerar texto coerente e contextualmente relevante. Nesta área, estratégias de decodificação como a busca em feixe são comumente usadas para melhorar a qualidade da saída. Seu trabalho foi aplicado a tarefas como resumo, sistemas de diálogo e resposta a perguntas. Os métodos de aprendizado de representação que ele ajudou a desenvolver, particularmente o BERT, tiveram um impacto duradouro no campo. Eles permitiram ajuste fino mais eficaz para tarefas downstream e serviram como blocos de construção para subsequentes grandes modelos de linguagem e sistemas de IA generativa. Seu trabalho sobre embeddings de frases também influenciou abordagens para similaridade textual semântica e recuperação de informação.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-scientist·natural-language-processing·google-research·machine-learning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico