Naman Goyal é um cientista da computação e pesquisador em inteligência artificial. Ele é mais conhecido por coautorar o BART, um autoencoder de denoising para pré-treinamento de modelos sequência-a-sequência, e por suas contribuições ao Fairseq, uma biblioteca de aprendizado profundo de código aberto amplamente utilizada. Seu trabalho influenciou o desenvolvimento dos modernos modelos de linguagem de grande escala.
A pesquisa de Goyal está situada no campo do aprendizado de máquina, particularmente em áreas relacionadas ao aprendizado sequência-a-sequência e ao pré-treinamento. Suas contribuições conectam arquiteturas fundamentais e ferramentas práticas para o treinamento de modelos de grande porte.
BART e Pré-treinamento
Goyal fez parte da equipe que lançou o BART em 2019. A arquitetura do BART combina um codificador bidirecional e um decodificador autorregressivo, usando um objetivo de denoising para pré-treinar em texto corrompido. Essa abordagem permitiu que o modelo gerasse saídas de alta qualidade para tarefas como sumarização e tradução. O artigo apresentou o modelo com até 400 milhões de parâmetros, e ele alcançou resultados de última geração em vários benchmarks, incluindo o Stanford Question Answering Dataset e o GLUE.
O BART foi um passo significativo no pré-treinamento porque unificou e estendeu ideias de modelos anteriores, como BERT e GPT. Em vez de usar apenas um objetivo padrão de modelo de linguagem, o BART corrompia o texto com várias funções de ruído, incluindo mascaramento de tokens e permutação de ordem. O papel de Goyal contribuiu para o sucesso empírico da abordagem, que demonstrou que o pré-treinamento sequência-a-sequência poderia ser tão eficaz quanto modelos puros de codificador ou decodificador.
Ferramenta Fairseq
Simultaneamente, Goyal contribuiu para o Fairseq, uma biblioteca de software desenvolvida na Meta AI (anteriormente Facebook AI Research). O Fairseq apoia o treinamento de modelos para tradução, sumarização e outras tarefas sequenciais. Ele usa PyTorch e fornece implementações eficientes para o transformador e outras arquiteturas. A biblioteca foi disponibilizada como código aberto e tem sido amplamente adotada na academia e em outros laboratórios.
O Fairseq introduziu técnicas como inicialização de pesos, normalização de camadas e agendamento de taxa de aprendizado que tornaram o treinamento de redes profundas mais estável. O envolvimento de Goyal no Fairseq ajudou na engenharia e nos experimentos, fazendo com que ele se tornasse uma ferramenta padrão para pesquisa.
Contribuições para o Escalonamento de Modelos
Em trabalhos relacionados, Goyal explorou questões como recorte de gradiente e amostragem top-p. Ele também participou de pesquisas sobre escalonamento e treinamento com lotes grandes, o que afetou a forma como os profissionais abordam o pré-treinamento. Por exemplo, o trabalho de 2020 sobre leis de escalonamento de modelos para modelos de linguagem neurais demonstrou que computação, dados e parâmetros precisam estar em equilíbrio; essa linha de pesquisa influenciou o design de modelos grandes.
Goyal também esteve entre os pesquisadores que lançaram o conjunto de dados Natural Questions por meio da comunidade, embora outros pesquisadores tenham gerenciado sua atribuição. No entanto, muitas de suas publicações tornaram-se, posteriormente, citações na literatura de aprendizado profundo.
Impacto
Seu trabalho no BART e no Fairseq ajudou a estabelecer uma linha de base para a geração condicional por tradução. Os modelos também informaram o design de conversão de texto em fala e a pesquisa em treinamento mais eficiente.
O legado continua em lançamentos subsequentes e em treinamentos não divulgados. Em 2024, o BART se tornou um modelo padrão em várias bibliotecas. As contribuições de Goyal foram reconhecidas por meio de contagens de citações e participação em conferências de alto nível. Ele também colaborou com pesquisadores como Yann Lecun e Mikel Artetxe.