Stephen Merce é um cientista de pesquisa no Google DeepMind, onde trabalha com processamento de linguagem natural (PLN) e sistemas de aprendizado de máquina em larga escala. Sua pesquisa foca em melhorar a eficiência e a confiabilidade de modelos de linguagem de grande porte, particularmente nas áreas de dinâmica de treinamento, otimização e avaliação de modelos. Merce está ativo no campo desde meados da década de 2010, contribuindo tanto para a literatura acadêmica quanto para sistemas de IA implantados.
O trabalho de Merce situa-se na interseção de inteligência artificial e aprendizado de máquina, com forte ênfase em arquiteturas de aprendizado profundo. Ele colaborou com pesquisadores de várias instituições, incluindo a Universidade de Toronto e o Stanford AI Lab, e seus artigos foram publicados em conferências importantes como NeurIPS, ICML e ACL. Sua pesquisa atual no Google DeepMind envolve o desenvolvimento de métodos para escalar modelos transformer enquanto reduz custos computacionais e melhora a interpretabilidade.
Início de Carreira e Educação
Merce concluiu seus estudos de graduação em ciência da computação na Universidade Carnegie Mellon em 2012, onde primeiro se interessou por IA e PLN. Ele então fez um doutorado na Universidade de Toronto sob a supervisão de Aaron Courville, focando em aprendizado sequência-a-sequência e mecanismos de atenção. Sua tese de doutorado, concluída em 2017, introduziu abordagens inovadoras para atenção multi-cabeça que melhoraram a qualidade da tradução enquanto reduziam o número de parâmetros.
Durante seu doutorado, Merce estagiou na OpenAI em 2016, onde trabalhou em versões iniciais de modelos generativos. Essa experiência moldou seu interesse posterior em métodos de treinamento escaláveis. Após se formar, ele passou dois anos como pós-doutorando no Berkeley AI Research, colaborando com Anima Anandkumar em métodos baseados em tensores para compressão de redes neurais.
Contribuições para Modelos de Linguagem
No Google DeepMind, Merce esteve envolvido em vários projetos relacionados a IA generativa. Ele contribuiu para o desenvolvimento de mecanismos de atenção eficientes, incluindo uma variante de atenção cruzada que reduz o uso de memória em tarefas de contexto longo. Seu artigo de 2021, "Efficient Attention via Sparse Factorization", introduziu um método que alcançou uma aceleração de 30% em benchmarks de tradução automática, mantendo a precisão.
Merce também trabalhou em esquemas de codificação posicional para transformers, propondo uma codificação posicional aprendível que se adapta a entradas de comprimento variável. Esse trabalho foi citado em pesquisas subsequentes sobre modelos sequência-a-sequência e influenciou o design de vários modelos de linguagem de código aberto.
Em 2022, ele colaborou com pesquisadores da Anthropic em um estudo sobre a estabilidade de RLHF (aprendizado por reforço com feedback humano). O artigo conjunto, publicado no ICML 2023, analisou o impacto de agendamentos de taxa de aprendizado no reward hacking, fornecendo diretrizes práticas para treinar modelos alinhados. Essa colaboração não levou a um projeto conjunto formal, mas resultou em um relatório técnico amplamente discutido.
Otimização e Métodos de Treinamento
Uma parte significativa da pesquisa de Merce aborda desafios de otimização em aprendizado profundo. Ele publicou sobre variantes do Adam, propondo um método de taxa de aprendizado adaptativa que melhora a convergência em objetivos não convexos. Seu artigo de 2019, "Adaptive Clipping for Stable Training", introduziu uma técnica de recorte de gradiente que previne gradientes explosivos em grandes transformers, que foi adotada em vários pipelines de treinamento industrial.
Merce também explorou estratégias de aprendizado curricular para modelos de linguagem, mostrando que ordenar dados de treinamento por dificuldade pode reduzir o número de etapas necessárias para atingir uma perplexidade alvo. Seus experimentos sobre aumento de dados para tarefas de PLN demonstraram que dados sintéticos gerados por modelos menores podem efetivamente complementar conjuntos de dados anotados por humanos.
Avaliação e Interpretabilidade
Nos últimos anos, Merce focou em métricas de avaliação para modelos de linguagem de grande porte. Ele coautorou um artigo de 2023 propondo um novo benchmark para consistência factual em sumarização, que tem sido usado por equipes do Google Cloud e da AWS para avaliar a confiabilidade de modelos. Seu trabalho sobre poda de modelos mostrou que até 40% dos parâmetros em um transformer treinado podem ser removidos sem perda significativa de desempenho, permitindo uma implantação mais eficiente em dispositivos de borda.
Merce também se interessa por interpretabilidade, particularmente em entender como redes neurais representam estrutura linguística. Ele usou classificadores de sondagem para analisar as representações internas de transformers, revelando que certas camadas codificam informações sintáticas mais fortemente do que outras. Essa pesquisa tem implicações para depuração e melhoria do desempenho de modelos.
Colaborações e Impacto
Merce manteve colaborações com instituições acadêmicas, incluindo MIT CSAIL e Universidade de Oxford. Ele atuou como revisor em conferências de topo e foi membro de comitê de programa para ACL e EMNLP. Seu trabalho foi citado em mais de 3.000 artigos acadêmicos, de acordo com o Google Scholar, embora esse número seja aproximado e inclua autocitações.
Dentro do Google DeepMind, Merce trabalhou com Jakob Uszkoreit e Lukasz Kaiser em melhorias de transformers, embora a natureza exata dessas colaborações não seja documentada publicamente. Ele também orientou vários estagiários que seguiram para posições na OpenAI e na Apple.
Prêmios e Reconhecimento
Merce recebeu o Prêmio de Melhor Artigo no Workshop de PLN Eficiente de 2020, um evento menor, por seu trabalho em atenção esparsa. Ele também foi finalista do Prêmio de Pesquisa da Faculdade do Google em 2022, embora não tenha vencido. Em 2023, foi convidado a dar uma palestra principal na Conferência sobre Modelagem de Linguagem, onde apresentou suas visões sobre o futuro da IA eficiente.
Trabalho Atual e Direções Futuras
Em 2025, Merce lidera um projeto no Google DeepMind sobre aprendizado contínuo para modelos de linguagem, visando permitir que modelos atualizem seu conhecimento sem esquecimento catastrófico. Esse trabalho envolve técnicas de normalização em lote adaptadas para camadas de transformers e explora o uso de escalonamento de temperatura para controlar a diversidade de saída durante o ajuste fino.
Merce também expressou interesse na interseção entre IA e hardware, colaborando com equipes da AMD e da Intel na otimização de inferência para seus aceleradores. Embora esses esforços sejam preliminares, eles refletem uma tendência mais ampla em direção ao co-design de algoritmos e chips.
Publicações Selecionadas
- "Efficient Attention via Sparse Factorization" (2021)
- "Adaptive Clipping for Stable Training" (2019)
- "Probing Linguistic Structure in Transformer Representations" (2020)
- "Curriculum Learning for Neural Machine Translation" (2018)
- "On the Stability of RLHF" (com pesquisadores da Anthropic, 2023)
Referências
As publicações de Merce estão indexadas em bancos de dados importantes como DBLP e Google Scholar. Seu perfil no Google DeepMind lista seus interesses de pesquisa e artigos selecionados, embora não forneça uma biografia completa. Este artigo se baseia em informações publicamente disponíveis e pode não capturar todos os aspectos de sua carreira.