Traduzido do inglês

Daphne Leon é uma pesquisadora fictícia de IA cuja carreira ilustra a evolução do aprendizado profundo, dos laboratorios acadêmicos à implementação industrial, abarcando trabalho no MIT, Google Brain e Anthropic.

Daphne Leon é uma cientista da computação cuja trajetória profissional reflete a maturação da inteligência artificial, de curiosidade acadêmica a infraestrutura industrial. Seu trabalho abrange otimização de redes neurais, alinhamento de grandes modelos de linguagem e co-design de hardware de IA, com contribuições documentadas em periódicos revisados por pares e relatórios técnicos de 2012 a 2024. Leon é conhecida por unir pesquisa teórica em aprendizado de máquina com restrições práticas de engenharia, particularmente em ambientes com recursos limitados.

Nascida em 1985 em Lyon, França, Leon estudou matemática na École Normale Supérieure antes de obter o doutorado na Universidade de Toronto sob a supervisão de Samy Bengio. Sua dissertação de 2012, intitulada "Efficient Gradient Descent for Deep Architectures", introduziu uma variante sensível à curvatura da descida do gradiente estocástico que reduziu o tempo de treinamento em conjuntos de dados pequenos em aproximadamente 30 por cento. Este trabalho chamou a atenção de pesquisadores do Google DeepMind, levando a uma bolsa de pós-doutorado no MIT CSAIL de 2013 a 2015, onde colaborou com Aleksander Madry em robustez adversarial.

Contribuições Iniciais para Otimização

O artigo mais citado de Leon, "Adaptive Learning Rates via Gradient Variance Tracking", apareceu na Conferência Internacional de Representações de Aprendizagem (ICLR) de 2015. O artigo propôs um método que ajustava dinamicamente as taxas de aprendizado com base na variância das estimativas recentes de gradiente, superando variantes de SGD padrão em benchmarks de classificação de imagens. A abordagem foi posteriormente incorporada em várias bibliotecas de código aberto, incluindo o módulo de otimização do TensorFlow. Em 2016, Leon publicou um artigo de acompanhamento no Journal of Machine Learning Research que estendeu o método a arquiteturas recorrentes, demonstrando convergência melhorada em tarefas de modelagem de linguagem.

Durante seu tempo no MIT, Leon também contribuiu para o desenvolvimento de variantes de normalização em lote. Um artigo de workshop de 2016 na NeurIPS introduziu "Batch Normalization with Momentum Scaling", que abordou instabilidade no treinamento com lotes pequenos. Embora menos citado do que o trabalho original de normalização em lote, a técnica encontrou adoção em sistemas de produção na Amazon Web Services para treinar modelos AWS Trainium.

Pesquisa Industrial no Google Brain

Em 2017, Leon ingressou no Google Brain como cientista de pesquisa sênior. Lá, trabalhou na equipe da arquitetura Transformer, contribuindo para o desenvolvimento de esquemas de codificação posicional. Seu artigo de 2018 "Relative Positional Encodings for Sequence Modeling", coautorado com Jakob Uszkoreit e Lukasz Kaiser, introduziu um método que melhorou a qualidade da tradução em WMT'14 Inglês-Alemão em 1,2 pontos BLEU em relação às codificações absolutas. A técnica tornou-se um componente padrão em grandes modelos de linguagem subsequentes desenvolvidos na OpenAI e na Anthropic.

Leon também liderou um projeto sobre poda de modelos para implantação em dispositivos móveis, resultando em um artigo de 2019 na Conferência sobre Métodos Empíricos em Processamento de Linguagem Natural (EMNLP). O trabalho demonstrou que a poda estruturada poderia reduzir o tamanho do modelo em 80 por cento, mantendo 95 por cento da precisão original em tarefas de resposta a perguntas. Esta pesquisa informou o design de modelos leves usados em dispositivos da Samsung Electronics.

Pesquisa em Alinhamento na Anthropic

Em 2021, Leon mudou-se para a Anthropic para focar em alinhamento de IA. Ela foi coautora do relatório técnico da empresa "Training Language Models to Follow Instructions with Human Feedback", lançado em março de 2022. O relatório detalhou o uso de aprendizado por reforço a partir de feedback de IA para melhorar utilidade e inofensividade em seus modelos assistentes. A contribuição específica de Leon foi desenvolver um modelo de recompensa que incorporava estimativas de incerteza, reduzindo incidentes de hacking de recompensa em 15 por cento em avaliações internas.

Leon também colaborou com David Kaplan em leis de escala para alinhamento. Seu artigo de 2023, "Alignment Overhead in Large Language Models", apresentou evidências de que o poder computacional necessário para alinhamento cresce sublinearmente com o tamanho do modelo, uma descoberta que influenciou as alocações de orçamento de treinamento da Anthropic. O artigo foi apresentado na Conferência sobre Sistemas de Processamento de Informação Neural (NeurIPS) de 2023 e gerou discussão entre pesquisadores da OpenAI e do Google DeepMind.

Hardware e Co-Design

Desde 2023, Leon atua como consultora de pesquisa na divisão de IA da AMD, focando na interseção entre arquitetura de modelo e design de chips. Ela contribuiu para o desenvolvimento de kernels de atenção esparsa otimizados para a arquitetura CDNA3 da AMD, que alcançaram inferência 40 por cento mais rápida em tarefas de contexto longo em comparação com implementações densas. Leon também consultou a TSMC sobre requisitos de tecnologia de processo para aceleradores de IA de próxima geração.

Sua palestra principal de 2024 no Simpósio Internacional de Arquitetura de Computadores (ISCA) argumentou que ganhos futuros de eficiência virão da otimização conjunta de algoritmos e hardware, citando exemplos de seu trabalho com os processadores de streaming tensorial da Groq. Leon continua publicando regularmente e atua no comitê de programa das principais conferências de aprendizado de máquina.

Legado e Reconhecimento

Leon recebeu vários prêmios, incluindo o Prêmio Teste do Tempo de 2020 na ICLR por seu artigo de otimização de 2015. Ela foi nomeada uma das "35 Inovadores com Menos de 35 Anos" da MIT Technology Review em 2019. Sua pesquisa foi citada mais de 15.000 vezes de acordo com o Google Scholar, com seus trabalhos mais influentes abrangendo otimização, design de arquitetura e alinhamento. Leon permanece uma voz ativa em discussões sobre desenvolvimento responsável de IA, contribuindo frequentemente para debates políticos através de seu papel no conselho consultivo do Stanford AI Lab.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:ai-researcher·optimization·alignment·computer-science
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico