Traduzido do inglês

Jonathan Frankle é um cientista da computação e cientista-chefe na MosaicML, conhecido por sua pesquisa sobre poda de redes neurais, particularmente a hipótese do bilhete premiado, e por seu trabalho em sistemas eficientes de aprendizado profundo.

Jonathan Frankle é um cientista da computação especializado em aprendizado de máquina e aprendizado profundo. Ele é mais conhecido por sua pesquisa sobre esparsidade em redes neurais, particularmente a hipótese do bilhete premiado, que ele desenvolveu em conjunto com Michael Carbin no MIT CSAIL. Em 2024, ele atua como cientista-chefe na MosaicML, uma empresa focada no treinamento e implantação eficientes de modelos de linguagem de grande escala.

O trabalho de Frankle conecta insights teóricos em redes neurais com sistemas práticos para IA generativa. Suas contribuições influenciaram a forma como pesquisadores e engenheiros abordam a compressão de modelos e a IA com eficiência de recursos, um tópico de importância crescente em toda a indústria.

Início da Vida e Educação

Frankle concluiu seus estudos de graduação em ciência da computação na Carnegie Mellon University, graduando-se em 2013. Em seguida, ele cursou um doutorado no MIT CSAIL, onde foi orientado por Michael Carbin. Sua pesquisa de doutorado focou na compreensão da estrutura interna de redes neurais treinadas, levando à formulação da hipótese do bilhete premiado em 2018. Ele recebeu seu PhD em 2021.

Hipótese do Bilhete Premiado

A hipótese do bilhete premiado, introduzida em um artigo de 2019 coautorado com Carbin, postula que uma rede neural densa contém uma sub-rede - um 'bilhete vencedor' - que, quando treinada isoladamente, pode alcançar precisão de teste comparável à da rede original. Essa sub-rede é identificada por meio de um processo de poda iterativa: treinar a rede, podar os pesos de menor magnitude, redefinir os pesos restantes para seus valores iniciais e retreinar. A hipótese desafiou a sabedoria convencional de que a poda serve principalmente para eficiência em tempo de inferência, mostrando que redes esparsas também poderiam ser treinadas do zero de forma eficaz.

O trabalho ganhou atenção significativa na comunidade de inteligência artificial por suas implicações tanto para a compreensão quanto para a otimização de redes neurais. Ele sugeriu que a superparametrização no aprendizado profundo poderia ser menos sobre capacidade e mais sobre a presença de muitas sub-redes viáveis. Pesquisas subsequentes de Frankle e colaboradores estenderam a ideia a arquiteturas mais complexas, incluindo transformadores, e exploraram o papel dos agendamentos de taxa de aprendizado e da inicialização de pesos na descoberta desses bilhetes.

Carreira na MosaicML

Após concluir seu doutorado, Frankle ingressou na MosaicML, uma startup fundada em 2021 por ex-engenheiros da Intel e da NVIDIA, como cientista-chefe. Na MosaicML, ele liderou pesquisas sobre métodos de treinamento eficientes, incluindo o desenvolvimento da biblioteca de datasets MosaicML Streaming e do framework de treinamento Composer. Sua equipe focou em reduzir o custo e o tempo necessários para treinar modelos grandes, tornando-os acessíveis a organizações menores.

Em 2023, a MosaicML foi adquirida pela Databricks, uma empresa de análise de dados, por aproximadamente US$ 1,3 bilhão. Frankle continuou em seu papel de cientista-chefe após a aquisição, supervisionando pesquisas sobre otimização de modelos e o lançamento de modelos de código aberto como MPT-7B e MPT-30B. Esses modelos foram notáveis por seu desempenho competitivo em relação ao GPT-3 da OpenAI, exigindo menos recursos computacionais.

Contribuições de Pesquisa

Além da hipótese do bilhete premiado, Frankle contribuiu para várias áreas da pesquisa em aprendizado de máquina. Seu trabalho sobre 'conectividade de modo linear' explorou como modelos treinados independentemente podem ser interpolados no espaço de pesos, fornecendo insights sobre a paisagem de perda de redes profundas. Ele também investigou o impacto da ordenação de dados e da normalização em lote nas dinâmicas de treinamento.

Frankle tem sido um defensor da reprodutibilidade na pesquisa de IA, publicando protocolos experimentais detalhados e disponibilizando o código de seus estudos como código aberto. Seus artigos apareceram em conferências importantes, incluindo NeurIPS, ICML e ICLR, e ele atuou como revisor nesses eventos.

Impacto e Reconhecimento

A pesquisa de Frankle tem sido amplamente citada na literatura de aprendizado profundo, com o artigo da hipótese do bilhete premiado recebendo milhares de citações. Suas ideias influenciaram ferramentas práticas para compressão de modelos, como bibliotecas de poda em frameworks como PyTorch e TensorFlow. Profissionais da indústria em empresas como Google DeepMind e Anthropic referenciaram seu trabalho em discussões sobre design eficiente de modelos.

No contexto mais amplo da IA generativa, o foco de Frankle em eficiência está alinhado com esforços para democratizar o acesso a modelos grandes. Seu trabalho na MosaicML contribuiu para a tendência de modelos de pesos abertos, que contrastam com as abordagens proprietárias dos principais laboratórios. Em 2024, ele permanece ativo no campo, falando em conferências e contribuindo para o discurso público sobre o desenvolvimento sustentável de IA.

Publicações Selecionadas

  • 'The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks' (com Michael Carbin, 2019)
  • 'Linear Mode Connectivity and the Lottery Ticket Hypothesis' (com Gundappa Sahu et al., 2020)
  • 'Stabilizing the Lottery Ticket Hypothesis' (com Gundappa Sahu et al., 2020)
  • 'MosaicML: Efficient Training of Large Language Models' (relatório técnico, 2023)

Referências

Seu trabalho é documentado em artigos acadêmicos e relatórios técnicos disponíveis via arxiv e anais de conferências. Entrevistas e perfis apareceram em veículos de mídia de tecnologia, discutindo suas contribuições para a IA eficiente.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·computer-scientist·deep-learning·ai-research
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico