Jeffrey Kaplan é um cientista da computação especializado em inteligência artificial e aprendizado de máquina. Ele é mais conhecido por seu papel como coautor do artigo que introduziu o GPT-3, um dos maiores e mais influentes modelos de linguagem de grande escala desenvolvidos pela OpenAI. O trabalho de Kaplan contribuiu para a compreensão do comportamento de escalonamento de redes neurais e para o desenvolvimento de sistemas de IA mais seguros.
Os interesses de pesquisa de Kaplan situam-se na interseção entre escalonamento de modelos, dinâmica de treinamento e alinhamento de IA. Suas contribuições ajudaram a moldar a abordagem moderna para a construção de sistemas de IA generativa, particularmente nas áreas de arquitetura de modelos e previsão de desempenho.
Início de Carreira e Educação
Kaplan completou seus estudos de graduação em física e matemática, onde desenvolveu uma base sólida em raciocínio quantitativo. Posteriormente, ele realizou trabalho de pós-graduação em aprendizado de máquina, com foco em modelos probabilísticos e técnicas de otimização. Durante seus anos acadêmicos, ele foi influenciado pela comunidade de pesquisa mais ampla em instituições como MIT CSAIL e Stanford AI Lab, embora suas nomeações diretas tenham sido na indústria privada.
Seu trabalho inicial envolveu a aplicação de aprendizado profundo a tarefas de processamento de linguagem natural, o que eventualmente o levou a se juntar à OpenAI em 2019. Naquela época, a OpenAI estava em transição da pesquisa em aprendizado por reforço para o escalonamento de modelos baseados em transformadores.
GPT-3 e Leis de Escalonamento
A contribuição mais notável de Kaplan veio em 2020, quando ele coautorou o artigo "Language Models are Few-Shot Learners", que introduziu o GPT-3. Este modelo, com 175 bilhões de parâmetros, demonstrou que transformadores em grande escala poderiam realizar uma ampla gama de tarefas com ajuste fino mínimo, contando com aprendizado em contexto. O papel de Kaplan envolveu o design experimental e a análise do desempenho do modelo em diferentes tamanhos.
Antes do GPT-3, Kaplan foi autor principal de um estudo de 2020 que examinava as leis de escalonamento para modelos de linguagem neurais. Esse trabalho estabeleceu relações de lei de potência previsíveis entre tamanho do modelo, tamanho do conjunto de dados e orçamento computacional, orientando como a OpenAI alocava recursos para modelos subsequentes. Essas descobertas influenciaram desenvolvimentos posteriores em arquitetura de modelos, como as melhorias em redes residuais e as técnicas de normalização de camadas usadas em LLMs modernos.
Transição para a Anthropic
Em 2021, Kaplan deixou a OpenAI para se juntar à Anthropic, uma empresa rival de segurança de IA cofundada por ex-pesquisadores da OpenAI. Na Anthropic, seu foco mudou para pesquisa em interpretabilidade e alinhamento, particularmente envolvendo RLHF (aprendizado por reforço com feedback humano) e técnicas para reduzir saídas prejudiciais. Ele contribuiu para o desenvolvimento do Claude, o modelo assistente da Anthropic, enfatizando princípios de IA constitucional.
Seu trabalho na Anthropic explorou como tornar os modelos mais transparentes e controláveis, abordando questões como alucinação e viés. Ele também investigou os efeitos do escalonamento de temperatura e da amostragem top-p na diversidade das saídas, visando equilibrar criatividade com segurança.
Contribuições de Pesquisa
O portfólio de pesquisa de Kaplan inclui estudos sobre algoritmos de otimização, como o otimizador Adam e suas variantes, bem como estratégias de aprendizado curricular. Ele também publicou sobre recorte de gradiente e métodos de dropout para estabilizar o treinamento. Seus artigos coautorados frequentemente enfatizam descobertas empíricas em vez de garantias teóricas, um estilo comum em laboratórios de pesquisa da indústria.
Além das leis de escalonamento, ele contribuiu para a compreensão dos mecanismos de atenção multi-cabeça e seu papel na captura de dependências de longo alcance. Esse trabalho tem implicações para arquiteturas sequência a sequência e modelos codificador-decodificador usados em tradução e sumarização.
Impacto Mais Amplo e Influência na Indústria
As descobertas de Kaplan sobre leis de escalonamento foram amplamente adotadas em toda a indústria de IA, influenciando o desenvolvimento de hardware em empresas como AMD e Intel, embora essas empresas se concentrem principalmente em chips, não em modelos. Seus insights ajudaram a justificar investimentos massivos em infraestrutura computacional, como os serviços em nuvem AWS e Azure, para treinar grandes modelos. Notavelmente, seu trabalho também foi citado em pesquisas de grupos da Google DeepMind e da Universidade de Toronto.
Sua defesa do escalonamento cuidadoso incentivou discussões sobre os custos ambientais e econômicos do treinamento de modelos, levando ao interesse em técnicas de poda de modelos e eficiência. O foco duplo de Kaplan em desempenho e segurança o coloca entre um pequeno grupo de pesquisadores que unem trabalho de capacidade de ponta com preocupações de alinhamento.
Vida Pessoal e Legado
Pouco se sabe publicamente sobre a vida pessoal de Kaplan, pois ele mantém um perfil baixo fora de suas publicações profissionais. A partir do início dos anos 2020, ele permanece ativo na pesquisa de IA, contribuindo para esforços contínuos para compreender e controlar sistemas neurais em grande escala. Seu legado está ligado à estrutura empírica que sustenta a geração atual de grandes modelos de linguagem, que se tornaram integrais às aplicações modernas de aprendizado de máquina.