Jared Kaplan é um físico teórico e pesquisador de aprendizado de máquina, conhecido por liderar a pesquisa que estabeleceu as leis de escala empíricas para modelos de linguagem, e como cofundador e cientista-chefe da Anthropic.
Histórico e leis de escala
Kaplan ocupou uma posição de professor de física teórica na Universidade Johns Hopkins antes de migrar para a pesquisa em IA, uma formação que ele disse ter moldado sua abordagem de tratar o comportamento de modelos como um sistema empírico e quantitativo a ser medido, em vez de apenas projetado por intuição. Em 2020, enquanto afiliado à OpenAI, ele liderou o artigo "Scaling Laws for Neural Language Models", que mostrou que a perda em tarefas de modelagem de linguagem segue relações de lei de potência suaves com o tamanho do modelo, o tamanho do conjunto de dados e o poder computacional de treinamento. O artigo forneceu aos laboratórios uma estrutura preditiva para decidir como alocar um orçamento computacional fixo, e informou diretamente o treinamento do GPT-3. Um artigo de acompanhamento amplamente citado de 2022 da DeepMind, o artigo "Chinchilla", revisou as conclusões originais de Kaplan sobre a proporção ideal de parâmetros para tokens de treinamento, mas a estrutura subjacente de lei de potência que ele ajudou a estabelecer permaneceu fundamental para a forma como os laboratórios de fronteira planejam grandes execuções de treinamento.
Anthropic
Em 2021, Kaplan cofundou a Anthropic ao lado de Dario Amodei, Daniela Amodei, Tom Brown, Chris Olah e outros que haviam trabalhado juntos na OpenAI. Como cientista-chefe da Anthropic, ele supervisionou direções de pesquisa que abrangem pré-treinamento, alinhamento e o estudo empírico das capacidades dos modelos à medida que escalam, continuando o programa de pesquisa focado em escalabilidade que iniciou na OpenAI. A estrutura pública de segurança da Anthropic, incluindo sua Política de Escalabilidade Responsável (veja princípios da Anthropic), baseia-se em parte na premissa de que o crescimento de capacidades é previsível o suficiente a partir das tendências de escala para ser planejado e controlado, uma ideia diretamente descendente da pesquisa anterior de Kaplan.
Influência
O trabalho de Kaplan sobre leis de escala é frequentemente citado junto com o artigo do GPT-3 como um dos dois desenvolvimentos que convenceram o campo mais amplo de que continuar escalando modelos transformer de forma previsível, em vez de buscar arquiteturas fundamentalmente novas, era o caminho mais confiável para ganhos adicionais de capacidade, uma conclusão que moldou a estratégia de laboratórios de fronteira até meados da década de 2020.
Sua formação em física teórica é frequentemente mencionada em perfis da liderança da Anthropic como uma característica distintiva entre os fundadores de laboratórios de IA, e ele continuou a traçar analogias explícitas entre os métodos empíricos usados para estudar sistemas físicos e a forma como os laboratórios de fronteira agora estudam o comportamento de grandes modelos treinados antes e depois da implantação.