Jan Leike é um pesquisador de alinhamento de IA que co-liderou o time Superalignment da OpenAI e posteriormente se juntou à Anthropic após uma renúncia de alto perfil da OpenAI em 2024.
Carreira na DeepMind e OpenAI
Leike possui doutorado em teoria de aprendizado por reforço pela Australian National University. Antes de entrar na OpenAI, ele trabalhou como cientista de pesquisa na DeepMind em problemas de segurança de IA e alinhamento. Na OpenAI, ele trabalhou extensivamente em técnicas para treinar modelos a serem mais úteis e honestos, contribuindo para o programa de pesquisa RLHF que moldou o ChatGPT e depois co-autorando o trabalho da OpenAI sobre supervisão escalável e generalização fraca-para-forte.
Superalignment e renúncia
Em julho de 2023, a OpenAI anunciou o time Superalignment, co-liderado por Leike e pelo cofundador da OpenAI Ilya Sutskever, com o objetivo declarado de resolver o problema técnico de alinhar um hipotético sistema de IA superinteligente no futuro dentro de quatro anos, apoiado por um compromisso de recursos computacionais significativos. O trabalho do time abordou interpretabilidade, supervisão escalável e pesquisa automatizada de alinhamento.
Em maio de 2024, Leike renunciou à OpenAI, afirmando publicamente que "a cultura e os processos de segurança ficaram em segundo plano em relação a produtos brilhantes" na empresa e que seu time estava lutando para obter os recursos computacionais que lhe foram prometidos. Sua renúncia ocorreu na mesma semana da saída de Sutskever e chamou atenção significativa para as tensões internas na OpenAI sobre o equilíbrio entre a implantação rápida de produtos e a pesquisa de segurança de longo prazo, tensões que também haviam surgido durante a OpenAI board crisis de novembro de 2023.
Mudança para a Anthropic
Pouco depois de deixar a OpenAI, Leike se juntou à Anthropic para continuar a pesquisa de alinhamento, juntando-se a um grupo crescente de pesquisadores, incluindo chegadas anteriores como Jared Kaplan e Chris Olah, que haviam migrado da OpenAI para a Anthropic por divergências sobre a priorização da segurança. Na Anthropic, ele continuou o trabalho relacionado à supervisão escalável e à avaliação de modelos.
Influência
A carta pública de renúncia de Leike se tornou um dos documentos mais amplamente circulados na discussão da comunidade de segurança de IA sobre se os incentivos internos dos laboratórios de fronteira apoiam de forma confiável seus compromissos declarados de segurança, um debate intimamente ligado a questões mais amplas em governança de IA e risco de IA de longo prazo. Sua saída, seguindo saídas semelhantes de outros pesquisadores focados em segurança, foi frequentemente citada como evidência de que os times internos de alinhamento em laboratórios comerciais de ritmo acelerado enfrentam pressão estrutural para competir com prazos de produtos por recursos computacionais e pessoal.