Paul Christiano é um pesquisador americano em alinhamento de IA, conhecido por co-desenvolver a técnica que se tornou RLHF e por fundar o Alignment Research Center, uma organização sem fins lucrativos dedicada à pesquisa em alinhamento.
Início da carreira e RLHF
Christiano trabalhou como pesquisador na OpenAI em seus primeiros anos, onde em 2017 foi coautor de "Deep Reinforcement Learning from Human Preferences", um artigo que introduziu o método central de treinar um modelo de recompensa a partir de comparações humanas entre saídas de modelos e, em seguida, otimizar uma política contra esse modelo de recompensa. Essa abordagem, posteriormente ampliada e aplicada a modelos de linguagem como RLHF, tornou-se a técnica dominante para alinhar modelos voltados a conversação com a intenção humana, de forma mais visível no treinamento por trás do ChatGPT e de seu predecessor de seguimento de instruções, o InstructGPT.
Alignment Research Center
Em 2021, Christiano deixou a OpenAI para fundar o Alignment Research Center (ARC), uma organização sem fins lucrativos focada em trabalho teórico em alinhamento de IA, incluindo pesquisa sobre "extração de conhecimento latente" de modelos e métodos para avaliar se um modelo possui capacidades ou intenções que suas saídas não revelam. O ARC também se tornou conhecido por construir e executar algumas das primeiras avaliações formais de capacidades pré-implantação de modelos de fronteira, incluindo testes de capacidades perigosas conduzidos em coordenação com laboratórios como OpenAI e Anthropic antes de lançamentos como o GPT-4.
Instituto de Segurança de IA dos EUA
Em 2024, Christiano foi nomeado para liderar o trabalho de avaliação de segurança no Instituto de Segurança de IA dos EUA, sediado no Instituto Nacional de Padrões e Tecnologia, um papel que colocou um pesquisador intimamente associado ao trabalho técnico de alinhamento dentro de um órgão governamental responsável por avaliar modelos de fronteira antes do processo da cúpula internacional de segurança de IA que começou em Bletchley Park em novembro de 2023. A nomeação atraiu tanto apoio quanto críticas de diferentes partes da comunidade de segurança de IA, em questões de independência e da capacidade de avaliação do governo.
Influência
Christiano é amplamente considerado no campo da segurança de IA como um dos pesquisadores mais responsáveis por traduzir preocupações abstratas sobre risco de IA a longo prazo em programas de pesquisa concretos e empiricamente testáveis, unindo o trabalho mais filosófico associado a figuras como Nick Bostrom e as técnicas de treinamento aplicadas usadas em quase todos os principais modelos voltados a conversação lançados após 2022.