Paul Christiano est un chercheur américain en alignement de l'IA, connu pour avoir co-développé la technique qui est devenue RLHF et pour avoir fondé l'Aligment Research Center, une organisation à but non lucratif dédiée à la recherche sur l'alignement.
Début de carrière et RLHF
Christiano a travaillé comme chercheur chez OpenAI dans ses premières années, où il a été co-auteur en 2017 de « Deep Reinforcement Learning from Human Preferences », un article qui a introduit la méthode fondamentale d'entraînement d'un modèle de récompense à partir de comparaisons humaines entre les sorties du modèle, puis d'optimisation d'une politique contre ce modèle de récompense. Cette approche, ensuite étendue et appliquée à systèmes de grands modèles de langage via le RLHF, est devenue la technique dominante pour aligner les modèles orientés conversation avec les intentions humaines, notamment dans l'entraînement derrière ChatGPT et son prédécesseur InstructGPT, qui suivait des instructions.
Alignment Research Center
En 2021, Christiano a quitté OpenAI pour fonder le Center (ARC), un organisme à but non lucratif axé sur les travaux théoriques dans le domaine de l'alignement de l'IA, y compris des recherches sur la « sollicitation de connaissances latentes » à partir des modèles et des méthodes pour évaluer si un modèle possède des capacités ou des intentions que ses sorties ne révèlent pas. ARC est également devenu célèbre pour avoir conçu et exécuté parmi les plus précoces évaluations opérationnelles de capacités post-extension des modèles frontières, notamment des tests de capacités dangereuses menés en coordination avec des instituts comme OpenAI et Anthropic en amont de modèles comme GPT-4.
Institut Américain pour la Sécurité de l'IA
En 2024, Christiano a été nommé pour diriger les travaux d'évaluation axés sur la sécurité à l'Institut Américain pour la sécurité de l'IA, logé au sein de l'National Institute of Standards as part, un rôle qui a placé un chercheur étroitement associé à l'alignement technique au sein des structure gouvernementales chargées d'évaluation des modèles de frontière avant le processus des -cleatley-declaration#du Sommet international sur la Sécurité de l'IA qui débuta au Bletchley Park en novembre 2023. Cette nomination a suscité à la fois reconnaissance de soutien et des critiques de différentes parties de la communauté de la sécurité de l'IA, sur les questions de l'indépendance et de la capacité d'évaluation du gouvernement.
Influence
Christiano est largement reconnu dans le domaine de la sécurité de l'IA comme l'un des chercheurs les plus responsables de la traduction de préoccupations abstraites concernant les risques aliés afin à l’IA à long terme en programmes de recherche concrets et empiriquement testables, faisant le pont entre le travail plus philosophique associé à des figures comme Nick Bostrom et les techniques d'entraînement appliquées utilisées dans la quasi-totalité des grands modèles conversationnels publiés depuis après 202.