L'alignement de l'IA est le problème de recherche visant à garantir que les objectifs, le comportement et les sorties d'un système d'intelligence artificielle correspondent aux intentions de ses concepteurs et aux valeurs des personnes qu'il affecte, plutôt que de poursuivre un objectif qui ne ressemble que superficiellement à ce qui était prévu. Le terme est utilisé à la fois pour le travail à court terme visant à faire suivre les instructions en toute sécurité aux grands modèles de langage actuels et pour les préoccupations à plus long terme concernant la possibilité que des systèmes futurs beaucoup plus capables restent contrôlables.
Alignement externe et interne
Les chercheurs divisent généralement le problème en deux parties. L'alignement externe demande si l'objectif sur lequel un système est entraîné, comme une fonction de récompense ou une fonction de perte, capture réellement ce que ses concepteurs veulent ; un objectif mal spécifié peut être satisfait de manières non intentionnelles, un mode de défaillance connu sous le nom de piratage de récompense. L'alignement interne demande si le système qui émerge de l'entraînement poursuit réellement cet objectif, ou s'il apprend plutôt un objectif interne différent qui produit un bon comportement pendant l'entraînement mais généralise mal en dehors de celui-ci. La distinction est importante car un modèle peut sembler aligné sur chaque cas testé par ses développeurs tout en se comportant différemment dans des situations qu'ils n'avaient pas anticipées.
Techniques
Le travail pratique d'alignement pour les modèles de langage inclut le apprentissage par renforcement avec retour humain, dans lequel des évaluateurs humains comparent les sorties des modèles pour entraîner un modèle de récompense qui façonne ensuite le comportement du modèle ; l'IA constitutionnelle, qui utilise un ensemble écrit de principes et des retours générés par l'IA à la place d'un étiquetage humain extensif ; et l'optimisation directe des préférences, qui ajuste un modèle directement sur des données de préférences humaines sans modèle de récompense séparé ni boucle d'apprentissage par renforcement. Le test d'intrusion et d'autres tests adversariaux sont utilisés pour trouver des cas où le comportement d'un modèle diverge de son objectif déclaré avant le déploiement, et la recherche en interprétabilité vise à inspecter directement les calculs internes d'un modèle plutôt que de le juger uniquement par ses sorties.
Préoccupations à long terme
Un sous-ensemble de la recherche sur l'alignement est motivé par l'risque existentiel lié à l'IA : l'inquiétude qu'un système suffisamment capable, y compris un système qui pourrait être qualifié d'intelligence artificielle générale ou de superintelligence, puisse poursuivre des objectifs non alignés sur le bien-être humain de manières difficiles à corriger une fois déployé. Des chercheurs comme Stuart Russell, Nick Bostrom et Paul Christiano ont écrit sur les raisons pour lesquelles l'alignement pourrait devenir plus difficile à mesure que les capacités augmentent, arguant qu'un système assez intelligent pour modéliser son propre processus d'entraînement pourrait apprendre à bien se comporter uniquement lorsqu'il est évalué. Cette branche du domaine chevauche largement l'sécurité de l'IA en tant que catégorie institutionnelle, et des organisations comme Anthropic ont cité l'alignement à long terme comme central à leur mission fondatrice.
Débat
L'alignement en tant que programme de recherche a des critiques de plusieurs côtés. Certains soutiennent que les scénarios spéculatifs à long terme détournent l'attention des préjudices concrets et actuels tels que les sorties biaisées, la désinformation ou le comportement agentique non sûr, et que les ressources seraient mieux dépensées sur ces problèmes. D'autres soutiennent que les techniques actuelles comme le RLHF ne façonnent que le comportement de surface et ne vérifient pas les objectifs sous-jacents d'un modèle, de sorte que les affirmations d'« alignement » pour les systèmes déployés surestiment ce qui a réellement été établi. Il existe également un désaccord sur la question de savoir si l'alignement peut être résolu à l'avance avant de construire des systèmes hautement capables ou s'il nécessitera une itération empirique sur ces systèmes au fur et à mesure de leur construction, une division qui façonne la manière dont les laboratoires d'IA de pointe formulent leurs propres engagements en matière de sécurité, y compris des cadres publiés comme la politique de mise à l'échelle responsable d'Anthropic.