Politiques de mise à l’échelle responsable

Traduit de l'anglais

Les politiques de mise à l'échelle responsable sont des cadres volontaires qui lient l'augmentation de la capacité déployée d'un modèle d'IA à des augmentations correspondantes des mesures de sécurité et d'évaluation, publiées pour la première fois par Anthropic en 2023.

Les politiques de mise à l'échelle responsable (RSP) sont des cadres volontaires publiés par les développeurs d'IA qui lient les augmentations de capacités déployées d'un modèle à des augmentations correspondantes des mesures de sécurité, de sûreté et d'évaluation qui lui sont appliquées, avec l'objectif explicite de prévenir les dommages catastrophiques à mesure que les modèles approchent des seuils de capacités dangereuses. Anthropic a publié la première politique de ce type en septembre 2023, définissant une série de « niveaux de sécurité de l'IA » (ASL) vaguement inspirés des normes de confinement en biosécurité, et l'approche a ensuite été adoptée sous une forme similaire, sous différents noms, par d'autres laboratoires.

L'idée centrale est de rendre les engagements de sécurité concrets et vérifiables plutôt que purement aspirationnels : un laboratoire s'engage à l'avance sur des évaluations de capacités spécifiques et déclare que si un modèle franchit un seuil défini, par exemple en renforçant de manière significative un novice tentant de créer des armes biologiques, il ne déploiera pas ou ne continuera pas à entraîner le modèle tant que des mesures de protection correspondantes ne seront pas en place.

Origines et cadres comparables

La RSP d'Anthropic a été influencée par des recherches antérieures sur la sécurité de l'IA concernant la mesure et la prévision des capacités dangereuses, ainsi que par un débat interne sur la manière d'opérationnaliser les préoccupations d'alignement en décisions de déploiement concrètes. OpenAI a publié un « cadre de préparation » comparable en décembre 2023, suivant des catégories de risques telles que les menaces cybernétiques et biologiques via un modèle de scorecard. Google DeepMind a suivi avec un « cadre de sécurité frontière » en 2024, et plusieurs autres développeurs de modèles frontières ont pris des engagements volontaires similaires autour du sommet sur la sécurité de l'IA à Bletchley Park en 2023.

Contenu et mécanismes

Les éléments typiques incluent des seuils de capacités liés à des évaluations spécifiques, des mesures de sécurité et de sûreté requises à chaque niveau, telles que le red teaming et un accès restreint aux poids du modèle, ainsi que des engagements à suspendre la mise à l'échelle si les mesures ne peuvent pas être prêtes à temps. Le PDG d'Anthropic, Dario Amodei, a présenté la politique comme un pari selon lequel courir pour construire une IA puissante en toute sécurité est préférable à ne pas courir du tout, étant donné que d'autres acteurs continueront le développement de toute façon. Les politiques sont auto-publiées et auto-appliquées plutôt que vérifiées en externe ou juridiquement contraignantes, une caractéristique structurelle partagée dans toute l'industrie au milieu des années 2020.

Critiques

Les critiques, y compris certains chercheurs en gouvernance de l'IA, soutiennent que l'autorégulation volontaire de l'industrie manque de mordant en matière d'application, que les seuils peuvent être redéfinis par les mêmes entreprises tenues de les respecter, et que la pression concurrentielle crée une incitation à interpréter les évaluations ambiguës de manière généreuse. Les partisans rétorquent que les RSP établissent au moins une trace écrite publique et une norme industrielle que la réglementation contraignante, telle que l'IA Act de l'UE, peut ensuite référencer ou formaliser, et qu'elles représentent l'un des rares artefacts concrets reliant les préoccupations abstraites de risque existentiel aux décisions de déploiement quotidiennes.

Catégories:ai-safety·ai-governance·policy
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique