Les garde-fous, dans les systèmes d'IA, sont des mécanismes de sécurité et de contrôle placés autour d'un modèle, à l'entrée, à la sortie, ou aux deux, pour contraindre son comportement au-delà de ce qui est obtenu par l'entraînement du modèle lui-même. Là où les techniques d'alignement telles que le RLHF façonnent le comportement d'un modèle pendant l'entraînement, les garde-fous opèrent au moment du déploiement : ils filtrent ou réécrivent les entrées utilisateur, examinent ou bloquent les sorties générées, et appliquent des politiques spécifiques à l'application qui peuvent être plus strictes, plus récentes, ou plus audibles que ce que l'entraînement seul peut garantir.
Les garde-fous sont devenus un élément standard des systèmes d'IA de production à mesure que les chatbots et les agents d'IA sont passés de démonstrations de recherche à des produits destinés aux clients à partir de 2022, poussés à la fois par des échecs très médiatisés, tels que des chatbots produisant des sorties offensantes, fausses, ou juridiquement risquées, et par le besoin pratique de maintenir un modèle à usage général dans les limites d'un cas d'usage commercial spécifique.
Types de garde-fous
Les implémentations de garde-fous varient considérablement mais tombent généralement dans quelques catégories. Les garde-fous d'entrée examinent les invites entrantes pour détecter du contenu interdit, des tentatives de jailbreak, ou des attaques de injection de prompt avant qu'elles n'atteignent le modèle. Les garde-fous de sortie vérifient le texte généré pour détecter des violations de politique, des informations personnellement identifiables, un langage toxique, ou des affirmations factuelles qui devraient déclencher une citation ou un avertissement, utilisant parfois un modèle séparé, plus petit, comme classificateur ou juge. Les garde-fous thématiques restreignent un assistant déployé à un champ défini, par exemple empêchant un bot de service client de répondre à des questions sans rapport ou d'offrir des conseils médicaux ou juridiques. Les garde-fous structurels contraignent le format de sortie, comme forcer un JSON valide pour un système en aval.
Approches d'implémentation
Les garde-fous peuvent être implémentés comme des modèles classificateurs séparés, tels que Llama Guard de Meta et le point de terminaison de modération d'OpenAI, comme des filtres basés sur des règles utilisant des listes de mots-clés ou des expressions régulières, ou comme un deuxième appel au même modèle ou à un autre grand modèle demandé de critiquer ou d'approuver la sortie du premier modèle avant qu'elle ne soit montrée à un utilisateur. Des cadres open-source tels que NeMo Guardrails de NVIDIA et Guardrails AI ont émergé pour standardiser ce modèle, permettant aux développeurs de définir des sujets autorisés, une structure de sortie requise, et un comportement de repli de manière déclarative plutôt que de coder manuellement chaque vérification.
Limites et critiques
Les garde-fous sont largement reconnus comme imparfaits. Parce qu'ils opèrent typiquement comme des couches de correspondance de motifs ou de classification autour d'un modèle plutôt que de modifier ses capacités sous-jacentes, ils peuvent être vaincus par des tentatives de jailbreak suffisamment créatives, et des garde-fous trop agressifs peuvent produire des faux positifs qui bloquent des demandes légitimes, frustrant les utilisateurs et, selon les critiques, rendant parfois les systèmes moins utiles sans les rendre significativement plus sûrs. Les garde-fous sont généralement considérés comme un complément à, et non un substitut pour, le travail de sécurité pendant l'entraînement tel que le Constitutional AI et la pratique plus large de sécurité de l'IA, puisqu'un attaquant déterminé qui peut atteindre le modèle sous-jacent directement contourne entièrement les garde-fous.
Impact
Au milieu des années 2020, les garde-fous étaient devenus un poste standard dans les listes de contrôle de déploiement d'IA en entreprise et une catégorie de produit distincte, avec des fournisseurs offrant des plateformes de garde-fous comme middleware entre les applications et les modèles de fondation sous-jacents. Des cadres réglementaires tels que le EU AI Act font de plus en plus référence à la surveillance des sorties et aux contrôles de contenu comme exigences de conformité, intégrant davantage les garde-fous comme infrastructure attendue pour les systèmes d'IA déployés.