Un harnais agentique (souvent simplement « le harnais ») est l'environnement logiciel qui transforme un modèle de langage brut en un agent fonctionnel : la boucle qui alimente le modèle en contexte, exécute ses appels d'outils, renvoie les résultats, et répète jusqu'à ce qu'une tâche soit terminée. Le terme est devenu central dans l'ingénierie de l'IA en 2025-2026, lorsqu'il est apparu clairement qu'une grande partie des capacités réelles d'un agent ne provient pas uniquement du modèle, mais aussi de la qualité du harnais qui l'entoure - le même modèle peut sembler médiocre ou exceptionnel selon le harnais dans lequel il fonctionne.
Ce que fournit un harnais
- La boucle agentique. Interroger le modèle, analyser son action, l'exécuter, ajouter le résultat au contexte, répéter. Les conditions de terminaison, les nouvelles tentatives et la gestion des erreurs se trouvent ici.
- Les outils. Édition de fichiers, exécution de shell, navigation, exécution de code, recherche - exposés via appel de fonctions ou des protocoles comme le Model Context Protocol.
- La gestion du contexte. Ce que le modèle voit à chaque tour : invites système, ingénierie du contexte, résumé ou compactage lorsque la fenêtre de contexte se remplit, et mémoire entre les sessions.
- Les sous-agents et l'orchestration. Génération de sous-agents pour un travail parallèle ou spécialisé, et fusion de leurs résultats - le substrat des systèmes multi-agents et des schémas comme la boucle gauntlet.
- Les garde-fous de sécurité. Permissions, sandboxing, portes d'approbation humaine et journaux d'audit ; l'incident OpenAI-Hugging Face de 2026 (voir 2026 OpenAI agent cyberattacks) a fait de l'isolation au niveau du harnais un sujet de sécurité de premier ordre.
Exemples
Les harnais de codage sont les plus visibles : Claude Code, le CLI Codex d'OpenAI, le mode agent de Cursor, et des projets open source comme OpenHands et Aider. Les harnais d'évaluation (les échafaudages utilisés pour exécuter des benchmarks comme SWE-bench) sont la même idée appliquée à la mesure, c'est pourquoi les résultats de benchmarks sont souvent rapportés « avec le harnais X » : les scores varient avec le harnais, pas seulement avec le modèle.
Pourquoi le terme est important
« Harnais » sépare deux couches qui étaient auparavant confondues : la capacité du modèle (poids) et la capacité de l'agent (poids + environnement). Les annonces de modèles citent de plus en plus des résultats dépendants du harnais, les schémas d'invite sont écrits POUR un harnais (la boucle gauntlet en exige explicitement un), et les laboratoires ajustent leurs modèles à leurs propres harnais - les modèles Claude d'Anthropic et Claude Code étant le couple canonique. Le terme connexe d'échafaudage agentique est parfois utilisé de manière interchangeable, bien que l'échafaudage se réfère généralement à la structure d'invite et de flux de travail, tandis que le harnais se réfère à l'environnement d'exécution complet.