utilisation informatique (IA)

Traduit de l'anglais

Une capacité qui permet à un modèle d'IA d'opérer directement une interface graphique informatique standard, en visualisant des captures d'écran et en émettant des actions de souris et de clavier, plutôt que d'interagir uniquement via des API dédiées.

L'utilisation d'ordinateur est une capacité qui permet à un grand modèle de langage de piloter directement une interface graphique standard, en visualisant le contenu de l'écran et en émettant des actions de souris et de clavier, plutôt que d'interagir avec un logiciel uniquement via des API dédiées écrites spécifiquement pour lui. Là où l'utilisation d'outils ordinaire exige qu'un développeur expose chaque capacité sous forme d'appel de fonction discret, l'utilisation d'ordinateur permet à un modèle d'agir sur tout logiciel doté d'une interface visuelle, y compris les sites web, les applications de bureau et les contrôles du système d'exploitation, de la même manière qu'un utilisateur humain, en regardant ce qui est à l'écran et en cliquant, en tapant ou en faisant défiler en réponse.

Anthropic a introduit cette technique publiquement en octobre 2024 comme une fonctionnalité de ses modèles Claude (AI model family), la décrivant comme permettant au modèle de prendre des captures d'écran, de déplacer un curseur, de cliquer sur des boutons et de taper du texte dans un environnement virtuel contrôlé. Cette capacité repose sur la capacité du modèle à interpréter des images d'un écran et à traduire cette compréhension en actions basées sur des coordonnées, ce qui en fait une extension naturelle des capacités de IA multimodale et de modèles vision-langage plutôt qu'une technique purement textuelle. D'autres laboratoires, notamment Google DeepMind et OpenAI, ont publié des fonctionnalités comparables d'agents de navigation et de contrôle de système d'exploitation au cours de 2024 et 2025, alors que cette approche devenait une catégorie établie dans la vague plus large des agents.

Comment cela fonctionne

Une boucle d'utilisation d'ordinateur suit généralement un cycle percevoir-décider-agir : le modèle reçoit une capture d'écran de l'état actuel de l'écran ainsi que l'objectif global de l'utilisateur, il décide d'une seule action suivante, comme cliquer sur une coordonnée spécifique, taper une chaîne de caractères ou appuyer sur une touche, cette action est exécutée dans l'environnement, et une nouvelle capture d'écran est prise et renvoyée dans la fenêtre de contexte du modèle pour la décision suivante. Ce cycle se répète jusqu'à ce que le modèle détermine que la tâche est terminée ou qu'une limite soit atteinte. Comme il fonctionne via la même surface visuelle et de saisie qu'un humain, l'utilisation d'ordinateur ne nécessite pas qu'une application expose une API, ce qui lui permet de fonctionner avec des logiciels hérités, des outils d'entreprise internes et des sites web sans intégration publique.

Applications

L'utilisation d'ordinateur a été appliquée à l'automatisation de navigateurs pour la recherche et la saisie de données, aux tests de logiciels en simulant les clics et les saisies d'un utilisateur réel, et à l'automatisation de tâches de bureau répétitives telles que le remplissage de formulaires dans des systèmes qui n'ont jamais été conçus pour être scriptés. Elle est souvent discutée comme une extension de la catégorie plus large des agents IA vers des environnements au-delà d'un ensemble d'outils défini, et elle peut être combinée avec des appels d'outils plus conventionnels au sein du même agent, parfois câblée via une interface partagée telle que le protocole de contexte de modèle, appelant une API dédiée lorsqu'elle existe et revenant au contrôle direct de l'interface lorsqu'elle n'existe pas.

Limites et risques

Les premiers systèmes d'utilisation d'ordinateur étaient nettement plus lents et moins fiables que l'utilisation d'outils basée sur API, car chaque action nécessite un aller-retour complet à travers l'interprétation d'image avant que l'étape suivante puisse être entreprise, et les modèles pouvaient mal cliquer, mal lire du petit texte ou être confus par des mises en page d'interface inhabituelles. Anthropic et d'autres laboratoires ont décrit cette capacité comme expérimentale lors de son lancement et ont recommandé de l'exécuter dans des environnements sandboxés compte tenu du risque d'actions involontaires. Les implications en matière de sécurité sont également plus graves que pour une utilisation d'outils étroite, car un modèle opérant une interface informatique complète a, en principe, la même gamme d'actions possibles qu'un utilisateur humain, y compris des actions ayant des conséquences financières, de sécurité ou irréversibles, ce qui est l'une des raisons pour lesquelles les agents d'utilisation d'ordinateur sont considérés comme une cible accrue pour les attaques par injection de prompt et sont généralement déployés avec des garde-fous, une supervision humaine et des environnements d'exécution restreints. En 2025, l'utilisation d'ordinateur restait une catégorie en évolution rapide mais encore en maturation, avec une précision et une fiabilité s'améliorant considérablement à travers les générations successives de modèles, mais restant en retard par rapport aux intégrations API spécialisées pour les tâches où une API dédiée existe.

Catégories:agentic-ai·automation·multimodal-ai
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique