Traduit de l'anglais

Toolformer est une architecture de modèle de langage qui apprend à utiliser des outils externes par apprentissage auto-supervisé, lui permettant de décider quand et comment appeler des API pour améliorer les performances des tâches.

Toolformer est une architecture de Large language model introduite par des chercheurs de Meta AI en février 2023. Elle est conçue pour apprendre de manière autonome quels outils externes utiliser - tels que les calculatrices, les moteurs de recherche, les systèmes de traduction et les API de calendrier - grâce à un processus d'entraînement auto-supervisé. Contrairement aux approches antérieures qui nécessitaient des annotations humaines extensives ou un apprentissage par renforcement, Toolformer apprend l'utilisation des outils à partir d'un petit ensemble de démonstrations, puis intègre ces capacités dans son propre processus de génération.

Le modèle est basé sur l'architecture Transformer (architecture) et étend la modélisation autorégressive standard du langage avec un mécanisme permettant d'insérer des appels d'outils dans les séquences de texte. Pendant l'inférence, Toolformer peut générer une séquence de jetons spéciale qui invoque un outil, reçoit la sortie de l'outil, puis continue à générer du texte intégrant cette sortie. Cela lui permet de déléguer des tâches comme l'arithmétique, la recherche factuelle ou les calculs de dates à des systèmes externes plus fiables, améliorant ainsi la précision sur les tâches où les connaissances paramétriques sont insuffisantes.

Procédure d'entraînement

L'entraînement de Toolformer utilise un pipeline en deux étapes. D'abord, un petit ensemble d'exemples rédigés par des humains (environ 10 par outil) montre comment formuler un appel d'outil. À partir de ces exemples, le modèle génère un ensemble de données plus vaste d'appels d'outils potentiels en échantillonnant ses propres sorties et en les filtrant selon un critère de perte auto-supervisé. Plus précisément, le modèle évalue si l'appel d'outil réduit la perte sur le texte suivant ; seuls les appels qui améliorent la prédiction sont conservés.

L'ensemble de données filtré est ensuite utilisé pour affiner le modèle de langage de base (une version de GPT-J avec 6,7 milliards de paramètres) via une prédiction standard du prochain jeton. Cet affinage apprend au modèle à la fois quand invoquer un outil et comment formater l'appel et intégrer le résultat. Les auteurs ont rapporté que cette approche ne nécessitait que quelques centaines d'exemples d'entraînement par outil, contrastant avec des méthodes qui exigent des milliers d'instances étiquetées.

Outils pris en charge et capacités

Toolformer a été évalué sur cinq outils : une calculatrice pour l'arithmétique, un système de questions-réponses (basé sur un modèle à récupération augmentée), un moteur de recherche Wikipédia, un système de traduction automatique et une API de calendrier. Le modèle a appris à utiliser chaque outil de manière appropriée, comme appeler la calculatrice pour des multiplications à plusieurs chiffres et le moteur de recherche pour des événements récents ou des faits obscurs. Dans des évaluations en zéro-shot sur des tâches en aval comme les problèmes de mots mathématiques (GSM8K) et les questions-réponses factuelles, Toolformer a surpassé le modèle de base et a égalé ou dépassé des modèles plus grands comme GPT-3 (175B paramètres) sur certains benchmarks.

Un choix de conception notable est que Toolformer ne nécessite pas d'affiner l'outil lui-même ; il traite chaque outil comme une boîte noire avec une interface fixe. Cette modularité permet d'ajouter de nouveaux outils en fournissant quelques exemples et en relançant le processus de filtrage.

Limitations et critiques

L'article original a reconnu plusieurs limitations. Les appels d'outils de Toolformer sont générés de manière gloutonne et ne peuvent pas être révisés en fonction de la sortie de l'outil, ce qui peut entraîner des erreurs en cascade si l'appel initial est mal formé. Le modèle manque également de la capacité d'enchaîner plusieurs appels d'outils dans une seule étape de raisonnement, limitant son utilisation sur des problèmes complexes en plusieurs étapes. De plus, le filtrage auto-supervisé peut parfois sélectionner des appels fallacieux qui réduisent la perte sans améliorer réellement la performance de la tâche.

Des travaux ultérieurs d'autres chercheurs ont noté que les gains de Toolformer étaient modestes sur certaines tâches et que sa dépendance à un ensemble fixe d'outils limitait la généralisation. Cependant, il a inspiré une ligne de recherche sur les modèles de langage augmentés par des outils, y compris des systèmes ultérieurs comme Gorilla et ART, qui ont élargi l'ensemble d'outils et amélioré la robustesse des appels.

Impact et héritage

Toolformer a démontré que les modèles de langage peuvent apprendre l'utilisation d'outils avec une supervision minimale, une étape vers des systèmes d'IA plus capables et plus fiables. Il a influencé les développements ultérieurs dans Generative AI et Artificial intelligence, en particulier dans l'intégration de sources de connaissances externes et d'outils computationnels. L'approche a été adoptée et étendue par des laboratoires académiques et des groupes industriels, y compris OpenAI et Google DeepMind, qui ont incorporé des mécanismes similaires d'appel d'outils dans leurs modèles de production.

L'accent mis par l'article sur l'apprentissage auto-supervisé pour l'acquisition d'outils a également contribué à des discussions plus larges sur l'efficacité du Machine learning et les limites des connaissances purement paramétriques. En 2025, les modèles de langage augmentés par des outils sont un composant standard de nombreux assistants IA déployés, bien qu'ils utilisent généralement des méthodes de planification et de vérification plus sophistiquées que le Toolformer original.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:language-models·tool-use·self-supervised-learning·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique