Traduit de l'anglais

Gorilla est un grand modèle de langage conçu pour appeler des API, développé par le laboratoire de recherche en intelligence artificielle de Berkeley, destiné à générer des appels de fonctions précis pour l'apprentissage automatique et d'autres API.

Gorilla est un grand modèle de langage développé par le laboratoire BAIR (Berkeley AI Research) de l'Université de Californie à Berkeley. Il est spécifiquement conçu pour générer des appels API précis, traduisant des instructions en langage naturel en invocations de fonctions exécutables. Le modèle a été introduit dans un article de recherche de 2023 et a été positionné comme un outil pour améliorer la fiabilité des systèmes d'IA qui interagissent avec des services logiciels externes.

L'innovation centrale de Gorilla réside dans sa méthodologie d'entraînement et son focus sur le domaine de l'utilisation des API. Contrairement aux modèles de langage généralistes qui peuvent halluciner ou produire du code syntaxiquement incorrect, Gorilla est affiné sur un large corpus de documentation d'API et d'exemples d'appels correspondants. Cela lui permet de comprendre la structure et les paramètres de milliers d'API différentes, des services cloud aux bibliothèques d'apprentissage automatique.

Entraînement et Architecture

Gorilla est construit sur une architecture transformeur sous-jacente, similaire à d'autres grands modèles de langage contemporains. La version initiale a été affinée à partir du modèle LLaMA-7B, un modèle fondamental publié par Meta. Le processus d'entraînement impliquait une technique appelée Retrieval-Augmented Fine-Tuning (RAFT), qui combine l'affinage standard avec un mécanisme de récupération. Pendant l'entraînement, le modèle est présenté avec des extraits de documentation d'API accompagnés de requêtes utilisateur et de l'appel API correct. Cette approche apprend au modèle à générer des appels ancrés dans la documentation fournie, réduisant la probabilité d'inventer des fonctions ou des paramètres inexistants.

Les données d'entraînement ont été organisées à partir d'un ensemble diversifié de sources, y compris la documentation pour les services Amazon Web Services, Microsoft Azure et Google Cloud, ainsi que des frameworks d'apprentissage automatique populaires. Cette couverture étendue permet à Gorilla de gérer une large gamme de tâches, des opérations simples de stockage de données aux flux de travail complexes de déploiement de modèles.

Capacités et Références

Gorilla est évalué sur le benchmark APIBench, un ensemble de données créé par les chercheurs pour mesurer la précision de la génération d'appels API. Dans ces évaluations, Gorilla a démontré une amélioration significative par rapport aux modèles existants, y compris OpenAI GPT-4, en termes de correction des appels générés et de réduction des erreurs d'hallucination. Le modèle est capable de sélectionner l'API correcte parmi un large ensemble de candidats, de comprendre les arguments requis et de produire du code syntaxiquement valide dans des langages tels que Python.

L'une des caractéristiques clés de Gorilla est sa capacité à s'adapter aux mises à jour de la documentation API. En utilisant la récupération au moment de l'inférence, le modèle peut incorporer la documentation la plus récente dans ses réponses, le rendant plus robuste aux changements dans les services sous-jacents. Cela est particulièrement important dans le paysage en évolution rapide du cloud computing et des outils de apprentissage automatique.

Applications et Impact

L'application principale de Gorilla se situe dans le domaine des agents de IA générative qui doivent interagir avec des outils et services externes. Il peut servir de backend pour des assistants virtuels, des systèmes de flux de travail automatisés et des outils de génération de code. En fournissant une interface fiable entre le langage naturel et les API programmatiques, Gorilla aide à combler le fossé entre l'intention humaine et l'exécution machine.

La publication de Gorilla a influencé les recherches ultérieures dans le domaine des modèles de langage conscients des API. Son approche combinant la récupération avec l'affinage a été adoptée et étendue par d'autres groupes de recherche. Le modèle est également notable pour sa nature open-source, avec le code et les poids du modèle rendus publiquement disponibles, permettant à d'autres chercheurs de s'appuyer sur ce travail.

Limitations et Directions Futures

Malgré ses forces, Gorilla a des limitations. Sa performance dépend de la qualité et de la couverture de la documentation API utilisée pendant l'entraînement. Pour des API de niche ou mal documentées, le modèle peut encore produire des appels incorrects. De plus, comme tous les grands modèles de langage, Gorilla peut être sensible à la formulation de l'invite d'entrée et peut nécessiter une ingénierie d'invite soigneuse pour obtenir des résultats optimaux.

Les directions de recherche futures incluent l'expansion du modèle pour supporter plus de langages de programmation et de domaines d'API, l'amélioration de sa capacité à gérer des interactions API en plusieurs étapes, et son intégration plus profonde avec l'apprentissage par renforcement à partir de retours humains (RLHF) pour affiner davantage ses sorties. L'équipe de Berkeley continue d'itérer sur le modèle, avec des versions ultérieures visant à améliorer sa précision et son efficacité.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·berkeley-ai-research·api-calling·generative-ai
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique