Traduit de l'anglais

Gato est un agent d'IA généraliste développé par Google DeepMind qui exécute 604 tâches diverses couvrant les domaines du texte, de la vision et du contrôle, en utilisant un seul réseau neuronal basé sur un transformeur. Publié en 2022, il représente une étape vers une intelligence artificielle générale polyvalente.

Gato est un système d'intelligence artificielle à usage général développé par Google DeepMind, annoncé pour la première fois en 2022. Il s'agit d'un réseau de neurones unique entraîné à effectuer 604 tâches distinctes couvrant la génération de texte, la reconnaissance d'images, le contrôle robotique et le jeu vidéo. La conception de Gato repose sur l'architecture Transformer (architecture), la même base utilisée dans les grands modèles de langage, mais étendue pour gérer des entrées et sorties multimodales, y compris le texte, les images et les signaux de contrôle continus.

Le système a été présenté comme une démonstration qu'un modèle unique, sans ajustement fin spécifique à une tâche, pouvait atteindre des performances compétentes dans un large éventail de domaines. Bien qu'il ne surpassât pas les systèmes spécialisés dans chaque tâche, Gato a mis en évidence le potentiel des agents généralistes dans la recherche en IA, s'alignant sur des efforts plus larges vers des modèles plus flexibles et adaptables.

Architecture et entraînement

L'architecture de Gato est un modèle séquentiel basé sur le transformer qui traite des jetons provenant de différentes modalités. Les entrées telles que les images passent par un encodeur visuel, tandis que le texte et les actions discrètes sont tokenisés directement. Les sorties de contrôle continu, comme les couples articulaires pour les robots, sont discrétisées en intervalles. Le modèle est entraîné à l'aide d'un objectif standard de apprentissage automatique - prédire le jeton suivant dans une séquence - pour tous les types de tâches.

Les données d'entraînement provenaient de diverses sources, notamment des corpus de texte, des ensembles de données d'images, des enregistrements de jeu et des démonstrations de manipulation robotique réelle. Le modèle compte environ 1,2 milliard de paramètres, ce qui le rend relativement petit par rapport aux grands modèles de langage contemporains. L'entraînement utilisait un seul pod TPUv3, reflétant une efficacité dans l'utilisation des données et du calcul.

Capacités et tâches

Gato a été évalué sur 604 tâches, couvrant des catégories telles que :

  • Tâches textuelles : répondre à des questions, résumer et générer des dialogues.
  • Tâches visuelles : légender des images et reconnaître des objets.
  • Jeu vidéo : jeux Atari et environnement d'échecs, atteignant un niveau amateur.
  • Robotique : contrôler un bras robotique réel pour empiler des blocs et manipuler des objets.

Le modèle a démontré un transfert positif, ce qui signifie que l'entraînement sur un ensemble de tâches améliorait les performances sur d'autres. Par exemple, l'exposition à des données textuelles et visuelles aidait pour les tâches de contrôle robotique, suggérant que des représentations partagées entre modalités sont bénéfiques.

Importance et réception

Gato était remarquable par son ampleur plutôt que par sa profondeur. Il atteignait ou dépassait 50 % des performances d'experts sur la plupart des tâches, un critère que les chercheurs utilisaient pour mesurer la capacité généraliste. Le système était perçu comme un pas vers l'intelligence artificielle générale, bien que les experts aient noté qu'il manquait de la spécialisation approfondie des modèles dédiés.

Les critiques ont souligné que les performances de Gato sur des tâches individuelles étaient souvent inférieures à celles des systèmes de pointe, et que la notion de « généraliste » était limitée par l'ensemble fixe de tâches. Néanmoins, il a influencé les recherches ultérieures en IA générative et en apprentissage multitâche, en particulier au sein de DeepMind et de la communauté IA au sens large.

Relation avec d'autres modèles

Gato partage des racines conceptuelles avec les grands modèles de langage comme ceux de OpenAI et Anthropic, mais diffère par son accent explicite sur le contrôle et l'intégration multimodale. Contrairement aux modèles purement textuels, Gato peut interagir avec des environnements physiques et simulés, le rapprochant des systèmes d'IA incarnée. Il fait également écho aux efforts en apprentissage profond pour unifier des tâches disparates sous une architecture unique, une tendance qui s'est poursuivie avec des modèles ultérieurs.

Héritage et orientations futures

La publication de Gato a suscité des discussions sur la mise à l'échelle des agents généralistes. Les travaux ultérieurs dans le domaine ont exploré des modèles plus grands, des ensembles de tâches plus diversifiés et des techniques d'entraînement améliorées. Bien que Gato lui-même n'ait pas été déployé commercialement, ses principes ont influencé les projets ultérieurs de DeepMind et ont contribué à la transition plus large vers des modèles de fondation gérant plusieurs modalités.

En 2025, le concept d'un modèle unique effectuant des centaines de tâches reste un domaine de recherche actif, Gato servant de preuve de concept précoce. Son héritage réside dans la démonstration que des architectures unifiées peuvent atteindre des performances raisonnables dans divers domaines, ouvrant la voie à des systèmes généralistes plus capables.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·deep-learning·google-deepmind·transformer
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique