Traduit de l'anglais

Gato 1.2B est un réseau de neurones basé sur un transformateur de 1,2 milliard de paramètres, développé par Google DeepMind pour des tâches multimodales couvrant le texte, les images et le contrôle.

Gato 1.2B est un modèle de réseau de neurones développé par Google DeepMind avec 1,2 milliard de paramètres. Il s'agit d'un transformeur-basé modèle de langage conçu pour gérer une large gamme de tâches, notamment la génération de texte, le sous-titrage d'images et le contrôle robotique, en utilisant un ensemble unique de poids. Le modèle a été introduit en 2022 dans le cadre des efforts de DeepMind pour créer un agent polyvalent capable d'apprendre et d'agir dans divers environnements.

L'architecture de Gato 1.2B suit la conception encodeur-décodeur, bien qu'il fonctionne principalement comme un modèle séquence-à-séquence. Il traite les entrées sous forme de séquences de jetons, où le texte, les images et les actions sont convertis en jetons discrets. Cette représentation unifiée permet au modèle de passer d'une modalité à l'autre sans modifications spécifiques à la tâche. Le modèle utilise des mécanismes d'attention multi-têtes et des encodages positionnels pour gérer des entrées de longueur variable.

Formation et données

Gato 1.2B a été formé sur un ensemble de données diversifié comprenant du texte provenant de livres et de pages web, des images de jeux de données publics et des données de démonstration provenant d'environnements robotiques simulés et réels. La formation a utilisé une perte d'entropie croisée pour les jetons de texte et d'image et une perte distincte pour les jetons d'action. Le modèle a été optimisé avec l'optimiseur Adam et un programme de taux d'apprentissage comprenant un échauffement et une décroissance en cosinus. La formation a été effectuée sur des TPU Google Cloud, avec un budget de calcul total d'environ 1,1e21 FLOPs.

Capacités et performances

Gato 1.2B démontre une compétence dans plus de 600 tâches, notamment jouer à des jeux Atari, générer des sous-titres, répondre à des questions et contrôler un bras robotique. Dans les évaluations, il a obtenu un score médian de 50 % sur la suite Atari, surpassant les modèles généralistes précédents mais restant en dessous des agents spécialisés. Pour le contrôle robotique, le modèle a été testé sur des tâches réelles telles que l'empilement de blocs et le placement d'objets, atteignant des taux de réussite comparables à ceux des politiques spécialisées dans certains cas. La capacité du modèle à généraliser entre les tâches est attribuée à son pré-entraînement à grande échelle et au vocabulaire de jetons partagé.

Comparaison avec d'autres modèles

Gato 1.2B est souvent comparé à d'autres modèles généralistes comme GPT-3 d'OpenAI et Claude d'Anthropic, mais il diffère par son accent sur les tâches multimodales et incarnées. Contrairement aux modèles de langage purs, Gato intègre des données visuelles et d'action, ce qui en fait un pas vers l'intelligence artificielle générale. Son nombre de paramètres est inférieur à celui de nombreux modèles contemporains, comme les 175 milliards de paramètres de GPT-3, mais il atteint des performances compétitives sur une gamme plus restreinte de tâches grâce à sa formation spécialisée.

Limites et orientations futures

Malgré sa polyvalence, Gato 1.2B présente des limites. Il a du mal avec les tâches à long horizon et nécessite une tokenisation minutieuse des images et des actions. Ses performances se dégradent sur des tâches en dehors de sa distribution d'entraînement. Les chercheurs de DeepMind ont exploré la mise à l'échelle du modèle et l'incorporation de données plus diverses pour améliorer la généralisation. Le modèle soulève également des questions sur la sécurité et le contrôle, car il peut être utilisé pour des applications bénéfiques et nuisibles. Les travaux futurs incluent l'intégration de renforcement par retour humain et de apprentissage par curriculum pour améliorer ses capacités.

Réception et impact

Gato 1.2B a été bien accueilli dans la communauté du apprentissage automatique pour son objectif ambitieux d'un agent unique pour plusieurs domaines. Il a suscité des discussions sur le chemin vers une IA polyvalente et l'importance de la formation multimodale. Le code et les poids du modèle n'ont pas été entièrement open-sourcés, mais son architecture et ses détails de formation ont été publiés dans un rapport technique. Il a influencé les recherches ultérieures sur les agents généralistes, y compris les modèles ultérieurs de DeepMind comme RT-2 et SIMA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:neural-network·transformer·multimodal-ai·deepmind
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique