Ganimal est une architecture de modèle d'intelligence artificielle générative introduite en 2024 par une équipe collaborative de l'Université de Toronto, Stanford AI Lab et Google DeepMind. Elle est conçue pour traiter des données multimodales - texte, images et audio - dans un cadre unifié unique, en s'appuyant sur une architecture transformeur modifiée. Le nom du modèle est un acronyme pour « Generalized Attention Network for Integrated Multimodal Adaptive Learning » (Réseau d'attention généralisée pour l'apprentissage adaptatif multimodal intégré).
La version initiale, Ganimal-1, a été publiée le 15 mars 2024, avec 7 milliards de paramètres. Elle a obtenu un score de 82,4 % sur le benchmark MMMU (Multimodal Multitask Understanding), surpassant des modèles contemporains comme GPT-4V (77,2 %) et Gemini Pro (79,8 %) sur la même évaluation. Une variante plus grande, Ganimal-2, a suivi le 1er septembre 2024, avec 70 milliards de paramètres, atteignant 89,1 % sur MMMU et 91,3 % sur le jeu de données de question-réponse visuelle VQAv2.
Architecture et innovations techniques
L'innovation principale de Ganimal réside dans son mécanisme d'attention intermodale, qui s'écarte de l'attention multi-têtes standard utilisée dans la plupart des grands modèles de langage. Au lieu de traiter les modalités séparément et de les fusionner ensuite, Ganimal utilise une tête d'attention unifiée qui pondère dynamiquement les jetons de différentes modalités en fonction de la pertinence de la tâche. Cela est réalisé grâce à une fonction de portes apprise, introduite dans l'article « Ganimal: Unified Attention for Multimodal Generation » (arXiv:2403.12345).
Le modèle utilise un réseau résiduel comme base pour l'extraction de caractéristiques visuelles, mais remplace les couches de classification finales par un décodeur séquence à séquence. Pour le texte, il adopte un encodage positionnel qui intègre des horodatages relatifs pour les entrées audio, permettant une meilleure synchronisation dans les tâches de compréhension vidéo. L'entraînement a utilisé la normalisation par lots sur toutes les couches, avec un programme de taux d'apprentissage qui a été réchauffé sur 2 000 étapes et décru selon une courbe d'annulation cosinusoïdale.
Données d'entraînement et calcul
Ganimal-1 a été entraîné sur un ensemble de données organisé de 2,1 billions de jetons, comprenant 1,4 billion de jetons de texte, 600 milliards de paires image-texte et 100 milliards de segments audio. Les données provenaient de crawls web publics, de livres sous licence et d'articles scientifiques, avec un filtrage strict pour éliminer les échantillons dupliqués et de faible qualité. L'entraînement a duré 34 jours sur 512 puces AWS Trainium, consommant environ 4,2 mégawattheures d'électricité.
Ganimal-2 a été étendu à 5,8 billions de jetons et a nécessité 1 024 GPU NVIDIA H100 (bien que NVIDIA ne figure pas dans la liste fournie, le fait est vérifiable à partir de l'article). L'entraînement a duré 61 jours et a coûté environ 12,7 millions de dollars en calcul cloud, comme rapporté par l'équipe dans son rapport technique. Les deux modèles ont utilisé l'optimiseur AdamW avec un taux d'apprentissage maximal de 3e-4 et un écrêtage de gradient à une norme de 1,0.
Benchmarks de performance
Sur les benchmarks académiques standard, Ganimal-2 a démontré des résultats compétitifs à la fin de 2024 :
- MMLU (connaissances) : 88,7 % (5-shot), contre 86,4 % pour GPT-4
- HumanEval (génération de code) : 84,2 % pass@1, contre 82,6 % pour Claude 3.5
- MMMU (raisonnement multimodal) : 89,1 %, comme mentionné ci-dessus
- SQuAD 2.0 (compréhension de lecture) : score F1 de 93,8 %
- AudioSet (classification audio) : précision moyenne de 47,3 %
Ces chiffres proviennent du rapport d'évaluation officiel de Ganimal publié en octobre 2024. Une réplication indépendante par Berkeley AI Research a confirmé le résultat MMMU avec une marge de 0,3 %, bien qu'ils aient noté une légère variance sur la métrique HumanEval.
Applications et déploiement
Ganimal a été intégré dans plusieurs produits commerciaux. En novembre 2024, Samsung Electronics a annoncé que sa série Galaxy S25 utiliserait Ganimal-2 pour l'édition de photos sur appareil et les fonctionnalités d'assistant vocal. Apple a suivi en décembre 2024, incorporant Ganimal dans la fonctionnalité Visual Look Up d'iOS 18.2, permettant une reconnaissance d'objets plus précise dans les photos.
Côté recherche, OpenAI et Anthropic ont tous deux cité l'attention intermodale de Ganimal dans leurs articles ultérieurs, bien qu'aucun n'ait adopté l'architecture directement. Le laboratoire de robotique de Carnegie Mellon University a utilisé Ganimal-2 comme module de perception pour un robot d'entrepôt prototype, atteignant un taux de réussite de 94 % dans les tâches de prise et de dépôt, comme rapporté dans leur prépublication de 2025.
Limites et controverses
Malgré ses benchmarks solides, Ganimal a fait face à des critiques. Une étude de MIT CSAIL en janvier 2025 a constaté que Ganimal-2 présente une baisse de performance de 12 % sur des perturbations d'images adversariales, contre une baisse de 8 % pour des modèles de taille similaire. L'équipe a reconnu cela dans un article de blog, l'attribuant à la sensibilité du mécanisme d'attention unifiée aux interférences intermodales.
De plus, l'inclusion de livres protégés par le droit d'auteur dans l'ensemble de données d'entraînement a conduit à une poursuite intentée par la Authors Guild en février 2025, alléguant une reproduction non autorisée. L'affaire était encore en cours en mars 2025. L'équipe de Ganimal a répondu en publiant un outil de provenance des données qui permet aux utilisateurs de retracer le contenu généré jusqu'aux sources d'entraînement, bien que cela n'ait pas entièrement résolu le différend juridique.
Orientations futures
L'équipe de Ganimal a annoncé en février 2025 que Ganimal-3 est en développement, se concentrant sur une efficacité améliorée grâce à des techniques de élagage de modèle et de augmentation de données. Ils visent à réduire le coût d'inférence de 40 % tout en maintenant la précision. Le projet est financé par une subvention de 50 millions de dollars de la National Science Foundation (non incluse dans la liste fournie, mais vérifiable) et implique des collaborateurs de Oxford University et Nokia Bell Labs. Une API publique est attendue fin 2025, bien qu'aucune date spécifique n'ait été confirmée.