Traduit de l'anglais

VQA 3.0 est la troisième version majeure d'un système de réponse à des questions visuelles, introduite en 2023, qui intègre de grands modèles de langage avec des encodeurs visuels pour répondre à des questions complexes sur des images.

VQA 3.0 est la troisième itération majeure d'un système de réponse à des questions visuelles (VQA), une classe de modèles d'intelligence-artificielle qui acceptent une image et une question en langage naturel en entrée et produisent une réponse textuelle. Publié en 2023, VQA 3.0 s'appuie sur ses prédécesseurs en intégrant un grand-modele-de-langage avec un encodeur visuel, lui permettant de traiter des questions ouvertes qui nécessitent du raisonnement, du bon sens et une compréhension détaillée de la scène, plutôt que de s'appuyer sur un ensemble fixe de réponses possibles. Le système est conçu pour être utilisé dans des applications allant des technologies d'assistance pour les utilisateurs malvoyants à l'analyse automatisée d'images dans des domaines tels que la médecine et la robotique.

Le développement de VQA 3.0 a été mené par une équipe de recherche chez Google DeepMind, avec des contributions de collaborateurs de l'universite-de-toronto et du laboratoire-dia-de-stanford. Le projet a été annoncé dans un rapport technique au début de l'année 2023, et l'architecture du modèle ainsi que sa méthodologie d'entraînement ont été détaillées dans un article présenté lors d'une grande conférence sur la vision par ordinateur plus tard dans l'année. Le système est basé sur une architecture Transformer (architecture), utilisant un mécanisme d'attention-multi-tetes pour aligner les caractéristiques visuelles avec les jetons textuels, et il emploie un cadre sequence-a-sequence où l'image d'entrée est encodée et la question est décodée en une réponse.

Architecture et Entraînement

VQA 3.0 utilise une conception à double encodeur. L'encodeur visuel, une variante de reseau-residuel avec 21 couches, traite l'image d'entrée en une grille de vecteurs de caractéristiques. Ces caractéristiques sont ensuite projetées dans l'espace d'embedding du modèle de langage, qui est un transformer décodeur seul de 12 couches avec 7 milliards de paramètres. Le modèle est entraîné en deux étapes : d'abord, une phase de pré-entraînement sur un grand corpus de paires image-texte provenant du web, puis une phase de fine-tuning sur des ensembles de données VQA organisés tels que VQA v2 et Visual Genome. Pendant le fine-tuning, le modèle est optimisé en utilisant une perte d'entropie croisée avec un taux d'apprentissage en cosinus et l'optimiseur Adam. L'entraînement a utilisé 256 puces TPU v4 pendant environ deux semaines, traitant plus de 100 millions de triplets image-question-réponse.

Capacités et Références

VQA 3.0 atteint des résultats de pointe sur plusieurs références standard. Sur la division test-dev de VQA v2, il atteint une précision de 78,4 %, surpassant le meilleur modèle précédent de 3,2 points de pourcentage. Sur l'ensemble de données GQA, qui teste le raisonnement compositionnel, il obtient 63,1 %, et sur la référence VizWiz, conçue pour les questions posées par des utilisateurs aveugles, il atteint 71,8 %. Le modèle est particulièrement performant pour compter les objets, le raisonnement spatial et répondre à des questions nécessitant des connaissances externes, comme « Quel type d'animal est-ce ? » lorsque l'image montre une espèce rare. Dans une étude d'évaluation humaine, 87 % des réponses générées par VQA 3.0 ont été jugées précises et fluides par les annotateurs, contre 79 % pour la version précédente.

Limites et Considérations Éthiques

Malgré ses performances, VQA 3.0 présente des limites connues. Il peut être fragile face aux perturbations adverses, comme de petits changements d'éclairage ou d'orientation des objets, et il produit parfois des réponses plausibles mais incorrectes lorsque la question est ambiguë. Le modèle hérite également de biais de ses données d'entraînement, montrant une précision inférieure sur les images de personnes issues de groupes démographiques sous-représentés. Les développeurs ont publié une fiche modèle documentant ces problèmes et recommandent que les déploiements incluent une supervision humaine pour les applications à enjeux élevés. En réponse, l'équipe a publié une boîte à outils d'évaluation des biais et s'est engagée à effectuer des audits réguliers des performances du modèle sur différents segments de la population.

Déploiement et Impact

VQA 3.0 est disponible via la plateforme Google Cloud Vertex AI en tant qu'API gérée, permettant aux développeurs d'intégrer la réponse à des questions visuelles dans leurs applications avec un simple appel REST. Il a été adopté par plusieurs organisations, notamment Samsung Electronics pour des fonctionnalités d'accessibilité dans leurs smartphones, et Intuitive Surgical pour aider les chirurgiens à interpréter des images peropératoires. Le modèle a également été utilisé dans des contextes de recherche, comme Bhabha Atomic Research Centre pour analyser des images satellite. La sortie de VQA 3.0 a stimulé davantage de recherches sur les modèles multimodaux, et son architecture a influencé des systèmes ultérieurs comme VQA 4.0, qui intègre un encodeur visuel plus grand et un modèle de langage à mélange d'experts.

Directions Futures

L'équipe de VQA 3.0 a défini plusieurs domaines pour des travaux futurs. Une direction est d'améliorer la capacité du modèle à traiter des vidéos, en étendant le cadre actuel d'image unique à des séquences temporelles. Une autre est d'améliorer l'interprétabilité, en utilisant des cartes d'attention pour montrer quelles parties de l'image le modèle examine lors de la génération d'une réponse. L'équipe explore également des moyens de réduire l'empreinte carbone du modèle en utilisant des techniques d'entraînement plus efficaces, comme l'elagage-de-modele et l'augmentation-de-donnees. En 2024, un modèle successeur, VQA 3.5, est en développement, avec un accent sur l'apprentissage en quelques exemples et une meilleure gestion des concepts abstraits.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·computer-vision·multimodal-learning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique