Intelligence artificielle multimodale

Traduit de l'anglais

L'IA multimodale désigne des modèles qui traitent et génèrent des informations à travers plus d'une modalité de données, telles que le texte, les images, l'audio et la vidéo, au sein d'un système unifié plutôt que via des pipelines spécialisés séparés.

L'IA multimodale décrit des systèmes d'apprentissage automatique, en particulier les modèles de fondation modernes, qui peuvent accepter, traiter et souvent générer plus d'un type de données, comme le texte, les images, l'audio et la vidéo, au sein d'un seul modèle plutôt que d'assembler des systèmes spécialisés séparés. Le terme contraste avec les systèmes unimodaux antérieurs, tels qu'un grand modèle de langage textuel ou un classifieur réseau de neurones convolutif basé uniquement sur les images, qui gèrent un seul type d'entrée et de sortie.

Historique

La recherche multimodale précède la génération actuelle de modèles ; les premiers travaux combinaient la vision par ordinateur et le traitement du langage naturel pour des tâches comme la légende d'images et la réponse à des questions visuelles, en utilisant des encodeurs séparés reliés par des réseaux de connexion plus petits. Une étape majeure a été franchie avec CLIP d'OpenAI (2021), qui a appris un espace d'embedding partagé pour les images et le texte grâce à un pré-entraînement contrastif, permettant aux modèles de relier des concepts visuels et linguistiques sans étiquettes spécifiques à la tâche. Les embeddings de type CLIP sont devenus fondamentaux pour les systèmes texte-à-image ultérieurs, y compris pour guider la génération basée sur la diffusion.

Le passage aux modèles unifiés

Au cours de 2023 et 2024, les principaux laboratoires sont passés de l'ajout d'un encodeur visuel à un modèle textuel vers l'entraînement d'architectures véritablement unifiées basées sur le transformer à partir de données entrelacées de texte, d'images, d'audio et parfois de vidéo dès le départ. Gemini de Google, décrit comme nativement multimodal, et GPT-4o d'OpenAI ont illustré ce changement, traitant et générant à travers plusieurs modalités au sein d'un seul modèle plutôt que de router entre des sous-modèles séparés. Cela a permis des capacités telles que la conversation vocale en temps réel avec compréhension visuelle, et la réponse à des questions nécessitant un raisonnement conjoint sur une image et un texte d'accompagnement.

Architecture

Les modèles multimodaux tokenisent ou intègrent généralement chaque modalité dans un espace de représentation partagé qu'un backbone transformer peut traiter de manière uniforme, utilisant parfois des encodeurs spécifiques à la modalité pour les images ou l'audio, dont les sorties sont projetées dans la même dimension d'embedding que les jetons de texte. La sortie peut être également multimodale : un modèle peut générer du texte, ou déléguer la génération à un décodeur d'images basé sur la diffusion, comme avec des systèmes tels que l'éditeur d'images Nano Banana de Google. Le mécanisme d'attention central permet au modèle de relier les jetons à travers les modalités, par exemple en ancrant une description textuelle dans des régions spécifiques de l'image.

Applications

L'IA multimodale permet la compréhension de documents qui combine la lecture de type OCR du texte intégré avec la compréhension de la mise en page et des images, des outils d'accessibilité qui décrivent les images à voix haute, la réponse à des questions vidéo, des systèmes robotiques qui combinent la perception visuelle avec des instructions linguistiques, et des assistants grand public capables d'interpréter une photo, une capture d'écran ou un flux de caméra en direct. Les modèles vision-langage sont une sous-catégorie majeure axée spécifiquement sur la compréhension conjointe image-texte, tandis que l'IA multimodale est le terme plus large qui inclut également l'audio et la vidéo.

Évaluation et limites

Les référentiels pour les systèmes multimodaux testent le raisonnement inter-modalités, comme répondre à des questions sur des graphiques, des diagrammes ou des séquences vidéo, et les performances restent inférieures aux capacités humaines sur des tâches nécessitant un raisonnement spatial précis, le comptage ou la lecture de petits textes denses dans les images. Les modèles peuvent également halluciner des détails absents d'une image, et la combinaison des modalités augmente la surface d'attaque pour les injections de prompt, car des instructions malveillantes peuvent être cachées dans une image ou un clip audio plutôt que uniquement dans le texte.

Catégories:multimodal-ai·deep-learning·generative-ai
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique