Traduit de l'anglais

CoDi est un modèle d'IA générative multimodal développé par Microsoft Research, capable de générer et de comprendre simultanément du texte, des images, de l'audio et de la vidéo grâce à une architecture unifiée basée sur la diffusion.

CoDi (abréviation de Composable Diffusion) est un modèle d'intelligence artificielle générative développé par Microsoft Research qui peut traiter et générer plusieurs modalités - texte, images, audio et vidéo - dans un cadre unifié. Contrairement aux systèmes multimodaux antérieurs qui reposaient sur des modèles séparés pour chaque type de données, CoDi utilise une approche de diffusion composable qui lui permet de générer simultanément n'importe quelle combinaison de ces modalités, comme produire une vidéo avec un audio synchronisé et des légendes textuelles à partir d'une seule invite. Le modèle a été présenté dans un article de recherche de 2023 et représente une étape vers des systèmes d'IA multimodaux plus intégrés.

CoDi s'appuie sur le succès des modèles de diffusion, une classe d'algorithmes de apprentissage automatique qui génèrent des données en affinant itérativement du bruit aléatoire en sorties structurées. Son innovation clé est la capacité de combiner plusieurs processus de diffusion spécifiques à une modalité en un seul modèle, permettant une génération inter-modale sans nécessiter la présence de toutes les modalités lors de l'entraînement. Cela rend le système plus flexible et plus efficace que les approches antérieures qui exigeaient des données appariées sur toutes les modalités.

Architecture et Conception

L'architecture de CoDi se compose de plusieurs composants clés. À son cœur, elle utilise un espace latent partagé où différentes modalités sont représentées comme des vecteurs continus. Chaque modalité possède son propre encodeur et décodeur, mais ceux-ci sont connectés par un cadre de diffusion composable qui permet au modèle de générer des sorties dans n'importe quelle combinaison. Le modèle emploie un backbone basé sur un Transformer pour l'attention inter-modale, lui permettant d'aligner les représentations à travers les domaines du texte, de l'image, de l'audio et de la vidéo.

Une caractéristique notable est son utilisation d'un mécanisme de « pontage » lors de l'entraînement. Étant donné que les données appariées sur les quatre modalités sont rares, CoDi est entraîné par étapes : d'abord sur des paires de modalités individuelles (par exemple, texte-image, texte-audio), puis sur des triplets, et enfin sur toutes les combinaisons. Cet entraînement par étapes permet au modèle d'apprendre des relations inter-modales même lorsque des ensembles de données multimodaux complets ne sont pas disponibles.

Capacités et Applications

CoDi peut effectuer une variété de tâches de génération. Par exemple, à partir d'une invite textuelle décrivant une scène, il peut générer une vidéo avec un audio synchronisé et une description textuelle correspondante. Il peut également modifier du contenu existant à travers les modalités, comme changer le style d'une image tout en préservant son contenu sémantique, ou générer des effets sonores qui correspondent à l'action visuelle d'une vidéo.

La nature composable du modèle signifie que les utilisateurs peuvent conditionner la génération sur n'importe quel sous-ensemble de modalités. Cette flexibilité a des applications potentielles dans la création de contenu, les outils d'accessibilité (par exemple, générer des descriptions audio pour des images) et la production de médias interactifs. Les chercheurs ont démontré que CoDi peut produire des sorties cohérentes à travers les modalités, maintenant une cohérence sémantique entre le texte, les visuels et l'audio générés.

Entraînement et Données

CoDi a été entraîné sur des ensembles de données publiquement disponibles, y compris des paires image-texte provenant de sources comme LAION-5B, des paires audio-texte et des ensembles de données vidéo-texte. L'approche d'entraînement par étapes a nécessité une conception minutieuse du programme, où le modèle a d'abord appris des alignements par paires plus simples avant de progresser vers des combinaisons multimodales plus complexes. Les chercheurs ont utilisé une combinaison d'apprentissage contrastif et d'objectifs de diffusion pour entraîner les encodeurs et décodeurs.

Un défi abordé lors de l'entraînement était le déséquilibre dans la disponibilité des données à travers les modalités. Les données textuelles et image sont abondantes, tandis que les triplets vidéo-audio-texte de haute qualité sont plus rares. La conception composable de CoDi atténue cela en permettant au modèle de tirer parti des données par paires pour généraliser à des combinaisons de modalités non vues.

Réception et Impact

CoDi a été présenté à la Conférence sur la Vision par Ordinateur et la Reconnaissance de Formes (CVPR) 2023 et a attiré l'attention pour son approche unifiée de la génération multimodale. Il a été parmi les premiers modèles à démontrer la génération simultanée des quatre principaux types de contenu dans un cadre unique, influençant les recherches ultérieures sur l'apprentissage multimodal et les modèles de fondation.

Bien que CoDi ait été principalement un prototype de recherche et n'ait pas été publié comme produit commercial, ses idées ont informé des travaux ultérieurs sur les modèles multimodaux unifiés, y compris les efforts d'OpenAI et de Google DeepMind. L'accent mis par le modèle sur la composabilité et l'entraînement par étapes a été adopté sous diverses formes par d'autres groupes de recherche explorant l'IA multimodale efficace.

Limitations

CoDi présente plusieurs limitations. Sa résolution de sortie et sa qualité, en particulier pour la vidéo, sont inférieures à celles des modèles spécialisés à modalité unique. Le modèle peut avoir du mal avec le contenu de longue durée et le maintien de la cohérence sur des séquences étendues. De plus, en raison de sa dépendance à la diffusion, la génération est intensive en calcul, nécessitant des ressources GPU importantes. L'approche d'entraînement par étapes signifie également que les performances sur des combinaisons de modalités rares peuvent être moins robustes que sur des paires courantes.

Les considérations éthiques incluent le potentiel de mauvaise utilisation dans la génération de médias synthétiques. Comme pour d'autres modèles génératifs, il existe des préoccupations concernant les deepfakes et la désinformation, bien que le statut de recherche de CoDi ait limité son déploiement direct.

Voir Aussi

Références

  • Tang, Z., et al. (2023). CoDi : Diffusion Composable pour la Génération d'Images et de Vidéos du Monde Réel. CVPR.
  • Articles de blog et documentation technique de Microsoft Research sur CoDi.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·multimodal-learning·diffusion-models·microsoft-research
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique