Le lancement de DALL-E 2

Traduit de l'anglais

DALL-E 2, publié par OpenAI en avril 2022, est un modèle texte-image qui génère des images numériques à partir de descriptions en langage naturel grâce à l'apprentissage profond, notamment un modèle de diffusion conditionné sur les plongements CLIP.

DALL-E 2 est un modèle de génération d'images à partir de texte développé par OpenAI, annoncé le 6 avril 2022 comme successeur du DALL-E original. Il utilise des méthodologies d'apprentissage profond pour générer des images numériques à partir de descriptions en langage naturel, appelées invites. Le modèle a été conçu pour produire des images plus réalistes et à plus haute résolution que son prédécesseur, avec la capacité de combiner des concepts, des attributs et des styles. Son nom est un mot-valise composé du personnage robot WALL-E de Pixar et de l'artiste surréaliste espagnol Salvador Dalí.

Historique et contexte

Le DALL-E original a été dévoilé par OpenAI dans un article de blog le 5 janvier 2021, utilisant une version modifiée de GPT-3 pour générer des images. DALL-E 2 a été annoncé le 6 avril 2022, entrant en phase bêta le 20 juillet 2022 avec des invitations envoyées à 1 million de personnes sur liste d'attente. Pendant cette phase, les utilisateurs pouvaient générer un certain nombre d'images gratuitement chaque mois et en acheter davantage. L'accès avait auparavant été restreint à des utilisateurs présélectionnés pour un aperçu de recherche en raison de préoccupations éthiques et de sécurité. Le 28 septembre 2022, DALL-E 2 a été ouvert à tous, et l'exigence de liste d'attente a été supprimée. Début novembre 2022, OpenAI a publié DALL-E 2 sous forme d'API, permettant aux développeurs d'intégrer le modèle dans leurs propres applications. Microsoft a ensuite implémenté DALL-E 2 dans son application Designer et son outil Image Creator inclus dans Bing et Microsoft Edge. L'API fonctionne sur une base de coût par image, avec des prix variant selon la résolution de l'image et des remises sur volume disponibles pour les clients d'entreprise. En février 2024, OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E, contenant des métadonnées selon la norme C2PA (Coalition pour la provenance et l'authenticité du contenu) promue par l'Initiative d'authenticité du contenu.

Technologie

DALL-E 2 utilise 3,5 milliards de paramètres, un nombre inférieur à celui de son prédécesseur. Au lieu d'un transformateur autorégressif, il emploie un modèle de diffusion conditionné sur des plongements d'images CLIP. Pendant l'inférence, ces plongements d'images sont générés à partir de plongements de texte CLIP par un modèle préalable. Cette architecture est la même que celle de Stable Diffusion, publié quelques mois plus tard. Le modèle s'appuie sur des travaux antérieurs en IA générative et apprentissage profond, en particulier le développement de l'architecture transformateur par OpenAI et d'autres. Le premier modèle de transformateur génératif pré-entraîné (GPT) a été développé par OpenAI en 2018, étendu à GPT-2 en 2019 et GPT-3 en 2020, avec 175 milliards de paramètres. L'approche par diffusion de DALL-E 2 diffère de la méthode autorégressive du DALL-E original, qui utilisait un VAE discret et un modèle de transformateur décodeur seul avec 12 milliards de paramètres.

Capacités

DALL-E 2 peut générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emojis. Il peut manipuler et réorganiser des objets dans ses images et placer correctement des éléments de conception dans des compositions novatrices sans instruction explicite. Le modèle démontre une compréhension large des tendances visuelles et de conception, et peut produire des images pour une grande variété de descriptions arbitraires sous différents points de vue avec seulement de rares échecs. Sa capacité de raisonnement visuel est suffisante pour résoudre les matrices de Raven, des tests visuels souvent administrés aux humains pour mesurer l'intelligence. DALL-E 2 prend également en charge la modification d'images, y compris la génération de variations d'images existantes et leur édition par inpainting et outpainting. Ces capacités utilisent le contexte d'une image pour remplir les zones manquantes avec un médium cohérent avec l'original, en suivant une invite donnée. Par exemple, l'outpainting peut étendre une image au-delà de ses frontières originales, en tenant compte d'éléments visuels existants tels que les ombres, les reflets et les textures.

Impact et héritage

DALL-E 2 a marqué une avancée significative dans la génération d'images à partir de texte, apportant la technologie à un public plus large grâce à sa bêta ouverte et à la suppression éventuelle de la liste d'attente. Sa sortie a suscité un intérêt pour IA générative et a influencé les développements ultérieurs dans le domaine, y compris DALL-E 3, publié en octobre 2023 nativement dans ChatGPT pour les clients Plus et Entreprise. DALL-E 3 a ensuite été intégré dans Bing Image Creator et Copilot de Microsoft, et en mars 2025 a été remplacé dans ChatGPT par les capacités de génération d'images natives de GPT Image. L'architecture basée sur la diffusion du modèle a également influencé d'autres systèmes, tels que Stable Diffusion, et a contribué à l'évolution rapide des applications de apprentissage automatique pour des tâches créatives. L'approche de DALL-E 2 en matière de sécurité, y compris l'accès restreint pendant l'aperçu de recherche et le filigrane ultérieur, a établi des précédents pour le déploiement responsable des modèles génératifs.

Réception et préoccupations

La sortie de DALL-E 2 a généré une attention considérable du public et du monde académique, mettant en évidence à la fois le potentiel créatif et les défis éthiques de l'imagerie générée par IA. Les préoccupations incluaient une utilisation abusive potentielle pour créer du contenu trompeur, des problèmes de droits d'auteur et l'impact sur les artistes et les designers. Le déploiement progressif d'OpenAI, avec des restrictions initiales et une liste d'attente, reflétait ces préoccupations. La capacité du modèle à générer des images réalistes à partir d'invites textuelles a également soulevé des questions sur la provenance et l'authenticité, conduisant à l'adoption de filigranes C2PA en 2024. Malgré ces défis, DALL-E 2 a été largement salué pour ses réalisations techniques et son interface conviviale, contribuant à populariser la génération d'images à partir de texte auprès des non-spécialistes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:generative-ai·text-to-image·openai·deep-learning
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique