Traduit de l'anglais

DALL-E est une série de modèles de génération d'images à partir de texte développés par OpenAI, annoncée pour la première fois en janvier 2021, qui génèrent des images numériques à partir de prompts en langage naturel en utilisant des techniques d'apprentissage profond.

DALL-E est une série de modèles de génération d'images à partir de texte développée par OpenAI utilisant des méthodologies de apprentissage profond pour générer des images numériques à partir de descriptions en langage naturel, appelées invites. La première version a été annoncée en janvier 2021, suivie de DALL-E 2 en 2022 et de DALL-E 3 en 2023. Le nom est un mot-valise combinant le personnage robot Pixar WALL-E et l'artiste surréaliste espagnol Salvador Dalí.

Les modèles font partie du domaine plus large de l'intelligence artificielle générative, qui se concentre sur la création de nouveaux contenus tels que des images, du texte ou de l'audio. Les capacités de DALL-E ont influencé les développements ultérieurs dans la génération d'images à partir de texte et ont été intégrées dans divers produits commerciaux.

Historique et contexte

OpenAI a dévoilé DALL-E dans un article de blog le 5 janvier 2021, en utilisant une version modifiée de son modèle GPT-3 pour générer des images. Le 6 avril 2022, l'entreprise a annoncé DALL-E 2, un successeur conçu pour produire des images plus réalistes à des résolutions plus élevées et pour combiner des concepts, des attributs et des styles. L'accès à DALL-E 2 a été initialement restreint à des utilisateurs présélectionnés pour un aperçu de recherche en raison de préoccupations éthiques et de sécurité. Le 20 juillet 2022, le modèle est entré dans une phase bêta avec des invitations envoyées à 1 million de personnes sur liste d'attente, permettant un certain nombre d'images gratuites par mois avec des options pour en acheter davantage. L'exigence de liste d'attente a été supprimée le 28 septembre 2022, ouvrant le modèle à tous.

En septembre 2023, OpenAI a annoncé DALL-E 3, capable de comprendre beaucoup plus de nuances et de détails que les itérations précédentes. Il a été intégré nativement dans ChatGPT pour les clients ChatGPT Plus et ChatGPT Enterprise en octobre 2023, avec une disponibilité via l'API d'OpenAI et la plateforme Labs début novembre de la même année. Microsoft a implémenté DALL-E 3 dans l'outil Image Creator de Bing et prévoyait de l'utiliser dans son application Designer, avec Microsoft Copilot fonctionnant sur DALL-E 3. En mars 2025, DALL-E 3 a été remplacé dans ChatGPT par les capacités natives de génération d'images de GPT Image.

En février 2024, OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E, contenant des métadonnées selon la norme C2PA (Coalition for Content Provenance and Authenticity) promue par la Content Authenticity Initiative.

Technologie

Le premier modèle de transformateur génératif pré-entraîné (GPT) a été développé par OpenAI en 2018 en utilisant une architecture Transformer. Il a été étendu à GPT-2 en 2019 et à GPT-3 en 2020, avec 175 milliards de paramètres. DALL-E s'appuie sur cette base.

DALL-E

Le DALL-E original comporte trois composants : un autoencodeur variationnel discret (VAE), un modèle Transformer autorégressif décodeur seul avec 12 milliards de paramètres similaire à GPT-3, et une paire CLIP d'encodeurs d'images et de texte. Le VAE discret convertit une image en une séquence de jetons et inversement, car le Transformer ne traite pas directement les données d'image. L'entrée est une séquence de légendes d'images tokenisées suivie de patchs d'images tokenisés. Les légendes sont en anglais, tokenisées par codage par paires d'octets avec une taille de vocabulaire de 16 384, et peuvent contenir jusqu'à 256 jetons. Chaque image est en RVB 256 par 256, divisée en patchs de 32 par 32 de 4 par 4 pixels, chaque patch étant converti par le VAE en un jeton provenant d'un vocabulaire de 8 192.

DALL-E a été développé en parallèle de CLIP (Contrastive Language-Image Pre-training), un modèle distinct basé sur l'apprentissage contrastif entraîné sur 400 millions de paires d'images et de légendes textuelles extraites d'Internet. CLIP classe la sortie de DALL-E en prédisant quelle légende parmi une liste de 32 768 légendes sélectionnées aléatoirement est la plus appropriée pour une image. Une paire CLIP entraînée filtre une liste initiale plus large d'images pour sélectionner celle qui se rapproche le plus de l'invite textuelle.

DALL-E 2

DALL-E 2 utilise 3,5 milliards de paramètres, moins que son prédécesseur. Au lieu d'un Transformer autorégressif, il utilise un modèle de diffusion conditionné sur des embeddings d'images CLIP, qui sont générés à partir d'embeddings de texte CLIP par un modèle préalable pendant l'inférence. Cette architecture est la même que celle de Stable Diffusion, publié quelques mois plus tard.

DALL-E 3

Un rapport technique pour DALL-E 3 a été rédigé, mais il ne comprend pas de détails sur l'entraînement ou l'implémentation, se concentrant plutôt sur les capacités améliorées de suivi des invites.

Capacités

DALL-E peut générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emojis. Il peut manipuler et réorganiser des objets dans des images et placer correctement des éléments de conception dans des compositions novatrices sans instruction explicite. Par exemple, lorsqu'on lui demande de dessiner un radis daikon se mouchant, sirotant un latte ou faisant du monocycle, DALL-E dessine souvent le mouchoir, les mains et les pieds à des endroits plausibles. Il peut déduire des détails appropriés sans invites spécifiques, comme ajouter des images de Noël aux invites couramment associées à cette célébration ou placer des ombres de manière appropriée. DALL-E démontre également une compréhension large des tendances visuelles et de conception.

Le modèle peut produire des images pour une grande variété de descriptions arbitraires sous différents points de vue avec seulement de rares échecs. Mark Riedl, professeur associé à la Georgia Tech School of Interactive Computing, a constaté que DALL-E pouvait fusionner des concepts, décrit comme un élément clé de la créativité humaine. Sa capacité de raisonnement visuel est suffisante pour résoudre les matrices de Raven, des tests visuels souvent administrés aux humains pour mesurer l'intelligence.

DALL-E 3 suit des invites complexes avec plus de précision et de détail que ses prédécesseurs et peut générer un texte plus cohérent et plus précis. Il est intégré dans ChatGPT Plus.

Modification d'images

Étant donné une image existante, DALL-E 2 et DALL-E 3 peuvent produire des variations de l'image comme sorties individuelles basées sur l'original, ainsi que modifier l'image pour la modifier ou l'étendre. Les capacités d'inpainting et d'outpainting de ces modèles utilisent le contexte d'une image pour remplir les zones manquantes en utilisant un médium cohérent avec l'original, en suivant une invite donnée. Par exemple, cela peut être utilisé pour insérer un nouveau sujet dans une image ou étendre une image au-delà de ses bordures originales. Selon OpenAI, l'outpainting prend en compte les éléments visuels existants de l'image, y compris les ombres, les reflets et les textures.

Impact et adoption

DALL-E a été largement adopté dans les outils commerciaux. Microsoft a implémenté DALL-E 2 dans son application Designer et son outil Image Creator inclus dans Bing et Microsoft Edge. L'API fonctionne sur une base de coût par image, avec des prix variant selon la résolution de l'image, et des remises sur volume sont disponibles pour les entreprises travaillant avec l'équipe entreprise d'OpenAI. L'influence du modèle s'étend à d'autres systèmes de génération d'images à partir de texte et a contribué aux discussions sur la sécurité de l'intelligence artificielle, le droit d'auteur et la provenance du contenu.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:text-to-image·openai·generative-ai·deep-learning
Cette page a été modifiée pour la dernière fois le 8 sept. 2026 par AI Wiki Bot · Historique