DALL-E 1, stylisé DALL·E, est un modèle de texte à image développé par OpenAI utilisant une méthodologie de apprentissage profond. Il génère des images numériques à partir de descriptions en langage naturel, appelées invites. La première version de DALL-E a été annoncée en janvier 2021, ce qui en fait l'un des premiers modèles à combiner grands modèles de langage avec la génération d'images. Le nom du logiciel est un mot-valise formé à partir des noms du robot animé WALL-E et de l'artiste surréaliste espagnol Salvador Dalí.
Son successeur, DALL-E 2, est sorti en avril 2022, avec une version bêta publique en juillet 2022. DALL-E 3, publié en octobre 2023, a été intégré nativement dans ChatGPT pour les clients Plus et Enterprise. DALL-E 3 a ensuite été remplacé dans ChatGPT par les capacités natives de génération d'images de GPT Image en mars 2025.
Historique et contexte
DALL-E a été dévoilé par OpenAI dans un article de blog le 5 janvier 2021. Le modèle utilisait une version de gpt-partnr? mais pour les images, une architecture transformeur adaptée à la génération d'images. À l'époque, OpenAI était connu pour ses grands modèles de langage comme GPT-3, mais DALL-E marquait un tournant vers l'intelligence artificielle multimodale, traitant à la fois les domaines du texte et de l'image. Le nom du modèle s'inscrivait dans la lignée des acronymes et jeux de mots ludiques courants dans la dénomination chez OpenAI.
En février 2024, OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E, contenant des métadonnées conformes à la norme C2PA (Coalition pour la provenance et l'authenticité du contenu), promue par l'Initiative pour l'authenticité du contenu, afin de faciliter la traçabilité de l'origine des images.
Technologie
Le premier transformeur génératif pré-entraîné (GPT) a été initialement développé par OpenAI en 2018, utilisant une architecture transformeur. La première itération, GPT-1, a été mise à l'échelle pour produire GPT-2 en 2019 ; en 2020, elle a de nouveau été mise à l'échelle pour produire GPT-3, avec 175 milliards de paramètres. DALL-E est une variante distincte de GPT-3, modifiée pour générer des images.
DALL-E 1
DALL-E comprend trois composants : un autoencodeur variationnel discret, un modèle transformeur autorégressif à décodeur seul (12 milliards de paramètres) similaire à GPT-3, et une paire CLIP composée d'un encodeur d'images et d'un encodeur de texte.
L'autoencodeur variationnel (VAE) discret convertit une image en une séquence de jetons, et inversement, convertit une séquence de jetons en une image. Cela est nécessaire car le modèle transformeur ne traite pas directement les données image. L'entrée du transformeur est une séquence de légendes d'images tokenisées suivie de jetons de patchs d'images. La légende est en anglais, tokenisée par codage par paires d'octets (taille de vocabulaire 16 384), et peut contenir jusqu'à 256 jetons. Chaque image est une image RVB de 256x256 pixels, divisée en patchs de 32x32, chaque patch étant lui-même de 4x4 pixels. Chaque patch est ensuite converti en un jeton (taille de vocabulaire 8 192) par le VAE discret.
DALL-E est développé et publié en conjonction avec CLIP (Contrastive Language-Image Pre-training). CLIP est un modèle distinct basé sur l'apprentissage contrastif, entraîné sur 400 millions de paires d'images avec des légendes textuelles extraites d'Internet. Son rôle est de comprendre et de classer les sorties de DALL-E en prédisant quelle légende, parmi une liste de 32 768 légendes sélectionnées aléatoirement (dont une seule est correcte), correspond le mieux à une image. Une paire CLIP entraînée filtre une liste initiale plus large d'images générées par DALL-E pour sélectionner l'image la plus proche de l'invite textuelle.
Successeurs
DALL-E 2 utilise 3,5 milliards de paramètres, un nombre inférieur à celui de son prédécesseur. Au lieu d'un transformeur autorégressif, il utilise un modèle de diffusion conditionné sur des plongements CLIP, qui, pendant l'inférence, sont générés à partir de plongements textuels CLIP par un modèle antérieur. C'est la même architecture que celle de Stable Diffusion, publiée quelques mois plus tard.
DALL-E 3, publié en septembre 2023, suit des invites complexes avec plus de précision et de détails que les itérations précédentes, et peut générer un texte plus cohérent. Un rapport technique a été rédigé à son sujet, mais il ne comprend pas de détails sur la formation ou la mise en œuvre, se concentrant sur l'amélioration du suivi des instructions.
Capacités
DALL-E peut générer des images dans de multiples styles, y compris des images photoréalistes, des peintures et des emojis. Il peut manipuler et réorganiser des objets dans ses images, et placer correctement des éléments de conception dans des compositions novatrices sans instruction explicite. Il fait preuve de capacités de raisonnement créatif, comme combler des détails plausibles pour des invites - par exemple, ajouter des images de Noël à des invites associées à cette fête, ou placer des ombres de manière appropriée même lorsqu'elles ne sont pas mentionnées. DALL-E démontre une large compréhension des tendances en matière de design visuel.
DALL-E peut produire des images pour une grande variété de descriptions arbitraires depuis différents points de vue, avec seulement de rares échecs. Mark Riedl, professeur associé à l'École d'informatique interactive du Georgia Tech, a constaté que DALL-E pouvait fusionner des concepts, un élément clé de la créativité humaine. Ses capacités de raisonnement visuel sont suffisantes pour résoudre les matrices de Raven, des tests visuels souvent utilisés pour mesurer l'intelligence.
Modification d'images
Étant donné une image existante, DALL-E 2 et DALL-E 3 peuvent produire des variations de l'image et la modifier pour étendre ou modifier la scène. Ces modèles utilisent l'infilling et l'outpainting, en s'appuyant sur le contexte de l'image pour combler les zones manquantes dans un style cohérent avec l'original, en suivant une invite donnée. Cela peut être utilisé pour insérer un nouveau sujet ou étendre une image au-delà de ses limites d'origine. Selon OpenAI, l'outpainting prend en compte les éléments visuels existants de l'image, y compris les ombres, les reflets et les textures.
Applications et impact
DALL-E 1 a ouvert une nouvelle ère de création d'images par intelligence artificielle générative et a influencé les modèles et applications ultérieurs. Son successeur, DALL-E 2, a été rendu disponible via une API en novembre 2022, permettant aux développeurs d'intégrer le modèle dans leurs applications, avec un tarif à l'image. Microsoft a intégré DALL-E 2 dans son application Designer et son outil Image Creator dans Bing et Edge. DALL-E 3 a été intégré dans ChatGPT pour les clients Plus et Enterprise en octobre 2023, avec une disponibilité via les API et Labs en novembre. En février 2024, OpenAI a ajouté des filigranes aux images DALL-E conformément à la norme C2PA.
Références
Cet article est basé sur des informations provenant de rapports publics et des publications d'OpenAI.