DALL-E 3 est un modèle de génération d'images à partir de texte développé par OpenAI, publié en octobre 2023 comme troisième itération de la série DALL-E. Il a été rendu disponible nativement dans ChatGPT pour les clients ChatGPT Plus et ChatGPT Enterprise, avec un accès élargi via l'API et la plateforme Labs d'OpenAI au début de novembre 2023. Le modèle s'appuie sur les fondations de ses prédécesseurs, DALL-E et DALL-E 2, en utilisant l'apprentissage profond pour générer des images numériques à partir de descriptions en langage naturel.
Le nom DALL-E est un mot-valise combinant le personnage robot de Pixar WALL-E et l'artiste surréaliste espagnol Salvador Dalí. La première version a été annoncée en janvier 2021, suivie de DALL-E 2 en avril 2022. DALL-E 3 représente une avancée significative dans la compréhension des nuances et des détails des descriptions, et il a été intégré à l'outil Bing Image Creator de Microsoft, avec Microsoft Copilot fonctionnant sur ce modèle.
Historique et contexte
OpenAI a d'abord révélé DALL-E dans un article de blog le 5 janvier 2021, en utilisant une version modifiée de GPT-3 pour générer des images. DALL-E 2 a été annoncé le 6 avril 2022, conçu pour générer des images plus réalistes à des résolutions plus élevées et pour combiner des concepts, des attributs et des styles. Il est entré en version bêta le 20 juillet 2022 avec des invitations envoyées à 1 million de personnes sur liste d'attente, et a été ouvert à tous le 28 septembre 2022.
En septembre 2023, OpenAI a annoncé DALL-E 3, capable de comprendre significativement plus de nuances et de détails que les itérations précédentes. Le modèle a été publié nativement dans ChatGPT pour les clients Plus et Enterprise en octobre 2023. Le début de novembre 2023 a vu sa disponibilité via l'API et la plateforme Labs d'OpenAI. Microsoft a implémenté le modèle dans l'outil Image Creator de Bing et prévoyait son intégration dans son application Designer.
En février 2024, OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E, contenant des métadonnées selon la norme C2PA (Coalition pour la provenance et l'authenticité du contenu) promue par l'Initiative pour l'authenticité du contenu. En mars 2025, DALL-E 3 a été remplacé dans ChatGPT par les capacités de génération d'images natives de GPT Image.
Technologie
Le premier modèle génératif pré-entraîné à transformateur (GPT) a été développé par OpenAI en 2018 en utilisant une architecture de transformateur. GPT-1 a été mis à l'échelle pour produire GPT-2 en 2019, puis GPT-3 avec 175 milliards de paramètres en 2020. DALL-E 3 utilise des méthodologies d'apprentissage profond, bien que le rapport technique d'OpenAI pour DALL-E 3 n'inclue pas de détails sur l'entraînement ou l'implémentation, se concentrant plutôt sur les capacités améliorées de suivi des descriptions.
Architecture de DALL-E
Le DALL-E original avait trois composants : un VAE discret, un modèle de transformateur autorégressif décodeur seul avec 12 milliards de paramètres similaire à GPT-3, et une paire CLIP d'encodeur d'images et d'encodeur de texte. Le VAE discret convertit les images en séquences de jetons et inversement, nécessaire car le transformateur ne traite pas directement les données d'image.
L'entrée du transformateur est une séquence de légendes d'images tokenisées suivie de patchs d'images tokenisés. Les légendes sont en anglais, tokenisées par encodage par paires d'octets avec une taille de vocabulaire de 16384, jusqu'à 256 jetons de longueur. Chaque image est en RGB 256×256, divisée en patchs de 32×32 de 4×4 chacun, chaque patch étant converti par un autoencodeur variationnel discret en un jeton avec une taille de vocabulaire de 8192.
CLIP (Pré-entraînement contrastif langage-image) a été développé parallèlement à DALL-E, entraîné sur 400 millions de paires d'images avec des légendes textuelles. Il classe la sortie de DALL-E en prédisant quelle légende parmi une liste de 32 768 légendes sélectionnées aléatoirement est la plus appropriée pour une image, filtrant une liste initiale plus large pour sélectionner la correspondance la plus proche.
Architecture de DALL-E 2 et DALL-E 3
DALL-E 2 utilise 3,5 milliards de paramètres, moins que son prédécesseur, et emploie un modèle de diffusion conditionné sur des plongements d'images CLIP, avec un modèle préalable générant ces plongements à partir de plongements de texte CLIP lors de l'inférence. Cette architecture est similaire à Stable Diffusion, publié quelques mois plus tard.
DALL-E 3 poursuit cette approche basée sur la diffusion mais avec un suivi amélioré des descriptions. Bien qu'aucun détail technique public ne soit disponible, le modèle démontre une précision accrue dans le suivi de descriptions complexes et la génération de texte cohérent dans les images.
Capacités
DALL-E peut générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emojis. Il peut manipuler et réorganiser des objets, et placer correctement des éléments de conception dans des compositions nouvelles sans instruction explicite. Par exemple, lorsqu'on lui demande de dessiner un radis daikon se mouchant, sirotant un latte ou faisant du monocycle, DALL-E dessine souvent le mouchoir, les mains et les pieds à des endroits plausibles.
Le modèle peut combler les blancs pour déduire des détails appropriés sans descriptions spécifiques, comme ajouter des images de Noël aux descriptions couramment associées à cette célébration, et placer des ombres de manière appropriée dans des images qui ne les mentionnent pas. DALL-E montre une compréhension large des tendances visuelles et de conception, et peut produire des images pour une grande variété de descriptions arbitraires sous différents angles avec seulement de rares échecs.
Mark Riedl, professeur associé à l'École d'informatique interactive du Georgia Tech, a constaté que DALL-E pouvait fusionner des concepts, décrit comme un élément clé de la créativité humaine. Sa capacité de raisonnement visuel est suffisante pour résoudre les matrices de Raven, des tests visuels souvent administrés aux humains pour mesurer l'intelligence.
DALL-E 3 suit des descriptions complexes avec plus de précision et de détails que ses prédécesseurs, et peut générer un texte plus cohérent et précis dans les images. Il est intégré à ChatGPT Plus, permettant aux utilisateurs de générer des images via des descriptions conversationnelles.
Modification d'images
Étant donné une image existante, DALL-E 2 et DALL-E 3 peuvent produire des variations de l'image comme sorties individuelles basées sur l'original, ainsi que modifier l'image pour la changer ou l'étendre. Les capacités d'inpainting et d'outpainting utilisent le contexte d'une image pour remplir les zones manquantes en utilisant un médium cohérent avec l'original, en suivant une description donnée.
Par exemple, cela peut être utilisé pour insérer un nouveau sujet dans une image, ou étendre une image au-delà de ses frontières originales. Selon OpenAI, l'outpainting prend en compte les éléments visuels existants de l'image, y compris les ombres, les reflets et les textures, pour maintenir la cohérence.
Intégration et disponibilité
DALL-E 3 a été publié nativement dans ChatGPT pour les clients ChatGPT Plus et ChatGPT Enterprise en octobre 2023. La disponibilité via l'API et la plateforme Labs d'OpenAI a suivi au début de novembre 2023. Microsoft a implémenté le modèle dans l'outil Image Creator de Bing, avec Microsoft Copilot fonctionnant sur DALL-E 3, et prévoyait son intégration dans leur application Designer.
L'API fonctionne sur une base de coût par image, avec des prix variant selon la résolution de l'image. Des remises sur volume sont disponibles pour les entreprises travaillant avec l'équipe entreprise d'OpenAI. En mars 2025, DALL-E 3 a été remplacé dans ChatGPT par les capacités de génération d'images natives de GPT Image.
Sécurité et provenance
OpenAI a abordé les préoccupations de sécurité avec les modèles DALL-E, y compris des restrictions sur le contenu nuisible et l'ajout de filigranes. En février 2024, OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E, contenant des métadonnées selon la norme C2PA promue par l'Initiative pour l'authenticité du contenu. Cela aide à vérifier la provenance des images générées par IA.
Héritage
DALL-E 3 représente une étape importante dans la technologie de l'IA générative et du texte vers image, s'appuyant sur des travaux antérieurs sur les modèles de apprentissage profond et de réseau neuronal. Son intégration avec les systèmes de modèle de langage étendu comme ChatGPT démontre la convergence de la génération de langage et d'images. Les capacités du modèle ont influencé les développements ultérieurs dans le domaine, y compris GPT Image et d'autres systèmes de génération d'images.
La publication de DALL-E 3 en octobre 2023 a marqué un tournant vers une génération d'images par IA plus accessible et nuancée, avec des implications pour les industries créatives, la création de contenu et l'art numérique. Son utilisation dans Microsoft Copilot et Bing Image Creator a élargi sa portée à un public plus large.