DALL-E 1, stylisé DALL·E, est la première version d'un modèle de génération d'images à partir de texte développé par OpenAI. Annoncé en janvier 2021, il utilise des méthodologies d'apprentissage profond pour générer des images numériques à partir de descriptions en langage naturel, appelées invites. Le nom est un mot-valise combinant le personnage robot Pixar WALL-E et l'artiste surréaliste espagnol Salvador Dalí.
DALL-E 1 a été une étape marquante dans l'intelligence artificielle générative, démontrant qu'un modèle basé sur un Transformer pouvait produire des images cohérentes et variées à partir de descriptions textuelles. Il a été succédé par DALL-E 2 en 2022 et DALL-E 3 en 2023, chacun améliorant le réalisme, la résolution et la compréhension des invites.
Historique et contexte
OpenAI a révélé DALL-E 1 dans un article de blog le 5 janvier 2021. Il utilisait une version modifiée de GPT-3, un grand modèle de langage avec 175 milliards de paramètres, pour générer des images. Le modèle a été développé aux côtés de CLIP (Contrastive Language-Image Pre-training), un modèle distinct entraîné sur 400 millions de paires image-texte extraites d'Internet. Le rôle de CLIP était de classer les sorties de DALL-E en prédisant quelle légende parmi une liste de 32 768 légendes sélectionnées aléatoirement était la plus appropriée pour une image, aidant ainsi à filtrer les meilleurs résultats.
La sortie de DALL-E 1 a suscité un intérêt public considérable et des discussions sur les capacités et les implications de l'IA générative. Il n'a pas été immédiatement largement disponible ; l'accès a d'abord été restreint à un aperçu de recherche en raison de préoccupations éthiques et de sécurité. Le successeur DALL-E 2 est entré en version bêta en juillet 2022 et a été ouvert à tous en septembre 2022.
Technologie
DALL-E 1 avait trois composants : un autoencodeur variationnel discret (VAE), un modèle Transformer décodeur seul autorégressif avec 12 milliards de paramètres, et une paire d'encodeurs d'images et de texte CLIP. Le VAE discret convertissait les images en séquences de jetons et inversement, car le Transformer ne traitait pas directement les données d'image.
L'entrée du Transformer était une séquence de légendes d'images tokenisées suivie de patchs d'images tokenisés. Les légendes étaient en anglais, tokenisées par codage par paires d'octets avec une taille de vocabulaire de 16 384, et pouvaient contenir jusqu'à 256 jetons. Chaque image était une image RVB de 256×256 divisée en patchs de 32×32 de 4×4 pixels. Chaque patch était converti par le VAE discret en un jeton provenant d'un vocabulaire de 8 192.
Cette architecture était similaire à celle de GPT-3 mais adaptée à la génération d'images. Le modèle autorégressif prédisait les jetons d'image séquentiellement, conditionnés par la légende textuelle. CLIP, basé sur l'apprentissage contrastif, était utilisé pour classer et sélectionner la meilleure image parmi un ensemble plus large généré par le modèle.
Capacités
DALL-E 1 pouvait générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emojis. Il pouvait « manipuler et réorganiser » des objets dans ses images et placer correctement des éléments de conception dans des compositions nouvelles sans instruction explicite. Par exemple, lorsqu'on lui demandait de dessiner un radis daikon se mouchant, sirotant un latte ou faisant du monocycle, il dessinait souvent le mouchoir, les mains et les pieds à des endroits plausibles.
Le modèle montrait une capacité à « combler les lacunes », en déduisant des détails appropriés sans invites spécifiques, comme ajouter des images de Noël aux invites couramment associées à cette célébration et placer les ombres de manière appropriée. Il démontrait une compréhension large des tendances visuelles et de conception.
DALL-E 1 pouvait produire des images pour une grande variété de descriptions arbitraires sous différents angles de vue, avec seulement de rares échecs. Mark Riedl, professeur associé à la Georgia Tech School of Interactive Computing, a constaté qu'il pouvait fusionner des concepts, un élément clé de la créativité humaine. Sa capacité de raisonnement visuel était suffisante pour résoudre les matrices de Raven, des tests visuels souvent utilisés pour mesurer l'intelligence humaine.
Impact et héritage
DALL-E 1 a contribué à populariser la génération d'images à partir de texte et a stimulé davantage de recherches en IA générative. Il a été suivi par DALL-E 2, qui utilisait un modèle de diffusion avec 3,5 milliards de paramètres, et DALL-E 3, intégré à ChatGPT en octobre 2023. Microsoft a implémenté DALL-E 3 dans Bing's Image Creator et l'application Designer, et Copilot fonctionne dessus. En mars 2025, DALL-E 3 a été remplacé dans ChatGPT par les capacités natives de génération d'images de GPT Image.
OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E en février 2024, en utilisant des métadonnées dans la norme C2PA (Coalition for Content Provenance and Authenticity). La sortie de DALL-E 1 a marqué une étape significative dans le développement de l'intelligence artificielle et de l'apprentissage automatique, influençant les modèles et applications ultérieurs.