Traduit de l'anglais

DALL-E est une série de modèles de génération d'images à partir de texte développés par OpenAI, annoncée pour la première fois en janvier 2021, qui génèrent des images numériques à partir de descriptions en langage naturel en utilisant l'apprentissage profond.

DALL-E est une série de modèles de génération d'images à partir de texte développés par OpenAI qui produisent des images numériques à partir de descriptions en langage naturel, appelées invites. La première version a été annoncée en janvier 2021, suivie de DALL-E 2 en 2022 et de DALL-E 3 en 2023. Le nom est un mot-valise combinant le robot animé WALL-E et l'artiste surréaliste Salvador Dalí.

Historique et contexte

OpenAI a révélé DALL-E dans un article de blog le 5 janvier 2021, en utilisant une version modifiée de son modèle GPT-3 pour générer des images. Le 6 avril 2022, l'entreprise a annoncé DALL-E 2, un successeur conçu pour produire des images plus réalistes à des résolutions plus élevées et pour combiner des concepts, des attributs et des styles. L'accès était initialement restreint à des utilisateurs présélectionnés pour un aperçu de recherche en raison de préoccupations éthiques et de sécurité. Le 20 juillet 2022, DALL-E 2 est passé en version bêta, avec des invitations envoyées à un million de personnes sur liste d'attente ; les utilisateurs pouvaient générer un nombre limité d'images gratuitement chaque mois et en acheter davantage. Le 28 septembre 2022, la liste d'attente a été supprimée et le modèle est devenu accessible à tous.

En septembre 2023, OpenAI a annoncé DALL-E 3, capable de comprendre beaucoup plus de nuances et de détails que les itérations précédentes. Il a été intégré nativement à ChatGPT pour les clients Plus et Enterprise en octobre 2023, avec une disponibilité via l'API et Labs début novembre. Microsoft a intégré DALL-E 3 dans le créateur d'images de Bing et son application Designer, et Microsoft Copilot fonctionne avec DALL-E 3. En mars 2025, DALL-E 3 a été remplacé dans ChatGPT par les capacités de génération d'images natives de GPT Image.

En février 2024, OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E, intégrant des métadonnées selon la norme C2PA (Coalition for Content Provenance and Authenticity) promue par la Content Authenticity Initiative.

Technologie

Le premier modèle de transformeur génératif pré-entraîné (GPT) a été développé par OpenAI en 2018, utilisant une architecture Transformer (architecture). Il a été étendu à GPT-2 en 2019 puis à GPT-3 en 2020, avec 175 milliards de paramètres.

DALL-E

DALL-E se compose de trois éléments : un autoencodeur variationnel discret (VAE), un modèle transformeur autorégressif décodeur seul avec 12 milliards de paramètres similaire à GPT-3, et une paire d'encodeurs d'images et de texte CLIP (Contrastive Language-Image Pre-training). Le VAE discret convertit une image en une séquence de jetons et inversement, permettant au transformeur de traiter les données d'image. Le transformeur reçoit une séquence de légendes d'images tokenisées suivie de patchs d'images tokenisés. Les légendes sont en anglais, tokenisées par codage par paires d'octets avec une taille de vocabulaire de 16 384, et peuvent contenir jusqu'à 256 jetons. Chaque image est en RGB 256×256, divisée en patchs de 32×32 de 4×4 pixels, chacun converti par le VAE en un jeton d'un vocabulaire de 8 192.

CLIP, développé parallèlement à DALL-E, est un modèle distinct basé sur l'apprentissage contrastif, entraîné sur 400 millions de paires image-texte extraites d'Internet. Il classe la sortie de DALL-E en prédisant quelle légende parmi une liste de 32 768 légendes sélectionnées aléatoirement est la plus appropriée pour une image. Une paire CLIP entraînée filtre une liste initiale plus large d'images générées pour sélectionner celle qui se rapproche le plus de l'invite.

DALL-E 2

DALL-E 2 utilise 3,5 milliards de paramètres, moins que son prédécesseur. Au lieu d'un transformeur autorégressif, il utilise un modèle de diffusion conditionné sur des embeddings d'images CLIP, qui sont générés à partir d'embeddings de texte CLIP par un modèle préalable lors de l'inférence. Cette architecture est similaire à celle de Stable Diffusion, publié quelques mois plus tard.

DALL-E 3

OpenAI a publié un rapport technique pour DALL-E 3, mais il n'inclut pas de détails sur l'entraînement ou l'implémentation, se concentrant plutôt sur les capacités améliorées de suivi des invites.

Capacités

DALL-E peut générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emojis. Il peut manipuler et réorganiser des objets dans les images et placer correctement des éléments de conception dans des compositions nouvelles sans instruction explicite. Par exemple, lorsqu'on lui demande de dessiner un radis daïkon se mouchant, sirotant un latte ou faisant du monocycle, DALL-E dessine souvent le mouchoir, les mains et les pieds à des endroits plausibles. Il peut déduire des détails appropriés non mentionnés dans les invites, comme ajouter des images de Noël aux invites liées aux fêtes ou placer des ombres de manière appropriée. DALL-E démontre également une compréhension large des tendances visuelles et de conception.

DALL-E peut produire des images pour une grande variété de descriptions arbitraires sous différents angles, avec seulement de rares échecs. Mark Riedl, professeur associé à la Georgia Tech School of Interactive Computing, a constaté que DALL-E pouvait fusionner des concepts, ce qu'il a décrit comme un élément clé de la créativité humaine. Sa capacité de raisonnement visuel est suffisante pour résoudre les matrices de Raven, des tests visuels souvent utilisés pour mesurer l'intelligence humaine.

DALL-E 3 suit des invites complexes avec plus de précision et de détails que ses prédécesseurs et peut générer un texte plus cohérent et plus précis. Il est intégré à ChatGPT Plus.

Modification d'images

DALL-E 2 et DALL-E 3 peuvent produire des variations d'images existantes et les modifier pour les ajuster ou les étendre. Les capacités d'impainting et d'outpainting utilisent le contexte d'une image pour remplir les zones manquantes dans un style cohérent avec l'original, en suivant une invite donnée. Cela peut insérer un nouveau sujet dans une image ou l'étendre au-delà de ses limites d'origine. Selon OpenAI, l'outpainting prend en compte les éléments visuels existants de l'image, y compris les ombres, les reflets et les textures.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:text-to-image·openai·generative-ai·deep-learning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique