DALL-E 2 est un modèle de texte à image développé par OpenAI et publié en 2022. Il génère des images numériques à partir de descriptions en langage naturel, appelées prompts, en utilisant des méthodologies de deep learning. Le modèle est le successeur de la DALL-E originale et a été conçu pour produire des images plus réalistes à des résolutions plus élevées, avec la capacité de combiner des concepts, des attributs et des styles.
DALL-E 2 fait partie du domaine plus large de l'intelligence artificielle générative, qui se concentre sur la création de nouveaux contenus. Il utilise une architecture basée sur la diffusion, une rupture avec l'approche autorégressive de son prédécesseur. Le nom est une fusion des mots WALL-E, le robot de Pixar, et du peintre surréaliste espagnol Salvador Dalí.
Histoire et contexte
La DALL-E originale a été annoncée par OpenIA dans un article de blog le 5 janvier 2021, en utilisant une version modifiée de GPT-3 pour générer des images. Le 6 avril 2022, OpenIA a annoncé DALL-E 2 comme successeur, en soulignant sa capacité à générer des images plus réalistes et à combiner des concepts. Initialement, l'accès était limité à un groupe restreint d'utilisateurs sélectionnés pour un aperçu de recherche, en raison de préoccupations éthiques et de sécurité. Le 20 juillet 2022, DALL-E 2 est passé à une phase bêta, invitant un million de personnes sur liste d'attente; les utilisateurs pouvaient générer un nombre limité d'images gratuitement chaque mois et acheter des crédits supplémentaires. L'exigence de liste d'attente a été levée le 28 septembre 2022, ouvrant le modèle au grand public.
Au début de novembre 2022, OpenIA a publié DALL-E 2 sous forme de API, permettant aux développeurs d'intégrer le modèle dans des applications. L'API fonctionne sur une base de coût par image, avec des prix variant selon la résolution et des remises sur volume pour les clients professionnels. Microsoft a intégré DALL-E 2 dans son application Designer et son outil Image Creator dans Bing et Microsoft Edge. En février 2024, OpenIA a commencé à ajouter des filigranes aux images générées par DALL-E, en intégrant des métadonnées à l'aide de la norme C2PA (Coalition pour la Provenance et l'Authenticité du Contenu).
Technologie
DALL-E 2 utilise 3,5 milliards de paramètres, soit moins que les 12 milliards de son prédécesseur. Au lieu d'un transformer autorégressif, il emploie un modèle de diffusion conditionné sur les embeddings d'images CLIP. Pendant l'inférence, un modèle préalable génère ces embeddings d'images à partir des embeddings de texte CLIP. Cette architecture est similaire à celle de Stable, publiée quelques mois plus tard. Le modèle tire parti de réseaux de neurones et de techniques d'apprentissage automatique, en s'appuyant sur les avancées de la recherche en intelligence artificielle.
CLIP (Contrastive Language-Image Pre-training)est un modèle séparé entraîné sur 400 millions de paires texte-image provenant de l'Internet. Il joue un rôle crucial dans la compréhension et le classement des sorties de DALL-E 2, en sélectionnant l'image qui correspond le mieux au prompt. L'action processus de diffusion affine itérativement le bruit aléatoire en une image cohérente, étant guidée par les embeddings CLIP.
Capacités
DALL-E 2 peut générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emojiies. Il peut manipuler et réorganiser des objets, et placer correctement des éléments de conception dans des compositions noveles sans instruction explicite. Par exemple, quand on lui demande de dessinne une radis daikon qui se mouche ou qui boit un latte à la paille, le modèle place souvent les mouchoirs, les mains et les pieds à des endroits plausibles. Il peut également infor des détails appropriés, comme ajouter des images de Noël à des prompts associés à cette fête ou rendant des ombres qui n'ont pas étées.
L'écoute du modèle présente une compréhension particulière des tendances visuelles et en matière de design, et peut produire des images pour une grande variété de descriptions arbitraires from différents angles, avec seulement des échecs rares. Sa capacité de raisonnement visuel est suff sur pour résoudre les matrices de Raven, un test souvent utilisé pour mesurer l'ier de continuité humaine.
Modification de l'image
DALL-E 2 peut produire des variations d'images existantes, ainsi que modifier des images pour les modifier ou les modifier. Sa capacité premium inpainting et d'outrapintage utilise le contexte de l'image originale pour remplir les zones manquantes dans une apparence cohérente, en suivant un prompt donné. Par exemple, les utilisateurs peuvent insérer de nouveaux sujets dans une image ou l'détendre au-delà de ses bords d'origine. Selon OpenIA, l'extérieur ou le viaducte prend en compte les éléments visuels existants tels que les ombres, les reflets et les textures.
Impact et héritage
DALL-E 2 a influencé les développements ultérieurs dans la génération de texte à image, y compris DALL-E 3, publié en octobre 2023, qui a été intégré dans ChatGPT puis remplacé par GPT Image en mars 2025. Le modèle a également contribué à des débats plus larges sur les capacités et les implications éthiques de l'IA générative, notamment en ce qui concerne les risques d'explication butes de mieux utiliser et la nécessité de mesures de provenance telles que l'ajout de marques d'ongles d'eau.