Traduit de l'anglais

DALL-E 2 est un modèle de génération d'images à partir de texte développé par OpenAI, publié en avril 2022, qui produit des images réalistes à partir de descriptions en langage naturel en utilisant des embeddings de diffusion et de CLIP. Il a succédé au DALL-E original et a ensuite été suivi par DALL-E 3.

DALL-E 2 est un modèle de texte-à-image développé par OpenAI qui génère des images numériques à partir de descriptions en langage naturel, appelées invites. Annoncé le 6 avril 2022, il a succédé au modèle DALL-E original et a été conçu pour produire des images plus réalistes à des résolutions plus élevées, avec la capacité de combiner des concepts, des attributs et des styles. Le modèle utilise des méthodologies d'apprentissage profond, en particulier un modèle de diffusion conditionné sur des plongements d'images CLIP, et a été rendu public par étapes au cours de l'année 2022.

Le nom DALL-E est un mot-valise combinant le personnage robotique animé WALL-E et l'artiste surréaliste espagnol Salvador Dalí. Le développement du modèle a marqué une étape significative dans l'intelligence artificielle générative, s'appuyant sur des avancées antérieures en apprentissage automatique et en réseaux de neurones.

Historique et contexte

La première version de DALL-E a été annoncée par OpenAI en janvier 2021, utilisant une version modifiée de GPT-3 pour générer des images. Le 6 avril 2022, OpenAI a annoncé DALL-E 2 comme successeur, en mettant l'accent sur un réalisme et une résolution améliorés. L'accès était initialement restreint à des utilisateurs présélectionnés pour un aperçu de recherche en raison de préoccupations éthiques et de sécurité. Le 20 juillet 2022, le modèle est entré en phase bêta, avec des invitations envoyées à 1 million de personnes sur liste d'attente, qui pouvaient générer un certain nombre d'images gratuitement chaque mois et acheter des crédits supplémentaires. L'exigence de liste d'attente a été supprimée le 28 septembre 2022, ouvrant DALL-E 2 à tous.

Au début de novembre 2022, OpenAI a publié DALL-E 2 en tant qu'API, permettant aux développeurs d'intégrer le modèle dans leurs applications. L'API fonctionne sur une base de coût par image, avec des prix variant selon la résolution et des remises sur volume disponibles pour les clients d'entreprise. Microsoft a ensuite implémenté DALL-E 2 dans son application Designer et son outil Image Creator au sein de Bing et Microsoft Edge. En septembre 2023, OpenAI a annoncé DALL-E 3, intégré à ChatGPT pour les clients Plus et Enterprise en octobre 2023, puis remplacé par GPT Image en mars 2025.

Technologie

DALL-E 2 utilise 3,5 milliards de paramètres, moins que les 12 milliards de son prédécesseur. Au lieu d'un modèle Transformer autorégressif, il emploie un modèle de diffusion conditionné sur des plongements d'images CLIP. Pendant l'inférence, un modèle préalable génère ces plongements d'images à partir de plongements de texte CLIP. Cette architecture est similaire à celle de Stable Diffusion, publié quelques mois plus tard. Le DALL-E original utilisait un autoencodeur variationnel discret pour convertir les images en jetons, traités par un Transformer autorégressif décodeur seul, avec une paire CLIP d'encodeurs d'images et de texte pour classer les sorties.

Le processus de diffusion de DALL-E 2 affine itérativement le bruit en une image, guidé par les plongements dérivés du texte, permettant des sorties haute résolution et un placement cohérent des objets. L'entraînement du modèle impliquait de grands ensembles de données de paires image-texte, bien que les détails spécifiques n'aient pas été entièrement divulgués.

Capacités

DALL-E 2 peut générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emoji. Il peut manipuler et réorganiser des objets, et placer correctement des éléments de conception dans des compositions nouvelles sans instruction explicite. Par exemple, lorsqu'on lui demande de dessiner un radis daikon se mouchant, sirotant un latte ou faisant du monocycle, le modèle dessine souvent le mouchoir, les mains et les pieds à des endroits plausibles. Il peut également combler les vides, comme ajouter des images de Noël à des invites associées à cette célébration ou des ombres appropriées à des images qui ne les mentionnent pas.

Le modèle montre une compréhension large des tendances visuelles et de conception, et peut fusionner des concepts, un élément clé de la créativité humaine. Sa capacité de raisonnement visuel est suffisante pour résoudre les matrices de Raven, des tests visuels souvent administrés aux humains pour mesurer l'intelligence. DALL-E 2 peut produire des images pour une grande variété de descriptions arbitraires sous différents points de vue, avec seulement de rares échecs.

Modification d'images

Étant donné une image existante, DALL-E 2 peut produire des variations comme sorties individuelles basées sur l'original, ainsi que modifier l'image pour la modifier ou l'étendre. Les capacités d'inpainting et d'outpainting utilisent le contexte de l'image pour remplir les zones manquantes, en suivant une invite donnée. Par exemple, cela peut insérer un nouveau sujet dans une image ou l'étendre au-delà de ses frontières originales. OpenAI a noté que l'outpainting prend en compte les éléments visuels existants de l'image, y compris les ombres, les reflets et les textures.

Sécurité et éthique

Pendant son aperçu de recherche, OpenAI a restreint l'accès à DALL-E 2 en raison de préoccupations concernant une utilisation abusive, comme la génération de contenu trompeur ou nuisible. L'entreprise a implémenté des filtres pour bloquer le contenu violent, adulte ou politique, et a ajouté des filigranes aux images générées en février 2024, contenant des métadonnées dans la norme C2PA promue par la Content Authenticity Initiative. Ces mesures visaient à répondre aux problèmes éthiques liés aux deepfakes et à la désinformation.

Héritage et impact

DALL-E 2 a influencé les modèles de texte-à-image ultérieurs et la recherche plus large en intelligence artificielle. Son approche basée sur la diffusion a été adoptée par d'autres systèmes, et son intégration dans des produits comme Bing Image Creator a élargi l'accès du public à l'imagerie générative. Le succès du modèle a contribué à la proéminence d'OpenAI dans le domaine, aux côtés des développements en apprentissage profond et en mécanismes d'attention.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:text-to-image·openai·generative-ai·diffusion-model
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique