DALL-E 3 est un modèle de génération d'images à partir de texte développé par OpenAI, publié en octobre 2023. Il s'agit de la troisième itération de la série DALL-E, succédant à DALL-E et DALL-E 2. DALL-E 3 utilise des méthodologies d'apprentissage profond pour générer des images numériques à partir de descriptions en langage naturel, appelées invites, en mettant l'accent sur la compréhension de « significativement plus de nuances et de détails » que ses prédécesseurs. Le modèle a été intégré nativement dans ChatGPT pour les clients ChatGPT Plus et ChatGPT Enterprise, puis rendu disponible via l'API et la plateforme Labs d'OpenAI. En mars 2025, DALL-E 3 a été remplacé dans ChatGPT par les capacités natives de génération d'images de GPT Image.
Historique et contexte
DALL-E a été annoncé pour la première fois par OpenAI le 5 janvier 2021, utilisant une version modifiée de GPT-3 pour générer des images. DALL-E 2 a suivi le 6 avril 2022, offrant une résolution plus élevée et la capacité de combiner des concepts, des attributs et des styles. Après une phase bêta en juillet 2022 et une sortie publique en septembre 2022, DALL-E 2 a été rendu disponible via l'API en novembre 2022. En septembre 2023, OpenAI a annoncé DALL-E 3, qui a été publié en octobre 2023. Microsoft a implémenté DALL-E 3 dans l'outil Image Creator de Bing, et Microsoft Copilot fonctionne avec DALL-E 3. Le nom « DALL-E » est un mot-valise du robot Pixar WALL-E et de l'artiste surréaliste espagnol Salvador Dalí. En février 2024, OpenAI a commencé à ajouter des filigranes aux images générées par DALL-E, en utilisant des métadonnées conformes à la norme C2PA.
Technologie
DALL-E 3 s'appuie sur l'architecture de transformeur utilisée dans les modèles GPT d'OpenAI. Bien qu'un rapport technique ait été rédigé pour DALL-E 3, il ne comprend pas de détails sur l'entraînement ou l'implémentation, se concentrant plutôt sur l'amélioration du suivi des invites. Le modèle est conçu pour interpréter des invites complexes avec une plus grande précision et un plus grand détail, et peut générer un texte plus cohérent et plus précis dans les images par rapport aux versions antérieures.
DALL-E et DALL-E 2
Le DALL-E original utilisait un VAE discret, un transformeur autorégressif décodeur seul avec 12 milliards de paramètres, et un modèle CLIP pour classer les sorties. DALL-E 2, avec 3,5 milliards de paramètres, est passé à un modèle de diffusion conditionné sur les plongements d'images CLIP, similaire à l'architecture utilisée plus tard dans Stable Diffusion.
Capacités
DALL-E 3 peut générer des images dans plusieurs styles, y compris des images photoréalistes, des peintures et des emojis. Il peut manipuler et réorganiser des objets, et placer des éléments de conception dans des compositions novatrices. Il suit des invites complexes avec plus de précision et de détail que ses prédécesseurs, et peut produire un texte cohérent dans les images. DALL-E 3 est intégré dans ChatGPT Plus, permettant aux utilisateurs de générer des images directement dans les conversations.
Modification d'images
DALL-E 2 et DALL-E 3 peuvent produire des variations d'images existantes et les modifier, y compris l'incrustation et l'extension. Ces fonctionnalités utilisent le contexte de l'image originale pour remplir les zones manquantes ou étendre au-delà des bordures, en maintenant la cohérence avec les ombres, les reflets et les textures.
Réception et impact
DALL-E 3 a été remarqué pour son suivi d'invites amélioré et son intégration avec ChatGPT, le rendant accessible à un public plus large. Son utilisation dans Image Creator et Copilot de Microsoft a élargi sa portée. La capacité du modèle à générer des images détaillées et précises à partir d'invites complexes a influencé le domaine de l'IA générative, bien que des préoccupations concernant l'éthique et la sécurité aient été soulevées, conduisant à des mesures telles que les filigranes.