Traduit de l'anglais

Une série de modèles de génération texte-image développés par OpenAI entre 2021 et 2023, qui ont contribué à populariser l’imagerie générée par IA auprès du grand public.

DALL-E est une série de modèles de génération texte-vers-image développés par OpenAI, nommée comme un mot-valise de l'artiste Salvador Dali et du robot Pixar WALL-E. Le DALL-E original a été annoncé en janvier 2021 comme un modèle transformeur de 12 milliards de paramètres, basé sur la même famille d'architecture que GPT-3, entraîné pour générer des images à partir de descriptions textuelles en traitant la génération d'images comme un problème de prédiction de séquence sur des jetons d'image discrets, plutôt que d'utiliser les techniques de diffusion qui domineraient plus tard le domaine.

Évolution à travers les versions

DALL-E 2, publié en avril 2022, a remplacé l'approche originale par jetons discrets par une architecture basée sur la diffusion, guidée par CLIP, le modèle d'intégration conjoint image-texte d'OpenAI, produisant des images nettement plus haute résolution et plus photoréalistes, et introduisant une fonctionnalité d'« inpainting » pour éditer des parties d'images existantes à partir d'une description textuelle. La version bêta publique de DALL-E 2, suivie d'une disponibilité générale plus tard en 2022, a attiré une attention médiatique grand public considérable et est largement créditée, aux côtés de sorties contemporaines telles que Midjourney et Stable Diffusion, d'avoir amené l'imagerie générée par IA à la conscience publique grand public pour la première fois. DALL-E 3, publié en 2023 et intégré directement dans ChatGPT pour les abonnés, a amélioré l'adhérence aux invites et le rendu du texte dans les images, et a utilisé ChatGPT lui-même pour développer et affiner les invites courtes des utilisateurs avant de les transmettre au modèle d'image.

Réception et impact

Les sorties de DALL-E ont suscité un débat public substantiel sur l'avenir du travail créatif visuel, générant à la fois de l'enthousiasme de la part des utilisateurs expérimentant l'art et le design assistés par IA, et des inquiétudes de la part des illustrateurs et photographes professionnels concernant le déplacement et l'utilisation d'images protégées par le droit d'auteur dans les données d'entraînement sans consentement, un différend qui a alimenté des litiges plus larges sur l'IA et le droit d'auteur dans l'industrie de l'IA générative. Le système a également attiré l'attention pour son potentiel à générer de la désinformation et des images non consensuelles, incitant OpenAI à mettre en place des filtres de contenu et, pendant une période, des restrictions sur la génération de visages reconnaissables de figures publiques.

Héritage

DALL-E est généralement crédité comme l'un des modèles, aux côtés de travaux académiques antérieurs sur les GAN et de concurrents ouverts ultérieurs, qui a établi la génération texte-vers-image comme une technologie grand public et commerciale plutôt qu'une curiosité de recherche. Son succès a contribué directement à la stratégie multimodale plus large d'OpenAI, informant les capacités de compréhension et de génération d'images ultérieurement intégrées dans GPT-4 et les modèles suivants, et a aidé à populariser l'écriture d'invites comme une compétence pertinente pour les systèmes d'IA générative visuels, pas seulement textuels.

Catégories:generative-ai·image-generation·openai
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique