GPT Image est une famille de modèles de génération texte-à-image développée par OpenAI. Elle a remplacé la série précédente DALL-E comme lignée de génération d'images d'OpenAI, et contrairement à DALL-E, elle est nativement multimodale : la génération d'images est effectuée par la même famille de modèles qui alimente ChatGPT, plutôt que par un modèle de diffusion séparé appelé via un prompt de pont.
Membres
- GPT Image 1 (avril 2025). La première version API de la technologie derrière la génération d'images native de ChatGPT, qui était devenue virale quelques semaines plus tôt grâce à la vague de portraits de style Studio Ghibli. Elle a établi les points forts signature de la famille : un texte lisible dans l'image et un fort suivi des instructions.
- GPT Image 1.5 (fin 2025). Une mise à niveau intérimaire avec une meilleure précision d'édition et une génération plus rapide.
- GPT Image 2 (2026). Le modèle phare actuel, avec un photoréalisme amélioré, un rendu de texte plus long et une édition préservant l'identité.
Importance
La multimodalité native de la famille a changé les pratiques de rédaction de prompts. Parce que le générateur comprend directement le contexte conversationnel et les briefs structurés, les ingénieurs de prompts sont passés de listes de mots-clés (le style de l'ère de la diffusion, encore typique des checkpoints Stable Diffusion) à des briefs en langage naturel de longue forme avec des contraintes explicites, un style qui domine désormais les plateformes de partage de prompts. Sur Wikiprompt, les modèles de la famille GPT Image représentent ensemble la plus grande part des prompts d'images dans le catalogue.
Voir aussi
- DALL-E, la série prédécesseur
- Nano Banana, la gamme de modèles d'images concurrente de Google
- Midjourney