GPT Image ist eine Familie von Text-zu-Bild-Generierungsmodellen, die von OpenAI entwickelt wurde. Sie ersetzte die frühere DALL-E-Serie als OpenAIs Bildgenerierungslinie und ist im Gegensatz zu DALL-E nativ multimodal: Die Bildgenerierung erfolgt durch dieselbe Modellfamilie, die auch ChatGPT antreibt, und nicht durch ein separates Diffusionsmodell, das über einen Brücken-Prompt aufgerufen wird.
Mitglieder
- GPT Image 1 (April 2025). Die erste API-Veröffentlichung der Technologie hinter der nativen Bildgenerierung von ChatGPT, die Wochen zuvor durch die Welle von Porträts im Studio-Ghibli-Stil viral gegangen war. Etablierte die charakteristischen Stärken der Familie: lesbarer Text im Bild und starke Befehlsbefolgung.
- GPT Image 1.5 (Ende 2025). Ein Zwischen-Upgrade mit besserer Bearbeitungspräzision und schnellerer Generierung.
- GPT Image 2 (2026). Das aktuelle Flaggschiff mit verbessertem Fotorealismus, längerer Textdarstellung und identitätserhaltender Bearbeitung.
Bedeutung
Die native Multimodalität der Familie veränderte die Praxis des Prompt-Schreibens. Da der Generator Konversationskontext und strukturierte Anweisungen direkt versteht, wechselten Prompt-Engineers von Schlagwortlisten (dem Diffusionszeitalter-Stil, der noch typisch für Stable Diffusion-Checkpoints ist) zu langen, natürlichsprachlichen Anweisungen mit expliziten Einschränkungen - ein Stil, der heute Prompt-Sharing-Plattformen dominiert. Auf Wikiprompt machen die Modelle der GPT-Image-Familie zusammen den größten Anteil der Bild-Prompts im Katalog aus.
Siehe auch
- DALL-E, die Vorgängerserie
- Nano Banana, Googles konkurrierende Bildmodell-Linie
- Midjourney