GPT Image 1 ist ein Text-zu-Bild-Generierungsmodell, das von OpenAI entwickelt und im April 2025 über die OpenAI-API veröffentlicht wurde. Es ist die produktisierte Version der nativen Bildgenerierungsfähigkeit, die im März 2025 in ChatGPT integriert wurde und deren Start zu einem der viralsten Momente in der Verbraucher-KI wurde: Der Trend mit Porträts im Studio-Ghibli-Stil erzeugte so viel Verkehr, dass OpenAI die Bildgenerierung für kostenlose Nutzer vorübergehend mit Ratenlimits versah.
GPT Image 1 folgte auf DALL-E 3 als OpenAIs Bildmodell. Der architektonische Wandel war bedeutend: Statt eines Diffusionsmodells, das über einen Vermittler angesteuert wird, generiert GPT Image 1 Bilder nativ innerhalb eines multimodalen Transformers, was ihm kontextuelles Bewusstsein in Gesprächen und deutlich bessere Befolgung von Anweisungen verleiht.
Fähigkeiten
Bei der Veröffentlichung führte GPT Image 1 das Feld in zwei Bereichen an, die Nutzer von Diffusionsmodellen seit Jahren frustriert hatten:
- Lesbarer Text in Bildern. Schilder, Poster, Produktetiketten und UI-Mockups wurden mit korrekter Rechtschreibung in Raten gerendert, die frühere Modelle nicht erreichen konnten.
- Befolgung von Aufforderungen. Mehrteilige Anforderungen (spezifische Objektanzahlen, räumliche Layouts, Stilmischungen) wurden zuverlässig umgesetzt, was strukturierte, lange Aufforderungen praktikabel machte.
Es unterstützte auch Bildbearbeitung mit Masken, Referenzbild-Eingaben und transparente Hintergründe, was es für Produktfotografie und Design-Workflows beliebt machte.
Vermächtnis
GPT Image 1 definierte den Aufforderungsstil, der die aktuelle Ära dominiert: lange, natürlichsprachliche Briefings, die in Abschnitte gegliedert sind, oft mit Kameravokabular aus der Fotografie. Es wurde von GPT Image 1.5 und dann GPT Image 2 abgelöst, die denselben Ansatz erweiterten. Siehe GPT-Image-Familie.