DALL-E 3 ist ein Text-zu-Bild-Modell, das von OpenAI entwickelt und im Oktober 2023 als dritte Iteration der DALL-E-Serie veröffentlicht wurde. Es wurde nativ in ChatGPT für ChatGPT-Plus- und ChatGPT-Enterprise-Kunden verfügbar gemacht, mit breiterem Zugang über die OpenAI-API und die Labs-Plattform Anfang November 2023. Das Modell baut auf den Grundlagen seiner Vorgänger DALL-E und DALL-E 2 auf und nutzt Deep Learning, um digitale Bilder aus natürlichen Sprachprompts zu erzeugen.
Der Name DALL-E ist ein Kofferwort aus dem Pixar-Robotercharakter WALL-E und dem spanischen surrealistischen Künstler Salvador Dalí. Die erste Version wurde im Januar 2021 angekündigt, gefolgt von DALL-E 2 im April 2022. DALL-E 3 stellt einen bedeutenden Fortschritt beim Verständnis von Nuancen und Details in Prompts dar und wurde in Microsofts Bing Image Creator integriert, wobei Microsoft Copilot auf dem Modell läuft.
Geschichte und Hintergrund
OpenAI stellte DALL-E erstmals in einem Blogbeitrag am 5. Januar 2021 vor und verwendete eine modifizierte Version von GPT-3 zur Bilderzeugung. DALL-E 2 wurde am 6. April 2022 angekündigt und sollte realistischere Bilder in höheren Auflösungen erzeugen sowie Konzepte, Attribute und Stile kombinieren. Es ging am 20. Juli 2022 in die Beta-Phase über, wobei Einladungen an 1 Million Personen auf der Warteliste gesendet wurden, und wurde am 28. September 2022 für alle geöffnet.
Im September 2023 kündigte OpenAI DALL-E 3 an, das deutlich mehr Nuancen und Details versteht als frühere Iterationen. Das Modell wurde im Oktober 2023 nativ in ChatGPT für Plus- und Enterprise-Kunden veröffentlicht. Anfang November 2023 folgte die Verfügbarkeit über die OpenAI-API und die Labs-Plattform. Microsoft implementierte das Modell im Bing Image Creator und plante die Integration in seine Designer-App.
Im Februar 2024 begann OpenAI, Wasserzeichen zu DALL-E-generierten Bildern hinzuzufügen, die Metadaten im C2PA-Standard (Coalition for Content Provenance and Authenticity) enthalten, der von der Content Authenticity Initiative gefördert wird. Im März 2025 wurde DALL-E 3 in ChatGPT durch die nativen Bildgenerierungsfunktionen von GPT Image ersetzt.
Technologie
Das erste generative vortrainierte Transformer-Modell (GPT) wurde 2018 von OpenAI unter Verwendung einer Transformer-Architektur entwickelt. GPT-1 wurde zu GPT-2 im Jahr 2019 und zu GPT-3 mit 175 Milliarden Parametern im Jahr 2020 skaliert. DALL-E 3 verwendet Deep-Learning-Methoden, obwohl der technische Bericht von OpenAI zu DALL-E 3 keine Trainings- oder Implementierungsdetails enthält und sich stattdessen auf verbesserte Prompt-Befolgungsfähigkeiten konzentriert.
DALL-E-Architektur
Das ursprüngliche DALL-E hatte drei Komponenten: einen diskreten VAE, ein autoregressives Decoder-only-Transformer-Modell mit 12 Milliarden Parametern ähnlich GPT-3 und ein CLIP-Paar aus Bild-Encoder und Text-Encoder. Der diskrete VAE wandelt Bilder in Sequenzen von Tokens um und zurück, was notwendig ist, da der Transformer Bilddaten nicht direkt verarbeitet.
Die Transformer-Eingabe ist eine Sequenz aus tokenisierten Bildunterschriften, gefolgt von tokenisierten Bildausschnitten. Die Unterschriften sind auf Englisch, tokenisiert durch Byte-Pair-Encoding mit einer Vokabulargröße von 16384, bis zu 256 Tokens lang. Jedes Bild ist 256×256 RGB, unterteilt in 32×32 Ausschnitte von je 4×4, wobei jeder Ausschnitt durch einen diskreten variationalen Autoencoder in ein Token mit Vokabulargröße 8192 umgewandelt wird.
CLIP (Contrastive Language-Image Pre-training) wurde zusammen mit DALL-E entwickelt und auf 400 Millionen Bildpaaren mit Textunterschriften trainiert. Es bewertet die Ausgabe von DALL-E, indem es vorhersagt, welche Unterschrift aus einer Liste von 32.768 zufällig ausgewählten Unterschriften am besten zu einem Bild passt, und filtert so aus einer größeren anfänglichen Liste die nächste Übereinstimmung aus.
DALL-E-2- und DALL-E-3-Architektur
DALL-E 2 verwendet 3,5 Milliarden Parameter, weniger als sein Vorgänger, und nutzt ein Diffusionsmodell, das auf CLIP-Bild-Embeddings konditioniert ist, mit einem Prior-Modell, das diese Embeddings während der Inferenz aus CLIP-Text-Embeddings generiert. Diese Architektur ähnelt Stable Diffusion, das einige Monate später veröffentlicht wurde.
DALL-E 3 setzt diesen diffusionsbasierten Ansatz fort, jedoch mit verbesserter Prompt-Befolgung. Obwohl keine öffentlichen technischen Details verfügbar sind, zeigt das Modell eine verbesserte Genauigkeit beim Befolgen komplexer Prompts und beim Erzeugen kohärenter Texte in Bildern.
Fähigkeiten
DALL-E kann Bilder in mehreren Stilen erzeugen, darunter fotorealistische Bilder, Gemälde und Emojis. Es kann Objekte manipulieren und neu anordnen sowie Designelemente in neuartigen Kompositionen ohne explizite Anweisung korrekt platzieren. Wenn man es beispielsweise bittet, einen Rettich zu zeichnen, der sich die Nase putzt, einen Latte schlürft oder Einrad fährt, zeichnet DALL-E oft Taschentuch, Hände und Füße an plausiblen Stellen.
Das Modell kann Lücken füllen, um geeignete Details ohne spezifische Prompts zu erschließen, etwa Weihnachtsbilder zu Prompts hinzuzufügen, die üblicherweise mit dem Fest assoziiert werden, und Schatten in Bildern angemessen zu platzieren, die sie nicht erwähnen. DALL-E zeigt ein breites Verständnis visueller und gestalterischer Trends und kann Bilder für eine Vielzahl beliebiger Beschreibungen aus verschiedenen Blickwinkeln erzeugen, mit nur seltenen Fehlern.
Mark Riedl, außerordentlicher Professor an der Georgia Tech School of Interactive Computing, fand heraus, dass DALL-E Konzepte verschmelzen kann, was als Schlüsselelement menschlicher Kreativität beschrieben wird. Seine visuelle Denkfähigkeit reicht aus, um Raven-Matrizen zu lösen, visuelle Tests, die oft an Menschen zur Messung von Intelligenz durchgeführt werden.
DALL-E 3 folgt komplexen Prompts mit mehr Genauigkeit und Detailtreue als seine Vorgänger und kann kohärentere und genauere Texte in Bildern erzeugen. Es ist in ChatGPT Plus integriert, sodass Benutzer Bilder über konversationelle Prompts generieren können.
Bildmodifikation
Bei einem vorhandenen Bild können DALL-E 2 und DALL-E 3 Variationen des Bildes als einzelne Ausgaben basierend auf dem Original erzeugen sowie das Bild bearbeiten, um es zu modifizieren oder zu erweitern. Die Inpainting- und Outpainting-Fähigkeiten nutzen den Kontext eines Bildes, um fehlende Bereiche mit einem zum Original konsistenten Medium gemäß einem gegebenen Prompt zu füllen.
Dies kann beispielsweise verwendet werden, um ein neues Subjekt in ein Bild einzufügen oder ein Bild über seine ursprünglichen Grenzen hinaus zu erweitern. Laut OpenAI berücksichtigt Outpainting die vorhandenen visuellen Elemente des Bildes, einschließlich Schatten, Reflexionen und Texturen, um Konsistenz zu wahren.
Integration und Verfügbarkeit
DALL-E 3 wurde im Oktober 2023 nativ in ChatGPT für ChatGPT-Plus- und ChatGPT-Enterprise-Kunden veröffentlicht. Die Verfügbarkeit über die OpenAI-API und die Labs-Plattform folgte Anfang November 2023. Microsoft implementierte das Modell im Bing Image Creator, wobei Microsoft Copilot auf DALL-E 3 läuft, und plante die Integration in seine Designer-App.
Die API arbeitet auf Kosten-pro-Bild-Basis, wobei die Preise je nach Bildauflösung variieren. Mengenrabatte sind für Unternehmen verfügbar, die mit dem Enterprise-Team von OpenAI zusammenarbeiten. Im März 2025 wurde DALL-E 3 in ChatGPT durch die nativen Bildgenerierungsfunktionen von GPT Image ersetzt.
Sicherheit und Herkunft
OpenAI hat Sicherheitsbedenken bei DALL-E-Modellen adressiert, darunter Einschränkungen für schädliche Inhalte und das Hinzufügen von Wasserzeichen. Im Februar 2024 begann OpenAI, Wasserzeichen zu DALL-E-generierten Bildern hinzuzufügen, die Metadaten im C2PA-Standard enthalten, der von der Content Authenticity Initiative gefördert wird. Dies hilft, die Herkunft KI-generierter Bilder zu verifizieren.
Vermächtnis
DALL-E 3 stellt einen Meilenstein in der generativen KI und Text-zu-Bild-Technologie dar und baut auf früheren Arbeiten zu Deep Learning und neuronalen Netzen auf. Seine Integration mit Großsprachmodell-Systemen wie ChatGPT zeigt die Konvergenz von Sprach- und Bilderzeugung. Die Fähigkeiten des Modells haben nachfolgende Entwicklungen in diesem Bereich beeinflusst, darunter GPT Image und andere Bildgenerierungssysteme.
Die Veröffentlichung von DALL-E 3 im Oktober 2023 markierte eine Verschiebung hin zu zugänglicherer und nuancierterer KI-Bildgenerierung mit Auswirkungen auf kreative Branchen, Content-Erstellung und digitale Kunst. Seine Verwendung in Microsoft Copilot und Bing Image Creator erweiterte seine Reichweite auf ein breiteres Publikum.