DALL-E 2 ist ein Text-zu-Bild-Modell, das von OpenAI entwickelt wurde und digitale Bilder aus natürlichen Sprachbeschreibungen, sogenannten Prompts, erzeugt. Es wurde am 6. April 2022 angekündigt, folgte auf das ursprüngliche DALL-E-Modell und wurde entwickelt, um realistischere Bilder in höheren Auflösungen zu erzeugen, mit der Fähigkeit, Konzepte, Attribute und Stile zu kombinieren. Das Modell verwendet Methoden des Deep Learning, insbesondere ein Diffusionsmodell, das auf CLIP-Bild-Embeddings konditioniert ist, und wurde im Laufe des Jahres 2022 schrittweise der Öffentlichkeit zugänglich gemacht.
Der Name DALL-E ist ein Kofferwort aus dem animierten Robotercharakter WALL-E und dem spanischen surrealistischen Künstler Salvador Dalí. Die Entwicklung des Modells markierte einen bedeutenden Schritt in der generativen künstlichen Intelligenz und baute auf früheren Fortschritten im maschinellen Lernen und bei neuronalen Netzen auf.
Geschichte und Hintergrund
Die erste Version von DALL-E wurde von OpenAI im Januar 2021 angekündigt und verwendete eine modifizierte Version von GPT-3, um Bilder zu erzeugen. Am 6. April 2022 kündigte OpenAI DALL-E 2 als Nachfolger an, wobei der Schwerpunkt auf verbesserter Realismus und Auflösung lag. Der Zugang war zunächst aus ethischen und sicherheitstechnischen Gründen auf vorab ausgewählte Nutzer für eine Forschungsvorschau beschränkt. Am 20. Juli 2022 trat das Modell in eine Betaphase ein, wobei Einladungen an 1 Million Personen auf der Warteliste gesendet wurden, die eine bestimmte Anzahl von Bildern pro Monat kostenlos generieren und zusätzliche Credits erwerben konnten. Die Wartelistenanforderung wurde am 28. September 2022 entfernt, wodurch DALL-E 2 für alle geöffnet wurde.
Anfang November 2022 veröffentlichte OpenAI DALL-E 2 als API, die es Entwicklern ermöglichte, das Modell in ihre Anwendungen zu integrieren. Die API arbeitet auf Kosten-pro-Bild-Basis, wobei die Preise je nach Auflösung variieren und Mengenrabatte für Unternehmenskunden verfügbar sind. Microsoft implementierte DALL-E 2 später in seiner Designer-App und dem Image Creator-Tool innerhalb von Bing und Microsoft Edge. Im September 2023 kündigte OpenAI DALL-E 3 an, das im Oktober 2023 in ChatGPT für Plus- und Enterprise-Kunden integriert wurde und im März 2025 durch GPT Image ersetzt wurde.
Technologie
DALL-E 2 verwendet 3,5 Milliarden Parameter, weniger als die 12 Milliarden seines Vorgängers. Anstelle eines autoregressiven Transformer-Modells verwendet es ein Diffusionsmodell, das auf CLIP-Bild-Embeddings konditioniert ist. Während der Inferenz erzeugt ein Prior-Modell diese Bild-Embeddings aus CLIP-Text-Embeddings. Diese Architektur ähnelt der von Stable Diffusion, das einige Monate später veröffentlicht wurde. Das ursprüngliche DALL-E verwendete einen diskreten Variational Autoencoder, um Bilder in Tokens umzuwandeln, die von einem autoregressiven Decoder-only-Transformer verarbeitet wurden, mit einem CLIP-Paar aus Bild- und Text-Encodern zur Bewertung der Ausgaben.
Der Diffusionsprozess von DALL-E 2 verfeinert iterativ Rauschen zu einem Bild, geleitet von den aus Text abgeleiteten Embeddings, was hochauflösende Ausgaben und eine kohärente Platzierung von Objekten ermöglicht. Das Training des Modells umfasste große Datensätze von Bild-Text-Paaren, wobei spezifische Details nicht vollständig offengelegt wurden.
Fähigkeiten
DALL-E 2 kann Bilder in mehreren Stilen erzeugen, einschließlich fotorealistischer Bilder, Gemälde und Emojis. Es kann Objekte manipulieren und neu anordnen und Designelemente in neuartigen Kompositionen ohne explizite Anweisung korrekt platzieren. Wenn es beispielsweise gebeten wird, einen Rettich zu zeichnen, der sich die Nase putzt, einen Latte schlürft oder auf einem Einrad fährt, zeichnet das Modell oft das Taschentuch, die Hände und die Füße an plausiblen Stellen. Es kann auch Lücken füllen, wie das Hinzufügen von Weihnachtsbildern zu Prompts, die mit dem Fest verbunden sind, oder geeignete Schatten zu Bildern, die diese nicht erwähnen.
Das Modell zeigt ein breites Verständnis visueller und gestalterischer Trends und kann Konzepte kombinieren, ein Schlüsselelement menschlicher Kreativität. Seine visuelle Denkfähigkeit reicht aus, um Raven-Matrizen zu lösen, visuelle Tests, die oft an Menschen zur Messung der Intelligenz durchgeführt werden. DALL-E 2 kann Bilder für eine Vielzahl beliebiger Beschreibungen aus verschiedenen Blickwinkeln erzeugen, mit nur seltenen Fehlern.
Bildmodifikation
Bei einem vorhandenen Bild kann DALL-E 2 Variationen als einzelne Ausgaben basierend auf dem Original erzeugen sowie das Bild bearbeiten, um es zu modifizieren oder zu erweitern. Die Inpainting- und Outpainting-Fähigkeiten nutzen den Kontext des Bildes, um fehlende Bereiche gemäß einem gegebenen Prompt zu füllen. Dies kann beispielsweise ein neues Motiv in ein Bild einfügen oder es über seine ursprünglichen Grenzen hinaus erweitern. OpenAI stellte fest, dass Outpainting die vorhandenen visuellen Elemente des Bildes berücksichtigt, einschließlich Schatten, Reflexionen und Texturen.
Sicherheit und Ethik
Während seiner Forschungsvorschau beschränkte OpenAI den Zugang zu DALL-E 2 aufgrund von Bedenken hinsichtlich Missbrauchs, wie der Erzeugung irreführender oder schädlicher Inhalte. Das Unternehmen implementierte Filter, um gewalttätige, erwachsene oder politische Inhalte zu blockieren, und fügte im Februar 2024 Wasserzeichen zu generierten Bildern hinzu, die Metadaten im C2PA-Standard enthalten, der von der Content Authenticity Initiative gefördert wird. Diese Maßnahmen zielten darauf ab, ethische Probleme im Zusammenhang mit Deepfakes und Fehlinformationen anzugehen.
Vermächtnis und Auswirkungen
DALL-E 2 beeinflusste nachfolgende Text-zu-Bild-Modelle und die breitere Forschung zu künstlicher Intelligenz. Sein diffusionsbasierter Ansatz wurde von anderen Systemen übernommen, und seine Integration in Produkte wie Bing Image Creator erweiterte den öffentlichen Zugang zu generativen Bildern. Der Erfolg des Modells trug zur Prominenz von OpenAI auf diesem Gebiet bei, neben Entwicklungen im Deep Learning und bei Aufmerksamkeitsmechanismen.