Aus dem Englischen übersetzt

DALL-E 2 ist ein von OpenAI entwickeltes Text-zu-Bild-Modell, das 2022 veröffentlicht wurde und mithilfe von Diffusion und CLIP-Embeddings realistische Bilder aus natürlichen Sprachaufforderungen erzeugt.

DALL-E 2 ist ein Text-zu-Bild-Modell, das von OpenAI entwickelt und 2022 veröffentlicht wurde. Es erzeugt digitale Bilder aus natürlichsprachlichen Beschreibungen, sogenannten Prompts, mithilfe von Deep-Learning-Methoden. Das Modell ist der Nachfolger des ursprünglichen DALL-E und wurde entwickelt, um realistischere Bilder in höheren Auflösungen zu produzieren, mit der Fähigkeit, Konzepte, Attribute und Stile zu kombinieren.

DALL-E 2 ist Teil des breiteren Feldes der generativen künstlichen Intelligenz, das sich auf die Erstellung neuer Inhalte konzentriert. Es verwendet eine diffusionsbasierte Architektur, eine Abkehr vom autoregressiven Ansatz seines Vorgängers. Der Name ist ein Kofferwort aus dem Pixar-Roboter WALL-E und dem spanischen surrealistischen Künstler Salvador Dalí.

Geschichte und Hintergrund

Das ursprüngliche DALL-E wurde von OpenAI in einem Blogbeitrag am 5. Januar 2021 angekündigt und verwendete eine modifizierte Version von GPT-3, um Bilder zu erzeugen. Am 6. April 2022 kündigte OpenAI DALL-E 2 als Nachfolger an und betonte dessen Fähigkeit, realistischere Bilder zu erzeugen und Konzepte zu kombinieren. Zunächst war der Zugang aus ethischen und sicherheitstechnischen Gründen auf vorab ausgewählte Nutzer für eine Forschungspreview beschränkt. Am 20. Juli 2022 trat DALL-E 2 in eine Beta-Phase ein und lud 1 Million Personen von der Warteliste ein; Nutzer konnten eine begrenzte Anzahl von Bildern pro Monat kostenlos generieren und zusätzliche Credits erwerben. Die Wartelistenanforderung wurde am 28. September 2022 entfernt, wodurch das Modell der allgemeinen Öffentlichkeit zugänglich wurde.

Anfang November 2022 veröffentlichte OpenAI DALL-E 2 als API, die es Entwicklern ermöglicht, das Modell in Anwendungen zu integrieren. Die API funktioniert auf Kosten-pro-Bild-Basis, wobei die Preise je nach Auflösung variieren und Mengenrabatte für Unternehmenskunden gelten. Microsoft integrierte DALL-E 2 in seine Designer-App und das Image-Creator-Tool in Bing und Microsoft Edge. Im Februar 2024 begann OpenAI, Wasserzeichen zu DALL-E-generierten Bildern hinzuzufügen und Metadaten mithilfe des C2PA-Standards (Coalition for Content Provenance and Authenticity) einzubetten.

Technologie

DALL-E 2 verwendet 3,5 Milliarden Parameter, weniger als die 12 Milliarden seines Vorgängers. Statt eines autoregressiven Transformers nutzt es ein Diffusionsmodell, das auf CLIP-Bild-Einbettungen konditioniert ist. Während der Inferenz erzeugt ein Prior-Modell diese Bild-Einbettungen aus CLIP-Text-Einbettungen. Diese Architektur ähnelt der von Stable Diffusion, das einige Monate später veröffentlicht wurde. Das Modell nutzt neuronale Netze und maschinelles Lernen-Techniken und baut auf Fortschritten in der Forschung zu künstlicher Intelligenz auf.

CLIP (Contrastive Language-Image Pre-training) ist ein separates Modell, das auf 400 Millionen Bild-Text-Paaren aus dem Internet trainiert wurde. Es spielt eine entscheidende Rolle beim Verstehen und Bewerten der Ausgaben von DALL-E 2, indem es das Bild auswählt, das am besten zum Prompt passt. Der Diffusionsprozess verfeinert iterativ zufälliges Rauschen zu einem kohärenten Bild, geleitet von den CLIP-Einbettungen.

Fähigkeiten

DALL-E 2 kann Bilder in mehreren Stilen erzeugen, darunter fotorealistische Bilder, Gemälde und Emojis. Es kann Objekte manipulieren und neu anordnen sowie Designelemente in neuartigen Kompositionen ohne explizite Anweisung korrekt platzieren. Wenn es beispielsweise aufgefordert wird, einen Daikon-Rettich zu zeichnen, der sich die Nase putzt, einen Latte schlürft oder Einrad fährt, platziert das Modell oft Taschentücher, Hände und Füße an plausiblen Stellen. Es kann auch angemessene Details ableiten, wie das Hinzufügen von Weihnachtsbildern zu Prompts, die mit dem Feiertag verbunden sind, oder das Rendern von Schatten, die nicht erwähnt wurden.

Das Modell zeigt ein breites Verständnis visueller und gestalterischer Trends und kann Bilder für eine Vielzahl beliebiger Beschreibungen aus verschiedenen Blickwinkeln erzeugen, mit nur seltenen Fehlern. Seine visuelle Denkfähigkeit reicht aus, um Raven-Matrizen zu lösen, einen Test, der häufig zur Messung menschlicher Intelligenz verwendet wird.

Bildmodifikation

DALL-E 2 kann Variationen vorhandener Bilder erzeugen sowie Bilder bearbeiten, um sie zu modifizieren oder zu erweitern. Die Inpainting- und Outpainting-Fähigkeiten nutzen den Kontext des Originalbilds, um fehlende Bereiche in einem konsistenten Medium gemäß einem gegebenen Prompt zu füllen. Beispielsweise können Nutzer neue Motive in ein Bild einfügen oder es über seine ursprünglichen Grenzen hinaus erweitern. Laut OpenAI berücksichtigt Outpainting vorhandene visuelle Elemente wie Schatten, Reflexionen und Texturen.

Auswirkungen und Vermächtnis

DALL-E 2 beeinflusste nachfolgende Entwicklungen in der Text-zu-Bild-Generierung, einschließlich DALL-E 3, das im Oktober 2023 veröffentlicht und in ChatGPT integriert wurde und später im März 2025 durch GPT Image ersetzt wurde. Das Modell trug auch zu breiteren Diskussionen über die Fähigkeiten und ethischen Implikationen generativer KI bei, einschließlich Bedenken hinsichtlich Missbrauch und der Notwendigkeit von Herkunftsmaßnahmen wie Wasserzeichen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:text-to-image·generative-ai·openai·diffusion-models
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte