Aus dem Englischen übersetzt

DALL-E 3 ist ein Text-zu-Bild-Modell von OpenAI, das im Oktober 2023 veröffentlicht wurde und für verbesserte Prompt-Befolgung sowie Integration mit ChatGPT bekannt ist. Es erzeugt Bilder aus natürlichen Sprachbeschreibungen mithilfe von Deep Learning.

DALL-E 3 ist ein Text-zu-Bild-Modell, das von OpenAI entwickelt und im Oktober 2023 veröffentlicht wurde. Es ist die dritte Iteration der DALL-E-Serie, nach DALL-E und DALL-E 2. DALL-E 3 verwendet Methoden des Deep Learning, um digitale Bilder aus natürlichen Sprachbeschreibungen, sogenannten Prompts, zu generieren, mit einem Fokus darauf, „deutlich mehr Nuancen und Details“ als seine Vorgänger zu verstehen. Das Modell wurde nativ in ChatGPT für ChatGPT-Plus- und ChatGPT-Enterprise-Kunden integriert und später über die API und die Labs-Plattform von OpenAI verfügbar gemacht. Im März 2025 wurde DALL-E 3 in ChatGPT durch die nativen Bildgenerierungsfähigkeiten von GPT Image ersetzt.

Geschichte und Hintergrund

DALL-E wurde erstmals am 5. Januar 2021 von OpenAI angekündigt und verwendete eine modifizierte Version von GPT-3 zur Bildgenerierung. DALL-E 2 folgte am 6. April 2022 und bot eine höhere Auflösung sowie die Fähigkeit, Konzepte, Attribute und Stile zu kombinieren. Nach einer Beta-Phase im Juli 2022 und einer öffentlichen Veröffentlichung im September 2022 wurde DALL-E 2 im November 2022 über die API verfügbar gemacht. Im September 2023 kündigte OpenAI DALL-E 3 an, das im Oktober 2023 veröffentlicht wurde. Microsoft implementierte DALL-E 3 im Bildgenerator von Bing, und Microsoft Copilot läuft auf DALL-E 3. Der Name „DALL-E“ ist ein Kofferwort aus dem Pixar-Roboter WALL-E und dem spanischen surrealistischen Künstler Salvador Dalí. Im Februar 2024 begann OpenAI, Wasserzeichen zu DALL-E-generierten Bildern hinzuzufügen, wobei Metadaten im C2PA-Standard verwendet wurden.

Technologie

DALL-E 3 baut auf der Transformer-Architektur auf, die in den GPT-Modellen von OpenAI verwendet wird. Obwohl ein technischer Bericht für DALL-E 3 verfasst wurde, enthält dieser keine Trainings- oder Implementierungsdetails, sondern konzentriert sich stattdessen auf die verbesserte Prompt-Befolgung. Das Modell ist darauf ausgelegt, komplexe Prompts mit größerer Genauigkeit und Detailtreue zu interpretieren und kann im Vergleich zu früheren Versionen kohärenteren und genaueren Text in Bildern generieren.

DALL-E und DALL-E 2

Das ursprüngliche DALL-E verwendete ein diskretes VAE, einen autoregressiven Decoder-only-Transformer mit 12 Milliarden Parametern und ein CLIP-Modell zur Bewertung der Ausgaben. DALL-E 2 mit 3,5 Milliarden Parametern wechselte zu einem Diffusionsmodell, das auf CLIP-Bild-Embeddings konditioniert ist, ähnlich der Architektur, die später in Stable Diffusion verwendet wurde.

Fähigkeiten

DALL-E 3 kann Bilder in mehreren Stilen generieren, darunter fotorealistische Bilder, Gemälde und Emojis. Es kann Objekte manipulieren und neu anordnen sowie Designelemente in neuartigen Kompositionen platzieren. Es folgt komplexen Prompts mit mehr Genauigkeit und Detailtreue als seine Vorgänger und kann kohärenten Text in Bildern erzeugen. DALL-E 3 ist in ChatGPT Plus integriert, sodass Benutzer Bilder direkt in Konversationen generieren können.

Bildmodifikation

DALL-E 2 und DALL-E 3 können Variationen vorhandener Bilder erzeugen und diese bearbeiten, einschließlich Inpainting und Outpainting. Diese Funktionen nutzen den Kontext des Originalbilds, um fehlende Bereiche zu füllen oder über die Ränder hinaus zu erweitern, wobei Konsistenz bei Schatten, Reflexionen und Texturen gewahrt bleibt.

Rezeption und Auswirkungen

DALL-E 3 wurde für seine verbesserte Prompt-Befolgung und die Integration mit ChatGPT beachtet, was es einem breiteren Publikum zugänglich macht. Seine Verwendung im Bing-Bildgenerator und in Copilot von Microsoft hat seine Reichweite erweitert. Die Fähigkeit des Modells, detaillierte und genaue Bilder aus komplexen Prompts zu generieren, hat das Feld der generativen KI beeinflusst, obwohl Bedenken hinsichtlich Ethik und Sicherheit geäußert wurden, was zu Maßnahmen wie Wasserzeichen führte.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:text-to-image·openai·generative-ai·deep-learning
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte