Text-to-Image-Generierung bezieht sich auf KI-Systeme, die eine natürlichsprachliche Beschreibung, oder Prompt, aufnehmen und ein entsprechendes Bild erzeugen. Die Aufgabe kombiniert Verarbeitung natürlicher Sprache zur Interpretation des Textes mit Computervision und generativer Modellierung zur Darstellung von Pixeln und wurde zu einer der sichtbarsten Anwendungen von Generativen Adversarialen Netzen und später Diffusionsmodellen.
Geschichte
Frühe Versuche in den 2010er Jahren nutzten GANs, die auf Texteinbettungen konditioniert waren, und erzeugten kleine, unscharfe Bilder, die auf enge Bereiche wie Vögel oder Blumen beschränkt waren. Das Feld änderte sich mit DALL-E von OpenAI im Januar 2021, das einen Transformer anwendete, der autoregressiv über Bildtoken trainiert wurde, und mit CLIP später im selben Jahr, das Forschern eine Möglichkeit gab, zu bewerten, wie gut ein Bild zu einer Bildunterschrift passte, und die Erzeugung darauf auszurichten. Der eigentliche Durchbruch war der Wechsel zur Diffusion: DALL-E 2 (2022), Googles Imagen und insbesondere die Open-Source-Veröffentlichung von Stable Diffusion im August 2022 machten qualitativ hochwertige Erzeugung schnell und, im Fall von Stable Diffusion, auf Verbraucher-GPUs lauffähig. Midjourney, über Discord erreichbar, baute ein unverwechselbares ästhetikorientiertes Produkt um dieselben Kerntechniken auf, während Flux, veröffentlicht von Black Forest Labs im Jahr 2024, zu einem neuen Open-Weights-Standard wurde.
Funktionsweise
Die meisten modernen Systeme basieren auf einem latenten Diffusionsmodell: Ein Bild wird durch einen Autoencoder in einen kompakten Latentraum komprimiert, ein Textencoder wandelt den Prompt in eine Einbettung um, und ein Denoising-Netzwerk verwandelt schrittweise zufälliges Rauschen in ein latentes Bild, das von dieser Einbettung geleitet wird, welches dann zu Pixeln dekodiert wird. Techniken wie classifier-free guidance ermöglichen es Nutzern, die Treue zum Prompt gegen die Bildvielfalt abzuwägen. ControlNet, eingeführt 2023, fügte die Fähigkeit hinzu, die Erzeugung zusätzlich zum Text auf einer Skizze, Pose oder Tiefenkarte zu konditionieren, was eine feinere Kontrolle über die Komposition ermöglicht.
Prompt-Kultur und Werkzeuge
Da die Ausgabequalität empfindlich auf die Formulierung reagiert, entstand ein informelles Handwerk rund um das Verfassen effektiver Prompts, das Themenbeschreibung, künstlerischen Stil, Kamera- und Lichtbegriffe sowie negatives Prompting zum Ausschließen unerwünschter Elemente abdeckt, ein frühes Beispiel für das, was später als Prompt-Engineering bezeichnet wurde. Communities auf Discord und Reddit teilten Prompt-Formeln, und sekundäre Werkzeuge entstanden für Hochskalierung, Inpainting und das Kombinieren von Ausgaben. LoRA-Adapter machten es praktikabel, ein Basismodell auf eine bestimmte Figur, einen Stil oder ein Objekt mit einer kleinen Anzahl von Beispielbildern und moderater Rechenleistung fein abzustimmen.
Rezeption und Kritik
Text-to-Image-Werkzeuge fanden schnelle kommerzielle Anwendung in Werbung, Konzeptkunst und Spieldesign, begleitet von anhaltender Kontroverse. Künstler protestierten gegen Modelle, die auf ohne Zustimmung oder Vergütung gescrapten Bildern trainiert wurden, was in breitere KI-Urheberrechts-Streitigkeiten und Klagen gegen mehrere Bildgenerierungsunternehmen mündete. Kritiker äußerten auch Bedenken hinsichtlich Deepfakes, nicht einvernehmlicher Bilder und der Überflutung von Stockfoto- und Social-Plattformen mit gering aufwendiger synthetischer Ausgabe, ein Phänomen, das später als KI-Slop bezeichnet wurde. Labore reagierten mit Inhaltsfiltern, Provenienz-Metadaten und in einigen Fällen KI-Wasserzeichensystemen, obwohl die Durchsetzung im gesamten Ökosystem uneinheitlich bleibt.
Spätere Entwicklungen
Bis 2025 konnten führende Modelle längere, kompositionellere Prompts befolgen, lesbaren Text innerhalb von Bildern rendern und bestehende Fotos durch natürlichsprachliche Anweisungen bearbeiten, wodurch die Lücke zwischen Text-to-Image-Generierung und allgemeiner Bildbearbeitung kleiner wurde.