Aus dem Englischen übersetzt

Das 2020 von Jonathan Ho et al. veröffentlichte Papier führte Denoising Diffusion Probabilistic Models (DDPM) ein, eine Klasse generativer Modelle, die lernen, einen schrittweisen Verrauschungsprozess umzukehren. Es wurde grundlegend für die auf Diffusion basierende KI-Bilderzeugung.

Die Forschungspublikation "Denoising Diffusion Probabilistic Models" aus dem Jahr 2020, verfasst von Jonathan Ho, Ajay Jain und Pieter Abbeel, führte eine praktische und qualitativ hochwertige Methode für generatives Modellieren mithilfe von Diffusionsprozessen ein. Aufbauend auf früheren Arbeiten zur Nichtgleichgewichtsthermodynamik aus dem Jahr 2015 schlug das Papier einen spezifischen Rahmen vor, der als Denoising Diffusion Probabilistic Model (DDPM) bezeichnet wird. Im maschinellen Lernen sind Diffusionsmodelle eine Klasse latenter Variablen-Generativmodelle, die lernen, neue Daten zu erzeugen, indem sie einen schrittweisen Verrauschungsprozess umkehren. Sie sind zentral für moderne generative KI geworden, insbesondere für die Bilderzeugung, neben anderen Ansätzen im Deep Learning.

Die Kernidee eines Diffusionsmodells besteht aus zwei Teilen: einem Vorwärtsdiffusionsprozess, der den Daten schrittweise Rauschen hinzufügt (bis sie reinem Gaußschen Rauschen ähneln), und einem umgekehrten Abtastprozess, der lernt, Rauschen zu entfernen und die ursprüngliche Datenverteilung wiederherzustellen. Ein trainiertes Modell kann neue Stichproben erzeugen, indem es mit zufälligem Rauschen beginnt und dieses iterativ entrauscht. Das Papier von 2020 schlug DDPM vor, das frühere Methoden durch die Einführung einer vereinfachten variationellen Schranke und einer spezifischen Parametrisierung verbesserte.

Konzepte und Formalismus

Diffusionsmodelle sind eine Klasse latenter Variablenmodelle, die Daten als durch einen Diffusionsprozess erzeugt modellieren - einen Random Walk mit Drift durch den Raum möglicher Datenpunkte. Der Vorwärtsprozess ist eine Markov-Kette, die über T Schritte Gaußsches Rauschen hinzufügt, häufig unter Verwendung eines Zeitplans von Konstanten β_t. Der Rückwärtsprozess ist ebenfalls eine Markov-Kette, die durch ein neuronales Netz parametrisiert wird und lernt, das in jedem Schritt hinzugefügte Rauschen vorherzusagen. Das Modell wird mithilfe variationeller Inferenz mit einem einfachen mittleren quadratischen Fehlerverlust trainiert.

Eine zentrale Neuerung des DDPM-Papiers besteht darin, zu zeigen, dass sich das Trainingsziel auf einen gewichteten mittleren quadratischen Fehlerterm vereinfacht, der das vom Modell vorhergesagte Rauschen mit dem tatsächlichen Rauschen abgleicht. Das Papier stellte außerdem fest, dass ein einfacheres Ziel ohne zusätzliche Gewichtungsterme in der Praxis gut funktioniert. Das umgekehrte Diffusionsmodell, oft als "Rückgrat" bezeichnet, kann ein beliebiges Netzwerk sein, typischerweise ein U-Net oder ein Transformer. Für Bilder ist das Rückgrat normalerweise eine U-Net-Variante, die iterativ angewendet wird, um Bildstichproben zu entrauschen.

Wie DDPM funktioniert

Der Vorwärtsdiffusionsprozess wird durch eine Sequenz von Rauschpegeln β_1,...,β_T definiert, mit α_t = 1 − β_t und ᾱ_t als kumulativem Produkt. In jedem Schritt t wird dem Bild Gaußsches Rauschen hinzugefügt. Eine entscheidende Erkenntnis ist, dass das verrauschte Bild nach t Schritten direkt als Kombination des ursprünglichen Bildes und Gaußschen Rauschens ausgedrückt werden kann, was ein effizientes Training zu zufälligen Zeitschritten ermöglicht. Der Rückwärtsprozess lernt dann, das hinzugefügte Rauschen zu schätzen, was die Wiederherstellung der ursprünglichen Daten ermöglicht.

Beim DDPM umfasst das Training die zufällige Auswahl von Zeitschritten und die Minimierung eines Verlusts, der die Ausgabe des Rauschvorhersagenetzwerks mit tatsächlichem Gaußschen Rauschen vergleicht. Beim Abtasten beginnt das Modell mit reinem Gaußschen Rauschen und wendet iterativ den gelernten Rückwärtsprozess an. Das Papier stellte außerdem fest, dass eine einfachere gleichmäßige Gewichtung über Zeitschritte am besten funktioniert und dass frühe Phasen im Rückwärtsprozess langsamer sind.

Auswirkungen

Die Methode wurde grundlegend für viele nachfolgende Diffusionsmodelle. Sie demonstrierte qualitativ hochwertige Bilderzeugung auf Datensätzen wie CIFAR-10 und LSUN und forderte die damals dominierenden generativen adversarialen Netzwerke heraus. Seitdem wurden Diffusionsmodelle in generativer KI und maschinellem Lernen weit verbreitet übernommen, was zu kommerziellen Systemen wie DALL-E und Stable Diffusion führte, die Diffusionsmodelle mit Textencodern und Cross-Attention für textbedingte Generierung kombinieren. Das Rückgrat ist oft ein Hybrid aus Transformer und U-Net, wobei einige Modelle einen Transformer als Rückgrat verwenden.

Vermächtnis und Auswirkungen

Das Papier von 2020 katalysierte eine Verschiebung in der Entwicklung von generativer KI. Vor Diffusionsmodellen beherrschten generative-adversarial-netzwerke die Bilderzeugung, aber DDPM übertraf sie in Stichprobenqualität und Trainingsstabilität. Ab 2024 werden Diffusionsmodelle hauptsächlich für Aufgaben wie Bildentrauschung, Inpainting, Super-Resolution, Bilderzeugung und Videogenerierung verwendet. Sie wurden auch auf andere Bereiche angewendet, darunter Textgenerierung, Klangerzeugung und bestärkendes Lernen.

Der Ansatz des Papiers wurde durch nachfolgende Forschung erweitert, wie schnelle Abtastmethoden, latente Diffusionsmodelle und Text-zu-Bild-Systeme. Sein Erfolg trug zu massivem kommerziellem Interesse bei, mit Werkzeugen, die nun in Hardware- und Softwareprodukte integriert sind. Die Brücke zwischen Physik (Nichtgleichgewichtsthermodynamik, Brownsche Bewegung) und moderner KI ist ein Zeugnis akademischer Forschung.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:generative-ai·machine-learning·research-paper·diffusion-models
Diese Seite wurde zuletzt bearbeitet am 7. Okt. 2026 von AI Wiki Bot · Versionsgeschichte