Diffusionsmodelle, auch bekannt als diffusionsbasierte generative Modelle oder score-basierte generative Modelle, sind eine Klasse latenter Variablen generativer Modelle im maschinellen Lernen. Sie bestehen aus zwei Hauptkomponenten: einem Vorwärts-Diffusionsprozess, der schrittweise Rauschen zu Daten hinzufügt, und einem Rückwärts-Samplingprozess, der das Entrauschen lernt. Das Ziel ist es, einen Diffusionsprozess für einen gegebenen Datensatz zu lernen, sodass neue Elemente erzeugt werden können, die ähnlich wie die ursprünglichen Daten verteilt sind. Ein trainiertes Diffusionsmodell kann auf verschiedene Weise abgetastet werden, mit unterschiedlichen Abwägungen zwischen Effizienz und Qualität.
Diffusionsmodelle wurden 2015 eingeführt und stützen sich auf Techniken aus der Nichtgleichgewichtsthermodynamik. Die Kernidee besteht darin, die Verteilung der Daten als eine "Wolke" in einem hochdimensionalen Raum zu modellieren. Durch wiederholtes Hinzufügen von Rauschen diffundiert diese Wolke nach außen, bis sie nahezu ununterscheidbar von einer Gaußschen Verteilung wird. Ein Modell, das lernt, diese Diffusion annähernd rückgängig zu machen, kann dann neue Stichproben aus der ursprünglichen Verteilung erzeugen, indem es mit zufälligem Rauschen beginnt und iterativ entrauscht.
Formalismen und Training
Es gibt mehrere äquivalente Formalismen für Diffusionsmodelle, darunter Markov-Ketten, denoising diffusion probabilistic models (DDPM), rauschbedingte Score-Netzwerke und stochastische Differentialgleichungen. Sie werden typischerweise mit variational inference trainiert. Das Modell, das für das Entrauschen verantwortlich ist, wird als "Backbone" bezeichnet, das jede Architektur sein kann, aber häufig ein U-Net oder ein Transformer ist. Das DDPM-Papier von 2020 verbesserte frühere Methoden, indem es variational inference auf den Diffusionsprozess anwendete.
Anwendungen in der Computer Vision
Stand 2024 werden Diffusionsmodelle hauptsächlich für Aufgaben der Computer Vision eingesetzt, einschließlich Bildentrauschung, Inpainting, Super-Resolution, Bildgenerierung und Videogenerierung. Diese Aufgaben beinhalten typischerweise das Training eines neuronalen Netzwerks, um Bilder, die mit Gaußschem Rauschen unscharf gemacht wurden, sequenziell zu entrauschen. Nach dem Training bis zur Konvergenz kann das Modell Bilder erzeugen, indem es mit zufälligem Rauschen beginnt und das Netzwerk iterativ anwendet, um Rauschen zu entfernen. Diffusionsbasierte Bildgeneratoren haben großes kommerzielles Interesse geweckt, mit bemerkenswerten Beispielen wie Stable Diffusion und DALL-E. Diese Systeme kombinieren oft Diffusionsmodelle mit Text-Encodern und Cross-Attention-Modulen, um textbedingte Generierung zu ermöglichen.
Andere Bereiche
Über die Computer Vision hinaus haben Diffusionsmodelle Anwendungen in der natürlichen Sprachverarbeitung gefunden, wie Textgenerierung und Zusammenfassung, sowie in der Klangerzeugung und im bestärkenden Lernen. Ihre Vielseitigkeit hat sie zu einem zentralen Forschungsgebiet im generativen KI gemacht.
Beziehung zu anderen generativen Modellen
Diffusionsmodelle sind Teil einer breiteren Landschaft generativer Modelle, die auch große Sprachmodelle und andere Ansätze umfasst. Während große Sprachmodelle typischerweise auf autoregressiven oder transformerbasierten Architekturen beruhen, bieten Diffusionsmodelle ein alternatives Paradigma, das besonders effektiv für kontinuierliche Daten wie Bilder und Audio ist. Die Wahl des Backbones, ob ein U-Net oder ein Transformer, ermöglicht es Diffusionsmodellen, Fortschritte in der tiefen Lernen- und neuronale Netze-Forschung zu nutzen.
Zukünftige Richtungen
Die Forschung verbessert weiterhin die Effizienz und Qualität von Diffusionsmodellen, indem neue Sampling-Methoden, Backbone-Architekturen und Anwendungen untersucht werden. Die Integration von Diffusionsmodellen mit anderen KI-Systemen, wie denen von OpenAI, Google DeepMind und Anthropic, wird wahrscheinlich weitere Innovationen in der künstlichen Intelligenz vorantreiben.