एक डिफ्यूज़न मॉडल एक जनरेटिव मॉडल है जो क्रमिक शोर प्रक्रिया को उलट कर डेटा, आमतौर पर चित्र, वीडियो या ऑडियो बनाना सीखता है: इसे दूषित नमूने से धीरे-धीरे शोर हटाने के लिए प्रशिक्षित किया जाता है, और एक बार प्रशिक्षित होने के बाद, यह शुद्ध यादृच्छिक शोर से शुरू करके और इसे सुसंगत आउटपुट में पुनरावृत्त रूप से डीनॉइज़ करके नया डेटा उत्पन्न कर सकता है। 2020 के दशक के मध्य तक, डिफ्यूज़न मॉडल अधिकांश प्रमुख Text-to-image generation और Text-to-video generation प्रणालियों के पीछे की तकनीक हैं, जिन्होंने उच्च-निष्ठा छवि संश्लेषण के लिए प्रमुख दृष्टिकोण के रूप में Generative adversarial network को विस्थापित कर दिया है।
इतिहास
सैद्धांतिक आधार 2015 में जस्चा सोहल-डिकस्टीन और सहयोगियों द्वारा एक पेपर में रखा गया था, जिसने गैर-संतुलन थर्मोडायनामिक्स के साथ एक सादृश्य बनाया, जो शोर के साथ डेटा में संरचना को धीरे-धीरे नष्ट करने और फिर इसे उलटना सीखने की प्रक्रिया का वर्णन करता है। यह दृष्टिकोण एक शोध जिज्ञासा बना रहा जब तक कि जोनाथन हो, अजय जैन और पीटर एबील ने 2020 में डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल, या डीडीपीएम प्रकाशित नहीं किया, जिसमें दिखाया गया कि एक अपेक्षाकृत सरल प्रशिक्षण उद्देश्य जीएएन के बराबर छवि गुणवत्ता उत्पन्न कर सकता है। यह तकनीक अप्रैल 2022 में OpenAI के DALL-E 2 के माध्यम से मुख्यधारा के ध्यान में आई, और कुछ महीने बाद अगस्त 2022 में Stable Diffusion के ओपन-सोर्स रिलीज़ के साथ व्यापक रूप से सुलभ हो गई, जो लेटेंट डिफ्यूज़न पर आधारित थी, एक 2022 की तकनीक जिसे Robin Rombach और सहयोगियों द्वारा पेश किया गया था, जो कच्चे पिक्सल के बजाय संपीड़ित Latent space में डीनॉइज़िंग प्रक्रिया चलाती थी, जिससे डिफ्यूज़न मॉडल को प्रशिक्षित करने और चलाने के लिए आवश्यक कंप्यूट की मात्रा में भारी कटौती हुई।
यह कैसे काम करता है
एक डिफ्यूज़न मॉडल को प्रशिक्षित करने में एक फॉरवर्ड प्रक्रिया शामिल होती है जो कई चरणों में वास्तविक डेटा नमूने में गाऊसी शोर की छोटी मात्रा जोड़ती है जब तक कि यह शुद्ध शोर से अप्रभेद्य न हो जाए, और एक तंत्रिका नेटवर्क, आमतौर पर एक यू-नेट या, तेजी से, एक Transformer (architecture)-आधारित वास्तुकला, जिसे प्रत्येक चरण में जोड़े गए शोर की भविष्यवाणी करने और हटाने के लिए प्रशिक्षित किया जाता है, प्रभावी रूप से रिवर्स प्रक्रिया सीखता है। पीढ़ी इस रिवर्स प्रक्रिया को शुरू से चलाती है: यादृच्छिक शोर से शुरू करके, मॉडल कई चरणों में बार-बार शोर की भविष्यवाणी करता है और घटाता है, धीरे-धीरे एक सुसंगत छवि या वीडियो प्रकट करता है। कंडीशनिंग तंत्र, सबसे आम तौर पर एक टेक्स्ट Prompt को एन्कोड करके और इसे क्रॉस-अटेंशन के माध्यम से डीनॉइज़िंग नेटवर्क में फीड करके, उपयोगकर्ताओं को यह मार्गदर्शन करने देते हैं कि मॉडल क्या उत्पन्न करता है, और क्लासिफायर-मुक्त मार्गदर्शन जैसी तकनीकें मजबूत करती हैं कि आउटपुट उस कंडीशनिंग सिग्नल का कितनी बारीकी से पालन करता है।
अनुप्रयोग और पारिस्थितिकी तंत्र
डिफ्यूज़न मॉडल अनिवार्य रूप से व्यापक उपयोग में हर प्रमुख छवि जनरेटर को शक्ति देते हैं, जिसमें Stable Diffusion, DALL-E, मिडजर्नी और फ्लक्स शामिल हैं, और सोरा, Google के वेओ, और क्लिंग और सीडेंस सहित चीनी प्रणालियों जैसे प्रमुख वीडियो जनरेटर के अंतर्गत हैं। 2023 में पेश किए गए ControlNet जैसे एक्सटेंशन संरचनात्मक कंडीशनिंग जोड़ते हैं, जिससे उपयोगकर्ता स्केच, पोज़ या डेप्थ मैप के साथ पीढ़ी का मार्गदर्शन कर सकते हैं, जबकि ओपन चेकपॉइंट्स के आसपास निर्मित पारिस्थितिकी तंत्र समुदाय द्वारा प्रशिक्षित LoRA एडेप्टर जैसी तकनीकों के माध्यम से व्यापक अनुकूलन का समर्थन करते हैं। डिफ्यूज़न तकनीकों को मीडिया पीढ़ी से परे भी लागू किया गया है, जिसमें प्रोटीन संरचना भविष्यवाणी और अणु डिजाइन शामिल हैं, और शोधकर्ताओं ने अधिकांश Large language model द्वारा उपयोग किए जाने वाले टोकन-दर-टोकन ऑटोरेग्रेसिव दृष्टिकोण के विकल्प के रूप में टेक्स्ट पीढ़ी के लिए डिफ्यूज़न-आधारित दृष्टिकोणों का पता लगाया है, हालांकि 2025 तक टेक्स्ट के लिए ऑटोरेग्रेसिव पीढ़ी प्रमुख बनी हुई है।
सीमाएं
जीएएन की तुलना में, डिफ्यूज़न मॉडल अनुमान समय पर कम्प्यूटेशनल रूप से महंगे हैं क्योंकि एक एकल नमूना उत्पन्न करने के लिए दर्जनों या सैकड़ों अनुक्रमिक डीनॉइज़िंग चरणों की आवश्यकता हो सकती है, हालांकि कुछ-चरण मॉडल में आसवन और बेहतर सैंपलर जैसी तकनीकों ने 2022 के बाद से इस लागत को काफी कम कर दिया है। बड़े, अनक्यूरेटेड वेब-स्क्रैप्ड डेटासेट पर प्रशिक्षित डिफ्यूज़न मॉडल को भी AI and copyright विवादों का सामना करना पड़ा है कि क्या Training data में कलाकारों की शैली में या उनके समान छवियां उत्पन्न करना उल्लंघन है, और कुछ शर्तों के तहत याद किए गए प्रशिक्षण चित्रों को शब्दशः पुन: उत्पन्न करने की उनकी क्षमता पर जांच की गई है।