डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) जनरेटिव मॉडल की एक श्रेणी हैं, जो मशीन लर्निंग में एक क्रमिक नॉइज़िंग प्रक्रिया को उलटना सीखकर डेटा उत्पन्न करते हैं। वे डिफ्यूज़न मॉडल के व्यापक परिवार से संबंधित हैं, जो डेटा को उच्च-आयामी स्थान में बहाव के साथ एक यादृच्छिक चाल से गुजरने के रूप में मॉडल करते हैं। DDPM को 2020 के एक पेपर में पेश किया गया था, जिसने वैरिएशनल इन्फ्रेंस का उपयोग करके पहले के डिफ्यूज़न-आधारित दृष्टिकोणों में सुधार किया, और वे कई आधुनिक छवि निर्माण प्रणालियों की नींव बन गए।
DDPM में, फॉरवर्ड प्रक्रिया समय-चरणों के अनुक्रम में एक छवि में गाऊसी शोर जोड़ती है, धीरे-धीरे इसे शुद्ध शोर में बदल देती है। मॉडल को इस प्रक्रिया को उलटने के लिए प्रशिक्षित किया जाता है, जो यादृच्छिक शोर से शुरू होकर यथार्थवादी छवि उत्पन्न करने के लिए पुनरावृत्त रूप से डीनॉइज़ करता है। यह दृष्टिकोण छवि निर्माण, इनपेंटिंग और सुपर-रिज़ॉल्यूशन जैसे कार्यों के लिए अत्यधिक प्रभावी साबित हुआ है, और यह स्टेबल डिफ्यूज़न और DALL-E जैसी वाणिज्यिक प्रणालियों को रेखांकित करता है।
मुख्य तंत्र
DDPM ढांचा शोर स्तरों की एक निश्चित अनुसूची के साथ एक फॉरवर्ड डिफ्यूज़न प्रक्रिया को परिभाषित करता है। किसी दी गई छवि के लिए, प्रत्येक समय-चरण पर एक वेरिएंस अनुसूची के अनुसार शोर जोड़ा जाता है, जिससे तेजी से शोर वाले संस्करणों का अनुक्रम उत्पन्न होता है। रिवर्स प्रक्रिया एक तंत्रिका नेटवर्क द्वारा सीखी जाती है, आमतौर पर एक U-Net या एक ट्रांसफॉर्मर, जो प्रत्येक चरण पर शोर घटक की भविष्यवाणी करता है। प्रशिक्षण पूर्वानुमानित और वास्तविक शोर के बीच एक सरल माध्य-वर्ग त्रुटि को कम करता है, जो वैरिएशनल इन्फ्रेंस के एक रूप के बराबर है।
गणितीय रूप से, फॉरवर्ड प्रक्रिया (0,1) में स्थिरांक \(\beta_1, \dots, \beta_T\) का उपयोग करती है, जिसमें \(\alpha_t = 1 - \beta_t\) और \(\bar{\alpha}_t = \prod_{s=1}^t \alpha_s\) होता है। समय-चरण \(t\) पर शोर वाली छवि मूल छवि और गाऊसी शोर का एक रैखिक संयोजन है, जिसमें वेरिएंस \(\sigma_t^2 = 1 - \bar{\alpha}_t\) होता है। रिवर्स प्रक्रिया एक तंत्रिका नेटवर्क द्वारा पैरामीटराइज़ की जाती है जो डीनॉइज़िंग वितरण का माध्य आउटपुट करता है।
प्रशिक्षण और सैंपलिंग
DDPM को प्रशिक्षित करने में एक यादृच्छिक समय-चरण का नमूना लेना, छवि में संबंधित शोर जोड़ना और नेटवर्क को उस शोर की भविष्यवाणी करने के लिए प्रशिक्षित करना शामिल है। लॉस फ़ंक्शन \(\mathbb{E}_{t, \mathbf{x}_0, \epsilon}[\|\epsilon - \epsilon_\theta(\mathbf{x}_t, t)\|^2]\) है, जहां \(\epsilon\) शोर है और \(\epsilon_\theta\) नेटवर्क की भविष्यवाणी है। यह उद्देश्य लॉग-लाइक्लिहुड पर एक वैरिएशनल बाउंड से लिया गया है।
सैंपलिंग के समय, मॉडल शुद्ध गाऊसी शोर से शुरू होता है और रिवर्स प्रक्रिया को \(T\) चरणों के लिए पुनरावृत्त रूप से लागू करता है, हर बार शोर का एक हिस्सा हटाता है। चरणों की संख्या को डीनॉइज़िंग डिफ्यूज़न इम्प्लिसिट मॉडल (DDIM) जैसी तकनीकों का उपयोग करके या शोर अनुसूची सीखकर कम किया जा सकता है, जिससे तेज़ निर्माण संभव होता है।
ऐतिहासिक संदर्भ
डिफ्यूज़न मॉडल पहली बार 2015 में जैस्चा सोहल-डिकस्टीन और सहयोगियों सहित शोधकर्ताओं द्वारा प्रस्तावित किए गए थे, जो गैर-संतुलन थर्मोडायनामिक्स के सिद्धांतों का उपयोग करते थे। उन्होंने दिखाया कि एक जटिल डेटा वितरण को धीरे-धीरे एक सरल गाऊसी वितरण में विसरित किया जा सकता है, और इस प्रक्रिया को उलटना सीखने से नए नमूने उत्पन्न हो सकते हैं। हालांकि, शुरुआती तरीके कम्प्यूटेशनल रूप से महंगे थे और उस समय GAN की तुलना में कम प्रभावी थे।
2020 का DDPM पेपर, जो जोनाथन हो, अजय जैन और पीटर एबील द्वारा लिखा गया था, ने प्रदर्शित किया कि सावधानीपूर्वक चुनी गई शोर अनुसूची और U-Net बैकबोन के साथ, डिफ्यूज़न मॉडल अत्याधुनिक छवि निर्माण गुणवत्ता प्राप्त कर सकते हैं। इसने अनुसंधान और अनुप्रयोगों के तेजी से विस्तार को प्रेरित किया।
अनुप्रयोग और प्रभाव
2024 तक, DDPM और उनके वेरिएंट कंप्यूटर विज़न में छवि डीनॉइज़िंग, इनपेंटिंग, सुपर-रिज़ॉल्यूशन और टेक्स्ट-टू-इमेज निर्माण जैसे कार्यों के लिए व्यापक रूप से उपयोग किए जाते हैं। वे प्राकृतिक भाषा प्रसंस्करण में पाठ निर्माण और सारांशीकरण के लिए, और ऑडियो निर्माण में भी लागू होते हैं। स्टेबल डिफ्यूज़न और DALL-E जैसे वाणिज्यिक उत्पाद DDPM को टेक्स्ट एनकोडर और क्रॉस-अटेंशन मॉड्यूल के साथ जोड़ते हैं ताकि टेक्स्ट-कंडीशन्ड निर्माण सक्षम हो सके, जिससे वे व्यापक दर्शकों के लिए सुलभ हो जाते हैं।
DDPM ने सुदृढीकरण सीखने और वैज्ञानिक सिमुलेशन सहित अन्य क्षेत्रों को भी प्रभावित किया है, जहां उनका उपयोग जटिल वितरणों को मॉडल करने के लिए किया जाता है। उच्च-गुणवत्ता वाले नमूने उत्पन्न करने की उनकी क्षमता ने उन्हें आधुनिक कृत्रिम बुद्धिमत्ता अनुसंधान की आधारशिला बना दिया है।
सीमाएं और भविष्य की दिशाएं
अपनी सफलता के बावजूद, DDPM की सीमाएं हैं। पुनरावृत्त डीनॉइज़िंग प्रक्रिया के कारण सैंपलिंग आमतौर पर GAN की तुलना में धीमी होती है, हालांकि त्वरित विधियां विकसित की गई हैं। उन्हें प्रशिक्षण के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की भी आवश्यकता होती है, जिसने कुशल आर्किटेक्चर और AWS Trainium और Google Cloud TPU जैसे हार्डवेयर में रुचि बढ़ाई है। चल रहे शोध नमूना गुणवत्ता में सुधार, अनुमान समय कम करने और DDPM को नए मोडैलिटी तक विस्तारित करने पर केंद्रित है।
2025 तक, डिफ्यूज़न मॉडल अध्ययन का एक सक्रिय क्षेत्र बना हुआ है, जिसमें बैकबोन आर्किटेक्चर, शोर अनुसूचियों और कंडीशनिंग तंत्र में नवाचार जनरेटिव मॉडलिंग में संभव की सीमाओं को आगे बढ़ा रहे हैं।