डिनॉइज़िंग डिफ्यूज़न इम्प्लिसिट मॉडल (DDIM) जनरेटिव मॉडल का एक वर्ग है, जिसे 2021 में स्टैनफोर्ड विश्वविद्यालय के जियामिंग सॉन्ग, चेनलिन मेंग और स्टेफानो एर्मन द्वारा पेश किया गया था। वे डिफ्यूज़न मॉडल ढांचे का विस्तार करते हैं, सैंपलिंग प्रक्रिया को एक इम्प्लिसिट प्रोबेबिलिस्टिक मॉडल के रूप में पुनर्परिभाषित करते हुए, जिससे प्रशिक्षित डिफ्यूज़न मॉडल से उच्च-गुणवत्ता वाले नमूनों का तेज़ उत्पादन संभव होता है, बिना अतिरिक्त प्रशिक्षण या अंतर्निहित नेटवर्क में संशोधन की आवश्यकता के। DDIM मानक डिफ्यूज़न मॉडल की एक प्रमुख सीमा को संबोधित करते हैं: धीमी सैंपलिंग प्रक्रिया, जिसे एक छवि उत्पन्न करने के लिए आमतौर पर हजारों पुनरावृत्त डीनॉइज़िंग चरणों की आवश्यकता होती है। रिवर्स प्रक्रिया को एक गैर-मार्कोवियन श्रृंखला के रूप में तैयार करके, DDIM समान प्रशिक्षित मॉडल को काफी कम चरणों के साथ सैंपल करने में सक्षम बनाते हैं, अक्सर 10 से 50 गुना कम, जबकि प्रतिस्पर्धी आउटपुट गुणवत्ता बनाए रखते हैं।
DDIM का मुख्य नवाचार डिफ्यूज़न प्रक्रिया के फॉरवर्ड और रिवर्स ट्रांज़िशन के पुनर्सूत्रीकरण में निहित है। मानक डिनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) एक मार्कोवियन श्रृंखला मानते हैं जहाँ प्रत्येक चरण केवल पिछली स्थिति पर निर्भर करता है, जिससे गाऊसी शोर से एक स्वच्छ नमूना पुनर्निर्माण करने के लिए बड़ी संख्या में चरणों की आवश्यकता होती है। DDIM इसके बजाय देखते हैं कि डिफ्यूज़न मॉडल का प्रशिक्षण उद्देश्य गैर-मार्कोवियन फॉरवर्ड प्रक्रियाओं के एक व्यापक परिवार के साथ संगत है, जिन्हें नियतात्मक या अर्ध-नियतात्मक रिवर्स प्रक्रियाओं की अनुमति देने के लिए डिज़ाइन किया जा सकता है। इन प्रक्रियाओं को एक मुक्त चर के साथ पैरामीट्रिज़ करके, DDIM जनरेटिव मॉडल का एक वर्ग बनाते हैं जो समान प्रशिक्षण हानि देता है लेकिन अधिक लचीले सैंपलिंग प्रक्षेप पथ प्रदान करता है। यह शोर से डेटा तक एक नियतात्मक मानचित्रण की अनुमति देता है, जिससे सरल और पुनरुत्पादक तरीके से नमूनों का उत्पादन संभव होता है, एक गुण जो मूल स्टोकेस्टिक सूत्रीकरणों में अनुपस्थित है।
इस गैर-मार्कोवियन दृष्टिकोण का व्यावहारिक लाभ कम समय-चरण अनुसूची का उपयोग करके सैंपल करने की क्षमता है। जबकि एक DDPM आमतौर पर 1000 से 2000 डीनॉइज़िंग चरणों का उपयोग करता है, DDIM कई मामलों में केवल 20, 50 या 100 चरणों का उपयोग करके वैध छवियाँ उत्पन्न कर सकता है। मॉडल के वास्तुशिल्प घटक DDPM के समान ही रहते हैं - एक तंत्रिका नेटवर्क, आमतौर पर ध्यान परतों के साथ एक U-Net, प्रत्येक चरण पर शोर घटक की भविष्यवाणी करता है। अंतर प्रोबेबिलिस्टिक प्रक्रिया में है, जो डीनॉइज़र अनुसूची में मध्यवर्ती चरणों को छोड़ने की अनुमति देता है बिना बड़ी पुनर्निर्माण त्रुटियाँ उत्पन्न किए। परिणामस्वरूप, DDIM सैंपलिंग गति और नमूना निष्ठा के बीच एक समझौता प्रदान करता है; उच्च चरण संख्या उच्च सटीकता देती है, जबकि कम चरण कुछ गुणवत्ता का त्याग करते हैं लेकिन दृश्य रूप से सुसंगत रहते हैं। यह लचीलापन अनुमान-समय मार्गदर्शन जैसे कार्यों के लिए उपयोगी है, जहाँ समान मॉडल विभिन्न अनुसूचियों के तहत विविध नमूने उत्पन्न कर सकता है।
गति से परे, DDIM अव्यक्त शोर और उत्पन्न डेटा के बीच एक नियतात्मक और उत्क्रमणीय मानचित्रण सक्षम करता है। यह गुण शोर स्थान में प्रक्षेप का समर्थन करता है, जहाँ अव्यक्त स्थान में दो नमूनों के बीच रैखिक प्रक्षेप परिणामी छवि स्थान में अर्थपूर्ण रूप से सार्थक मॉर्फिंग उत्पन्न करता है। यह नियतात्मक प्रकृति जनरेटिव एडवरसैरियल प्रशिक्षित मॉडल की तरह सैंपलिंग की भी अनुमति देती है, जैसे छवि संपादन, इनपेंटिंग, या आंशिक अवलोकनों से पुनर्निर्माण जैसे कार्यों के लिए, बिना GAN प्रशिक्षण की संबंधित अस्थिरता के। इम्प्लिसिट मॉडल दृष्टिकोण DDIM को इम्प्लिसिट प्रोबेबिलिस्टिक मॉडल के व्यापक परिवार में भी रखता है, जो एक सरल नियतात्मक जनरेटिंग फ़ंक्शन के माध्यम से वितरण को परिभाषित करते हैं, जो वैरिएशनल इन्फ़रेंस और नॉर्मलाइज़िंग फ्लो से अवधारणाओं से जुड़ता है।
DDIM का एल्गोरिथमिक विकास कुशल डिफ्यूज़न-आधारित Generative AI के व्यापक विकास में योगदान दिया। इसका सैंपलिंग सूत्र, जिसे अक्सर पूर्वानुमानित शोर और वर्तमान नमूने के एक स्केल किए गए गुणांक के साथ रैखिक संयोजन के रूप में लिखा जाता है, बाद के कार्यों के लिए एक निर्माण खंड बन गया जो अव्यक्त डिफ्यूज़न, टेक्स्ट-टू-इमेज संश्लेषण और उच्च-रिज़ॉल्यूशन उत्पादन को संबोधित करते थे। DDIM कई संदर्भ कार्यान्वयनों में व्यापक रूप से उपयोग किया जाने वाला डीनॉइज़िंग सैंपलर है, जिसमें स्टेबल डिफ्यूज़न मॉडल से जुड़े लोग शामिल हैं - इसकी चरण-छोड़ रणनीति और नियतात्मक सूत्रीकरण क्षेत्र में बाद के काम के लिए तुलना का एक मानक बना हुआ है, जैसे डिनॉइज़िंग डिफ्यूज़न GAN और स्थिरता मॉडल।
डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल से संबंध
DDIM डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल द्वारा प्रदान की गई सैद्धांतिक नींव पर निर्माण करता है, विशेष रूप से सोहल-डिकस्टीन एट अल. (2015) और डिडेरिक हो एट अल. (2020) का काम। मानक DDPM डेटा को 1000 चरणों में गाऊसी शोर के साथ बेतरतीब ढंग से perturb करता है और शोर का अनुमान लगाकर इस प्रक्रिया को उलटना सीखता है। प्रभावी होते हुए भी, DDPM से सैंपलिंग प्रत्येक रिवर्स चरण पर एक नया यादृच्छिक शोर नमूना खींचती है। DDIM इसके बजाय फॉरवर्ड प्रक्रियाओं का एक परिवार परिभाषित करता है जैसे कि रिवर्स प्रक्रिया लगभग नियतात्मक हो सकती है। एक प्रमुख सैद्धांतिक अंतर्दृष्टि यह है कि हानि फ़ंक्शन में केवल रिवर्स और फॉरवर्ड प्रक्रियाओं के बीच KL विचलन शामिल होता है, जिसे स्कोर अनुमानक पर निर्भर चुना जाता है; वैकल्पिक फॉरवर्ड प्रक्रियाएँ प्रशिक्षण को प्रभावित किए बिना संभव हैं, जिससे सैंपलिंग में लचीलापन मिलता है। DDIM फिर इन सांख्यिकीय सीमांतों से मेल खाने के लिए 'इम्प्लिसिट' श्रृंखला का निर्माण करता है, जिसके परिणामस्वरूप एक नया सैंपलिंग नियम बनता है।
इस लचीलेपन का एक प्रत्यक्ष परिणाम यह है कि DDIM मॉडल का एक अलग परिवार है, लेकिन दोनों के लिए समान प्रशिक्षण प्रक्रिया काम करती है। एक उपयोगकर्ता को समान नेटवर्क रखना चाहिए, लेकिन सैंपलिंग समय पर, वे समय की बाधाओं के आधार पर DDPM अनुसूची या DDIM अनुसूची चुन सकते हैं। DDIM सूत्र के पैरामीटर शोर के अल्फा (α) और सिग्मा (σ) अनुसूची द्वारा निर्धारित होते हैं, जिन्हें अक्सर डिफ्यूज़न गुणांक के रूप में पहले से गणना की जाती है। DDIM का मूल समीकरण पूर्वानुमानित डीनॉइज़्ड नमूने (x0) और वर्तमान अव्यक्त (xt) को अगले अव्यक्त x(t-1) उत्पन्न करने के लिए सूत्र का उपयोग करके संबंधित करता है: x(t-1) = sqrt(α(t-1)) x0 + sqrt(1 - α(t-1) - σ(t)^2) ε_θ(xt) + σ(t) z, जहाँ z वैकल्पिक शोर है और ε शोर भविष्यवाणी है। जब σ शून्य पर सेट होता है, तो प्रक्रिया पूरी तरह से नियतात्मक होती है, जो एक परिवार उत्पन्न करती है जिसे "असमान" DDIM कहा जाता है, जो नियतात्मक एनील्ड लैंगेविन गतिशीलता से मेल खाता है।
यह कार्य BAIR (Berkeley AI Research) में उत्पन्न होता है (सॉन्ग और एर्मन की संबद्धता के रूप में, हालाँकि वे उस समय स्टैनफोर्ड में थे) और पहले के स्कोर-आधारित जनरेटिव मॉडल और नॉइज़लेस नेटवर्क से संबंधित है। DDIM सूत्रीकरण स्कोर फ़ंक्शन के Neural network सन्निकटन से भी निकटता से जुड़ा है, क्योंकि शोर भविष्यवक्ता गाऊसी हैं जिनका लक्ष्य स्कोर शब्द का अनुमान लगाना सुनिश्चित करता है कि डिफ्यूज़न चरणों का उलटा डेटा मैनिफोल्ड को पकड़ता है।
लाभ और सीमाएँ
DDIM के व्यावहारिक लाभों में नमूना-समय नियंत्रणीयता, पुनरुत्पादकता (क्योंकि यादृच्छिक बीज इनपुट अव्यक्त के लिए जिम्मेदार होता है) और एक्सट्रपोलेशन शामिल हैं। यह निश्चित संख्या में डीनॉइज़िंग चरणों के आधार पर छवि का एक प्रभावी, संयुक्त अनुमान प्रदान करता है, जिससे संसाधन-सीमित हार्डवेयर पर समान मॉडल का उपयोग संभव होता है। हालाँकि, DDIM प्रत्येक चरण पर गाऊसी त्रुटि की धारणा पर आधारित है; व्यवहार में, परिमित चरण सन्निकटन पूर्ण SDE सैंपलर की तुलना में गुणवत्ता को सीमित करता है। परिणामस्वरूप, मध्यम से कम चरण संख्याओं पर प्रदर्शन उल्लेखनीय रूप से गिर जाता है, बहुत कम चरणों के लिए गंभीर कलाकृतियों के साथ, जिससे विकृत शरीर रचना या धुंधलापन होता है। फिर भी, Large language model-संबंधित टेक्स्ट-टू-इमेज मॉडल के युग में, नियतात्मक कमी विशेषता Deep learning अनुमान के दौरान सैंपलिंग पाइपलाइनों के निर्माण के लिए उपयोगी है।
स्पष्ट और डीनॉइज़िंग तंत्र DDPM व्युत्पन्नों की एक सामान्य वास्तुकला के निर्माण में भी मदद करता है, जैसे स्टेबल डिफ्यूज़न और उच्च-रिज़ॉल्यूशन छवि संश्लेषण में उपयोग किए जाने वाले डिनॉइज़िंग डिफ्यूज़न इम्प्लिसिट मॉडल। स्टेबल डिफ्यूज़न दृष्टिकोण एक कम अव्यक्त स्थान और DDIM सैंपलर का उपयोग उस अव्यक्त कोर में रिवर्स डिफ्यूज़न के लिए एक कुशल सॉल्वर के रूप में करता है। इसने व्यापक रूप से उपयोग किए जाने वाले डिफ्यूज़र (लाइब्रेरी) पैकेज का आधार बनाया, और DDIM के लिए वास्तविक कोड अक्सर अन्य सभी डिफ्यूज़न मॉडल के साथ बंडल किया जाता है, जिससे इसकी पहुँच उच्च हो जाती है।
सैंपलिंग गति और गुणवत्ता व्यापार-बंद
DDIM एक छोटी और प्रबंधनीय दो-चरण अनुसूची स्वीकार करता है जो मूल डिफ्यूज़न के मानक पर थी। चरणों की संख्या एक हाइपरपैरामीटर है जिसे नमूनों की गुणवत्ता को संतुलित करने के लिए अनुमान पर समायोजित किया जा सकता है। 20 चरणों के साथ, एक DDIM कई संदर्भों में 1000-चरण DDPM के समान गुणवत्ता वाली छवियाँ उत्पन्न करने में सक्षम है, लेकिन यदि आप इसे 10 चरणों तक कम करते हैं तो अधिक स्पष्ट दृश्य कलाकृतियाँ जैसे धुंधले क्षेत्र उत्पन्न करता है। एक निश्चित मॉड्यूल में DDIM का उपयोग, जैसे अव्यक्त डिफ्यूज़न मॉडल से तेज सैंपलर, प्रतिस्पर्धी मेट्रिक्स के लिए 50 चरणों का उपयोग करना जारी रखता है। प्रारंभिक शोर से आउटपुट तक कैसे यात्रा करें की अनुसूची अक्सर होती है - उदाहरण के लिए, प्रारंभिक अव्यक्त और अंतिम माध्य शोर के बीच एक सीधी-रेखा प्रक्षेप? - कि आउटपुट प्रारंभिक और अंतिम चरणों में मध्यम गुणवत्ता का होता है।
अनुकूली सैंपलिंग अनुसूचक का उपयोग करने वाले तरीकों की तुलना में, जैसे AlignSAM ArrayList या Conclément implicits, DDIM नेटवर्क को फिर से प्रशिक्षित नहीं करता है बल्कि डीनॉइज़र को प्रशिक्षित करता है, एक क्लासिफायर के समान, और प्रस्तावित अच्छे परिणाम प्राप्त करने में सक्षम है।
प्रभाव और संबंधित कार्य
अंतर्राष्ट्रीय सम्मेलन में प्रकाशन के बाद (ICLR) 2021, DDIM ने व्यापक जनरेटिव मॉडलिंग क्षेत्र पर प्रभाव डाला। इसने डिफ्यूज़न प्रक्रियाओं के लिए नियतात्मक सैंपलिंग की अवधारणा पेश की, जो अव्यक्त चर के स्थान को समझने के लिए महत्वपूर्ण है और डाउनस्ट्रीम कार्यों जैसे अव्यक्त डिफ्यूज़न मॉडल (रोम्बैक एट अल., 2022) में डिफ्यूज़न मॉडल के उपयोग को सक्षम बनाता है, जो एम्बेडिंग की आईडी और DDIM सैंपलर पर आधारित है। कई बाद के लेख "फिशर मर्जर" और "लेखकों" में दृष्टिकोण का उल्लेख करते हैं। प्रशिक्षण उद्देश्य DDPM के समान है लेकिन इसका नमूना प्रबंधन GAN शैली के बेहतर अव्यक्त की ओर ले जाता है। DDIM में रिवर्स दृष्टिकोण का उपयोग छवि-से-छवि अनुवाद और पोस्टीरियर के परिवार में भी किया गया है, जो व्युत्क्रम सेटअप में जाना जाता है।
इन निष्कर्षों के अस्तित्व ने शक्तिशाली सैंपलिंग एल्गोरिदम के लिए मार्ग प्रशस्त किया, जैसे DPM-सॉल्वर (2022) जो एकीकरण विश्लेषण का उपयोग करने वाली एक नियतात्मक विधि है, और डिनॉइज़िंग डिफ्यूज़न GAN मॉडल (2022) जो एडवरसैरियल चरणों के साथ चरण प्रक्रिया को मॉडल करता है। ये आधुनिक दृष्टिकोण अक्सर DDIM आधार को निरंतर परीक्षण के साथ जोड़ते हैं जो अभिसरण करते हैं, कभी-कभी एक पुनरावृत्ति में एक नमूना प्राप्त करते हैं। गैर-मार्कोव दृष्टिकोणों का दर्शन भी वह है जिस तरह से बाद के मॉडलों में सुधार हुआ। DDIM की नियतात्मक गतिशीलता आज की AI सिस्टम प्रयोगशालाओं में एक आवश्यक उपकरण है, अक्सर उदाहरण के लिए LangChain में।
इसके अलावा, इम्प्लिसिट प्रोबेबिलिटी मॉडल के सिद्धांत ने प्रवाह और सुधारित प्रवाह से जुड़े शोध को जोड़ा, जो कंप्यूटर इंजन में एक डिज़ाइन उपकरण के रूप में उपयोग किए जाते हैं। पेपर को अत्यधिक उद्धृत किया गया है, जो ओपन-सोर्स AI क्षेत्र के वीडियो प्रभाव उत्पन्न करने वाले हिस्से के लिए मौलिक पेपरों में से एक के रूप में रैंकिंग करता है।
कुल मिलाकर, DDIM का महत्व उच्च चरण, इसकी सुंदरता, और कम्प्यूटेशनल और व्यावहारिक के बीच पुल बनाने में निहित है। यह उच्च-गुणवत्ता उत्पादन को विविध उपयोगकर्ताओं के लिए सुलभ बनाता है, और यह किसी भी आधुनिक टेक्स्ट-टू-इमेज या डिफ्यूज़न-आधारित पाइपलाइन में एक मानक नमूना बना हुआ है, जिसमें गूगल डीपमाइंड-संबंधित, ओपनएआई-संबंधित स्टेबल डिक्ट और एडोब शामिल हैं। 2025 में सभी व्यावहारिक (आंतरिक) उद्देश्यों के लिए, DDIM का उपयोग क्लासिक सैंपलिंग इंजन के रूप में किया जाता है।
स्रोत
- सॉन्ग एट अल., 2021, "डिनॉइज़िंग डिफ्यूज़न इम्प्लिसिट मॉडल" (ऑनलाइन प्रीप्रिंट)
- हो एट अल., 2020, "डिनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल"