एक लेटेंट डिफ्यूज़न मॉडल (LDM) एक प्रकार का जनरेटिव मॉडल है जो डिफ्यूज़न मॉडल ढांचे का विस्तार करता है, जो सीधे पिक्सेल स्पेस के बजाय निम्न-आयामी लेटेंट स्पेस में कार्य करता है। म्यूनिख में एलएमयू में कंप्यूटर विज़न एंड लर्निंग (CompVis) समूह द्वारा विकसित, एलडीएम को 20 दिसंबर, 2021 को arXiv पर प्रकाशित एक पेपर में पेश किया गया था। यह कम्प्यूटेशनल लागत को कम करके और उच्च-गुणवत्ता वाले छवि संश्लेषण को बनाए रखते हुए मानक डिफ्यूज़न मॉडल में सुधार करता है, और यह सेल्फ-अटेंशन और क्रॉस-अटेंशन तंत्र के माध्यम से कंडीशनिंग का समर्थन करता है। एलडीएम व्यावहारिक डिफ्यूज़न मॉडल में व्यापक रूप से उपयोग किए जाते हैं; उदाहरण के लिए, स्टेबल डिफ्यूज़न संस्करण 1.1 से 2.1 एलडीएम वास्तुकला पर आधारित थे।
एलडीएम वास्तुकला में तीन मुख्य घटक होते हैं: एक वैरिएशनल ऑटोएनकोडर (VAE), एक संशोधित यू-नेट, और एक टेक्स्ट एनकोडर। वीएई छवियों को लेटेंट स्पेस में संपीड़ित करता है, यू-नेट उस लेटेंट स्पेस में डीनॉइज़िंग करता है, और टेक्स्ट एनकोडर कंडीशनिंग जानकारी प्रदान करता है। यह डिज़ाइन मॉडल को टेक्स्ट प्रॉम्प्ट से कुशलतापूर्वक छवियां उत्पन्न करने की अनुमति देता है, जिससे यह आधुनिक एआई छवि निर्माण की आधारशिला बन जाता है।
पृष्ठभूमि और विकास
डिफ्यूज़न मॉडल पहली बार 2015 में जटिल संभाव्यता वितरण से नमूना लेना सीखने की एक विधि के रूप में पेश किए गए थे, जो गैर-संतुलन थर्मोडायनामिक्स के सिद्धांतों का उपयोग करते हैं। 2019 के एक पेपर ने नॉइज़ कंडीशनल स्कोर नेटवर्क (NCSN) का प्रस्ताव रखा, जिसे लैंगेविन डायनामिक्स (SMLD) के साथ स्कोर-मैचिंग के रूप में भी जाना जाता है, जिसे PyTorch में लागू किया गया था। 2020 में, डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) ने वैरिएशनल इन्फ्रेंस का उपयोग करके इन तरीकों में सुधार किया, जिसमें TensorFlow में एक संदर्भ कार्यान्वयन था।
एलडीएम पेपर 20 दिसंबर, 2021 को arXiv पर प्रकाशित हुआ था, और स्टेबल डिफ्यूज़न और एलडीएम दोनों रिपॉजिटरी GitHub पर जारी किए गए थे। वास्तुकला ने तब प्रमुखता प्राप्त की जब स्टेबल डिफ्यूज़न संस्करण 1.1 से 2.1 ने इसे अपनाया। स्टेबल डिफ्यूज़न 1.1 को LAION-2B-en डेटासेट पर प्रशिक्षित किया गया था, और बाद के संस्करणों को बेहतर सौंदर्यशास्त्र और क्लासिफायर-मुक्त मार्गदर्शन के लिए फाइन-ट्यून किया गया था। स्टेबल डिफ्यूज़न 1.5 अक्टूबर 2022 में RunwayML द्वारा जारी किया गया था।
वास्तुकला अवलोकन
एलडीएम एक संपीड़ित लेटेंट स्पेस में कार्य करता है, जो डेटा की आयामीता को कम करता है और प्रशिक्षण और अनुमान को गति देता है। यह प्रक्रिया एक वीएई एनकोडर से शुरू होती है जो एक इनपुट छवि को पिक्सेल स्पेस से लेटेंट प्रतिनिधित्व में संपीड़ित करता है। फिर फॉरवर्ड डिफ्यूज़न के दौरान इस लेटेंट प्रतिनिधित्व पर गाऊसी शोर को पुनरावृत्त रूप से लागू किया जाता है। एक यू-नेट, जो ResNet बैकबोन से बना है, विपरीत दिशा में लेटेंट प्रतिनिधित्व को डीनॉइज़ करता है, और अंत में एक वीएई डिकोडर डीनॉइज़ किए गए लेटेंट को वापस पिक्सेल स्पेस में परिवर्तित करता है।
डीनॉइज़िंग चरण को विभिन्न मोडैलिटी, जैसे टेक्स्ट, छवियों या अन्य डेटा पर कंडीशन किया जा सकता है। टेक्स्ट कंडीशनिंग के लिए, एक पूर्व-प्रशिक्षित CLIP ViT-L/14 टेक्स्ट एनकोडर टेक्स्ट प्रॉम्प्ट को एक एम्बेडिंग स्पेस में बदल देता है, जो क्रॉस-अटेंशन तंत्र के माध्यम से यू-नेट को उजागर होता है। यह मॉडल को प्रदान किए गए पाठ्य विवरण के साथ संरेखित छवियां उत्पन्न करने की अनुमति देता है।
वैरिएशनल ऑटोएनकोडर
वीएई को छवियों के एक डेटासेट पर एक संपीड़ित लेटेंट प्रतिनिधित्व सीखने के लिए प्रशिक्षित किया जाता है। एनकोडर आकार (3, 512, 512) की एक RGB छवि लेता है और लेटेंट वेक्टर को लगभग सफेद करने के लिए 0.18215 का स्केलिंग कारक लागू करने के बाद, आकार (4, 64, 64) का एक लेटेंट टेंसर आउटपुट करता है। डिकोडर इस प्रक्रिया को उलट देता है, एक लेटेंट टेंसर लेता है और एक छवि उत्पन्न करता है, जिसमें 0.18125 का स्केलिंग कारक और [0, 1] की सीमा में क्लिपिंग होती है।
एनकोडर एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) है जिसमें अंत के पास एक एकल सेल्फ-अटेंशन तंत्र होता है। यह लेटेंट वेक्टर के लिए अनुमानित माध्य और विचरण का एक संयोजन आउटपुट करता है, प्रत्येक आकार (4, H/8, W/8) का होता है। प्रशिक्षण के दौरान, विचरण का उपयोग किया जाता है, लेकिन अनुमान पर, केवल माध्य को आम तौर पर बनाए रखा जाता है। डिकोडर भी एक समान सेल्फ-अटेंशन संरचना वाला एक CNN है, जो लेटेंट टेंसर को वापस छवियों में परिवर्तित करता है।
यू-नेट
यू-नेट बैकबोन मुख्य डीनॉइज़िंग घटक है। यह वीएई एनकोडर द्वारा उत्पादित एक लेटेंट इमेज ऐरे को इनपुट के रूप में लेता है, साथ ही टेक्स्ट एम्बेडिंग जैसी कंडीशनिंग जानकारी भी लेता है। यू-नेट को फॉरवर्ड डिफ्यूज़न के दौरान जोड़े गए शोर की भविष्यवाणी करने के लिए डिज़ाइन किया गया है, जिससे मॉडल को पुनरावृत्त रूप से शोर को हटाने और मूल लेटेंट प्रतिनिधित्व को पुनर्प्राप्त करने की अनुमति मिलती है। वास्तुकला में अवशिष्ट कनेक्शन और अटेंशन तंत्र शामिल हैं, जो इसे डेटा में जटिल निर्भरता को संभालने में सक्षम बनाते हैं।
अनुप्रयोग और प्रभाव
लेटेंट डिफ्यूज़न मॉडल कई टेक्स्ट-टू-इमेज सिस्टम, विशेष रूप से स्टेबल डिफ्यूज़न की नींव बन गए हैं। लेटेंट स्पेस में काम करके प्राप्त दक्षता इन मॉडलों को उपभोक्ता हार्डवेयर पर चलाने की अनुमति देती है, जिससे एआई छवि निर्माण तक पहुंच का लोकतंत्रीकरण होता है। वास्तुकला को अन्य कार्यों, जैसे इनपेंटिंग, सुपर-रिज़ॉल्यूशन और वीडियो निर्माण के लिए भी अनुकूलित किया गया है, जो इसकी बहुमुखी प्रतिभा को प्रदर्शित करता है।
सीमाएं और भविष्य की दिशाएं
उनकी सफलता के बावजूद, एलडीएम को प्रशिक्षण के लिए कम्प्यूटेशनल आवश्यकताओं, उत्पन्न सामग्री में संभावित पूर्वाग्रहों और कंडीशनिंग तंत्र के सावधानीपूर्वक ट्यूनिंग की आवश्यकता जैसी चुनौतियों का सामना करना पड़ता है। अनुसंधान वास्तुकला में सुधार करना जारी रखता है, जिसमें अधिक कुशल अटेंशन तंत्र और बेहतर लेटेंट स्पेस प्रतिनिधित्व शामिल हैं। 2020 के दशक की शुरुआत तक, एलडीएम मशीन लर्निंग और कंप्यूटर विज़न में अध्ययन का एक प्रमुख क्षेत्र बने हुए हैं, जिसमें शैक्षणिक और औद्योगिक प्रयोगशालाओं से निरंतर योगदान हो रहा है।