लैटेंट डिफ्यूज़न मॉडल (LDM) एक डिफ्यूज़न मॉडल आर्किटेक्चर है जिसे LMU म्यूनिख में कंप्यूटर विज़न एंड लर्निंग (CompVis) समूह द्वारा विकसित किया गया है। यह डिफ्यूज़न प्रक्रिया को सीधे पिक्सेल स्पेस के बजाय निम्न-आयामी लैटेंट स्पेस में करके मानक डिफ्यूज़न मॉडल में सुधार करता है, जिससे कम्प्यूटेशनल लागत कम होती है और उच्च-रिज़ॉल्यूशन छवियों का अधिक कुशल निर्माण संभव होता है। LDM में स्व-ध्यान और क्रॉस-ध्यान कंडीशनिंग भी शामिल है, जो पाठ, छवियों या अन्य मोडैलिटी के आधार पर उत्पन्न आउटपुट पर लचीला नियंत्रण सक्षम बनाती है।
डिफ्यूज़न मॉडल 2015 में जनरेटिव मॉडल के एक वर्ग के रूप में पेश किए गए थे जो क्रमिक शोर प्रक्रिया को उलटना सीखते हैं। LDM आर्किटेक्चर 20 दिसंबर, 2021 को arXiv पर प्रकाशित हुआ था, और स्टेबल डिफ्यूज़न और LDM दोनों रिपॉजिटरी GitHub पर जारी किए गए थे। LDM व्यावहारिक डिफ्यूज़न मॉडल में व्यापक रूप से उपयोग किए जाते हैं; उदाहरण के लिए, स्टेबल डिफ्यूज़न संस्करण 1.1 से 2.1 LDM आर्किटेक्चर पर आधारित थे।
आर्किटेक्चर
LDM में तीन मुख्य घटक होते हैं: एक वैरिएशनल ऑटोएन्कोडर (VAE), एक संशोधित U-Net, और एक टेक्स्ट एन्कोडर। VAE एन्कोडर इनपुट छवि को पिक्सेल स्पेस से छोटे लैटेंट स्पेस में संपीड़ित करता है, जो आयामीता को कम करते हुए अर्थ संबंधी अर्थ को पकड़ता है। फॉरवर्ड डिफ्यूज़न के दौरान इस संपीड़ित लैटेंट प्रतिनिधित्व पर गॉसियन शोर पुनरावृत्त रूप से लागू किया जाता है। U-Net, जो ResNet बैकबोन पर बनाया गया है, रिवर्स प्रक्रिया के माध्यम से लैटेंट प्रतिनिधित्व को डीनॉइज़ करता है। अंत में, VAE डिकोडर डीनॉइज़ किए गए लैटेंट को वापस पिक्सेल स्पेस में परिवर्तित करके अंतिम छवि उत्पन्न करता है।
डीनॉइज़िंग चरण को पाठ, छवियों या अन्य मोडैलिटी पर कंडीशन किया जा सकता है। पाठ कंडीशनिंग के लिए, एक पूर्व-प्रशिक्षित CLIP ViT-L/14 टेक्स्ट एन्कोडर टेक्स्ट प्रॉम्प्ट को एम्बेडिंग स्पेस में बदलता है, जिसे फिर क्रॉस-ध्यान तंत्र के माध्यम से U-Net को उजागर किया जाता है। यह मॉडल को प्रदान किए गए पाठ्य विवरण के अनुरूप छवियां उत्पन्न करने की अनुमति देता है।
वैरिएशनल ऑटोएन्कोडर
VAE को पहले छवियों के डेटासेट पर प्रशिक्षित किया जाता है। इसका एन्कोडर एक छवि को इनपुट के रूप में लेता है और निम्न-आयामी लैटेंट प्रतिनिधित्व आउटपुट करता है, जो U-Net के इनपुट के रूप में कार्य करता है। प्रशिक्षण के बाद, एन्कोडर का उपयोग छवियों को संपीड़ित करने के लिए किया जाता है, और डिकोडर लैटेंट प्रतिनिधित्व से छवियों का पुनर्निर्माण करता है।
कार्यान्वित संस्करण में, एन्कोडर एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) है जिसमें अंत के पास एक एकल स्व-ध्यान तंत्र होता है। यह आकार (3, H, W) का टेंसर लेता है और आकार (8, H/8, W/8) का टेंसर आउटपुट करता है, जो लैटेंट वेक्टर के अनुमानित माध्य और विचरण को जोड़ता है, प्रत्येक आकार (4, H/8, W/8) का होता है। प्रशिक्षण के दौरान, विचरण का उपयोग किया जाता है, लेकिन अनुमान के समय आमतौर पर केवल माध्य बनाए रखा जाता है। डिकोडर भी एक एकल स्व-ध्यान तंत्र के साथ एक CNN है, जो (4, H/8, W/8) टेंसर को वापस (3, H, W) में मैप करता है।
U-Net
U-Net बैकबोन कई इनपुट संसाधित करता है: VAE एन्कोडर से एक लैटेंट छवि सरणी, वर्तमान शोर स्तर को इंगित करने वाला एक टाइमस्टेप एम्बेडिंग, और टेक्स्ट एन्कोडर से कंडीशनिंग एम्बेडिंग। U-Net को लैटेंट प्रतिनिधित्व में जोड़े गए शोर की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जिससे यह पुनरावृत्त रूप से डीनॉइज़ कर सकता है। आर्किटेक्चर में अवशिष्ट ब्लॉक और ध्यान परतें शामिल हैं, जो इसे स्थानीय और वैश्विक दोनों संदर्भों को संभालने में सक्षम बनाती हैं।
प्रशिक्षण और कंडीशनिंग
LDM को डीनॉइज़िंग उद्देश्य के साथ प्रशिक्षित किया जाता है: एक शोरग्रस्त लैटेंट दिए जाने पर, मॉडल मूल शोर की भविष्यवाणी करना सीखता है। प्रशिक्षण प्रक्रिया एक हानि फ़ंक्शन का उपयोग करती है जो अनुमानित और वास्तविक शोर के बीच अंतर को मापता है। कंडीशनिंग को क्रॉस-ध्यान परतों के माध्यम से एकीकृत किया जाता है, जहां टेक्स्ट एम्बेडिंग का उपयोग डीनॉइज़िंग प्रक्रिया को मॉड्यूलेट करने के लिए किया जाता है। यह दृष्टिकोण क्लासिफायर-मुक्त मार्गदर्शन का समर्थन करता है, जहां मॉडल को कंडीशनिंग के साथ और बिना दोनों तरह से प्रशिक्षित किया जाता है, और अनुमान के समय प्रॉम्प्ट के पालन को बेहतर बनाने के लिए कंडीशनिंग को बढ़ाया जाता है।
अनुप्रयोग और प्रभाव
LDM पाठ-से-छवि निर्माण के लिए एक मौलिक आर्किटेक्चर बन गए हैं। स्टेबल डिफ्यूज़न, एक प्रमुख ओपन-सोर्स मॉडल, LDM आर्किटेक्चर का उपयोग करता है। संस्करण 1.1 से 1.4 अगस्त 2022 में CompVis द्वारा जारी किए गए थे, प्रत्येक संस्करण को क्रमिक रूप से अधिक सौंदर्यपूर्ण छवियों पर फाइन-ट्यून किया गया था। स्टेबल डिफ्यूज़न 1.5, जो अक्टूबर 2022 में RunwayML द्वारा जारी किया गया था, में क्लासिफायर-मुक्त मार्गदर्शन में सुधार के लिए टेक्स्ट कंडीशनिंग का 10% ड्रॉपआउट शामिल किया गया था। लैटेंट स्पेस डिफ्यूज़न की दक्षता ने इन मॉडलों को उपभोक्ता हार्डवेयर पर चलाना संभव बना दिया है, जिससे जनरेटिव AI तक पहुंच लोकतांत्रिक हो गई है।
संबंधित विकास
डिफ्यूज़न मॉडल गैर-संतुलन थर्मोडायनामिक्स पर पहले के काम से विकसित हुए। 2019 के एक पेपर ने शोर सशर्त स्कोर नेटवर्क (NCSN) पेश किया, जिसे लैंगेविन डायनेमिक्स (SMLD) के साथ स्कोर मिलान के रूप में भी जाना जाता है, जिसमें PyTorch कार्यान्वयन था। 2020 के एक पेपर ने डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) प्रस्तावित किया, जिसने वैरिएशनल इंफेरेंस के माध्यम से प्रशिक्षण में सुधार किया और TensorFlow में जारी किया गया था। LDM डिफ्यूज़न प्रक्रिया को लैटेंट स्पेस में स्थानांतरित करके इन नींवों पर निर्माण करता है, जो एक प्रमुख नवाचार है जो उच्च आउटपुट गुणवत्ता बनाए रखते हुए मेमोरी और कंप्यूट आवश्यकताओं को कम करता है।
LDM व्यापक Generative AI क्षेत्र का हिस्सा हैं, जिसमें Large language model और अन्य Deep learning आर्किटेक्चर भी शामिल हैं। Cross-Attention और U-Net बैकबोन का उपयोग LDM को Neural network डिज़ाइन में प्रगति से जोड़ता है। 2025 तक, लैटेंट डिफ्यूज़न वाणिज्यिक और ओपन-सोर्स छवि निर्माण प्रणालियों में एक मानक दृष्टिकोण बना हुआ है, जिसमें दक्षता, नियंत्रणीयता और निष्ठा में सुधार पर केंद्रित चल रहे शोध हैं।