अंग्रेज़ी से अनुवादित

अव्यक्त प्रसार मॉडल (LDMs) एक प्रसार मॉडल वास्तुकला है जो संपीड़ित अव्यक्त स्थान में डीनॉइज़िंग करता है, जिससे उच्च-रिज़ॉल्यूशन छवि निर्माण कुशलतापूर्वक संभव होता है। LMU म्यूनिख के CompVis समूह द्वारा विकसित, LDMs स्टेबल डिफ्यूज़न संस्करण 1.1 से 2.1 का आधार बनाते हैं।

लैटेंट डिफ्यूज़न मॉडल (LDM) एक डिफ्यूज़न मॉडल आर्किटेक्चर है जिसे LMU म्यूनिख में कंप्यूटर विज़न एंड लर्निंग (CompVis) समूह द्वारा विकसित किया गया है। यह डिफ्यूज़न प्रक्रिया को सीधे पिक्सेल स्पेस के बजाय निम्न-आयामी लैटेंट स्पेस में करके मानक डिफ्यूज़न मॉडल में सुधार करता है, जिससे कम्प्यूटेशनल लागत कम होती है और उच्च-रिज़ॉल्यूशन छवियों का अधिक कुशल निर्माण संभव होता है। LDM में स्व-ध्यान और क्रॉस-ध्यान कंडीशनिंग भी शामिल है, जो पाठ, छवियों या अन्य मोडैलिटी के आधार पर उत्पन्न आउटपुट पर लचीला नियंत्रण सक्षम बनाती है।

डिफ्यूज़न मॉडल 2015 में जनरेटिव मॉडल के एक वर्ग के रूप में पेश किए गए थे जो क्रमिक शोर प्रक्रिया को उलटना सीखते हैं। LDM आर्किटेक्चर 20 दिसंबर, 2021 को arXiv पर प्रकाशित हुआ था, और स्टेबल डिफ्यूज़न और LDM दोनों रिपॉजिटरी GitHub पर जारी किए गए थे। LDM व्यावहारिक डिफ्यूज़न मॉडल में व्यापक रूप से उपयोग किए जाते हैं; उदाहरण के लिए, स्टेबल डिफ्यूज़न संस्करण 1.1 से 2.1 LDM आर्किटेक्चर पर आधारित थे।

आर्किटेक्चर

LDM में तीन मुख्य घटक होते हैं: एक वैरिएशनल ऑटोएन्कोडर (VAE), एक संशोधित U-Net, और एक टेक्स्ट एन्कोडर। VAE एन्कोडर इनपुट छवि को पिक्सेल स्पेस से छोटे लैटेंट स्पेस में संपीड़ित करता है, जो आयामीता को कम करते हुए अर्थ संबंधी अर्थ को पकड़ता है। फॉरवर्ड डिफ्यूज़न के दौरान इस संपीड़ित लैटेंट प्रतिनिधित्व पर गॉसियन शोर पुनरावृत्त रूप से लागू किया जाता है। U-Net, जो ResNet बैकबोन पर बनाया गया है, रिवर्स प्रक्रिया के माध्यम से लैटेंट प्रतिनिधित्व को डीनॉइज़ करता है। अंत में, VAE डिकोडर डीनॉइज़ किए गए लैटेंट को वापस पिक्सेल स्पेस में परिवर्तित करके अंतिम छवि उत्पन्न करता है।

डीनॉइज़िंग चरण को पाठ, छवियों या अन्य मोडैलिटी पर कंडीशन किया जा सकता है। पाठ कंडीशनिंग के लिए, एक पूर्व-प्रशिक्षित CLIP ViT-L/14 टेक्स्ट एन्कोडर टेक्स्ट प्रॉम्प्ट को एम्बेडिंग स्पेस में बदलता है, जिसे फिर क्रॉस-ध्यान तंत्र के माध्यम से U-Net को उजागर किया जाता है। यह मॉडल को प्रदान किए गए पाठ्य विवरण के अनुरूप छवियां उत्पन्न करने की अनुमति देता है।

वैरिएशनल ऑटोएन्कोडर

VAE को पहले छवियों के डेटासेट पर प्रशिक्षित किया जाता है। इसका एन्कोडर एक छवि को इनपुट के रूप में लेता है और निम्न-आयामी लैटेंट प्रतिनिधित्व आउटपुट करता है, जो U-Net के इनपुट के रूप में कार्य करता है। प्रशिक्षण के बाद, एन्कोडर का उपयोग छवियों को संपीड़ित करने के लिए किया जाता है, और डिकोडर लैटेंट प्रतिनिधित्व से छवियों का पुनर्निर्माण करता है।

कार्यान्वित संस्करण में, एन्कोडर एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) है जिसमें अंत के पास एक एकल स्व-ध्यान तंत्र होता है। यह आकार (3, H, W) का टेंसर लेता है और आकार (8, H/8, W/8) का टेंसर आउटपुट करता है, जो लैटेंट वेक्टर के अनुमानित माध्य और विचरण को जोड़ता है, प्रत्येक आकार (4, H/8, W/8) का होता है। प्रशिक्षण के दौरान, विचरण का उपयोग किया जाता है, लेकिन अनुमान के समय आमतौर पर केवल माध्य बनाए रखा जाता है। डिकोडर भी एक एकल स्व-ध्यान तंत्र के साथ एक CNN है, जो (4, H/8, W/8) टेंसर को वापस (3, H, W) में मैप करता है।

U-Net

U-Net बैकबोन कई इनपुट संसाधित करता है: VAE एन्कोडर से एक लैटेंट छवि सरणी, वर्तमान शोर स्तर को इंगित करने वाला एक टाइमस्टेप एम्बेडिंग, और टेक्स्ट एन्कोडर से कंडीशनिंग एम्बेडिंग। U-Net को लैटेंट प्रतिनिधित्व में जोड़े गए शोर की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जिससे यह पुनरावृत्त रूप से डीनॉइज़ कर सकता है। आर्किटेक्चर में अवशिष्ट ब्लॉक और ध्यान परतें शामिल हैं, जो इसे स्थानीय और वैश्विक दोनों संदर्भों को संभालने में सक्षम बनाती हैं।

प्रशिक्षण और कंडीशनिंग

LDM को डीनॉइज़िंग उद्देश्य के साथ प्रशिक्षित किया जाता है: एक शोरग्रस्त लैटेंट दिए जाने पर, मॉडल मूल शोर की भविष्यवाणी करना सीखता है। प्रशिक्षण प्रक्रिया एक हानि फ़ंक्शन का उपयोग करती है जो अनुमानित और वास्तविक शोर के बीच अंतर को मापता है। कंडीशनिंग को क्रॉस-ध्यान परतों के माध्यम से एकीकृत किया जाता है, जहां टेक्स्ट एम्बेडिंग का उपयोग डीनॉइज़िंग प्रक्रिया को मॉड्यूलेट करने के लिए किया जाता है। यह दृष्टिकोण क्लासिफायर-मुक्त मार्गदर्शन का समर्थन करता है, जहां मॉडल को कंडीशनिंग के साथ और बिना दोनों तरह से प्रशिक्षित किया जाता है, और अनुमान के समय प्रॉम्प्ट के पालन को बेहतर बनाने के लिए कंडीशनिंग को बढ़ाया जाता है।

अनुप्रयोग और प्रभाव

LDM पाठ-से-छवि निर्माण के लिए एक मौलिक आर्किटेक्चर बन गए हैं। स्टेबल डिफ्यूज़न, एक प्रमुख ओपन-सोर्स मॉडल, LDM आर्किटेक्चर का उपयोग करता है। संस्करण 1.1 से 1.4 अगस्त 2022 में CompVis द्वारा जारी किए गए थे, प्रत्येक संस्करण को क्रमिक रूप से अधिक सौंदर्यपूर्ण छवियों पर फाइन-ट्यून किया गया था। स्टेबल डिफ्यूज़न 1.5, जो अक्टूबर 2022 में RunwayML द्वारा जारी किया गया था, में क्लासिफायर-मुक्त मार्गदर्शन में सुधार के लिए टेक्स्ट कंडीशनिंग का 10% ड्रॉपआउट शामिल किया गया था। लैटेंट स्पेस डिफ्यूज़न की दक्षता ने इन मॉडलों को उपभोक्ता हार्डवेयर पर चलाना संभव बना दिया है, जिससे जनरेटिव AI तक पहुंच लोकतांत्रिक हो गई है।

संबंधित विकास

डिफ्यूज़न मॉडल गैर-संतुलन थर्मोडायनामिक्स पर पहले के काम से विकसित हुए। 2019 के एक पेपर ने शोर सशर्त स्कोर नेटवर्क (NCSN) पेश किया, जिसे लैंगेविन डायनेमिक्स (SMLD) के साथ स्कोर मिलान के रूप में भी जाना जाता है, जिसमें PyTorch कार्यान्वयन था। 2020 के एक पेपर ने डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) प्रस्तावित किया, जिसने वैरिएशनल इंफेरेंस के माध्यम से प्रशिक्षण में सुधार किया और TensorFlow में जारी किया गया था। LDM डिफ्यूज़न प्रक्रिया को लैटेंट स्पेस में स्थानांतरित करके इन नींवों पर निर्माण करता है, जो एक प्रमुख नवाचार है जो उच्च आउटपुट गुणवत्ता बनाए रखते हुए मेमोरी और कंप्यूट आवश्यकताओं को कम करता है।

LDM व्यापक Generative AI क्षेत्र का हिस्सा हैं, जिसमें Large language model और अन्य Deep learning आर्किटेक्चर भी शामिल हैं। Cross-Attention और U-Net बैकबोन का उपयोग LDM को Neural network डिज़ाइन में प्रगति से जोड़ता है। 2025 तक, लैटेंट डिफ्यूज़न वाणिज्यिक और ओपन-सोर्स छवि निर्माण प्रणालियों में एक मानक दृष्टिकोण बना हुआ है, जिसमें दक्षता, नियंत्रणीयता और निष्ठा में सुधार पर केंद्रित चल रहे शोध हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·diffusion-models·deep-learning·image-generation
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास