लैटेंट डिफ्यूज़न मॉडल (Latent Diffusion Model)

अंग्रेज़ी से अनुवादित

एक अव्यक्त प्रसार मॉडल (LDM) एक प्रसार मॉडल वास्तुकला है जो संपीड़ित अव्यक्त स्थान में प्रसार प्रक्रिया को निष्पादित करती है, जिससे कुशल टेक्स्ट-टू-इमेज निर्माण संभव होता है। यह स्टेबल डिफ्यूजन के पीछे की मुख्य वास्तुकला है।

एक लेटेंट डिफ्यूज़न मॉडल (LDM) एक प्रकार का जनरेटिव मॉडल है जो डिफ्यूज़न मॉडल ढांचे का विस्तार करता है, जो सीधे पिक्सेल स्पेस के बजाय निम्न-आयामी लेटेंट स्पेस में कार्य करता है। म्यूनिख में एलएमयू में कंप्यूटर विज़न एंड लर्निंग (CompVis) समूह द्वारा विकसित, एलडीएम को 20 दिसंबर, 2021 को arXiv पर प्रकाशित एक पेपर में पेश किया गया था। यह कम्प्यूटेशनल लागत को कम करके और उच्च-गुणवत्ता वाले छवि संश्लेषण को बनाए रखते हुए मानक डिफ्यूज़न मॉडल में सुधार करता है, और यह सेल्फ-अटेंशन और क्रॉस-अटेंशन तंत्र के माध्यम से कंडीशनिंग का समर्थन करता है। एलडीएम व्यावहारिक डिफ्यूज़न मॉडल में व्यापक रूप से उपयोग किए जाते हैं; उदाहरण के लिए, स्टेबल डिफ्यूज़न संस्करण 1.1 से 2.1 एलडीएम वास्तुकला पर आधारित थे।

एलडीएम वास्तुकला में तीन मुख्य घटक होते हैं: एक वैरिएशनल ऑटोएनकोडर (VAE), एक संशोधित यू-नेट, और एक टेक्स्ट एनकोडर। वीएई छवियों को लेटेंट स्पेस में संपीड़ित करता है, यू-नेट उस लेटेंट स्पेस में डीनॉइज़िंग करता है, और टेक्स्ट एनकोडर कंडीशनिंग जानकारी प्रदान करता है। यह डिज़ाइन मॉडल को टेक्स्ट प्रॉम्प्ट से कुशलतापूर्वक छवियां उत्पन्न करने की अनुमति देता है, जिससे यह आधुनिक एआई छवि निर्माण की आधारशिला बन जाता है।

पृष्ठभूमि और विकास

डिफ्यूज़न मॉडल पहली बार 2015 में जटिल संभाव्यता वितरण से नमूना लेना सीखने की एक विधि के रूप में पेश किए गए थे, जो गैर-संतुलन थर्मोडायनामिक्स के सिद्धांतों का उपयोग करते हैं। 2019 के एक पेपर ने नॉइज़ कंडीशनल स्कोर नेटवर्क (NCSN) का प्रस्ताव रखा, जिसे लैंगेविन डायनामिक्स (SMLD) के साथ स्कोर-मैचिंग के रूप में भी जाना जाता है, जिसे PyTorch में लागू किया गया था। 2020 में, डीनॉइज़िंग डिफ्यूज़न प्रोबेबिलिस्टिक मॉडल (DDPM) ने वैरिएशनल इन्फ्रेंस का उपयोग करके इन तरीकों में सुधार किया, जिसमें TensorFlow में एक संदर्भ कार्यान्वयन था।

एलडीएम पेपर 20 दिसंबर, 2021 को arXiv पर प्रकाशित हुआ था, और स्टेबल डिफ्यूज़न और एलडीएम दोनों रिपॉजिटरी GitHub पर जारी किए गए थे। वास्तुकला ने तब प्रमुखता प्राप्त की जब स्टेबल डिफ्यूज़न संस्करण 1.1 से 2.1 ने इसे अपनाया। स्टेबल डिफ्यूज़न 1.1 को LAION-2B-en डेटासेट पर प्रशिक्षित किया गया था, और बाद के संस्करणों को बेहतर सौंदर्यशास्त्र और क्लासिफायर-मुक्त मार्गदर्शन के लिए फाइन-ट्यून किया गया था। स्टेबल डिफ्यूज़न 1.5 अक्टूबर 2022 में RunwayML द्वारा जारी किया गया था।

वास्तुकला अवलोकन

एलडीएम एक संपीड़ित लेटेंट स्पेस में कार्य करता है, जो डेटा की आयामीता को कम करता है और प्रशिक्षण और अनुमान को गति देता है। यह प्रक्रिया एक वीएई एनकोडर से शुरू होती है जो एक इनपुट छवि को पिक्सेल स्पेस से लेटेंट प्रतिनिधित्व में संपीड़ित करता है। फिर फॉरवर्ड डिफ्यूज़न के दौरान इस लेटेंट प्रतिनिधित्व पर गाऊसी शोर को पुनरावृत्त रूप से लागू किया जाता है। एक यू-नेट, जो ResNet बैकबोन से बना है, विपरीत दिशा में लेटेंट प्रतिनिधित्व को डीनॉइज़ करता है, और अंत में एक वीएई डिकोडर डीनॉइज़ किए गए लेटेंट को वापस पिक्सेल स्पेस में परिवर्तित करता है।

डीनॉइज़िंग चरण को विभिन्न मोडैलिटी, जैसे टेक्स्ट, छवियों या अन्य डेटा पर कंडीशन किया जा सकता है। टेक्स्ट कंडीशनिंग के लिए, एक पूर्व-प्रशिक्षित CLIP ViT-L/14 टेक्स्ट एनकोडर टेक्स्ट प्रॉम्प्ट को एक एम्बेडिंग स्पेस में बदल देता है, जो क्रॉस-अटेंशन तंत्र के माध्यम से यू-नेट को उजागर होता है। यह मॉडल को प्रदान किए गए पाठ्य विवरण के साथ संरेखित छवियां उत्पन्न करने की अनुमति देता है।

वैरिएशनल ऑटोएनकोडर

वीएई को छवियों के एक डेटासेट पर एक संपीड़ित लेटेंट प्रतिनिधित्व सीखने के लिए प्रशिक्षित किया जाता है। एनकोडर आकार (3, 512, 512) की एक RGB छवि लेता है और लेटेंट वेक्टर को लगभग सफेद करने के लिए 0.18215 का स्केलिंग कारक लागू करने के बाद, आकार (4, 64, 64) का एक लेटेंट टेंसर आउटपुट करता है। डिकोडर इस प्रक्रिया को उलट देता है, एक लेटेंट टेंसर लेता है और एक छवि उत्पन्न करता है, जिसमें 0.18125 का स्केलिंग कारक और [0, 1] की सीमा में क्लिपिंग होती है।

एनकोडर एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) है जिसमें अंत के पास एक एकल सेल्फ-अटेंशन तंत्र होता है। यह लेटेंट वेक्टर के लिए अनुमानित माध्य और विचरण का एक संयोजन आउटपुट करता है, प्रत्येक आकार (4, H/8, W/8) का होता है। प्रशिक्षण के दौरान, विचरण का उपयोग किया जाता है, लेकिन अनुमान पर, केवल माध्य को आम तौर पर बनाए रखा जाता है। डिकोडर भी एक समान सेल्फ-अटेंशन संरचना वाला एक CNN है, जो लेटेंट टेंसर को वापस छवियों में परिवर्तित करता है।

यू-नेट

यू-नेट बैकबोन मुख्य डीनॉइज़िंग घटक है। यह वीएई एनकोडर द्वारा उत्पादित एक लेटेंट इमेज ऐरे को इनपुट के रूप में लेता है, साथ ही टेक्स्ट एम्बेडिंग जैसी कंडीशनिंग जानकारी भी लेता है। यू-नेट को फॉरवर्ड डिफ्यूज़न के दौरान जोड़े गए शोर की भविष्यवाणी करने के लिए डिज़ाइन किया गया है, जिससे मॉडल को पुनरावृत्त रूप से शोर को हटाने और मूल लेटेंट प्रतिनिधित्व को पुनर्प्राप्त करने की अनुमति मिलती है। वास्तुकला में अवशिष्ट कनेक्शन और अटेंशन तंत्र शामिल हैं, जो इसे डेटा में जटिल निर्भरता को संभालने में सक्षम बनाते हैं।

अनुप्रयोग और प्रभाव

लेटेंट डिफ्यूज़न मॉडल कई टेक्स्ट-टू-इमेज सिस्टम, विशेष रूप से स्टेबल डिफ्यूज़न की नींव बन गए हैं। लेटेंट स्पेस में काम करके प्राप्त दक्षता इन मॉडलों को उपभोक्ता हार्डवेयर पर चलाने की अनुमति देती है, जिससे एआई छवि निर्माण तक पहुंच का लोकतंत्रीकरण होता है। वास्तुकला को अन्य कार्यों, जैसे इनपेंटिंग, सुपर-रिज़ॉल्यूशन और वीडियो निर्माण के लिए भी अनुकूलित किया गया है, जो इसकी बहुमुखी प्रतिभा को प्रदर्शित करता है।

सीमाएं और भविष्य की दिशाएं

उनकी सफलता के बावजूद, एलडीएम को प्रशिक्षण के लिए कम्प्यूटेशनल आवश्यकताओं, उत्पन्न सामग्री में संभावित पूर्वाग्रहों और कंडीशनिंग तंत्र के सावधानीपूर्वक ट्यूनिंग की आवश्यकता जैसी चुनौतियों का सामना करना पड़ता है। अनुसंधान वास्तुकला में सुधार करना जारी रखता है, जिसमें अधिक कुशल अटेंशन तंत्र और बेहतर लेटेंट स्पेस प्रतिनिधित्व शामिल हैं। 2020 के दशक की शुरुआत तक, एलडीएम मशीन लर्निंग और कंप्यूटर विज़न में अध्ययन का एक प्रमुख क्षेत्र बने हुए हैं, जिसमें शैक्षणिक और औद्योगिक प्रयोगशालाओं से निरंतर योगदान हो रहा है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·deep-learning·computer-vision·text-to-image
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास