स्टेबल डिफ्यूज़न अगस्त 2022

अंग्रेज़ी से अनुवादित

स्टेबल डिफ्यूजन एक डीप लर्निंग, टेक्स्ट-टू-इमेज मॉडल है जिसे अगस्त 2022 में स्टेबिलिटी एआई द्वारा जारी किया गया था, जो लेटेंट डिफ्यूजन तकनीकों पर आधारित है। यह टेक्स्ट प्रॉम्प्ट से विस्तृत छवियाँ उत्पन्न करता है और अपने ओपन-सोर्स रिलीज़ के लिए उल्लेखनीय है, जिससे उपभोक्ता हार्डवेयर पर व्यापक अपनाने को सक्षम किया गया है।

स्टेबल डिफ्यूज़न एक डीप लर्निंग, टेक्स्ट-टू-इमेज मॉडल है जिसे अगस्त 2022 में जारी किया गया था, जिसे LMU म्यूनिख और रनवे में CompVis समूह के शोधकर्ताओं द्वारा विकसित किया गया था, जिसमें स्टेबिलिटी AI से कम्प्यूटेशनल समर्थन और गैर-लाभकारी संगठनों से प्रशिक्षण डेटा शामिल था। यह एक लेटेंट डिफ्यूज़न मॉडल है, जो एक प्रकार का डीप जनरेटिव आर्टिफिशियल न्यूरल नेटवर्क है, और इसे स्टेबिलिटी AI का प्रमुख उत्पाद माना जाता है, जो चल रहे AI बूम में योगदान देता है। मॉडल का कोड और वज़न सार्वजनिक रूप से जारी किए गए थे, जिससे यह मामूली GPUs (कम से कम 2.4 GB VRAM) वाले उपभोक्ता हार्डवेयर पर चल सकता है, जो DALL-E और मिडजर्नी जैसे मालिकाना मॉडलों से अलग है जो केवल क्लाउड सेवाओं के माध्यम से सुलभ थे।

प्राथमिक उपयोग का मामला टेक्स्ट विवरणों द्वारा निर्धारित विस्तृत छवियां उत्पन्न करना है, लेकिन यह इनपेंटिंग, आउटपेंटिंग, और टेक्स्ट प्रॉम्प्ट द्वारा निर्देशित इमेज-टू-इमेज अनुवाद जैसे कार्यों का भी समर्थन करता है। इसकी ओपन-सोर्स प्रकृति और दक्षता ने डिजिटल कला से लेकर अनुसंधान तक विभिन्न अनुप्रयोगों में तेजी से अपनाने को बढ़ावा दिया।

विकास

स्टेबल डिफ्यूज़न एक परियोजना से उत्पन्न हुआ जिसे लेटेंट डिफ्यूज़न कहा जाता है, जिसे जर्मनी में LMU म्यूनिख और हीडलबर्ग विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित किया गया था। मूल पांच लेखकों में से चार (रॉबिन रोम्बैक, एंड्रियास ब्लैटमैन, पैट्रिक एसर, और डोमिनिक लोरेंज) बाद में स्टेबिलिटी AI में शामिल हुए और बाद के संस्करण जारी किए। तकनीकी लाइसेंस LMU म्यूनिख में CompVis समूह द्वारा जारी किया गया था। विकास का नेतृत्व रनवे के पैट्रिक एसर और CompVis के रॉबिन रोम्बैक ने किया, जो लेटेंट डिफ्यूज़न आर्किटेक्चर के आविष्कारकों में से थे। स्टेबिलिटी AI ने EleutherAI और LAION को भी श्रेय दिया, जो एक जर्मन गैर-लाभकारी संगठन है जिसने प्रशिक्षण डेटासेट तैयार किया, समर्थकों के रूप में।

प्रौद्योगिकी

आर्किटेक्चर

डिफ्यूज़न मॉडल, 2015 में पेश किए गए, प्रशिक्षण छवियों पर गाऊसी शोर के क्रमिक अनुप्रयोगों को हटाने के लिए प्रशिक्षित किए जाते हैं, जो डीनॉइज़िंग ऑटोएनकोडर के अनुक्रम के रूप में कार्य करते हैं। नाम थर्मोडायनामिक डिफ्यूज़न से लिया गया है, क्योंकि वे थर्मोडायनामिक्स से प्रेरित थे। स्टेबल डिफ्यूज़न एक प्रकार का लेटेंट डिफ्यूज़न मॉडल (LDM) का उपयोग करता है, जिसे 2021 में CompVis समूह द्वारा विकसित किया गया था।

मॉडल में तीन भाग होते हैं: एक वैरिएशनल ऑटोएनकोडर (VAE), एक U-Net, और एक वैकल्पिक टेक्स्ट एनकोडर। VAE एनकोडर छवियों को पिक्सेल स्पेस से छोटे लेटेंट स्पेस में संपीड़ित करता है, जो अर्थ संबंधी अर्थ को पकड़ता है। फॉरवर्ड डिफ्यूज़न के दौरान संपीड़ित लेटेंट प्रतिनिधित्व पर गाऊसी शोर को पुनरावृत्त रूप से लागू किया जाता है। U-Net, जो एक ResNet बैकबोन से बना है, आउटपुट को डीनॉइज़ करके एक लेटेंट प्रतिनिधित्व प्राप्त करता है। अंत में, VAE डिकोडर प्रतिनिधित्व को पिक्सेल स्पेस में वापस परिवर्तित करके अंतिम छवि उत्पन्न करता है।

डीनॉइज़िंग चरण को क्रॉस-अटेंशन तंत्र के माध्यम से टेक्स्ट, छवियों, या अन्य मोडैलिटी द्वारा निर्धारित किया जा सकता है। टेक्स्ट कंडीशनिंग के लिए, एक निश्चित, पूर्व-प्रशिक्षित CLIP ViT-L/14 टेक्स्ट एनकोडर प्रॉम्प्ट को एक एम्बेडिंग स्पेस में बदल देता है। LDM प्रशिक्षण और उत्पादन के लिए बढ़ी हुई कम्प्यूटेशनल दक्षता प्रदान करते हैं। U-Net में 860 मिलियन पैरामीटर और टेक्स्ट एनकोडर में 123 मिलियन के साथ, स्टेबल डिफ्यूज़न 2022 मानकों द्वारा अपेक्षाकृत हल्का है, जो उपभोक्ता GPUs और यहां तक कि OpenVINO संस्करण के साथ केवल CPU पर चलने में सक्षम है।

SD XL

XL संस्करण समान LDM आर्किटेक्चर का उपयोग करता है लेकिन बड़ा: एक बड़ा UNet बैकबोन, बड़ा क्रॉस-अटेंशन संदर्भ, एक के बजाय दो टेक्स्ट एनकोडर, और कई पहलू अनुपातों पर प्रशिक्षण। SD XL रिफाइनर, जो एक साथ जारी किया गया था, समान आर्किटेक्चर है लेकिन टेक्स्ट-कंडीशन्ड img2img के माध्यम से मौजूदा छवियों में बारीक विवरण जोड़ने के लिए प्रशिक्षित किया गया था।

SD 3.0

3.0 संस्करण बैकबोन को पूरी तरह से बदल देता है, UNet के बजाय एक रेक्टिफाइड फ्लो ट्रांसफॉर्मर का उपयोग करता है। ट्रांसफॉर्मर आर्किटेक्चर में तीन ट्रैक होते हैं: मूल टेक्स्ट एन्कोडिंग, परिवर्तित टेक्स्ट एन्कोडिंग, और छवि एन्कोडिंग (लेटेंट स्पेस में)। परिवर्तित टेक्स्ट एन्कोडिंग और छवि एन्कोडिंग प्रत्येक ट्रांसफॉर्मर ब्लॉक के दौरान मिश्रित होते हैं। इस आर्किटेक्चर को "मल्टीमॉडल डिफ्यूज़न ट्रांसफॉर्मर (MMDiT)" नाम दिया गया है, जहां "मल्टीमॉडल" का अर्थ है कि यह अपने संचालन के अंदर टेक्स्ट और छवि एन्कोडिंग को मिश्रित करता है, पिछले DiT संस्करणों से भिन्न जहां टेक्स्ट एन्कोडिंग केवल छवि एन्कोडिंग को प्रभावित करती थी।

प्रशिक्षण डेटा

स्टेबल डिफ्यूज़न को LAION-5B से छवि-कैप्शन जोड़ों पर प्रशिक्षित किया गया था, जो कॉमन क्रॉल डेटा से प्राप्त एक सार्वजनिक रूप से उपलब्ध डेटासेट है, जिसमें भाषा, रिज़ॉल्यूशन, वॉटरमार्क संभावना, और अनुमानित सौंदर्य स्कोर द्वारा फ़िल्टर किए गए 5 बिलियन छवि-टेक्स्ट जोड़े शामिल हैं। डेटासेट LAION द्वारा बनाया गया था, जो स्टेबिलिटी AI द्वारा वित्त पोषित एक जर्मन गैर-लाभकारी संगठन है। मॉडल को तीन उपसमुच्चयों पर प्रशिक्षित किया गया था: laion2B-en, laion-high-resolution, और laion-aesthetics v2 5+। 12 मिलियन छवियों के एक छोटे उपसमुच्चय के तीसरे पक्ष के विश्लेषण में पाया गया कि लगभग 47% 100 विभिन्न डोमेन से आए थे, जिसमें Pinterest 8.5% के साथ शीर्ष पर था, उसके बाद WordPress, Blogspot, Flickr, DeviantArt, और Wikimedia Commons थे। Bayerischer Rundfunk द्वारा एक जांच से पता चला कि Hugging Face पर होस्ट किए गए LAION के डेटासेट में बड़ी मात्रा में निजी और संवेदनशील डेटा शामिल है।

प्रशिक्षण प्रक्रियाएं

मॉडल को शुरू में laion2B-en और laion-high-resolution पर प्रशिक्षित किया गया था, अंतिम दौर LAION-Aesthetics v2 5+ पर, जो 600 मिलियन कैप्शन वाली छवियों का एक उपसमुच्चय है जिसे सौंदर्य गुणवत्ता के लिए कम से कम 5 में से 10 स्कोर प्राप्त करने की भविष्यवाणी की गई थी। इस उपसमुच्चय ने कम-रिज़ॉल्यूशन छवियों और 80% से अधिक वॉटरमार्क संभावना वाली छवियों को बाहर रखा। अंतिम प्रशिक्षण दौर में क्लासिफायर-फ्री डिफ्यूज़न गाइडेंस में सुधार के लिए 10% टेक्स्ट कंडीशनिंग छोड़ दी गई। मॉडल को अमेज़न वेब सेवाओं पर 256 Nvidia A100 GPUs का उपयोग करके कुल 150,000 GPU-घंटे के लिए प्रशिक्षित किया गया था, जिसकी लागत $600,000 थी।

सीमाएं

स्टेबल डिफ्यूज़न में ज्ञात सीमाएं हैं, जिनमें जटिल दृश्यों में कठिनाई, शारीरिक अशुद्धियां (जैसे हाथ), और प्रशिक्षण डेटा में पूर्वाग्रह शामिल हैं। यह उन सामाजिक पूर्वाग्रहों को प्रतिबिंबित करने वाली छवियां भी उत्पन्न कर सकता है जो डेटासेट में मौजूद हैं। मॉडल टेक्स्ट रेंडरिंग और बारीक विवरणों के साथ संघर्ष कर सकता है, और इसका प्रदर्शन विभिन्न प्रॉम्प्टों के बीच भिन्न होता है। 2024 तक, चल रहे शोध फाइन-ट्यूनिंग और आर्किटेक्चरल सुधारों के माध्यम से इन मुद्दों को संबोधित करते हैं।

प्रभाव और अपनाना

अगस्त 2022 में स्टेबल डिफ्यूज़न का सार्वजनिक रिलीज़ जनरेटिव AI में एक महत्वपूर्ण बदलाव को चिह्नित करता है, जिससे उच्च-गुणवत्ता वाली टेक्स्ट-टू-इमेज पीढ़ी व्यापक दर्शकों के लिए सुलभ हो गई। इसका ओपन-सोर्स लाइसेंस डेवलपर्स को इसे कला उपकरणों से लेकर शैक्षिक प्लेटफार्मों तक विभिन्न अनुप्रयोगों में एकीकृत करने में सक्षम बनाता है। मॉडल की दक्षता ने इसे उपभोक्ता हार्डवेयर पर चलने की अनुमति दी, जिससे शौकीनों और शोधकर्ताओं का एक समुदाय विकसित हुआ। इस रिलीज़ ने कॉपीराइट, नैतिकता, और AI-जनित सामग्री के संभावित दुरुपयोग के बारे में चर्चाओं को भी जन्म दिया। स्टेबिलिटी AI ने SD XL और SD 3.0 जैसे बेहतर संस्करण जारी करना जारी रखा, जो कृत्रिम बुद्धिमत्ता के तेजी से विकसित होते क्षेत्र में अपनी स्थिति बनाए रखता है।

भविष्य की दिशाएं

स्टेबल डिफ्यूज़न के बाद के संस्करणों ने विभिन्न आर्किटेक्चर की खोज की है, जैसे SD 3.0 में रेक्टिफाइड फ्लो ट्रांसफॉर्मर, जिसका उद्देश्य गुणवत्ता और दक्षता में सुधार करना है। पूर्वाग्रहों को कम करने, नियंत्रणीयता बढ़ाने, और अन्य मोडैलिटी के साथ एकीकरण पर शोध जारी है। मॉडल की सफलता ने अन्य मशीन लर्निंग परियोजनाओं को प्रभावित किया है और व्यापक AI बूम में योगदान दिया है, जिसके निहितार्थ डीप लर्निंग और तंत्रिका नेटवर्क के लिए हैं। 2025 तक, स्टेबल डिफ्यूज़न टेक्स्ट-टू-इमेज पीढ़ी में एक बेंचमार्क बना हुआ है, जिसमें चल रहे सामुदायिक और कॉर्पोरेट विकास शामिल हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-image·open-source·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास