Stable Diffusion एक डीप लर्निंग, टेक्स्ट-टू-इमेज मॉडल है जिसे 2022 में Stability AI द्वारा जारी किया गया था, जो डिफ्यूज़न तकनीकों पर आधारित है। इसका उपयोग मुख्य रूप से टेक्स्ट विवरणों के आधार पर विस्तृत छवियाँ उत्पन्न करने के लिए किया जाता है, हालाँकि इसे इनपेंटिंग, आउटपेंटिंग, और टेक्स्ट प्रॉम्प्ट द्वारा निर्देशित इमेज-टू-इमेज अनुवाद जैसे कार्यों पर भी लागू किया जा सकता है। मॉडल को चल रहे जनरेटिव AI उछाल का एक हिस्सा माना जाता है और यह पिछले स्वामित्व वाले टेक्स्ट-टू-इमेज मॉडल जैसे DALL-E और Midjourney से एक अलग दिशा में चला गया, जो केवल क्लाउड सेवाओं के माध्यम से सुलभ थे।
Stable Diffusion एक लेटेंट डिफ्यूज़न मॉडल है, जो एक प्रकार का डीप जनरेटिव कृत्रिम तंत्रिका नेटवर्क है। इसके कोड और मॉडल वेट्स सार्वजनिक रूप से जारी किए गए थे, और एक अनुकूलित संस्करण अधिकांश उपभोक्ता हार्डवेयर पर चल सकता है जिसमें 2.4 GB VRAM जितनी कम क्षमता वाला एक साधारण GPU हो। यह पहुँच इसे पहले के मॉडलों से अलग करती थी और इसके व्यापक अपनाने में योगदान करती थी।
विकास
Stable Diffusion की उत्पत्ति एक परियोजना से हुई जिसे लेटेंट डिफ्यूज़न कहा जाता है, जिसे जर्मनी में LMU म्यूनिख और हीडलबर्ग विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित किया गया था। मूल पाँच लेखकों में से चार - रॉबिन रोम्बैक, एंड्रियास ब्लैटमैन, पैट्रिक एसर, और डोमिनिक लोरेंज - बाद में Stability AI में शामिल हो गए और मॉडल के बाद के संस्करण जारी किए। तकनीकी लाइसेंस LMU म्यूनिख के CompVis समूह द्वारा जारी किया गया था, जिसमें विकास का नेतृत्व रनवे के पैट्रिक एसर और CompVis के रॉबिन रोम्बैक ने किया, जिन्होंने पहले लेटेंट डिफ्यूज़न आर्किटेक्चर का आविष्कार किया था। Stability AI ने EleutherAI और LAION को भी समर्थकों के रूप में श्रेय दिया, जो एक जर्मन गैर-लाभकारी संगठन है जिसने प्रशिक्षण डेटासेट को एकत्र किया।
प्रौद्योगिकी
आर्किटेक्चर
डिफ्यूज़न मॉडल, जिन्हें 2015 में पेश किया गया था, प्रशिक्षण छवियों पर गाऊसी शोर के क्रमिक अनुप्रयोगों को हटाने के लिए प्रशिक्षित किए जाते हैं, जो डीनोइज़िंग ऑटोएनकोडर के अनुक्रम के समान है। यह नाम थर्मोडायनामिक डिफ्यूज़न से लिया गया है, क्योंकि प्रारंभिक विकास थर्मोडायनामिक्स से प्रेरित था। SD 3 से पहले के Stable Diffusion श्रृंखला के मॉडलों ने लेटेंट डिफ्यूज़न मॉडल (LDM) नामक एक प्रकार का उपयोग किया, जिसे 2021 में LMU म्यूनिख के CompVis समूह द्वारा विकसित किया गया था।
Stable Diffusion तीन भागों से मिलकर बना है: एक वैरिएशनल ऑटोएनकोडर (VAE), एक U-Net, और एक वैकल्पिक टेक्स्ट एनकोडर। VAE एनकोडर छवियों को पिक्सेल स्पेस से एक छोटे लेटेंट स्पेस में संपीड़ित करता है, जो मौलिक अर्थपूर्ण अर्थ को पकड़ता है। फॉरवर्ड डिफ्यूज़न के दौरान संपीड़ित लेटेंट प्रतिनिधित्व पर गाऊसी शोर को पुनरावृत्त रूप से लागू किया जाता है। U-Net ब्लॉक, जो एक ResNet बैकबोन से बना है, आउटपुट को डीनोइज़ करके एक लेटेंट प्रतिनिधित्व प्राप्त करता है, और VAE डिकोडर प्रतिनिधित्व को पिक्सेल स्पेस में वापस परिवर्तित करके अंतिम छवि उत्पन्न करता है।
डीनोइज़िंग चरण को क्रॉस-अटेंशन तंत्र के माध्यम से टेक्स्ट, एक छवि, या किसी अन्य मोडैलिटी पर सशर्त किया जा सकता है। टेक्स्ट कंडीशनिंग के लिए, एक निश्चित, पूर्व-प्रशिक्षित CLIP ViT-L/14 टेक्स्ट एनकोडर प्रॉम्प्ट को एक एम्बेडिंग स्पेस में बदल देता है। शोधकर्ता प्रशिक्षण और उत्पादन के लिए बढ़ी हुई कम्प्यूटेशनल दक्षता को LDM का लाभ बताते हैं। U-Net में 860 मिलियन पैरामीटर और टेक्स्ट एनकोडर में 123 मिलियन पैरामीटर के साथ, Stable Diffusion 2022 के मानकों से अपेक्षाकृत हल्का है और उपभोक्ता GPU पर चल सकता है, या OpenVINO संस्करण के साथ केवल CPU पर भी।
#### SD XL
XL संस्करण समान LDM आर्किटेक्चर का उपयोग करता है लेकिन बड़ा: एक बड़ा UNet बैकबोन, बड़ा क्रॉस-अटेंशन संदर्भ, एक के बजाय दो टेक्स्ट एनकोडर, और कई पहलू अनुपातों पर प्रशिक्षण। SD XL रिफाइनर, जो एक साथ जारी किया गया था, समान आर्किटेक्चर रखता है लेकिन टेक्स्ट-कंडीशनल img2img के माध्यम से पहले से मौजूद छवियों में बारीक विवरण जोड़ने के लिए प्रशिक्षित किया गया था।
#### SD 3.0
3.0 संस्करण बैकबोन को पूरी तरह से बदल देता है, UNet के बजाय एक रेक्टिफाइड फ्लो ट्रांसफॉर्मर का उपयोग करता है। आर्किटेक्चर में मूल टेक्स्ट एन्कोडिंग, रूपांतरित टेक्स्ट एन्कोडिंग, और लेटेंट स्पेस में छवि एन्कोडिंग के लिए तीन ट्रैक हैं, जिसमें बाद वाले दो प्रत्येक ट्रांसफॉर्मर ब्लॉक के दौरान मिश्रित होते हैं। इसे "मल्टीमॉडल डिफ्यूज़न ट्रांसफॉर्मर" (MMDiT) नाम दिया गया है, जो दर्शाता है कि यह आंतरिक रूप से टेक्स्ट और छवि एन्कोडिंग को मिलाता है, पिछले DiT संस्करणों के विपरीत जहाँ टेक्स्ट छवि को प्रभावित करता है लेकिन इसके विपरीत नहीं।
प्रशिक्षण डेटा
Stable Diffusion को LAION-5B से छवि-कैप्शन जोड़ों पर प्रशिक्षित किया गया था, जो कॉमन क्रॉल वेब डेटा से प्राप्त एक सार्वजनिक रूप से उपलब्ध डेटासेट है। LAION-5B में 5 बिलियन छवि-टेक्स्ट जोड़े हैं जिन्हें भाषा द्वारा वर्गीकृत किया गया है और रिज़ॉल्यूशन, वॉटरमार्क संभावना, और अनुमानित सौंदर्य स्कोर द्वारा फ़िल्टर किया गया है। डेटासेट LAION द्वारा बनाया गया था, जो Stability AI द्वारा वित्त पोषित एक जर्मन गैर-लाभकारी संगठन है। मॉडल को तीन उपसमुच्चयों पर प्रशिक्षित किया गया था: laion2B-en, laion-high-resolution, और laion-aesthetics v2 5+। 12 मिलियन छवियों के एक छोटे उपसमुच्चय के तीसरे पक्ष के विश्लेषण में पाया गया कि लगभग 47% 100 डोमेन से आए, जिसमें Pinterest 8.5% के साथ शीर्ष पर था, उसके बाद WordPress, Blogspot, Flickr, DeviantArt, और Wikimedia Commons थे। Bayerischer Rundfunk की एक जाँच से पता चला कि Hugging Face पर होस्ट किए गए LAION के डेटासेट में बड़ी मात्रा में निजी और संवेदनशील डेटा शामिल है।
प्रशिक्षण प्रक्रियाएँ
मॉडल को शुरू में laion2B-en और laion-high-resolution पर प्रशिक्षित किया गया था, जिसमें अंतिम चरण LAION-Aesthetics v2 5+ पर थे, जो 600 मिलियन कैप्शन वाली छवियों का एक उपसमुच्चय है जिसके मानव मूल्यांकनकर्ताओं से कम से कम 5 में से 5 का स्कोर प्राप्त करने का अनुमान लगाया गया था। इस उपसमुच्चय ने कम-रिज़ॉल्यूशन छवियों और 80% से अधिक अनुमानित वॉटरमार्क संभावना वाली छवियों को बाहर रखा। अंतिम प्रशिक्षण चरणों में क्लासिफायर-फ्री डिफ्यूज़न गाइडेंस को बेहतर बनाने के लिए 10% टेक्स्ट कंडीशनिंग को हटा दिया गया। मॉडल को अमेज़न वेब सेवाओं पर 256 Nvidia A100 GPU का उपयोग करके 150,000 GPU-घंटे के लिए प्रशिक्षित किया गया था, जिसकी लागत $600,000 थी।
सीमाएँ
Stable Diffusion में ज्ञात गिरावट की समस्याएँ हैं, जैसे हाथों और टेक्स्ट को प्रस्तुत करने में कठिनाई, और प्रशिक्षण डेटा के कारण पक्षपाती या हानिकारक सामग्री उत्पन्न कर सकता है। सार्वजनिक रिलीज़ ने दुरुपयोग के बारे में चिंताएँ उठाईं, जिसमें डीपफेक और कॉपीराइट उल्लंघन शामिल हैं, जिससे मशीन लर्निंग समुदाय में विनियमन और नैतिक उपयोग के बारे में चल रही बहसें हुईं।
प्रभाव
2022 में Stable Diffusion की रिलीज़ ने डीप लर्निंग कला आंदोलन को काफी तेज किया, जिससे शौकीनों और कलाकारों को व्यक्तिगत हार्डवेयर पर उच्च-गुणवत्ता वाली छवियाँ उत्पन्न करने में सक्षम बनाया गया। इसने बाद के टेक्स्ट-टू-इमेज मॉडलों को प्रभावित किया और व्यापक AI उछाल में योगदान दिया, जिसमें कला, डिज़ाइन, और सामग्री निर्माण में अनुप्रयोग शामिल हैं। मॉडल की ओपन-सोर्स प्रकृति ने सामुदायिक उपकरणों और फाइन-ट्यून किए गए वेरिएंट्स का एक बड़ा पारिस्थितिकी तंत्र विकसित किया, हालाँकि इसने बौद्धिक संपदा और रचनात्मक कार्य के भविष्य के बारे में चर्चाएँ भी शुरू कीं।
स्वागत और विरासत
मॉडल को इसकी तकनीकी उपलब्धियों और पहुँच के लिए व्यापक ध्यान मिला। इसे इसकी दक्षता और गुणवत्ता के लिए प्रशंसा मिली, लेकिन संभावित दुरुपयोग के लिए भी आलोचना की गई। 2025 तक, Stable Diffusion जनरेटिव AI में एक मौलिक संदर्भ बना हुआ है, जिसमें Stability AI और ओपन-सोर्स समुदाय द्वारा निरंतर विकास हो रहा है। इसके आर्किटेक्चर और प्रशिक्षण दृष्टिकोण को कई बाद के मॉडलों में अनुकूलित किया गया है, जिससे क्षेत्र में इसकी विरासत स्थापित हुई है।