अंग्रेज़ी से अनुवादित

Stable Diffusion एक ओपन-सोर्स डीप लर्निंग टेक्स्ट-टू-इमेज मॉडल है, जिसे 2022 में Stability AI द्वारा जारी किया गया था, जिसने उपभोक्ता हार्डवेयर पर चलकर जनरेटिव कला को लोकप्रिय बनाया। यह टेक्स्ट प्रॉम्प्ट से विस्तृत छवियाँ उत्पन्न करने के लिए लेटेंट डिफ्यूज़न का उपयोग करता है।

Stable Diffusion एक डीप लर्निंग, टेक्स्ट-टू-इमेज मॉडल है जिसे 2022 में डिफ्यूजन तकनीकों के आधार पर जारी किया गया था। यह जनरेटिव एआई तकनीक Stability AI का प्रमुख उत्पाद है और इसे चल रहे एआई बूम का हिस्सा माना जाता है। इसका उपयोग मुख्य रूप से टेक्स्ट विवरणों के आधार पर विस्तृत छवियां उत्पन्न करने के लिए किया जाता है, हालांकि इसे अन्य कार्यों जैसे इनपेंटिंग, आउटपेंटिंग, और टेक्स्ट प्रॉम्प्ट द्वारा निर्देशित इमेज-टू-इमेज अनुवाद उत्पन्न करने के लिए भी लागू किया जा सकता है। इसके विकास में LMU म्यूनिख में CompVis समूह और Runway के शोधकर्ता शामिल थे, जिसमें Stability से कम्प्यूटेशनल दान और गैर-लाभकारी संगठनों से प्रशिक्षण डेटा प्राप्त हुआ था।

Stable Diffusion एक लेटेंट डिफ्यूजन मॉडल है, जो एक प्रकार का गहरा जनरेटिव कृत्रिम तंत्रिका नेटवर्क है। इसके कोड और मॉडल वेट्स सार्वजनिक रूप से जारी किए गए हैं, और एक अनुकूलित संस्करण अधिकांश उपभोक्ता हार्डवेयर पर चल सकता है जिसमें 2.4 GB VRAM जितनी कम क्षमता वाला मामूली GPU हो। यह पिछले मालिकाना टेक्स्ट-टू-इमेज मॉडल जैसे DALL-E और Midjourney से एक अलग दृष्टिकोण था, जो केवल क्लाउड सेवाओं के माध्यम से सुलभ थे।

विकास

Stable Diffusion की उत्पत्ति एक परियोजना से हुई जिसे लेटेंट डिफ्यूजन कहा जाता है, जिसे जर्मनी में LMU म्यूनिख और हीडलबर्ग विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित किया गया था। मूल 5 लेखकों में से चार (रॉबिन रॉम्बैक, एंड्रियास ब्लैटमैन, पैट्रिक एसर और डोमिनिक लोरेंज) बाद में Stability AI में शामिल हुए और Stable Diffusion के बाद के संस्करण जारी किए। मॉडल के लिए तकनीकी लाइसेंस LMU म्यूनिख में CompVis समूह द्वारा जारी किया गया था। विकास का नेतृत्व Runway के पैट्रिक एसर और CompVis के रॉबिन रॉम्बैक ने किया, जो उन शोधकर्ताओं में से थे जिन्होंने पहले Stable Diffusion द्वारा उपयोग किए गए लेटेंट डिफ्यूजन मॉडल आर्किटेक्चर का आविष्कार किया था। Stability AI ने EleutherAI और LAION को भी परियोजना के समर्थकों के रूप में श्रेय दिया, जो एक जर्मन गैर-लाभकारी संगठन है जिसने उस डेटासेट को एकत्र किया जिस पर Stable Diffusion को प्रशिक्षित किया गया था।

2022 में Stable Diffusion का जारी होना Generative AI उपकरणों की पहुंच में एक महत्वपूर्ण बदलाव का प्रतीक था। पहले के मॉडलों के विपरीत जिन्हें क्लाउड एक्सेस की आवश्यकता थी, Stable Diffusion को स्थानीय रूप से चलाया जा सकता था, जिससे कलाकारों और डेवलपर्स के व्यापक समुदाय को टेक्स्ट-टू-इमेज जनरेशन के साथ प्रयोग करने में सक्षम बनाया गया। इसने इसके तेजी से अपनाने और विभिन्न ऑनलाइन प्लेटफार्मों पर एआई-जनित कला के प्रसार में योगदान दिया।

तकनीक

आर्किटेक्चर

डिफ्यूजन मॉडल, जिन्हें 2015 में पेश किया गया था, प्रशिक्षण छवियों पर गॉसियन शोर के क्रमिक अनुप्रयोगों को हटाने के उद्देश्य से प्रशिक्षित किए जाते हैं, जिन्हें डीनोइज़िंग ऑटोएनकोडर के अनुक्रम के रूप में सोचा जा सकता है। नाम डिफ्यूजन थर्मोडायनामिक डिफ्यूजन से है, क्योंकि वे पहली बार थर्मोडायनामिक्स से प्रेरणा के साथ विकसित किए गए थे। SD 3 से पहले Stable Diffusion श्रृंखला के मॉडल सभी ने डिफ्यूजन मॉडल का एक प्रकार, जिसे लेटेंट डिफ्यूजन मॉडल (LDM) कहा जाता है, का उपयोग किया, जिसे 2021 में LMU म्यूनिख में CompVis (कंप्यूटर विज़न और लर्निंग) समूह द्वारा विकसित किया गया था।

Stable Diffusion में 3 भाग होते हैं: वैरिएशनल ऑटोएनकोडर (VAE), U-Net, और एक वैकल्पिक टेक्स्ट एनकोडर। VAE एनकोडर छवि को पिक्सेल स्पेस से छोटे आयामी लेटेंट स्पेस में संपीड़ित करता है, जो छवि के अधिक मौलिक अर्थ संबंधी अर्थ को पकड़ता है। फॉरवर्ड डिफ्यूजन के दौरान संपीड़ित लेटेंट प्रतिनिधित्व पर गॉसियन शोर को पुनरावृत्त रूप से लागू किया जाता है। U-Net ब्लॉक, जो ResNet बैकबोन से बना है, फॉरवर्ड डिफ्यूजन से आउटपुट को पीछे की ओर डीनोइज़ करके एक लेटेंट प्रतिनिधित्व प्राप्त करता है। अंत में, VAE डिकोडर प्रतिनिधित्व को वापस पिक्सेल स्पेस में परिवर्तित करके अंतिम छवि उत्पन्न करता है।

डीनोइज़िंग चरण को लचीले ढंग से टेक्स्ट की एक स्ट्रिंग, एक छवि, या एक अन्य मोडैलिटी पर सशर्त किया जा सकता है। एन्कोडेड कंडीशनिंग डेटा को क्रॉस-अटेंशन तंत्र के माध्यम से डीनोइज़िंग U-Nets को उजागर किया जाता है। टेक्स्ट पर कंडीशनिंग के लिए, निश्चित, पूर्व-प्रशिक्षित CLIP ViT-L/14 टेक्स्ट एनकोडर का उपयोग टेक्स्ट प्रॉम्प्ट को एम्बेडिंग स्पेस में बदलने के लिए किया जाता है। शोधकर्ता प्रशिक्षण और जनरेशन के लिए बढ़ी हुई कम्प्यूटेशनल दक्षता को LDM का लाभ बताते हैं। U-Net में 860 मिलियन पैरामीटर और टेक्स्ट एनकोडर में 123 मिलियन के साथ, Stable Diffusion को 2022 के मानकों से अपेक्षाकृत हल्का माना जाता है, और अन्य डिफ्यूजन मॉडलों के विपरीत, यह उपभोक्ता GPUs पर चल सकता है, और यहां तक कि केवल CPU पर भी यदि OpenVINO संस्करण का उपयोग किया जाए।

#### SD XL

XL संस्करण पिछले संस्करणों के समान LDM आर्किटेक्चर का उपयोग करता है, सिवाय बड़े होने के: बड़ा UNet बैकबोन, बड़ा क्रॉस-अटेंशन संदर्भ, एक के बजाय दो टेक्स्ट एनकोडर, और कई पहलू अनुपातों पर प्रशिक्षित (पिछले संस्करणों की तरह केवल वर्ग पहलू अनुपात नहीं)। SD XL रिफाइनर, जो उसी समय जारी किया गया था, SD XL के समान आर्किटेक्चर है, लेकिन इसे टेक्स्ट-कंडीशनल img2img के माध्यम से पहले से मौजूद छवियों में बारीक विवरण जोड़ने के लिए प्रशिक्षित किया गया था।

#### SD 3.0

3.0 संस्करण बैकबोन को पूरी तरह से बदल देता है। यह UNet नहीं है, बल्कि एक रेक्टिफाइड फ्लो ट्रांसफॉर्मर है, जो Transformer (architecture) के साथ रेक्टिफाइड फ्लो विधि को लागू करता है। SD 3.0 के लिए उपयोग किया जाने वाला ट्रांसफॉर्मर आर्किटेक्चर में तीन "ट्रैक" हैं, मूल टेक्स्ट एन्कोडिंग, परिवर्तित टेक्स्ट एन्कोडिंग, और छवि एन्कोडिंग (लेटेंट स्पेस में) के लिए। परिवर्तित टेक्स्ट एन्कोडिंग और छवि एन्कोडिंग प्रत्येक ट्रांसफॉर्मर ब्लॉक के दौरान मिश्रित होते हैं। आर्किटेक्चर को "मल्टीमॉडल डिफ्यूजन ट्रांसफॉर्मर (MMDiT)" नाम दिया गया है, जहां "मल्टीमॉडल" का अर्थ है कि यह अपने संचालन के भीतर टेक्स्ट और छवि एन्कोडिंग को मिश्रित करता है। यह DiT के पिछले संस्करणों से भिन्न है, जहां टेक्स्ट एन्कोडिंग छवि एन्कोडिंग को प्रभावित करती है, लेकिन इसके विपरीत नहीं।

प्रशिक्षण डेटा

Stable Diffusion को LAION-5B से लिए गए छवियों और कैप्शन के जोड़े पर प्रशिक्षित किया गया था, जो वेब से स्क्रैप किए गए Common Crawl डेटा से प्राप्त एक सार्वजनिक रूप से उपलब्ध डेटासेट है, जहां 5 बिलियन छवि-टेक्स्ट जोड़े को भाषा के आधार पर वर्गीकृत किया गया था और रिज़ॉल्यूशन, वॉटरमार्क होने की अनुमानित संभावना, और अनुमानित "सौंदर्य" स्कोर (जैसे व्यक्तिपरक दृश्य गुणवत्ता) द्वारा अलग डेटासेट में फ़िल्टर किया गया था। डेटासेट LAION द्वारा बनाया गया था, जो एक जर्मन गैर-लाभकारी संगठन है जिसे Stability AI से वित्त पोषण मिलता है। Stable Diffusion मॉडल को LAION-5B के तीन उपसमुच्चयों पर प्रशिक्षित किया गया था: laion2B-en, laion-high-resolution, और laion-aesthetics v2 5+। मॉडल के प्रशिक्षण डेटा के एक तृतीय-पक्ष विश्लेषण ने पहचान की कि मूल व्यापक डेटासेट से लिए गए 12 मिलियन छवियों के छोटे उपसमुच्चय में से, छवियों के नमूना आकार का लगभग 47% 100 विभिन्न डोमेन से आया था, जिसमें Pinterest उपसमुच्चय का 8.5% हिस्सा लेता है, इसके बाद WordPress, Blogspot, Flickr, DeviantArt और Wikimedia Commons जैसी वेबसाइटें शामिल हैं। Bayerischer Rundfunk की एक जांच से पता चला कि LAION के डेटासेट, जो Hugging Face पर होस्ट किए गए हैं, में बड़ी मात्रा में निजी और संवेदनशील डेटा शामिल है।

प्रशिक्षण प्रक्रियाएं

मॉडल को शुरू में laion2B-en और laion-high-resolution उपसमुच्चयों पर प्रशिक्षित किया गया था, जिसमें प्रशिक्षण के अंतिम कुछ दौर LAION-Aesthetics v2 5+ पर किए गए थे, जो 600 मिलियन कैप्शन वाली छवियों का एक उपसमुच्चय है जिसके लिए LAION-Aesthetics Predictor V2 ने भविष्यवाणी की थी कि मनुष्य, औसतन, जब पूछा जाए कि वे उन्हें कितना पसंद करते हैं, तो 10 में से कम से कम 5 का स्कोर देंगे। LAION-Aesthetics v2 5+ उपसमुच्चय ने कम-रिज़ॉल्यूशन वाली छवियों और उन छवियों को भी बाहर रखा जिन्हें LAION-5B-WatermarkDetection ने 80% से अधिक संभावना के साथ वॉटरमार्क ले जाने के रूप में पहचाना। प्रशिक्षण के अंतिम दौरों ने क्लासिफायर-फ्री डिफ्यूजन गाइडेंस को बेहतर बनाने के लिए 10% टेक्स्ट कंडीशनिंग को भी हटा दिया। मॉडल को Amazon Web Services पर 256 Nvidia A100 GPUs का उपयोग करके कुल 150,000 GPU-घंटे के लिए प्रशिक्षित किया गया था, जिसकी लागत $600,000 थी।

प्रभाव और विरासत

Stable Diffusion के कोड और वेट्स का सार्वजनिक जारी होना Artificial intelligence और डिजिटल कला के क्षेत्र पर गहरा प्रभाव डाला। इसने शक्तिशाली टेक्स्ट-टू-इमेज जनरेशन तक पहुंच को लोकतांत्रिक बना दिया, जिससे व्यक्तियों और छोटी टीमों को महंगे क्लाउड इंफ्रास्ट्रक्चर की आवश्यकता के बिना उच्च-गुणवत्ता वाली छवियां बनाने में सक्षम बनाया गया। इससे रचनात्मक अनुप्रयोगों में वृद्धि हुई, अवधारणा कला और चित्रण से लेकर विज्ञापन और गेम डिजाइन तक। मॉडल ने Machine learning में आगे के शोध को भी प्रेरित किया, विशेष रूप से मॉडल संपीड़न और कुशल अनुमान जैसे क्षेत्रों में, क्योंकि डेवलपर्स ने तेजी से मामूली हार्डवेयर पर मॉडल चलाने की मांग की।

Stable Diffusion ने कॉपीराइट, डेटा गोपनीयता, और दुरुपयोग की संभावना के संबंध में महत्वपूर्ण नैतिक और कानूनी प्रश्न भी उठाए। प्रशिक्षण के लिए स्क्रैप किए गए वेब डेटा का उपयोग, जिसमें कॉपीराइट छवियां और व्यक्तिगत जानकारी शामिल है, बहस और मुकदमेबाजी का विषय बन गया। इन चिंताओं ने जनरेटिव मॉडल के विकास में अधिक पारदर्शी और जिम्मेदार डेटा प्रथाओं की आवश्यकता पर चर्चा को प्रेरित किया, जिससे क्षेत्र में बाद के काम प्रभावित हुए।

सीमाएं

Stable Diffusion में गिरावट और कलाकृतियों के साथ समस्याएं हैं, विशेष रूप से जटिल दृश्यों या टेक्स्ट उत्पन्न करते समय। यह शारीरिक सटीकता के साथ संघर्ष कर सकता है, विकृत हाथों या चेहरों वाली छवियां उत्पन्न कर सकता है, और छवियों के भीतर टेक्स्ट को सटीक रूप से प्रस्तुत नहीं कर सकता है। मॉडल का प्रदर्शन अपने प्रशिक्षण डेटा की गुणवत्ता और विविधता पर भी निर्भर है, जो उत्पन्न छवियों में पूर्वाग्रह पैदा कर सकता है। इसके अतिरिक्त, SD 3.0 जैसे बड़े मॉडलों के प्रशिक्षण और फाइन-ट्यूनिंग की कम्प्यूटेशनल लागत महत्वपूर्ण बनी हुई है, जो कुछ शोधकर्ताओं और डेवलपर्स के लिए प्रयोग को सीमित करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-image·deep-learning·open-source
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास