अंग्रेज़ी से अनुवादित

स्टेबल डिफ्यूज़न एक ओपन-सोर्स टेक्स्ट-टू-इमेज मॉडल है, जिसे अगस्त 2022 में स्टेबिलिटी एआई द्वारा जारी किया गया था, और यह लेटेंट डिफ्यूज़न तकनीक पर आधारित है। यह टेक्स्ट प्रॉम्प्ट से विस्तृत छवियाँ उत्पन्न करता है और उपभोक्ता हार्डवेयर पर चलता है, जो स्वामित्व वाले क्लाउड-केवल मॉडल से एक बदलाव को चिह्नित करता है।

Stable Diffusion एक गहन शिक्षण (deep learning), पाठ-से-छवि (text-to-image) मॉडल है जिसे अगस्त 2022 में जारी किया गया था, जो प्रसार तकनीकों (diffusion techniques) पर आधारित है। यह Stability AI का प्रमुख उत्पाद है और इसे चल रहे एआई उछाल का हिस्सा माना जाता है। यह मॉडल पाठ विवरणों के आधार पर विस्तृत छवियाँ उत्पन्न करता है, और यह इनपेंटिंग (inpainting), आउटपेंटिंग (outpainting), और पाठ संकेतों द्वारा निर्देशित छवि-से-छवि अनुवाद जैसे कार्यों का भी समर्थन करता है। इसके विकास में LMU म्यूनिख के CompVis समूह और Runway के शोधकर्ता शामिल थे, जिसमें Stability AI से कम्प्यूटेशनल दान और गैर-लाभकारी संगठनों से प्रशिक्षण डेटा प्राप्त हुआ।

Stable Diffusion एक अव्यक्त प्रसार मॉडल (latent diffusion model) है, जो एक प्रकार का गहन जनरेटिव कृत्रिम तंत्रिका नेटवर्क है। इसका कोड और मॉडल वेट सार्वजनिक रूप से जारी किए गए थे, और एक अनुकूलित संस्करण अधिकांश उपभोक्ता हार्डवेयर पर मामूली GPU के साथ केवल 2.4 GB VRAM का उपयोग करके चलता है। यह DALL-E और Midjourney जैसे स्वामित्व वाले पाठ-से-छवि मॉडलों से अलग था, जो केवल क्लाउड सेवाओं के माध्यम से सुलभ थे, जिसने Stable Diffusion को व्यक्तिगत उपयोगकर्ताओं और शोधकर्ताओं के लिए व्यापक रूप से उपलब्ध कराया।

विकास

Stable Diffusion की उत्पत्ति एक परियोजना से हुई जिसे अव्यक्त प्रसार (latent diffusion) कहा जाता है, जिसे जर्मनी में LMU म्यूनिख और हीडलबर्ग विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित किया गया था। मूल पाँच लेखकों में से चार - रॉबिन रोम्बैक, एंड्रियास ब्लैटमैन, पैट्रिक एसर, और डोमिनिक लोरेंज - बाद में Stability AI में शामिल हुए और बाद के संस्करण जारी किए। तकनीकी लाइसेंस LMU म्यूनिख के CompVis समूह द्वारा जारी किया गया था। विकास का नेतृत्व Runway के पैट्रिक एसर और CompVis के रॉबिन रोम्बैक ने किया, जिन्होंने पहले अव्यक्त प्रसार वास्तुकला का आविष्कार किया था। Stability AI ने EleutherAI और LAION को भी परियोजना समर्थकों के रूप में श्रेय दिया, जो एक जर्मन गैर-लाभकारी संगठन है जिसने प्रशिक्षण डेटासेट तैयार किया।

प्रौद्योगिकी

वास्तुकला

प्रसार मॉडल, जिन्हें 2015 में पेश किया गया था, प्रशिक्षण छवियों पर गाऊसी शोर (Gaussian noise) के क्रमिक अनुप्रयोगों को हटाने के लिए प्रशिक्षित किए जाते हैं, जो डीनॉइज़िंग ऑटोएन्कोडर (denoising autoencoders) के अनुक्रम के रूप में कार्य करते हैं। यह नाम थर्मोडायनामिक प्रसार से आया है, क्योंकि यह तकनीक थर्मोडायनामिक्स से प्रेरित थी। SD 3 से पहले के Stable Diffusion श्रृंखला के मॉडलों ने अव्यक्त प्रसार मॉडल (LDM) नामक एक प्रकार का उपयोग किया, जिसे 2021 में LMU म्यूनिख के CompVis समूह द्वारा विकसित किया गया था।

Stable Diffusion तीन भागों से बना है: एक वैरिएशनल ऑटोएन्कोडर (VAE), एक U-Net, और एक वैकल्पिक पाठ एन्कोडर। VAE एन्कोडर छवियों को पिक्सेल स्थान से छोटे आयामी अव्यक्त स्थान में संपीड़ित करता है, जो अर्थ संबंधी अर्थ को पकड़ता है। गाऊसी शोर को आगे के प्रसार के दौरान संपीड़ित अव्यक्त प्रतिनिधित्व पर पुनरावृत्त रूप से लागू किया जाता है। U-Net ब्लॉक, जो एक ResNet बैकबोन से बना है, आउटपुट को पीछे की ओर डीनॉइज़ करके एक अव्यक्त प्रतिनिधित्व प्राप्त करता है। अंत में, VAE डिकोडर प्रतिनिधित्व को वापस पिक्सेल स्थान में परिवर्तित करके अंतिम छवि उत्पन्न करता है।

डीनॉइज़िंग चरण को पाठ, एक छवि, या किसी अन्य मोडैलिटी द्वारा सशर्त किया जा सकता है। एन्कोडेड कंडीशनिंग डेटा को Cross-Attention तंत्र के माध्यम से डीनॉइज़िंग U-Nets के संपर्क में लाया जाता है। पाठ कंडीशनिंग के लिए, एक निश्चित, पूर्व-प्रशिक्षित CLIP ViT-L/14 पाठ एन्कोडर प्रॉम्प्ट को एक एम्बेडिंग स्थान में बदल देता है। शोधकर्ता प्रशिक्षण और उत्पादन के लिए बढ़ी हुई कम्प्यूटेशनल दक्षता को LDM का लाभ बताते हैं।

U-Net में 860 मिलियन पैरामीटर और पाठ एन्कोडर में 123 मिलियन पैरामीटर के साथ, Stable Diffusion 2022 के मानकों के अनुसार अपेक्षाकृत हल्का है। अन्य प्रसार मॉडलों के विपरीत, यह उपभोक्ता GPUs पर चलता है, और OpenVINO संस्करण के साथ केवल CPU पर भी चलता है।

#### SD XL

XL संस्करण समान LDM वास्तुकला का उपयोग करता है लेकिन बड़ा: एक बड़ा UNet बैकबोन, बड़ा क्रॉस-अटेंशन संदर्भ, एक के बजाय दो पाठ एन्कोडर, और केवल वर्ग के बजाय कई पहलू अनुपातों पर प्रशिक्षण। SD XL Refiner, जो एक साथ जारी किया गया था, समान वास्तुकला रखता है लेकिन पाठ-सशर्त img2img के माध्यम से पहले से मौजूद छवियों में बारीक विवरण जोड़ने के लिए प्रशिक्षित किया गया था।

#### SD 3.0

3.0 संस्करण पूरी तरह से बैकबोन बदल देता है। यह एक रेक्टिफाइड फ्लो ट्रांसफॉर्मर (Rectified Flow Transformer) का उपयोग करता है, जो Transformer (architecture) वास्तुकला के साथ रेक्टिफाइड फ्लो विधि को लागू करता है। वास्तुकला में तीन ट्रैक हैं: मूल पाठ एन्कोडिंग, रूपांतरित पाठ एन्कोडिंग, और अव्यक्त स्थान में छवि एन्कोडिंग। रूपांतरित पाठ एन्कोडिंग और छवि एन्कोडिंग प्रत्येक ट्रांसफॉर्मर ब्लॉक के दौरान मिश्रित होते हैं। इसे "मल्टीमॉडल डिफ्यूजन ट्रांसफॉर्मर (MMDiT)" नाम दिया गया है, जहाँ मल्टीमॉडल का अर्थ है कि यह अपने संचालन के भीतर पाठ और छवि एन्कोडिंग को मिलाता है, पिछले DiT संस्करणों के विपरीत जहाँ पाठ एन्कोडिंग ने छवि एन्कोडिंग को प्रभावित किया लेकिन इसके विपरीत नहीं।

प्रशिक्षण डेटा

Stable Diffusion को LAION-5B से छवि-कैप्शन जोड़ों पर प्रशिक्षित किया गया था, जो कॉमन क्रॉल वेब स्क्रेप्स से प्राप्त एक सार्वजनिक रूप से उपलब्ध डेटासेट है। 5 बिलियन छवि-पाठ जोड़ों को भाषा द्वारा वर्गीकृत किया गया और रिज़ॉल्यूशन, अनुमानित वॉटरमार्क संभावना, और अनुमानित "सौंदर्य" स्कोर द्वारा डेटासेट में फ़िल्टर किया गया। LAION, एक जर्मन गैर-लाभकारी संगठन जिसे Stability AI से वित्त पोषण मिला, ने डेटासेट बनाया। मॉडल को तीन उपसमुच्चयों पर प्रशिक्षित किया गया था: laion2B-en, laion-high-resolution, और laion-aesthetics v2 5+।

12 मिलियन छवियों के एक छोटे उपसमुच्चय के तीसरे पक्ष के विश्लेषण में पाया गया कि लगभग 47% 100 डोमेन से आए, जिसमें Pinterest ने 8.5% लिया, उसके बाद WordPress, Blogspot, Flickr, DeviantArt, और Wikimedia Commons थे। Bayerischer Rundfunk की एक जांच से पता चला कि LAION के डेटासेट, जो Hugging Face पर होस्ट किए गए हैं, में बड़ी मात्रा में निजी और संवेदनशील डेटा शामिल है।

प्रशिक्षण प्रक्रियाएँ

मॉडल को शुरू में laion2B-en और laion-high-resolution पर प्रशिक्षित किया गया था, अंतिम दौर LAION-Aesthetics v2 5+ पर था, जो 600 मिलियन कैप्शन वाली छवियों का एक उपसमुच्चय है जिसके मानव सौंदर्य रेटिंग में कम से कम 5 में से 5 प्राप्त करने की भविष्यवाणी की गई थी। इस उपसमुच्चय ने कम-रिज़ॉल्यूशन छवियों और 80% से ऊपर वॉटरमार्क पहचान संभावना वाली छवियों को बाहर रखा। अंतिम प्रशिक्षण दौर में क्लासिफायर-फ्री डिफ्यूजन गाइडेंस को बेहतर बनाने के लिए पाठ कंडीशनिंग का 10% हटा दिया गया। प्रशिक्षण में अमेज़न वेब सेवाओं पर 256 Nvidia A100 GPUs का उपयोग 150,000 GPU-घंटे के लिए किया गया, जिसकी लागत $600,000 थी।

सीमाएँ

Stable Diffusion में गिरावट और कलाकृतियों (artifacts) की समस्याएँ हैं, विशेष रूप से जटिल दृश्यों, मानव शरीर रचना, और पाठ प्रतिपादन में। यह प्रशिक्षण डेटा से पूर्वाग्रहों को पुन: उत्पन्न कर सकता है, जिसमें रूढ़िवादिता और हानिकारक सामग्री शामिल है। मॉडल हाथों और चेहरों जैसे बारीक विवरणों के साथ संघर्ष करता है, अक्सर विकृत परिणाम उत्पन्न करता है। इसे कई वस्तुओं या विशिष्ट स्थानिक संबंधों से जुड़े रचनात्मक प्रॉम्प्ट के साथ भी कठिनाई होती है। 2024 तक, नए संस्करण कुछ सीमाओं को संबोधित करते हैं लेकिन इन क्षेत्रों में अभी भी चुनौतियों का सामना करते हैं।

प्रभाव और स्वागत

अगस्त 2022 में Stable Diffusion की सार्वजनिक रिलीज़ ने जनरेटिव एआई नैतिकता, कॉपीराइट, और कलात्मक श्रम के बारे में व्यापक चर्चा छेड़ दी। इसकी ओपन-सोर्स प्रकृति ने डेवलपर्स को मशीन लर्निंग प्रयोग, डेटा संवर्धन, और रचनात्मक वर्कफ़्लो के लिए उपकरण बनाने की अनुमति दी। उपभोक्ता हार्डवेयर पर मॉडल की पहुँच ने एआई कला समुदायों और वाणिज्यिक अनुप्रयोगों में वृद्धि में योगदान दिया। Stability AI ने बाद के संस्करण जारी किए, जिनमें 2023 में SD XL और 2024 में SD 3.0 शामिल हैं, प्रत्येक ने गुणवत्ता और क्षमताओं में सुधार किया। मॉडल ने नीति बहसों को भी प्रभावित किया, जिससे एआई विनियमन और सामग्री उत्पत्ति के बारे में चर्चाएँ हुईं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-image·open-source-software·diffusion-models
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास