अंग्रेज़ी से अनुवादित

अगस्त 2022 में Stability AI और शैक्षणिक सहयोगियों द्वारा सार्वजनिक रूप से जारी किया गया एक ओपन-सोर्स लेटेंट डिफ्यूज़न मॉडल, जो टेक्स्ट-टू-इमेज जनरेशन के लिए है। इसकी खुलापन सामुदायिक फाइन-ट्यून्स और रचनात्मक उपकरणों के एक बड़े पारिस्थितिकी तंत्र के लिए उत्प्रेरक बना।

Stable Diffusion एक Text-to-image generation पीढ़ी मॉडल है जिसे 22 अगस्त 2022 को सार्वजनिक रूप से जारी किया गया था, जिसे लुडविग मैक्सिमिलियन यूनिवर्सिटी म्यूनिख में CompVis समूह के शोधकर्ताओं द्वारा Stability AI और Runway के सहयोग से विकसित किया गया था, जो अव्यक्त विसरण मॉडल पर पूर्व शैक्षणिक कार्य पर आधारित था। इसका ओपन-वेट्स मॉडल के रूप में जारी होना, बंद प्रतिस्पर्धियों के विपरीत, इसे मुख्यधारा जनरेटिव छवि AI के प्रारंभिक इतिहास में सबसे महत्वपूर्ण रिलीज़ में से एक बना दिया।

तकनीकी दृष्टिकोण

Stable Diffusion विसरण मॉडल तकनीक पर आधारित है, जो क्रमिक शोर प्रक्रिया को उलटना सीखती है, लेकिन विशिष्ट रूप से यह प्रक्रिया पिक्सेल पर सीधे करने के बजाय एक संपीड़ित अव्यक्त स्थान में करती है, यह दृष्टिकोण Robin Rombach द्वारा सह-लेखित "High-Resolution Image Synthesis with Latent Diffusion Models" पेपर में वर्णित है। अव्यक्त स्थान में संचालन ने पिक्सेल-स्थान विसरण की तुलना में मॉडल के प्रशिक्षण और चलाने की कम्प्यूटेशनल लागत को काफी कम कर दिया, जिससे इसे एकल उपभोक्ता GPU पर चलाना व्यावहारिक हो गया, जो इसके तेजी से अपनाने का एक प्रमुख कारक था। CLIP से प्राप्त एक टेक्स्ट एनकोडर का उपयोग करके टेक्स्ट कंडीशनिंग प्रदान की गई थी, जिससे मॉडल प्राकृतिक-भाषा प्रॉम्प्ट से मेल खाती छवियां उत्पन्न कर सके।

रिलीज़ और खुलापन

Stability AI, जिसका नेतृत्व उस समय Emad Mostaque कर रहे थे, ने प्रशिक्षण के लिए कम्प्यूटेशनल संसाधनों का वित्तपोषण किया और मॉडल के वेट्स को एक अनुमेय लाइसेंस (CreativeML Open RAIL-M) के तहत सार्वजनिक रूप से जारी किया, साथ ही ऐसा कोड भी जिसे कोई भी स्थानीय रूप से चला सकता था। यह OpenAI के DALL-E और बाद में Midjourney द्वारा अपनाए गए बंद-API दृष्टिकोण के विपरीत एक जानबूझकर अंतर था। प्रशिक्षण डेटा काफी हद तक गैर-लाभकारी LAION द्वारा संकलित LAION-5B डेटासेट से लिया गया था, जो वेब से स्क्रैप किए गए छवि-टेक्स्ट जोड़ों का एक बड़ा संग्रह है, जो बाद में कॉपीराइट और, एक छोटे उपसमुच्चय में, अवैध सामग्री पर विवाद का स्रोत बन गया, जिसे LAION ने पहचानने और हटाने का काम किया।

पारिस्थितिकी तंत्र

Stable Diffusion के खुले रिलीज़ ने असामान्य रूप से बड़ा और तेजी से विकसित होने वाला सामुदायिक पारिस्थितिकी तंत्र शुरू किया। महीनों के भीतर, डेवलपर्स ने कस्टम यूज़र इंटरफेस, एक्सटेंशन और प्रशिक्षण पाइपलाइन बनाई, और खुले लाइसेंस ने सामुदायिक-प्रशिक्षित चेकपॉइंट्स और शैली-विशिष्ट फाइन-ट्यून्स की एक लहर को सक्षम किया, जो हगिंग फेस और Civitai जैसे प्लेटफार्मों पर वितरित किए गए। LoRA एडेप्टर और ControlNet जैसी तकनीकें, जो पोज़, किनारों और डेप्थ मैप्स पर सटीक कंडीशनिंग की अनुमति देती हैं, समुदाय द्वारा विकसित की गईं और जल्दी से मुख्यधारा के वर्कफ्लो में शामिल हो गईं, जिससे मॉडल की व्यावहारिक क्षमताएं इसके मूल रिलीज़ से कहीं आगे बढ़ गईं। क्रमिक आधिकारिक संस्करणों (SD 2.0, SDXL, SD3) ने छवि गुणवत्ता और प्रॉम्प्ट पालन में सुधार किया, हालांकि कुछ अपडेट, विशेष रूप से SD 2.0 का अधिक प्रतिबंधात्मक प्रशिक्षण डेटा फ़िल्टरिंग, ने कुछ क्षमताओं को कम करने के लिए समुदाय से प्रतिक्रिया प्राप्त की।

स्वागत और प्रभाव

Stable Diffusion को उच्च-गुणवत्ता वाली छवि पीढ़ी तक पहुंच को लोकतांत्रिक बनाने और AI और कॉपीराइट पर सार्वजनिक बहस को तेज करने का श्रेय व्यापक रूप से दिया जाता है, क्योंकि इसकी स्थानीय रूप से चलने की क्षमता ने इसे API-गेटेड प्रतिस्पर्धियों की तुलना में पुलिस करना कहीं अधिक कठिन बना दिया। इसने प्रशिक्षण डेटा सहमति की जांच को भी तेज किया, जिससे कलाकारों और Getty Images सहित स्टॉक-छवि कंपनियों से मुकदमे आए। Stability AI की अपनी वाणिज्यिक स्थिति उथल-पुथल भरी साबित हुई, Mostaque 2024 में फंडिंग दबाव के बीच CEO के रूप में बाहर हो गए, जबकि अंतर्निहित मॉडल और इसके खुले व्युत्पन्न व्यापक रूप से उपयोग में बने रहे और FLUX जैसे बाद के खुले प्रवेशकों के सापेक्ष प्रभावशाली बने रहे।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·image-generation·open-weights
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास