अंग्रेज़ी से अनुवादित

2023 में पेश की गई एक तंत्रिका नेटवर्क वास्तुकला, जो पूर्व-प्रशिक्षित टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल में सूक्ष्म-स्तरीय सशर्त नियंत्रण जोड़ती है, जिससे उपयोगकर्ता मुद्राओं, किनारे के नक्शे, गहराई के नक्शे या रेखाचित्रों के साथ निर्माण का मार्गदर्शन कर सकते हैं।

ControlNet एक तंत्रिका नेटवर्क वास्तुकला है जो पूर्व-प्रशिक्षित Text-to-image generation diffusion models जैसे Stable Diffusion में स्थानिक कंडीशनिंग जोड़ती है। फरवरी 2023 में स्टैनफोर्ड विश्वविद्यालय में लवमिन झांग, अन्यि राव और मनीष अग्रवाल द्वारा प्रकाशित एक पेपर में पेश किया गया, इसने उपयोगकर्ताओं को एक सहायक इनपुट जैसे मानव पोज़ कंकाल, कैनी एज मैप, डेप्थ मैप, या एक मोटा स्केच, एक टेक्स्ट Prompt के साथ प्रदान करके उत्पन्न छवि की संरचना को नियंत्रित करने की अनुमति दी, न कि केवल इसकी सामग्री को। ControlNet से पहले, diffusion models ने रचना पर केवल अप्रत्यक्ष नियंत्रण की पेशकश की थी, जो प्रॉम्प्ट शब्दों और बीज चयन के माध्यम से था; ControlNet ने संरचनात्मक नियंत्रण को प्रत्यक्ष और विश्वसनीय बना दिया।

आर्किटेक्चर

ControlNet एक पूर्व-प्रशिक्षित diffusion model की एन्कोडिंग परतों के वजन को एक प्रशिक्षण योग्य प्रति में क्लोन करके काम करता है, जबकि मूल मॉडल के वजन को स्थिर रखता है। प्रशिक्षण योग्य प्रति को कंडीशनिंग छवि खिलाई जाती है और "शून्य कनवल्शन" परतों के माध्यम से स्थिर नेटवर्क से वापस जोड़ा जाता है, जो शून्य वजन के साथ आरंभिक कनवल्शनल परतें हैं, ताकि प्रशिक्षण की शुरुआत में, जोड़ी गई शाखा का आधार मॉडल के आउटपुट पर कोई प्रभाव न पड़े। प्रशिक्षण तब धीरे-धीरे नेटवर्क को कंडीशनिंग सिग्नल का सम्मान करना सिखाता है, बिना आधार मॉडल ने अपने बहुत बड़े पूर्व-प्रशिक्षण सेट से जो सीखा है उसे विनाशकारी रूप से भूलने के बिना। क्योंकि आधार मॉडल स्थिर रहता है, एक एकल ControlNet मॉड्यूल को अपेक्षाकृत छोटे, कार्य-विशिष्ट डेटासेट पर प्रशिक्षित किया जा सकता है, जबकि अंतर्निहित diffusion model की पूर्ण उत्पादक क्षमता विरासत में मिलती है। कई ControlNet मॉड्यूल, प्रत्येक विभिन्न प्रकार की कंडीशनिंग के लिए विशेषीकृत, यौगिक संरचनात्मक नियंत्रण के लिए भी संयुक्त किए जा सकते हैं।

कंडीशनिंग प्रकार

ControlNet को कई कंडीशनिंग मोड के समर्थन के साथ जारी किया गया था, प्रत्येक को अपने स्वयं के प्रशिक्षित मॉड्यूल की आवश्यकता होती है: मानव पोज़ नियंत्रण के लिए OpenPose कंकाल, रूपरेखा-आधारित नियंत्रण के लिए कैनी एज डिटेक्शन, स्थानिक लेआउट नियंत्रण के लिए डेप्थ मैप, वास्तुशिल्प और आंतरिक दृश्यों के लिए हफ लाइन डिटेक्शन, अर्थपूर्ण विभाजन मैप, सामान्य मैप, और मोटे रचनात्मक मार्गदर्शन के लिए स्क्रिबल या स्केच इनपुट। इस विविधता ने ControlNet को विभिन्न वर्कफ़्लोज़ में उपयोगी बना दिया, चित्रों की एक श्रृंखला में पात्रों को लगातार पोज़ देने से लेकर एक मोटे डूडल को एक तैयार छवि में परिवर्तित करने तक, जबकि कलाकार के इच्छित लेआउट को संरक्षित किया जाता है।

अपनाना और प्रभाव

ControlNet को स्टेबल डिफ्यूजन 1.5 के साथ संगत पूर्व-प्रशिक्षित वजन के साथ ओपन-सोर्स कोड के रूप में जारी किया गया था, और इसे Hugging Face-संबंधित ओपन-सोर्स छवि-निर्माण समुदाय द्वारा तेजी से अपनाया गया, जो Automatic1111 के स्टेबल डिफ्यूजन WebUI और ComfyUI जैसे इंटरफेस का एक मानक घटक बन गया। इसका आगमन अक्सर diffusion models के व्यावहारिक, उत्पादन-उन्मुख उपयोग के लिए एक महत्वपूर्ण मोड़ के रूप में उद्धृत किया जाता है, क्योंकि इसने मुख्य शिकायत को संबोधित किया कि टेक्स्ट प्रॉम्प्ट अकेले कलाकारों और डिजाइनरों को रचना पर बहुत कम नियंत्रण देते थे। ControlNet-शैली की कंडीशनिंग को बाद में नए आधार मॉडलों के लिए फिर से लागू और विस्तारित किया गया, जिसमें स्टेबल डिफ्यूजन XL शामिल है, और प्रभावित किया कि कैसे बाद की वाणिज्यिक प्रणालियों जैसे Midjourney और FLUX ने संरचनात्मक मार्गदर्शन को अपनाया, भले ही उन प्रणालियों ने विभिन्न अंतर्निहित तंत्रों का उपयोग किया हो।

स्वागत

ControlNet को Computer vision और जनरेटिव-एआई अनुसंधान समुदाय के भीतर व्यापक रूप से एक महत्वपूर्ण, कम लागत वाली विधि के रूप में माना गया, जो पूर्ण पुनर्प्रशिक्षण के बिना एक मौजूदा Foundation model की क्षमताओं का विस्तार करती है, और इसकी शून्य-कनवल्शन तकनीक ने बाद में कुशल कंडीशनिंग और एडाप्टर विधियों पर काम को व्यापक रूप से प्रभावित किया। इसे नियंत्रणीय पीढ़ी पर बाद के अनुसंधान में एक संदर्भ बिंदु के रूप में व्यापक रूप से उद्धृत किया गया है, दोनों छवियों के लिए और बाद में, Text-to-video generation प्रणालियों के लिए, जिन्हें टेक्स्ट प्रॉम्प्ट अकेले निर्दिष्ट कर सकते हैं उससे परे संरचनात्मक और अस्थायी नियंत्रण की समान आवश्यकता का सामना करना पड़ता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·image-generation·computer-vision
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास