अंग्रेज़ी से अनुवादित

U-Net एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जिसे बायोमेडिकल छवि विभाजन के लिए विकसित किया गया है, जिसमें स्किप कनेक्शन के साथ एन्कोडर-डिकोडर संरचना शामिल है। इसे 2015 में पेश किया गया था और यह चिकित्सा इमेजिंग और जनरेटिव AI डिफ्यूजन मॉडल में व्यापक रूप से उपयोग किया जाने लगा है।

U-Net एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जिसे छवि विभाजन (image segmentation) के लिए विकसित किया गया था, विशेष रूप से बायोमेडिकल संदर्भों में। इसे 2015 में जर्मनी के फ्रीबर्ग विश्वविद्यालय में ओलाफ रोनबर्गर, फिलिप फिशर और थॉमस ब्रोक्स द्वारा प्रस्तुत किया गया था। यह आर्किटेक्चर पूर्ण रूप से कन्वोल्यूशनल नेटवर्क (FCN) का संशोधन और विस्तार है, जिसे 2014 में इवान शेलहैमर, जोनाथन लॉन्ग और ट्रेवर डैरेल ने सिमेंटिक विभाजन के लिए प्रस्तावित किया था। U-Net को कम प्रशिक्षण छवियों के साथ प्रभावी ढंग से काम करने और अधिक सटीक विभाजन परिणाम उत्पन्न करने के लिए डिज़ाइन किया गया था। इस क्षमता ने इसे चिकित्सा इमेजिंग में व्यापक रूप से अपनाया और बाद में जनरेटिव आर्टिफिशियल इंटेलिजेंस सिस्टम में प्रभावशाली बनाया।

नेटवर्क एक संकुचन पथ (contracting path) के सिद्धांत पर काम करता है जिसके बाद एक विस्तार पथ (expansive path) होता है, जिससे एक यू-आकार की आर्किटेक्चर बनती है जो मॉडल को इसका नाम देती है। संकुचन पथ (एनकोडर) स्थानिक रिज़ॉल्यूशन को कम करते हुए फीचर मैप्स बढ़ाने के लिए बार-बार कन्वोल्यूशन, रेक्टिफाइड लीनियर यूनिट (ReLU) सक्रियण और मैक्स पूलिंग संचालन लागू करता है। विस्तार पथ (डिकोडर) स्थानिक आयामों को बहाल करने के लिए अपसैंपलिंग और अप-कन्वोल्यूशन का उपयोग करता है, जिसमें स्किप कनेक्शन एनकोडर से उच्च-रिज़ॉल्यूशन फीचर मैप्स को संबंधित डिकोडर परतों से जोड़ते हैं। यह डिज़ाइन नेटवर्क को मोटे सिमेंटिक जानकारी को बारीक स्थानिक विवरणों के साथ संयोजित करने की अनुमति देता है, जिससे सटीक पिक्सेल-वार भविष्यवाणियाँ प्राप्त होती हैं। आर्किटेक्चर बिना किसी पूर्ण रूप से जुड़ी परतों के केवल वैध कन्वोल्यूशन संचालन का उपयोग करता है, इसलिए यह विभिन्न आकारों की इनपुट छवियों को संभाल सकता है। सीमा क्षेत्रों को संभालने के लिए, इनपुट छवियों को सीमाओं पर मिररिंग द्वारा एक्सट्रपोलेट किया जाता है, और बड़ी छवियों के लिए एक टाइलिंग रणनीति उन्हें ओवरलैपिंग टाइलों में विभाजित करती है जिन्हें GPU मेमोरी बाधाओं को दूर करने के लिए स्वतंत्र रूप से संसाधित किया जाता है।

उत्पत्ति और डिज़ाइन प्रेरणा

U-Net को पहली बार 2015 में इंटरनेशनल कॉन्फ्रेंस ऑन मेडिकल इमेज कंप्यूटिंग एंड कंप्यूटर-असिस्टेड इंटरवेंशन में पेपर "U-Net: Convolutional Networks for Biomedical Image Segmentation" में प्रस्तुत किया गया था। लेखकों ने पहचाना कि विभाजन के लिए पिछले कन्वोल्यूशनल नेटवर्क को बड़े प्रशिक्षण डेटासेट की आवश्यकता होती थी, जो अक्सर बायोमेडिकल कार्यों के लिए उपलब्ध नहीं होते थे जहाँ विशेषज्ञ एनोटेशन दुर्लभ होता है। उनका मुख्य नवाचार संकुचन नेटवर्क को क्रमिक परतों के साथ पूरक करना था जहाँ पूलिंग संचालन को अपसैंपलिंग ऑपरेटरों द्वारा प्रतिस्थापित किया गया था। यह नेटवर्क को उच्च-स्तरीय संदर्भ और निम्न-स्तरीय विवरणों दोनों के आधार पर सटीक आउटपुट बनाना सीखने की अनुमति देता है। पेपर ने प्रदर्शित किया कि आर्किटेक्चर समकालीन (2015) GPU पर एक सेकंड से कम समय में 512 बाय 512 छवि का विभाजन सक्षम बनाता है।

नेटवर्क के विस्तार पथ में बड़ी संख्या में फीचर चैनल होते हैं, जो उच्च-रिज़ॉल्यूशन परतों में संदर्भ प्रसार को सक्षम बनाता है। परिणामी पथ संकुचन पथ के साथ लगभग सममित होता है। मूल कार्यान्वयन इस यू-आकार की संरचना के साथ डिज़ाइन किया गया था और इसमें सीमाओं पर इनपुट को मिरर करके सीमा क्षेत्रों में लापता संदर्भ का एक्सट्रपोलेशन शामिल था। यह नेटवर्क को सटीकता खोए बिना छवि किनारों के पास पिक्सेल की भविष्यवाणी करने की अनुमति देता था। इसके अलावा, टाइलिंग रणनीति उच्च-रिज़ॉल्यूशन छवियों को संसाधित करने में सक्षम बनाती थी क्योंकि व्यक्तिगत टाइलों का आकार GPU मेमोरी के अनुसार समायोजित किया जा सकता था।

बायोमेडिकल छवि विभाजन में उपयोग

U-Net बायोमेडिकल छवि विभाजन के लिए एक मानक उपकरण बन गया, जिसे कंप्यूटेड टोमोग्राफी (CT) और चुंबकीय अनुनाद इमेजिंग (MRI) स्कैन पर लागू किया गया। इसका उपयोग विभिन्न अंगों और शारीरिक प्रणालियों के विभाजन के लिए किया गया है, जिसमें BraTS चैलेंज के भीतर मस्तिष्क छवि विभाजन और 'siliver07' डेटासेट में यकृत विभाजन शामिल है। विधि का उपयोग प्रोटीन बाइंडिंग साइट भविष्यवाणी के लिए भी किया गया है, जहाँ प्रोटीन संरचनाओं पर विशिष्ट क्षेत्रों की पहचान की जाती है। इसकी सफलता सटीक और घने विभाजन मानचित्र उत्पन्न करने की क्षमता से उपजी है, जबकि विकल्पों की तुलना में कम प्रशिक्षण डेटा की आवश्यकता होती है। 2025 तक, इसके वेरिएंट आधुनिक चिकित्सा छवि विश्लेषण कार्यों के लिए उपयोग में जारी हैं।

वेरिएंट और विस्तार

U-Net आर्किटेक्चर ने विभिन्न कार्यों के लिए अनुकूलित कई वेरिएंट देखे हैं। 3D U-Net, जो 2016 में प्रस्तावित किया गया था, 3D आकार विभाजन के लिए विरल एनोटेशन के साथ वॉल्यूमेट्रिक डेटा तक आर्किटेक्चर का विस्तार करता है। TernausNet एक पूर्व-प्रशिक्षित VGG11 एनकोडर को U-Net में शामिल करता है, जो ऑब्जेक्ट डिटेक्शन और सिमेंटिक विभाजन जैसे कार्यों पर विभाजन प्रदर्शन में सुधार करता है। एक अन्य कार्यान्वयन, J Akeret का TensorFlow U-Net (2017), फ्रेमवर्क के पार आर्किटेक्चर की पोर्टेबिलिटी दिखाता है। पिक्सेल-वार रिग्रेशन U-Net को उपग्रह इमेजरी के पैनशार्पनिंग पर लागू किया गया है, और छवि-से-छवि अनुवाद माइक्रोस्कोप छवियों में फ्लोरोसेंट दागों का अनुमान लगाने के लिए U-Net वेरिएंट का उपयोग करता है। इसके अतिरिक्त, रिसेप्टिव-फील्ड-आधारित U-Net मॉडल ने चिकित्सा विभाजन के लिए रुचि प्राप्त की है, जो बेहतर सटीकता के लिए रिसेप्टिव फील्ड के आकार को समायोजित करने पर केंद्रित है।

जनरेटिव मॉडल में U-Net

U-Net आर्किटेक्चर डिफ्यूजन मॉडल के विकास में महत्वपूर्ण रहा है, जो पुनरावृत्त छवि डीनॉइज़िंग के लिए व्यापक रूप से उपयोग किए जाते हैं। ये विधियाँ DALL-E, Midjourney और Stable Diffusion जैसे आधुनिक छवि निर्माण मॉडल की नींव बनाती हैं। डिफ्यूजन मॉडल में, U-Net का उपयोग आमतौर पर रिवर्स डिफ्यूजन प्रक्रिया के प्रत्येक चरण में शोर की भविष्यवाणी करने के लिए किया जाता है, जो गॉसियन शोर से छवि को पुनरावृत्त रूप से परिष्कृत करता है। वजन स्किप कनेक्शन के कारण बड़े पैमाने पर संदर्भ को पकड़ते हुए उच्च-रिज़ॉल्यूशन विवरणों को संरक्षित करने की इसकी क्षमता इस कार्य के लिए आदर्श है। चूंकि स्टेबल डिफ्यूजन एक व्यापक रूप से ज्ञात अनुप्रयोग बन गया है, U-Net अब बायोमेडिकल इमेजिंग से परे जनरेटिव AI में एक मुख्य बिल्डिंग ब्लॉक के रूप में पहचाना जाता है। इसने चिकित्सा डोमेन के बाहर इसकी प्रासंगिकता बढ़ा दी है।

भाषा और विज़न में अन्वेषण

छवि प्रसंस्करण में इसकी सफलता के आधार पर, शोधकर्ताओं ने U-Net आर्किटेक्चर को भाषा मॉडल और अन्य AI अनुप्रयोगों के लिए अनुकूलित करने की खोज की है। भाषा के लिए, एक दिशा मॉडल में टोकनाइज़ेशन को एकीकृत करना है, बजाय एक अलग पूर्व-गणना चरण के। यह मॉडल को वर्तनी को अधिक आसानी से समझने और साथ ही उच्च-स्तरीय अवधारणाओं को वेक्टराइज़ करने की अनुमति देता है। 2020 के दशक की शुरुआत तक, प्राकृतिक भाषा प्रसंस्करण के लिए U-Net का उपयोग करने का विचार प्रयोगात्मक बना हुआ है और अभी तक Transformer (architecture) या Large language model आर्किटेक्चर जैसे उत्पादन प्रणालियों में व्यापक रूप से नहीं है। मोटे और बारीक फीचर्स को संयोजित करने का आर्किटेक्चर का पैटर्न उन कार्यों के लिए उपयोगी हो सकता है जिन्हें विभाजन-जैसे आउटपुट की आवश्यकता होती है, लेकिन भाषा में इसका अपनाना सीमित रहता है। यह मल्टीमॉडल अनुप्रयोगों में उपयोग पा सकता है, जैसे भाषा को छवियों से जोड़ना।

कम्प्यूटेशनल दक्षता और व्यावहारिक उपयोग

U-Net का डिज़ाइन कम्प्यूटेशनल दक्षता का समर्थन करता है। संकुचन पथ शुरू में डाउनसैंपलिंग के माध्यम से गणनाओं को कम करता है, जबकि विस्तार पथ केवल फीचर चैनलों का एक हिस्सा जोड़ता है। चूंकि इसमें कोई पूर्ण रूप से जुड़ी परतें नहीं हैं और केवल कन्वोल्यूशन संचालन का उपयोग होता है, इसे विभिन्न हार्डवेयर पर प्रशिक्षित किया जा सकता है। 2015 की रिपोर्ट कि 512 x 512 छवि को लगभग एक सेकंड से कम समय में संसाधित किया जा सकता है, उस समय उल्लेखनीय थी। TensorFlow जैसे फ्रेमवर्क में आधुनिक कार्यान्वयन ने और अनुकूलन किया है। U-Net का प्रदर्शन अक्सर बेहतर आरंभीकरण के लिए पूर्व-प्रशिक्षित एनकोडर (देखें transfer learning) के उपयोग से लाभान्वित होता है। आर्किटेक्चर की मेमोरी उपयोग को टाइलिंग के साथ प्रबंधित किया जा सकता है, और इसकी लचीलापन इसे बड़े GPU क्लस्टर के बिना शोधकर्ताओं के लिए सुलभ बनाती है।

प्रभाव और विरासत

U-Net को कंप्यूटर विज़न में एक मौलिक मॉडल माना जाता है, विशेष रूप से विभाजन कार्यों के लिए। इसकी सफलता ने शैक्षणिक अनुसंधान और वाणिज्यिक अनुप्रयोगों दोनों में कई अनुवर्ती कार्यों को प्रेरित किया है। आर्किटेक्चर ने बाद में स्वायत्त ड्राइविंग, उपग्रह इमेजरी और सामग्री विज्ञान जैसे डोमेन में छवि विभाजन को प्रभावित किया। डिफ्यूजन मॉडल तक इसका विस्तार AI छवि निर्माण पर इसके प्रभाव को व्यापक बनाया है। मूल पेपर का दुनिया भर के हजारों शोधकर्ताओं द्वारा उद्धरण के साथ बहुत बड़ा प्रभाव रहा है, और स्रोत कोड फ्रीबर्ग विश्वविद्यालय के पैटर्न रिकग्निशन और इमेज प्रोसेसिंग समूह से सार्वजनिक रूप से उपलब्ध है। U-Net इस बात का प्रमाण है कि एक अच्छी तरह से डिज़ाइन किया गया, अपेक्षाकृत सरल मॉडल व्यापक प्रभाव कैसे डाल सकता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:neural-networks·convolutional-networks·image-segmentation·biomedical-imaging
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास