अंग्रेज़ी से अनुवादित

U-Net एक convolutional neural network आर्किटेक्चर है जो बायोमेडिकल इमेज segmentation के लिए डिज़ाइन किया गया है, जिसमें encoder-decoder संरचना और skip connections शामिल हैं जो सीमित प्रशिक्षण डेटा के साथ सटीक pixel-level classification को सक्षम बनाते हैं।

U-Net एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जिसे छवि विभाजन के लिए विकसित किया गया है, विशेष रूप से बायोमेडिकल संदर्भों में। इसे 2015 में फ्रीबर्ग विश्वविद्यालय में ओलाफ रोनेबर्गर, फिलिप फिशर और थॉमस ब्रोक्स द्वारा पेश किया गया था, जो पहले के पूर्ण रूप से कन्वोल्यूशनल नेटवर्क पर आधारित था। यह आर्किटेक्चर अपने सममित एनकोडर-डिकोडर डिज़ाइन और स्किप कनेक्शन के लिए विशिष्ट है, जो इसे अपेक्षाकृत कम प्रशिक्षण छवियों से सटीक विभाजन मानचित्र उत्पन्न करने की अनुमति देता है। U-Net आर्किटेक्चर का उपयोग करके 512 × 512 छवि का विभाजन आधुनिक (2015) GPU पर एक सेकंड से भी कम समय लेता है।

U-Net आर्किचेक्चर तथाकथित "पूर्ण रूप से कन्वोल्यूशनल नेटवर्क" (FCN) से उत्पन्न हुआ है, जिसे 2014 में इवान शेलहैमर, जोनाथन लॉन्ग और ट्रेवर डैरेल द्वारा विकसित किया गया था। मुख्य विचार एक सामान्य संकुचन नेटवर्क को क्रमिक परतों के साथ पूरक करना है, जहां पूलिंग संचालन को अपसैंपलिंग ऑपरेटरों द्वारा प्रतिस्थापित किया जाता है। इसलिए ये परतें आउटपुट के रिज़ॉल्यूशन को बढ़ाती हैं। एक क्रमिक कन्वोल्यूशनल परत तब इस जानकारी के आधार पर सटीक आउटपुट को इकट्ठा करना सीख सकती है।

नेटवर्क आर्किटेक्चर

नेटवर्क में एक संकुचन पथ और एक विस्तार पथ होता है, जो इसे यू-आकार का आर्किटेक्चर देता है। संकुचन पथ एक विशिष्ट कन्वोल्यूशनल नेटवर्क है जिसमें कन्वोल्यूशन के बार-बार अनुप्रयोग होते हैं, प्रत्येक के बाद एक रेक्टिफाइड लीनियर यूनिट (ReLU) और एक मैक्स पूलिंग ऑपरेशन होता है। संकुचन के दौरान, स्थानिक जानकारी कम हो जाती है जबकि फीचर जानकारी बढ़ जाती है। विस्तार पथ अप-कन्वोल्यूशन और संकुचन पथ से उच्च-रिज़ॉल्यूशन सुविधाओं के साथ संयोजन के अनुक्रम के माध्यम से फीचर और स्थानिक जानकारी को जोड़ता है।

U-Net में एक महत्वपूर्ण संशोधन यह है कि अपसैंपलिंग भाग में बड़ी संख्या में फीचर चैनल होते हैं, जो नेटवर्क को संदर्भ जानकारी को उच्च-रिज़ॉल्यूशन परतों तक प्रसारित करने की अनुमति देते हैं। परिणामस्वरूप, विस्तार पथ संकुचन भाग के लिए कमोबेश सममित होता है, और एक यू-आकार का आर्किटेक्चर उत्पन्न करता है। नेटवर्क केवल प्रत्येक कन्वोल्यूशन के वैध भाग का उपयोग करता है, बिना किसी पूर्ण रूप से जुड़ी परतों के। इसलिए, नेटवर्क को प्रशिक्षित किया जा सकता है और इनपुट रिज़ॉल्यूशन के मिश्रण के साथ चलाया जा सकता है।

छवि के सीमा क्षेत्र में पिक्सेल की भविष्यवाणी करने के लिए, छवि सीमा से परे लापता संदर्भ को छवि सीमाओं पर इनपुट छवि को प्रतिबिंबित करके एक्सट्रपोलेट किया जाता है। मूल U-Net पेपर ने एक टाइलिंग रणनीति का भी सुझाव दिया, जहां बड़ी छवियों को ओवरलैपिंग टाइलों में काटा जाता है जिन्हें स्वतंत्र रूप से संसाधित किया जाता है। यह उच्च-रिज़ॉल्यूशन छवियों के प्रसंस्करण को सक्षम बनाता है जो अन्यथा उपलब्ध GPU मेमोरी से अधिक होती हैं। हाल ही में, चिकित्सा छवि विभाजन के लिए रिसेप्टिव फील्ड आधारित U-Net मॉडल में भी रुचि रही है।

प्रशिक्षण और हानि फलन

U-Net को स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) का उपयोग करके एंड-टू-एंड प्रशिक्षित किया जाता है, जिसमें पिक्सेल-वार हानि फलन होता है, आमतौर पर क्रॉस-एन्ट्रॉपी या एक भारित संस्करण। ऊर्जा फलन की गणना अंतिम फीचर मानचित्र पर पिक्सेल-वार सॉफ्ट-मैक्स और क्रॉस-एन्ट्रॉपी हानि के संयोजन से की जाती है। लेखकों ने एक भार मानचित्र पेश किया जो स्पर्श करने वाली वस्तुओं के बीच की सीमाओं के पास पिक्सेल को अधिक महत्व देता है, जो नेटवर्क को बायोमेडिकल छवियों में व्यक्तिगत उदाहरणों को अलग करना सीखने में मदद करता है। यह भार मानचित्र प्रत्येक प्रशिक्षण छवि के लिए पूर्व-गणना किया जाता है और सीमा क्षेत्रों में त्रुटियों को अधिक भारी रूप से दंडित करने के लिए उपयोग किया जाता है।

नेटवर्क प्रभावी प्रशिक्षण सेट आकार बढ़ाने के लिए डेटा संवर्धन का उपयोग करता है, जिसमें लोचदार विकृतियां, घुमाव और तीव्रता भिन्नताएं शामिल हैं। यह बायोमेडिकल इमेजिंग में विशेष रूप से महत्वपूर्ण है जहां एनोटेटेड डेटा दुर्लभ है। मूल कार्यान्वयन ने स्थिर अभिसरण सुनिश्चित करने के लिए उच्च गति (0.99) और कम सीखने की दर (0.00001) का उपयोग किया।

बायोमेडिकल इमेजिंग में अनुप्रयोग

बायोमेडिकल छवि विभाजन में U-Net के कई अनुप्रयोग हैं, जैसे कंप्यूटेड टोमोग्राफी (CT) और चुंबकीय अनुनाद इमेजिंग (MRI) स्कैन में विभिन्न अंगों और शारीरिक प्रणालियों का विभाजन। विशिष्ट मामलों में मस्तिष्क छवि विभाजन (BRATS) और यकृत छवि विभाजन (siliver07) के साथ-साथ प्रोटीन बाइंडिंग साइट भविष्यवाणी शामिल हैं। U-Net कार्यान्वयन भौतिक विज्ञान में भी उपयोग पाए गए हैं, उदाहरण के लिए सामग्री के माइक्रोग्राफ के विश्लेषण में।

U-Net के विविधताओं को चिकित्सा छवि पुनर्निर्माण के लिए भी लागू किया गया है। यहां U-Net के कुछ विविधताएं और अनुप्रयोग निम्नलिखित हैं:

  • पिक्सेल-वार प्रतिगमन का उपयोग करके U-Net और पैनशार्पनिंग पर इसका अनुप्रयोग।
  • 3D U-Net: स्पार्स एनोटेशन से घने वॉल्यूमेट्रिक विभाजन सीखना।
  • टर्नॉसनेट: छवि विभाजन के लिए ImageNet पर पूर्व-प्रशिक्षित VGG11 एनकोडर के साथ U-Net।
  • फ्लोरोसेंट दागों का अनुमान लगाने के लिए छवि-से-छवि अनुवाद।
  • प्रोटीन संरचना की बाइंडिंग साइट भविष्यवाणी में।

डिफ्यूजन मॉडल में उपयोग

U-Net आर्किटेक्चर को पुनरावृत्त छवि डीनॉइज़िंग के लिए डिफ्यूजन मॉडल में भी नियोजित किया गया है। यह तकनीक कई आधुनिक छवि निर्माण मॉडलों को रेखांकित करती है, जैसे DALL-E, Midjourney और Stable Diffusion। इन मॉडलों में, एक U-Net को डिफ्यूजन प्रक्रिया के प्रत्येक चरण में छवि में जोड़े गए शोर की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जिससे मॉडल धीरे-धीरे एक यादृच्छिक शोर इनपुट को एक सुसंगत छवि में परिष्कृत कर सकता है। U-Net में स्किप कनेक्शन यहां विशेष रूप से फायदेमंद हैं क्योंकि वे डीनॉइज़िंग प्रक्रिया के दौरान उच्च-आवृत्ति विवरण संरक्षित करते हैं।

भाषा मॉडल के लिए अन्वेषण

U-Net को भाषा मॉडल के लिए भी खोजा जा रहा है। टोकनाइज़ेशन एक अलग चरण नहीं है, जिससे मॉडल वर्तनी को अधिक आसानी से समझ सके और साथ ही उच्च-स्तरीय अवधारणाओं को समवर्ती रूप से वेक्टराइज़ / टोकनाइज़ कर सके। यह अनुसंधान का एक उभरता हुआ क्षेत्र है जो U-Net की बहु-पैमाने सुविधाओं को पकड़ने की क्षमता का लाभ उठाता है, संभावित रूप से प्राकृतिक भाषा प्रसंस्करण में प्रमुख ट्रांसफॉर्मर आर्किटेक्चर का एक विकल्प प्रदान करता है।

इतिहास और विरासत

U-Net को 2015 में ओलाफ रोनेबर्गर, फिलिप फिशर और थॉमस ब्रोक्स द्वारा बनाया गया था और पेपर "U-Net: कन्वोल्यूशनल नेटवर्क्स फॉर बायोमेडिकल इमेज सेगमेंटेशन" में रिपोर्ट किया गया था। यह FCN का सुधार और विकास है: इवान शेलहैमर, जोनाथन लॉन्ग, ट्रेवर डैरेल (2014)। "सिमेंटिक विभाजन के लिए पूर्ण रूप से कन्वोल्यूशनल नेटवर्क"। यह पेपर डीप लर्निंग के क्षेत्र में सबसे अधिक उद्धृत में से एक बन गया है, और आर्किटेक्चर को बायोमेडिकल इमेजिंग से परे अनगिनत कार्यों के लिए अनुकूलित किया गया है।

U-Net की सफलता ने कई विविधताओं को प्रेरित किया है, जिसमें विभिन्न एनकोडर (जैसे VGG या ResNet), ध्यान तंत्र और बहु-पैमाने प्रसंस्करण शामिल हैं। इसका प्रभाव मशीन लर्निंग के अन्य क्षेत्रों तक फैला हुआ है, जिसमें जनरेटिव एआई और कंप्यूटर विज़न शामिल हैं। यह आर्किटेक्चर चिकित्सा इमेजिंग चुनौतियों में एक सामान्य आधार रेखा भी है और TensorFlow और PyTorch जैसे फ्रेमवर्क में व्यापक रूप से लागू किया गया है।

कार्यान्वयन

U-Net के कई ओपन-सोर्स कार्यान्वयन उपलब्ध हैं। J Akeret (2017) द्वारा Tensorflow Unet एक लोकप्रिय कार्यान्वयन है। मूल U-Net स्रोत कोड जर्मनी के फ्रीबर्ग विश्वविद्यालय के कंप्यूटर विज्ञान विभाग में पैटर्न पहचान और छवि प्रसंस्करण समूह से उपलब्ध है। इन कार्यान्वयनों ने अनुसंधान और उद्योग दोनों में U-Net के व्यापक रूप से अपनाने की सुविधा प्रदान की है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·computer-vision·biomedical-imaging·neural-network
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास