U-Net एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर है जिसे छवि विभाजन (image segmentation) के लिए डिज़ाइन किया गया है, जिसे 2015 में ओलाफ रोनेबर्गर, फिलिप फिशर और थॉमस ब्रोक्स द्वारा प्रस्तुत किया गया था। यह आर्किटेक्चर एक सममित एनकोडर-डिकोडर संरचना को स्किप कनेक्शन के साथ प्रदर्शित करता है, जो संदर्भात्मक जानकारी को संरक्षित करते हुए सटीक स्थानीयकरण को सक्षम बनाता है। U-Net मूल रूप से बायोमेडिकल छवि विभाजन के लिए विकसित किया गया था, लेकिन तब से इसे कंप्यूटर विज़न और जनरेटिव मॉडलिंग सहित विभिन्न क्षेत्रों में व्यापक रूप से अपनाया गया है। इसके डिज़ाइन ने कई बाद के आर्किटेक्चर को प्रभावित किया है और यह विभाजन कार्यों में एक बेंचमार्क बना हुआ है।
आर्किटेक्चर
U-Net आर्किटेक्चर में दो मुख्य पथ होते हैं: एक संकुचन पथ (एनकोडर) और एक विस्तार पथ (डिकोडर), जो मिलकर एक U-आकार की संरचना बनाते हैं। संकुचन पथ एक कन्वोल्यूशनल नेटवर्क के विशिष्ट लेआउट का अनुसरण करता है, जिसमें दो 3x3 कन्वोल्यूशन के बार-बार अनुप्रयोग होते हैं, प्रत्येक के बाद एक रेक्टिफाइड लीनियर यूनिट (ReLU) और स्ट्राइड 2 के साथ एक 2x2 मैक्स पूलिंग ऑपरेशन डाउनसैंपलिंग के लिए होता है। प्रत्येक डाउनसैंपलिंग चरण पर, फीचर चैनलों की संख्या दोगुनी हो जाती है, जिससे नेटवर्क स्थानिक रिज़ॉल्यूशन को कम करते हुए तेजी से अमूर्त फीचर प्राप्त कर सकता है।
इसके विपरीत, विस्तार पथ फीचर मैप का अपसैंपलिंग करता है, जिसके बाद एक 2x2 कन्वोल्यूशन होता है जो फीचर चैनलों की संख्या को आधा कर देता है। फिर इसे संकुचन पथ से संबंधित रूप से क्रॉप किए गए फीचर मैप के साथ जोड़ा जाता है, जिससे स्किप कनेक्शन बनते हैं। यह संयोजन एनकोडर से उच्च-रिज़ॉल्यूशन फीचर को अपसैंपल किए गए डिकोडर फीचर के साथ जोड़ता है, जिससे सटीक स्थानीयकरण संभव होता है। फिर दो 3x3 कन्वोल्यूशन लागू किए जाते हैं, प्रत्येक के बाद एक ReLU होता है। अंतिम परत पर, एक 1x1 कन्वोल्यूशन फीचर वेक्टर को वांछित संख्या में कक्षाओं में मैप करता है।
U-Net में एक प्रमुख संशोधन अपसैंपलिंग भाग में फीचर चैनलों की बड़ी संख्या है, जो नेटवर्क को संदर्भ जानकारी को उच्च-रिज़ॉल्यूशन परतों तक प्रसारित करने की अनुमति देता है। विस्तार पथ संकुचन पथ के लिए कमोबेश सममित है, जिसके परिणामस्वरूप विशिष्ट U-आकार की वास्तुकला बनती है। नेटवर्क केवल प्रत्येक कन्वोल्यूशन के वैध भाग का उपयोग करता है, जिसका अर्थ है कि कोई पैडिंग लागू नहीं की जाती है, जिससे प्रत्येक चरण पर स्थानिक आयामों में थोड़ी कमी आती है। सीमा क्षेत्रों को संभालने के लिए, लापता संदर्भ को सीमाओं पर इनपुट छवि को प्रतिबिंबित करके एक्सट्रपोलेट किया जाता है। मूल पेपर ने बड़ी छवियों के लिए एक टाइलिंग रणनीति भी सुझाई थी, जहां ओवरलैपिंग टाइलों को स्वतंत्र रूप से संसाधित किया जाता है और फिर एक साथ जोड़ा जाता है, जिससे उच्च-रिज़ॉल्यूशन छवियों को संभालना संभव हो जाता है जो अन्यथा GPU मेमोरी से अधिक हो जाती हैं।
प्रशिक्षण और डेटा संवर्धन
U-Net को स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग करके प्रशिक्षित किया जाता है, जिसमें एक हानि फ़ंक्शन होता है जो क्रॉस-एन्ट्रॉपी को सीमा पिक्सेल पर जोर देने के लिए एक भार योजना के साथ जोड़ता है। भार मानचित्र को एक ही वर्ग की स्पर्श करने वाली वस्तुओं को अलग करने के लिए पूर्व-गणना की जाती है, जो विशेष रूप से बायोमेडिकल विभाजन में उपयोगी है जहां कोशिकाएं अक्सर ओवरलैप होती हैं। प्रभावी प्रशिक्षण सेट आकार बढ़ाने के लिए डेटा संवर्धन का उपयोग किया जाता है, जिसमें लोचदार विकृतियां और घुमाव शामिल हैं, जो विशेष रूप से बायोमेडिकल छवियों के लिए प्रासंगिक हैं जहां ऐसी विविधताएं आम हैं। यह दृष्टिकोण U-Net को अपेक्षाकृत कम प्रशिक्षण नमूनों के साथ भी उच्च सटीकता प्राप्त करने की अनुमति देता है, जैसा कि मूल पेपर में इलेक्ट्रॉन माइक्रोस्कोपी छवियों में तंत्रिका संरचनाओं के विभाजन के साथ प्रदर्शित किया गया था।
अनुप्रयोग
U-Net को बायोमेडिकल छवि विभाजन में व्यापक रूप से लागू किया गया है, जिसमें कंप्यूटेड टोमोग्राफी (CT) और चुंबकीय अनुनाद इमेजिंग (MRI) स्कैन में अंगों और शारीरिक प्रणालियों का विभाजन शामिल है। विशिष्ट उदाहरणों में BRATS चुनौती में मस्तिष्क छवि विभाजन और यकृत विभाजन शामिल हैं। बायोमेडिकल इमेजिंग से परे, U-Net का उपयोग पैनशार्पनिंग में पिक्सेल-वार प्रतिगमन जैसे कार्यों के लिए किया गया है, जहां यह मल्टीस्पेक्ट्रल उपग्रह छवियों के स्थानिक रिज़ॉल्यूशन को बढ़ाता है। इसका उपयोग भौतिक विज्ञान में सामग्री के माइक्रोग्राफ के विश्लेषण में भी किया गया है। चिकित्सा छवि पुनर्निर्माण के लिए U-Net की विविधताएं विकसित की गई हैं, और आर्किटेक्चर को 3D डेटा के लिए अनुकूलित किया गया है, जैसे कि विरल एनोटेशन से वॉल्यूमेट्रिक विभाजन के लिए 3D U-Net। एक और उल्लेखनीय संस्करण TernausNet है, जो विभाजन कार्यों पर प्रदर्शन में सुधार के लिए ImageNet पर पूर्व-प्रशिक्षित VGG11 एनकोडर का उपयोग करता है।
जनरेटिव मॉडल पर प्रभाव
U-Net आर्किटेक्चर ने जनरेटिव मॉडल, विशेष रूप से डिफ्यूजन मॉडल में भी महत्वपूर्ण उपयोग पाया है। इन मॉडलों में, U-Net पुनरावृत्त छवि डीनॉइज़िंग के लिए बैकबोन के रूप में कार्य करता है, जहां यह डिफ्यूजन प्रक्रिया के प्रत्येक चरण में छवि में जोड़े गए शोर की भविष्यवाणी करना सीखता है। यह तकनीक DALL-E, Midjourney और Stable Diffusion सहित कई आधुनिक छवि निर्माण प्रणालियों को रेखांकित करती है। बारीक विवरणों को संरक्षित करते हुए वैश्विक संदर्भ को पकड़ने की U-Net की क्षमता इसे इस कार्य के लिए उपयुक्त बनाती है। इस संदर्भ में, U-Net को अक्सर समय एम्बेडिंग और ध्यान तंत्र को शामिल करने के लिए संशोधित किया जाता है ताकि बदलते शोर स्तरों को संभाला जा सके और लंबी दूरी की निर्भरताओं को मॉडल किया जा सके।
हाल के विकास और विस्तार
U-Net ने कई वास्तुशिल्प विस्तार और सुधारों को प्रेरित किया है। Attention U-Net प्रासंगिक फीचर पर ध्यान केंद्रित करने के लिए ध्यान गेट पेश करता है, जबकि U-Net++ (Nested U-Net) ग्रेडिएंट प्रवाह में सुधार के लिए घने स्किप कनेक्शन जोड़ता है। Residual U-Net गहरे नेटवर्क के प्रशिक्षण को आसान बनाने के लिए अवशिष्ट ब्लॉक शामिल करता है। आर्किटेक्चर को ट्रांसफॉर्मर के साथ भी जोड़ा गया है, जैसे कि TransUNet में, जो वैश्विक संदर्भ को पकड़ने के लिए एक ट्रांसफॉर्मर एनकोडर को एकीकृत करता है। डिफ्यूजन मॉडल के संदर्भ में, ध्यान परतों के साथ U-Net वेरिएंट मानक बन गए हैं। इसके अतिरिक्त, चिकित्सा छवि विभाजन के लिए रिसेप्टिव फील्ड आधारित U-Net मॉडल में रुचि रही है, जिसका उद्देश्य स्थानीय और वैश्विक जानकारी के बीच व्यापार-बंद को अनुकूलित करना है। आर्किटेक्चर सक्रिय शोध का विषय बना हुआ है, जिसमें दक्षता, सटीकता और नए डोमेन के लिए अनुकूलनशीलता में सुधार के चल रहे प्रयास हैं।
यह भी देखें
- कन्वोल्यूशनल न्यूरल नेटवर्क
- छवि विभाजन
- डिफ्यूजन मॉडल
- एनकोडर-डिकोडर
- स्किप कनेक्शन
- बायोमेडिकल इमेजिंग
- जनरेटिव एडवर्सेरियल नेटवर्क
- डीप लर्निंग
संदर्भ
- Ronneberger, O., Fischer, P., & Brox, T. (2015). U-Net: Convolutional Networks for Biomedical Image Segmentation. In Medical Image Computing and Computer-Assisted Intervention (MICCAI).
- Shelhamer, E., Long, J., & Darrell, T. (2014). Fully Convolutional Networks for Semantic Segmentation. In CVPR.
- Çiçek, Ö., Abdulkadir, A., Lienkamp, S. S., Brox, T., & Ronneberger, O. (2016). 3D U-Net: Learning Dense Volumetric Segmentation from Sparse Annotation. In MICCAI.
- Iglovikov, V., & Shvets, A. (2018). TernausNet: U-Net with VGG11 Encoder Pre-Trained on ImageNet for Image Segmentation. arXiv preprint.
- Ho, J., Jain, A., & Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. In NeurIPS.