SegNet एक गहन तंत्रिका नेटवर्क वास्तुकला है जिसे सिमेंटिक सेगमेंटेशन के लिए डिज़ाइन किया गया है, जो एक कंप्यूटर विज़न कार्य है जो छवि में प्रत्येक पिक्सेल को एक वर्ग लेबल प्रदान करता है। इसे 2015 में कैम्ब्रिज विश्वविद्यालय के शोधकर्ताओं, जिनमें विजय बद्रिनारायणन, एलेक्स केंडल और रॉबर्टो सिपोला शामिल थे, द्वारा प्रस्तुत किया गया था। SegNet अपनी एनकोडर-डिकोडर संरचना के लिए उल्लेखनीय है, जो उच्च-स्तरीय सिमेंटिक विशेषताओं को पकड़ता है जबकि स्थानिक रिज़ॉल्यूशन को एक तंत्र के माध्यम से संरक्षित करता है जो एनकोडर से डिकोडर तक अधिकतम-पूलिंग सूचकांक स्थानांतरित करता है। यह डिज़ाइन इसे पहले के दृष्टिकोणों की तुलना में मेमोरी और गणना दोनों में कुशल बनाता है, और यह स्वायत्त ड्राइविंग और दृश्य समझ जैसे अनुप्रयोगों में व्यापक रूप से उपयोग किया गया है।
वास्तुकला में एक एनकोडर नेटवर्क शामिल है जो कन्वोल्यूशनल और पूलिंग परतों के माध्यम से इनपुट छवि को क्रमिक रूप से डाउनसैंपल करता है, और एक संगत डिकोडर नेटवर्क जो फीचर मैप्स को मूल रिज़ॉल्यूशन पर वापस अपसैंपल करता है। मुख्य नवाचार पूलिंग सूचकांकों का उपयोग है: एनकोडर में अधिकतम-पूलिंग के दौरान, अधिकतम मानों के स्थान दर्ज किए जाते हैं और डिकोडर को पारित किए जाते हैं, जो उन्हें अपसैंपल किए गए मानों को सही स्थानों पर रखने के लिए उपयोग करता है। यह सीखने योग्य अपसैंपलिंग परतों की आवश्यकता को समाप्त करता है और मापदंडों की संख्या को कम करता है, जिससे SegNet कुछ संदर्भों में यू-नेट जैसे विकल्पों की तुलना में अधिक कुशल बन जाता है।
वास्तुकला और प्रशिक्षण
SegNet का एनकोडर VGG16 नेटवर्क की कन्वोल्यूशनल परतों पर आधारित है, जिसे ImageNet पर पूर्व-प्रशिक्षित किया गया था, लेकिन यह पैरामीटर गणना को कम करने के लिए पूरी तरह से जुड़ी परतों को हटा देता है। एनकोडर में 13 कन्वोल्यूशनल परतें होती हैं, प्रत्येक के बाद बैच सामान्यीकरण और ReLU सक्रियण होता है, और इसे उनके बीच अधिकतम-पूलिंग के साथ पांच चरणों में व्यवस्थित किया जाता है। डिकोडर इस संरचना को 13 कन्वोल्यूशनल परतों के साथ प्रतिबिंबित करता है, लेकिन यह अपसैंपलिंग परतों का उपयोग करता है जो संबंधित एनकोडर चरण से पूलिंग सूचकांक लेते हैं। अंतिम परत एक सॉफ्टमैक्स क्लासिफायर है जो प्रत्येक पिक्सेल के लिए वर्गों पर संभाव्यता वितरण उत्पन्न करती है।
प्रशिक्षण क्रॉस-एन्ट्रॉपी हानि फ़ंक्शन के साथ स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग करके एंड-टू-एंड किया जाता है। लेखकों ने बताया कि पूर्व-प्रशिक्षित एनकोडर वेट का उपयोग करने से अभिसरण में तेजी आई और सटीकता में सुधार हुआ। उन्होंने मजबूती बढ़ाने के लिए यादृच्छिक क्रॉपिंग और फ्लिपिंग जैसी डेटा वृद्धि तकनीकों का भी उपयोग किया। मॉडल को CamVid डेटासेट पर प्रशिक्षित किया गया था, जिसमें 11 वर्गों के साथ सड़क दृश्य शामिल हैं, और बाद में SUN RGB-D और Cityscapes जैसे अन्य बेंचमार्क पर मूल्यांकन किया गया।
प्रदर्शन और तुलना
मूल पेपर में, SegNet ने CamVid परीक्षण सेट पर 60.1% का माध्य इंटरसेक्शन-ओवर-यूनियन (IoU) प्राप्त किया, जो FCN (फुली कन्वोल्यूशनल नेटवर्क) और DeconvNet जैसे पहले के तरीकों से बेहतर प्रदर्शन करता है। यह सड़क सीमाओं और छोटी वस्तुओं जैसे बारीक विवरणों को पकड़ने में विशेष रूप से प्रभावी था, पूलिंग सूचकांक तंत्र के कारण जो किनारे की जानकारी को संरक्षित करता है। हालांकि, कुछ बाद की वास्तुकलाओं की तुलना में अनुमान के दौरान इसकी मेमोरी उपयोग अधिक थी, और इसकी सटीकता बाद में अधिक परिष्कृत ध्यान तंत्र या फैली हुई कन्वोल्यूशन वाले मॉडलों द्वारा पार कर ली गई।
यू-नेट की तुलना में, जो लगभग उसी समय बायोमेडिकल छवि सेगमेंटेशन के लिए विकसित किया गया था, SegNet एक अलग अपसैंपलिंग रणनीति का उपयोग करता है। यू-नेट स्किप कनेक्शन के माध्यम से एनकोडर विशेषताओं को डिकोडर विशेषताओं के साथ संयोजित करता है, जबकि SegNet केवल पूलिंग सूचकांक स्थानांतरित करता है। यह SegNet को प्रशिक्षण के दौरान अधिक मेमोरी-कुशल बनाता है लेकिन उन कार्यों में संभावित रूप से कम सटीक बनाता है जहां बारीक स्थानिक विवरण महत्वपूर्ण होते हैं। उनके बीच चुनाव अक्सर विशिष्ट अनुप्रयोग और कम्प्यूटेशनल बाधाओं पर निर्भर करता है।
अनुप्रयोग और प्रभाव
SegNet को विभिन्न डोमेन में लागू किया गया है, जिसमें स्वायत्त ड्राइविंग शामिल है, जहां इसका उपयोग सड़क दृश्यों को सड़क, वाहन, पैदल यात्री और इमारत जैसी श्रेणियों में विभाजित करने के लिए किया जाता है। इसका उपयोग रोबोटिक्स में दृश्य समझ के लिए, रिमोट सेंसिंग में भूमि आवरण वर्गीकरण के लिए, और चिकित्सा इमेजिंग में अंग या ट्यूमर सेगमेंटेशन के लिए भी किया गया है। इसकी दक्षता ने इसे एम्बेडेड उपकरणों पर वास्तविक समय के अनुप्रयोगों के लिए उपयुक्त बनाया, और इसने गहन शिक्षण में बाद की एनकोडर-डिकोडर वास्तुकलाओं को प्रभावित किया।
पेपर "SegNet: A Deep Convolutional Encoder-Decoder Architecture for Image Segmentation" 2017 में IEEE Transactions on Pattern Analysis and Machine Intelligence में प्रकाशित हुआ था, और कोड ओपन-सोर्स लाइसेंस के तहत जारी किया गया था। वास्तुकला को हजारों बार उद्धृत किया गया है और यह सिमेंटिक सेगमेंटेशन अनुसंधान के लिए एक संदर्भ बिंदु बना हुआ है।
सीमाएं और विकास
अपनी ताकत के बावजूद, SegNet की सीमाएं हैं। पूलिंग सूचकांक तंत्र, हालांकि कुशल है, कुछ स्थानिक जानकारी खो सकता है क्योंकि यह केवल अधिकतम मान के स्थान को रिकॉर्ड करता है, पूरे फीचर मैप को नहीं। यह कुछ मामलों में धुंधली सीमाओं का कारण बन सकता है। इसके अतिरिक्त, निश्चित एनकोडर-डिकोडर संरचना बहु-पैमाने के संदर्भ को उतनी प्रभावी ढंग से शामिल नहीं करती जितनी बाद के मॉडल जैसे PSPNet या DeepLab, जो पिरामिड पूलिंग या एट्रस कन्वोल्यूशन का उपयोग करते हैं।
बाद के शोध ने SegNet के विचारों पर निर्माण किया है, जैसे निम्न-स्तरीय और उच्च-स्तरीय विशेषताओं को संयोजित करने के लिए स्किप कनेक्शन का उपयोग करना, या सेगमेंटेशन मैप्स को परिष्कृत करने के लिए ध्यान तंत्र को नियोजित करना। यू-नेट वेरिएंट और ट्रांसफॉर्मर जैसी आधुनिक वास्तुकलाओं ने सटीकता के मामले में SegNet को काफी हद तक पीछे छोड़ दिया है, लेकिन इसके सिद्धांत मौलिक बने हुए हैं। 2020 के दशक के मध्य तक, SegNet अभी भी शैक्षणिक तुलनाओं में और उन अनुप्रयोगों में एक आधार रेखा के रूप में उपयोग किया जाता है जहां कम्प्यूटेशनल दक्षता को अत्याधुनिक सटीकता पर प्राथमिकता दी जाती है।
संदर्भ और विरासत
SegNet का योगदान यह प्रदर्शित करने में है कि पूलिंग सूचकांक स्थानांतरण के साथ एक एनकोडर-डिकोडर अपेक्षाकृत छोटे मेमोरी पदचिह्न के साथ प्रतिस्पर्धी सेगमेंटेशन परिणाम प्राप्त कर सकता है। इसे कई मशीन लर्निंग फ्रेमवर्क और टूलकिट में एकीकृत किया गया है, और इसके डिज़ाइन ने कई वेरिएंट को प्रेरित किया है। मूल कार्यान्वयन GitHub पर उपलब्ध है, और पेपर कंप्यूटर विज़न साहित्य में व्यापक रूप से उद्धृत किया गया है। इसकी विरासत आधुनिक सेगमेंटेशन मॉडलों में एनकोडर-डिकोडर संरचनाओं के निरंतर उपयोग में स्पष्ट है, जिसमें ट्रांसफॉर्मर और जनरेटिव एआई दृष्टिकोणों पर आधारित शामिल हैं।