DeepLab दीप तंत्रिका नेटवर्क वास्तुकलाओं का एक परिवार है जो सिमेंटिक सेगमेंटेशन के लिए है, एक कंप्यूटर विज़न कार्य जो छवि के हर पिक्सेल को एक वर्ग लेबल प्रदान करता है। गूगल के शोधकर्ताओं द्वारा विकसित (शुरुआत में Google Research में, बाद में Google DeepMind का हिस्सा), DeepLab मॉडल एट्रस (डायलेटेड) कनवल्शन के उपयोग से प्रतिष्ठित हैं, एक तकनीक जो फ़िल्टर के संवेदनशील क्षेत्र को बिना पैरामीटरों की संख्या बढ़ाए या स्थानिक रिज़ॉल्यूशन खोए विस्तारित करती है। यह परिवार कई संस्करणों के माध्यम से विकसित हुआ है, प्रत्येक वास्तुकला और प्रशिक्षण पद्धति में परिशोधन पेश करता है, और लगातार PASCAL VOC और Cityscapes जैसे बेंचमार्क डेटासेट पर अत्याधुनिक परिणाम प्राप्त किए हैं।
DeepLab का मूल नवाचार एट्रस कनवल्शन का अनुप्रयोग है, जिसे डायलेटेड कनवल्शन भी कहा जाता है, सिमेंटिक सेगमेंटेशन के लिए। मानक कनवल्शन में, एक फ़िल्टर इनपुट के सन्निहित क्षेत्र पर लागू होता है। एट्रस कनवल्शन फ़िल्टर वज़न के बीच शून्य (छेद) डालता है, प्रभावी रूप से उन्हें अलग करता है। डायलेशन दर स्पेसिंग को नियंत्रित करती है; दर 1 एक मानक कनवल्शन है, जबकि उच्च दरें दृश्य के क्षेत्र का विस्तार करती हैं। यह नेटवर्क को फ़ीचर मैप्स को डाउनसैंपल किए बिना बड़े संदर्भ से जानकारी कैप्चर करने की अनुमति देता है, जो सेगमेंटेशन सीमाओं में बारीक विवरण संरक्षित करने के लिए महत्वपूर्ण है। DeepLab एट्रस स्थानिक पिरामिड पूलिंग (ASPP) भी नियोजित करता है, एक मॉड्यूल जो समानांतर में विभिन्न डायलेशन दरों के साथ कई एट्रस कनवल्शन लागू करता है, फिर उनके आउटपुट को मर्ज करता है। यह बहु-पैमाने दृष्टिकोण मॉडल को विभिन्न आकारों की वस्तुओं को पहचानने में मदद करता है।
प्रारंभिक संस्करण: DeepLabv1 और DeepLabv2
पहला संस्करण, DeepLabv1, 2015 में पेश किया गया था और पोस्ट-प्रोसेसिंग के लिए एट्रस कनवल्शन को पूरी तरह से जुड़े सशर्त यादृच्छिक क्षेत्रों (CRFs) के साथ जोड़ा। CRF ने स्थानिक स्थिरता लागू करके मोटे नेटवर्क आउटपुट को परिष्कृत किया, ऑब्जेक्ट सीमाओं को तेज किया। DeepLabv2, 2016 में प्रस्तुत, ने ASPP मॉड्यूल जोड़ा और VGG-16 बैकबोन को ResNet से बदल दिया, सटीकता और दक्षता में सुधार किया। v2 मॉडल ने PASCAL VOC 2012 बेंचमार्क पर शीर्ष परिणाम प्राप्त किए, क्षेत्र के लिए एक नया मानक स्थापित किया।
DeepLabv3 और DeepLabv3+
DeepLabv3, 2017 में प्रकाशित, ने CRF पोस्ट-प्रोसेसिंग को हटाकर वास्तुकला को सरल बनाया, क्योंकि बैच सामान्यीकरण के साथ ASPP मॉड्यूल बहु-पैमाने संदर्भ कैप्चर करने के लिए पर्याप्त साबित हुआ। इसने बाद के DeepLabv3+ संस्करण में एक अधिक प्रभावी एनकोडर-डिकोडर संरचना भी पेश की, जिसने सेगमेंटेशन सीमाओं, विशेष रूप से छोटी वस्तुओं के लिए, को परिष्कृत करने के लिए एक डिकोडर मॉड्यूल जोड़ा। DeepLabv3+ मशीन लर्निंग समुदाय में व्यापक रूप से अपनाया गया बेसलाइन बन गया, जिसे अक्सर इंस्टेंस सेगमेंटेशन और पैनोप्टिक सेगमेंटेशन जैसे अन्य कार्यों के लिए बैकबोन के रूप में उपयोग किया जाता है। Cityscapes और अन्य स्वायत्त ड्राइविंग डेटासेट पर मॉडल का प्रदर्शन ने इसे वास्तविक दुनिया के अनुप्रयोगों के लिए एक लोकप्रिय विकल्प बना दिया।
तकनीकी विवरण और प्रशिक्षण
DeepLab मॉडल आमतौर पर एक पूर्व-प्रशिक्षित बैकबोन नेटवर्क का उपयोग करते हैं, जैसे ResNet या Xception, अंतिम पूरी तरह से जुड़ी परतों को हटाकर। आउटपुट स्ट्राइड, जो इनपुट छवि आकार से आउटपुट फ़ीचर मैप आकार का अनुपात निर्धारित करता है, एक प्रमुख हाइपरपैरामीटर है। DeepLabv3+ अक्सर गति और सटीकता को संतुलित करने के लिए प्रशिक्षण के दौरान आउटपुट स्ट्राइड 16 और अनुमान के दौरान 8 का उपयोग करता है। प्रशिक्षण में डेटा संवर्धन, बैच सामान्यीकरण, और स्टोकेस्टिक ग्रेडिएंट डीसेंट या इसके वेरिएंट के साथ अनुकूलन जैसी मानक तकनीकें शामिल हैं। हानि फ़ंक्शन आमतौर पर प्रति-पिक्सेल क्रॉस-एन्ट्रॉपी हानि होती है, कभी-कभी मध्यवर्ती परतों के लिए सहायक हानियों के साथ संयुक्त।
अनुप्रयोग और प्रभाव
DeepLab कई डोमेन में लागू किया गया है, जिसमें स्वायत्त ड्राइविंग (वेमो और अन्य कंपनियां परिदृश्य समझ के लिए समान सेगमेंटेशन मॉडल का उपयोग करती हैं), चिकित्सा छवि विश्लेषण (जैसे, स्कैन में अंगों या ट्यूमर का खंडन), उपग्रह इमेजरी विश्लेषण, और संवर्धित वास्तविकता शामिल हैं। इसका प्रभाव सिमेंटिक सेगमेंटेशन से परे है; एट्रस कनवल्शन तकनीक को U-Net वेरिएंट और ऑब्जेक्ट डिटेक्शन मॉडल जैसी अन्य वास्तुकलाओं में अपनाया गया है। DeepLab परिवार बड़े सिस्टम में भी एक सामान्य घटक है, जिसमें छवि संपादन और जनरेटिव एआई अनुप्रयोगों के लिए सटीक ऑब्जेक्ट सीमाओं की आवश्यकता होती है।
DeepLab का विकास डीप लर्निंग में व्यापक प्रवृत्तियों को दर्शाता है: हस्त-निर्मित सुविधाओं से अंत-से-अंत सीखे गए प्रतिनिधित्व में बदलाव, बहु-पैमाने प्रसंस्करण का महत्व, और सटीकता को कम्प्यूटेशनल दक्षता के साथ संतुलित करने वाली वास्तुकलाओं की खोज। जबकि नए मॉडल, जैसे कि ट्रांसफार्मर और बड़े भाषा मॉडल पर आधारित जो विज़न के लिए अनुकूलित हैं, ने कुछ बेंचमार्क पर DeepLab को पीछे छोड़ दिया है, DeepLab परिवार सिमेंटिक सेगमेंटेशन के क्षेत्र में एक मौलिक संदर्भ बिंदु बना हुआ है।