DenseNet (घनत्व से जुड़ा संवहनी तंत्रिका नेटवर्क) छवि पहचान के लिए एक तंत्रिका नेटवर्क वास्तुकला है जो प्रत्येक परत को फीड-फॉरवर्ड तरीके से हर अन्य परत से जोड़ता है। L परतों वाले पारंपरिक संवहनी नेटवर्क के विपरीत, जिनमें L कनेक्शन होते हैं, DenseNet में L(L+1)/2 सीधे कनेक्शन होते हैं। प्रत्येक परत के लिए, पिछली सभी परतों के फीचर मैप्स को इनपुट के रूप में उपयोग किया जाता है, और इसके अपने फीचर मैप्स को बाद की सभी परतों में इनपुट के रूप में उपयोग किया जाता है। यह घना कनेक्टिविटी पैटर्न 2016 के एक पेपर में गाओ हुआंग, झुआंग लियू, लॉरेन्स वैन डेर माटेन और किलियन क्यू. वेनबर्गर द्वारा पेश किया गया था, और इसे 2017 IEEE सम्मेलन कंप्यूटर विज़न और पैटर्न पहचान (CVPR) में प्रस्तुत किया गया था।
यह वास्तुकला गहरे नेटवर्क में लुप्त होते ग्रेडिएंट समस्या को हल करने के लिए डिज़ाइन की गई थी। शुरुआती परतों से बाद की परतों और हानि फलन तक छोटे रास्ते प्रदान करके, DenseNet प्रशिक्षण के दौरान ग्रेडिएंट के प्रवाह को सुगम बनाता है। यह फीचर पुन:उपयोग को भी प्रोत्साहित करता है, क्योंकि प्रत्येक परत को पिछली सभी परतों से सामूहिक ज्ञान प्राप्त होता है, जिससे अधिक कॉम्पैक्ट मॉडल बनते हैं। DenseNet ने ImageNet और CIFAR बेंचमार्क पर उल्लेखनीय परिणाम प्राप्त किए, अक्सर गहन शिक्षण के अवशिष्ट कनेक्शन पर आधारित तुलनीय वास्तुकलाओं की तुलना में कम पैरामीटर की आवश्यकता होती है।
घना कनेक्टिविटी और विकास दर
DenseNet में, l-वीं परत को पिछली सभी परतों के फीचर मैप्स, x_0, x_1, ..., x_{l-1}, इनपुट के रूप में प्राप्त होते हैं। l-वीं परत का आउटपुट x_l = H_l([x_0, x_1, ..., x_{l-1}]) के रूप में परिभाषित किया गया है, जहाँ [x_0, x_1, ..., x_{l-1}] फीचर मैप्स के संयोजन को दर्शाता है। फलन H_l एक समग्र संक्रिया है जिसमें आमतौर पर बैच सामान्यीकरण, एक रेक्टिफाइड रैखिक इकाई (ReLU) सक्रियण, और 3x3 संवलन शामिल होता है। यह संयोजन, न कि योग, DenseNet को अवशिष्ट नेटवर्क से अलग करता है, जो योजक स्किप कनेक्शन का उपयोग करते हैं।
प्रत्येक परत फीचर मैप्स की एक निश्चित संख्या जोड़ती है, जिसे विकास दर k कहा जाता है। यदि प्रत्येक H_l k फीचर मैप्स उत्पन्न करता है, तो l-वीं परत में k_0 + k*(l-1) इनपुट फीचर मैप्स होते हैं, जहाँ k_0 इनपुट छवि में चैनलों की संख्या है। सामान्य विकास दरें 12, 24 और 32 हैं। छोटी विकास दर एक संकरा नेटवर्क बनाती है, जबकि बड़े मान क्षमता बढ़ाते हैं। घना कनेक्टिविटी का मतलब है कि फीचर मैप्स की कुल संख्या गहराई के साथ द्विघात रूप से बढ़ती है, लेकिन बाधा परतों और संपीड़न का उपयोग मॉडल आकार को नियंत्रित करने में मदद करता है।
बाधा और संपीड़न परतें
कम्प्यूटेशनल दक्षता में सुधार के लिए, DenseNet प्रत्येक H_l में DenseNet-B जैसी वास्तुकलाओं के लिए एक बाधा परत शामिल करता है। बाधा परत में बैच सामान्यीकरण, ReLU, एक 1x1 संवलन जो फीचर मैप्स की संख्या को 4k तक कम करता है, और फिर एक 3x3 संवलन शामिल होता है। यह डिज़ाइन 3x3 संवलन के लिए इनपुट चैनलों की संख्या कम करता है, जिससे पैरामीटर गिनती और कम्प्यूटेशनल लागत घटती है। उदाहरण के लिए, DenseNet-BC में, बाधा को संपीड़न के साथ जोड़ा जाता है।
संपीड़न, जिसे थीटा पैरामीटर (1 से कम या बराबर मानों के साथ) द्वारा दर्शाया जाता है, संक्रमण परतों पर लागू होता है। एक संक्रमण परत, जो घने ब्लॉकों के बीच रखी जाती है, में बैच सामान्यीकरण, एक 1x1 संवलन, और एक 2x2 औसत पूलिंग संक्रिया शामिल होती है। 1x1 संवलन फीचर मैप्स की संख्या को थीटा के कारक से कम करता है। जब थीटा 1 से कम होता है, तो नेटवर्क को DenseNet-C कहा जाता है। बाधा और संपीड़न का संयोजन, DenseNet-BC, विशेष रूप से प्रभावी साबित हुआ, जो अन्य वास्तुकलाओं की तुलना में कम पैरामीटर के साथ उच्च सटीकता प्राप्त करता है।
घने ब्लॉक और संक्रमण परतें
नेटवर्क को घने ब्लॉकों में व्यवस्थित किया गया है, जहाँ घना कनेक्टिविटी प्रत्येक ब्लॉक के भीतर लागू होती है। ब्लॉकों के बीच, संक्रमण परतें फीचर मैप्स के आकार को नियंत्रित करती हैं। ImageNet के लिए एक विशिष्ट DenseNet वास्तुकला, जैसे DenseNet-121, में क्रमशः 6, 12, 24 और 16 परतों वाले चार घने ब्लॉक होते हैं, जिनकी विकास दर 32 होती है। पहले घने ब्लॉक से पहले पहली संवलन परत में 64 चैनल होते हैं। अंतिम घने ब्लॉक के बाद, एक वैश्विक औसत पूलिंग परत और एक सॉफ्टमैक्स क्लासिफायर आउटपुट उत्पन्न करते हैं। ब्लॉकों के बीच संक्रमण परतें फीचर मैप्स की संख्या को कम करने के लिए संपीड़न का उपयोग करती हैं, जो मॉडल की मेमोरी फुटप्रिंट को कम करने में मदद करता है।
प्रशिक्षण और प्रदर्शन
DenseNet मॉडल को गति के साथ स्टोकेस्टिक ग्रेडिएंट डिसेंट, वजन क्षय, और वार्म-अप और क्षय शामिल एक सीखने की दर अनुसूची का उपयोग करके प्रशिक्षित किया जाता है। यादृच्छिक क्रॉपिंग, फ्लिपिंग और सामान्यीकरण जैसी डेटा संवर्धन तकनीकें आमतौर पर उपयोग की जाती हैं। ImageNet लार्ज स्केल विज़ुअल पहचान चुनौती (ILSVRC) 2012 डेटासेट पर, DenseNet-201 ने 22.15% की शीर्ष-1 त्रुटि दर और 6.20% की शीर्ष-5 त्रुटि दर हासिल की, जो उस समय के अत्याधुनिक परिणामों के साथ प्रतिस्पर्धी थी। CIFAR-10 और CIFAR-100 पर, 12 की विकास दर वाले DenseNet-BC ने क्रमशः 3.46% और 17.18% की त्रुटि दरें हासिल कीं, जो कई अवशिष्ट नेटवर्क वेरिएंट को कम पैरामीटर के साथ बेहतर प्रदर्शन दिया।
घना कनेक्टिविटी गहन पर्यवेक्षण का एक अंतर्निहित रूप भी प्रदान करता है, क्योंकि प्रत्येक परत को हानि फलन से ग्रेडिएंट तक सीधी पहुंच होती है। यह गुण सहायक क्लासिफायर की आवश्यकता को कम करता है। DenseNet को विभिन्न कंप्यूटर विज़न कार्यों में व्यापक रूप से अपनाया गया है, जिसमें शब्दार्थ विभाजन, वस्तु पहचान और चिकित्सा छवि विश्लेषण शामिल हैं। इसके डिज़ाइन सिद्धांतों ने बाद की वास्तुकलाओं को प्रभावित किया है, जैसे कि कृत्रिम बुद्धिमत्ता प्रणालियों में छवि समझ के लिए उपयोग किए जाने वाले।
प्रभाव और वेरिएंट
DenseNet की सफलता ने कई वेरिएंट और विस्तारों को जन्म दिया। उदाहरण के लिए, घने कनेक्टिविटी की अवधारणा को डुअल पाथ नेटवर्क जैसे मॉडलों में अन्य तंत्रों के साथ जोड़ा गया, जो अवशिष्ट और घने कनेक्शन को मर्ज करते हैं। मशीन लर्निंग अनुसंधान के संदर्भ में, DenseNet को कई अनुप्रयोगों में फीचर निष्कर्षण के लिए एक बैकबोन के रूप में उपयोग किया गया है। पैरामीटर का कुशल उपयोग इसे संसाधन-सीमित उपकरणों पर तैनाती के लिए उपयुक्त बनाता है, जिसमें सैमसंग इलेक्ट्रॉनिक्स और अन्य मोबाइल हार्डवेयर निर्माताओं के उपकरण शामिल हैं। यह वास्तुकला तंत्रिका नेटवर्क डिज़ाइन पर अध्ययन के लिए एक आधार रेखा के रूप में भी कार्य करती थी, जैसे कि चौड़ाई, गहराई और कार्डिनैलिटी के प्रभाव की खोज करने वाले। जबकि ट्रांसफॉर्मर जैसी नई वास्तुकलाएं कुछ क्षेत्रों में प्रमुख हो गई हैं, DenseNet संवहनी नेटवर्क डिज़ाइन में एक मौलिक मॉडल बना हुआ है।