VGGNet एक कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर के परिवार को संदर्भित करता है, जिसे ऑक्सफोर्ड विश्वविद्यालय में विज़ुअल ज्योमेट्री ग्रुप (VGG) द्वारा विकसित किया गया था। ये मॉडल 2014 के एक पेपर में पेश किए गए थे और अपने सरल, मॉड्यूलर डिज़ाइन और छवि वर्गीकरण कार्यों पर मजबूत प्रदर्शन के लिए गहन शिक्षण के क्षेत्र में प्रभावशाली बन गए। VGG परिवार छोटे 3x3 कन्वोल्यूशनल फिल्टर के सुसंगत और समान उपयोग द्वारा विशेषता है, जो एलेक्सनेट जैसे पहले के नेटवर्क में उपयोग किए गए बड़े फिल्टर से एक विचलन है।
VGG मॉडल विभिन्न कंप्यूटर विज़न अनुप्रयोगों में व्यापक रूप से अपनाए गए थे। VGG नेटवर्क के एक समूह ने 2014 में इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) में शीर्ष परिणाम प्राप्त किए। यह आर्किटेक्चर ResNet पेपर में तुलना के लिए एक आधार रेखा के रूप में, वस्तु पहचान के लिए फास्ट रीजन-आधारित CNN में आधार नेटवर्क के रूप में, और न्यूरल स्टाइल ट्रांसफर एल्गोरिदम में एक घटक के रूप में कार्य करता था। जबकि बाद के आर्किटेक्चर जैसे इंसेप्शन, ResNet और DenseNet ने VGGNet के प्रदर्शन को पीछे छोड़ दिया, यह श्रृंखला कन्वोल्यूशनल न्यूरल नेटवर्क के विकास में एक ऐतिहासिक रूप से महत्वपूर्ण मील का पत्थर बनी हुई है।
डिज़ाइन सिद्धांत
VGGNet के पीछे मुख्य विचार प्रत्येक परत को शुरू से डिज़ाइन करने के बजाय सामान्य, सरल मॉड्यूल को स्टैक करके एक गहरा नेटवर्क बनाना था। यह एलेक्सनेट (2012) जैसे पहले के दृष्टिकोणों के विपरीत था, जिसमें बड़े फिल्टर के साथ एक अधिक विषम संरचना का उपयोग किया गया था। VGG आर्किटेक्चर में 3x3 कन्वोल्यूशनल परतों के दोहराए गए ब्लॉक होते हैं, जिनके बाद मैक्स-पूलिंग परतें आती हैं, और अंत में पूरी तरह से जुड़ी परतों का एक सेट होता है।
छोटे 3x3 फिल्टर का सुसंगत उपयोग एक प्रमुख नवाचार था। दो 3x3 कन्वोल्यूशन को स्टैक करने से एकल 5x5 कन्वोल्यूशन के समान रिसेप्टिव फील्ड मिलता है, लेकिन कम पैरामीटर के साथ (18c^2 बनाम 25c^2, जहां c चैनलों की संख्या है)। इसने कम पैरामीटर के साथ गहरे नेटवर्क की अनुमति दी, जबकि बढ़ी हुई गहराई ने नेटवर्क को अधिक जटिल विशेषताओं को सीखने में सक्षम बनाया। मूल प्रकाशन ने प्रदर्शित किया कि गहरे और संकीर्ण नेटवर्क उथले और चौड़े समकक्षों से काफी बेहतर प्रदर्शन करते हैं।
आर्किटेक्चर
VGG आर्किचेक्चर क्रमिक रूप से स्टैक किए गए सामान्य मॉड्यूल से बना है। कन्वोल्यूशनल परतें 3x3 फिल्टर का उपयोग स्ट्राइड 1 और ReLU सक्रियण के साथ करती हैं। इनके बाद 2x2 फिल्टर और स्ट्राइड 2 के साथ मैक्स-पूलिंग परतें आती हैं, जो फीचर मैप्स को चौड़ाई और ऊंचाई दोनों में आधा कर देती हैं, जबकि चैनलों की संख्या को संरक्षित रखती हैं।
कन्वोल्यूशनल और पूलिंग चरणों के बाद, नेटवर्क 4096-4096-1000 आकारों के साथ तीन पूरी तरह से जुड़ी परतों के साथ समाप्त होता है। अंतिम परत में 1000 इकाइयाँ हैं जो इमेजनेट डेटासेट में 1000 वर्गों के अनुरूप हैं। एक सॉफ्टमैक्स परत इन वर्गों पर अंतिम संभाव्यता वितरण उत्पन्न करती है।
कॉन्फ़िगरेशन और गहराई
VGG परिवार में कई कॉन्फ़िगरेशन शामिल हैं, जिन्हें एक अक्षर और वजन परतों की संख्या द्वारा दर्शाया जाता है। सबसे अधिक उपयोग किए जाने वाले वेरिएंट VGG-16 और VGG-19 हैं। VGG-16 में 13 कन्वोल्यूशनल परतें और 3 पूरी तरह से जुड़ी परतें हैं, जिनमें कुल लगभग 138 मिलियन पैरामीटर हैं। VGG-19 में 16 कन्वोल्यूशनल परतें और 3 पूरी तरह से जुड़ी परतें हैं, जिनमें लगभग 144 मिलियन पैरामीटर हैं।
विशिष्ट VGG आर्किटेक्चर में, कन्वोल्यूशनल चरण ब्लॉकों में व्यवस्थित होते हैं। प्रत्येक ब्लॉक में एक या अधिक 3x3 कन्वोल्यूशनल परतें होती हैं, जिनके बाद 2x2 मैक्स-पूलिंग परत स्ट्राइड 2 के साथ आती है, जो फीचर मैप्स को डाउनसैंपल करती है। चैनलों की संख्या नेटवर्क के माध्यम से धीरे-धीरे बढ़ती है, पहले ब्लॉक में 64 से लेकर सबसे गहरे ब्लॉक में 512 तक। अंतिम चरण 4096, 4096 और 1000 आकारों के साथ तीन पूरी तरह से जुड़ी परतें हैं, जिनके बाद 1000 इमेजनेट वर्गों पर वर्गीकरण के लिए एक सॉफ्टमैक्स परत है।
डिज़ाइन सिद्धांत
VGG मॉडल का प्रमुख आर्किटेक्चरल सिद्धांत स्ट्राइड 1 के साथ छोटे 3x3 कन्वोल्यूशन का सुसंगत उपयोग है। यह डिज़ाइन विकल्प महत्वपूर्ण था क्योंकि दो 3x3 कन्वोल्यूशन को स्टैक करने से एकल 5x5 कन्वोल्यूशन के समान रिसेप्टिव फील्ड प्राप्त होता है, जबकि कम पैरामीटर का उपयोग होता है। मूल पेपर ने प्रदर्शित किया कि गहरे और संकीर्ण नेटवर्क उथले और चौड़े समकक्षों से बेहतर प्रदर्शन करते हैं, जिससे मशीन लर्निंग में गहराई का महत्व स्थापित हुआ।
एलेक्सनेट (2012) जैसे पहले के नेटवर्क के विपरीत, जो 11x11 तक के बड़े फिल्टर का उपयोग करते थे और शुरू से डिज़ाइन किए गए थे, VGGNet सामान्य, दोहराए जाने योग्य मॉड्यूल से बना था। इस मॉड्यूलर दृष्टिकोण ने डिज़ाइन प्रक्रिया को सरल बनाया और आर्किटेक्चर को लागू करना और अनुकूलित करना आसान बना दिया। छोटे फिल्टर के सुसंगत उपयोग ने पैरामीटर की संख्या को कम करते हुए समान रिसेप्टिव फील्ड के साथ गहरे नेटवर्क की अनुमति दी।
आर्किटेक्चर
VGG परिवार में विभिन्न गहराई के कई कॉन्फ़िगरेशन शामिल हैं, जिन्हें 'VGG' अक्षर के बाद वजन परतों की संख्या द्वारा दर्शाया जाता है। सबसे सामान्य संस्करण VGG-16 (13 कन्वोल्यूशनल परतें और 3 पूरी तरह से जुड़ी परतें, कुल लगभग 138 मिलियन पैरामीटर) और VGG-19 (16 कन्वोल्यूशनल परतें और 3 पूरी तरह से जुड़ी परतें, कुल लगभग 144 मिलियन पैरामीटर) हैं। ये मूल प्रकाशन में कॉन्फ़िगरेशन D और E के अनुरूप हैं।
सभी VGG मॉडल एक समान संरचना का पालन करते हैं। वे कन्वोल्यूशनल मॉड्यूल से शुरू होते हैं, जिनमें से प्रत्येक में स्ट्राइड 1 और ReLU सक्रियण के साथ 3x3 फिल्टर होते हैं। कन्वोल्यूशनल परतों के कुछ समूहों के बाद, 2x2 विंडो और स्ट्राइड 2 के साथ एक मैक्स-पूलिंग परत स्थानिक आयामों को आधा कर देती है, जबकि चैनल गणना को संरक्षित रखती है। चैनलों की संख्या नेटवर्क के माध्यम से धीरे-धीरे बढ़ती है, पहली परत में 64 से लेकर सबसे गहरी कन्वोल्यूशनल परतों में 512 तक।
नेटवर्क 4096, 4096 और 1000 आकारों के साथ तीन पूरी तरह से जुड़ी परतों के साथ समाप्त होता है। अंतिम परत इमेजनेट डेटासेट में 1000 वर्गों के लिए स्कोर आउटपुट करती है। एक सॉफ्टमैक्स परत फिर इन स्कोर को वर्गों पर संभाव्यता वितरण में परिवर्तित करती है।
प्रशिक्षण और प्रदर्शन
VGG मॉडल को इमेजनेट डेटासेट पर प्रशिक्षित किया गया था, जिसमें 1000 श्रेणियों में 14 मिलियन से अधिक छवियां शामिल हैं। ऐसे गहरे नेटवर्क को प्रशिक्षित करने के लिए महत्वपूर्ण कम्प्यूटेशनल संसाधन और सावधानीपूर्वक ट्यूनिंग की आवश्यकता थी। मॉडल को यादृच्छिक क्रॉपिंग और क्षैतिज फ़्लिपिंग जैसी डेटा वृद्धि तकनीकों के साथ कई युगों के लिए प्रशिक्षित किया गया था।
2014 ILSVRC प्रतियोगिता में, VGG मॉडल के एक समूह ने अत्याधुनिक परिणाम प्राप्त किए, जो आर्किटेक्चर की प्रभावशीलता को प्रदर्शित करता है। विशेष रूप से VGG-16 मॉडल छवि वर्गीकरण कार्यों के लिए एक मानक आधार रेखा बन गया और ट्रांसफर लर्निंग में व्यापक रूप से उपयोग किया गया, जहां इमेजनेट पर पूर्व-प्रशिक्षित नेटवर्क को छोटे डेटासेट के साथ अन्य कार्यों के लिए अनुकूलित किया जाता है।
प्रभाव और विरासत
VGGNet CNN में मानक कन्वोल्यूशनल फिल्टर आकार को बड़े कर्नेल (एलेक्सनेट में 11x11 तक) से बहुत छोटे 3x3 फिल्टर में स्थानांतरित करने में सहायक था। इस डिज़ाइन विकल्प ने कई बाद के आर्किटेक्चर को प्रभावित किया। नेटवर्क का व्यापक रूप से अन्य कार्यों के लिए एक बैकबोन के रूप में उपयोग किया गया, जिसमें फास्ट रीजन-आधारित CNN (फास्ट R-CNN) फ्रेमवर्क में वस्तु पहचान और न्यूरल स्टाइल ट्रांसफर एल्गोरिदम में एक आधार नेटवर्क शामिल है।
आर्किटेक्चर का सीधा डिज़ाइन इसे शोधकर्ताओं और चिकित्सकों के लिए एक लोकप्रिय विकल्प बनाता है। इसकी सफलता ने प्रदर्शित किया कि गहराई, छोटे, समान फिल्टर के साथ मिलकर, मजबूत प्रदर्शन दे सकती है। हालांकि, मॉडल कम्प्यूटेशनल रूप से महंगे हैं और पूरी तरह से जुड़ी परतों के कारण बड़ी मेमोरी फुटप्रिंट है।
VGG श्रृंखला अंततः इंसेप्शन, ResNet और DenseNet जैसे अधिक कुशल आर्किटेक्चर द्वारा प्रतिस्थापित की गई, जिन्होंने कम पैरामीटर के साथ बेहतर प्रदर्शन प्राप्त किया। 2021 में, RepVGG आर्किटेक्चर ने आधुनिक तकनीकों के साथ VGG-शैली के सरल डिज़ाइन की पुनर्कल्पना की, यह दिखाते हुए कि एक सादा, VGG-जैसा नेटवर्क फिर से अत्याधुनिक प्रदर्शन से मेल खा सकता है। मूल VGGNet विभिन्न ट्रांसफर लर्निंग अनुप्रयोगों में फीचर एक्सट्रैक्टर के रूप में सामान्य बने हुए हैं।
ऐतिहासिक संदर्भ
VGGNet उस समय विकसित किया गया था जब न्यूरल नेटवर्क गहरे और अधिक शक्तिशाली हो रहे थे। एलेक्सनेट, 2012 ILSVRC विजेता, ने 11x11 तक के बड़े कन्वोल्यूशनल फिल्टर का उपयोग किया और 8 परतों की अपेक्षाकृत उथली संरचना थी। VGG का कई 3x3 कन्वोल्यूशन को स्टैक करने का प्रस्ताव प्रदर्शित करता है कि गहराई को काफी बढ़ाया जा सकता है, जबकि पैरामीटर की प्रबंधनीय संख्या बनाए रखी जा सकती है। सरल मॉड्यूल को जोड़कर गहरे नेटवर्क बनाने के इस सिद्धांत ने कई बाद के आर्किटेक्चर को प्रभावित किया।
VGG मॉडल ResNet पेपर में आधार रेखा तुलना के रूप में उपयोग किए गए और विभिन्न कंप्यूटर विज़न सिस्टम के लिए बैकबोन के रूप में कार्य किए, जिसमें वस्तु पहचान के लिए फास्ट रीजन-आधारित CNN और न्यूरल स्टाइल ट्रांसफर के कार्यान्वयन शामिल हैं। मॉडल कई विज़न कार्यों में फीचर निष्कर्षण के लिए एक मानक विकल्प भी बन गए।
प्रभाव और विरासत
VGGNet का महत्व इसके प्रदर्शन में निहित है कि एक सावधानीपूर्वक संरचित, गहरा कृत्रिम बुद्धिमत्ता नेटवर्क अत्यधिक नियमित डिज़ाइन के साथ उत्कृष्ट परिणाम प्राप्त कर सकता है। इसकी मॉड्यूलरिटी ने इसे लागू करना और अनुकूलित करना आसान बना दिया, जिससे अनुसंधान और उद्योग दोनों में इसकी लोकप्रियता में योगदान हुआ। आर्किटेक्चर गहन शिक्षण पाठ्यक्रमों में एक सामान्य शैक्षिक उदाहरण और कई कंप्यूटर विज़न कार्यों के लिए एक आधार रेखा बना हुआ है।
जबकि नए आर्किटेक्चर ने मानक बेंचमार्क पर VGG के प्रदर्शन को पार कर लिया है, मॉडल का प्रभाव बना हुआ है। इसके सिद्धांत - छोटे फिल्टर, गहरे स्टैक और सरल मॉड्यूलर डिज़ाइन - कई बाद के नेटवर्क में दिखाई देते हैं। पूर्व-प्रशिक्षित VGG मॉडल की उपलब्धता इसे विभिन्न अनुप्रयोगों में फीचर निष्कर्षण और ट्रांसफर लर्निंग के लिए उपयोगी बनाती है, जिसमें वस्तु पहचान और स्टाइल ट्रांसफर शामिल हैं।