अंग्रेज़ी से अनुवादित

VGGNet ऑक्सफोर्ड विश्वविद्यालय के विज़ुअल ज्योमेट्री ग्रुप द्वारा विकसित गहरे कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर की एक श्रृंखला है, जो छोटे 3x3 फिल्टर के समान उपयोग के लिए जानी जाती है। इसने 2014 की ImageNet प्रतियोगिता में अत्याधुनिक परिणाम प्राप्त किए और कंप्यूटर विज़न में व्यापक रूप से उपयोग किया जाने वाला आधार बन गया।

VGGNet उन कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) आर्किटेक्चर के परिवार को संदर्भित करता है, जिन्हें ऑक्सफोर्ड विश्वविद्यालय के विज़ुअल ज्योमेट्री ग्रुप (VGG) द्वारा विकसित किया गया था। ये मॉडल अपनी आर्किटेक्चरल सरलता के लिए उल्लेखनीय हैं, जो छोटे 3x3 कन्वोल्यूशनल फिल्टर के एक समान स्टैक पर निर्भर करते हैं, और CNN डिज़ाइन को गहरे नेटवर्क की ओर स्थानांतरित करने में सहायक थे। इस परिवार के सबसे सामान्य वेरिएंट, VGG-16 और VGG-19, ने 2014 में ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) में अत्याधुनिक प्रदर्शन हासिल किया, और यह आर्किचेक्चर कई वर्षों तक कंप्यूटर विज़न कार्यों में व्यापक रूप से अपनाया गया।

शैक्षणिक शोध के उत्पाद के रूप में, VGGNet एक खुला, गैर-व्यावसायिक मॉडल है, और इसका डिज़ाइन शिक्षा और उद्योग दोनों में व्यापक रूप से प्रतिकृति और अनुकूलित किया गया है। यह आर्किटेक्चर बाद के विकासों के लिए एक प्रमुख संदर्भ बिंदु बना, जिसमें ResNet और DenseNet परिवार शामिल हैं, और इसके सिद्धांतों को 2021 में RepVGG आर्किटेक्चर के साथ फिर से देखा गया।

विकास और ऐतिहासिक संदर्भ

VGGNet श्रृंखला को ऑक्सफोर्ड विश्वविद्यालय के विज़ुअल ज्योमेट्री ग्रुप द्वारा डिज़ाइन किया गया था, जिसका नेतृत्व करेन सिमोनियन और एंड्रयू ज़िसरमैन ने किया। ये मॉडल "वेरी डीप कन्वोल्यूशनल नेटवर्क्स फॉर लार्ज-स्केल इमेज रिकग्निशन" शीर्षक वाले एक पेपर में पेश किए गए थे, जो 2014 में प्रस्तुत किया गया था। इस कार्य का उद्देश्य व्यवस्थित रूप से मूल्यांकन करना था कि नेटवर्क की गहराई बढ़ाने से सटीकता पर कैसे प्रभाव पड़ता है, जो पहले के AlexNet (2012) आर्किटेक्चर के विपरीत था, जिसे बड़े और अधिक विविध फिल्टर आकारों के साथ "स्क्रैच से" डिज़ाइन किया गया था।

VGGNet का दृष्टिकोण सामान्य, दोहराए जाने वाले मॉड्यूल बनाना था: ReLU सक्रियण के साथ 3x3 कन्वोल्यूशन, 2x2 मैक्स-पूलिंग परतों के साथ मिश्रित, उसके बाद पूरी तरह से जुड़ी परतें और एक सॉफ्टमैक्स परत। इस मॉड्यूलर डिज़ाइन ने गहरे नेटवर्क के निर्माण और विश्लेषण को सरल बना दिया, और पेपर के अनुभवजन्य परिणामों ने प्रदर्शित किया कि छोटे फिल्टर वाले गहरे नेटवर्क अपने उथले और चौड़े समकक्षों से बेहतर प्रदर्शन करते हैं।

प्रमुख डिज़ाइन विशेषताएँ

VGGNet का मुख्य डिज़ाइन सिद्धांत स्ट्राइड 1 के साथ छोटे 3x3 कन्वोल्यूशनल फिल्टर का लगातार उपयोग है। ऐसे दो कन्वोल्यूशन को स्टैक करने से एकल 5x5 फिल्टर के समान रिसेप्टिव फील्ड मिलता है, जबकि कम पैरामीटर का उपयोग होता है: दो 3x3 परतें 18·c² पैरामीटर का उपयोग करती हैं, जबकि एक 5x5 परत 25·c² का उपयोग करती है, जहाँ c चैनलों की संख्या है। यह पैरामीटर कमी अधिक परतों की अनुमति देती है, बिना गणना या ओवरफिटिंग में आनुपातिक वृद्धि के।

नेटवर्क एक नियमित संरचना का पालन करता है, जिसमें इनपुट छवि (आमतौर पर एक निश्चित आकार, जैसे 224x224 पिक्सेल) कन्वोल्यूशन चरणों के अनुक्रम से गुजरती है। प्रत्येक चरण में एक या अधिक 3x3 कन्वोल्यूशन होते हैं, उसके बाद स्थानिक आयामों को आधा करने के लिए स्ट्राइड 2 के साथ एक 2x2 मैक्स-पूलिंग परत होती है। चैनल की संख्या गहराई के साथ एक रैखिक पैटर्न में बढ़ती है: 64 से शुरू होकर, 128, 256, और 512 तक दोगुनी होती है, अंतिम चरणों में 512 चैनल का उपयोग होता है। उदाहरण के लिए, VGG-19 कॉन्फ़िगरेशन (मूल पेपर में E के रूप में दर्शाया गया) में 16 कन्वोल्यूशनल परतें और 3 पूरी तरह से जुड़ी परतें (कुल 19 वजन परतों के लिए) और 144 मिलियन पैरामीटर शामिल हैं।

वेरिएंट और पैरामीटर

VGG पेपर ने कई कॉन्फ़िगरेशन पेश किए, जिन्हें A से E तक लेबल किया गया, जो गहराई में भिन्न थे। दो सबसे सामान्य हैं VGG-16 (कॉन्फ़िगरेशन D, जिसमें 13 कन्वोल्यूशनल परतें और 3 पूरी तरह से जुड़ी परतें हैं) और VGG-19 (कॉन्फ़िगरेशन E, जिसमें 16 कन्वोल्यूशनल परतें और 3 पूरी तरह से जुड़ी परतें हैं)। इन मॉडलों में क्रमशः 138 मिलियन और 144 मिलियन पैरामीटर हैं। पूरी तरह से जुड़ी परतों के आकार 4096 और 4096 हैं, उसके बाद 1000 ImageNet वर्गों के अनुरूप 1000 इकाइयों वाली एक अंतिम परत है।

आर्किटेक्चर को वर्गीकरण के लिए डिज़ाइन किया गया था, लेकिन इसकी सामान्य मॉड्यूलरिटी के कारण, इसे वस्तु पहचान जैसे अन्य कार्यों के लिए अनुकूलित किया जा सकता था, जहाँ यह Fast R-CNN फ्रेमवर्क के लिए एक आधार नेटवर्क के रूप में कार्य करता था, और न्यूरल स्टाइल ट्रांसफर के लिए, जहाँ इसे एक फीचर एक्सट्रैक्टर के रूप में उपयोग किया गया था।

प्रभाव और विरासत

VGGNet डीप लर्निंग अनुसंधान में एक महत्वपूर्ण मील का पत्थर था। इसका सरल, मॉड्यूलर डिज़ाइन इसे तुलना के लिए एक आसान आधार रेखा बनाता था, और इसे ResNet पेपर और कई अन्य अध्ययनों में एक संदर्भ के रूप में उपयोग किया गया। मानक कन्वोल्यूशनल कर्नेल आकारों को बड़े (जैसे AlexNet के 11x11 कर्नेल) से 3x3 में बदलने में इसका योगदान केवल 2022 में ConvNext आर्किटेक्चर के साथ बहुत बाद में संशोधित किया गया।

Inception, ResNet और DenseNet की शुरुआत के बाद यह आर्किटेक्चर अप्रचलित हो गया, जिन्होंने बेहतर प्रदर्शन या दक्षता की पेशकश की। हालाँकि, इसकी सरलता एक शिक्षण उपकरण और आधार रेखा के रूप में बनी रही। 2021 में पेश किया गया RepVGG आर्किटेक्चर, एक अद्यतन संस्करण है जो बेहतर अनुमान गति के लिए पुनर्पैरामीट्रिज्ड ब्लॉक के साथ सरल VGG-शैली डिज़ाइन पर पुनर्विचार करता है।

VGGNet कंप्यूटर विज़न और छवि पहचान के संदर्भ में भी ऐतिहासिक रूप से महत्वपूर्ण था, और यह कन्वोल्यूशनल नेटवर्क में गहराई के मूल्य को प्रदर्शित करने में सहायक था, जिसने शैक्षणिक और वाणिज्यिक क्षेत्र के डिज़ाइनों की एक पीढ़ी को प्रभावित किया। ऑक्सफोर्ड विश्वविद्यालय में इसका विकास और मानक डीप लर्निंग लाइब्रेरीज़ (जैसे पूर्व-प्रशिक्षित मॉडल के माध्यम से) में इसका समावेश इसे व्यापक रूप से सुलभ बनाता था। VGGNet की सफलता ने छवि प्रसंस्करण में डीप लर्निंग के उदय में योगदान दिया और इसे आर्टिफिशियल इंटेलिजेंस और मशीन लर्निंग जैसे शब्दों के साथ संरेखित किया।

VGGNet श्रृंखला तकनीकी साहित्य में सबसे अधिक संदर्भित आर्किटेक्चर में से एक बनी हुई है, जो बाद के मॉडलों की एक श्रृंखला के लिए एक टेम्पलेट प्रदान करती है और विभिन्न अध्ययनों में एक सामान्य मूल्यांकन बेंचमार्क के रूप में कार्य करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:convolutional-network·image-classification·deep-learning·oxford-university
इस पृष्ठ को अंतिम बार संपादित किया गया 8 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास