ConvNeXt परिवार शुद्ध कन्वोल्यूशनल न्यूरल नेटवर्क आर्किटेक्चर का एक समूह है, जिसे 2022 में फेसबुक एआई रिसर्च (अब मेटा एआई) के शोधकर्ताओं द्वारा पेश किया गया था। इसे पारंपरिक कन्वोल्यूशनल नेटवर्क और विज़न ट्रांसफॉर्मर (ViTs) के बीच प्रदर्शन अंतर को कम करने के लिए डिज़ाइन किया गया था, जबकि कन्वोल्यूशन की सरलता और दक्षता को बनाए रखा गया था। यह नाम "कन्वोल्यूशन" और "नेक्स्ट" का एक मिश्रित शब्द है, जो क्लासिक ConvNet डिज़ाइनों जैसे ResNet के आधुनिक उत्तराधिकारी के रूप में इसकी भूमिका को दर्शाता है।
यह आर्किटेक्चर झुआंग लियू, हानज़ी माओ, चाओ-युआन वू, क्रिस्टोफ फीचटेनहोफर, ट्रेवर डैरेल और साइनिंग ज़ी द्वारा लिखित पेपर "ए कन्वनेट फॉर द 2020s" में प्रस्तावित किया गया था। इस कार्य ने ट्रांसफॉर्मर से डिज़ाइन रणनीतियों को शामिल करके मानक ResNet को व्यवस्थित रूप से आधुनिक बनाया, जैसे कि पैचिफाइड स्टेम, डेप्थवाइज़ कन्वोल्यूशन, इनवर्टेड बॉटलनेक ब्लॉक और बड़े कर्नेल आकार। परिणामस्वरूप मॉडलों का एक परिवार तैयार हुआ जो छवि वर्गीकरण, वस्तु पहचान और सिमेंटिक सेगमेंटेशन कार्यों में विज़न ट्रांसफॉर्मर की सटीकता को मिलाता है या उससे अधिक करता है, जबकि कई कॉन्फ़िगरेशन में कम पैरामीटर और FLOPs का उपयोग करता है।
डिज़ाइन सिद्धांत
ConvNeXt एक मानक ResNet-50 से शुरू होता है और नियंत्रित प्रयोगों के माध्यम से सत्यापित वृद्धिशील संशोधनों की एक श्रृंखला लागू करता है। मुख्य परिवर्तनों में शामिल हैं:
- पैचिफाई स्टेम: स्ट्राइड 2 के साथ प्रारंभिक 7x7 कन्वोल्यूशनल परत को स्ट्राइड 4 के साथ गैर-अतिव्यापी 4x4 कन्वोल्यूशन द्वारा प्रतिस्थापित किया जाता है, जो विज़न ट्रांसफॉर्मर में पैच एम्बेडिंग के समान है।
- डेप्थवाइज़ कन्वोल्यूशन: प्रत्येक ब्लॉक में 3x3 कन्वोल्यूशन को डेप्थवाइज़ कन्वोल्यूशन से बदल दिया जाता है, जो प्रति इनपुट चैनल एक एकल फ़िल्टर लागू करता है, जिससे गणना और पैरामीटर कम हो जाते हैं।
- इनवर्टेड बॉटलनेक: ब्लॉक संरचना को चौड़ा-संकीर्ण-चौड़ा पैटर्न (विस्तार अनुपात 4) में बदल दिया जाता है, जहां 1x1 कन्वोल्यूशन चैनलों का विस्तार और संपीड़न करते हैं, जो ट्रांसफॉर्मर में MLP ब्लॉक की नकल करता है।
- बड़े कर्नेल आकार: कर्नेल आकार 3x3 से बढ़ाकर 7x7 कर दिया जाता है, जो रिसेप्टिव फील्ड और प्रदर्शन में सुधार करता है।
- कम सक्रियण फ़ंक्शन: GELU (गाऊसी एरर लीनियर यूनिट) ReLU की जगह लेता है, और सक्रियण परतों की संख्या प्रति ब्लॉक एक तक कम कर दी जाती है।
- लेयर नॉर्मलाइज़ेशन: लेयरनॉर्म पूरे नेटवर्क में बैचनॉर्म की जगह लेता है, जो ट्रांसफॉर्मर प्रथाओं के साथ संरेखित एक बदलाव है।
- अलग डाउनसैंपलिंग परतें: डाउनसैंपलिंग स्टेजों के बीच स्ट्राइड 2 के साथ 2x2 कन्वोल्यूशनल परतों का उपयोग करके की जाती है, न कि प्रत्येक स्टेज के पहले ब्लॉक में एकीकृत करके।
ये परिवर्तन धीरे-धीरे लागू किए जाते हैं, प्रत्येक चरण ImageNet पर सटीकता में सुधार करता है, जिसके परिणामस्वरूप एक ऐसा मॉडल बनता है जो मूल ResNet को महत्वपूर्ण अंतर से बेहतर प्रदर्शन करता है।
मॉडल वेरिएंट
ConvNeXt कई कॉन्फ़िगरेशन में उपलब्ध है, जो ResNet की नामकरण परंपरा का पालन करता है: ConvNeXt-T (टिनी), ConvNeXt-S (स्मॉल), ConvNeXt-B (बेस), ConvNeXt-L (लार्ज), और ConvNeXt-XL (एक्स्ट्रा लार्ज)। बेस मॉडल में लगभग 89 मिलियन पैरामीटर हैं और बाहरी डेटा के बिना ImageNet-1K पर 82.8% टॉप-1 सटीकता प्राप्त करता है। जब ImageNet-21K जैसे बड़े डेटासेट पर प्रीट्रेन किया जाता है या कमजोर पर्यवेक्षित डेटा का उपयोग किया जाता है, तो बड़े वेरिएंट 87% से अधिक टॉप-1 सटीकता तक पहुंचते हैं।
आर्किटेक्चर में ConvNeXt V2 नामक एक वेरिएंट भी शामिल है, जो 2023 में जारी किया गया था, जो स्व-पर्यवेक्षित प्रीट्रेनिंग के लिए एक पूरी तरह से कन्वोल्यूशनल मास्क्ड ऑटोएनकोडर पेश करता है। यह संस्करण नमूना दक्षता और मजबूती में सुधार करता है, कई बेंचमार्कों पर अत्याधुनिक परिणाम प्राप्त करता है।
प्रदर्शन और तुलना
ImageNet-1K वर्गीकरण बेंचमार्क पर, ConvNeXt-B 224x224 इनपुट के साथ 83.8% टॉप-1 सटीकता प्राप्त करता है, जो DeiT-B विज़न ट्रांसफॉर्मर (81.8%) से थोड़ा अधिक है और Swin ट्रांसफॉर्मर (83.5%) के बराबर है। Mask R-CNN के साथ वस्तु पहचान पर, ConvNeXt बैकबोन बॉक्स AP और मास्क AP के मामले में ResNet और Swin ट्रांसफॉर्मर दोनों से बेहतर प्रदर्शन करते हैं। UperNet के साथ सिमेंटिक सेगमेंटेशन के लिए, ConvNeXt-L ADE20K पर 53.1% mIoU प्राप्त करता है, जो Swin-L से 0.6 अंक अधिक है।
एक उल्लेखनीय लाभ यह है कि ConvNeXt मॉडल अनुमान के दौरान ट्रांसफॉर्मर की तुलना में अधिक मेमोरी-कुशल होते हैं, क्योंकि उन्हें ध्यान मैट्रिसेस संग्रहीत करने की आवश्यकता नहीं होती है। यह उन्हें एज डिवाइसों पर तैनाती और वास्तविक समय अनुप्रयोगों के लिए आकर्षक बनाता है, जिसमें एप्पल और सैमसंग जैसी कंपनियां शामिल हैं जो ऑन-डिवाइस मशीन लर्निंग के लिए अनुकूलन करती हैं।
प्रभाव और प्रभाव
ConvNeXt की शुरुआत ने प्रदर्शित किया कि कन्वोल्यूशनल नेटवर्क अप्रचलित नहीं थे और उन्हें ध्यान-आधारित आर्किटेक्चर के साथ प्रतिस्पर्धा करने के लिए आधुनिक बनाया जा सकता है। इसने बाद के शोध को प्रभावित किया जो कन्वोल्यूशन और ध्यान को जोड़ने वाले हाइब्रिड मॉडलों में, जैसे ConvNeXt V2 और विभिन्न कुशल विज़न बैकबोनों में, देखा गया। डिज़ाइन सिद्धांतों को अन्य डोमेनों में भी अपनाया गया है, जिसमें ऑडियो और वीडियो प्रोसेसिंग शामिल है, जहां आर्किचेक्चर के इंडक्टिव बायस फायदेमंद होते हैं।
MIT CSAIL और स्टैनफोर्ड एआई लैब जैसे संस्थानों के शोधकर्ताओं ने कन्वोल्यूशन और ध्यान के बीच ट्रेड-ऑफ को समझने के लिए ConvNeXt को एक प्रमुख संदर्भ के रूप में उद्धृत किया है। कोड और प्रीट्रेन मॉडल एक अनुमेय लाइसेंस के तहत ओपन-सोर्स हैं, जो शिक्षा और उद्योग में व्यापक अपनाने की सुविधा प्रदान करता है।
सीमाएं और भविष्य की दिशाएं
अपनी ताकत के बावजूद, ConvNeXt अभी भी मैन्युअल रूप से डिज़ाइन किए गए आर्किटेक्चर पर निर्भर करता है, जबकि ट्रांसफॉर्मर ने स्केलिंग कानूनों और मोडैलिटीज में एकीकृत आर्किटेक्चर से लाभ उठाया है। कुछ अध्ययनों से पता चलता है कि बहुत बड़े डेटासेट पर ट्रांसफॉर्मर की तुलना में ConvNeXt के प्रदर्शन लाभ कम हो जाते हैं, जो लंबी दूरी की निर्भरताओं को पकड़ने में उत्कृष्ट होते हैं। भविष्य के काम ने क्षमता को और बढ़ाने के लिए गतिशील कन्वोल्यूशन या मिश्रण-ऑफ-विशेषज्ञों को एकीकृत करने की खोज की है।
2024 तक, ConvNeXt कंप्यूटर विज़न में एक मजबूत बेसलाइन बना हुआ है, जिसे अक्सर कई अनुप्रयोगों में डिफ़ॉल्ट बैकबोन के रूप में उपयोग किया जाता है। इसके सिद्धांतों को FastViT और RepViT जैसे नए आर्किटेक्चर में शामिल किया गया है, जिनका उद्देश्य मोबाइल और वास्तविक समय परिदृश्यों के लिए दक्षता और सटीकता को संतुलित करना है।