GoogLeNet, जिसे बाद में Inception v1 नाम दिया गया, एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) है जो कंप्यूटर विज़न के लिए है, जिसे 2014 में Google के शोधकर्ताओं द्वारा पेश किया गया था। इसने ImageNet Large-Scale Visual Recognition Challenge 2014 (ILSVRC14) जीता, जिससे छवि वर्गीकरण में त्रुटि दर में काफी कमी आई। यह वास्तुकला ऐतिहासिक रूप से महत्वपूर्ण थी क्योंकि यह एक प्रारंभिक CNN थी जो स्टेम (डेटा इन्जेस्ट), बॉडी (डेटा प्रोसेसिंग), और हेड (पूर्वानुमान) को अलग करती है, एक डिज़ाइन जो अधिकांश आधुनिक CNN आर्किटेक्चर में बना हुआ है।
"GoogLeNet" नाम LeNet के प्रति सम्मान था, जो 1998 में Yann LeCun द्वारा बनाया गया CNN था, क्योंकि दोनों CNN हैं। टीम ने इसे "Inception" भी कहा, जो "हमें और गहराई में जाना होगा" इंटरनेट मीम के बाद था, जो 2010 की फिल्म Inception का एक वाक्यांश है। बाद में संस्करण जारी होने के कारण, मूल वास्तुकला का नाम बदलकर "Inception v1" रखा गया। मॉडल और कोड Apache 2.0 लाइसेंस के तहत GitHub पर जारी किए गए थे।
आर्किटेक्चर और प्रमुख नवाचार
Inception v1 एक गहरा CNN है जो 22 परतों से बना है, जिनमें से अधिकांश "Inception मॉड्यूल" हैं। मूल पेपर ने Inception मॉड्यूल को Network in Network दृष्टिकोण और Arora एट अल. (2014) के काम का "तार्किक चरमोत्कर्ष" बताया। प्रत्येक Inception मॉड्यूल विभिन्न आकारों (1x1, 3x3, 5x5) के कई कन्वोल्यूशनल फिल्टर और पूलिंग को समानांतर में लागू करता है, फिर उनके आउटपुट को जोड़ता है, जिससे नेटवर्क विभिन्न पैमानों पर विशेषताओं को पकड़ सकता है।
अपनी गहराई के कारण, Inception v1 को वैनिशिंग ग्रेडिएंट समस्या का सामना करना पड़ा। टीम ने नेटवर्क के भीतर एक-तिहाई और दो-तिहाई गहराई पर दो "सहायक क्लासिफायर" डालकर इसे संबोधित किया। हानि फ़ंक्शन तीनों क्लासिफायर का भारित योग था: L = 0.3 L_aux1 + 0.3 L_aux2 + L_real। प्रशिक्षण पूरा होने के बाद इन सहायक क्लासिफायर को हटा दिया गया। इस समस्या को बाद में ResNet आर्किटेक्चर द्वारा अधिक मौलिक रूप से हल किया गया।
वास्तुकला में तीन भाग एक दूसरे के ऊपर खड़े होते हैं:
- स्टेम (डेटा इन्जेस्ट): पहली कुछ कन्वोल्यूशनल परतें छवियों को छोटे आकार में डाउनस्केल करने के लिए डेटा प्रीप्रोसेसिंग करती हैं।
- बॉडी (डेटा प्रोसेसिंग): अगले कई Inception मॉड्यूल डेटा प्रोसेसिंग का अधिकांश कार्य करते हैं।
- हेड (पूर्वानुमान): अंतिम पूरी तरह से जुड़ी परत और सॉफ्टमैक्स छवि वर्गीकरण के लिए संभाव्यता वितरण उत्पन्न करता है।
Inception v2
Inception v2 2015 में जारी किया गया था, एक पेपर में जो बैच नॉर्मलाइज़ेशन प्रस्तावित करने के लिए अधिक प्रसिद्ध है। इसमें 13.6 मिलियन पैरामीटर थे। इसने Inception v1 में बैच नॉर्मलाइज़ेशन जोड़कर सुधार किया और ड्रॉपआउट और लोकल रिस्पॉन्स नॉर्मलाइज़ेशन को हटा दिया, जिसे शोधकर्ताओं ने पाया कि बैच नॉर्मलाइज़ेशन का उपयोग करने पर अनावश्यक हो गया।
Inception v3
Inception v3 2016 में जारी किया गया था। इसने फैक्टराइज़्ड कन्वोल्यूशन का उपयोग करके Inception v2 में सुधार किया। उदाहरण के लिए, एक एकल 5x5 कन्वोल्यूशन को दो स्टैक्ड 3x3 कन्वोल्यूशन में फैक्टर किया जा सकता है, दोनों का रिसेप्टिव फील्ड आकार 5x5 है। 5x5 कर्नेल में 25 पैरामीटर होते हैं जबकि फैक्टराइज़्ड संस्करण में 18 होते हैं, जिससे फैक्टराइज़्ड संस्करण अधिक पैरामीटर-कुशल बनता है। टीम ने अनुभवजन्य रूप से पाया कि फैक्टराइज़्ड कन्वोल्यूशन ने प्रदर्शन में मदद की।
इसने एक कन्वोल्यूशनल परत और एक पूलिंग परत के आउटपुट को जोड़कर आयाम कमी का एक रूप भी पेश किया। उदाहरण के लिए, 35x35x320 आकार का एक टेंसर स्ट्राइड-2 कन्वोल्यूशन द्वारा 17x17x320 तक डाउनस्केल किया जा सकता है, और पूल आकार 2x2 के साथ मैक्सपूलिंग द्वारा 17x17x320 तक, जिन्हें फिर 17x17x640 में जोड़ा जाता है।
Inception v3 ने प्रशिक्षण के दौरान सबसे निचले सहायक क्लासिफायर को भी हटा दिया, यह पाते हुए कि सहायक हेड नियमितीकरण के एक रूप के रूप में काम करता है। इसके अतिरिक्त, इसने लेबल-स्मूथिंग नियमितीकरण प्रस्तावित किया: लेबल c वाली छवि के लिए, एक-हॉट वितरण δ_c की भविष्यवाणी करने के बजाय, मॉडल एक स्मूथ वितरण (1 - ε)δ_c + ε/K की भविष्यवाणी करता है, जहाँ K कुल वर्गों की संख्या है।
Inception v4 और Inception ResNet
2017 में, टीम ने Inception v4, Inception ResNet v1, और Inception ResNet v2 जारी किए। Inception v4 एक वृद्धिशील अपडेट था जिसमें और भी अधिक फैक्टराइज़्ड कन्वोल्यूशन और अन्य जटिलताएँ थीं जो अनुभवजन्य रूप से बेंचमार्क में सुधार करने के लिए पाई गईं। Inception ResNet v1 और v2 दोनों Inception v4 के संशोधन हैं, जहाँ प्रत्येक Inception मॉड्यूल में अवशिष्ट कनेक्शन जोड़े जाते हैं, जो ResNet आर्किटेक्चर से प्रेरित हैं।
Xception
Xception ("Extreme Inception") 2017 में प्रकाशित हुआ था। यह अवशिष्ट कनेक्शन के साथ डेप्थवाइज़ सेपरेबल कन्वोल्यूशन परतों का एक रैखिक स्टैक है। डिज़ाइन इस परिकल्पना पर प्रस्तावित किया गया था कि CNN में, फीचर मैप्स में क्रॉस-चैनल सहसंबंध और स्थानिक सहसंबंध पूरी तरह से अलग किए जा सकते हैं। प्रत्येक Xception नेटवर्क को प्रशिक्षित करने में 60 K80 GPU पर 3 दिन लगे, या लगभग 0.5 पेटाफ्लॉप-दिन।
Inception परिवार कंप्यूटर विज़न के लिए डीप लर्निंग के विकास में अत्यधिक प्रभावशाली रहा है, और इसके वास्तुशिल्प सिद्धांत आधुनिक CNN डिज़ाइन को सूचित करते रहते हैं।