कन्वोल्यूशनल परत कई तंत्रिका नेटवर्क का एक मुख्य घटक है, विशेष रूप से उन नेटवर्कों का जो छवि और सिग्नल प्रसंस्करण के लिए उपयोग किए जाते हैं। पूर्ण रूप से जुड़ी परतों के विपरीत, जो हर इनपुट न्यूरॉन को हर आउटपुट न्यूरॉन से जोड़ती हैं, एक कन्वोल्यूशनल परत सीखने योग्य फिल्टर (जिन्हें कर्नेल भी कहा जाता है) का एक सेट स्लाइडिंग-विंडो तरीके से इनपुट पर लागू करती है। यह ऑपरेशन, जिसे कन्वोल्यूशन के रूप में जाना जाता है, किनारों, कोनों, या बनावट जैसी स्थानीय विशेषताओं का पता लगाता है, और फीचर मैप उत्पन्न करता है जो दर्शाते हैं कि ये पैटर्न कहाँ होते हैं। परत का डिज़ाइन घनी परतों की तुलना में पैरामीटरों की संख्या कम करता है और अनुवाद अपरिवर्तनशीलता प्रदान करता है, जिसका अर्थ है कि एक पैटर्न को उसकी स्थिति की परवाह किए बिना पहचाना जा सकता है।
कन्वोल्यूशनल परतें जैविक दृश्य प्रांतस्था अनुसंधान से प्रेरित थीं, विशेष रूप से 1960 के दशक में डेविड हुबेल और टॉर्स्टन विज़ेल द्वारा, जिन्होंने पाया कि बिल्ली की दृश्य प्रणाली में न्यूरॉन्स स्थानीय उत्तेजनाओं पर प्रतिक्रिया करते हैं। प्रारंभिक कृत्रिम कार्यान्वयन में 1980 में कुनिहिको फुकुशिमा द्वारा नियोकॉग्निट्रॉन और बाद में 1990 के दशक में यान लेकुन द्वारा लेनेट आर्किटेक्चर शामिल हैं, जिसने हस्तलिखित अंक पहचान के लिए कन्वोल्यूशनल परतों का उपयोग किया। तब से, कन्वोल्यूशनल परतें गहन शिक्षण में सर्वव्यापी हो गई हैं, जो चिकित्सा इमेजिंग से लेकर स्वायत्त ड्राइविंग तक के अनुप्रयोगों को शक्ति प्रदान करती हैं।
संचालन और हाइपरपैरामीटर
एक कन्वोल्यूशनल परत एक इनपुट टेंसर (जैसे, कई रंग चैनलों वाली 2D छवि) लेती है और फिल्टर का एक सेट लागू करती है। प्रत्येक फिल्टर वजन का एक छोटा मैट्रिक्स है, आमतौर पर 3x3 या 5x5, जो एक निर्दिष्ट स्ट्राइड (चरण आकार) के साथ इनपुट पर स्लाइड करता है। प्रत्येक स्थिति पर, परत फिल्टर वजन और संबंधित इनपुट पैच के बीच डॉट उत्पाद की गणना करती है, जिससे एक एकल आउटपुट मान उत्पन्न होता है। परिणाम प्रत्येक फिल्टर के लिए एक 2D सक्रियण मानचित्र है, और इन मानचित्रों को गहराई आयाम के साथ स्टैक करने से आउटपुट टेंसर बनता है।
मुख्य हाइपरपैरामीटर में फिल्टर आकार, स्ट्राइड, पैडिंग और फिल्टर की संख्या शामिल हैं। पैडिंग (अक्सर शून्य-पैडिंग) आउटपुट के स्थानिक आयामों को नियंत्रित करती है, जिससे परत इनपुट आकार को संरक्षित या कम कर सकती है। स्ट्राइड डाउनसैंपलिंग को प्रभावित करता है; बड़े स्ट्राइड आउटपुट रिज़ॉल्यूशन को कम करते हैं। फिल्टर की संख्या आउटपुट फीचर मैप की गहराई निर्धारित करती है, प्रत्येक फिल्टर एक अलग प्रकार की विशेषता का पता लगाना सीखता है। कन्वोल्यूशन के बाद, गैर-रैखिकता पेश करने के लिए आमतौर पर ReLU (रेक्टिफाइड लीनियर यूनिट) जैसा एक सक्रियण फ़ंक्शन लागू किया जाता है।
पैरामीटर साझाकरण और स्थानीय कनेक्टिविटी
दो गुण कन्वोल्यूशनल परतों को पूर्ण रूप से जुड़ी परतों से अलग करते हैं: स्थानीय कनेक्टिविटी और पैरामीटर साझाकरण। स्थानीय कनेक्टिविटी का अर्थ है कि प्रत्येक आउटपुट न्यूरॉन केवल इनपुट के एक छोटे क्षेत्र से जुड़ता है, जो इस विचार को दर्शाता है कि निकटवर्ती पिक्सेल दूर वाले की तुलना में अधिक सहसंबद्ध होते हैं। पैरामीटर साझाकरण का अर्थ है कि समान फिल्टर वजन सभी स्थानिक स्थानों पर उपयोग किए जाते हैं, जिससे सीखने योग्य पैरामीटरों की संख्या नाटकीय रूप से कम हो जाती है। उदाहरण के लिए, 3 इनपुट चैनलों और 64 आउटपुट फिल्टर वाले 3x3 फिल्टर में केवल 333*64 = 1,728 वजन होते हैं, जबकि 256x256 छवि को संसाधित करने वाली पूर्ण रूप से जुड़ी परत को लाखों वजन की आवश्यकता होगी। यह दक्षता कन्वोल्यूशनल परतों को उच्च-आयामी इनपुट के लिए व्यवहार्य बनाती है और ओवरफिटिंग को रोकने में मदद करती है।
आधुनिक आर्किटेक्चर में भूमिका
कन्वोल्यूशनल परतें कई क्लासिक और समकालीन नेटवर्क आर्किटेक्चर की नींव हैं। अवशिष्ट नेटवर्क (ResNet), जिसे 2015 में काइमिंग हे और सहकर्मियों द्वारा पेश किया गया था, बहुत गहरे नेटवर्क (जैसे, 50, 101, या 152 परतें) को प्रशिक्षित करने के लिए स्किप कनेक्शन के साथ कन्वोल्यूशनल परतों का उपयोग करता है और ImageNet पर अत्याधुनिक परिणाम प्राप्त किए। U-Net आर्किटेक्चर, जो बायोमेडिकल छवि विभाजन के लिए डिज़ाइन किया गया है, स्थानिक विवरणों को संरक्षित करने के लिए स्किप कनेक्शन के साथ एन्कोडर-डिकोडर संरचना में कन्वोल्यूशनल परतों का उपयोग करता है। इसके अलावा, कन्वोल्यूशनल परतों को अक्सर प्रशिक्षण को स्थिर करने के लिए बैच सामान्यीकरण और नियमितीकरण के लिए ड्रॉपआउट के साथ जोड़ा जाता है।
छवियों से परे, कन्वोल्यूशनल परतें ऑडियो (जैसे, स्पेक्ट्रोग्राम), पाठ (जैसे, वर्ण-स्तरीय कन्वोल्यूशन), और समय-श्रृंखला डेटा पर लागू होती हैं। वे हाइब्रिड मॉडल में भी उपयोग की जाती हैं जो छवि कैप्शनिंग जैसे कार्यों के लिए ट्रांसफॉर्मर या मल्टी-हेड अटेंशन को शामिल करते हैं। जबकि ट्रांसफॉर्मर ने कई डोमेन में प्रमुखता प्राप्त की है, कन्वोल्यूशनल परतें स्थानीय फीचर निष्कर्षण और उच्च-रिज़ॉल्यूशन इनपुट के कुशल प्रसंस्करण की आवश्यकता वाले कार्यों के लिए आवश्यक बनी हुई हैं।
प्रशिक्षण और अनुकूलन
कन्वोल्यूशनल परतों को बैकप्रोपेगेशन का उपयोग करके प्रशिक्षित किया जाता है, जहां फिल्टर वजन के संबंध में ग्रेडिएंट की गणना की जाती है और नेटवर्क के माध्यम से प्रचारित किया जाता है। मानक अनुकूलक स्टोचैस्टिक ग्रेडिएंट डिसेंट (SGD) या एडम जैसे इसके वेरिएंट हैं (देखें एडम अनुकूलक)। सीखने की दर अनुसूची और वजन आरंभीकरण जैसे हाइपरपैरामीटर अभिसरण को महत्वपूर्ण रूप से प्रभावित करते हैं। डेटा वृद्धि (जैसे, यादृच्छिक क्रॉप, फ्लिप) जैसी तकनीकें सामान्यीकरण में सुधार करने में मदद करती हैं। प्रशिक्षण के दौरान, फिल्टर धीरे-धीरे तेजी से जटिल विशेषताओं का पता लगाना सीखते हैं: प्रारंभिक परतें किनारों और रंगों को पकड़ती हैं, जबकि गहरी परतें इन्हें वस्तु भागों और पूर्ण वस्तुओं में जोड़ती हैं।
सीमाएं और विकल्प
कन्वोल्यूशनल परतों में सीमाएं हैं, जिनमें एक निश्चित ग्रहणशील क्षेत्र शामिल है जो केवल गहराई के साथ बढ़ता है, जो लंबी दूरी की निर्भरता को पकड़ने के लिए अक्षम हो सकता है। उन्हें हाइपरपैरामीटर के सावधानीपूर्वक ट्यूनिंग की भी आवश्यकता होती है और वे कम्प्यूटेशनल रूप से गहन हो सकते हैं, विशेष रूप से बड़े इनपुट के लिए। विकल्पों और सुधारों में फैली हुई कन्वोल्यूशन (जो पैरामीटर बढ़ाए बिना ग्रहणशील क्षेत्र का विस्तार करती हैं), गहराई-वार पृथक कन्वोल्यूशन (दक्षता के लिए MobileNet में उपयोग किया जाता है), और ध्यान तंत्र शामिल हैं जो स्थानिक स्थितियों को गतिशील रूप से भारित करते हैं। इन विकल्पों के बावजूद, कन्वोल्यूशनल परतें गहन शिक्षण प्रणालियों में एक मजबूत और व्यापक रूप से उपयोग किया जाने वाला निर्माण खंड बनी हुई हैं, जो NVIDIA और Google Cloud जैसी कंपनियों से हार्डवेयर अनुकूलन द्वारा समर्थित हैं।