[[convolutional-neural-network|कन्वोल्यूशनल न्यूरल नेटवर्क]]

अंग्रेज़ी से अनुवादित

एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) एक फीडफॉरवर्ड न्यूरल नेटवर्क है जो फिल्टर अनुकूलन के माध्यम से विशेषताएं सीखता है, और आमतौर पर छवियों जैसे ग्रिड-जैसे डेटा के लिए उपयोग किया जाता है। यह विभिन्न डेटा प्रकारों को संसाधित करने और भविष्यवाणी करने के लिए कन्वोल्यूशनल, पूलिंग और पूरी तरह से जुड़ी परतों का उपयोग करता है।

एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) एक प्रकार का फीडफॉरवर्ड न्यूरल नेटवर्क है जो फिल्टर (या कर्नेल) अनुकूलन के माध्यम से विशेषताओं को सीखता है। इस प्रकार के डीप लर्निंग नेटवर्क को कई अलग-अलग प्रकार के डेटा, जैसे पाठ, चित्र और ऑडियो, को संसाधित करने और उनसे भविष्यवाणियाँ करने के लिए लागू किया गया है। CNN कंप्यूटर विज़न और छवि प्रसंस्करण में डीप लर्निंग-आधारित दृष्टिकोणों में डी-फैक्टो मानक हैं, और हाल ही में कुछ मामलों में उन्हें Transformer (architecture) जैसी नई वास्तुकलाओं द्वारा प्रतिस्थापित किया गया है।

CNN को शिफ्ट इनवेरिएंट या स्पेस इनवेरिएंट आर्टिफिशियल न्यूरल नेटवर्क के रूप में भी जाना जाता है, जो कन्वोल्यूशन कर्नेल या फिल्टर की साझा-भार वास्तुकला पर आधारित है जो इनपुट विशेषताओं के साथ स्लाइड करते हैं और अनुवाद-समतुल्य प्रतिक्रियाएँ प्रदान करते हैं जिन्हें फीचर मैप कहा जाता है। प्रति-सहज रूप से, अधिकांश कन्वोल्यूशनल न्यूरल नेटवर्क अनुवाद के लिए इनवेरिएंट नहीं होते हैं, क्योंकि वे इनपुट पर डाउनसैंपलिंग ऑपरेशन लागू करते हैं।

वास्तुकला

एक कन्वोल्यूशनल न्यूरल नेटवर्क में एक इनपुट परत, छिपी हुई परतें और एक आउटपुट परत होती है। एक कन्वोल्यूशनल न्यूरल नेटवर्क में, छिपी हुई परतों में एक या अधिक परतें शामिल होती हैं जो कन्वोल्यूशन करती हैं। आम तौर पर, इसमें एक परत शामिल होती है जो कन्वोल्यूशन कर्नेल का परत के इनपुट मैट्रिक्स के साथ डॉट उत्पाद करती है। यह उत्पाद आमतौर पर फ्रोबेनियस आंतरिक उत्पाद होता है, और इसकी सक्रियण फ़ंक्शन आमतौर पर ReLU होती है। जैसे ही कन्वोल्यूशन कर्नेल परत के लिए इनपुट मैट्रिक्स के साथ स्लाइड करता है, कन्वोल्यूशन ऑपरेशन एक फीचर मैप उत्पन्न करता है, जो बदले में अगली परत के इनपुट में योगदान देता है। इसके बाद अन्य परतें जैसे पूलिंग परतें, पूरी तरह से जुड़ी परतें और सामान्यीकरण परतें आती हैं।

कन्वोल्यूशनल परतें

एक CNN में, इनपुट एक टेंसर होता है जिसका आकार होता है: (इनपुट की संख्या) × (इनपुट ऊँचाई) × (इनपुट चौड़ाई) × (इनपुट चैनल)। एक कन्वोल्यूशनल परत से गुजरने के बाद, छवि एक फीचर मैप में सारगर्भित हो जाती है, जिसे सक्रियण मैप भी कहा जाता है, जिसका आकार होता है: (इनपुट की संख्या) × (फीचर मैप ऊँचाई) × (फीचर मैप चौड़ाई) × (फीचर मैप चैनल)। कन्वोल्यूशनल परतें इनपुट को कन्वोल्यूट करती हैं और इसके परिणाम को अगली परत में भेजती हैं। यह दृश्य प्रांतस्था में एक न्यूरॉन की एक विशिष्ट उत्तेजना के प्रति प्रतिक्रिया के समान है। प्रत्येक कन्वोल्यूशनल न्यूरॉन केवल अपने ग्रहणशील क्षेत्र के लिए डेटा संसाधित करता है।

हालाँकि पूरी तरह से जुड़े फीडफॉरवर्ड न्यूरल नेटवर्क का उपयोग विशेषताओं को सीखने और डेटा को वर्गीकृत करने के लिए किया जा सकता है, यह वास्तुकला आम तौर पर बड़े इनपुट (जैसे उच्च-रिज़ॉल्यूशन छवियों) के लिए अव्यावहारिक है, जिसके लिए बड़ी संख्या में न्यूरॉन्स की आवश्यकता होगी क्योंकि प्रत्येक पिक्सेल एक प्रासंगिक इनपुट विशेषता है। 100 × 100 आकार की छवि के लिए एक पूरी तरह से जुड़ी परत में दूसरी परत के प्रत्येक न्यूरॉन के लिए 10,000 भार होते हैं। कन्वोल्यूशन मुक्त मापदंडों की संख्या को कम करता है, जिससे नेटवर्क को गहरा होने की अनुमति मिलती है। उदाहरण के लिए, 5 × 5 टाइलिंग क्षेत्र का उपयोग करके, प्रत्येक में समान साझा भार के साथ, केवल 25 न्यूरॉन्स की आवश्यकता होती है। साझा भार का उपयोग करने का मतलब है कि बहुत कम पैरामीटर हैं, जो पहले के न्यूरल नेटवर्क में बैकप्रोपेगेशन के दौरान देखी गई लुप्त ग्रेडिएंट और विस्फोटक ग्रेडिएंट समस्याओं से बचने में मदद करता है।

प्रसंस्करण को तेज करने के लिए, मानक कन्वोल्यूशनल परतों को डेप्थवाइज़ सेपरेबल कन्वोल्यूशनल परतों द्वारा प्रतिस्थापित किया जा सकता है, जो एक डेप्थवाइज़ कन्वोल्यूशन के बाद एक पॉइंटवाइज़ कन्वोल्यूशन पर आधारित होती हैं। डेप्थवाइज़ कन्वोल्यूशन एक स्थानिक कन्वोल्यूशन है जो इनपुट टेंसर के प्रत्येक चैनल पर स्वतंत्र रूप से लागू होता है, जबकि पॉइंटवाइज़ कन्वोल्यूशन एक मानक कन्वोल्यूशन है जो 1 × 1 कर्नेल के उपयोग तक सीमित है।

पूलिंग परतें

कन्वोल्यूशनल नेटवर्क में पारंपरिक कन्वोल्यूशनल परतों के साथ स्थानीय और/या वैश्विक पूलिंग परतें शामिल हो सकती हैं। पूलिंग परतें एक परत में न्यूरॉन क्लस्टर के आउटपुट को अगली परत में एक न्यूरॉन में संयोजित करके डेटा के आयामों को कम करती हैं। स्थानीय पूलिंग छोटे क्लस्टर को जोड़ती है, जिसमें आमतौर पर 2 × 2 जैसे टाइलिंग आकार का उपयोग किया जाता है। वैश्विक पूलिंग फीचर मैप के सभी न्यूरॉन्स पर कार्य करती है। लोकप्रिय उपयोग में दो सामान्य प्रकार की पूलिंग हैं: अधिकतम और औसत। अधिकतम पूलिंग फीचर मैप में प्रत्येक स्थानीय न्यूरॉन क्लस्टर के अधिकतम मान का उपयोग करती है, जबकि औसत पूलिंग औसत मान लेती है।

पूरी तरह से जुड़ी परतें

पूरी तरह से जुड़ी परतें एक परत में प्रत्येक न्यूरॉन को दूसरी परत में प्रत्येक न्यूरॉन से जोड़ती हैं। यह एक पारंपरिक मल्टीलेयर परसेप्ट्रॉन न्यूरल नेटवर्क (MLP) के समान है। पूरी तरह से जुड़ी परत में प्रत्येक न्यूरॉन पिछली परत के सभी न्यूरॉन्स से इनपुट प्राप्त करता है। इन इनपुट को संबंधित पूर्वाग्रहों के साथ भारित और जोड़ा जाता है, और फिर एक गैर-रेखीय परिवर्तन करने के लिए एक सक्रियण फ़ंक्शन के माध्यम से पारित किया जाता है, जिससे आउटपुट उत्पन्न होता है। चपटा मैट्रिक्स छवियों को वर्गीकृत करने के लिए एक पूरी तरह से जुड़ी परत से गुजरता है।

जैविक प्रेरणा

कन्वोल्यूशनल नेटवर्क जैविक प्रक्रियाओं से प्रेरित थे, जिसमें न्यूरॉन्स के बीच कनेक्टिविटी पैटर्न पशु दृश्य प्रांतस्था के संगठन से मिलता जुलता है। व्यक्तिगत कॉर्टिकल न्यूरॉन्स केवल दृश्य क्षेत्र के एक प्रतिबंधित क्षेत्र में उत्तेजनाओं का जवाब देते हैं जिसे ग्रहणशील क्षेत्र के रूप में जाना जाता है। विभिन्न न्यूरॉन्स के ग्रहणशील क्षेत्र आंशिक रूप से ओवरलैप होते हैं ताकि वे पूरे दृश्य क्षेत्र को कवर करें। इस जैविक सादृश्य ने कन्वोल्यूशनल परतों के डिजाइन को प्रेरित किया, जहां प्रत्येक न्यूरॉन एक स्थानीय क्षेत्र से इनपुट संसाधित करता है, ग्रहणशील क्षेत्र संरचना की नकल करता है।

नियमितीकरण और ओवरफिटिंग

फीडफॉरवर्ड न्यूरल नेटवर्क आमतौर पर पूरी तरह से जुड़े नेटवर्क होते हैं, अर्थात, एक परत में प्रत्येक न्यूरॉन अगली परत के सभी न्यूरॉन्स से जुड़ा होता है। इन नेटवर्कों की "पूर्ण कनेक्टिविटी" उन्हें डेटा को ओवरफिट करने के लिए प्रवण बनाती है। नियमितीकरण या ओवरफिटिंग को रोकने के सामान्य तरीकों में प्रशिक्षण के दौरान मापदंडों को दंडित करना (जैसे भार क्षय) या कनेक्टिविटी को ट्रिम करना (छोड़े गए कनेक्शन, ड्रॉपआउट, आदि) शामिल हैं। मजबूत डेटासेट भी संभावना बढ़ाते हैं कि CNN किसी दिए गए डेटासेट की विशेषता वाले सामान्यीकृत सिद्धांतों को सीखेंगे, न कि खराब आबादी वाले सेट के पूर्वाग्रहों को। इसके अतिरिक्त, CNN की साझा-भार वास्तुकला स्वाभाविक रूप से मापदंडों की संख्या को कम करती है, जो नियमितीकरण का एक रूप प्रदान करती है जो ओवरफिटिंग को कम करने में मदद करती है।

अनुप्रयोग

CNN के कुछ अनुप्रयोगों में छवि और वीडियो पहचान, अनुशंसा प्रणाली, छवि वर्गीकरण, छवि विभाजन, चिकित्सा छवि विश्लेषण, प्राकृतिक भाषा प्रसंस्करण, मस्तिष्क-कंप्यूटर इंटरफेस और वित्तीय समय श्रृंखला शामिल हैं। कंप्यूटर विज़न में, CNN का व्यापक रूप से वस्तु पहचान, चेहरे की पहचान और स्वायत्त ड्राइविंग जैसे कार्यों के लिए उपयोग किया गया है। प्राकृतिक भाषा प्रसंस्करण में, CNN को पाठ वर्गीकरण और भावना विश्लेषण पर लागू किया गया है, हालांकि कई ऐसे कार्यों में उन्हें बड़े पैमाने पर Transformer (architecture)-आधारित मॉडल द्वारा प्रतिस्थापित किया गया है। CNN की बहुमुखी प्रतिभा पदानुक्रमित विशेषताओं को सीखने की उनकी क्षमता से उत्पन्न होती है, निम्न-स्तरीय किनारों से उच्च-स्तरीय अर्थपूर्ण अवधारणाओं तक।

लाभ और सीमाएँ

CNN अन्य छवि वर्गीकरण एल्गोरिदम की तुलना में अपेक्षाकृत कम पूर्व-प्रसंस्करण का उपयोग करते हैं। इसका मतलब है कि नेटवर्क स्वचालित सीखने के माध्यम से फिल्टर (या कर्नेल) को अनुकूलित करना सीखता है, जबकि पारंपरिक एल्गोरिदम में ये फिल्टर हाथ से इंजीनियर किए जाते हैं। यह प्रक्रिया को सरल और स्वचालित करता है, दक्षता और स्केलेबिलिटी को बढ़ाता है, और मानव हस्तक्षेप की बाधाओं को दूर करता है। हालांकि, CNN स्वाभाविक रूप से अनुवाद इनवेरिएंट नहीं हैं, क्योंकि डाउनसैंपलिंग ऑपरेशन के कारण, जो कुछ कार्यों में एक सीमा हो सकती है। इसके अतिरिक्त, जबकि CNN कंप्यूटर विज़न में प्रमुख रहे हैं, Transformer (architecture) जैसी नई वास्तुकलाएं कुछ अनुप्रयोगों में उन्हें प्रतिस्थापित करना शुरू कर दी हैं, विशेष रूप से जब बड़े पैमाने पर डेटा और कम्प्यूटेशनल संसाधन उपलब्ध होते हैं।

अन्य न्यूरल नेटवर्क प्रकारों से संबंध

CNN Neural network का एक विशेष रूप और Deep learning वास्तुकलाओं का एक उपसमुच्चय हैं। वे पूरी तरह से जुड़े नेटवर्क से अपने कन्वोल्यूशनल और पूलिंग परतों के उपयोग में भिन्न होते हैं, जो पैरामीटर गणना को कम करते हैं और पदानुक्रमित विशेषता निष्कर्षण को सक्षम करते हैं। Transformer (architecture) की तुलना में, जो ध्यान तंत्र पर निर्भर करते हैं, CNN स्थानीय ग्रहणशील क्षेत्रों और साझा भार का उपयोग करते हैं, जिससे वे ग्रिड-जैसे डेटा के लिए अधिक पैरामीटर-कुशल होते हैं, लेकिन अतिरिक्त संशोधनों के बिना लंबी दूरी की निर्भरता को पकड़ने में कम सक्षम होते हैं। ट्रांसफॉर्मर के उदय के बावजूद, CNN Machine learning में एक मौलिक वास्तुकला बने हुए हैं और हाइब्रिड मॉडल में उपयोग किए जाते रहते हैं जो कन्वोल्यूशनल और ध्यान-आधारित घटकों को जोड़ते हैं।

भविष्य की दिशाएँ

शोध CNN को बेहतर बनाने के लिए जारी है, जिसमें दक्षता के लिए डेप्थवाइज़ सेपरेबल कन्वोल्यूशन, लुप्त ग्रेडिएंट को संबोधित करने के लिए अवशिष्ट कनेक्शन और अन्य वास्तुकलाओं के साथ एकीकरण शामिल हैं। Batch Normalization और Dropout जैसी तकनीकें आमतौर पर प्रशिक्षण को स्थिर करने और ओवरफिटिंग को रोकने के लिए उपयोग की जाती हैं। 2020 के दशक की शुरुआत तक, CNN कंप्यूटर विज़न में एक मानक उपकरण बने हुए हैं, लेकिन उनका प्रभुत्व ट्रांसफॉर्मर-आधारित मॉडल द्वारा चुनौती दी जा रही है, विशेष रूप से बड़े पैमाने पर सेटिंग्स में। चल रहे काम का उद्देश्य दोनों दृष्टिकोणों की ताकत को जोड़ना है, जिससे विभिन्न प्रकार के अनुप्रयोगों के लिए अधिक मजबूत और कुशल मॉडल तैयार हो सकें।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·computer-vision·neural-networks
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास