कन्वोल्यूशनल न्यूरल नेटवर्क

अंग्रेज़ी से अनुवादित

एक कन्वोल्यूशनल न्यूरल नेटवर्क एक न्यूरल नेटवर्क आर्किटेक्चर है जो साझा, स्थानीयकृत फिल्टर का उपयोग करता है, जो इसे छवियों जैसे ग्रिड-संरचित डेटा को संसाधित करने में विशेष रूप से प्रभावी बनाता है।

एक कन्वोल्यूशनल न्यूरल नेटवर्क, या CNN, एक तंत्रिका-नेटवर्क वास्तुकला है जो कन्वोल्यूशनल परतों के इर्द-गिर्द बनी होती है, जो इनपुट पर छोटे, साझा फिल्टर लगाती हैं, जिससे यह ग्रिड-संरचित डेटा जैसे कि छवियों के लिए विशेष रूप से प्रभावी होती है, जहाँ पास के पिक्सेल संबंधित होते हैं और उपयोगी पैटर्न, जैसे कि किनारे या बनावट, फ्रेम में कहीं भी दिख सकते हैं। समान फिल्टर भार को हर स्थानिक स्थान पर पुनः उपयोग करके, CNN को तुलनीय आकार के पूर्ण रूप से जुड़े नेटवर्क की तुलना में कहीं कम पैरामीटर की आवश्यकता होती है और वे स्वाभाविक रूप से यह धारणा एन्कोड करते हैं कि किसी छवि का अर्थ उसकी सामग्री के स्थानांतरण से काफी हद तक अपरिवर्तित रहता है, एक गुण जिसे अनुवाद अपरिवर्तनशीलता कहा जाता है।

इतिहास

वास्तुकला की वैचारिक जड़ें कुनिहिको फुकुशिमा के नियोकॉग्निट्रॉन तक जाती हैं, जो दृश्य प्रांतस्था का 1980 का पदानुक्रमित मॉडल है, जिसका वर्णन कुनिहिको फुकुशिमा द्वारा किया गया है, जिसने प्रशिक्षण के लिए बैकप्रोपेगेशन का उपयोग किए बिना स्तरित फीचर पहचान की शुरुआत की। यान लेकुन ने 1980 के दशक के अंत में कन्वोल्यूशनल परतों को बैकप्रोपेगेशन के साथ जोड़ा, जिससे LeNet का निर्माण हुआ, जो 1990 के दशक के मध्य तक व्यावसायिक तैनाती में बैंक चेक पर हस्तलिखित अंकों को पढ़ सकता था, जो गहन-शिक्षण की सबसे प्रारंभिक व्यावहारिक सफलताओं में से एक था। CNN लगभग दो दशकों तक एक विशेष उपकरण बने रहे, जब तक कि 2012 में, एलेक्सनेट, जिसे एलेक्स क्रिज़ेव्स्की ने इल्या सुत्स्केवर और जेफ्री हिंटन के साथ डिज़ाइन किया था, ने GPU पर प्रशिक्षित एक गहरे CNN का उपयोग करके ILSVRC-2012 इमेजनेट प्रतियोगिता बड़े अंतर से जीती, एक घटना जिसे व्यापक रूप से आधुनिक गहन शिक्षण उछाल को प्रज्वलित करने का श्रेय दिया जाता है।

वास्तुकला

एक विशिष्ट CNN वैकल्पिक कन्वोल्यूशनल परतों को जोड़ता है, जो सीखे गए फिल्टर का उपयोग करके स्थानीय पैटर्न का पता लगाती हैं, और पूलिंग परतें, जो स्थानिक रिज़ॉल्यूशन को कम करती हैं जबकि सबसे मजबूत पहचाने गए फीचर को बनाए रखती हैं, धीरे-धीरे प्रारंभिक परतों में किनारों और रंगों जैसे निम्न-स्तरीय पैटर्न से गहरी परतों में चेहरे या वस्तुओं जैसी उच्च-स्तरीय, अर्थपूर्ण अवधारणाओं तक निर्माण करती हैं। अंतिम परतें आमतौर पर पूर्ण रूप से जुड़ी होती हैं, निकाले गए फीचर को आउटपुट वर्गों में मैप करती हैं। बाद की वास्तुकलाएँ जैसे कि VGGNet, ResNet, और Inception ने गहराई को कहीं अधिक बढ़ाया, जिसमें ResNet के 2015 के अवशिष्ट, या स्किप, कनेक्शन के परिचय ने लुप्त-ढाल समस्या को हल किया जिसने पहले बहुत गहरे CNN को सामान्य ग्रेडिएंट-डिसेंट के साथ प्रशिक्षित करना कठिन बना दिया था।

अनुप्रयोग

CNN कंप्यूटर-विज़न कार्यों के लिए डिफ़ॉल्ट वास्तुकला बन गए, जिनमें छवि वर्गीकरण, वस्तु पहचान, अर्थपूर्ण विभाजन, और चेहरे की पहचान शामिल हैं, और वे स्व-ड्राइविंग धारणा प्रणालियों, चिकित्सा छवि विश्लेषण, और प्रारंभिक जनरेटिव-एडवरसैरियल-नेटवर्क डिज़ाइनों के घटकों को रेखांकित करते हैं, जहाँ CNN आमतौर पर जनरेटर और विभेदक दोनों बनाते हैं। उन्हें दृष्टि के बाहर भी लागू किया गया है, उदाहरण के लिए ऑडियो स्पेक्ट्रोग्राम और कुछ पाठ वर्गीकरण कार्यों के लिए, जहाँ भी डेटा में एक स्थानीय, ग्रिड-जैसी संरचना होती है जिसका एक साझा फिल्टर लाभ उठा सकता है।

सापेक्ष प्रभुत्व में गिरावट

लगभग 2020 के बाद से, विज़न ट्रांसफॉर्मर, जो ट्रांसफॉर्मर वास्तुकला और इसके ध्यान तंत्र को कन्वोल्यूशनल फिल्टर के बजाय छवि पैच के लिए अनुकूलित करते हैं, ने कई बड़े पैमाने के विज़न बेंचमार्क पर CNN प्रदर्शन को बराबर या पार कर लिया है, विशेष रूप से बहुत बड़े डेटासेट पर प्रशिक्षित होने पर, जिससे बहस छिड़ गई है कि क्या कन्वोल्यूशन की अंतर्निहित स्थानिक धारणाएँ आवश्यक बनी हुई हैं जब पर्याप्त डेटा और कंप्यूट उपलब्ध हो। फिर भी CNN व्यवहार में व्यापक रूप से उपयोग में बने हुए हैं, विशेष रूप से संसाधन-सीमित या एज-एआई सेटिंग्स में, क्योंकि उनके प्रेरक पूर्वाग्रह उन्हें सीमित प्रशिक्षण डेटा होने पर ट्रांसफॉर्मर की तुलना में अधिक डेटा-कुशल बनाते हैं, और वे बड़े बहु-मोडल सिस्टम के अंदर एन्कोडर के रूप में काम करना जारी रखते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·computer-vision·neural-networks
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास