कैप्सूल न्यूरल नेटवर्क

अंग्रेज़ी से अनुवादित

कैप्सूल न्यूरल नेटवर्क (CapsNet) एक प्रकार का कृत्रिम न्यूरल नेटवर्क है जो कैप्सूल नामक संरचनाओं को जोड़कर पदानुक्रमित संबंधों का मॉडल बनाता है, जो किसी इकाई की उपस्थिति और मुद्रा का प्रतिनिधित्व करने वाले वेक्टर आउटपुट करते हैं, जिसका उद्देश्य जैविक न्यूरल संगठन की बेहतर नकल करना है।

एक कैप्सूल न्यूरल नेटवर्क (CapsNet) एक प्रकार का कृत्रिम तंत्रिका नेटवर्क है जिसका उपयोग मशीन लर्निंग में डेटा में पदानुक्रमित संबंधों को बेहतर ढंग से मॉडल करने के लिए किया जाता है, विशेष रूप से छवि पहचान में। यह दृष्टिकोण कैप्सूल नामक संरचनाओं को पेश करके जैविक तंत्रिका संगठन की अधिक निकटता से नकल करने का प्रयास करता है, जो न्यूरॉन्स के समूह हैं जो सामूहिक रूप से किसी इकाई की उपस्थिति की संभावना और उसकी मुद्रा (जैसे स्थिति, आकार और अभिविन्यास) दोनों को एन्कोड करते हैं। CapsNets को पारंपरिक कन्वोल्यूशनल न्यूरल नेटवर्क (CNNs) की सीमाओं को संबोधित करने के लिए विकसित किया गया था, विशेष रूप से पूलिंग परतों पर उनकी निर्भरता और वस्तु भागों के बीच स्थानिक संबंधों को संभालने में उनकी कठिनाई।

CapsNets इस तथ्य का लाभ उठाते हैं कि जबकि दृष्टिकोण परिवर्तन पिक्सेल स्तर पर गैर-रेखीय प्रभाव डालते हैं, वे भाग/वस्तु स्तर पर रेखीय प्रभाव डालते हैं। यह गुण नेटवर्क को उसकी मुद्रा की परवाह किए बिना वस्तुओं को पहचानने की अनुमति देता है, जैसे कि कई भागों से बनी वस्तु के प्रतिपादन को उलटना। अन्य लाभों के अलावा, CapsNets छवि पहचान में "पिकासो समस्या" को संबोधित करते हैं, जहां छवियों में सभी सही भाग होते हैं लेकिन गलत स्थानिक संबंधों में (जैसे, एक चेहरा जिसमें आंख और मुंह बदल दिए गए हों)।

इतिहास

कैप्सूल नेटवर्क की अवधारणा 2000 में वापस जाती है, जब जेफ्री हिंटन और सहयोगियों ने एक इमेजिंग प्रणाली का वर्णन किया था जो पार्स ट्री का उपयोग करके विभाजन और पहचान को एक एकल अनुमान प्रक्रिया में जोड़ती थी। यह प्रणाली, जिसे विश्वसनीयता नेटवर्क कहा जाता है, अव्यक्त चर और संभावित पार्स ट्री पर संयुक्त वितरण को मॉडल करती थी और MNIST हस्तलिखित अंक डेटाबेस पर उपयोगी साबित हुई। हिंटन के मूल विचार में, एक मिनीकॉलम एक बहुआयामी इकाई का प्रतिनिधित्व और पता लगाएगा।

कैप्सूल नेटवर्क के लिए एक गतिशील रूटिंग तंत्र 2017 में हिंटन और उनकी टीम द्वारा पेश किया गया था। इस दृष्टिकोण को MNIST पर त्रुटि दर कम करने और प्रशिक्षण सेट आकार कम करने का दावा किया गया था, जिसमें अत्यधिक ओवरलैप किए गए अंकों पर CNN की तुलना में काफी बेहतर परिणाम थे। तब से, CapsNets का विभिन्न अनुप्रयोगों के लिए अध्ययन किया गया है, हालांकि उन्हें ट्रांसफॉर्मर जैसे अन्य आर्किटेक्चर की तरह व्यापक रूप से नहीं अपनाया गया है।

परिवर्तन

कंप्यूटर विज़न में, परिवर्तनों को समझना महत्वपूर्ण है। एक अपरिवर्तनीय एक वस्तु गुण है जो परिवर्तन के तहत नहीं बदलता है, जैसे स्थानांतरित होने पर एक वृत्त का क्षेत्रफल। एक समविभाज्य एक गुण है जो अनुमानित रूप से बदलता है, जैसे वृत्त के साथ चलने वाला वृत्त का केंद्र। एक गैर-समविभाज्य एक गुण है जो अनुमानित रूप से नहीं बदलता है, जैसे एक वृत्त की परिधि जब एक दीर्घवृत्त में बदल जाती है।

वस्तु पहचान के लिए, किसी वस्तु का वर्ग आमतौर पर कई परिवर्तनों पर अपरिवर्तनीय होता है (एक बिल्ली स्थानांतरित या स्केल होने पर बिल्ली बनी रहती है), लेकिन अन्य गुण समविभाज्य होते हैं, जैसे स्केल होने पर बिल्ली का आयतन। समविभाज्य गुण, जिनमें स्थानिक संबंध शामिल हैं, एक मुद्रा में कैप्चर किए जाते हैं, जो अनुवाद, रोटेशन, स्केल और प्रतिबिंब का वर्णन करता है।

अनुपयोगी CapsNets एक वस्तु और उसकी मुद्रा के बीच एक वैश्विक रेखीय मैनिफोल्ड को वजन के मैट्रिक्स के रूप में सीखते हैं। यह नेटवर्क को स्थानिक संबंधों को शामिल करके वस्तु को पहचानना सीखने के बजाय उसकी मुद्रा से स्वतंत्र रूप से वस्तु की पहचान करने की अनुमति देता है। मुद्रा में गैर-स्थानिक गुण, जैसे रंग, भी शामिल हो सकते हैं। वस्तु को मैनिफोल्ड से गुणा करने से वस्तु अंतरिक्ष में स्थित होती है।

पूलिंग

CapsNets पारंपरिक CNNs की पूलिंग परत रणनीति को अस्वीकार करते हैं, जो उच्च परतों पर संसाधित विवरण की मात्रा को कम करती है। पूलिंग अनुवादात्मक अपरिवर्तनीयता प्रदान करती है और अधिक फीचर प्रकारों की अनुमति देती है, लेकिन CapsNet समर्थकों का तर्क है कि पूलिंग के कई नुकसान हैं: यह एक आंतरिक समन्वय फ्रेम की कमी से जैविक आकार धारणा का उल्लंघन करता है; यह समविभाज्यता (उस जानकारी को अलग करना) के बजाय अपरिवर्तनीयता (स्थितीय जानकारी को त्यागना) प्रदान करता है; यह छवि विविधताओं के अंतर्निहित रेखीय मैनिफोल्ड को अनदेखा करता है; यह स्थिर रूप से रूट करता है बजाय संभावित "खोजों" को उन विशेषताओं तक संचार करने के जो उनकी सराहना कर सकते हैं; और यह उन सूचनाओं को हटाकर निकटवर्ती फीचर डिटेक्टरों को नुकसान पहुंचाता है जिन पर वे निर्भर हैं।

पूलिंग के बजाय, CapsNets परतों के बीच जानकारी को गतिशील रूप से निर्देशित करने के लिए समझौते द्वारा रूटिंग का उपयोग करते हैं, विस्तृत स्थानिक जानकारी को संरक्षित करते हैं।

कैप्सूल

एक कैप्सूल न्यूरॉन्स का एक सेट है जो व्यक्तिगत रूप से एक प्रकार की वस्तु के विभिन्न गुणों, जैसे स्थिति, आकार और रंग के लिए सक्रिय होते हैं। औपचारिक रूप से, एक कैप्सूल एक गतिविधि वेक्टर उत्पन्न करता है जिसमें प्रति न्यूरॉन एक तत्व होता है, जो उस न्यूरॉन का इंस्टेंटिएशन मान (जैसे, रंग) रखता है। ग्राफिक्स प्रोग्राम वस्तुओं को आकर्षित करने के लिए इंस्टेंटिएशन मानों का उपयोग करते हैं, और CapsNets इन्हें इनपुट से प्राप्त करने का प्रयास करते हैं। किसी इकाई की उपस्थिति की संभावना वेक्टर की लंबाई है, जबकि वेक्टर का अभिविन्यास कैप्सूल के गुणों को मापता है।

पारंपरिक कृत्रिम न्यूरॉन्स एक अदिश सक्रियण आउटपुट करते हैं, लेकिन CapsNets अदिश-आउटपुट फीचर डिटेक्टरों को वेक्टर-आउटपुट कैप्सूल और अधिकतम-पूलिंग को समझौते द्वारा रूटिंग से बदल देते हैं। क्योंकि कैप्सूल स्वतंत्र हैं, जब कई कैप्सूल सहमत होते हैं, सही पहचान की संभावना बहुत अधिक होती है। उदाहरण के लिए, छह-आयामी इकाई पर विचार करने वाले दो कैप्सूलों का एक न्यूनतम समूह संयोग से 10% के भीतर केवल दस लाख परीक्षणों में एक बार सहमत होगा; संयोग सहमति की संभावना अधिक आयामों के साथ तेजी से घटती है।

उच्च-परत कैप्सूल निचली-परत कैप्सूल से आउटपुट लेते हैं और उन लोगों को स्वीकार करते हैं जिनके आउटपुट क्लस्टर होते हैं। एक क्लस्टर उच्च कैप्सूल को इकाई उपस्थिति की उच्च संभावना और उच्च-आयामी (20-50+) मुद्रा आउटपुट करने का कारण बनता है। उच्च-स्तरीय कैप्सूल आउटलायर को अनदेखा करते हैं, क्लस्टर पर ध्यान केंद्रित करते हैं, जैसे क्लासिक डिजिटल छवि प्रसंस्करण से हफ ट्रांसफॉर्म, RHT और RANSAC।

समझौते द्वारा रूटिंग

समझौते द्वारा रूटिंग वह तंत्र है जिसके द्वारा एक कैप्सूल (बच्चा) से आउटपुट अगली परत (माता-पिता) में कैप्सूल को बच्चे की माता-पिता के आउटपुट की भविष्यवाणी करने की क्षमता के आधार पर रूट किए जाते हैं। कुछ पुनरावृत्तियों में, प्रत्येक माता-पिता का आउटपुट कुछ बच्चों से भविष्यवाणियों के साथ अभिसरण कर सकता है और दूसरों से विचलन कर सकता है, यह दर्शाता है कि वह माता-पिता मौजूद है या अनुपस्थित है।

प्रत्येक संभावित माता-पिता के लिए, प्रत्येक बच्चा अपने आउटपुट को बैकप्रॉपैगेशन द्वारा प्रशिक्षित वजन मैट्रिक्स से गुणा करके एक भविष्यवाणी वेक्टर की गणना करता है। माता-पिता का आउटपुट तब भविष्यवाणियों के भारित योग के रूप में गणना की जाती है, जहां वजन संभावना का प्रतिनिधित्व करते हैं कि एक बच्चा उस माता-पिता से संबंधित है। एक बच्चा जिसकी भविष्यवाणियां परिणामी आउटपुट के करीब हैं, वह उस माता-पिता के साथ अपने युग्मन गुणांक को बढ़ाता है, जबकि दूसरों के लिए इसे घटाता है। यह पुनरावृत्त प्रक्रिया नेटवर्क को गतिशील रूप से संसाधनों को आवंटित करने और पहचान सटीकता में सुधार करने की अनुमति देती है।

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-neural-networks·machine-learning·computer-vision·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास