एक कैप्सूल न्यूरल नेटवर्क (CapsNet) एक मशीन लर्निंग प्रणाली है जो एक प्रकार का कृत्रिम तंत्रिका नेटवर्क (ANN) है जिसका उपयोग पदानुक्रमित संबंधों को बेहतर ढंग से मॉडल करने के लिए किया जा सकता है। यह दृष्टिकोण जैविक तंत्रिका संगठन की अधिक निकटता से नकल करने का एक प्रयास है। विचार यह है कि एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) में "कैप्सूल" नामक संरचनाएँ जोड़ी जाएँ, और उन कई कैप्सूलों के आउटपुट को पुनः उपयोग करके उच्च कैप्सूलों के लिए अधिक स्थिर (विभिन्न गड़बड़ियों के संबंध में) प्रतिनिधित्व बनाया जाए। आउटपुट एक वेक्टर है जिसमें एक अवलोकन की संभावना और उस अवलोकन के लिए एक पोज़ शामिल होता है। यह वेक्टर उदाहरण के लिए CNNs में स्थानीकरण के साथ वर्गीकरण करते समय किए जाने वाले कार्य के समान है।
अन्य लाभों के अलावा, CapsNets छवि पहचान में "पिकासो समस्या" का समाधान करते हैं: जिन छवियों में सभी सही भाग होते हैं लेकिन वे सही स्थानिक संबंध में नहीं होते हैं (उदाहरण के लिए, एक "चेहरे" में, मुँह और एक आँख की स्थिति बदल दी गई है)। छवि पहचान के लिए, CapsNets इस तथ्य का लाभ उठाते हैं कि जबकि दृष्टिकोण परिवर्तन पिक्सेल स्तर पर गैर-रेखीय प्रभाव डालते हैं, वे भाग/वस्तु स्तर पर रेखीय प्रभाव डालते हैं। इसकी तुलना कई भागों वाली वस्तु के प्रतिपादन को उलटने से की जा सकती है।
इतिहास
2000 में, जेफ्री हिंटन एट अल. ने एक इमेजिंग प्रणाली का वर्णन किया जिसने विभाजन और पहचान को पार्स ट्री का उपयोग करके एक एकल अनुमान प्रक्रिया में संयोजित किया। तथाकथित विश्वसनीयता नेटवर्क ने अव्यक्त चर और संभावित पार्स ट्री पर संयुक्त वितरण का वर्णन किया। यह प्रणाली mnist हस्तलिखित अंक डेटाबेस पर उपयोगी साबित हुई।
कैप्सूल नेटवर्क के लिए एक गतिशील रूटिंग तंत्र 2017 में हिंटन और उनकी टीम द्वारा पेश किया गया था। दावा किया गया था कि यह दृष्टिकोण MNIST पर त्रुटि दर कम करता है और प्रशिक्षण सेट आकार को घटाता है। परिणाम अत्यधिक अतिव्यापी अंकों पर CNN की तुलना में काफी बेहतर होने का दावा किया गया। हिंटन के मूल विचार में, एक मिनीकॉलम एक बहुआयामी इकाई का प्रतिनिधित्व और पता लगाएगा।
रूपांतरण
एक अपरिवर्तनीय (इनवेरिएंट) एक वस्तु गुण है जो किसी रूपांतरण के परिणामस्वरूप नहीं बदलता है। उदाहरण के लिए, एक वृत्त का क्षेत्रफल नहीं बदलता यदि वृत्त बाईं ओर स्थानांतरित किया जाता है। अनौपचारिक रूप से, एक समविभाज्य (इक्विवेरिएंट) एक गुण है जो रूपांतरण के तहत पूर्वानुमानित रूप से बदलता है। उदाहरण के लिए, एक वृत्त का केंद्र स्थानांतरित होने पर वृत्त के समान मात्रा में चलता है। एक गैर-समविभाज्य (नॉन-इक्विवेरिएंट) एक गुण है जिसका मान रूपांतरण के तहत पूर्वानुमानित रूप से नहीं बदलता है। उदाहरण के लिए, एक वृत्त को दीर्घवृत्त में बदलने का अर्थ है कि उसकी परिधि की गणना π गुना व्यास के रूप में नहीं की जा सकती।
कंप्यूटर विज़न में, वस्तु की श्रेणी कई रूपांतरणों पर एक अपरिवर्तनीय होने की अपेक्षा की जाती है। अर्थात, एक बिल्ली अभी भी बिल्ली है यदि उसे स्थानांतरित किया जाए, उल्टा किया जाए या आकार में सिकोड़ा जाए। हालाँकि, कई अन्य गुण इसके बजाय समविभाज्य होते हैं। एक बिल्ली का आयतन बदलता है जब उसे मापा जाता है। समविभाज्य गुण जैसे स्थानिक संबंध एक पोज़ में कैप्चर किए जाते हैं, डेटा जो वस्तु के अनुवाद, घूर्णन, पैमाने और प्रतिबिंब का वर्णन करता है। अनुवाद एक या अधिक आयामों में स्थान में परिवर्तन है। घूर्णन अभिविन्यास में परिवर्तन है। पैमाना आकार में परिवर्तन है। प्रतिबिंब एक दर्पण छवि है।
अनपर्यवेक्षित CapsNets एक वस्तु और उसके पोज़ के बीच भार के मैट्रिक्स के रूप में एक वैश्विक रेखीय मैनिफोल्ड सीखते हैं। दूसरे शब्दों में, CapsNets एक वस्तु को उसके पोज़ से स्वतंत्र रूप से पहचान सकते हैं, बजाय इसके कि वस्तु के हिस्से के रूप में उसके स्थानिक संबंधों को शामिल करके वस्तु को पहचानना सीखना पड़े। CapsNets में, पोज़ स्थानिक संबंधों के अलावा अन्य गुणों को शामिल कर सकता है, जैसे रंग (बिल्लियाँ विभिन्न रंगों की हो सकती हैं)। वस्तु को मैनिफोल्ड से गुणा करने से वस्तु को स्थिति मिलती है (एक वस्तु के लिए, अंतरिक्ष में)।
पूलिंग
CapsNets पारंपरिक CNNs की पूलिंग परत रणनीति को अस्वीकार करते हैं जो अगली उच्च परत पर संसाधित किए जाने वाले विवरण की मात्रा को कम करती है। पूलिंग अनुवादात्मक अपरिवर्तनीयता की एक डिग्री की अनुमति देता है (यह किसी वस्तु को कुछ अलग स्थान पर पहचान सकता है) और बड़ी संख्या में फीचर प्रकारों का प्रतिनिधित्व करने की अनुमति देता है। CapsNet समर्थकों का तर्क है कि पूलिंग:
- जैविक आकार धारणा का उल्लंघन करता है क्योंकि इसमें कोई आंतरिक समन्वय फ्रेम नहीं होता है;
- समविभाज्यता (उस जानकारी को अलग करना) के बजाय अपरिवर्तनीयता (स्थिति संबंधी जानकारी को त्यागना) प्रदान करता है;
- उस रेखीय मैनिफोल्ड को अनदेखा करता है जो छवियों के बीच कई भिन्नताओं को रेखांकित करता है;
- स्थैतिक रूप से रूट करता है बजाय संभावित "खोज" को उस फीचर तक संचारित करने के जो उसकी सराहना कर सकता है;
- आस-पास के फीचर डिटेक्टरों को नुकसान पहुंचाता है, उस जानकारी को हटाकर जिस पर वे निर्भर करते हैं।
कैप्सूल
एक कैप्सूल न्यूरॉनों का एक समूह है जो एक प्रकार की वस्तु के विभिन्न गुणों जैसे स्थिति, आकार और रंग के लिए व्यक्तिगत रूप से सक्रिय होते हैं। औपचारिक रूप से, एक कैप्सूल न्यूरॉनों का एक समूह है जो सामूहिक रूप से एक गतिविधि वेक्टर उत्पन्न करता है जिसमें प्रत्येक न्यूरॉन के लिए एक तत्व होता है ताकि उस न्यूरॉन का तात्क्षणिक मान (जैसे रंग) रखा जा सके। ग्राफिक्स प्रोग्राम वस्तु बनाने के लिए तात्क्षणिक मान का उपयोग करते हैं। CapsNets इन्हें अपने इनपुट से प्राप्त करने का प्रयास करते हैं। किसी विशिष्ट इनपुट में इकाई की उपस्थिति की संभावना वेक्टर की लंबाई है, जबकि वेक्टर का अभिविन्यास कैप्सूल के गुणों की मात्रा निर्धारित करता है।
कृत्रिम न्यूरॉन्स पारंपरिक रूप से एक अदिश, वास्तविक-मूल्यवान सक्रियण आउटपुट करते हैं जो मोटे तौर पर एक अवलोकन की संभावना का प्रतिनिधित्व करता है। CapsNets अदिश-आउटपुट फीचर डिटेक्टरों को वेक्टर-आउटपुट कैप्सूल और अधिकतम-पूलिंग को समझौते-द्वारा-रूटिंग से बदलते हैं। क्योंकि कैप्सूल स्वतंत्र हैं, जब कई कैप्सूल सहमत होते हैं, तो सही पहचान की संभावना बहुत अधिक होती है। छह-आयामी इकाई पर विचार करने वाले दो कैप्सूलों का एक न्यूनतम क्लस्टर संयोग से 10% के भीतर केवल एक लाख परीक्षणों में एक बार सहमत होगा। जैसे-जैसे आयामों की संख्या बढ़ती है, उच्च आयामों के साथ बड़े क्लस्टर में सहमति की संभावना तेजी से घटती है।
उच्च परतों में कैप्सूल निचली परतों के कैप्सूलों से आउटपुट लेते हैं, और उन्हें स्वीकार करते हैं जिनके आउटपुट क्लस्टर होते हैं। एक क्लस्टर उच्च कैप्सूल को उच्च संभावना का अवलोकन आउटपुट करने का कारण बनता है कि एक इकाई मौजूद है और उच्च-आयामी (20-50+) पोज़ भी आउटपुट करता है। उच्च-स्तरीय कैप्सूल आउटलायरों को अनदेखा करते हैं, क्लस्टरों पर ध्यान केंद्रित करते हैं। यह क्लासिक डिजिटल छवि प्रसंस्करण से हफ ट्रांसफ़ॉर्म, RHT और RANSAC के समान है।
समझौते द्वारा रूटिंग
एक कैप्सूल (चाइल्ड) से आउटपुट अगली परत (पैरेंट) में कैप्सूलों को बच्चे की माता-पिता के आउटपुट की भविष्यवाणी करने की क्षमता के अनुसार रूट किए जाते हैं। कुछ पुनरावृत्तियों के दौरान, प्रत्येक माता-पिता के आउटपुट कुछ बच्चों की भविष्यवाणियों के साथ अभिसरित हो सकते हैं और दूसरों से भिन्न हो सकते हैं, जिसका अर्थ है कि वह माता-पिता दृश्य में मौजूद है या अनुपस्थित है। प्रत्येक संभावित माता-पिता के लिए, प्रत्येक बच्चा अपने आउटपुट को एक भार मैट्रिक्स (बैकप्रोपेगेशन द्वारा प्रशिक्षित) से गुणा करके एक भविष्यवाणी वेक्टर की गणना करता है। इसके बाद माता-पिता के आउटपुट की गणना एक भविष्यवाणी के अदिश गुणनफल के रूप में की जाती है जिसमें एक गुणांक होता है जो संभावना का प्रतिनिधित्व करता है कि यह बच्चा उस माता-पिता से संबंधित है। एक बच्चा जिसकी भविष्यवाणियाँ परिणामी आउटपुट के अपेक्षाकृत करीब हैं, उस माता-पिता और बच्चे के बीच गुणांक को क्रमिक रूप से बढ़ाता है और दूसरों के लिए इसे घटाता है।
कैप्सूल नेटवर्क डीप-लर्निंग के भीतर शोध का एक सक्रिय क्षेत्र बने हुए हैं, जो स्पष्ट स्थानिक पदानुक्रम की आवश्यकता वाले कार्यों के लिए पारंपरिक CNNs का एक विकल्प प्रदान करते हैं। उन्हें कृत्रिम-बुद्धिमत्ता और मशीन-लर्निंग जैसे संदर्भों में खोजा गया है, जिनमें कंप्यूटर-विज़न और रोबोटिक्स जैसे क्षेत्रों में संभावित अनुप्रयोग हैं। हालाँकि ट्रांसफॉर्मर-आधारित मॉडलों की तरह व्यापक रूप से नहीं अपनाए गए, वे समविभाज्य प्रतिनिधित्व और रूटिंग तंत्र पर काम को प्रेरित करना जारी रखते हैं।