एक क्षेत्र प्रस्ताव नेटवर्क (आरपीएन) एक प्रकार का तंत्रिका नेटवर्क है जिसका उपयोग वस्तु पहचान में उम्मीदवार क्षेत्रों, या बाउंडिंग बॉक्सों, को उत्पन्न करने के लिए किया जाता है, जिनमें वस्तुएँ होने की संभावना होती है। इसे 2015 में शाओकिंग रेन, कैमिंग हे, रॉस गिरशिक और जियान सन द्वारा फास्टर आर-सीएनएन वास्तुकला के हिस्से के रूप में पेश किया गया था, जिसने क्षेत्र प्रस्ताव पीढ़ी और वस्तु वर्गीकरण को एक एकल एंड-टू-एंड प्रशिक्षण योग्य मॉडल में एकीकृत किया। आरपीएन ने पारंपरिक क्षेत्र प्रस्ताव विधियों जैसे चयनात्मक खोज को प्रतिस्थापित किया, जिससे पहचान पाइपलाइनों में गति और सटीकता दोनों में काफी सुधार हुआ।
आरपीएन एक बैकबोन कन्वोल्यूशनल नेटवर्क (जैसे VGG-16 या ResNet) द्वारा उत्पादित फीचर मैप पर कार्य करता है। यह फीचर मैप पर एक छोटा नेटवर्क स्लाइड करता है, और प्रत्येक स्लाइडिंग विंडो स्थिति पर, यह विभिन्न पैमानों और आस्पेक्ट अनुपातों के एंकर बॉक्सों के एक सेट का उपयोग करके कई क्षेत्र प्रस्तावों की भविष्यवाणी करता है। आउटपुट में वस्तु स्कोर (यह दर्शाते हुए कि क्या किसी क्षेत्र में कोई वस्तु है) और परिष्कृत बाउंडिंग बॉक्स निर्देशांक शामिल हैं। इन प्रस्तावों को फिर अंतिम पहचान के लिए एक डाउनस्ट्रीम क्लासिफायर और बाउंडिंग-बॉक्स रिग्रेशन के लिए पारित किया जाता है।
वास्तुकला और तंत्र
आरपीएन एक पूर्ण रूप से कन्वोल्यूशनल नेटवर्क है। यह H x W x C आकार के इनपुट फीचर मैप को लेता है और एक 3x3 कन्वोल्यूशनल परत लागू करता है, जिसके बाद दो सहोदर 1x1 कन्वोल्यूशनल परतें होती हैं: एक वर्गीकरण (वस्तु बनाम पृष्ठभूमि) के लिए और एक रिग्रेशन (बाउंडिंग बॉक्स ऑफसेट) के लिए। प्रत्येक स्थानिक स्थान पर, नेटवर्क k एंकर बॉक्सों को संसाधित करता है, जहाँ k आमतौर पर 9 (तीन पैमाने और तीन आस्पेक्ट अनुपात) होता है। वर्गीकरण परत 2k स्कोर आउटपुट करती है, और रिग्रेशन परत 4k निर्देशांक आउटपुट करती है। प्रशिक्षण के दौरान, एंकरों को सकारात्मक के रूप में लेबल किया जाता है यदि उनका किसी ग्राउंड-ट्रुथ बॉक्स के साथ प्रतिच्छेदन-ओवर-यूनियन (IoU) ओवरलैप 0.7 से अधिक हो, या यदि उनका किसी ग्राउंड-ट्रुथ बॉक्स के साथ सबसे अधिक IoU हो। 0.3 से नीचे IoU वाले एंकरों को नकारात्मक के रूप में लेबल किया जाता है। हानि फ़ंक्शन वर्गीकरण के लिए क्रॉस-एन्ट्रॉपी हानि और रिग्रेशन के लिए चिकनी L1 हानि को जोड़ता है।
प्रशिक्षण और फास्टर आर-सीएनएन के साथ एकीकरण
फास्टर आर-सीएनएन में, आरपीएन को बहु-कार्य हानि का उपयोग करके पहचान नेटवर्क के साथ संयुक्त रूप से प्रशिक्षित किया जाता है। प्रशिक्षण आरपीएन और फास्ट आर-सीएनएन डिटेक्टर को अनुकूलित करने के बीच वैकल्पिक होता है, या यह बैकप्रोपेगेशन के माध्यम से एंड-टू-एंड किया जा सकता है। आरपीएन डिटेक्टर के साथ कन्वोल्यूशनल फीचर साझा करता है, जिससे अनावश्यक गणना कम होती है। आरपीएन द्वारा उत्पन्न प्रस्तावों का उपयोग क्षेत्र-ऑफ-इंटरेस्ट (RoI) पूलिंग परत के इनपुट के रूप में किया जाता है, जो प्रत्येक प्रस्ताव के लिए निश्चित आकार के फीचर मैप निकालता है, इसके बाद वर्गीकरण और बाउंडिंग बॉक्स परिष्करण के लिए पूर्ण रूप से जुड़ी परतें होती हैं। इस डिज़ाइन ने फास्टर आर-सीएनएन को निकट-वास्तविक समय गति (GPU पर लगभग 5-17 फ्रेम प्रति सेकंड) पर चलाने की अनुमति दी, जबकि PASCAL VOC और MS COCO जैसे बेंचमार्क पर उच्चतम-स्तरीय सटीकता प्राप्त की।
प्रभाव और विकास
अपनी शुरुआत के बाद से, आरपीएन कई वस्तु पहचान वास्तुकलाओं में एक आधारभूत घटक बन गया है। इसने बाद के मॉडलों जैसे कि Mask R-CNN (उदाहरण विभाजन के लिए), FPN (फीचर पिरामिड नेटवर्क) जो आरपीएन को बहु-पैमाने फीचर मैप के साथ बढ़ाता है, और एक-चरण डिटेक्टरों जैसे RetinaNet को प्रभावित किया जो एंकर-आधारित भविष्यवाणी को शामिल करते हैं। एंकर बॉक्स और क्षेत्र प्रस्ताव पीढ़ी की अवधारणा को अन्य क्षेत्रों में भी अनुकूलित किया गया है, जिसमें कृत्रिम बुद्धिमत्ता अनुप्रयोग जैसे स्वायत्त ड्राइविंग और चिकित्सा इमेजिंग शामिल हैं। आरपीएन की न्यूनतम संगणना ओवरहेड के साथ उच्च-गुणवत्ता वाले प्रस्ताव उत्पन्न करने की क्षमता ने इसे कंप्यूटर विज़न के गहन शिक्षण युग में एक प्रमुख नवाचार बना दिया।
सीमाएँ और विकल्प
अपनी सफलता के बावजूद, आरपीएन की सीमाएँ हैं। पूर्वनिर्धारित एंकर बॉक्सों के उपयोग के लिए पैमानों और आस्पेक्ट अनुपातों के सावधानीपूर्वक समायोजन की आवश्यकता होती है, जो असामान्य आकार वाली वस्तुओं के लिए उप-इष्टतम हो सकता है। एंकर-आधारित विधियाँ भी बड़ी संख्या में प्रस्ताव उत्पन्न करती हैं, जिनमें से कई अनावश्यक होते हैं, जिससे संगणना अक्षमता होती है। इन मुद्दों को संबोधित करने के लिए, एंकर-मुक्त डिटेक्टर जैसे CornerNet और CenterNet प्रस्तावित किए गए, जो एंकर के बिना सीधे कीपॉइंट या केंद्रों की भविष्यवाणी करते हैं। हालाँकि, आरपीएन अपनी सरलता और प्रभावशीलता के कारण व्यापक रूप से उपयोग में बना हुआ है, और यह कई आधुनिक पहचान ढाँचों में एक मानक घटक बना हुआ है।
यह भी देखें
- गहन शिक्षण
- मशीन लर्निंग
- तंत्रिका नेटवर्क
- कंप्यूटर विज़न (उपलब्ध स्लग सूची में नहीं, इसलिए छोड़ा गया)
नोट: लेख केवल उपलब्ध स्लग्स के आंतरिक लिंक का उपयोग करता है। चूँकि दी गई सूची में 'computer-vision' या 'convolutional-neural-network' शामिल नहीं है, लिंक केवल उपलब्ध स्लग्स तक सीमित हैं।