क्षेत्र प्रस्ताव नेटवर्क (Region Proposal Network)

अंग्रेज़ी से अनुवादित

एक क्षेत्र प्रस्ताव नेटवर्क (RPN) एक कन्वोल्यूशनल न्यूरल नेटवर्क घटक है जो वस्तु पहचान कार्यों के लिए उम्मीदवार वस्तु बाउंडिंग बॉक्स उत्पन्न करता है, जिसे 2015 में फास्टर R-CNN आर्किटेक्चर में पेश किया गया था।

एक क्षेत्र प्रस्ताव नेटवर्क (आरपीएन) एक प्रकार का तंत्रिका नेटवर्क है जिसका उपयोग वस्तु पहचान में उम्मीदवार क्षेत्रों, या बाउंडिंग बॉक्सों, को उत्पन्न करने के लिए किया जाता है, जिनमें वस्तुएँ होने की संभावना होती है। इसे 2015 में शाओकिंग रेन, कैमिंग हे, रॉस गिरशिक और जियान सन द्वारा फास्टर आर-सीएनएन वास्तुकला के हिस्से के रूप में पेश किया गया था, जिसने क्षेत्र प्रस्ताव पीढ़ी और वस्तु वर्गीकरण को एक एकल एंड-टू-एंड प्रशिक्षण योग्य मॉडल में एकीकृत किया। आरपीएन ने पारंपरिक क्षेत्र प्रस्ताव विधियों जैसे चयनात्मक खोज को प्रतिस्थापित किया, जिससे पहचान पाइपलाइनों में गति और सटीकता दोनों में काफी सुधार हुआ।

आरपीएन एक बैकबोन कन्वोल्यूशनल नेटवर्क (जैसे VGG-16 या ResNet) द्वारा उत्पादित फीचर मैप पर कार्य करता है। यह फीचर मैप पर एक छोटा नेटवर्क स्लाइड करता है, और प्रत्येक स्लाइडिंग विंडो स्थिति पर, यह विभिन्न पैमानों और आस्पेक्ट अनुपातों के एंकर बॉक्सों के एक सेट का उपयोग करके कई क्षेत्र प्रस्तावों की भविष्यवाणी करता है। आउटपुट में वस्तु स्कोर (यह दर्शाते हुए कि क्या किसी क्षेत्र में कोई वस्तु है) और परिष्कृत बाउंडिंग बॉक्स निर्देशांक शामिल हैं। इन प्रस्तावों को फिर अंतिम पहचान के लिए एक डाउनस्ट्रीम क्लासिफायर और बाउंडिंग-बॉक्स रिग्रेशन के लिए पारित किया जाता है।

वास्तुकला और तंत्र

आरपीएन एक पूर्ण रूप से कन्वोल्यूशनल नेटवर्क है। यह H x W x C आकार के इनपुट फीचर मैप को लेता है और एक 3x3 कन्वोल्यूशनल परत लागू करता है, जिसके बाद दो सहोदर 1x1 कन्वोल्यूशनल परतें होती हैं: एक वर्गीकरण (वस्तु बनाम पृष्ठभूमि) के लिए और एक रिग्रेशन (बाउंडिंग बॉक्स ऑफसेट) के लिए। प्रत्येक स्थानिक स्थान पर, नेटवर्क k एंकर बॉक्सों को संसाधित करता है, जहाँ k आमतौर पर 9 (तीन पैमाने और तीन आस्पेक्ट अनुपात) होता है। वर्गीकरण परत 2k स्कोर आउटपुट करती है, और रिग्रेशन परत 4k निर्देशांक आउटपुट करती है। प्रशिक्षण के दौरान, एंकरों को सकारात्मक के रूप में लेबल किया जाता है यदि उनका किसी ग्राउंड-ट्रुथ बॉक्स के साथ प्रतिच्छेदन-ओवर-यूनियन (IoU) ओवरलैप 0.7 से अधिक हो, या यदि उनका किसी ग्राउंड-ट्रुथ बॉक्स के साथ सबसे अधिक IoU हो। 0.3 से नीचे IoU वाले एंकरों को नकारात्मक के रूप में लेबल किया जाता है। हानि फ़ंक्शन वर्गीकरण के लिए क्रॉस-एन्ट्रॉपी हानि और रिग्रेशन के लिए चिकनी L1 हानि को जोड़ता है।

प्रशिक्षण और फास्टर आर-सीएनएन के साथ एकीकरण

फास्टर आर-सीएनएन में, आरपीएन को बहु-कार्य हानि का उपयोग करके पहचान नेटवर्क के साथ संयुक्त रूप से प्रशिक्षित किया जाता है। प्रशिक्षण आरपीएन और फास्ट आर-सीएनएन डिटेक्टर को अनुकूलित करने के बीच वैकल्पिक होता है, या यह बैकप्रोपेगेशन के माध्यम से एंड-टू-एंड किया जा सकता है। आरपीएन डिटेक्टर के साथ कन्वोल्यूशनल फीचर साझा करता है, जिससे अनावश्यक गणना कम होती है। आरपीएन द्वारा उत्पन्न प्रस्तावों का उपयोग क्षेत्र-ऑफ-इंटरेस्ट (RoI) पूलिंग परत के इनपुट के रूप में किया जाता है, जो प्रत्येक प्रस्ताव के लिए निश्चित आकार के फीचर मैप निकालता है, इसके बाद वर्गीकरण और बाउंडिंग बॉक्स परिष्करण के लिए पूर्ण रूप से जुड़ी परतें होती हैं। इस डिज़ाइन ने फास्टर आर-सीएनएन को निकट-वास्तविक समय गति (GPU पर लगभग 5-17 फ्रेम प्रति सेकंड) पर चलाने की अनुमति दी, जबकि PASCAL VOC और MS COCO जैसे बेंचमार्क पर उच्चतम-स्तरीय सटीकता प्राप्त की।

प्रभाव और विकास

अपनी शुरुआत के बाद से, आरपीएन कई वस्तु पहचान वास्तुकलाओं में एक आधारभूत घटक बन गया है। इसने बाद के मॉडलों जैसे कि Mask R-CNN (उदाहरण विभाजन के लिए), FPN (फीचर पिरामिड नेटवर्क) जो आरपीएन को बहु-पैमाने फीचर मैप के साथ बढ़ाता है, और एक-चरण डिटेक्टरों जैसे RetinaNet को प्रभावित किया जो एंकर-आधारित भविष्यवाणी को शामिल करते हैं। एंकर बॉक्स और क्षेत्र प्रस्ताव पीढ़ी की अवधारणा को अन्य क्षेत्रों में भी अनुकूलित किया गया है, जिसमें कृत्रिम बुद्धिमत्ता अनुप्रयोग जैसे स्वायत्त ड्राइविंग और चिकित्सा इमेजिंग शामिल हैं। आरपीएन की न्यूनतम संगणना ओवरहेड के साथ उच्च-गुणवत्ता वाले प्रस्ताव उत्पन्न करने की क्षमता ने इसे कंप्यूटर विज़न के गहन शिक्षण युग में एक प्रमुख नवाचार बना दिया।

सीमाएँ और विकल्प

अपनी सफलता के बावजूद, आरपीएन की सीमाएँ हैं। पूर्वनिर्धारित एंकर बॉक्सों के उपयोग के लिए पैमानों और आस्पेक्ट अनुपातों के सावधानीपूर्वक समायोजन की आवश्यकता होती है, जो असामान्य आकार वाली वस्तुओं के लिए उप-इष्टतम हो सकता है। एंकर-आधारित विधियाँ भी बड़ी संख्या में प्रस्ताव उत्पन्न करती हैं, जिनमें से कई अनावश्यक होते हैं, जिससे संगणना अक्षमता होती है। इन मुद्दों को संबोधित करने के लिए, एंकर-मुक्त डिटेक्टर जैसे CornerNet और CenterNet प्रस्तावित किए गए, जो एंकर के बिना सीधे कीपॉइंट या केंद्रों की भविष्यवाणी करते हैं। हालाँकि, आरपीएन अपनी सरलता और प्रभावशीलता के कारण व्यापक रूप से उपयोग में बना हुआ है, और यह कई आधुनिक पहचान ढाँचों में एक मानक घटक बना हुआ है।

यह भी देखें

नोट: लेख केवल उपलब्ध स्लग्स के आंतरिक लिंक का उपयोग करता है। चूँकि दी गई सूची में 'computer-vision' या 'convolutional-neural-network' शामिल नहीं है, लिंक केवल उपलब्ध स्लग्स तक सीमित हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:object-detection·computer-vision·deep-learning·neural-network
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास