अंग्रेज़ी से अनुवादित

Faster R-CNN एक डीप लर्निंग ऑब्जेक्ट डिटेक्शन फ्रेमवर्क है जो उम्मीदवार ऑब्जेक्ट क्षेत्रों को उत्पन्न करने के लिए एक Region Proposal Network (RPN) प्रस्तुत करता है, जिससे उच्च सटीकता के साथ लगभग वास्तविक समय में डिटेक्शन संभव होता है। इसे 2015 में Shaoqing Ren एट अल. द्वारा पेश किया गया था और यह पिछले R-CNN वेरिएंट्स से बेहतर प्रदर्शन करता है।

फास्टर आर-सीएनएन Deep learning और Computer vision के क्षेत्र में एक ऑब्जेक्ट डिटेक्शन आर्किटेक्चर है, जो क्षेत्र प्रस्ताव निर्माण और ऑब्जेक्ट वर्गीकरण को एक एकल, प्रशिक्षण योग्य Neural network में एकीकृत करता है। इसे 2015 में शाओकिंग रेन, काइमिंग हे, रॉस गिरशिक और जियान सन द्वारा पेश किया गया था, जो पहले के आर-सीएनएन और फास्ट आर-सीएनएन मॉडल पर आधारित था। मुख्य नवाचार रीजन प्रपोज़ल नेटवर्क (आरपीएन) है, जो डिटेक्टर के साथ पूर्ण-छवि कन्वोल्यूशनल सुविधाओं को साझा करता है, जिससे उम्मीदवार क्षेत्रों को उत्पन्न करने की कम्प्यूटेशनल लागत नाटकीय रूप से कम हो जाती है। यह डिज़ाइन उच्च डिटेक्शन सटीकता बनाए रखते हुए लगभग वास्तविक समय की अनुमान गति की अनुमति देता है, जिससे यह आधुनिक ऑब्जेक्ट डिटेक्शन सिस्टम के लिए एक आधारभूत मॉडल स्थापित करता है।

फास्टर आर-सीएनएन एक दो-चरणीय डिटेक्टर के रूप में कार्य करता है। पहला चरण आरपीएन का उपयोग करके आयताकार ऑब्जेक्ट क्षेत्रों का एक सेट प्रस्तावित करता है। दूसरा चरण, एक डिटेक्शन नेटवर्क, इन क्षेत्रों को विशिष्ट ऑब्जेक्ट श्रेणियों में वर्गीकृत करता है और उनके बाउंडिंग बॉक्स को परिष्कृत करता है। यह पृथक्करण एकल-चरणीय डिटेक्टरों जैसे YOLO या SSD के विपरीत है, जो फीचर ग्रिड से सीधे बाउंडिंग बॉक्स और क्लास संभावनाओं को प्रतिगमित करते हैं। दो-चरणीय दृष्टिकोण आमतौर पर बेहतर स्थानीयकरण सटीकता उत्पन्न करता है, विशेष रूप से छोटे या अस्पष्ट ऑब्जेक्ट्स के लिए, जिसने फास्टर आर-सीएनएन को Machine learning अनुसंधान में एक मानक बेंचमार्क बना दिया है।

आर्किटेक्चर

आर्किटेक्चर में तीन मुख्य घटक शामिल हैं: एक बैकबोन कन्वोल्यूशनल नेटवर्क, आरपीएन, और रीजन-ऑफ-इंटरेस्ट (आरओआई) क्लासिफायर। बैकबोन, जो अक्सर VGG-16 या ResNet जैसा पूर्व-प्रशिक्षित नेटवर्क होता है, इनपुट छवि से फीचर मैप निकालता है। आरपीएन इन फीचर मैप पर कार्य करता है, एक छोटी स्लाइडिंग विंडो का उपयोग करके कई स्केल और पहलू अनुपात पर एंकर बॉक्स के एक सेट के लिए ऑब्जेक्टनेस स्कोर और बॉक्स रिग्रेशन ऑफसेट की भविष्यवाणी करता है। एंकर नेटवर्क को मल्टी-स्केल इमेज पिरामिड के बिना विभिन्न आकृतियों के ऑब्जेक्ट्स को संभालने की अनुमति देते हैं। परिणामी प्रस्तावों को फिर आरओआई पूलिंग का उपयोग करके एक निश्चित आकार में पूल किया जाता है और क्लासिफायर के माध्यम से पारित किया जाता है, जो क्लास संभावनाओं और परिष्कृत बाउंडिंग बॉक्स आउटपुट करता है।

प्रशिक्षण

प्रशिक्षण एक बहु-कार्य हानि फ़ंक्शन का उपयोग करके एंड-टू-एंड किया जाता है जो आरपीएन और डिटेक्टर दोनों के लिए वर्गीकरण और रिग्रेशन हानियों को जोड़ता है। मूल कार्यान्वयन ने एक वैकल्पिक अनुकूलन अनुसूची का उपयोग किया, लेकिन बाद के संस्करणों ने सभी परतों के माध्यम से बैकप्रोपेगेशन के साथ संयुक्त प्रशिक्षण अपनाया। आरपीएन को बाइनरी लेबल के साथ प्रशिक्षित किया जाता है जो दर्शाता है कि एक एंकर में ऑब्जेक्ट है या नहीं, जबकि डिटेक्टर सूक्ष्म-श्रेणी लेबल का उपयोग करता है। बड़ी संख्या में एंकर बॉक्स को संभालने के लिए, एक नमूनाकरण रणनीति प्रशिक्षण के दौरान एक संतुलित बैच का चयन करती है। यह एकीकृत प्रशिक्षण दृष्टिकोण पहले के आर-सीएनएन विधियों से एक महत्वपूर्ण विचलन है, जिसमें सिलेक्टिव सर्च जैसे क्षेत्र प्रस्ताव एल्गोरिदम के अलग प्रशिक्षण की आवश्यकता थी।

प्रदर्शन और प्रभाव

PASCAL VOC 2007 और 2012 बेंचमार्क पर, फास्टर आर-सीएनएन ने क्रमशः 73.2% और 70.4% के अत्याधुनिक mAP स्कोर हासिल किए, जबकि GPU पर 5 फ्रेम प्रति सेकंड पर चल रहा था। यह फास्ट आर-सीएनएन की तुलना में एक महत्वपूर्ण सुधार था, जिसमें प्रति छवि सेकंड लगते थे। आरपीएन की शुरूआत ने बाहरी क्षेत्र प्रस्ताव विधियों की बाधा को समाप्त कर दिया, जिससे पूरी डिटेक्शन पाइपलाइन एंड-टू-एंड प्रशिक्षण योग्य हो गई। इस कार्य ने इंस्टेंस सेगमेंटेशन के लिए Mask R-CNN और विभिन्न क्षेत्र-आधारित फ्रेमवर्क जैसे बाद के मॉडलों को प्रभावित किया। इसके सिद्धांतों को वाणिज्यिक प्रणालियों में व्यापक रूप से अपनाया गया है, जिसमें Waymo और Tesla जैसी कंपनियों में स्वायत्त ड्राइविंग धारणा स्टैक शामिल हैं।

वेरिएंट और विस्तार

फास्टर आर-सीएनएन के विशिष्ट पहलुओं को बेहतर बनाने के लिए कई विस्तार प्रस्तावित किए गए हैं। फीचर पिरामिड नेटवर्क (FPN) छोटे ऑब्जेक्ट्स की डिटेक्शन बढ़ाने के लिए मल्टी-स्केल फीचर मैप को एकीकृत करते हैं। कैस्केड आर-सीएनएन प्रस्तावों को पुनरावृत्त रूप से परिष्कृत करने के लिए बढ़ते IoU थ्रेसहोल्ड के साथ डिटेक्टरों के अनुक्रम का उपयोग करता है। अन्य कार्यों ने मोबाइल तैनाती के लिए हल्के बैकबोन की खोज की है, जैसे कि Arm Holdings-आधारित एज डिवाइस। Generative AI के संदर्भ में, फास्टर आर-सीएनएन का उपयोग विज़न-भाषा मॉडल में एक घटक के रूप में भी किया गया है, हालांकि बड़े पैमाने पर सिस्टम अक्सर ट्रांसफॉर्मर-आधारित डिटेक्टरों को पसंद करते हैं। इसे और अधिक कुशल बनाने के लिए अनुसंधान जारी है, जिसमें Intel और Qualcomm जैसे हार्डवेयर विक्रेताओं द्वारा क्वांटाइज़ेशन और प्रूनिंग तकनीकें लागू की जा रही हैं।

संबंधित विधियाँ

फास्टर आर-सीएनएन क्षेत्र-आधारित कन्वोल्यूशनल नेटवर्क के व्यापक परिवार से संबंधित है, जिसमें आर-सीएनएन और फास्ट आर-सीएनएन भी शामिल हैं। इसकी तुलना अक्सर YOLO और SSD जैसे एकल-चरणीय डिटेक्टरों से की जाती है, जो उच्च गति प्रदान करते हैं लेकिन आमतौर पर कम सटीकता रखते हैं। बाद के हाइब्रिड आर्किटेक्चर, जैसे RetinaNet, फोकल लॉस के साथ इस अंतर को पाटने का प्रयास करते हैं। आधुनिक डीप लर्निंग परिदृश्य में, Transformer (architecture) आर्किटेक्चर का उपयोग करने वाले ध्यान-आधारित डिटेक्टरों ने प्रमुखता प्राप्त की है, लेकिन फास्टर आर-सीएनएन एक व्यापक रूप से उपयोग किया जाने वाला बेसलाइन और एन्सेम्बल विधियों में एक सामान्य घटक बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·computer-vision·object-detection·neural-network
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास