अंग्रेज़ी से अनुवादित

Faster R-CNN एक गहन शिक्षण मॉडल है जो वस्तु पहचान के लिए उपयोग होता है, जो क्षेत्र प्रस्ताव निर्माण को तंत्रिका नेटवर्क में एकीकृत करता है, जिससे पहले के R-CNN संस्करणों की तुलना में गति और सटीकता में सुधार होता है।

Faster R-CNN एक गहन-शिक्षण मॉडल है जो वस्तु पहचान और स्थानीकरण के लिए उपयोग किया जाता है, जिसे जून 2015 में R-CNN परिवार के विकास के रूप में पेश किया गया था। यह क्षेत्र प्रस्तावों को सीधे एक तंत्रिका-नेटवर्क वास्तुकला के भीतर उत्पन्न करता है, जिससे बाहरी चयनात्मक खोज की आवश्यकता समाप्त हो जाती है और अंत-से-अंत प्रशिक्षण संभव होता है। यह डिज़ाइन गति और सटीकता दोनों में महत्वपूर्ण सुधार करता है, जिससे यह कंप्यूटर विज़न में एक आधारभूत विधि बन जाता है।

R-CNN परिवार, जिसे रॉस गिरशिक और काईमिंग हे सहित शोधकर्ताओं द्वारा विकसित किया गया था, छवियों में वस्तुओं की पहचान करने के कार्य को संबोधित करता है, जिसमें बाउंडिंग बॉक्स और वर्ग लेबल उत्पन्न किए जाते हैं। Faster R-CNN अपने पूर्ववर्तियों, R-CNN (नवंबर 2013) और Fast R-CNN (अप्रैल 2015) पर आधारित है, जिसमें प्रस्ताव चरण को नेटवर्क में एकीकृत किया गया है - यह एक प्रमुख नवाचार है जो कम्प्यूटेशनल ओवरहेड को कम करता है और वास्तविक-समय प्रदर्शन को बढ़ाता है।

वास्तुकला

Faster R-CNN में दो मुख्य घटक होते हैं: एक कन्वोल्यूशनल बैकबोन (जैसे VGG या ResNet) जो इनपुट छवि से फीचर मैप निकालता है, और एक क्षेत्र प्रस्ताव नेटवर्क (RPN) जो इन फीचर मैप पर कार्य करके उम्मीदवार वस्तु क्षेत्र उत्पन्न करता है। RPN विभिन्न पैमानों और पहलू अनुपातों के एंकर बॉक्स के एक सेट का उपयोग करके वस्तु-स्कोर और बाउंडिंग बॉक्स परिशोधन की भविष्यवाणी करता है। प्रस्तावित क्षेत्रों को फिर एक डिटेक्शन हेड द्वारा संसाधित किया जाता है, जिसमें आमतौर पर ROI पूलिंग और वर्गीकरण तथा बाउंडिंग बॉक्स प्रतिगमन के लिए पूर्ण रूप से जुड़ी परतें शामिल होती हैं।

पिछले संस्करणों के विपरीत जो रुचि के क्षेत्र उत्पन्न करने के लिए चयनात्मक खोज (एक पदानुक्रमित समूहन एल्गोरिदम) पर निर्भर थे, Faster R-CNN फीचर मैप से सीधे क्षेत्र प्रस्तावित करना सीखता है, जिससे पूरी पाइपलाइन विभेदनीय और अंत-से-अंत प्रशिक्षण योग्य बन जाती है।

R-CNN का विकास

R-CNN परिवार कई संस्करणों के माध्यम से आगे बढ़ा है, जिनमें से प्रत्येक अपने पूर्ववर्ती की सीमाओं को संबोधित करता है:

  • R-CNN (नवंबर 2013): 2000 तक उम्मीदवार क्षेत्र उत्पन्न करने के लिए चयनात्मक खोज का उपयोग किया, फिर प्रत्येक क्षेत्र पर स्वतंत्र रूप से एक CNN चलाया। यह अतिरेक गणनाओं के कारण कम्प्यूटेशनल रूप से महंगा था।
  • Fast R-CNN (अप्रैल 2015): पूरी छवि पर एक बार CNN चलाया और प्रत्येक क्षेत्र के लिए फीचर निकालने हेतु ROI पूलिंग की शुरुआत की, जिससे गति में काफी सुधार हुआ। फिर भी प्रस्तावों के लिए चयनात्मक खोज पर निर्भर रहा।
  • Faster R-CNN (जून 2015): चयनात्मक खोज को एक सीखे गए क्षेत्र प्रस्ताव नेटवर्क से बदल दिया, जिससे सिस्टम पूर्ण रूप से तंत्रिका-आधारित और तेज़ हो गया।
  • Mask R-CNN (मार्च 2017): पिक्सेल-वार मास्क के लिए एक शाखा जोड़कर Faster R-CNN को इंस्टेंस सेगमेंटेशन तक विस्तारित किया, और भिन्नात्मक पिक्सेल संरेखण को संभालने के लिए ROI पूलिंग को ROIAlign से बदल दिया।
  • Cascade R-CNN (दिसंबर 2017): स्थानीकरण सटीकता में सुधार के लिए क्रमिक रूप से बढ़ते हुए इंटरसेक्शन ओवर यूनियन (IoU) थ्रेसहोल्ड के साथ प्रशिक्षित किया गया।
  • Mesh R-CNN (जून 2019): 2D छवियों से 3D मेश उत्पन्न करने की क्षमता जोड़ी।

इन विकासों ने R-CNN की प्रयोज्यता को ड्रोन कैमरों से वस्तु ट्रैकिंग, टेक्स्ट स्थानीकरण, और Google Lens जैसे उत्पादों में एकीकरण जैसे कार्यों तक विस्तारित किया है।

प्रशिक्षण और प्रदर्शन

Faster R-CNN को एक बहु-कार्य हानि का उपयोग करके प्रशिक्षित किया जाता है जो वर्गीकरण हानि (जैसे क्रॉस-एंट्रॉपी) और बाउंडिंग बॉक्स परिशोधन के लिए प्रतिगमन हानि (जैसे स्मूथ L1) को जोड़ती है। RPN और डिटेक्शन हेड को संयुक्त रूप से प्रशिक्षित किया जा सकता है, अक्सर वैकल्पिक अनुकूलन या एकीकृत हानि के साथ अंत-से-अंत प्रशिक्षण का उपयोग करके। मॉडल ImageNet जैसे बड़े डेटासेट पर पूर्व-प्रशिक्षित बैकबोन से लाभान्वित होता है, जिसके बाद COCO या PASCAL VOC जैसे लक्ष्य डेटासेट पर फाइन-ट्यूनिंग की जाती है।

प्रदर्शन के संदर्भ में, Faster R-CNN बेंचमार्क डेटासेट पर अत्याधुनिक परिणाम प्राप्त करता है, जिसमें अपने पूर्ववर्तियों की तुलना में महत्वपूर्ण गति सुधार होता है। उदाहरण के लिए, PASCAL VOC 2007 पर, यह लगभग 73.2% का माध्य औसत परिशुद्धता (mAP) प्राप्त करता है जबकि GPU पर 5 फ्रेम प्रति सेकंड की दर से चलता है, जो Fast R-CNN की तुलना में एक पर्याप्त लाभ है।

अनुप्रयोग और प्रभाव

Faster R-CNN वस्तु पहचान में एक आधारशिला बन गया है, जिसने कई बाद की वास्तुकलाओं को प्रभावित किया है। इसकी क्षेत्र प्रस्ताव तंत्र को विभिन्न डोमेन में अपनाया गया है, जिनमें स्वायत्त ड्राइविंग (जैसे Waymo और Tesla), चिकित्सा इमेजिंग, और रोबोटिक्स शामिल हैं। वास्तविक समय में वस्तुओं का पता लगाने की मॉडल की क्षमता ने वीडियो निगरानी, संवर्धित वास्तविकता, और छवि खोज में अनुप्रयोगों को सक्षम किया है।

इसके अलावा, R-CNN परिवार को अन्य कार्यों तक विस्तारित किया गया है, जैसे इंस्टेंस सेगमेंटेशन (Mask R-CNN) और 3D पुनर्निर्माण (Mesh R-CNN)। Mask R-CNN भी MLPerf प्रशिक्षण बेंचमार्क के सात कार्यों में से एक है, जो तंत्रिका नेटवर्क प्रशिक्षण को तेज़ करने की एक प्रतियोगिता है, जो इसके व्यावहारिक महत्व को उजागर करता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:object-detection·deep-learning·computer-vision·neural-network
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास