अंग्रेज़ी से अनुवादित

R-CNN वस्तु पहचान और स्थानीयकरण के लिए गहन शिक्षण मॉडल का एक परिवार है, जो छवियों में वस्तुओं की पहचान करने के लिए क्षेत्र प्रस्तावों और संवेगात्मक तंत्रिका नेटवर्क का उपयोग करता है।

क्षेत्र-आधारित संवहनी तंत्रिका नेटवर्क (R-CNN) कंप्यूटर विज़न के लिए मशीन लर्निंग मॉडलों का एक परिवार है, विशेष रूप से वस्तु पहचान और स्थानीकरण के लिए। R-CNN का मूल लक्ष्य एक इनपुट छवि लेना और आउटपुट के रूप में बाउंडिंग बॉक्स का एक सेट तैयार करना था, जहां प्रत्येक बाउंडिंग बॉक्स में एक वस्तु और वस्तु की श्रेणी (जैसे कार या पैदल यात्री) दोनों शामिल हों। सामान्य तौर पर, R-CNN आर्किटेक्चर CNN द्वारा आउटपुट किए गए फीचर मैप्स पर चयनात्मक खोज करते हैं।

R-CNN को अन्य कंप्यूटर विज़न कार्यों को करने के लिए विस्तारित किया गया है, जैसे ड्रोन-माउंटेड कैमरे से वस्तुओं को ट्रैक करना, छवि में टेक्स्ट का पता लगाना, और Google Lens में वस्तु पहचान को सक्षम करना। Mask R-CNN भी MLPerf प्रशिक्षण बेंचमार्क में सात कार्यों में से एक है, जो तंत्रिका नेटवर्क के प्रशिक्षण को तेज करने की प्रतियोगिता है।

इतिहास

R-CNN के विकास में कई प्रमुख संस्करण देखे गए हैं। मूल R-CNN नवंबर 2013 में पेश किया गया था, उसके बाद अप्रैल 2015 में Fast R-CNN और जून 2015 में Faster R-CNN आया। Mask R-CNN मार्च 2017 में आया, जिसने ढांचे को इंस्टेंस सेगमेंटेशन तक विस्तारित किया। दिसंबर 2017 में, Cascade R-CNN प्रस्तावित किया गया, जो बढ़ते हुए इंटरसेक्शन ओवर यूनियन (IoU, जिसे जैकार्ड इंडेक्स भी कहा जाता है) थ्रेशोल्ड के साथ प्रशिक्षण देता है, जिससे प्रत्येक चरण निकटवर्ती गलत सकारात्मक के खिलाफ अधिक चयनात्मक हो जाता है। जून 2019 में, Mesh R-CNN ने 2D छवि से 3D मेश उत्पन्न करने की क्षमता जोड़ी।

आर्किटेक्चर

R-CNN परिवार क्षेत्र प्रस्तावों और संवहनी फीचर निष्कर्षण पर आधारित एक सामान्य आर्किटेक्चर साझा करता है। मूल विचार उम्मीदवार वस्तु क्षेत्रों को उत्पन्न करना, CNN का उपयोग करके फीचर निकालना, और प्रत्येक क्षेत्र को वर्गीकृत करना है।

चयनात्मक खोज

एक छवि (या छवि-जैसा फीचर मैप) दिए जाने पर, चयनात्मक खोज (जिसे पदानुक्रमित समूहीकरण भी कहा जाता है) पहले Felzenszwalb और Huttenlocher (2004) के एल्गोरिदम का उपयोग करके छवि को खंडित करती है। फिर यह रंग, बनावट, आकार और आकृति संगतता के आधार पर समान पड़ोसी क्षेत्रों को पुनरावृत्त रूप से विलय करती है, जिससे वस्तु स्थान परिकल्पनाओं का एक सेट तैयार होता है। एल्गोरिदम निम्नानुसार आगे बढ़ता है:

  1. छवि को प्रारंभिक क्षेत्रों R = {r1, ..., rn} में खंडित करें।
  2. एक समानता सेट S = ∅ प्रारंभ करें।
  3. प्रत्येक पड़ोसी क्षेत्र जोड़ी (ri, rj) के लिए, समानता s(ri, rj) की गणना करें और S में जोड़ें।
  4. जबकि S खाली नहीं है:
    • उच्चतम समानता s(ri, rj) = max(S) प्राप्त करें।
    • संबंधित क्षेत्रों को विलय करें rt = ri ∪ rj।
    • ri और rj से जुड़ी समानताओं को S से हटाएं।
    • rt और उसके पड़ोसियों के बीच समानताओं की गणना करें, S में जोड़ें।
    • rt को R में जोड़ें।
  5. R के सभी क्षेत्रों से वस्तु स्थान बॉक्स L निकालें।

R-CNN

मूल R-CNN के साथ, भविष्यवाणी दो-चरणीय प्रक्रिया का पालन करती है। एक प्रीप्रोसेसिंग चयनात्मक खोज चरण उम्मीदवार वस्तुओं का एक बड़ा सेट उत्पन्न करता है (आमतौर पर 2000 तक), जिन्हें रुचि के क्षेत्र (ROI) के रूप में जाना जाता है। इन्हें एक CNN को आगे भेजा जाता है, जो प्रत्येक ROI के लिए स्वतंत्र रूप से एक वस्तु वर्ग स्कोर और बाउंडिंग बॉक्स अनुमान की भविष्यवाणी करता है। महत्वपूर्ण रूप से, ROIs को अतिरिक्त उम्मीदवारों को हटाने के लिए भारी फ़िल्टर किया जाता है। फ़िल्टरिंग उन ROIs को हटाने से शुरू होती है जो पृष्ठभूमि श्रेणी को सौंपे गए हैं, जो अन्य श्रेणियों के साथ CNN द्वारा स्कोर की गई एक विशेष श्रेणी है। शेष ROIs अक्सर भारी नकल से ग्रस्त होते हैं, क्योंकि एक ही वस्तु को कवर करने वाले कई ROIs सभी गैर-पृष्ठभूमि श्रेणियों को सौंपे जाते हैं। इसे एक अनुमानी गैर-अधिकतम दमन (NMS) चरण द्वारा हल किया जाता है।

Fast R-CNN

जबकि मूल R-CNN ने दो हज़ार तक रुचि के क्षेत्रों में से प्रत्येक पर स्वतंत्र रूप से तंत्रिका नेटवर्क फीचर की गणना की, Fast R-CNN पूरी छवि पर एक बार तंत्रिका नेटवर्क चलाता है। नेटवर्क के अंत में एक ROIPooling मॉड्यूल होता है, जो नेटवर्क के आउटपुट टेंसर से प्रत्येक ROI को काटता है, उसे पुनः आकार देता है, और वर्गीकृत करता है। मूल R-CNN की तरह, Fast R-CNN अपने क्षेत्र प्रस्ताव उत्पन्न करने के लिए चयनात्मक खोज का उपयोग करता है।

Faster R-CNN

Faster R-CNN ROI उत्पादन को तंत्रिका नेटवर्क में ही एकीकृत करता है, जिससे बाहरी चयनात्मक खोज की आवश्यकता समाप्त हो जाती है। यह मॉडल को पूरी तरह से अंत-से-अंत प्रशिक्षित करने योग्य और काफी तेज़ बनाता है।

Mask R-CNN

जबकि पिछले संस्करण वस्तु पहचान पर केंद्रित थे, Mask R-CNN इंस्टेंस सेगमेंटेशन जोड़ता है, जो प्रत्येक पहचानी गई वस्तु के लिए एक सेगमेंटेशन मास्क उत्पन्न करता है। Mask R-CNN ने ROIPooling को ROIAlign नामक एक नई विधि से भी बदल दिया, जो पिक्सेल के अंशों का प्रतिनिधित्व कर सकता है, जिससे स्थानीकरण सटीकता में सुधार होता है।

अनुप्रयोग और प्रभाव

R-CNN मॉडल कंप्यूटर विज़न अनुप्रयोगों में व्यापक रूप से अपनाए गए हैं, जिनमें स्वायत्त ड्राइविंग, निगरानी और छवि खोज शामिल हैं। आर्किटेक्चर ने बाद के वस्तु पहचान मॉडल को प्रभावित किया है और विज़न के लिए गहन शिक्षण में एक मौलिक अवधारणा बना हुआ है। MLPerf बेंचमार्क में प्रशिक्षण प्रदर्शन का मूल्यांकन करने के लिए Mask R-CNN को एक मानक कार्य के रूप में शामिल किया गया है, जो इसके व्यावहारिक महत्व को उजागर करता है।

यह भी देखें

संदर्भ

  • Girshick, R., Donahue, J., Darrell, T., & Malik, J. (2014). Rich feature hierarchies for accurate object detection and semantic segmentation. CVPR.
  • Girshick, R. (2015). Fast R-CNN. ICCV.
  • Ren, S., He, K., Girshick, R., & Sun, J. (2015). Faster R-CNN: Towards real-time object detection with region proposal networks. NeurIPS.
  • He, K., Gkioxari, G., Dollár, P., & Girshick, R. (2017). Mask R-CNN. ICCV.

आगे पढ़ें

  • Parthasarathy, Dhruv (2017-04-27). "A Brief History of CNNs in Image Segmentation: From R-CNN to Mask R-CNN". Medium. Retrieved 2024-09-11.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·object-detection·deep-learning·convolutional-neural-network
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास