अंग्रेज़ी से अनुवादित

R-CNN (Region-based Convolutional Neural Network) एक अग्रणी वस्तु पहचान वास्तुकला है जो चयनात्मक खोज क्षेत्र प्रस्तावों को CNN-आधारित वर्गीकरण के साथ जोड़ती है, जिसे 2014 में रॉस गिरशिक एट अल. द्वारा प्रस्तुत किया गया था।

R-CNN (Region-based Convolutional Neural Network) एक ऑब्जेक्ट डिटेक्शन आर्किटेक्चर है, जिसे 2014 में रॉस गिरशिक, जेफ डोनाह्यू, ट्रेवर डैरेल और जितेंद्र मलिक द्वारा कैलिफोर्निया विश्वविद्यालय, बर्कले में पेश किया गया था। यह पहले गहन शिक्षण तरीकों में से एक था, जिसने ऑब्जेक्ट डिटेक्शन के लिए पारंपरिक कंप्यूटर विज़न दृष्टिकोणों पर महत्वपूर्ण सुधार हासिल किया, जिसमें छवि के भीतर वस्तुओं का पता लगाना और उन्हें वर्गीकृत करना दोनों शामिल हैं। R-CNN ने प्रदर्शित किया कि एक कन्वोल्यूशनल न्यूरल नेटवर्क को छवि वर्गीकरण से ऑब्जेक्ट डिटेक्शन में प्रभावी ढंग से अनुकूलित किया जा सकता है, जिससे डिटेक्शन मॉडल की एक नई पीढ़ी के लिए मंच तैयार हुआ।

R-CNN का मुख्य नवाचार इसका क्षेत्र-आधारित दृष्टिकोण था। पूरी छवि को स्लाइडिंग विंडो के साथ स्कैन करने के बजाय, यह पहले उम्मीदवार क्षेत्रों का एक सेट उत्पन्न करता है जिनमें वस्तुएं होने की संभावना होती है, फिर प्रत्येक क्षेत्र पर स्वतंत्र रूप से एक CNN चलाता है। यह दो-चरणीय प्रतिमान - क्षेत्र प्रस्ताव के बाद वर्गीकरण - कई वर्षों तक ऑब्जेक्ट डिटेक्शन में एक प्रमुख ढांचा बन गया, जिसने बाद के मॉडल जैसे Fast R-CNN और Faster R-CNN को प्रभावित किया।

आर्किटेक्चर और विधि

R-CNN तीन मुख्य चरणों में काम करता है। पहले, यह प्रति छवि लगभग 2,000 श्रेणी-स्वतंत्र क्षेत्र प्रस्ताव उत्पन्न करने के लिए एक चयनात्मक खोज एल्गोरिदम का उपयोग करता है। ये प्रस्ताव उम्मीदवार बाउंडिंग बॉक्स होते हैं जिनमें वस्तुएं हो सकती हैं। दूसरे, प्रत्येक प्रस्ताव को एक निश्चित आकार (227x227 पिक्सेल) में बदला जाता है और एक CNN - आमतौर पर AlexNet का एक प्रकार - के माध्यम से पारित किया जाता है, ताकि 4,096-आयामी फीचर वेक्टर निकाला जा सके। तीसरे, इन फीचर्स को क्षेत्र को वर्गीकृत करने के लिए श्रेणी-विशिष्ट रैखिक सपोर्ट वेक्टर मशीनों (SVMs) के एक सेट में डाला जाता है, और एक बाउंडिंग-बॉक्स प्रतिगमन मॉडल प्रस्ताव के निर्देशांक को परिष्कृत करता है।

चयनात्मक खोज का उपयोग, जिसे 2013 में जैस्पर उइजलिंग्स और सहयोगियों द्वारा विकसित किया गया था, महत्वपूर्ण था क्योंकि इसने व्यापक स्लाइडिंग-विंडो दृष्टिकोणों की तुलना में मूल्यांकन करने के लिए क्षेत्रों की संख्या कम कर दी। CNN ने एक शक्तिशाली फीचर एक्सट्रैक्टर के रूप में कार्य किया, जो कच्चे पिक्सेल से पदानुक्रमित प्रतिनिधित्व सीखता था, जो पहले के डिटेक्टरों जैसे Deformable Parts Models में उपयोग किए जाने वाले हाथ से निर्मित फीचर्स जैसे हिस्टोग्राम ऑफ ओरिएंटेड ग्रेडिएंट्स (HOG) से बेहतर प्रदर्शन करता था।

प्रशिक्षण प्रक्रिया

R-CNN को प्रशिक्षित करने में एक बहु-चरणीय प्रक्रिया शामिल थी। CNN को पहले ImageNet वर्गीकरण डेटासेट पर पूर्व-प्रशिक्षित किया गया था, जिसमें 1,000 श्रेणियों में 1.2 मिलियन से अधिक छवियां शामिल हैं। फिर इसे लक्ष्य डिटेक्शन डेटासेट पर ठीक-ट्यून किया गया, जिसमें क्षेत्र प्रस्तावों का उपयोग किया गया जिनका ग्राउंड-ट्रुथ बॉक्स के साथ कम से कम 0.5 का इंटरसेक्शन-ओवर-यूनियन (IoU) ओवरलैप था, सकारात्मक उदाहरणों के रूप में और 0.3 से कम IoU वाले नकारात्मक के रूप में। ठीक-ट्यूनिंग के बाद, SVMs को निकाले गए फीचर्स पर प्रशिक्षित किया गया, जिसमें सकारात्मक के लिए 0.3 का सख्त IoU थ्रेशोल्ड था ताकि झूठे सकारात्मक कम हों। अंत में, बाउंडिंग बॉक्स निर्देशांक को समायोजित करने के लिए एक रैखिक प्रतिगमन मॉडल प्रशिक्षित किया गया, जिसमें 0.6 से अधिक IoU वाले प्रस्तावों का उपयोग किया गया।

यह प्रशिक्षण पाइपलाइन कम्प्यूटेशनल रूप से महंगी थी। प्रत्येक क्षेत्र प्रस्ताव को CNN के माध्यम से एक फॉरवर्ड पास की आवश्यकता थी, और प्रति छवि 2,000 प्रस्तावों के साथ, प्रशिक्षण और अनुमान धीमे थे। GPU पर, एक एकल छवि को संसाधित करने में लगभग 47 सेकंड लगते थे, जिससे वास्तविक समय के अनुप्रयोग अव्यावहारिक हो जाते थे। हालांकि, सटीकता में लाभ पर्याप्त थे।

प्रदर्शन और प्रभाव

PASCAL VOC 2012 डेटासेट पर, R-CNN ने 53.3% की माध्य औसत सटीकता (mAP) हासिल की, जो SegDPM विधि द्वारा प्राप्त पिछले सर्वोत्तम 40.4% से एक महत्वपूर्ण सुधार था। VOC 2007 डेटासेट पर, यह 58.5% mAP तक पहुंच गया, जो सभी पिछले तरीकों से बड़े अंतर से बेहतर प्रदर्शन करता था। इसने ऑब्जेक्ट डिटेक्शन के लिए गहन शिक्षण की शक्ति का प्रदर्शन किया और क्षेत्र में तेजी से प्रगति को उत्प्रेरित किया।

R-CNN की सफलता ने सुधारों की एक श्रृंखला को प्रेरित किया। 2015 में, रॉस गिरशिक ने Fast R-CNN पेश किया, जिसने एक एकल CNN फॉरवर्ड पास के माध्यम से क्षेत्रों में गणना साझा करके और एक क्षेत्र-ऑफ-इंटरेस्ट (RoI) पूलिंग परत का उपयोग करके प्रक्रिया को सुव्यवस्थित किया, जिससे प्रशिक्षण और अनुमान समय में काफी कमी आई। उसी वर्ष बाद में, Faster R-CNN ने चयनात्मक खोज को एक सीखे गए क्षेत्र प्रस्ताव नेटवर्क के साथ बदल दिया, जिससे पूरी पाइपलाइन अंत-से-अंत प्रशिक्षण योग्य और लगभग वास्तविक समय बन गई। ये मॉडल, YOLO (You Only Look Once) और SSD (Single Shot MultiBox Detector) के साथ, जिन्होंने एक अलग एकल-चरणीय दृष्टिकोण अपनाया, कई वर्षों तक ऑब्जेक्ट डिटेक्शन अनुसंधान पर हावी रहे।

R-CNN द्वारा पेश किए गए सिद्धांत - क्षेत्र प्रस्ताव, फीचर निष्कर्षण और बाउंडिंग-बॉक्स प्रतिगमन - आधुनिक डिटेक्शन सिस्टम में मौलिक बने हुए हैं, भले ही नए आर्किटेक्चर जैसे DETR (Detection Transformer) अंत-से-अंत ट्रांसफॉर्मर-आधारित दृष्टिकोणों की ओर बढ़ गए हैं। R-CNN का प्रभाव ऑब्जेक्ट डिटेक्शन से परे इंस्टेंस सेगमेंटेशन और कीपॉइंट डिटेक्शन जैसे कार्यों तक फैला हुआ है, जहां क्षेत्र-आधारित विधियां अभी भी व्यापक रूप से उपयोग की जाती हैं।

सीमाएं और विरासत

अपनी सफलताओं के बावजूद, R-CNN की उल्लेखनीय सीमाएं थीं। बहु-चरणीय प्रशिक्षण जटिल और समय लेने वाला था, जिसमें CNN, SVMs और बाउंडिंग-बॉक्स प्रतिगमन के लिए अलग-अलग प्रशिक्षण की आवश्यकता थी। अनुमान की गति कई व्यावहारिक अनुप्रयोगों के लिए बहुत धीमी थी, और मेमोरी फुटप्रिंट बड़ा था क्योंकि सभी प्रस्तावों के फीचर्स को संग्रहीत करना पड़ता था। इन मुद्दों ने तेज़ और अधिक एकीकृत उत्तराधिकारियों के विकास को प्रेरित किया।

फिर भी, R-CNN को कंप्यूटर विज़न में एक ऐतिहासिक पेपर माना जाता है। इसने प्रदर्शित किया कि गहन शिक्षण को ऑब्जेक्ट डिटेक्शन पर सफलतापूर्वक लागू किया जा सकता है, एक ऐसी समस्या जिसने पहले के प्रयासों का विरोध किया था। इसकी पद्धति ने कई बाद के कार्यों को प्रभावित किया और बड़े वर्गीकरण डेटासेट से ट्रांसफर लर्निंग के महत्व को स्थापित करने में मदद की। 2014 में IEEE कॉन्फ्रेंस ऑन कंप्यूटर विज़न एंड पैटर्न रिकग्निशन (CVPR) में प्रकाशित यह पेपर, दसियों हज़ार बार उद्धृत किया गया है, जो Artificial intelligence और Machine learning के क्षेत्र पर इसके स्थायी प्रभाव को दर्शाता है।

R-CNN ने 2012 में AlexNet जैसी अन्य सफलताओं के साथ, कंप्यूटर विज़न में Deep learning तकनीकों के व्यापक अपनाने में भी योगदान दिया। इसकी सफलता ने शोधकर्ताओं को CNNs को व्यापक दृश्य कार्यों, जैसे सिमेंटिक सेगमेंटेशन और वीडियो विश्लेषण पर लागू करने के लिए प्रोत्साहित किया। आज, जबकि नए मॉडलों ने प्रदर्शन में R-CNN को पीछे छोड़ दिया है, इसकी अवधारणात्मक रूपरेखा कंप्यूटर विज़न पाठ्यक्रमों में पाठ्यक्रम का एक प्रमुख हिस्सा और ऑब्जेक्ट डिटेक्शन के विकास को समझने के लिए एक संदर्भ बिंदु बनी हुई है।

संबंधित विकास

R-CNN की वंशावली में कई उल्लेखनीय प्रकार शामिल हैं। Fast R-CNN (2015) ने कन्वोल्यूशनल गणनाओं को साझा करने के लिए RoI पूलिंग पेश की, जिससे प्रशिक्षण समय दिनों से घंटों तक कम हो गया और VOC 2012 पर mAP में 66% तक सुधार हुआ। Faster R-CNN (2015) ने एक क्षेत्र प्रस्ताव नेटवर्क (RPN) जोड़ा जो क्षेत्रों का प्रस्ताव करना सीखता है, GPU पर लगभग 5 फ्रेम प्रति सेकंड की लगभग वास्तविक समय की गति प्राप्त करता है और सटीकता को और बढ़ाता है। Mask R-CNN (2017) ने बाउंडिंग बॉक्स के साथ सेगमेंटेशन मास्क की भविष्यवाणी के लिए एक शाखा जोड़कर Faster R-CNN को इंस्टेंस सेगमेंटेशन तक विस्तारित किया। ये मॉडल स्वायत्त ड्राइविंग से लेकर चिकित्सा इमेजिंग तक के अनुप्रयोगों में व्यापक रूप से अपनाए गए हैं, और वे क्षेत्र में आधुनिक आर्किटेक्चर को प्रभावित करना जारी रखते हैं।

इन्फोबॉक्स

  • प्रकार: ऑब्जेक्ट डिटेक्शन आर्किटेक्चर
  • पेश किया गया: 2014
  • पेश किया गया द्वारा: रॉस गिरशिक, जेफ डोनाह्यू, ट्रेवर डैरेल, जितेंद्र मलिक
  • संबंधित: Neural network, Deep learning, Machine learning

श्रेणियां

  • object-detection
  • computer-vision
  • deep-learning
  • convolutional-neural-network
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:object-detection·computer-vision·deep-learning·convolutional-neural-network
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास