Fast R-CNN एक ऑब्जेक्ट डिटेक्शन मॉडल है जो अपने पूर्ववर्ती R-CNN (रीजन-बेस्ड कन्वोल्यूशनल न्यूरल नेटवर्क) की गति और सटीकता में महत्वपूर्ण सुधार करता है। माइक्रोसॉफ्ट रिसर्च में रॉस गिरशिक द्वारा विकसित, इसे 2015 में पेश किया गया था और यह छवियों के भीतर वस्तुओं की पहचान करने के लिए गहरे कन्वोल्यूशनल न्यूरल नेटवर्क का उपयोग करने की अवधारणा पर आधारित है। Fast R-CNN का प्राथमिक नवाचार एक एकल कन्वोल्यूशनल नेटवर्क के माध्यम से पूरी छवि को संसाधित करने और फिर प्रत्येक प्रस्तावित क्षेत्र के लिए विशेषताएँ निकालने की क्षमता है, जिससे पुराने तरीकों को प्रभावित करने वाली अनावश्यक गणना से बचा जा सके।
R-CNN के विपरीत, जो हजारों क्षेत्र प्रस्तावों में से प्रत्येक के लिए एक अलग कन्वोल्यूशनल नेटवर्क पास चलाता था, Fast R-CNN एक छवि में सभी क्षेत्रों के बीच कन्वोल्यूशनल गणना साझा करता है। यह पहले पूरी छवि को एक कन्वोल्यूशनल नेटवर्क के माध्यम से पारित करके एक फीचर मैप उत्पन्न करके प्राप्त किया जाता है। फिर, प्रत्येक क्षेत्र प्रस्ताव के लिए, एक रीजन ऑफ इंटरेस्ट (RoI) पूलिंग परत फीचर मैप से एक निश्चित आकार का फीचर वेक्टर निकालती है। यह डिज़ाइन प्रशिक्षण और अनुमान दोनों के समय को नाटकीय रूप से कम करता है, जिससे यह वास्तविक दुनिया के अनुप्रयोगों के लिए व्यावहारिक बन जाता है।
आर्किटेक्चर और RoI पूलिंग
Fast R-CNN का मुख्य वास्तुशिल्प घटक RoI पूलिंग परत है। यह परत कन्वोल्यूशनल नेटवर्क द्वारा उत्पन्न फीचर मैप और क्षेत्र प्रस्तावों का एक सेट (आमतौर पर चयनात्मक खोज जैसे बाहरी एल्गोरिदम द्वारा निर्मित) लेती है। प्रत्येक प्रस्ताव के लिए, यह फीचर मैप के संबंधित क्षेत्र को एक निश्चित ग्रिड (जैसे, 7x7) में विभाजित करता है और प्रत्येक ग्रिड सेल के भीतर अधिकतम पूलिंग लागू करता है। यह मूल क्षेत्र के आकार या पहलू अनुपात की परवाह किए बिना एक निश्चित आकार का आउटपुट उत्पन्न करता है, जिससे बाद की पूरी तरह से जुड़ी परतों में एक स्थिर इनपुट आयाम हो सके।
नेटवर्क को कन्वोल्यूशनल परतों (अक्सर VGG-16 जैसे पूर्व-प्रशिक्षित मॉडल पर आधारित) के साथ एक फीचर एक्सट्रैक्टर के रूप में संरचित किया जाता है, उसके बाद RoI पूलिंग परत, और फिर पूरी तरह से जुड़ी परतों की एक श्रृंखला होती है। अंतिम परतें दो आउटपुट में विभाजित होती हैं: एक क्षेत्र के भीतर वस्तु को वर्गीकृत करने के लिए (ऑब्जेक्ट क्लासेस के साथ-साथ एक पृष्ठभूमि वर्ग पर सॉफ्टमैक्स क्लासिफायर का उपयोग करके) और एक बाउंडिंग बॉक्स निर्देशांक को परिष्कृत करने के लिए (रिग्रेशन हेड का उपयोग करके)।
प्रशिक्षण और मल्टी-टास्क लॉस
Fast R-CNN को एक मल्टी-टास्क लॉस फ़ंक्शन का उपयोग करके एंड-टू-एंड प्रशिक्षित किया जाता है जो वर्गीकरण और बाउंडिंग बॉक्स रिग्रेशन लॉस को जोड़ता है। वर्गीकरण लॉस आमतौर पर ऑब्जेक्ट क्लासेस पर एक लॉग लॉस होता है, जबकि रिग्रेशन लॉस एक स्मूथ L1 लॉस होता है जो भविष्यवाणी किए गए बाउंडिंग बॉक्स और ग्राउंड ट्रुथ के बीच अंतर को मापता है। यह संयुक्त प्रशिक्षण नेटवर्क को वस्तुओं को पहचानने और उन्हें सटीक रूप से स्थानीयकृत करने की क्षमता में एक साथ सुधार करने की अनुमति देता है।
प्रशिक्षण स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग करके सावधानीपूर्वक डिज़ाइन की गई नमूनाकरण रणनीति के साथ किया जाता है। प्रत्येक मिनी-बैच के दौरान, छवियों की एक छोटी संख्या का चयन किया जाता है, और प्रत्येक छवि से, क्षेत्र प्रस्तावों की एक निश्चित संख्या का नमूना लिया जाता है, जिससे सकारात्मक (वस्तुओं वाले) और नकारात्मक (पृष्ठभूमि) उदाहरणों के बीच संतुलन सुनिश्चित होता है। यह दृष्टिकोण, साझा गणना के साथ मिलकर, प्रशिक्षण को R-CNN की तुलना में काफी तेज़ बनाता है, जिसके लिए क्लासिफायर और रिग्रेसर के लिए अलग प्रशिक्षण के साथ एक बहु-चरण पाइपलाइन की आवश्यकता होती थी।
प्रदर्शन और प्रभाव
PASCAL VOC 2012 डेटासेट पर, Fast R-CNN ने 66% की माध्य औसत सटीकता (mAP) हासिल की, जो R-CNN के 62% और SPPnet के 59% से काफी सुधार था। अधिक महत्वपूर्ण बात यह है कि यह प्रशिक्षण के दौरान R-CNN से लगभग 9 गुना तेज़ और परीक्षण के समय 213 गुना तेज़ था, एक छवि को लगभग 0.3 सेकंड में संसाधित करता था (क्षेत्र प्रस्ताव निर्माण को छोड़कर)। इस गति ने इंटरैक्टिव सिस्टम और बड़े पैमाने के अनुप्रयोगों में ऑब्जेक्ट डिटेक्शन मॉडल को तैनात करना संभव बना दिया।
मॉडल की सफलता ने ऑब्जेक्ट डिटेक्शन में गणना साझा करने और एंड-टू-एंड प्रशिक्षण के महत्व को उजागर किया। इसने बाद के विकासों के लिए भी मंच तैयार किया, विशेष रूप से Faster R-CNN, जिसने बाहरी प्रस्ताव एल्गोरिदम को समाप्त करने और गति और सटीकता में और सुधार करने के लिए एक रीजन प्रपोज़ल नेटवर्क पेश किया। Fast R-CNN Deep learning-आधारित ऑब्जेक्ट डिटेक्शन के क्षेत्र में एक मौलिक संदर्भ बना हुआ है।
अन्य मॉडलों से संबंध
Fast R-CNN ऑब्जेक्ट डिटेक्शन मॉडल की एक श्रृंखला का हिस्सा है जो मूल R-CNN से विकसित हुआ। R-CNN से मुख्य अंतर साझा फीचर गणना और RoI पूलिंग का उपयोग है। SPPnet की तुलना में, जो गणना भी साझा करता था लेकिन स्थानिक पिरामिड पूलिंग दृष्टिकोण का उपयोग करता था, Fast R-CNN ने RoI पूलिंग परत के माध्यम से ग्रेडिएंट्स को प्रवाहित करने की अनुमति देकर प्रशिक्षण प्रक्रिया को सरल बनाया, जिससे सभी परतों का एंड-टू-एंड फाइन-ट्यूनिंग संभव हो सका। यह एक महत्वपूर्ण लाभ था, क्योंकि SPPnet पिरामिड पूलिंग से पहले कन्वोल्यूशनल परतों को फाइन-ट्यून नहीं कर सकता था।
Fast R-CNN के विचारों ने कई बाद के आर्किटेक्चर को प्रभावित किया है, जिसमें Residual Network (ResNet)-आधारित डिटेक्टर और U-Net-प्रेरित सेगमेंटेशन मॉडल शामिल हैं, हालांकि इसके प्रत्यक्ष उत्तराधिकारी R-CNN परिवार में हैं। इसने मल्टी-टास्क लर्निंग की प्रभावशीलता भी प्रदर्शित की, एक अवधारणा जो अब Artificial intelligence प्रणालियों में व्यापक रूप से उपयोग की जाती है। बाहरी क्षेत्र प्रस्तावों पर मॉडल की निर्भरता को बाद में Faster R-CNN द्वारा संबोधित किया गया, जिसने प्रस्ताव निर्माण को नेटवर्क में एकीकृत किया, जिससे पूरी पाइपलाइन पूरी तरह से प्रशिक्षण योग्य बन गई।
सीमाएँ और विरासत
अपने सुधारों के बावजूद, Fast R-CNN में अभी भी सीमाएँ थीं। क्षेत्र प्रस्ताव चरण (जैसे, चयनात्मक खोज) कम्प्यूटेशनल रूप से महंगा था और प्रशिक्षण योग्य नहीं था, जिससे एक बाधा उत्पन्न हुई। इसके अतिरिक्त, मॉडल पूरी तरह से एंड-टू-एंड नहीं था, क्योंकि प्रस्ताव निर्माण अलग था। इन मुद्दों को Faster R-CNN में हल किया गया था, लेकिन फीचर साझाकरण और मल्टी-टास्क लॉस में Fast R-CNN का योगदान आधुनिक डिटेक्टरों के लिए अभिन्न बना हुआ है।
Fast R-CNN को शैक्षणिक साहित्य में व्यापक रूप से उद्धृत किया जाता है और नए डिटेक्शन विधियों की तुलना के लिए एक बेंचमार्क के रूप में कार्य करता है। इसके डिज़ाइन सिद्धांत - साझा कन्वोल्यूशनल विशेषताएँ, RoI पूलिंग, और संयुक्त अनुकूलन - अब कई ऑब्जेक्ट डिटेक्शन फ्रेमवर्क में मानक हैं। यह मॉडल Machine learning और कंप्यूटर विज़न पर पाठ्यक्रमों में एक सामान्य शैक्षिक उदाहरण भी है, जो दर्शाता है कि वास्तुशिल्प विकल्प कम्प्यूटेशनल दक्षता और सटीकता को कैसे नाटकीय रूप से प्रभावित कर सकते हैं।
यह भी देखें
- न्यूरल नेटवर्क
- कन्वोल्यूशनल न्यूरल नेटवर्क (डीप लर्निंग के माध्यम से जुड़ा हुआ)
- अवशिष्ट नेटवर्क
- डेटा संवर्धन
- लॉस फ़ंक्शन