फास्ट आर-सीएनएन एक Machine learning मॉडल है जो वस्तु पहचान और स्थानीकरण के लिए उपयोग किया जाता है, जिसे अप्रैल 2015 में मूल आर-सीएनएन में सुधार के रूप में पेश किया गया था। यह क्षेत्र-आधारित कन्वोल्यूशनल न्यूरल नेटवर्क (आर-सीएनएन) के परिवार से संबंधित है, जिसका उद्देश्य बाउंडिंग बॉक्स और श्रेणी लेबल उत्पन्न करके छवियों में वस्तुओं की पहचान करना है। फास्ट आर-सीएनएन अपने पूर्ववर्ती की एक प्रमुख अक्षमता को संबोधित करता है, जिसमें अंतर्निहित Neural network को हजारों उम्मीदवार क्षेत्रों पर अलग-अलग चलाने के बजाय पूरी छवि पर केवल एक बार चलाया जाता है, जिससे प्रशिक्षण और अनुमान तेज होता है और सटीकता बनी रहती है।
यह मॉडल रॉस गिरशिक द्वारा विकसित किया गया था, जो आर-सीएनएन के साथ पहले के काम पर आधारित था। यह रुचि के क्षेत्रों (आरओआई) का प्रस्ताव करने के लिए एक चयनात्मक खोज एल्गोरिदम का उपयोग करता है, जिन्हें बाद में एक कन्वोल्यूशनल नेटवर्क द्वारा संसाधित किया जाता है। एक समर्पित आरओआईपूलिंग मॉड्यूल प्रत्येक आरओआई के लिए निश्चित आकार की फीचर मैप्स निकालता है, जिन्हें बाद में वर्गीकृत किया जाता है और बाउंडिंग बॉक्स प्रतिगमन के लिए परिष्कृत किया जाता है। यह डिज़ाइन आर-सीएनएन की तुलना में कम्प्यूटेशनल अतिरेक को काफी कम करता है, जो प्रत्येक आरओआई के लिए स्वतंत्र रूप से सुविधाओं की गणना करता था।
आर्किटेक्चर
फास्ट आर-सीएनएन के आर्किटेक्चर में एक कन्वोल्यूशनल बैकबोन (जैसे, वीजीजी16) होता है जो इनपुट छवि को एक बार संसाधित करता है, जिससे एक फीचर मैप उत्पन्न होता है। चयनात्मक खोज छवि से 2000 तक क्षेत्र प्रस्ताव उत्पन्न करती है। प्रत्येक प्रस्ताव को फीचर मैप में एक क्षेत्र में मैप किया जाता है, और आरओआईपूलिंग उस क्षेत्र को एक निश्चित ग्रिड (जैसे, 7x7) में विभाजित करता है, जिसमें अधिकतम पूलिंग लागू करके निश्चित आकार का आउटपुट उत्पन्न किया जाता है। ये पूल किए गए फीचर पूरी तरह से जुड़ी परतों में भेजे जाते हैं जो सॉफ्टमैक्स वर्ग संभावनाएं और बाउंडिंग बॉक्स ऑफसेट आउटपुट करती हैं। पूरे नेटवर्क को वर्गीकरण और प्रतिगमन को संयोजित करने वाले एक बहु-कार्य हानि का उपयोग करके अंत-से-अंत तक प्रशिक्षित किया जाता है।
मूल आर-सीएनएन के विपरीत, जिसे प्रत्येक घटक के लिए एक अलग प्रशिक्षण चरण की आवश्यकता होती थी, फास्ट आर-सीएनएन सभी परतों को संयुक्त रूप से अनुकूलित करता है, जिससे प्रशिक्षण पाइपलाइन सरल हो जाती है। आरओआईपूलिंग का उपयोग बैकप्रॉपेगेशन के दौरान क्षेत्र प्रस्तावों के माध्यम से ग्रेडिएंट्स को प्रवाहित करने की अनुमति देता है, जिससे कुशल सीखना सक्षम होता है।
आर-सीएनएन पर सुधार
फास्ट आर-सीएनएन का प्राथमिक सुधार कम्प्यूटेशनल दक्षता है। आर-सीएनएन प्रत्येक 2000 आरओआई को सीएनएन के माध्यम से स्वतंत्र रूप से संसाधित करता था, जिससे बड़े पैमाने पर अनावश्यक गणना होती थी। फास्ट आर-सीएनएन सभी आरओआई के बीच कन्वोल्यूशनल गणना साझा करता है, जिससे प्रशिक्षण समय दिनों से घंटों तक कम हो जाता है और अनुमान गति 200 गुना से अधिक बढ़ जाती है। इसके अतिरिक्त, फास्ट आर-सीएनएन एक बहु-कार्य हानि का उपयोग करता है जो वर्गीकरण और बाउंडिंग बॉक्स प्रतिगमन को एक साथ अनुकूलित करता है, जिससे आर-सीएनएन के अलग प्रशिक्षण चरणों की तुलना में स्थानीकरण सटीकता में सुधार होता है।
एक और उल्लेखनीय परिवर्तन आर-सीएनएन में उपयोग किए जाने वाले सपोर्ट वेक्टर मशीनों (एसवीएम) के बजाय सॉफ्टमैक्स क्लासिफायर का उपयोग है, जो मॉडल को सरल बनाता है और प्रदर्शन में सुधार करता है। आरओआईपूलिंग परत अंत-से-अंत प्रशिक्षण को भी सक्षम बनाती है, जो मूल आर-सीएनएन में इसकी अलग प्रशिक्षण प्रक्रिया के कारण संभव नहीं था।
प्रभाव और विरासत
फास्ट आर-सीएनएन वस्तु पहचान में एक महत्वपूर्ण मील का पत्थर था, जिसने बाद के मॉडलों को प्रभावित किया। इसके बाद जून 2015 में फास्टर आर-सीएनएन आया, जिसने न्यूरल नेटवर्क में एकीकृत क्षेत्र प्रस्ताव नेटवर्क के साथ चयनात्मक खोज को बदल दिया, जिससे गति और सटीकता में और सुधार हुआ। बाद के विस्तार में इंस्टेंस सेगमेंटेशन के लिए मास्क आर-सीएनएन (मार्च 2017), बढ़ते आईओयू थ्रेसहोल्ड के साथ बेहतर स्थानीकरण के लिए कैस्केड आर-सीएनएन (दिसंबर 2017), और 3डी मेश जनरेशन के लिए मेश आर-सीएनएन (जून 2019) शामिल हैं। आर-सीएनएन परिवार को ड्रोन कैमरों से वस्तुओं को ट्रैक करने, टेक्स्ट स्थानीकरण और गूगल लेंस को शक्ति देने जैसे कार्यों में लागू किया गया है।
फास्ट आर-सीएनएन के आर्किटेक्चर, विशेष रूप से आरओआईपूलिंग, ने कई बाद के डिटेक्शन फ्रेमवर्क को प्रभावित किया। इसके साझा गणना और अंत-से-अंत प्रशिक्षण के सिद्धांत अब आधुनिक वस्तु डिटेक्टरों में मानक हैं, जिनमें Deep learning अनुप्रयोगों में उपयोग किए जाने वाले भी शामिल हैं।
प्रशिक्षण और प्रदर्शन
फास्ट आर-सीएनएन को पास्कल वीओसी और सीओसीओ जैसे डेटासेट पर प्रशिक्षित किया जाता है, जिसमें सीखने की दर अनुसूची के साथ स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग किया जाता है। यह आमतौर पर एक पूर्व-प्रशिक्षित बैकबोन (जैसे, वीजीजी16) का उपयोग करता है जो लक्ष्य डेटासेट पर ठीक-ट्यून किया जाता है। मॉडल बेंचमार्क डेटासेट पर उच्च माध्य औसत सटीकता (एमएपी) प्राप्त करता है, जिसमें आर-सीएनएन पर महत्वपूर्ण गति सुधार होता है। उदाहरण के लिए, पास्कल वीओसी 2012 पर, फास्ट आर-सीएनएन ने 66% की एमएपी प्राप्त की, जबकि आर-सीएनएन की तुलना में अनुमान पर लगभग 25 गुना तेज था।
प्रशिक्षण प्रक्रिया में प्रति बैच छोटी संख्या में छवियों से आरओआई नमूना लेना शामिल है, जो सकारात्मक और नकारात्मक उदाहरणों को संतुलित करता है। बहु-कार्य हानि वर्गीकरण और प्रतिगमन को भारित करती है, जिसमें इष्टतम प्रदर्शन के लिए हाइपरपैरामीटर ट्यून किए जाते हैं। फास्ट आर-सीएनएन की दक्षता ने इसे वास्तविक दुनिया के अनुप्रयोगों के लिए व्यावहारिक बना दिया, जिससे कंप्यूटर विजन अनुसंधान और उद्योग में इसका व्यापक रूप से अपनाना संभव हुआ।