RetinaNet एक एक-चरणीय मशीन लर्निंग तंत्रिका नेटवर्क वास्तुकला है जो वस्तु पहचान के लिए है, जिसे त्सुंग-यी लिन, प्रिया गोयल, रॉस गिरशिक, काइमिंग हे और पियोट्र डॉलर ने 2017 के एक शोधपत्र "फोकल लॉस फॉर डेंस ऑब्जेक्ट डिटेक्शन" में प्रस्तुत किया था। इसे फेसबुक एआई रिसर्च (अब मेटा एआई का हिस्सा) में विकसित किया गया था। मॉडल को एक-चरणीय डिटेक्टरों के बीच सटीकता के अंतर को दूर करने के लिए डिज़ाइन किया गया था, जो आमतौर पर तेज़ लेकिन कम सटीक होते हैं, और दो-चरणीय डिटेक्टरों जैसे फास्टर आर-सीएनएन, जो धीमे लेकिन अधिक सटीक होते हैं। RetinaNet फोकल लॉस पेश करके उच्च सटीकता प्राप्त करता है, जो एक नया लॉस फ़ंक्शन है जो प्रशिक्षण के दौरान आसान नकारात्मक उदाहरणों के योगदान को कम करता है, जिससे मॉडल कठिन उदाहरणों और दुर्लभ वस्तु वर्गों पर ध्यान केंद्रित कर सकता है।
RetinaNet एक पूर्ण रूप से संवोल्यूशनल नेटवर्क है जो बहु-पैमाने की विशेषताओं को निकालने के लिए फीचर पिरामिड नेटवर्क (FPN) बैकबोन का उपयोग करता है, इसके बाद दो कार्य-विशिष्ट सबनेटवर्क होते हैं: एक वस्तुओं को वर्गीकृत करने के लिए और एक बाउंडिंग बॉक्स को प्रतिगमित करने के लिए। वर्गीकरण सबनेटवर्क फोकल लॉस लागू करता है, जबकि प्रतिगमन सबनेटवर्क मानक स्मूथ L1 लॉस का उपयोग करता है। वास्तुकला घने पहचान के लिए डिज़ाइन की गई है, जिसका अर्थ है कि यह कई पैमानों पर हर स्थानिक स्थान पर वस्तुओं की भविष्यवाणी करती है, बिना किसी अलग क्षेत्र प्रस्ताव चरण की आवश्यकता के।
वास्तुकला और फोकल लॉस
RetinaNet का मुख्य नवाचार फोकल लॉस है, जो वर्गीकरण के लिए मानक क्रॉस-एन्ट्रॉपी लॉस को संशोधित करता है। फोकल लॉस क्रॉस-एन्ट्रॉपी पद में एक मॉड्यूलेटिंग कारक \((1 - p_t)^\gamma\) जोड़ता है, जहाँ \(p_t\) सही वर्ग के लिए मॉडल की अनुमानित संभावना है और \(\gamma\) एक फोकसिंग पैरामीटर है (आमतौर पर 2 पर सेट)। यह कारक अच्छी तरह से वर्गीकृत उदाहरणों (जहाँ \(p_t\) उच्च है) से लॉस योगदान को कम करता है, जिससे आसान पृष्ठभूमि उदाहरणों की विशाल संख्या प्रशिक्षण संकेत को प्रभावित नहीं करती। शोधपत्र ने प्रदर्शित किया कि अकेले फोकल लॉस, बिना वास्तुकला परिवर्तनों के, दो-चरणीय डिटेक्टरों के प्रदर्शन से मेल खाने या उससे अधिक करने के लिए पर्याप्त था।
नेटवर्क ResNet (ResNet-50 या ResNet-101) के बैकबोन का उपयोग करता है, जो फीचर पिरामिड नेटवर्क के साथ संयुक्त है, ताकि उच्च-रिज़ॉल्यूशन निम्न-स्तरीय विशेषताओं से लेकर निम्न-रिज़ॉल्यूशन उच्च-स्तरीय विशेषताओं तक कई पैमानों पर फीचर मैप उत्पन्न किए जा सकें। पिरामिड का प्रत्येक स्तर वर्गीकरण और प्रतिगमन सबनेटवर्क में फीड करता है, जो सभी पैमानों पर साझा होते हैं। यह डिज़ाइन एक ही फॉरवर्ड पास में छोटे से बड़े आकार की वस्तुओं का पता लगाने में सक्षम बनाता है।
प्रदर्शन और बेंचमार्क परिणाम
मूल शोधपत्र में, RetinaNet ने ResNet-101-FPN बैकबोन के साथ COCO टेस्ट-डेव बेंचमार्क पर 39.1 का अत्याधुनिक औसत परिशुद्धता (AP) हासिल किया, जो SSD और YOLOv2 जैसे पिछले एक-चरणीय डिटेक्टरों से आगे निकल गया, और फास्टर आर-सीएनएन जैसे दो-चरणीय डिटेक्टरों के प्रदर्शन से मेल खाता या उससे अधिक था। बड़े बैकबोन (ResNeXt-101-FPN) के साथ, यह 40.8 के AP तक पहुंच गया। मॉडल ने मजबूत अनुमान गति भी प्रदर्शित की, जो NVIDIA M40 GPU पर ResNet-50 बैकबोन के साथ 5.4 फ्रेम प्रति सेकंड तक चलता है, जिससे यह वास्तविक समय अनुप्रयोगों के लिए उपयुक्त हो जाता है।
लेखकों ने नोट किया कि फोकल लॉस अत्यधिक वर्ग असंतुलन को संभालने में विशेष रूप से प्रभावी था - COCO में, प्रति छवि लगभग 100,000 उम्मीदवार स्थान होते हैं लेकिन केवल कुछ वस्तुएं होती हैं, जिसमें पृष्ठभूमि उदाहरण अग्रभूमि वाले से कहीं अधिक होते हैं। आसान नकारात्मक उदाहरणों को कम महत्व देकर, RetinaNet ने पिछले घने डिटेक्टरों की तुलना में तेज़ अभिसरण और बेहतर अंतिम सटीकता हासिल की।
प्रभाव और विरासत
RetinaNet कंप्यूटर विज़न अनुसंधान में एक मानक आधार रेखा बन गया और स्वायत्त ड्राइविंग, निगरानी और चिकित्सा इमेजिंग जैसे अनुप्रयोगों के लिए उद्योग में व्यापक रूप से अपनाया गया। इसके डिज़ाइन सिद्धांतों ने बाद के वस्तु डिटेक्टरों को प्रभावित किया, जिसमें EfficientDet और नए एक-चरणीय मॉडल शामिल हैं। फोकल लॉस को अन्य कार्यों के लिए भी अनुकूलित किया गया, जैसे कि सिमेंटिक सेगमेंटेशन और प्राकृतिक भाषा प्रसंस्करण, जहाँ वर्ग असंतुलन की समस्याएं उत्पन्न होती हैं।
डीप लर्निंग फ्रेमवर्क में, RetinaNet को Detectron2, PyTorch के torchvision और TensorFlow ऑब्जेक्ट डिटेक्शन API जैसी लोकप्रिय लाइब्रेरीज़ में लागू किया गया है, जिससे शोधकर्ताओं और चिकित्सकों के लिए इसका उपयोग आसान हो गया है। इसे बड़े कृत्रिम बुद्धिमत्ता प्रणालियों में एक घटक के रूप में उपयोग किया गया है, जिसमें वाहन और पैदल यात्री पहचान के लिए टेस्ला ऑटोपायलट और वेमो की स्वायत्त ड्राइविंग तकनीक शामिल है, हालांकि इन कंपनियों ने तब से कस्टम वास्तुकला की ओर रुख किया है।
विस्तार और विविधताएं
RetinaNet के कई विस्तार प्रस्तावित किए गए हैं। एक उल्लेखनीय विविधता RetinaMask है, जो मास्क भविष्यवाणी शाखा जोड़कर RetinaNet को इंस्टेंस सेगमेंटेशन तक विस्तारित करती है। एक और FCOS (फुली कन्वोल्यूशनल वन-स्टेज) है, जो समान सिद्धांतों पर निर्मित है लेकिन एंकर बॉक्स के बिना केंद्र-आधारित भविष्यवाणी का उपयोग करता है। शोधकर्ताओं ने ध्यान तंत्र को एकीकृत करने की भी खोज की है, जैसे कि DEtection TRansformer (DETR) में, जो एक ट्रांसफॉर्मर वास्तुकला का उपयोग करता है लेकिन फिर भी उसी घने पहचान समस्या को संबोधित करता है।
मूल RetinaNet शोधपत्र को व्यापक रूप से उद्धृत किया गया है, 2024 तक 10,000 से अधिक उद्धरणों के साथ, जो वस्तु पहचान के क्षेत्र पर इसके महत्वपूर्ण प्रभाव को दर्शाता है। लॉस फ़ंक्शन डिज़ाइन में इसके योगदान घने भविष्यवाणी नेटवर्क के प्रशिक्षण में एक मानक तकनीक बने हुए हैं।