Mask R-CNN एक Deep learning मॉडल है जिसे इंस्टेंस सेगमेंटेशन के लिए डिज़ाइन किया गया है, जो एक कंप्यूटर विज़न कार्य है जो किसी छवि में प्रत्येक ऑब्जेक्ट इंस्टेंस को पिक्सेल स्तर पर पहचानता और रेखांकित करता है। यह Faster R-CNN ऑब्जेक्ट डिटेक्शन फ्रेमवर्क का विस्तार करता है, जिसमें सेगमेंटेशन मास्क की भविष्यवाणी के लिए एक समानांतर शाखा जोड़ी जाती है, जिससे एक साथ ऑब्जेक्ट डिटेक्शन और सटीक स्थानिक स्थानीयकरण संभव होता है। 2017 में Facebook AI Research (अब Meta का हिस्सा) के शोधकर्ताओं द्वारा पेश किया गया, इस मॉडल ने COCO डेटासेट पर अत्याधुनिक परिणाम प्राप्त किए और कई बाद के सेगमेंटेशन मॉडल के लिए एक आधारभूत आर्किटेक्चर बन गया।
सिमेंटिक सेगमेंटेशन के विपरीत, जो प्रत्येक पिक्सेल को व्यक्तिगत ऑब्जेक्ट को अलग किए बिना एक श्रेणी में वर्गीकृत करता है, इंस्टेंस सेगमेंटेशन के लिए एक ही वर्ग के अतिव्यापी या आसन्न ऑब्जेक्ट को अलग करना आवश्यक होता है। Mask R-CNN इसे एक रीजन प्रपोज़ल नेटवर्क (RPN) को मास्क भविष्यवाणी हेड के साथ जोड़कर संबोधित करता है। RPN उम्मीदवार ऑब्जेक्ट बाउंडिंग बॉक्स उत्पन्न करता है, जबकि मास्क शाखा प्रत्येक रीजन ऑफ इंटरेस्ट (RoI) के लिए एक बाइनरी मास्क आउटपुट करती है, जिसमें स्थानिक संरेखण को संरक्षित करने के लिए RoIAlign नामक तकनीक का उपयोग किया जाता है।
Architecture
आर्किटेक्चर Faster R-CNN पर आधारित है, जो स्वयं Neural network ऑब्जेक्ट डिटेक्टरों के परिवार का विस्तार है। Faster R-CNN फीचर मैप निकालने के लिए एक कन्वोल्यूशनल बैकबोन (जैसे ResNet), क्षेत्र प्रस्तावित करने के लिए एक RPN, और ऑब्जेक्ट वर्गों की भविष्यवाणी करने और बाउंडिंग बॉक्स को परिष्कृत करने के लिए एक क्लासिफायर का उपयोग करता है। Mask R-CNN एक तीसरी शाखा जोड़ता है जो वर्गीकरण और बॉक्स रिग्रेशन हेड के साथ समानांतर में काम करती है। यह मास्क शाखा एक पूर्ण कन्वोल्यूशनल नेटवर्क है जो प्रत्येक RoI के लिए एक बाइनरी मास्क की भविष्यवाणी करती है, आमतौर पर 28×28 पिक्सेल के रिज़ॉल्यूशन पर, जिसे बाद में मूल छवि आकार तक अपसैंपल किया जाता है।
एक प्रमुख नवाचार RoIAlign है, जो Faster R-CNN में उपयोग किए जाने वाले RoIPool ऑपरेशन को प्रतिस्थापित करता है। RoIPool RoI सीमाओं को क्वांटाइज़ करता है, जिससे निकाले गए फीचर और मूल छवि के बीच मिसअलाइनमेंट होता है। RoIAlign बिलिनियर इंटरपोलेशन का उपयोग करके क्वांटाइज़ेशन से बचता है, जिससे सटीक स्थानिक जानकारी संरक्षित रहती है। यह सुधार पिक्सेल-सटीक मास्क भविष्यवाणी के लिए महत्वपूर्ण है, क्योंकि छोटे मिसअलाइनमेंट भी सेगमेंटेशन गुणवत्ता को खराब कर सकते हैं।
Training and Loss
मॉडल को एक मल्टी-टास्क लॉस फ़ंक्शन के साथ एंड-टू-एंड प्रशिक्षित किया जाता है जो तीन घटकों को जोड़ता है: वर्गीकरण लॉस (क्रॉस-एंट्रॉपी), बाउंडिंग बॉक्स रिग्रेशन लॉस (स्मूथ L1), और मास्क लॉस (प्रति पिक्सेल बाइनरी क्रॉस-एंट्रॉपी)। मास्क शाखा केवल सकारात्मक RoI (जिनमें एक ऑब्जेक्ट होता है) पर प्रशिक्षित होती है, और प्रत्येक RoI को एक विशिष्ट ग्राउंड-ट्रुथ वर्ग को सौंपा जाता है, इसलिए मास्क भविष्यवाणी वर्ग-विशिष्ट होती है। अनुमान के दौरान, मास्क शाखा प्रत्येक पहचाने गए ऑब्जेक्ट के लिए चलती है, और अंतिम आउटपुट में वर्ग लेबल, बाउंडिंग बॉक्स और मास्क शामिल होते हैं।
प्रशिक्षण आमतौर पर मोमेंटम के साथ स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग करता है, जिसमें ImageNet पर पूर्व-प्रशिक्षित वेट से आरंभ किया जाता है। COCO डेटासेट पर, Mask R-CNN ने ResNet-101 बैकबोन के साथ 35.7% की मास्क औसत परिशुद्धता (AP) प्राप्त की, जो FCIS और Mask R-CNN के पूर्ववर्ती जैसे पिछले तरीकों से बेहतर प्रदर्शन करती है, जो अधिक जटिल पोस्ट-प्रोसेसिंग पर निर्भर थे। मॉडल ने Cityscapes और चिकित्सा इमेजिंग में इंस्टेंस-स्तरीय सेगमेंटेशन कार्यों सहित अन्य बेंचमार्क पर भी मजबूत प्रदर्शन दिखाया।
Applications
इंस्टेंस सेगमेंटेशन के विभिन्न क्षेत्रों में व्यापक अनुप्रयोग हैं। स्वायत्त ड्राइविंग में, Mask R-CNN पैदल चलने वालों, वाहनों और सड़क बाधाओं को पहचानने और अलग करने में मदद करता है, जिससे Waymo और Tesla जैसी कंपनियों के लिए धारणा प्रणाली में सुधार होता है। चिकित्सा इमेजिंग में, यह स्कैन से ट्यूमर, कोशिकाओं या अंगों को सेगमेंट करता है, जिससे निदान और सर्जिकल योजना में सहायता मिलती है। रोबोटिक्स में, यह पिक्सेल-स्तरीय ऑब्जेक्ट सीमाएं प्रदान करके सटीक ऑब्जेक्ट हेरफेर सक्षम करता है। अन्य उपयोगों में उपग्रह इमेजरी विश्लेषण, कृषि निगरानी और संवर्धित वास्तविकता शामिल हैं, जहां सटीक ऑब्जेक्ट रूपरेखा दृश्य समझ को बढ़ाती है।
मॉडल की लचीलापन वीडियो इंस्टेंस सेगमेंटेशन तक भी फैली हुई है, जहां अस्थायी स्थिरता जोड़ी जाती है, और पैनोप्टिक सेगमेंटेशन तक, जो इंस्टेंस और सिमेंटिक सेगमेंटेशन को एक एकीकृत आउटपुट में जोड़ता है। फीचर पिरामिड नेटवर्क (FPN) के साथ Mask R-CNN जैसे वेरिएंट छोटे ऑब्जेक्ट पर सटीकता में सुधार करते हैं, और MobileNet जैसे हल्के बैकबोन एज डिवाइस पर तैनाती सक्षम करते हैं।
Impact and Legacy
Mask R-CNN ने इंस्टेंस सेगमेंटेशन के लिए एक नया मानक स्थापित किया, जिसने Cascade Mask R-CNN, Hybrid Task Cascade, और Transformer (architecture)-आधारित DETR और Mask2Former जैसे बाद के आर्किटेक्चर को प्रभावित किया। Detectron2 फ्रेमवर्क (2019 में Meta AI द्वारा जारी) में इसका ओपन-सोर्स कार्यान्वयन अनुसंधान और उद्योग में अपनाने में तेजी लाता है। मॉडल के डिज़ाइन सिद्धांत - मल्टी-टास्क लर्निंग, RoIAlign, और समानांतर भविष्यवाणी हेड - अन्य विज़न कार्यों में व्यापक रूप से पुन: उपयोग किए गए हैं, जिनमें कीपॉइंट डिटेक्शन और पैनोप्टिक सेगमेंटेशन शामिल हैं।
एंड-टू-एंड ट्रांसफॉर्मर मॉडल के उदय के बावजूद, Mask R-CNN अपनी दक्षता और सटीकता के कारण एक मजबूत बेसलाइन बना हुआ है। 2024 तक, यह अभी भी उत्पादन प्रणालियों में उपयोग किया जाता है जहां कम्प्यूटेशनल संसाधन सीमित हैं, और इसकी अवधारणाएं मानक कंप्यूटर विज़न पाठ्यक्रमों में पढ़ाई जाती हैं। Kaiming He, Georgia Gkioxari, Piotr Dollár, और Ross Girshick द्वारा ICCV 2017 में प्रकाशित पेपर "Mask R-CNN" को हजारों उद्धरण मिले हैं, जो क्षेत्र पर इसके स्थायी प्रभाव को दर्शाता है।
Limitations
Mask R-CNN की ज्ञात सीमाएं हैं। यह दो-चरणीय आर्किटेक्चर के कारण सरल डिटेक्टरों की तुलना में धीमा है, जिससे हार्डवेयर त्वरण के बिना वास्तविक समय के अनुप्रयोग चुनौतीपूर्ण हो जाते हैं। मास्क रिज़ॉल्यूशन 28×28 पर स्थिर है, जो बड़े ऑब्जेक्ट के लिए बारीक विवरण खो सकता है। यह अत्यधिक अतिव्यापी इंस्टेंस के साथ भी संघर्ष करता है, जहां RPN प्रपोज़ल को विलय कर सकता है। प्रशिक्षण के लिए पिक्सेल-स्तरीय मास्क के साथ बड़े एनोटेटेड डेटासेट की आवश्यकता होती है, जो उत्पादन करने में महंगे हैं। इसके अतिरिक्त, मॉडल डोमेन शिफ्ट के प्रति संवेदनशील है, अपने प्रशिक्षण वितरण के बाहर की छवियों पर खराब प्रदर्शन करता है, जो Machine learning प्रणालियों में एक सामान्य मुद्दा है।
शोध ने इनमें से कुछ मुद्दों को संबोधित किया है, जैसे उच्च-रिज़ॉल्यूशन मास्क या ध्यान तंत्र का उपयोग, लेकिन गति और सटीकता के बीच व्यापार-बंद बना हुआ है। कई व्यावहारिक परिदृश्यों के लिए, Mask R-CNN एक विश्वसनीय विकल्प बना हुआ है, जो परिशुद्धता को मध्यम कम्प्यूटेशनल लागत के साथ संतुलित करता है।