अंग्रेज़ी से अनुवादित

Mask R-CNN एक गहन शिक्षण आर्किटेक्चर है जो इंस्टेंस सेगमेंटेशन के लिए है, जो Faster R-CNN का विस्तार करता है, जिसमें एक मास्क शाखा जोड़ी गई है। यह वस्तुओं का पता लगाता है और साथ ही पिक्सेल-स्तरीय सेगमेंटेशन मास्क उत्पन्न करता है।

Mask R-CNN एक Deep learning वास्तुकला है जो इंस्टेंस सेगमेंटेशन के लिए है, एक कंप्यूटर विज़न कार्य जो ऑब्जेक्ट डिटेक्शन को पिक्सेल-स्तरीय सेगमेंटेशन के साथ जोड़ता है। यह Faster R-CNN ऑब्जेक्ट डिटेक्शन ढांचे का विस्तार करता है, जिसमें सेगमेंटेशन मास्क की भविष्यवाणी के लिए एक समानांतर शाखा जोड़ी जाती है, जिससे मॉडल बाउंडिंग बॉक्स के साथ ऑब्जेक्ट्स को स्थानीयकृत करने और उनकी सटीक पिक्सेल सीमाओं को रेखांकित करने में सक्षम होता है। Facebook AI Research (अब Meta का हिस्सा) के शोधकर्ताओं द्वारा विकसित, Mask R-CNN को 2017 में पेश किया गया था और यह स्वायत्त ड्राइविंग, चिकित्सा इमेजिंग और रोबोटिक्स में कई डाउनस्ट्रीम अनुप्रयोगों के लिए एक आधारभूत मॉडल बन गया।

वास्तुकला सीधे Faster R-CNN पर आधारित है, जो स्वयं पहले के क्षेत्र-आधारित कन्वोल्यूशनल न्यूरल नेटवर्क से विकसित हुआ। Faster R-CNN उम्मीदवार ऑब्जेक्ट क्षेत्रों को उत्पन्न करने के लिए एक Region Proposal Network (RPN) का उपयोग करता है, इसके बाद वर्गीकरण और बाउंडिंग-बॉक्स प्रतिगमन के लिए निश्चित-आकार की फीचर मैप्स निकालने के लिए एक region-of-interest (RoI) पूलिंग परत का उपयोग करता है। Mask R-CNN RoI पूलिंग को RoIAlign से बदल देता है, एक प्रमुख संशोधन जो RoI पूलिंग द्वारा शुरू किए गए स्थानिक क्वांटिज़ेशन त्रुटियों को समाप्त करता है। RoIAlign नमूना बिंदुओं पर सटीक मानों की गणना करने के लिए बाइलिनियर इंटरपोलेशन का उपयोग करता है, जो सटीक मास्क भविष्यवाणी के लिए आवश्यक बारीक स्थानिक विवरणों को संरक्षित करता है। यह परिवर्तन मास्क शाखा को संरेखित फीचर मैप्स पर काम करने की अनुमति देता है, जिससे सेगमेंटेशन गुणवत्ता में काफी सुधार होता है।

मास्क शाखा स्वयं एक छोटा पूर्णतः कन्वोल्यूशनल नेटवर्क है जो प्रत्येक RoI पर लागू होता है, प्रत्येक वर्ग के लिए एक बाइनरी मास्क उत्पन्न करता है। प्रशिक्षण के दौरान, हानि फ़ंक्शन वर्गीकरण हानि, बाउंडिंग-बॉक्स प्रतिगमन हानि, और मास्क भविष्यवाणियों पर औसत बाइनरी क्रॉस-एन्ट्रॉपी हानि को जोड़ता है। यह मल्टी-टास्क लर्निंग सेटअप मॉडल को डिटेक्शन और सेगमेंटेशन को संयुक्त रूप से अनुकूलित करने में सक्षम बनाता है, जिससे COCO डेटासेट जैसे बेंचमार्क पर मजबूत प्रदर्शन होता है। COCO test-dev पर, Mask R-CNN ने अपने रिलीज़ के समय 35.7% की मास्क औसत परिशुद्धता और 39.8% की बाउंडिंग-बॉक्स औसत परिशुद्धता हासिल की, जो पिछले अत्याधुनिक तरीकों से बेहतर प्रदर्शन करता है।

Architecture and Components

Mask R-CNN में कई एकीकृत घटक शामिल हैं। बैकबोन नेटवर्क, आमतौर पर एक ResNet या ResNeXt, इनपुट छवि से पदानुक्रमित फीचर मैप्स निकालता है। एक Feature Pyramid Network (FPN) को बैकबोन से जोड़ा जा सकता है ताकि कम-रिज़ॉल्यूशन, शब्दार्थ रूप से मजबूत विशेषताओं को उच्च-रिज़ॉल्यूशन, स्थानिक रूप से सटीक विशेषताओं के साथ जोड़कर स्केल में डिटेक्शन में सुधार किया जा सके। फिर RPN उम्मीदवार क्षेत्रों का प्रस्ताव करता है, जिन्हें संरेखित फीचर मैप्स उत्पन्न करने के लिए RoIAlign द्वारा संसाधित किया जाता है। ये विशेषताएं दो हेड्स में फीड होती हैं: एक वर्गीकरण और बाउंडिंग-बॉक्स प्रतिगमन हेड, और मास्क भविष्यवाणी हेड। मास्क हेड प्रत्येक RoI पर स्वतंत्र रूप से लागू होता है, प्रति वर्ग 28x28 पिक्सेल का मास्क आउटपुट करता है, जिसे अंतिम भविष्यवाणी के लिए मूल RoI आकार में अपसैंपल किया जाता है।

Training and Inference

Mask R-CNN का प्रशिक्षण एक बहु-चरणीय प्रक्रिया का पालन करता है। मॉडल आमतौर पर बैकबोन के लिए ImageNet पर प्रीट्रेन्ड वेट्स के साथ आरंभ किया जाता है। प्रशिक्षण के दौरान, सकारात्मक RoIs (जिनमें ग्राउंड-ट्रुथ बॉक्स के साथ उच्च इंटरसेक्शन-ओवर-यूनियन होता है) को मास्क हानि गणना के लिए नमूना किया जाता है। मास्क शाखा केवल सकारात्मक RoIs पर प्रशिक्षित होती है, जबकि वर्गीकरण और प्रतिगमन हेड्स सकारात्मक और नकारात्मक दोनों नमूनों का उपयोग करते हैं। कुल हानि व्यक्तिगत हानियों का योग है, जिसमें डिफ़ॉल्ट रूप से समान भार होता है। अनुमान में RPN चलाना, RoIAlign लागू करना, और फिर बाइनरी सेगमेंटेशन उत्पन्न करने के लिए भविष्यवाणी किए गए मास्क को 0.5 पर थ्रेशोल्ड करना शामिल है। डुप्लिकेट डिटेक्शन को हटाने के लिए बाउंडिंग-बॉक्स भविष्यवाणियों पर नॉन-मैक्सिमम सप्रेशन लागू किया जाता है।

Impact and Applications

Mask R-CNN का कंप्यूटर विज़न के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा। इसने इंस्टेंस सेगमेंटेशन के लिए एक सरल, लचीला और सटीक ढांचा प्रदान किया, जो बाद के शोध के लिए एक मानक आधार बन गया। इसके डिज़ाइन ने बाद के मॉडलों जैसे Cascade Mask R-CNN और कन्वोल्यूशनल बैकबोन्स के साथ ट्रांसफॉर्मर को जोड़ने वाले हाइब्रिड दृष्टिकोणों को प्रभावित किया। व्यवहार में, Mask R-CNN को ट्यूमर सेगमेंटेशन के लिए चिकित्सा छवि विश्लेषण, पैदल चलने वालों और वाहनों की पहचान के लिए स्वायत्त वाहन धारणा, और पौधों की गिनती के लिए कृषि निगरानी में लागू किया गया है। वास्तुकला ने Generative AI पाइपलाइनों में एक घटक के रूप में भी काम किया, जहां सटीक ऑब्जेक्ट मास्क नियंत्रित छवि संपादन और निर्माण को सक्षम करते हैं।

Limitations and Extensions

अपनी सफलता के बावजूद, Mask R-CNN की ज्ञात सीमाएं हैं। यह कम्प्यूटेशनल रूप से गहन है, जिसके लिए प्रशिक्षण और अनुमान के लिए पर्याप्त GPU संसाधनों की आवश्यकता होती है, जो वास्तविक समय के अनुप्रयोगों के लिए निषेधात्मक हो सकता है। मॉडल भारी रूप से अस्पष्ट ऑब्जेक्ट्स और छोटे इंस्टेंस के साथ भी संघर्ष करता है, जहां मास्क भविष्यवाणियां शोरगुल वाली हो सकती हैं। एक्सटेंशन ने इन मुद्दों को संबोधित किया है: Mask Scoring R-CNN मास्क गुणवत्ता में सुधार के लिए एक मास्क-IoU भविष्यवाणी हेड जोड़ता है, और PointRend एक पुनरावृत्त बिंदु-आधारित दृष्टिकोण का उपयोग करके मास्क किनारों को परिष्कृत करता है। अधिक हाल की वास्तुकलाएं, जैसे कि Transformer (architecture) डिकोडर पर आधारित, कुछ बेंचमार्क पर Mask R-CNN को पार कर चुकी हैं, लेकिन मॉडल अपनी परिपक्वता और प्रीट्रेन्ड वेट्स और लाइब्रेरीज़ के व्यापक पारिस्थितिकी तंत्र के कारण व्यापक रूप से उपयोग में बना हुआ है।

Relationship to Other Methods

Mask R-CNN कंप्यूटर विज़न में क्षेत्र-आधारित विधियों के व्यापक परिवार से संबंधित है, जिसमें R-CNN और Fast R-CNN जैसे पहले के मॉडल भी शामिल हैं। यह YOLO और SSD जैसे एकल-चरण डिटेक्टरों के विपरीत है, जो सटीकता पर गति को प्राथमिकता देते हैं। Artificial intelligence और Machine learning के संदर्भ में, Mask R-CNN मल्टी-टास्क लर्निंग की प्रवृत्ति का उदाहरण है, जहां एक एकल Neural network कई संबंधित आउटपुट संभालता है। इसका विकास 2010 के दशक के मध्य में Deep learning में प्रगति की लहर का हिस्सा था, साथ ही Large language model अनुसंधान में सफलताओं के साथ, हालांकि दोनों क्षेत्र अनुप्रयोग में भिन्न थे। कोड और प्रीट्रेन्ड मॉडल ओपन-सोर्स लाइसेंस के तहत जारी किए गए थे, जिससे शिक्षा और उद्योग दोनों में अपनाने में तेजी आई, जिसमें Amazon Web Services और Google Cloud जैसी कंपनियां शामिल हैं, जो ऐसे मॉडल चलाने के लिए प्रबंधित सेवाएं प्रदान करती हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·instance-segmentation·deep-learning·object-detection
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास