RefCOCO+ एक बेंचमार्क डेटासेट है जो रेफरिंग एक्सप्रेशन समझ के लिए है, जो कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में एक कार्य है, जहाँ एक सिस्टम को पाठ्य विवरण के आधार पर छवि में एक विशिष्ट वस्तु का पता लगाना होता है। 2016 में वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया, यह माइक्रोसॉफ्ट COCO (कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट) डेटासेट पर आधारित है और दृश्य और भाषाई समझ को एकीकृत करने वाले मॉडलों के लिए एक मानक मूल्यांकन के रूप में कार्य करता है। यह डेटासेट स्थान-आधारित बाधाओं पर अपने जोर के लिए उल्लेखनीय है, जो इसे इसके पूर्ववर्ती RefCOCO की तुलना में अधिक चुनौतीपूर्ण बनाता है। RefCOCO+ में 19,000 से अधिक छवियाँ और 140,000 से अधिक रेफरिंग एक्सप्रेशन शामिल हैं, जिनमें से प्रत्येक एक बाउंडिंग बॉक्स एनोटेशन के साथ जोड़ा गया है।
RefCOCO+ की प्राथमिक विशिष्टता इसके रेफरिंग एक्सप्रेशन में निहित है, जो विशिष्ट परिस्थितियों में मानव एनोटेटर्स द्वारा उत्पन्न किए जाते हैं। मूल RefCOCO डेटासेट के विपरीत, जहाँ एक्सप्रेशन में कोई भी विशेषता शामिल हो सकती है, RefCOCO+ 'बाएँ', 'दाएँ', 'ऊपर', या 'नीचे' जैसे पूर्ण स्थान शब्दों के उपयोग पर प्रतिबंध लगाता है। इसके बजाय, एनोटेटर्स को सापेक्ष स्थानिक संबंधों (जैसे, 'महिला के दाईं ओर का आदमी') और रंग, आकार, या क्रिया जैसे उपस्थिति-आधारित विवरणों का उपयोग करने के लिए प्रोत्साहित किया जाता है। यह बाधा मॉडलों को वैश्विक स्थितीय संकेतों पर निर्भर रहने के बजाय वस्तु विशेषताओं और अंतर-वस्तु संबंधों के बारे में तर्क करने के लिए मजबूर करती है। डेटासेट यू और सहकर्मियों द्वारा बनाया गया था, जिन्होंने एक नया मूल्यांकन प्रोटोकॉल भी पेश किया जो विभिन्न प्रकार के एक्सप्रेशनों में सामान्यीकरण का परीक्षण करता है।
डेटासेट संरचना और एनोटेशन
डेटासेट MS COCO train2014 और val2014 स्प्लिट्स से बनाया गया है, जिसमें रोज़मर्रा के दृश्यों की एक विविध श्रृंखला शामिल है। प्रत्येक छवि में कई वस्तुएँ होती हैं, और रेफरिंग एक्सप्रेशन वस्तुओं के एक उपसमुच्चय के लिए प्रदान किए जाते हैं, आमतौर पर वे जो दृश्य रूप से प्रमुख होते हैं। एनोटेशन में प्रत्येक संदर्भित वस्तु के लिए एक मैन्युअल रूप से खींचा गया बाउंडिंग बॉक्स, साथ ही एक्सप्रेशन पाठ शामिल होता है। औसतन, प्रत्येक छवि में लगभग 7.5 रेफरिंग एक्सप्रेशन होते हैं, और प्रत्येक एक्सप्रेशन में लगभग 3.5 शब्द होते हैं। डेटासेट को प्रशिक्षण (90%), सत्यापन (5%), और परीक्षण (5%) सेटों में विभाजित किया गया है, जिसमें स्प्लिट्स में कोई ओवरलैपिंग छवियाँ सुनिश्चित करने के लिए सावधानीपूर्वक क्यूरेशन किया गया है। एक अद्वितीय विशेषता दो परीक्षण स्प्लिट्स, testA और testB का समावेश है, जहाँ testA में लोगों पर प्राथमिक फोकस वाले एक्सप्रेशन होते हैं और testB गैर-व्यक्ति वस्तुओं पर केंद्रित होता है, जिससे मॉडल प्रदर्शन का सूक्ष्म विश्लेषण संभव होता है।
कार्य परिभाषा और मूल्यांकन मेट्रिक्स
मुख्य कार्य एक बाउंडिंग बॉक्स आउटपुट करना है जो इनपुट एक्सप्रेशन द्वारा वर्णित वस्तु को सटीक रूप से शामिल करता है। सटीकता को इंटरसेक्शन ओवर यूनियन (IoU) मेट्रिक का उपयोग करके मापा जाता है, जहाँ एक भविष्यवाणी को सही माना जाता है यदि भविष्यवाणी और ग्राउंड-ट्रुथ बॉक्स के बीच IoU 0.5 से अधिक हो। यह थ्रेशोल्ड-आधारित मूल्यांकन रेफरिंग एक्सप्रेशन डेटासेट में मानक है। शोधकर्ता अक्सर परिणामों को 'IoU=0.5 पर सटीकता' के रूप में रिपोर्ट करते हैं, और कुछ प्रिसिजन-रिकॉल वक्रों का भी आकलन करते हैं। स्थान बाधाओं को देखते हुए, मॉडलों को भाषाई पार्सिंग को दृश्य विशेषता निष्कर्षण के साथ प्रभावी ढंग से संयोजित करना चाहिए। डीप लर्निंग दृष्टिकोण, विशेष रूप से कन्वोल्यूशनल न्यूरल नेटवर्क का उपयोग करने वाले, प्रमुख रहे हैं, जिनमें आर्किटेक्चर रुचि के क्षेत्रों से दृश्य विशेषताओं के साथ भाषा एम्बेडिंग को जोड़ते हैं।
पद्धतिगत प्रगति
अपनी रिलीज़ के बाद से, RefCOCO+ ने मल्टीमॉडल तर्क में महत्वपूर्ण प्रगति को प्रेरित किया है। प्रारंभिक विधियों ने स्थानिक ध्यान मानचित्र उत्पन्न करने के लिए Sequence-to-Sequence (Seq2Seq) मॉडल का उपयोग किया, जबकि बाद के कार्यों ने शब्दों को छवि क्षेत्रों के साथ संरेखित करने के लिए Multi-Head Attention तंत्र को शामिल किया। डेटासेट विज़न-लैंग्वेज मॉडल के विकास में सहायक था, जो कार्य को एक ग्राउंडिंग समस्या के रूप में मानते हैं। उल्लेखनीय योगदानों में विशेषता निष्कर्षण के लिए Residual Network (ResNet) बैकबोन का उपयोग और प्रशिक्षण को स्थिर करने के लिए Batch Normalization शामिल हैं। कई अत्याधुनिक सिस्टम बड़े इमेज-टेक्स्ट कॉर्पोरा पर पूर्व-प्रशिक्षित होते हैं और फिर RefCOCO+ पर फाइन-ट्यून करते हैं, ट्रांसफर लर्निंग का लाभ उठाते हुए। 2024 तक, ट्रांसफॉर्मर एनकोडर-डिकोडर जैसे ट्रांसफॉर्मर-आधारित आर्किटेक्चर ने testA पर 85% से ऊपर सटीकता हासिल की है, जो लगभग 60% स्कोर करने वाले प्रारंभिक बेसलाइनों की तुलना में पर्याप्त सुधार दर्शाता है।
अन्य डेटासेट से संबंध
RefCOCO+ रेफरिंग एक्सप्रेशन डेटासेट के एक परिवार का हिस्सा है, जिसमें RefCOCO और RefCOCOg शामिल हैं, प्रत्येक की अलग-अलग बाधाएँ हैं। RefCOCOg बिना स्थान प्रतिबंधों के लंबे, अधिक प्राकृतिक एक्सप्रेशन प्रदान करता है, जबकि RefCOCO+ बीच में है, जो जटिलता और व्यवहार्यता को संतुलित करता है। डेटासेट का व्यापक रूप से सिस्टम-स्तरीय AI अनुप्रयोगों, जैसे स्वचालित ड्राइविंग और सहायक रोबोटिक्स के प्रशिक्षण और मूल्यांकन के लिए उपयोग किया गया है, जहाँ स्थानिक संदर्भों को समझना महत्वपूर्ण है। इसके डिज़ाइन ने बाद के बेंचमार्कों को प्रभावित किया है, जिनमें एम्बोडिएड AI शामिल हैं, जहाँ एजेंटों को 3D वातावरण में निर्देशों का पालन करना होता है। समुदाय ने फ्यू-शॉट और ज़ीरो-शॉट लर्निंग अध्ययनों के लिए भी RefCOCO+ को अपनाया है, यह परीक्षण करते हुए कि क्या मॉडल अनदेखी वस्तु श्रेणियों में सामान्यीकरण कर सकते हैं।
सीमाएँ और भविष्य की दिशाएँ
इसकी उपयोगिता के बावजूद, RefCOCO+ की सीमाएँ हैं। एक्सप्रेशन अपेक्षाकृत छोटे हैं और प्राकृतिक मानव प्रवचन की जटिलता की कमी रखते हैं, और डेटासेट सामान्य वस्तु श्रेणियों की ओर झुका हुआ है। कुछ आलोचकों का तर्क है कि स्थान बाधा कृत्रिम रूप से लगाई गई है, जिससे कार्य वास्तविक दुनिया के अनुप्रयोगों के साथ कम संरेखित होता है। इन मुद्दों को संबोधित करने के लिए, शोधकर्ताओं ने समृद्ध एनोटेशन वाले नए डेटासेट प्रस्तावित किए हैं, लेकिन RefCOCO+ अपने आकार और स्थापित मूल्यांकन प्रोटोकॉल के कारण एक मानक बेंचमार्क बना हुआ है। भविष्य का काम अधिक विविध एक्सप्रेशन उत्पन्न करने के लिए Large language model घटकों को एकीकृत करने और मजबूती में सुधार के लिए Data Augmentation तकनीकों का उपयोग करने की खोज करता है। 2025 तक, डेटासेट ग्राउंडेड भाषा समझ में प्रगति को मापने के लिए एक संदर्भ बिंदु बना हुआ है, साथ ही छवि संपादन और इंटरैक्टिव संवाद के लिए Generative AI जैसे उभरते क्षेत्रों के साथ।