RefCOCOg एक संदर्भ अभिव्यक्ति समझ (referring expression comprehension) के लिए एक डेटासेट है, जो कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में एक कार्य है, जहाँ एक प्रणाली को पाठ्य विवरण के आधार पर छवि में एक विशिष्ट वस्तु का पता लगाना होता है। इसे पहले के RefCOCO डेटासेट के विस्तार के रूप में पेश किया गया था, जिसमें लंबे, अधिक वर्णनात्मक वाक्यांशों पर ध्यान केंद्रित किया गया था जो मानव-जनित भाषा से मिलते जुलते हैं। यह डेटासेट माइक्रोसॉफ्ट COCO (Common Objects in Context) छवि संग्रह पर आधारित है, जिसमें 330,000 से अधिक छवियाँ विस्तृत वस्तु एनोटेशन के साथ शामिल हैं।
RefCOCOg की प्राथमिक विशेषता इसके विवरणों में निहित है। पहले के डेटासेट के विपरीत, जो अक्सर छोटे, टेम्पलेट-आधारित वाक्यांशों का उपयोग करते थे, RefCOCOg लंबे, अधिक प्राकृतिक वाक्य प्रदान करता है जिनमें संदर्भात्मक जानकारी, स्थानिक संबंध और विशेषता विवरण शामिल होते हैं। उदाहरण के लिए, एक विवरण "लाल कार के बगल में खड़ा नीली शर्ट वाला आदमी" हो सकता है, न कि केवल "आदमी"। यह डेटासेट को उन मॉडलों के मूल्यांकन के लिए अधिक चुनौतीपूर्ण और यथार्थवादी बनाता है जिन्हें दृश्य सामग्री और भाषाई बारीकियों दोनों को समझना होता है।
डेटासेट निर्माण
RefCOCOg को उत्तरी कैरोलिना विश्वविद्यालय, चैपल हिल के शोधकर्ताओं द्वारा बनाया गया था और इसे पहली बार 2016 के एक पेपर में प्रस्तुत किया गया था। डेटासेट को क्राउडसोर्सिंग प्लेटफॉर्म का उपयोग करके एकत्र किया गया था, जहाँ कार्यकर्ताओं को COCO से छवियाँ दिखाई गईं और उन्हें ऐसे विवरण लिखने के लिए कहा गया जो छवि के भीतर एक विशिष्ट वस्तु की विशिष्ट पहचान करें। निर्देशों में पूर्व-निर्धारित टेम्पलेट्स का उपयोग करने के बजाय प्राकृतिक, मानव-समान वाक्यांश उत्पन्न करने पर जोर दिया गया। इस प्रक्रिया के परिणामस्वरूप 26,711 छवियों में 54,822 वस्तुओं के लिए लगभग 104,560 संदर्भ अभिव्यक्तियाँ प्राप्त हुईं।
डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है। एक सामान्य विभाजन, जिसे RefCOCOg-google कहा जाता है, प्रशिक्षण और सत्यापन के लिए 90/10 विभाजन का उपयोग करता है, जिसमें एक अलग परीक्षण सेट होता है। एक अन्य विभाजन, RefCOCOg-umd, बाद में मैरीलैंड विश्वविद्यालय के शोधकर्ताओं द्वारा प्रस्तावित किया गया था, जो विभाजनों में छवियों का अधिक संतुलित वितरण प्रदान करता है। विभाजन का चुनाव मॉडल मूल्यांकन को महत्वपूर्ण रूप से प्रभावित कर सकता है, क्योंकि विभिन्न विभाजनों में कठिनाई के स्तर भिन्न हो सकते हैं।
मूल्यांकन और मेट्रिक्स
RefCOCOg के लिए मानक मूल्यांकन सटीकता मीट्रिक का उपयोग करता है, जहाँ एक भविष्यवाणी को सही माना जाता है यदि अनुमानित बाउंडिंग बॉक्स का ग्राउंड-ट्रुथ बॉक्स के साथ प्रतिच्छेदन-ओवर-यूनियन (IoU) एक सीमा से अधिक हो, आमतौर पर 0.5। कुछ मूल्यांकन उच्च IoU सीमाओं, जैसे 0.75, पर भी सटीकता की रिपोर्ट करते हैं, ताकि स्थानीयकरण की सटीकता का आकलन किया जा सके। इस कार्य को अक्सर एक रैंकिंग समस्या के रूप में तैयार किया जाता है, जहाँ मॉडल को एक ऑब्जेक्ट डिटेक्टर द्वारा उत्पन्न उम्मीदवार प्रस्तावों के सेट से सही क्षेत्र का चयन करना होता है।
एआई अनुसंधान पर प्रभाव
RefCOCOg दृश्य ग्राउंडिंग और बहु-मोडल समझ के लिए एक बेंचमार्क बन गया है। इसका व्यापक रूप से उन मॉडलों का मूल्यांकन करने के लिए उपयोग किया जाता है जो दृष्टि और भाषा को जोड़ते हैं, जिनमें Transformer (architecture) आर्किटेक्चर और Large language model पर आधारित मॉडल शामिल हैं। डेटासेट ने क्षेत्र-स्तरीय कैप्शनिंग, दृश्य प्रश्न उत्तर और संदर्भ अभिव्यक्ति निर्माण जैसे क्षेत्रों में प्रगति को बढ़ावा दिया है। कई आधुनिक दृष्टिकोण Deep learning तकनीकों का उपयोग करते हैं, जिनमें Residual Network (ResNet) बैकबोन और Multi-Head Attention तंत्र शामिल हैं, ताकि डेटासेट के लंबे विवरणों द्वारा उत्पन्न चुनौतियों का सामना किया जा सके।
डेटासेट संबंधित कार्यों के लिए भी एक आधार के रूप में कार्य करता है, जैसे संदर्भ अभिव्यक्ति विभाजन, जहाँ लक्ष्य बाउंडिंग बॉक्स के बजाय पिक्सेल-स्तरीय मास्क उत्पन्न करना है। शोधकर्ताओं ने RefCOCOg का विस्तार करके नए बेंचमार्क बनाए हैं, जिनमें अस्थायी या इंटरैक्टिव तत्वों वाले शामिल हैं, हालाँकि मूल डेटासेट एक मानक संदर्भ बिंदु बना हुआ है।
सीमाएँ और चुनौतियाँ
अपनी उपयोगिता के बावजूद, RefCOCOg की ज्ञात सीमाएँ हैं। विवरण, हालाँकि पहले के डेटासेट की तुलना में लंबे हैं, फिर भी पूर्ण प्राकृतिक भाषा अनुच्छेदों की तुलना में अपेक्षाकृत छोटे हैं। डेटासेट COCO से पूर्वाग्रह भी विरासत में लेता है, जैसे सामान्य वस्तु श्रेणियों का अत्यधिक प्रतिनिधित्व और रोजमर्रा के दृश्यों पर ध्यान केंद्रित करना। इसके अतिरिक्त, क्राउडसोर्स किए गए विवरण अस्पष्ट हो सकते हैं या ऐसे संदर्भ पर निर्भर हो सकते हैं जो हमेशा दृश्य रूप से स्पष्ट नहीं होता, जिससे कुछ मामलों में मानव एनोटेटरों के लिए भी कार्य कठिन हो जाता है।
एक और चुनौती मूल्यांकन प्रोटोकॉल ही है। एक निश्चित IoU सीमा का उपयोग करने से मॉडल के स्थानीयकरण की गुणवत्ता पूरी तरह से कैप्चर नहीं हो सकती, विशेष रूप से छोटी वस्तुओं या अनियमित आकृतियों वाली वस्तुओं के लिए। हाल के वर्षों में, शोधकर्ताओं ने अधिक मजबूत मेट्रिक्स और मूल्यांकन ढाँचे प्रस्तावित किए हैं, लेकिन मूल सटीकता मीट्रिक सबसे अधिक रिपोर्ट की जाने वाली बनी हुई है।
भविष्य की दिशाएँ
RefCOCOg नई एआई विधियों के लिए एक परीक्षण मंच के रूप में प्रासंगिक बना हुआ है। Generative AI और बहु-मोडल मॉडल के उदय के साथ, डेटासेट का उपयोग अक्सर यह जाँचने के लिए किया जाता है कि ये प्रणालियाँ भाषा को दृश्य सामग्री में कितनी अच्छी तरह स्थापित कर सकती हैं। भविष्य के कार्यों में अधिक विविध विवरणों के साथ डेटासेट का विस्तार, वीडियो या 3D दृश्यों को शामिल करना, या अधिक व्यापक मूल्यांकन सुइट बनाने के लिए इसे अन्य बेंचमार्क के साथ एकीकृत करना शामिल हो सकता है। RefCOCOg से सीखे गए पाठ अगली पीढ़ी के दृश्य ग्राउंडिंग डेटासेट के विकास को सूचित करने की संभावना रखते हैं जो वास्तविक दुनिया की भाषा और दृष्टि की जटिलता को बेहतर ढंग से दर्शाते हैं।