अंग्रेज़ी से अनुवादित

RefCOCOg एक बड़े पैमाने पर डेटासेट है जो संदर्भ अभिव्यक्ति समझ और निर्माण के लिए है, जिसमें MS COCO डेटासेट की 26,711 छवियों में 54,822 वस्तुओं के लिए 104,560 संदर्भ अभिव्यक्तियाँ शामिल हैं, जिनमें लंबे, अधिक प्राकृतिक विवरण होते हैं।

RefCOCOg कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में एक बेंचमार्क डेटासेट है, जिसे संदर्भ अभिव्यक्ति समझ और निर्माण के कार्य के लिए डिज़ाइन किया गया है। इसे पहले के संदर्भ अभिव्यक्ति डेटासेट की सीमाओं को संबोधित करने के लिए पेश किया गया था, विशेष रूप से लंबी, अधिक वर्णनात्मक और संदर्भ-निर्भर भाषा की आवश्यकता। यह डेटासेट उन मॉडलों के लिए एक चुनौतीपूर्ण परीक्षण मंच प्रदान करता है जिन्हें दृश्य जानकारी को भाषाई विवरणों के साथ संरेखित करना होता है, जो मानव-रोबोट इंटरैक्शन, छवि संपादन और दृश्य प्रश्न उत्तर जैसे अनुप्रयोगों के लिए एक मुख्य क्षमता है।

डेटासेट में 26,711 छवियों में 54,822 वस्तुओं के लिए 104,560 संदर्भ अभिव्यक्तियाँ शामिल हैं, जो सभी Microsoft COCO (Common Objects in Context) डेटासेट से ली गई हैं। RefCOCOg की एक प्रमुख विशेषता यह है कि इसकी अभिव्यक्तियाँ पूर्ववर्ती डेटासेट जैसे RefCOCO की तुलना में लंबी और अधिक प्राकृतिक हैं, जिन्हें अक्सर दृश्य में कई वस्तुओं के बीच संबंधों की समझ की आवश्यकता होती है। उदाहरण के लिए, एक अभिव्यक्ति "लाल कार के बगल में खड़ा नीली शर्ट वाला आदमी" हो सकती है, जिसके लिए प्राथमिक वस्तु और उसके संबंधपरक संदर्भ दोनों को आधारित करने की आवश्यकता होती है।

निर्माण और एनोटेशन

RefCOCOg को शोधकर्ताओं की एक टीम द्वारा बनाया गया था, जिसमें एनोटेशन प्रक्रिया में मानव एनोटेटर शामिल थे जिन्हें एक छवि के भीतर लक्ष्य वस्तु को विशिष्ट रूप से पहचानने वाले विवरण लिखने के लिए कहा गया था। एनोटेशन एक क्राउडसोर्सिंग प्लेटफॉर्म के माध्यम से एकत्र किए गए थे, और प्रत्येक अभिव्यक्ति को सत्यापित किया गया था ताकि यह सुनिश्चित हो सके कि यह असंदिग्ध है। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट को आगे दो उपसमूहों में विभाजित किया गया है, इस आधार पर कि एनोटेटर ने प्रशिक्षण के दौरान छवि देखी थी या नहीं ('refexp' और 'refexp+' के रूप में जाना जाता है)। यह विभाजन डिज़ाइन अनदेखे एनोटेटर और भाषा शैलियों के लिए सामान्यीकरण का मूल्यांकन करने में मदद करता है।

कार्य निरूपण

RefCOCOg से जुड़ा प्राथमिक कार्य संदर्भ अभिव्यक्ति समझ है, जहां एक मॉडल एक छवि और एक पाठ्य विवरण प्राप्त करता है और वर्णित वस्तु को स्थानीयकृत करना चाहिए, आमतौर पर एक बाउंडिंग बॉक्स या एक विभाजन मास्क की भविष्यवाणी करके। एक संबंधित कार्य संदर्भ अभिव्यक्ति निर्माण है, जहां मॉडल को एक छवि में दी गई वस्तु के लिए एक प्राकृतिक भाषा विवरण उत्पन्न करना चाहिए। दोनों कार्यों का मूल्यांकन मानक मेट्रिक्स का उपयोग करके किया जाता है: समझ के लिए इंटरसेक्शन-ओवर-यूनियन (IoU) और निर्माण के लिए CIDEr या BLEU जैसे मेट्रिक्स।

मॉडल विकास पर प्रभाव

RefCOCOg का व्यापक रूप से गहन शिक्षण मॉडलों को प्रशिक्षित और मूल्यांकन करने के लिए उपयोग किया गया है, विशेष रूप से Transformer (architecture) आर्किटेक्चर और Multi-Head Attention तंत्र पर आधारित। प्रारंभिक दृष्टिकोणों ने दृश्य विशेषता निष्कर्षण के लिए Residual Network (ResNet) बैकबोन का उपयोग किया, जिसमें भाषा एन्कोडिंग के लिए आवर्तक तंत्रिका नेटवर्क शामिल थे। हाल की प्रणालियाँ Large language model और Vision-language model का लाभ उठाती हैं, अक्सर दृश्य और पाठ्य मोडैलिटी को संलयन करने के लिए Cross-Attention परतों को एकीकृत करती हैं। लंबी अभिव्यक्तियों पर डेटासेट का जोर स्थानिक संबंधों, विशेषताओं और संदर्भ के बारे में तर्क करने वाले मॉडलों के विकास को आगे बढ़ाने में सहायक रहा है, जो सरल वस्तु पहचान से परे है।

अन्य डेटासेट से संबंध

RefCOCOg संदर्भ अभिव्यक्ति डेटासेट के एक परिवार का हिस्सा है, जिसमें RefCOCO और RefCOCO+ शामिल हैं, जो लगभग उसी समय पेश किए गए थे। जबकि RefCOCO छोटी, अधिक संक्षिप्त अभिव्यक्तियों पर केंद्रित है, RefCOCO+ अभिव्यक्तियों को उपस्थिति-आधारित विवरणों तक सीमित करता है, स्थान शब्दों से बचता है। RefCOCOg अपनी लंबी, अधिक संवादात्मक विवरणों द्वारा प्रतिष्ठित है जिन्हें अक्सर समग्र दृश्य समझ की आवश्यकता होती है। साथ में, ये डेटासेट क्षेत्र में मानक बेंचमार्क बन गए हैं, जिनमें प्रत्येक पर अत्याधुनिक प्रदर्शन को ट्रैक करने वाले लीडरबोर्ड शामिल हैं।

चुनौतियाँ और सीमाएँ

अपनी उपयोगिता के बावजूद, RefCOCOg में ज्ञात सीमाएँ हैं। डेटासेट MS COCO से लिया गया है, जिसमें सामान्य वस्तु श्रेणियों और रोजमर्रा के दृश्यों की ओर पूर्वाग्रह है, जो संभावित रूप से विविधता को सीमित करता है। अभिव्यक्तियाँ, हालांकि लंबी हैं, फिर भी वास्तविक दुनिया की बातचीत में मानव संदर्भ की पूर्ण जटिलता को पकड़ नहीं सकती हैं, जैसे कि इशारों या साझा ज्ञान का उपयोग। इसके अतिरिक्त, बाउंडिंग बॉक्स पर आधारित मूल्यांकन मोटा हो सकता है, और कुछ अभिव्यक्तियाँ मनुष्यों के लिए भी अस्पष्ट हो सकती हैं। शोधकर्ताओं ने इन अंतरालों को संबोधित करने के लिए विस्तार और वैकल्पिक डेटासेट प्रस्तावित किए हैं, लेकिन RefCOCOg आधारित भाषा समझ का अध्ययन करने के लिए एक मौलिक संसाधन बना हुआ है।

यह भी देखें

संदर्भ

डेटासेट को जुन्हुआ माओ, जोनाथन हुआंग, अलेक्जेंडर तोशेव, ओआना कैम्बुरु, एलन युइल और केविन मर्फी द्वारा लिखित पेपर "Grounded Language Understanding: Referring Expression Comprehension and Generation" में पेश किया गया था, जो 2016 यूरोपीय सम्मेलन ऑन कंप्यूटर विज़न (ECCV) में प्रस्तुत किया गया था।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·natural-language-processing·dataset·referring-expression
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास