अंग्रेज़ी से अनुवादित

Flickr30k Entities एक वाक्यांश ग्राउंडिंग डेटासेट है जो Flickr30k का विस्तार करता है, जिसमें 244k कोरफेरेंस चेन और 31,783 बाउंडिंग बॉक्स शामिल हैं जो संज्ञा वाक्यांशों को छवि क्षेत्रों से जोड़ते हैं, जिसका उपयोग दृश्य ग्राउंडिंग और मल्टीमॉडल मॉडल के मूल्यांकन के लिए किया जाता है।

Flickr30k Entities फ्रेज़ ग्राउंडिंग के लिए एक डेटासेट है, जो कैप्शन में प्राकृतिक भाषा के वाक्यांशों को छवियों में संबंधित क्षेत्रों से जोड़ने का कार्य है। इसे Flickr30k छवि कैप्शनिंग डेटासेट का विस्तार करके बनाया गया था, जिसमें विस्तृत एनोटेशन शामिल हैं जो संस्थाओं के पाठ्य उल्लेखों को उनके दृश्य स्थानों से जोड़ते हैं। यह डेटासेट कंप्यूटर विज़न और मल्टीमॉडल मशीन लर्निंग अनुसंधान में व्यापक रूप से उपयोग किया जाता है, ताकि ऐसे मॉडलों को प्रशिक्षित और मूल्यांकन किया जा सके जिन्हें भाषा और दृश्य सामग्री के बीच संबंध को समझना होता है।

डेटासेट में 31,783 बाउंडिंग बॉक्स शामिल हैं जो छवियों के भीतर संज्ञा वाक्यांशों के दृश्य संदर्भों को स्थानीयकृत करते हैं। यह 244k कोरफेरेंस चेन भी प्रदान करता है, जो एक ही छवि के लिए कई कैप्शनों में एक ही इकाई के विभिन्न उल्लेखों को समूहित करती हैं। यह संरचना शोधकर्ताओं को न केवल प्रत्यक्ष वाक्यांश-क्षेत्र संरेखण का अध्ययन करने की अनुमति देती है, बल्कि मल्टीमॉडल संदर्भ में क्रॉस-वाक्य कोरफेरेंस समाधान का भी अध्ययन करने की अनुमति देती है। एनोटेशन रोजमर्रा की वस्तुओं, लोगों और जानवरों की एक व्यापक शब्दावली को कवर करते हैं, जिससे डेटासेट ग्राउंडेड भाषा समझ के लिए एक यथार्थवादी बेंचमार्क बन जाता है।

एनोटेशन संरचना

Flickr30k Entities में प्रत्येक छवि पांच स्वतंत्र मानव-लिखित कैप्शन से जुड़ी होती है। एनोटेटरों ने इन कैप्शनों में संज्ञा वाक्यांशों की पहचान की और प्रत्येक वाक्यांश को छवि में एक बाउंडिंग बॉक्स से जोड़ा, जब कोई दृश्य संदर्भ मौजूद था। जब एक ही इकाई का कई बार उल्लेख किया गया था, या तो एक कैप्शन के भीतर या पांच कैप्शनों में, उल्लेखों को एक कोरफेरेंस चेन में समूहित किया गया था। यह डिज़ाइन वाक्यांश स्थानीयकरण और इकाई-स्तरीय तर्क दोनों पर मॉडलों के मूल्यांकन को सक्षम बनाता है, जहां एक मॉडल को कई पाठ्य संदर्भों से साक्ष्य एकत्र करना होता है।

बाउंडिंग बॉक्स अक्ष-संरेखित आयताकार होते हैं जो संदर्भित वस्तु को कसकर घेरते हैं। डेटासेट सेगमेंटेशन मास्क प्रदान नहीं करता है, इसके बजाय ग्राउंडिंग कार्यों के लिए पर्याप्त मोटे स्थानीयकरण पर ध्यान केंद्रित करता है। कोरफेरेंस चेन उन कार्यों के लिए आवश्यक हैं जिनमें एक मॉडल को विभिन्न विवरणों में एक इकाई को ट्रैक करने की आवश्यकता होती है, जैसे दृश्य प्रश्न उत्तर या इकाई स्थिति के आधार पर छवि पुनर्प्राप्ति।

निर्माण और आंकड़े

डेटासेट मूल Flickr30k कोष पर बनाया गया था, जिसमें फोटो-साझाकरण वेबसाइट Flickr से एकत्रित 31,783 छवियां शामिल हैं। छवियां विभिन्न प्रकार के दृश्यों को दर्शाती हैं, जिनमें गतिविधियों में लगे लोग, जानवर और रोजमर्रा की वस्तुएं शामिल हैं। इकाई एनोटेशन एक क्राउडसोर्सिंग पाइपलाइन के माध्यम से तैयार किए गए थे, जिसमें स्थिरता सुनिश्चित करने के लिए गुणवत्ता नियंत्रण उपाय शामिल थे। अंतिम डेटासेट में 244k कोरफेरेंस चेन और 31,783 बाउंडिंग बॉक्स शामिल हैं, जिसमें प्रति छवि औसतन लगभग एक बाउंडिंग बॉक्स होता है, हालांकि कई छवियों में कई इकाइयां होती हैं।

एक उल्लेखनीय विशेषता उन वाक्यांशों का समावेश है जो छवि में दृश्य रूप से मौजूद नहीं इकाइयों का संदर्भ देते हैं। इन्हें ऐसे चिह्नित किया गया है, जिससे मॉडल ग्राउंडेड और अनग्राउंडेड संदर्भों के बीच अंतर करना सीख सकें। यह पहलू वास्तविक दुनिया के अनुप्रयोगों के लिए महत्वपूर्ण है जहां कैप्शन फ्रेम के बाहर की वस्तुओं का उल्लेख कर सकते हैं।

अनुसंधान में उपयोग

Flickr30k Entities वाक्यांश ग्राउंडिंग और संदर्भ अभिव्यक्ति समझ के लिए एक मानक बेंचमार्क बन गया है। मॉडलों का मूल्यांकन आमतौर पर किसी दिए गए संज्ञा वाक्यांश के लिए सही बाउंडिंग बॉक्स की भविष्यवाणी करने की उनकी क्षमता पर किया जाता है। डेटासेट का उपयोग विभिन्न आर्किटेक्चर को प्रशिक्षित और परीक्षण करने के लिए किया गया है, जिसमें Transformer (architecture) मॉडल और Neural network दृष्टिकोण पर आधारित शामिल हैं। यह Large language model आधारित विज़न-भाषा प्रणालियों के मूल्यांकन में भी एक सामान्य घटक है, जो अक्सर बारीक दृश्य समझ को मापने के लिए डेटासेट का उपयोग करते हैं।

शोधकर्ताओं ने डेटासेट का उपयोग कमजोर रूप से पर्यवेक्षित ग्राउंडिंग के तरीकों को विकसित करने के लिए किया है, जहां मॉडल स्पष्ट बाउंडिंग बॉक्स पर्यवेक्षण के बिना छवि-कैप्शन जोड़े से सीखते हैं, और पूरी तरह से पर्यवेक्षित ग्राउंडिंग के लिए। कोरफेरेंस एनोटेशन ने मल्टीमॉडल कोरफेरेंस समाधान पर काम को भी सक्षम किया है, एक ऐसा कार्य जो भाषाई कोरफेरेंस को दृश्य साक्ष्य के साथ जोड़ता है। डेटासेट Visual Genome और referitgame जैसे अन्य संसाधनों का पूरक है, जिनमें से प्रत्येक अलग-अलग एनोटेशन ग्रैन्युलैरिटी और चुनौतियां प्रदान करता है।

सीमाएं और विस्तार

डेटासेट मूल Flickr30k संग्रह से पूर्वाग्रहों को विरासत में लेता है, जो पश्चिमी, उपभोक्ता-उन्मुख फोटोग्राफी को प्रदर्शित करता है। कैप्शन अपेक्षाकृत छोटे होते हैं और प्रमुख वस्तुओं का वर्णन करते हैं, जो अधिक विशेषीकृत डोमेन की जटिलता को प्रतिबिंबित नहीं कर सकते हैं। बाउंडिंग बॉक्स मोटे होते हैं और ओक्लूजन या भाग-स्तरीय विवरण को कैप्चर नहीं करते हैं। इन सीमाओं के बावजूद, डेटासेट अपने पैमाने और कोरफेरेंस एनोटेशन की समृद्धि के कारण एक मूल्यवान संसाधन बना हुआ है।

कई विस्तार प्रस्तावित किए गए हैं, जिनमें अतिरिक्त विशेषताओं के साथ डेटासेट को बढ़ाना या अन्य कार्यों के लिए सिंथेटिक प्रशिक्षण डेटा उत्पन्न करने के लिए इसका उपयोग करना शामिल है। डेटासेट को बड़े बेंचमार्क में भी शामिल किया गया है जो डोमेन में सामान्यीकरण का परीक्षण करने के लिए कई ग्राउंडिंग डेटासेट को जोड़ते हैं। 2020 के दशक की शुरुआत तक, यह कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में सैकड़ों पेपरों में उद्धृत किया जा रहा है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·computer-vision·natural-language-processing·multimodal
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास