Flickr30k Entities फ्रेज़ ग्राउंडिंग के लिए एक डेटासेट है, जो कैप्शन में प्राकृतिक भाषा के वाक्यांशों को छवियों में संबंधित क्षेत्रों से जोड़ने का कार्य है। इसे Flickr30k छवि कैप्शनिंग डेटासेट का विस्तार करके बनाया गया था, जिसमें विस्तृत एनोटेशन शामिल हैं जो संस्थाओं के पाठ्य उल्लेखों को उनके दृश्य स्थानों से जोड़ते हैं। यह डेटासेट कंप्यूटर विज़न और मल्टीमॉडल मशीन लर्निंग अनुसंधान में व्यापक रूप से उपयोग किया जाता है, ताकि ऐसे मॉडलों को प्रशिक्षित और मूल्यांकन किया जा सके जिन्हें भाषा और दृश्य सामग्री के बीच संबंध को समझना होता है।
डेटासेट में 31,783 बाउंडिंग बॉक्स शामिल हैं जो छवियों के भीतर संज्ञा वाक्यांशों के दृश्य संदर्भों को स्थानीयकृत करते हैं। यह 244k कोरफेरेंस चेन भी प्रदान करता है, जो एक ही छवि के लिए कई कैप्शनों में एक ही इकाई के विभिन्न उल्लेखों को समूहित करती हैं। यह संरचना शोधकर्ताओं को न केवल प्रत्यक्ष वाक्यांश-क्षेत्र संरेखण का अध्ययन करने की अनुमति देती है, बल्कि मल्टीमॉडल संदर्भ में क्रॉस-वाक्य कोरफेरेंस समाधान का भी अध्ययन करने की अनुमति देती है। एनोटेशन रोजमर्रा की वस्तुओं, लोगों और जानवरों की एक व्यापक शब्दावली को कवर करते हैं, जिससे डेटासेट ग्राउंडेड भाषा समझ के लिए एक यथार्थवादी बेंचमार्क बन जाता है।
एनोटेशन संरचना
Flickr30k Entities में प्रत्येक छवि पांच स्वतंत्र मानव-लिखित कैप्शन से जुड़ी होती है। एनोटेटरों ने इन कैप्शनों में संज्ञा वाक्यांशों की पहचान की और प्रत्येक वाक्यांश को छवि में एक बाउंडिंग बॉक्स से जोड़ा, जब कोई दृश्य संदर्भ मौजूद था। जब एक ही इकाई का कई बार उल्लेख किया गया था, या तो एक कैप्शन के भीतर या पांच कैप्शनों में, उल्लेखों को एक कोरफेरेंस चेन में समूहित किया गया था। यह डिज़ाइन वाक्यांश स्थानीयकरण और इकाई-स्तरीय तर्क दोनों पर मॉडलों के मूल्यांकन को सक्षम बनाता है, जहां एक मॉडल को कई पाठ्य संदर्भों से साक्ष्य एकत्र करना होता है।
बाउंडिंग बॉक्स अक्ष-संरेखित आयताकार होते हैं जो संदर्भित वस्तु को कसकर घेरते हैं। डेटासेट सेगमेंटेशन मास्क प्रदान नहीं करता है, इसके बजाय ग्राउंडिंग कार्यों के लिए पर्याप्त मोटे स्थानीयकरण पर ध्यान केंद्रित करता है। कोरफेरेंस चेन उन कार्यों के लिए आवश्यक हैं जिनमें एक मॉडल को विभिन्न विवरणों में एक इकाई को ट्रैक करने की आवश्यकता होती है, जैसे दृश्य प्रश्न उत्तर या इकाई स्थिति के आधार पर छवि पुनर्प्राप्ति।
निर्माण और आंकड़े
डेटासेट मूल Flickr30k कोष पर बनाया गया था, जिसमें फोटो-साझाकरण वेबसाइट Flickr से एकत्रित 31,783 छवियां शामिल हैं। छवियां विभिन्न प्रकार के दृश्यों को दर्शाती हैं, जिनमें गतिविधियों में लगे लोग, जानवर और रोजमर्रा की वस्तुएं शामिल हैं। इकाई एनोटेशन एक क्राउडसोर्सिंग पाइपलाइन के माध्यम से तैयार किए गए थे, जिसमें स्थिरता सुनिश्चित करने के लिए गुणवत्ता नियंत्रण उपाय शामिल थे। अंतिम डेटासेट में 244k कोरफेरेंस चेन और 31,783 बाउंडिंग बॉक्स शामिल हैं, जिसमें प्रति छवि औसतन लगभग एक बाउंडिंग बॉक्स होता है, हालांकि कई छवियों में कई इकाइयां होती हैं।
एक उल्लेखनीय विशेषता उन वाक्यांशों का समावेश है जो छवि में दृश्य रूप से मौजूद नहीं इकाइयों का संदर्भ देते हैं। इन्हें ऐसे चिह्नित किया गया है, जिससे मॉडल ग्राउंडेड और अनग्राउंडेड संदर्भों के बीच अंतर करना सीख सकें। यह पहलू वास्तविक दुनिया के अनुप्रयोगों के लिए महत्वपूर्ण है जहां कैप्शन फ्रेम के बाहर की वस्तुओं का उल्लेख कर सकते हैं।
अनुसंधान में उपयोग
Flickr30k Entities वाक्यांश ग्राउंडिंग और संदर्भ अभिव्यक्ति समझ के लिए एक मानक बेंचमार्क बन गया है। मॉडलों का मूल्यांकन आमतौर पर किसी दिए गए संज्ञा वाक्यांश के लिए सही बाउंडिंग बॉक्स की भविष्यवाणी करने की उनकी क्षमता पर किया जाता है। डेटासेट का उपयोग विभिन्न आर्किटेक्चर को प्रशिक्षित और परीक्षण करने के लिए किया गया है, जिसमें Transformer (architecture) मॉडल और Neural network दृष्टिकोण पर आधारित शामिल हैं। यह Large language model आधारित विज़न-भाषा प्रणालियों के मूल्यांकन में भी एक सामान्य घटक है, जो अक्सर बारीक दृश्य समझ को मापने के लिए डेटासेट का उपयोग करते हैं।
शोधकर्ताओं ने डेटासेट का उपयोग कमजोर रूप से पर्यवेक्षित ग्राउंडिंग के तरीकों को विकसित करने के लिए किया है, जहां मॉडल स्पष्ट बाउंडिंग बॉक्स पर्यवेक्षण के बिना छवि-कैप्शन जोड़े से सीखते हैं, और पूरी तरह से पर्यवेक्षित ग्राउंडिंग के लिए। कोरफेरेंस एनोटेशन ने मल्टीमॉडल कोरफेरेंस समाधान पर काम को भी सक्षम किया है, एक ऐसा कार्य जो भाषाई कोरफेरेंस को दृश्य साक्ष्य के साथ जोड़ता है। डेटासेट Visual Genome और referitgame जैसे अन्य संसाधनों का पूरक है, जिनमें से प्रत्येक अलग-अलग एनोटेशन ग्रैन्युलैरिटी और चुनौतियां प्रदान करता है।
सीमाएं और विस्तार
डेटासेट मूल Flickr30k संग्रह से पूर्वाग्रहों को विरासत में लेता है, जो पश्चिमी, उपभोक्ता-उन्मुख फोटोग्राफी को प्रदर्शित करता है। कैप्शन अपेक्षाकृत छोटे होते हैं और प्रमुख वस्तुओं का वर्णन करते हैं, जो अधिक विशेषीकृत डोमेन की जटिलता को प्रतिबिंबित नहीं कर सकते हैं। बाउंडिंग बॉक्स मोटे होते हैं और ओक्लूजन या भाग-स्तरीय विवरण को कैप्चर नहीं करते हैं। इन सीमाओं के बावजूद, डेटासेट अपने पैमाने और कोरफेरेंस एनोटेशन की समृद्धि के कारण एक मूल्यवान संसाधन बना हुआ है।
कई विस्तार प्रस्तावित किए गए हैं, जिनमें अतिरिक्त विशेषताओं के साथ डेटासेट को बढ़ाना या अन्य कार्यों के लिए सिंथेटिक प्रशिक्षण डेटा उत्पन्न करने के लिए इसका उपयोग करना शामिल है। डेटासेट को बड़े बेंचमार्क में भी शामिल किया गया है जो डोमेन में सामान्यीकरण का परीक्षण करने के लिए कई ग्राउंडिंग डेटासेट को जोड़ते हैं। 2020 के दशक की शुरुआत तक, यह कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में सैकड़ों पेपरों में उद्धृत किया जा रहा है।
यह भी देखें
- phrase-grounding
- Visual Genome
- referitgame
- image-captioning