ReferIt एक referring expression grounding के लिए एक डेटासेट है, जो एक ऐसा कार्य है जो प्राकृतिक भाषा विवरणों को छवियों के भीतर विशिष्ट क्षेत्रों से जोड़ता है। इसे दृश्य ग्राउंडिंग, मानव-रोबोट संपर्क, और मल्टीमॉडल तर्क जैसे क्षेत्रों में अनुसंधान की सुविधा के लिए पेश किया गया था। यह डेटासेट छवियों को प्राकृतिक-भाषा referring expressions के साथ जोड़ता है और बाउंडिंग बॉक्स एनोटेशन प्रदान करता है जो प्रत्येक अभिव्यक्ति के अनुरूप लक्ष्य क्षेत्र को निर्दिष्ट करता है।
डेटासेट में लगभग 20,000 छवियाँ और 130,000 से अधिक referring expressions शामिल हैं। छवियाँ ImageNet से एकत्र की गई हैं, और अभिव्यक्तियाँ एक सहयोगी मानव-कंप्यूटर खेल के माध्यम से एकत्र की गई थीं, जिसने यह सुनिश्चित किया कि उपयोग की गई भाषा प्राकृतिक और कार्य-उन्मुख हो, जो वास्तविक दुनिया के संपर्क परिदृश्यों को प्रतिबिंबित करती हो। ReferIt में प्रत्येक अभिव्यक्ति एक segmentation या बाउंडिंग-बॉक्स एनोटेशन के साथ जोड़ी गई है जो उस ground-truth क्षेत्र को चिह्नित करती है जिसे वाक्यांश संदर्भित करता है।
कार्य परिभाषा
referring expression grounding कार्य में, एक मॉडल को एक छवि और एक referring expression दिया जाता है, जैसे "मेज पर लाल कप।" लक्ष्य छवि में एक ऐसा क्षेत्र आउटपुट करना है जो विवरण से मेल खाता हो। यह कार्य मानक वस्तु पहचान से भिन्न है, क्योंकि अभिव्यक्ति किसी भी वस्तु या क्षेत्र का वर्णन कर सकती है जो मनुष्यों के लिए पहचानने योग्य है, और वस्तु श्रेणियों का कोई पूर्व-निर्धारित सेट नहीं है। ReferIt पर मॉडल के प्रदर्शन का मूल्यांकन आमतौर पर पूर्वानुमानित क्षेत्र और ground-truth एनोटेशन के बीच intersection-over-union (IoU) को मापने के साथ शामिल होता है, जिसमें 0.5 से अधिक IoU की एक सामान्य सीमा को सही स्थानीकरण माना जाता है।
डेटासेट निर्माण
ReferIt के निर्माण में दो मुख्य घटक शामिल थे। पहला, ImageNet डेटाबेस से छवियों का एक सेट एकत्र किया गया था, जिससे रोज़मर्रा के दृश्यों और वस्तुओं का एक विविध सेट सुनिश्चित हुआ। दूसरा, referring expressions को एक Pictionary-शैली के खेल के माध्यम से उत्पन्न किया गया था, जहाँ एक खिलाड़ी ने एक वस्तु का वर्णन किया, और दूसरे खिलाड़ी को उसे पहचानना था। इस प्रक्रिया ने प्राकृतिक, विविध, और कभी-कभी अस्पष्ट वाक्यांशों के संग्रह की अनुमति दी। फिर छवियों को segmentation मास्क के साथ एनोटेट किया गया, जिन्हें बाद में मूल्यांकन उद्देश्यों के लिए बाउंडिंग बॉक्स में परिवर्तित किया गया, हालाँकि डेटासेट के कुछ प्रकार segmentation कार्यों के लिए मास्क एनोटेशन बनाए रखते हैं।
मॉडल आर्किटेक्चर और विधियाँ
ReferIt पर referring expression grounding के लिए अधिकांश आधुनिक दृष्टिकोणों में गहन शिक्षण मॉडल शामिल हैं, विशेष रूप से Artificial intelligence और Machine learning पर आधारित। मानक पाइपलाइन एक Neural network का उपयोग करती है जो दृश्य और पाठ्य दोनों मोडैलिटी को एनकोड करती है। आमतौर पर, छवि फीचर निष्कर्षण के लिए एक पूर्व-प्रशिक्षित convolutional नेटवर्क जैसे Residual Network (ResNet) का उपयोग किया जाता है, और एक Transformer (architecture) या recurrent नेटवर्क पाठ को एनकोड करता है। इन प्रतिनिधित्वों को फिर जोड़ा जाता है, और एक स्थानीकरण मॉड्यूल बाउंडिंग बॉक्स या मास्क की भविष्यवाणी करता है।
कई मॉडल एक दो-चरणीय दृष्टिकोण का उपयोग करते हैं जहाँ पहले एक वस्तु डिटेक्टर द्वारा क्षेत्र प्रस्ताव उत्पन्न किए जाते हैं, और फिर क्वेरी अभिव्यक्ति के साथ मिलान किया जाता है। वैकल्पिक रूप से, हालिया सुधार एक पूर्ण रूप से विभेदन योग्य फ्रेमवर्क का उपयोग करते हैं जो मिश्रित फीचर्स से सीधे निर्देशांक की भविष्यवाणी करता है, अक्सर Multi-Head Attention तंत्रों के साथ। 2024 तक, ReferIt पर state-of-the-art परिणाम बड़े पैमाने पर पूर्व-प्रशिक्षित vision-language transformers का उपयोग करके रिपोर्ट किए गए हैं, जो विशाल मात्रा में डेटा और डेटासेट पर बाद में फाइन-ट्यूनिंग का लाभ उठाते हैं।
अनुप्रयोग
ReferIt उन मॉडलों के मूल्यांकन के लिए एक बेंचमार्क प्रदान करता है जिन्हें भाषा को दृश्य दुनिया में ग्राउंड करने की आवश्यकता होती है, जो मानव-रोबोट संपर्क, इंटरैक्टिव छवि संपादन, और augmented reality जैसे कार्यों के लिए आवश्यक है। इसका उपयोग Computer vision और प्राकृतिक भाषा प्रसंस्करण को संयोजित करने वाली प्रणालियों के लिए एक प्रशिक्षण स्रोत के रूप में भी किया गया है, जिसमें एकीकृत मल्टीमॉडल सहायक शामिल हैं। डेटासेट ने अनुवर्ती कार्यों को जन्म दिया है, जिसमें दृश्य coreference resolution और referring expression generation शामिल हैं, जहाँ मॉडल किसी दिए गए क्षेत्र का वर्णन करने वाली भाषा उत्पन्न करते हैं।
प्रभाव और सीमाएँ
ReferIt को अनुसंधान समुदाय में व्यापक रूप से अपनाया गया है, और यह समान डेटासेट के साथ, मानक बेंचमार्क में से एक बन गया है। इसकी मुख्य सीमाओं में आधुनिक बड़े पैमाने के दृश्य डेटासेट की तुलना में अपेक्षाकृत छोटी छवि संख्या और प्राकृतिक दृश्यों के प्रति इसका पूर्वाग्रह शामिल है, जो अत्यधिक विशेष या औद्योगिक छवि डोमेन के लिए सामान्यीकृत नहीं हो सकता है। हालाँकि, इसकी यथार्थवादिता और प्राकृतिक भाषा संरचना grounding एल्गोरिदम के विकास को जारी रखती है। यह out-of-vocabulary और सामान्यीकरण के मूल्यांकन के लिए भी एक आधार है, क्योंकि अभिव्यक्तियाँ मनमाने ढंग से जटिल हो सकती हैं।
संबंधित संसाधन
अभिव्यक्ति ग्राउंडिंग का क्षेत्र मल्टीमॉडल शिक्षण का एक उपक्षेत्र बन गया है, और ReferIt के सिद्धांतों को अधिक व्यापक डेटासेट और बेंचमार्क में शामिल किया गया है। इनमें अब वीडियो ग्राउंडिंग डेटासेट और संयुक्त कार्य शामिल हैं, जो भाषा को छवियों और अस्थायी घटनाओं दोनों में वस्तुओं से जोड़ते हैं। इन सेटिंग्स में grounding सटीकता में सुधार के लिए मानव प्रतिक्रिया से Reinforcement learning का भी पता लगाया गया है, जैसा कि Reinforcement Learning from AI Feedback (RLAIF) में वर्णित है। दृश्य और भाषा के संलयन की मूल अवधारणाएँ Large language models के Encoder-Decoder Architecture और Cross-Attention तंत्रों जैसी नई आर्किटेक्चर में भी केंद्रीय हैं।