VSWinoground एक बेंचमार्क डेटासेट है जिसे विज़न-भाषा मॉडलों की दृश्य स्थानिक तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2023 में टोरंटो विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिसमें ट्रिस्टन थ्रश, रयान जियांग और सहयोगी शामिल थे। यह डेटासेट Winoground बेंचमार्क पर आधारित है, जो पाठ-छवि जोड़ों में संरचनात्मक समझ का परीक्षण करता है, लेकिन विशेष रूप से 'ऊपर', 'नीचे', 'बाएं' और 'दाएं' जैसे स्थानिक संबंधों पर केंद्रित है।
इस बेंचमार्क में 400 छवि-कैप्शन जोड़े शामिल हैं, जिनमें से प्रत्येक में दो कैप्शन एक ही छवि का वर्णन करते हैं लेकिन वस्तुओं की स्थानिक व्यवस्था में भिन्न होते हैं। उदाहरण के लिए, एक कैप्शन 'बिल्ली कुत्ते के ऊपर है' पढ़ सकता है जबकि दूसरा 'कुत्ता बिल्ली के ऊपर है' पढ़ता है। मॉडलों को किसी दी गई छवि के लिए सही कैप्शन चुनने का कार्य सौंपा जाता है, और इसके विपरीत भी। यह डेटासेट सार्वजनिक रूप से उपलब्ध है और मॉडल प्रदर्शन का आकलन करने के लिए कई शोध अध्ययनों में उपयोग किया गया है।
डिज़ाइन और मूल्यांकन
VSWinoground को एक अर्ध-स्वचालित पाइपलाइन का उपयोग करके निर्मित किया गया है जो सिंथेटिक 3D दृश्यों से छवियां उत्पन्न करता है, जिससे स्थानिक लेआउट पर सटीक नियंत्रण सुनिश्चित होता है। प्रत्येक छवि को एक विशिष्ट स्थानिक संबंध में रखी गई दो वस्तुओं के साथ प्रस्तुत किया जाता है, और कैप्शन टेम्पलेट्स का उपयोग करके उत्पन्न किए जाते हैं। बेंचमार्क में 'टेक्स्ट-टू-इमेज' और 'इमेज-टू-टेक्स्ट' दोनों पुनर्प्राप्ति कार्य शामिल हैं, और मॉडलों को प्रत्येक कार्य के लिए सटीकता के साथ-साथ एक संयुक्त 'समूह' स्कोर पर आंका जाता है, जिसके लिए किसी दिए गए जोड़े के लिए दोनों कार्यों पर सही प्रदर्शन की आवश्यकता होती है।
CLIP और ViLT सहित कई अत्याधुनिक मॉडलों पर प्रारंभिक मूल्यांकन से पता चला कि वे इमेज-टू-टेक्स्ट कार्य पर संयोग से केवल थोड़ा बेहतर प्रदर्शन करते हैं (लगभग 50% सटीकता), और टेक्स्ट-टू-इमेज कार्य पर काफी खराब प्रदर्शन करते हैं। उदाहरण के लिए, CLIP ने इमेज-टू-टेक्स्ट पर लगभग 52% और टेक्स्ट-टू-इमेज पर 48% सटीकता हासिल की, जबकि ViLT ने दोनों पर लगभग 50% स्कोर किया। ये परिणाम वर्तमान मॉडलों के लिए दृश्य स्थानिक तर्क की कठिनाई को उजागर करते हैं।
संबंधित बेंचमार्क
VSWinoground Winoground-शैली बेंचमार्क के व्यापक परिवार का हिस्सा है जो संरचनात्मक और स्थानिक समझ का परीक्षण करता है। मूल Winoground डेटासेट, जिसे 2022 में Google DeepMind के शोधकर्ताओं द्वारा पेश किया गया था, में अधिक सामान्य संरचनात्मक विविधताओं के साथ 400 छवि-कैप्शन जोड़े शामिल हैं। अन्य संबंधित बेंचमार्क में VSR (दृश्य स्थानिक तर्क) शामिल है, जो वास्तविक छवियों का उपयोग करता है और स्थानिक संबंधों पर केंद्रित है, और हाल ही में Winoground-V2, जो मूल डेटासेट का विस्तार करता है। इन बेंचमार्क का उपयोग अक्सर विज़न-भाषा मॉडलों की मजबूती का मूल्यांकन करने के लिए एक साथ किया जाता है।
सीमाएं और आलोचनाएं
VSWinoground की एक सीमा इसका अपेक्षाकृत छोटा आकार (400 जोड़े) है, जो मूल्यांकन परिणामों में उच्च भिन्नता पैदा कर सकता है। इसके अतिरिक्त, चूंकि छवियां सिंथेटिक हैं, वे वास्तविक दुनिया की स्थानिक तर्क की जटिलता को पूरी तरह से पकड़ नहीं सकती हैं। कुछ शोधकर्ताओं ने तर्क दिया है कि बेंचमार्क का सरल स्थानिक पूर्वसर्गों पर ध्यान केंद्रित करना व्यावहारिक अनुप्रयोगों में आवश्यक स्थानिक तर्क की पूरी श्रृंखला को प्रतिबिंबित नहीं कर सकता है। फिर भी, VSWinoground मॉडल क्षमताओं की जांच के लिए एक व्यापक रूप से उद्धृत संसाधन बना हुआ है।
प्रभाव और भविष्य की दिशाएं
VSWinoground का उपयोग कई अध्ययनों में विज़न-भाषा मॉडलों की सीमाओं का विश्लेषण करने के लिए किया गया है, विशेष रूप से बड़े भाषा मॉडल और मल्टीमॉडल शिक्षण के संदर्भ में। इसने स्थानिक तर्क में सुधार पर अनुवर्ती कार्य को भी प्रेरित किया है, जैसे स्पष्ट स्थानिक एन्कोडिंग को शामिल करना या सिंथेटिक डेटा संवर्धन का उपयोग करना। 2025 तक, किसी भी मॉडल ने बेंचमार्क पर मानव-स्तरीय प्रदर्शन हासिल नहीं किया है, और यह एआई अनुसंधान समुदाय के लिए एक चुनौतीपूर्ण परीक्षण मंच के रूप में कार्य करना जारी रखता है।
यह भी देखें
- Winoground (मूल बेंचमार्क)
- दृश्य स्थानिक तर्क
- विज़न-भाषा मॉडल