Winoground एक बेंचमार्क डेटासेट और मूल्यांकन सूट है, जिसे विज़न-भाषा मॉडल की संरचनात्मक समझ का परीक्षण करने के लिए डिज़ाइन किया गया है। इसे 2022 में टोरंटो विश्वविद्यालय के शोधकर्ताओं और अन्य लोगों द्वारा पेश किया गया था, और यह आकलन करने के लिए एक मानक संदर्भ बिंदु बन गया है कि क्या मॉडल वास्तव में दृश्य सामग्री और भाषाई संरचना के बीच संबंध को समझते हैं, न कि सांख्यिकीय शॉर्टकट या सतही सहसंबंधों पर निर्भर रहते हैं। बेंचमार्क का नाम "विनोग्राद" (प्राकृतिक भाषा के लिए विनोग्राद स्कीमा चैलेंज का संदर्भ) और "ग्राउंड" (भाषा को छवियों से जोड़ने के अर्थ में) का एक पोर्टमैंटू है।
Winoground में मुख्य कार्य में 400 सावधानीपूर्वक निर्मित उदाहरणों का एक सेट शामिल है। प्रत्येक उदाहरण में दो छवियाँ और दो कैप्शन होते हैं। कैप्शन को संरचनात्मक रूप से चुनौतीपूर्ण बनाने के लिए डिज़ाइन किया गया है: उनमें शब्दों का एक ही सेट होता है, लेकिन एक अलग क्रम में, जो अर्थ बदल देता है। उदाहरण के लिए, एक कैप्शन "कुत्ता बिल्ली का पीछा करता है" हो सकता है, जबकि दूसरा "बिल्ली कुत्ते का पीछा करती है" है। दो संबंधित छवियाँ प्रत्येक परिदृश्य को दर्शाती हैं। एक मॉडल को दोनों छवियों और दोनों कैप्शन के साथ प्रस्तुत किया जाता है, और उसे प्रत्येक कैप्शन को उसकी संबंधित छवि से सही ढंग से मिलाना होता है। सफलता के लिए मॉडल को कैप्शन की वाक्यात्मक संरचना को पार्स करना होगा और इसे छवियों में दृश्य संबंधों के साथ संरेखित करना होगा, जैसे कि एजेंट-क्रिया-रोगी भूमिकाएँ, स्थानिक पूर्वसर्ग (जैसे, "पर" बनाम "में"), या विशेषता-वस्तु जोड़े।
बेंचमार्क को विज़न-भाषा मॉडल में एक ज्ञात कमजोरी को संबोधित करने के लिए बनाया गया था: वे अक्सर उन कार्यों पर अच्छा प्रदर्शन करते हैं जिन्हें व्यक्तिगत वस्तुओं को पहचानकर या भाषा पूर्वधारणाओं का उपयोग करके हल किया जा सकता है, लेकिन वे तब विफल हो जाते हैं जब कार्य को यह समझने की आवश्यकता होती है कि शब्दों की व्यवस्था अर्थ को कैसे बदलती है। उदाहरण के लिए, एक मॉडल सही ढंग से पहचान सकता है कि एक छवि में एक कुत्ता और एक बिल्ली है, लेकिन यह निर्धारित करने में सक्षम नहीं हो सकता है कि कौन सा जानवर क्रिया कर रहा है। Winoground इस क्षमता के लिए एक नियंत्रित परीक्षण प्रदान करता है, और इसने अत्याधुनिक मॉडलों के प्रदर्शन में भी महत्वपूर्ण अंतराल को उजागर किया है।
डिज़ाइन और मूल्यांकन
प्रत्येक Winoground उदाहरण को तीन अलग-अलग मेट्रिक्स पर स्कोर किया जाता है: "कैप्शन स्कोर," "छवि स्कोर," और "समूह स्कोर।" कैप्शन स्कोर उन उदाहरणों के अनुपात को मापता है जहाँ मॉडल दोनों कैप्शन को उनकी संबंधित छवियों से सही ढंग से मिलाता है। छवि स्कोर उस अनुपात को मापता है जहाँ मॉडल दोनों छवियों को उनके संबंधित कैप्शन से सही ढंग से मिलाता है (जो सममित है लेकिन मॉडल विषमताओं के कारण भिन्न हो सकता है)। समूह स्कोर सबसे कठोर है: इसके लिए मॉडल को एक ही परीक्षण में दोनों कैप्शन-से-छवि मिलान सही करने की आवश्यकता होती है, जिसका अर्थ है कि मॉडल को न केवल सही जोड़ी की पहचान करनी चाहिए, बल्कि दो विकल्पों के बीच किसी भी भ्रम से भी बचना चाहिए।
डेटासेट का निर्माण मानव एनोटेटरों द्वारा किया गया था, जिन्होंने छवि जोड़े और कैप्शन उत्पन्न किए। कैप्शन को न्यूनतम जोड़े बनाने के लिए डिज़ाइन किया गया था, जो केवल एक विशिष्ट संरचनात्मक तत्व में भिन्न होते हैं। फिर छवियों को प्रत्येक कैप्शन से सटीक रूप से मेल खाने के लिए स्रोत या उत्पन्न किया गया था। रचनाकारों ने यह सुनिश्चित करने के लिए उदाहरणों को फ़िल्टर भी किया कि वे केवल सरल वस्तु पहचान से हल नहीं हो सकते हैं, और उन्होंने सत्यापित किया कि मानव एनोटेटर लगभग पूर्ण सटीकता के साथ कार्य को हल कर सकते हैं, जिससे एक मानव आधार रेखा स्थापित हुई।
परिणाम और निष्कर्ष
Winoground पर प्रमुख विज़न-भाषा मॉडलों के प्रारंभिक मूल्यांकन से पता चला कि अधिकांश मॉडलों ने संयोग स्तर पर या उसके आसपास प्रदर्शन किया (समूह स्कोर के लिए लगभग 25%, क्योंकि दो संभावित जोड़े हैं और मॉडल को सही चुनना होगा)। उदाहरण के लिए, CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) और अन्य दोहरे-एनकोडर आर्किटेक्चर जैसे मॉडल, जो छवियों और पाठ को एक साझा स्थान में एम्बेड करते हैं, अक्सर दो कैप्शन के बीच अंतर करने में विफल रहे। यह आश्चर्यजनक था क्योंकि इन मॉडलों ने छवि कैप्शन पुनर्प्राप्ति या दृश्य प्रश्न उत्तर जैसे अन्य बेंचमार्क पर उच्च स्कोर प्राप्त किए थे। विफलता ने इस बात पर प्रकाश डाला कि ये मॉडल वास्तव में संरचनात्मक तर्क नहीं कर रहे थे; इसके बजाय, वे अक्सर व्यक्तिगत वस्तुओं की उपस्थिति या शब्दों और दृश्य विशेषताओं के बीच सहसंबंधों पर निर्भर थे, जिन्हें संबंधपरक संरचना को समझने की आवश्यकता नहीं थी।
बाद के काम ने विभिन्न मॉडल आर्किटेक्चर की सीमाओं का पता लगाने के लिए Winoground का उपयोग किया है, जिसमें Transformer (architecture) और Large language model पर आधारित मॉडल शामिल हैं, जब दृश्य एनकोडर के साथ जोड़ा जाता है। शोधकर्ताओं ने पाया है कि अधिक परिष्कृत ध्यान तंत्र वाले मॉडल या जो अतिरिक्त उद्देश्यों के साथ प्रशिक्षित होते हैं, जैसे कि Cross-Attention या Multi-Head Attention परतें, कभी-कभी बेहतर प्रदर्शन दिखाते हैं, लेकिन फिर भी, स्कोर मानव स्तर से काफी नीचे रहते हैं। बेंचमार्क का उपयोग प्रशिक्षण डेटा पैमाने और सिंथेटिक डेटा के उपयोग के प्रभाव का अध्ययन करने के लिए भी किया गया है, कुछ अध्ययनों से पता चलता है कि संरचनात्मक उदाहरणों के साथ प्रशिक्षण डेटा को बढ़ाने से Winoground पर प्रदर्शन में सुधार हो सकता है, लेकिन सामान्यीकरण एक चुनौती बनी हुई है।
अन्य बेंचमार्क से संबंध
Winoground बेंचमार्क के एक व्यापक परिवार का हिस्सा है जो AI में संरचनात्मक सामान्यीकरण का परीक्षण करता है। यह अवधारणात्मक रूप से प्राकृतिक भाषा प्रसंस्करण में विनोग्राद स्कीमा चैलेंज से संबंधित है, जो कोरफेरेंस समाधान और सामान्य ज्ञान तर्क का परीक्षण करता है। विज़न-भाषा डोमेन में, यह VQA (दृश्य प्रश्न उत्तर) और छवि-पाठ पुनर्प्राप्ति जैसे अन्य बेंचमार्क का पूरक है, लेकिन यह विशेष रूप से संरचनात्मक पहलू को अलग करता है। उन कार्यों के विपरीत जो मॉडल को भाषा पूर्वधारणाओं या वस्तु सह-घटना आँकड़ों का उपयोग करने की अनुमति देते हैं, Winoground मॉडल को कैप्शन की सटीक वाक्यात्मक संरचना का उपयोग करने के लिए मजबूर करता है। यह इसे नए आर्किटेक्चर विकसित करने वाले शोधकर्ताओं के लिए एक मूल्यवान नैदानिक उपकरण बनाता है, जैसे कि छवि एन्कोडिंग के लिए Residual Network (ResNet) या U-Net पर आधारित, और Curriculum Learning या Reinforcement Learning from AI Feedback (RLAIF) (AI फीडबैक से सुदृढीकरण सीखना) जैसी प्रशिक्षण तकनीकों के लिए।
बेंचमार्क ने विविधताओं और विस्तारों को भी प्रेरित किया है, जैसे कि वीडियो के लिए या बहुभाषी सेटिंग्स के लिए Winoground, हालांकि ये कम मानकीकृत हैं। मूल डेटासेट सार्वजनिक रूप से उपलब्ध है, और इसे कंपनियों और अनुसंधान प्रयोगशालाओं द्वारा उपयोग किए जाने वाले कई मॉडल मूल्यांकन सूट में एकीकृत किया गया है, जिनमें OpenAI, Google DeepMind, और Anthropic शामिल हैं, जो संरचनात्मक समझ पर प्रगति को ट्रैक करने के तरीके के रूप में है।
सीमाएँ और आलोचनाएँ
कुछ शोधकर्ताओं ने नोट किया है कि Winoground की सीमाएँ हैं। डेटासेट अपेक्षाकृत छोटा है (400 उदाहरण), जो मूल्यांकन परिणामों में उच्च भिन्नता पैदा कर सकता है, विशेष रूप से स्टोकेस्टिक मॉडल के लिए। उदाहरण भी सभी अंग्रेजी में हैं और संरचनात्मक घटनाओं के एक सीमित सेट पर ध्यान केंद्रित करते हैं, जैसे कि विषय-क्रिया-वस्तु क्रम और स्थानिक संबंध, जो विज़न-भाषा समझ में संरचनात्मक चुनौतियों की पूरी श्रृंखला को कैप्चर नहीं कर सकते हैं। इसके अतिरिक्त, कार्य की द्विआधारी प्रकृति (दो छवियों को दो कैप्शन से मिलाना) कभी-कभी एक सरल अनुमानी का उपयोग करने वाले मॉडल द्वारा हल की जा सकती है, जैसे कि एक एकल विशिष्ट शब्द पर ध्यान केंद्रित करना, बिना वाक्य को पूरी तरह से समझे। इन आलोचनाओं के बावजूद, Winoground Artificial intelligence और Machine learning के क्षेत्र में एक व्यापक रूप से उद्धृत और प्रभावशाली बेंचमार्क बना हुआ है, और यह नए मॉडल और प्रशिक्षण विधियों के लिए एक मानक परीक्षण के रूप में उपयोग किया जाना जारी है।