CLIPScore एक मीट्रिक है जो कृत्रिम बुद्धिमत्ता प्रणालियों द्वारा उत्पन्न छवि कैप्शन की गुणवत्ता का मूल्यांकन करने के लिए उपयोग किया जाता है। यह एक संदर्भ-मुक्त मीट्रिक है, जिसका अर्थ है कि इसे तुलना के लिए मानव-लिखित ग्राउंड-ट्रुथ कैप्शन की आवश्यकता नहीं होती है। इसके बजाय, यह CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) नामक पूर्व-प्रशिक्षित तंत्रिका नेटवर्क का उपयोग करके सीधे एक छवि और एक उम्मीदवार कैप्शन के बीच शब्दार्थ संरेखण को मापता है।
यह मीट्रिक 2021 में कोपेनहेगन विश्वविद्यालय और डेनमार्क के तकनीकी विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिसका नेतृत्व जैक हेसल ने किया था। इसे उस वर्ष प्राकृतिक भाषा प्रसंस्करण में अनुभवजन्य तरीकों पर सम्मेलन (EMNLP) में प्रस्तुत किया गया था। मुख्य विचार CLIP द्वारा सीखे गए संयुक्त एम्बेडिंग स्थान का लाभ उठाना है, जहां छवियों और उनके संबंधित पाठ विवरणों को वैक्टर में मैप किया जाता है जो एक दूसरे के करीब होते हैं। CLIPScore छवि के CLIP एम्बेडिंग और कैप्शन के CLIP एम्बेडिंग के बीच कोसाइन समानता की गणना करता है, जिसे वैकल्पिक रूप से अत्यधिक छोटे कैप्शन के लिए दंड द्वारा भारित किया जाता है।
गणना और वेरिएंट
आधार CLIPScore को छवि और कैप्शन के सामान्यीकृत एम्बेडिंग के बीच कोसाइन समानता के रूप में परिभाषित किया गया है, जिसे कैप्शन की लंबाई को ध्यान में रखने वाले कारक से गुणा किया जाता है। विशेष रूप से, सूत्र है: CLIPScore(I, c) = w * max(cos(I, c), 0), जहां w एक भारांक शब्द है जो 2.5 है यदि कैप्शन में एक निश्चित संख्या से कम टोकन हैं (आमतौर पर 10) और अन्यथा 1 है। यह दंड अत्यधिक संक्षिप्त कैप्शन को हतोत्साहित करता है जो तुच्छ रूप से छवि से मेल खा सकते हैं।
RefCLIPScore नामक एक वेरिएंट प्रत्येक संदर्भ के साथ छवि के बीच CLIPScore का औसत लेकर संदर्भ कैप्शन को शामिल करता है, फिर इसे हार्मोनिक माध्य का उपयोग करके आधार CLIPScore के साथ जोड़ता है। यह वेरिएंट तब उपयोग किया जाता है जब मानव संदर्भ उपलब्ध हों, लेकिन CLIPScore का प्राथमिक लाभ उनके बिना काम करने की क्षमता है।
पारंपरिक मीट्रिक पर लाभ
छवि कैप्शनिंग के लिए पारंपरिक मीट्रिक, जैसे BLEU, ROUGE, METEOR, और CIDEr, उत्पन्न कैप्शन और संदर्भ कैप्शन के बीच n-ग्राम ओवरलैप पर निर्भर करते हैं। ये मीट्रिक संदर्भ-आधारित हैं और अक्सर शब्दार्थ समानता को पकड़ने में विफल होते हैं, उन पैराफ्रेज़ को दंडित करते हैं जो भाषाई रूप से भिन्न हैं लेकिन शब्दार्थ रूप से समकक्ष हैं। CLIPScore इसे छवि-पाठ जोड़ों के एक बड़े कोरपस से सीखे गए उच्च-आयामी शब्दार्थ स्थान में काम करके संबोधित करता है। यह इसे पहचानने की अनुमति देता है कि "एक कुत्ता गेंद खेल रहा है" और "एक कैनाइन गेंद को पुनः प्राप्त कर रहा है" एक ही दृश्य का वर्णन करते हैं, भले ही कोई साझा शब्द न हों।
अनुभवजन्य अध्ययनों से पता चला है कि CLIPScore कई बेंचमार्क डेटासेट, जिनमें Flickr8k, Flickr30k, और MS COCO शामिल हैं, में पारंपरिक मीट्रिक की तुलना में कैप्शन गुणवत्ता के मानव निर्णयों के साथ बेहतर सहसंबंध रखता है। इसकी संदर्भ-मुक्त प्रकृति इसे नए डोमेन में कैप्शन का मूल्यांकन करने या शून्य-शॉट कैप्शनिंग मॉडल के लिए विशेष रूप से उपयोगी बनाती है जहां संदर्भ कैप्शन अनुपलब्ध हैं।
अनुप्रयोग और सीमाएं
CLIPScore को छवि कैप्शनिंग और पाठ-से-छवि निर्माण के लिए जनरेटिव-एआई मॉडल के मूल्यांकन में व्यापक रूप से अपनाया गया है। इसे अक्सर समग्र मूल्यांकन प्रदान करने के लिए अन्य मीट्रिक के साथ उपयोग किया जाता है। उदाहरण के लिए, पाठ-से-छवि मॉडल में, CLIPScore नामक एक वेरिएंट का उपयोग उत्पन्न छवि और एक पाठ प्रॉम्प्ट के बीच संरेखण को मापने के लिए किया जाता है, जिससे शोधकर्ताओं को मॉडल पैरामीटर ट्यून करने में मदद मिलती है।
अपनी ताकत के बावजूद, CLIPScore की ज्ञात सीमाएं हैं। यह CLIP मॉडल चेकपॉइंट की पसंद के प्रति संवेदनशील है, क्योंकि विभिन्न चेकपॉइंट अलग-अलग स्कोर उत्पन्न कर सकते हैं। यह उन कैप्शनों के प्रति पक्षपाती हो सकता है जो सामान्य वस्तुओं या विशेषताओं का उल्लेख करते हैं, और यह बारीक विवरण या रचनात्मक तर्क को पूरी तरह से कैप्चर नहीं कर सकता है। इसके अतिरिक्त, यह व्याकरणिक शुद्धता या प्रवाह को सीधे मापता नहीं है, इसलिए इसे अक्सर भाषा-मॉडल-आधारित प्रवाह मीट्रिक के साथ जोड़ा जाता है।
अन्य एआई मीट्रिक से संबंध
CLIPScore मशीन-लर्निंग मूल्यांकन में एक व्यापक प्रवृत्ति का हिस्सा है जो n-ग्राम-आधारित मीट्रिक से दूर सीखे गए, एम्बेडिंग-आधारित मीट्रिक की ओर बढ़ता है। यह पाठ सारांश और अनुवाद के लिए BERTScore जैसे मीट्रिक के साथ वैचारिक समानताएं साझा करता है, जो बड़े-भाषा-मॉडल ट्रांसफॉर्मर से एम्बेडिंग का उपयोग करते हैं। हालांकि, CLIPScore अद्वितीय है क्योंकि यह क्रॉस-मोडली काम करता है, दृष्टि और भाषा को जोड़ता है।
CLIPScore का विकास 2021 की शुरुआत में OpenAI के CLIP मॉडल की रिलीज़ से संभव हुआ, जो स्वयं 400 मिलियन छवि-पाठ जोड़ों पर प्रशिक्षित एक ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क है। CLIPScore की सफलता ने अन्य मल्टीमॉडल कार्यों, जैसे वीडियो कैप्शनिंग और दृश्य प्रश्न उत्तर, में संदर्भ-मुक्त मूल्यांकन पर बाद के काम को प्रेरित किया है।