अंग्रेज़ी से अनुवादित

CLIPScore एक संदर्भ-मुक्त मीट्रिक है जो किसी छवि और उसके उत्पन्न कैप्शन के CLIP एम्बेडिंग के बीच कोसाइन समानता की गणना करके छवि कैप्शनिंग गुणवत्ता का मूल्यांकन करता है, जो मानवीय निर्णय के साथ अच्छी तरह से सहसंबंधित होता है।

CLIPScore एक मीट्रिक है जो कृत्रिम बुद्धिमत्ता प्रणालियों द्वारा उत्पन्न छवि कैप्शन की गुणवत्ता का मूल्यांकन करने के लिए उपयोग किया जाता है। यह एक संदर्भ-मुक्त मीट्रिक है, जिसका अर्थ है कि इसे तुलना के लिए मानव-लिखित ग्राउंड-ट्रुथ कैप्शन की आवश्यकता नहीं होती है। इसके बजाय, यह CLIP (कंट्रास्टिव लैंग्वेज-इमेज प्री-ट्रेनिंग) नामक पूर्व-प्रशिक्षित तंत्रिका नेटवर्क का उपयोग करके सीधे एक छवि और एक उम्मीदवार कैप्शन के बीच शब्दार्थ संरेखण को मापता है।

यह मीट्रिक 2021 में कोपेनहेगन विश्वविद्यालय और डेनमार्क के तकनीकी विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिसका नेतृत्व जैक हेसल ने किया था। इसे उस वर्ष प्राकृतिक भाषा प्रसंस्करण में अनुभवजन्य तरीकों पर सम्मेलन (EMNLP) में प्रस्तुत किया गया था। मुख्य विचार CLIP द्वारा सीखे गए संयुक्त एम्बेडिंग स्थान का लाभ उठाना है, जहां छवियों और उनके संबंधित पाठ विवरणों को वैक्टर में मैप किया जाता है जो एक दूसरे के करीब होते हैं। CLIPScore छवि के CLIP एम्बेडिंग और कैप्शन के CLIP एम्बेडिंग के बीच कोसाइन समानता की गणना करता है, जिसे वैकल्पिक रूप से अत्यधिक छोटे कैप्शन के लिए दंड द्वारा भारित किया जाता है।

गणना और वेरिएंट

आधार CLIPScore को छवि और कैप्शन के सामान्यीकृत एम्बेडिंग के बीच कोसाइन समानता के रूप में परिभाषित किया गया है, जिसे कैप्शन की लंबाई को ध्यान में रखने वाले कारक से गुणा किया जाता है। विशेष रूप से, सूत्र है: CLIPScore(I, c) = w * max(cos(I, c), 0), जहां w एक भारांक शब्द है जो 2.5 है यदि कैप्शन में एक निश्चित संख्या से कम टोकन हैं (आमतौर पर 10) और अन्यथा 1 है। यह दंड अत्यधिक संक्षिप्त कैप्शन को हतोत्साहित करता है जो तुच्छ रूप से छवि से मेल खा सकते हैं।

RefCLIPScore नामक एक वेरिएंट प्रत्येक संदर्भ के साथ छवि के बीच CLIPScore का औसत लेकर संदर्भ कैप्शन को शामिल करता है, फिर इसे हार्मोनिक माध्य का उपयोग करके आधार CLIPScore के साथ जोड़ता है। यह वेरिएंट तब उपयोग किया जाता है जब मानव संदर्भ उपलब्ध हों, लेकिन CLIPScore का प्राथमिक लाभ उनके बिना काम करने की क्षमता है।

पारंपरिक मीट्रिक पर लाभ

छवि कैप्शनिंग के लिए पारंपरिक मीट्रिक, जैसे BLEU, ROUGE, METEOR, और CIDEr, उत्पन्न कैप्शन और संदर्भ कैप्शन के बीच n-ग्राम ओवरलैप पर निर्भर करते हैं। ये मीट्रिक संदर्भ-आधारित हैं और अक्सर शब्दार्थ समानता को पकड़ने में विफल होते हैं, उन पैराफ्रेज़ को दंडित करते हैं जो भाषाई रूप से भिन्न हैं लेकिन शब्दार्थ रूप से समकक्ष हैं। CLIPScore इसे छवि-पाठ जोड़ों के एक बड़े कोरपस से सीखे गए उच्च-आयामी शब्दार्थ स्थान में काम करके संबोधित करता है। यह इसे पहचानने की अनुमति देता है कि "एक कुत्ता गेंद खेल रहा है" और "एक कैनाइन गेंद को पुनः प्राप्त कर रहा है" एक ही दृश्य का वर्णन करते हैं, भले ही कोई साझा शब्द न हों।

अनुभवजन्य अध्ययनों से पता चला है कि CLIPScore कई बेंचमार्क डेटासेट, जिनमें Flickr8k, Flickr30k, और MS COCO शामिल हैं, में पारंपरिक मीट्रिक की तुलना में कैप्शन गुणवत्ता के मानव निर्णयों के साथ बेहतर सहसंबंध रखता है। इसकी संदर्भ-मुक्त प्रकृति इसे नए डोमेन में कैप्शन का मूल्यांकन करने या शून्य-शॉट कैप्शनिंग मॉडल के लिए विशेष रूप से उपयोगी बनाती है जहां संदर्भ कैप्शन अनुपलब्ध हैं।

अनुप्रयोग और सीमाएं

CLIPScore को छवि कैप्शनिंग और पाठ-से-छवि निर्माण के लिए जनरेटिव-एआई मॉडल के मूल्यांकन में व्यापक रूप से अपनाया गया है। इसे अक्सर समग्र मूल्यांकन प्रदान करने के लिए अन्य मीट्रिक के साथ उपयोग किया जाता है। उदाहरण के लिए, पाठ-से-छवि मॉडल में, CLIPScore नामक एक वेरिएंट का उपयोग उत्पन्न छवि और एक पाठ प्रॉम्प्ट के बीच संरेखण को मापने के लिए किया जाता है, जिससे शोधकर्ताओं को मॉडल पैरामीटर ट्यून करने में मदद मिलती है।

अपनी ताकत के बावजूद, CLIPScore की ज्ञात सीमाएं हैं। यह CLIP मॉडल चेकपॉइंट की पसंद के प्रति संवेदनशील है, क्योंकि विभिन्न चेकपॉइंट अलग-अलग स्कोर उत्पन्न कर सकते हैं। यह उन कैप्शनों के प्रति पक्षपाती हो सकता है जो सामान्य वस्तुओं या विशेषताओं का उल्लेख करते हैं, और यह बारीक विवरण या रचनात्मक तर्क को पूरी तरह से कैप्चर नहीं कर सकता है। इसके अतिरिक्त, यह व्याकरणिक शुद्धता या प्रवाह को सीधे मापता नहीं है, इसलिए इसे अक्सर भाषा-मॉडल-आधारित प्रवाह मीट्रिक के साथ जोड़ा जाता है।

अन्य एआई मीट्रिक से संबंध

CLIPScore मशीन-लर्निंग मूल्यांकन में एक व्यापक प्रवृत्ति का हिस्सा है जो n-ग्राम-आधारित मीट्रिक से दूर सीखे गए, एम्बेडिंग-आधारित मीट्रिक की ओर बढ़ता है। यह पाठ सारांश और अनुवाद के लिए BERTScore जैसे मीट्रिक के साथ वैचारिक समानताएं साझा करता है, जो बड़े-भाषा-मॉडल ट्रांसफॉर्मर से एम्बेडिंग का उपयोग करते हैं। हालांकि, CLIPScore अद्वितीय है क्योंकि यह क्रॉस-मोडली काम करता है, दृष्टि और भाषा को जोड़ता है।

CLIPScore का विकास 2021 की शुरुआत में OpenAI के CLIP मॉडल की रिलीज़ से संभव हुआ, जो स्वयं 400 मिलियन छवि-पाठ जोड़ों पर प्रशिक्षित एक ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क है। CLIPScore की सफलता ने अन्य मल्टीमॉडल कार्यों, जैसे वीडियो कैप्शनिंग और दृश्य प्रश्न उत्तर, में संदर्भ-मुक्त मूल्यांकन पर बाद के काम को प्रेरित किया है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:image-captioning·evaluation-metrics·multimodal-learning·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास