अंग्रेज़ी से अनुवादित

NoCaps एक बेंचमार्क डेटासेट है जो नए ऑब्जेक्ट्स पर इमेज कैप्शनिंग मॉडल का मूल्यांकन करने के लिए है, जिसमें मॉडल को प्रशिक्षण के दौरान न देखे गए ऑब्जेक्ट्स वाली छवियों का वर्णन करने की आवश्यकता होती है। यह प्रशिक्षण वितरण से परे सामान्यीकरण का परीक्षण करता है।

NoCaps (नोवेल ऑब्जेक्ट कैप्शनिंग एट स्केल) एक बेंचमार्क डेटासेट और मूल्यांकन प्रोटोकॉल है, जिसे छवि कैप्शनिंग सिस्टम की उन वस्तुओं को शामिल करने वाली छवियों का वर्णन करने की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है जो उनके प्रशिक्षण डेटा में मौजूद नहीं थीं। 2019 में ऑस्टिन में टेक्सास विश्वविद्यालय के शोधकर्ताओं और अन्य लोगों द्वारा पेश किया गया, यह मानक कैप्शनिंग बेंचमार्क में एक महत्वपूर्ण सीमा को संबोधित करता है: मॉडल अक्सर प्रशिक्षण के दौरान देखे गए सीमित ऑब्जेक्ट शब्दावली के लिए अति-अनुकूलित हो जाते हैं और दृश्य अवधारणाओं की लंबी पूंछ को सामान्यीकृत करने में विफल रहते हैं। NoCaps इस सामान्यीकरण क्षमता को मापने के लिए एक नियंत्रित सेटिंग प्रदान करता है, जो Open Images डेटासेट की छवियों और व्यापक रूप से उपयोग किए जाने वाले COCO डेटासेट से असंबद्ध वस्तु श्रेणियों के एक बड़े सेट का उपयोग करता है।

बेंचमार्क में 15,000 से अधिक छवियां शामिल हैं, जिनमें से प्रत्येक को कई मानव-लिखित संदर्भ कैप्शन के साथ जोड़ा गया है। छवियों को उनमें मौजूद नई वस्तुओं की संख्या के आधार पर तीन मूल्यांकन उपसमूहों में विभाजित किया गया है: इन-डोमेन (कोई नई वस्तु नहीं), नियर-डोमेन (कुछ नई वस्तुएं), और ओपन-डोमेन (कई नई वस्तुएं)। यह स्तरीय संरचना शोधकर्ताओं को दृश्य सामग्री की नवीनता और जटिलता बढ़ने पर प्रदर्शन में गिरावट का विश्लेषण करने की अनुमति देती है। प्राथमिक मूल्यांकन मीट्रिक CIDEr है, जो कैप्शनिंग के लिए एक मानक मीट्रिक है जो उत्पन्न और संदर्भ कैप्शन के बीच सहमति को मापता है, हालांकि BLEU, METEOR और SPICE जैसे अन्य मीट्रिक भी रिपोर्ट किए जाते हैं।

प्रेरणा और चुनौतियाँ

COCO जैसे पारंपरिक कैप्शनिंग डेटासेट में केवल 80 ऑब्जेक्ट श्रेणियां होती हैं, जो दृश्य दुनिया का एक छोटा सा अंश है। ऐसे डेटासेट पर प्रशिक्षित मॉडल लगातार ऑब्जेक्ट सह-घटनाओं को याद करते हैं और अपरिचित संयोजनों या पूरी तरह से नई वस्तुओं का सामना करने पर विफल हो जाते हैं। NoCaps को क्षेत्र को अधिक मजबूत और सामान्यीकरण योग्य कैप्शनिंग सिस्टम की ओर धकेलने के लिए बनाया गया था। मुख्य चुनौती यह है कि एक मॉडल को न केवल नई वस्तुओं को पहचानना चाहिए (एक दृश्य धारणा समस्या) बल्कि उनका वर्णन करने के लिए धाराप्रवाह और संदर्भ-उपयुक्त भाषा भी उत्पन्न करनी चाहिए, अक्सर उन शब्दों का उपयोग करते हुए जो उसने प्रशिक्षण के दौरान उन दृश्य इनपुट के साथ कभी नहीं देखे हैं।

निर्माण और एनोटेशन

NoCaps की छवियां Open Images डेटासेट से ली गई हैं, जिसमें विविध वस्तु एनोटेशन के साथ लाखों छवियां हैं। निर्माताओं ने छवियों का एक उपसमूह चुना और तीन कठिनाई स्तरों में संतुलित वितरण सुनिश्चित करने के लिए उन्हें फ़िल्टर किया। उन्होंने Open Images से 500 ऑब्जेक्ट श्रेणियों की एक शब्दावली का उपयोग किया, जिनमें से 200 को COCO की 80 श्रेणियों के सापेक्ष नया माना जाता है। Amazon Mechanical Turk पर मानव एनोटेटरों ने प्रति छवि पांच संदर्भ कैप्शन लिखे, जो प्राकृतिक, वर्णनात्मक वाक्यों को प्रोत्साहित करने वाले दिशानिर्देशों का पालन करते थे। एनोटेशन प्रक्रिया में सटीकता और विविधता सुनिश्चित करने के लिए गुणवत्ता नियंत्रण उपाय शामिल थे।

मूल्यांकन प्रोटोकॉल

NoCaps पर एक मॉडल का मूल्यांकन करने के लिए, एक सिस्टम परीक्षण सेट में प्रत्येक छवि के लिए एक कैप्शन उत्पन्न करता है। उत्पन्न कैप्शन की तुलना मानव संदर्भों के साथ CIDEr का उपयोग करके की जाती है, जो उम्मीदवार और संदर्भ n-ग्राम वैक्टर के बीच औसत कोसाइन समानता की गणना करता है, जो टर्म फ्रीक्वेंसी-इनवर्स डॉक्यूमेंट फ्रीक्वेंसी द्वारा भारित होता है। बेंचमार्क विकास के लिए एक सार्वजनिक सत्यापन सेट और अंतिम मूल्यांकन के लिए एक छिपा हुआ परीक्षण सेट प्रदान करता है, जिसमें परिणाम आधिकारिक लीडरबोर्ड पर रिपोर्ट किए जाते हैं। यह सेटअप शास्त्रीय Sequence-to-Sequence (Seq2Seq) मॉडल से लेकर आधुनिक Transformer (architecture)-आधारित आर्किटेक्चर तक विभिन्न दृष्टिकोणों में निष्पक्ष तुलना को प्रोत्साहित करता है।

प्रभाव और उपयोग

NoCaps Machine learning और computer vision समुदायों में एक मानक बेंचमार्क बन गया है, विशेष रूप से छवि कैप्शनिंग मॉडल की सामान्यीकरण क्षमताओं का मूल्यांकन करने के लिए। इसका उपयोग Data Augmentation, Curriculum Learning, और Large language model जैसे बाहरी ज्ञान स्रोतों के समावेश जैसी तकनीकों की प्रभावशीलता प्रदर्शित करने के लिए किया गया है। उदाहरण के लिए, कुछ दृष्टिकोण नई वस्तुओं की पहचान करने के लिए एक पूर्व-प्रशिक्षित ऑब्जेक्ट डिटेक्टर का उपयोग करते हैं और फिर पहचाने गए लेबल पर एक भाषा मॉडल को सशर्त बनाते हैं, जबकि अन्य दृश्य और पाठ्य सुविधाओं को अधिक प्रभावी ढंग से संरेखित करने के लिए Cross-Attention तंत्र का उपयोग करते हैं। बेंचमार्क ने प्रशिक्षण डेटा और मॉडल क्षमता को स्केल करने के महत्व को भी उजागर किया है, क्योंकि विशाल डेटासेट पर प्रशिक्षित बड़े Neural network ओपन-डोमेन उपसमूह पर बेहतर प्रदर्शन करते हैं।

सीमाएं और आलोचनाएं

अपने प्रभाव के बावजूद, NoCaps की कुछ सीमाएं हैं। बेंचमार्क नई वस्तुओं के एक निश्चित सेट पर निर्भर करता है, जो वास्तविक दुनिया की नवीनता की खुली प्रकृति को पूरी तरह से पकड़ नहीं सकता है। मूल्यांकन मीट्रिक CIDEr शैली और लंबाई के प्रति संवेदनशील होने के लिए जाना जाता है, और यह शब्दार्थ सटीकता को पूरी तरह से प्रतिबिंबित नहीं कर सकता है। इसके अतिरिक्त, मानव संदर्भ, हालांकि उच्च गुणवत्ता वाले हैं, संख्या में सीमित हैं और किसी छवि का वर्णन करने के सभी वैध तरीकों को कवर नहीं कर सकते हैं। कुछ शोधकर्ताओं ने तर्क दिया है कि बेंचमार्क का ऑब्जेक्ट-स्तरीय नवीनता पर ध्यान सामान्यीकरण के अन्य पहलुओं, जैसे नए संबंधों या विशेषताओं, को प्रभावित करता है। फिर भी, NoCaps मजबूत छवि कैप्शनिंग में प्रगति को ट्रैक करने के लिए एक मूल्यवान उपकरण बना हुआ है।

भविष्य की दिशाएं

जैसे-जैसे क्षेत्र अधिक सक्षम Generative AI प्रणालियों की ओर बढ़ता है, NoCaps को रचनात्मक सामान्यीकरण, शून्य-शॉट सीखने और उपयोगकर्ता निर्देशों के साथ बातचीत का परीक्षण करने वाले बेंचमार्क द्वारा विस्तारित या पूरक होने की संभावना है। Large language model का डिकोडर के रूप में एकीकरण, अक्सर विज़न-लैंग्वेज मॉडल के साथ संयुक्त, व्यापक विश्व ज्ञान का लाभ उठाकर नई वस्तुओं को संभालने में पहले से ही वादा दिखा चुका है। भविष्य का काम गतिशील बेंचमार्क की खोज भी कर सकता है जो एक मॉडल के प्रशिक्षण डेटा के अनुकूल होते हैं, यह सुनिश्चित करते हुए कि नवीनता हमेशा वास्तव में नई हो। NoCaps ने सामान्यीकरण के कठोर मूल्यांकन के लिए एक मिसाल कायम की है, और इसके सिद्धांत मल्टीमॉडल AI में भविष्य के बेंचमार्क के डिजाइन को प्रभावित करने की संभावना रखते हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·natural-language-processing·benchmark·image-captioning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास