COCO कैप्शनिंग कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में एक बेंचमार्क कार्य है, जिसमें एक मॉडल को माइक्रोसॉफ्ट कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट (COCO) डेटासेट से एक छवि प्राप्त होती है और उसे उसकी सामग्री का वर्णन करने वाला एक प्राकृतिक-भाषा वाक्य उत्पन्न करना होता है। यह कार्य 2015 में COCO डेटासेट के साथ पेश किया गया था, ताकि यह मूल्यांकन किया जा सके कि एल्गोरिदम दृश्य समझ और भाषा निर्माण के बीच कितनी अच्छी तरह से सेतु बना सकते हैं। यह Artificial intelligence और Machine learning में आधुनिक मल्टीमॉडल सिस्टम के विकास को प्रभावित करते हुए, विज़न-भाषा मॉडल के लिए एक मानक परीक्षण मंच बन गया है।
COCO डेटासेट में 330,000 से अधिक छवियां हैं, जिनमें 2.5 मिलियन से अधिक लेबल किए गए उदाहरण हैं, और कैप्शनिंग कार्य के लिए, प्रत्येक छवि को पांच स्वतंत्र मानव-लिखित कैप्शन के साथ जोड़ा जाता है। बेंचमार्क छवियों को प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित करता है, जिसमें आधिकारिक मूल्यांकन एक होल्ड-आउट परीक्षण सेट का उपयोग करता है जो ओवरफिटिंग को रोकने के लिए सार्वजनिक रूप से जारी नहीं किया जाता है। मॉडल को स्वचालित मेट्रिक्स का उपयोग करके पांच संदर्भ कैप्शन के खिलाफ उत्पन्न कैप्शन की तुलना करके स्कोर किया जाता है, और अंतिम मूल्यांकन के लिए कभी-कभी मानव मूल्यांकन का उपयोग किया जाता है।
मूल्यांकन मेट्रिक्स
COCO कैप्शनिंग कई स्वचालित मेट्रिक्स पर निर्भर करता है जो उत्पन्न कैप्शन और मानव संदर्भों के बीच ओवरलैप और समानता को मापते हैं। सबसे आम तौर पर रिपोर्ट किए जाने वाले मेट्रिक्स BLEU, METEOR और CIDEr हैं, जिनमें बाद में अर्थ संबंधी समानता को पकड़ने के लिए SPICE जोड़ा गया। BLEU (द्विभाषी मूल्यांकन अंडरस्टडी) संक्षिप्तता दंड के साथ एन-ग्राम परिशुद्धता की गणना करता है, जबकि METEOR शब्दों को संरेखित करता है और समानार्थक शब्द और स्टेमिंग पर विचार करता है। CIDEr (सर्वसम्मति-आधारित छवि विवरण मूल्यांकन) डेटासेट में उनकी आवृत्ति के आधार पर एन-ग्राम को भारित करता है, जिससे सूचनात्मक और विशिष्ट वाक्यांशों को उच्च स्कोर मिलता है। SPICE (अर्थ संबंधी प्रस्तावात्मक छवि कैप्शन मूल्यांकन) कैप्शन को दृश्य ग्राफ़ में पार्स करता है और ऑब्जेक्ट, विशेषता और संबंध टुपल्स की तुलना करता है।
इन मेट्रिक्स की ज्ञात सीमाएं हैं, जैसे सामान्य विवरणों का पक्ष लेना और मानव निर्णय को पूरी तरह से पकड़ नहीं पाना। परिणामस्वरूप, अनुसंधान समुदाय ने मानव रेटिंग का भी उपयोग किया है, विशेष रूप से गुणात्मक विश्लेषण और समान स्वचालित स्कोर प्राप्त करने वाले मॉडल की तुलना करने के लिए। आधिकारिक COCO मूल्यांकन सर्वर परिणाम प्रस्तुत करने और लीडरबोर्ड के खिलाफ तुलना करने के लिए एक मानकीकृत मंच प्रदान करता है।
मॉडल आर्किटेक्चर
इस कार्य ने मॉडल आर्किटेक्चर के विकास को प्रारंभिक एनकोडर-डिकोडर ढांचे से आधुनिक ट्रांसफार्मर-आधारित सिस्टम तक प्रेरित किया है। प्रारंभिक दृष्टिकोणों ने एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) को छवि एनकोडर के रूप में उपयोग किया, आमतौर पर ResNet जैसे पूर्व-प्रशिक्षित Residual Network (ResNet) के बाद, शब्दों को अनुक्रमिक रूप से उत्पन्न करने के लिए एक आवर्तक तंत्रिका नेटवर्क (RNN) या लंबी अल्पकालिक स्मृति (LSTM) डिकोडर के बाद। इन मॉडलों को क्रॉस-एन्ट्रॉपी हानि का उपयोग करके अंत-से-अंत प्रशिक्षित किया गया था, अक्सर आउटपुट गुणवत्ता में सुधार के लिए अनुमान के दौरान Beam Search जैसी तकनीकों के साथ।
Transformer (architecture) आर्किटेक्चर के उदय के साथ, कैप्शनिंग मॉडल छवियों के लिए ट्रांसफार्मर एनकोडर और पाठ के लिए ट्रांसफार्मर डिकोडर का उपयोग करने के लिए स्थानांतरित हो गए। Encoder-Decoder Architecture ढांचा मानक बन गया, जिसमें छवि सुविधाओं को CNN से निकाला गया और फिर एक ट्रांसफार्मर डिकोडर द्वारा संसाधित किया गया जो Cross-Attention के माध्यम से उन सुविधाओं पर ध्यान केंद्रित करता है। हाल के मॉडलों ने Multi-Head Attention तंत्र और पूर्व-प्रशिक्षित विज़न-भाषा मॉडल को अपनाया है, जैसे कि Large language model बैकबोन पर आधारित, जो अधिक धाराप्रवाह और संदर्भ-समृद्ध कैप्शन उत्पन्न कर सकते हैं।
प्रशिक्षण और अनुकूलन
COCO कैप्शनिंग मॉडल को प्रशिक्षित करने में आमतौर पर उत्पन्न कैप्शन और संदर्भ कैप्शन के बीच क्रॉस-एन्ट्रॉपी हानि को कम करना शामिल होता है। कई मॉडल दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करते हैं: पहले, COCO प्रशिक्षण सेट पर पर्यवेक्षित शिक्षण, और दूसरा, सुदृढीकरण सीखने या अनुक्रम-स्तरीय उद्देश्यों के साथ अनुकूलन ताकि मूल्यांकन मीट्रिक में सीधे सुधार हो सके। Curriculum Learning और Data Augmentation जैसी तकनीकों को सामान्यीकरण में सुधार के लिए लागू किया गया है, जबकि Gradient Clipping और Batch Normalization स्थिर प्रशिक्षण के लिए आम हैं।
ऑप्टिमाइज़र और सीखने की दर अनुसूची का विकल्प प्रदर्शन को महत्वपूर्ण रूप से प्रभावित कर सकता है। एडम (देखें Adam (Optimizer)) और स्टोचैस्टिक ग्रेडिएंट डिसेंट के प्रकार (देखें Stochastic Gradient Descent Variants) जैसे मानक ऑप्टिमाइज़र व्यापक रूप से उपयोग किए जाते हैं, अक्सर Learning Rate Scheduling के साथ जो गर्म होता है और फिर क्षय होता है। अनुमान के दौरान, Beam Search, Top-K Sampling, और Top-P (Nucleus) Sampling जैसी डिकोडिंग रणनीतियों का उपयोग किया जाता है, जिसमें यादृच्छिकता को नियंत्रित करने के लिए तापमान स्केलिंग (देखें Temperature Scaling) शामिल है।
प्रभाव और विस्तार
COCO कैप्शनिंग का Generative AI और मल्टीमॉडल सीखने के क्षेत्र पर व्यापक प्रभाव पड़ा है। यह दृश्य प्रश्न उत्तर, छवि-पाठ पुनर्प्राप्ति, और पाठ-से-छवि निर्माण जैसे अधिक जटिल कार्यों के लिए एक आधार के रूप में कार्य किया है। बेंचमार्क ने बड़े पैमाने पर विज़न-भाषा प्रीट्रेनिंग के विकास को भी प्रभावित किया है, जहां मॉडल को विशाल छवि-पाठ जोड़े पर प्रशिक्षित किया जाता है और फिर COCO पर ठीक-ट्यून किया जाता है। Stanford AI Lab, BAIR (Berkeley AI Research), और MIT CSAIL जैसे संस्थानों के अनुसंधान समूहों ने प्रभावशाली तरीकों में योगदान दिया है, और OpenAI और Google DeepMind जैसी कंपनियों ने अपने मल्टीमॉडल सिस्टम में COCO-शैली डेटा का उपयोग किया है।
इस कार्य ने मशीन-जनित विवरणों के मूल्यांकन में चुनौतियों को भी उजागर किया है, जिससे अधिक मजबूत मेट्रिक्स और मानव-इन-द-लूप मूल्यांकन पर अनुसंधान हुआ है। 2020 के दशक की शुरुआत तक, अत्याधुनिक मॉडल कुछ मेट्रिक्स पर मानव प्रदर्शन के करीब स्कोर प्राप्त करते हैं, हालांकि वे अभी भी बारीक विवरण और दुर्लभ वस्तुओं के साथ संघर्ष करते हैं। COCO कैप्शनिंग विज़न-भाषा मॉडल की तुलना करने और धारणा और भाषा के प्रतिच्छेदन का अध्ययन करने के लिए एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बना हुआ है।