MS COCO Captions एक बड़े पैमाने का डेटासेट है जिसमें मानव-लिखित वाक्य शामिल हैं जो Microsoft Common Objects in Context (COCO) संग्रह की छवियों का वर्णन करते हैं। यह 330,000 से अधिक छवियों में से प्रत्येक के लिए पांच स्वतंत्र कैप्शन प्रदान करता है, जिससे यह कृत्रिम बुद्धिमत्ता अनुसंधान में दृष्टि-भाषा समझ के लिए एक मानक बेंचमार्क बन जाता है।
डेटासेट को छवि कैप्शनिंग के कार्य का समर्थन करने के लिए बनाया गया था, जहां एक मॉडल को छवि का प्राकृतिक भाषा विवरण उत्पन्न करना होता है। इसका पैमाना, विविधता, और एनोटेशन गुणवत्ता इसे मशीन लर्निंग और डीप लर्निंग में एक मूलभूत संसाधन बनाती है।
इतिहास और निर्माण
Microsoft COCO डेटासेट पहली बार 2014 में वस्तु पहचान और दृश्य समझ को आगे बढ़ाने के प्रयास के हिस्से के रूप में जारी किया गया था। कैप्शन एनोटेशन Amazon Mechanical Turk के माध्यम से एकत्र किए गए थे, जिसमें कार्यकर्ताओं से प्रत्येक छवि में महत्वपूर्ण वस्तुओं, क्रियाओं, और संबंधों का वर्णन करने के लिए कहा गया था। 2015 में, Xinlei Chen और सहयोगियों के एक साथी पेपर ने संग्रह पद्धति का विवरण दिया और एक मूल्यांकन सर्वर पेश किया। अंतिम डेटासेट में 328,000 छवियां हैं, प्रत्येक में पांच कैप्शन हैं, जो कुल मिलाकर लगभग 1.5 मिलियन वाक्य बनाते हैं।
डेटासेट आँकड़े और संरचना
प्रत्येक कैप्शन एक अंग्रेजी वाक्य है, आमतौर पर 10 से 12 शब्द लंबा, और पूर्ण शब्दावली लगभग 10,000 शब्दों तक फैली हुई है। छवियां 80 वस्तु श्रेणियों को कवर करती हैं और कई परस्पर क्रिया करने वाली वस्तुओं के साथ जटिल दृश्य शामिल करती हैं। डेटासेट को प्रशिक्षण, सत्यापन, और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण कैप्शन मूल्यांकन के लिए रोके रखे जाते हैं। मूल 2014 विभाजन में 82,783 प्रशिक्षण छवियां, 40,504 सत्यापन छवियां, और 40,775 परीक्षण छवियां शामिल हैं। यह संरचना तंत्रिका नेटवर्क मॉडल के पुनरुत्पादनीय बेंचमार्किंग का समर्थन करती है।
मूल्यांकन और बेंचमार्क
MS COCO Captions छवि कैप्शनिंग कार्य के लिए प्राथमिक बेंचमार्क है। BLEU, METEOR, ROUGE, CIDEr, और SPICE जैसे स्वचालित मेट्रिक्स का उपयोग मॉडल आउटपुट की तुलना पांच संदर्भ कैप्शन से करने के लिए किया जाता है। COCO परियोजना द्वारा होस्ट किया गया मूल्यांकन सर्वर शोधकर्ताओं को रोके गए परीक्षण सेट के लिए परिणाम प्रस्तुत करने की अनुमति देता है। प्रारंभिक अत्याधुनिक सिस्टम ने एनकोडर-डिकोडर आर्किटेक्चर का उपयोग अनुक्रम-से-अनुक्रम सीखने के साथ किया। बाद की प्रगति में ट्रांसफॉर्मर मॉडल और मल्टी-हेड अटेंशन तंत्र शामिल किए गए, जो अक्सर बड़े भाषा मॉडल से आरंभ किए जाते हैं। ये मॉडल अक्सर दृश्य विशेषताओं को पाठ के साथ संरेखित करने के लिए क्रॉस-अटेंशन परतों का उपयोग करते हैं, और डिकोडिंग आमतौर पर सुगम कैप्शन उत्पन्न करने के लिए बीम-सर्च पर निर्भर करती है।
प्रभाव और अनुप्रयोग
डेटासेट ने दृष्टि-भाषा कार्यों के लिए जनरेटिव एआई में प्रगति को बढ़ावा दिया है। इसका उपयोग स्वचालित alt-text पीढ़ी, छवि पुनर्प्राप्ति, और दृश्य प्रश्न उत्तर देने के लिए मॉडल प्रशिक्षित करने में किया जाता है। एनोटेशन को वस्तु पहचान और विभाजन जैसे अन्य कंप्यूटर दृष्टि कार्यों में डेटा संवर्धन के लिए भी अनुकूलित किया गया है। शोधकर्ताओं ने MS COCO Captions का उपयोग संरचनागत सामान्यीकरण, क्रॉस-मोडल संरेखण, और डीप-लर्निंग सिस्टम की मजबूती का अध्ययन करने के लिए किया है।
सीमाएँ और विस्तार
अपनी सफलता के बावजूद, MS COCO Captions में ज्ञात सीमाएँ हैं। छवियां मुख्य रूप से पश्चिमी संदर्भों से रोजमर्रा के दृश्यों को दर्शाती हैं, और कैप्शन सांस्कृतिक पूर्वाग्रहों को प्रतिबिंबित कर सकते हैं। शब्दावली अपेक्षाकृत छोटी है, और वाक्य सामान्य मानव विवरणों से छोटे हैं। इन मुद्दों को संबोधित करने के लिए, शोधकर्ताओं ने चीनी कैप्शन के लिए COCO-CN और खुले-शब्दावली कैप्शनिंग के लिए nocaps डेटासेट जैसे विस्तार बनाए हैं। ये प्रयास कृत्रिम बुद्धिमत्ता में नए बेंचमार्क के डिजाइन को प्रभावित करना जारी रखते हैं।