COCO Captions 2015 एक व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है जो छवि कैप्शनिंग के लिए है, जिसमें माइक्रोसॉफ्ट COCO (कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट) 2014 और 2015 संग्रहों में प्रत्येक छवि के लिए पांच स्वतंत्र मानव-लिखित विवरण शामिल हैं। यह डेटासेट कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में अनुसंधान का समर्थन करने के लिए पेश किया गया था, विशेष रूप से उन कार्यों के लिए जिनमें दृश्य सामग्री के प्राकृतिक भाषा विवरण उत्पन्न करने की आवश्यकता होती है। प्रत्येक कैप्शन एक पूर्ण वाक्य है जो संबंधित छवि में मौजूद वस्तुओं, क्रियाओं और संबंधों का वर्णन करता है, जो संरेखित दृष्टि-भाषा डेटा का एक समृद्ध स्रोत प्रदान करता है।
कैप्शन अमेज़न मैकेनिकल टर्क के माध्यम से एकत्र किए गए थे, जिसमें कार्यकर्ताओं को एक ही वाक्य में छवि के सभी महत्वपूर्ण भागों का वर्णन करने का निर्देश दिया गया था। डेटासेट में 330,000 से अधिक छवियां शामिल हैं, जिनमें से प्रत्येक पांच कैप्शन के साथ जोड़ी गई है, जिससे 1.5 मिलियन से अधिक कैप्शन-छवि जोड़े बनते हैं। COCO Captions 2015 उन मॉडलों के लिए एक मानक मूल्यांकन सेट बन गया जो कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में गहन शिक्षण तकनीकों को जोड़ते हैं, अक्सर तंत्रिका नेटवर्क आर्किटेक्चर जैसे एनकोडर-डिकोडर मॉडल का उपयोग करते हैं। डेटासेट का डिज़ाइन वाक्यांश में विविधता को प्रोत्साहित करता है, क्योंकि विभिन्न एनोटेटर एक ही दृश्य का विभिन्न तरीकों से वर्णन करते हैं, जो एक मॉडल की धाराप्रवाह और शब्दार्थ रूप से सटीक पाठ उत्पन्न करने की क्षमता का परीक्षण करता है।
संरचना और आँकड़े
COCO Captions 2015 डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण विभाजनों में व्यवस्थित किया गया है, जिसमें परीक्षण विभाजन को आगे एक सार्वजनिक परीक्षण सेट और आधिकारिक मूल्यांकन के लिए उपयोग किए जाने वाले एक आरक्षित परीक्षण सेट में विभाजित किया गया है। प्रशिक्षण विभाजन में लगभग 82,783 छवियां हैं, सत्यापन विभाजन में 40,504 छवियां हैं, और परीक्षण विभाजन में 40,775 छवियां हैं। प्रत्येक छवि पांच कैप्शन से जुड़ी है, लेकिन परीक्षण सेट के कैप्शन सार्वजनिक रूप से जारी नहीं किए जाते हैं ताकि ओवरफिटिंग को रोका जा सके; इसके बजाय, शोधकर्ता एक मूल्यांकन सर्वर पर भविष्यवाणियां प्रस्तुत करते हैं। कैप्शन की लंबाई भिन्न होती है, आमतौर पर 8 से 25 शब्दों तक होती है, और इसमें लोगों, जानवरों, वाहनों और इनडोर/आउटडोर सेटिंग्स सहित दैनिक दृश्यों की एक विस्तृत श्रृंखला शामिल होती है।
मूल्यांकन मेट्रिक्स
COCO Captions 2015 के लिए मानक मूल्यांकन मेट्रिक्स में BLEU, METEOR, ROUGE-L और CIDEr शामिल हैं। CIDEr (सर्वसम्मति-आधारित छवि विवरण मूल्यांकन) विशेष रूप से छवि कैप्शनिंग के लिए डिज़ाइन किया गया था और TF-IDF भारित n-ग्राम ओवरलैप का उपयोग करके उत्पन्न कैप्शन और मानव संदर्भों के सेट के बीच सर्वसम्मति को मापता है। डेटासेट की आधिकारिक मूल्यांकन स्क्रिप्ट इन मेट्रिक्स की गणना आरक्षित परीक्षण सेट पर करती है, और लीडरबोर्ड अत्याधुनिक मॉडलों के प्रदर्शन को ट्रैक करते हैं। 2015 में, शीर्ष-प्रदर्शन प्रणालियों ने BLEU-4 स्कोर लगभग 0.30 और CIDEr स्कोर लगभग 1.0 प्राप्त किए, लेकिन ट्रांसफॉर्मर-आधारित आर्किटेक्चर और बड़े भाषा मॉडल प्रीट्रेनिंग में बाद की प्रगति ने इन संख्याओं में काफी सुधार किया है।
मॉडल विकास में भूमिका
COCO Captions 2015 आधुनिक छवि कैप्शनिंग प्रणालियों के विकास में सहायक रहा है। प्रारंभिक दृष्टिकोणों ने दृश्य विशेषता निष्कर्षण के लिए अवशिष्ट नेटवर्क या यू-नेट बैकबोन का उपयोग किया, साथ ही पाठ उत्पादन के लिए आवर्ती तंत्रिका नेटवर्क का उपयोग किया। बाद में, मल्टी-हेड अटेंशन और क्रॉस-अटेंशन तंत्र, जैसा कि ट्रांसफॉर्मर आर्किेक्चर में पेश किया गया था, ने आवर्ती घटकों को बदल दिया, जिससे अधिक कुशल समानांतर प्रशिक्षण संभव हुआ। डेटासेट ने डेटा संवर्धन और पाठ्यक्रम शिक्षण में अनुसंधान की सुविधा भी दी, साथ ही बीम-सर्च और टॉप-पी सैंपलिंग डिकोडिंग रणनीतियों के उपयोग को भी बढ़ावा दिया। कई जनरेटिव एआई मॉडल, जिनमें ओपनएआई और गूगल-डीपमाइंड के मॉडल शामिल हैं, ने COCO Captions 2015 को प्रीट्रेनिंग या मूल्यांकन बेंचमार्क के रूप में उपयोग किया है, हालांकि फ्लिकर30k और विज़ुअल-जीनोम जैसे नए डेटासेट उभरे हैं।
सीमाएँ और विरासत
डेटासेट में ज्ञात सीमाएँ हैं, जिनमें सामान्य वस्तुओं और सरल वाक्य संरचनाओं के प्रति पूर्वाग्रह, साथ ही क्राउड वर्कर्स से संभावित एनोटेशन शोर शामिल हैं। इसमें सूक्ष्म स्थानिक संबंधों और रचनात्मक तर्क चुनौतियों का भी अभाव है जो हाल के बेंचमार्क में दिखाई देते हैं। इन मुद्दों के बावजूद, COCO Captions 2015 छवि कैप्शनिंग विधियों की तुलना करने और दृष्टि-भाषा संरेखण का अध्ययन करने के लिए एक मौलिक संसाधन बना हुआ है। इसकी प्रति-छवि पांच-कैप्शन डिज़ाइन ने बाद के डेटासेट को प्रभावित किया है, और इसकी मूल्यांकन प्रोटोकॉल अकादमिक अनुसंधान में उपयोग जारी है। डेटासेट शैक्षणिक उपयोग के लिए स्वतंत्र रूप से उपलब्ध है, और इसके एनोटेशन साहित्य में व्यापक रूप से उद्धृत हैं।
संबंधित बेंचमार्क और विस्तार
COCO Captions 2015 के विस्तार में COCO-CN शामिल है, जो चीनी कैप्शन जोड़ता है, और nocaps, जो नई वस्तु कैप्शनिंग पर केंद्रित है। डेटासेट COCO डिटेक्शन और सेगमेंटेशन कार्यों के साथ भी ओवरलैप करता है, जिससे मल्टी-टास्क लर्निंग संभव होती है। शोधकर्ता अक्सर सामान्यीकरण में सुधार के लिए COCO Captions 2015 को अन्य डेटासेट के साथ जोड़ते हैं, और यह दृष्टि-भाषा कार्यों में अनुक्रम-से-अनुक्रम मॉडल के परीक्षण के लिए एक सामान्य विकल्प बना हुआ है। डेटासेट का प्रभाव अमेज़न वेब सर्विसेज और गूगल क्लाउड पेशकशों तक फैला हुआ है, जो क्लाउड-आधारित मॉडल प्रशिक्षण के लिए पूर्व-संसाधित संस्करण प्रदान करते हैं।