COCO 2014 (Common Objects in Context) माइक्रोसॉफ्ट COCO डेटासेट का प्रारंभिक सार्वजनिक संस्करण है, जो वस्तु पहचान, विभाजन और छवि कैप्शनिंग को आगे बढ़ाने के लिए डिज़ाइन की गई छवियों का एक बड़े पैमाने पर संग्रह है। इसे पहली बार 2014 के एक पेपर में त्सुंग-यी लिन, माइकल मायर, सर्ज बेलोंगी, जेम्स हेज़, पिएत्रो पेरोना, देवा रामानन, पियोट्र डॉलर और सी. लॉरेंस ज़िटनिक द्वारा प्रस्तुत किया गया था। इस डेटासेट में 328,000 छवियाँ शामिल हैं, जिनमें 80 वस्तु श्रेणियों में 2.5 मिलियन से अधिक लेबल किए गए उदाहरण हैं। इसकी परिभाषित विशेषता वस्तुओं के प्राकृतिक स्थानिक संबंधों के साथ रोज़मर्रा के दृश्यों पर जोर देना है, जो इमेजनेट जैसे पहले के डेटासेट के विपरीत है, जिनमें अक्सर केंद्रित, पृथक विषय होते थे।
2014 का संस्करण मानक प्रशिक्षण/सत्यापन (वैल) विभाजन स्थापित करता है जो बेंचमार्क परंपरा बन गए हैं। प्रशिक्षण सेट में 82,783 छवियाँ हैं, जबकि सत्यापन सेट में 40,504 छवियाँ हैं; मूल्यांकन के लिए 40,775 छवियों का एक अलग परीक्षण सेट उपयोग किया गया था, लेकिन ओवरफिटिंग को रोकने के लिए इसके लेबल कुछ समय के लिए छिपाए गए थे। एनोटेशन में प्रति-उदाहरण विभाजन बहुभुज (केवल बाउंडिंग बॉक्स नहीं), प्रति छवि पाँच प्राकृतिक-भाषा कैप्शन, और एक उपसमूह के लिए मानव मुद्रा अनुमान के लिए कीपॉइंट एनोटेशन शामिल हैं - विशेष रूप से, 5,000 प्रशिक्षण और 2,000 सत्यापन छवियों पर 17 शरीर जोड़। डेटासेट में संदर्भ के लिए छवि-स्तरीय दृश्य श्रेणियाँ और "स्टफ" श्रेणियाँ (जैसे, आकाश, घास) भी शामिल हैं, हालाँकि इन्हें बाद के संस्करणों में अधिक पूर्ण रूप से विकसित किया गया था।
एनोटेशन प्रारूप और चुनौतियाँ
COCO 2014 ने एक JSON-आधारित एनोटेशन प्रारूप पेश किया जो उद्योग मानक बन गया। प्रत्येक छवि खंडों से जुड़ी होती है, जो बहुभुज निर्देशांक की सरणियों के रूप में संग्रहीत होते हैं; उदाहरणों में चरम बिंदुओं से प्राप्त बाउंडिंग बॉक्स भी हो सकते हैं। वास्तविक-विश्व कठिनाई को दर्शाने के लिए, डेटासेट में जानबूझकर छोटी, अस्पष्ट और कटी-फटी वस्तुएँ शामिल हैं, जिनमें कुछ उदाहरणों पर "कठिन" फ़्लैग होता है जिसे कई पहचान चुनौतियों ने अनदेखा किया। आधिकारिक मूल्यांकन मेट्रिक्स - 0.5 से 0.95 तक 0.05 के चरणों में कई इंटरसेक्शन-ओवर-यूनियन (IoU) थ्रेसहोल्ड पर औसत परिशुद्धता (AP) - ने विधियों को सटीक मास्क और बॉक्स उत्पन्न करने के लिए प्रोत्साहित किया, जिससे क्षेत्र सरल मोटे स्थानीयकरण से आगे बढ़ गया।
कंप्यूटर विज़न अनुसंधान पर प्रभाव
COCO 2014 के संस्करण ने चुनौतियों की एक श्रृंखला को उत्प्रेरित किया, जिसकी शुरुआत 2015 में COCO डिटेक्शन चैलेंज से हुई, जो ICCV और CVPR जैसे प्रमुख सम्मेलनों के साथ चला। विजेता प्रणालियाँ तेजी से पारंपरिक हस्तनिर्मित विशेषताओं से कन्वोल्यूशनल न्यूरल नेटवर्क पर आधारित प्रारंभिक डीप लर्निंग मॉडल की ओर बढ़ीं। डेटासेट का पैमाना और एनोटेशन विवरण ने शोधकर्ताओं को विभाजन और मुद्रा अनुमान के लिए अवशिष्ट नेटवर्क और अन्य आर्किटेक्चर प्रशिक्षित करने की अनुमति दी, जिससे यह पैनोप्टिक विभाजन जैसे बाद के कार्यों के लिए एक आधारभूत संसाधन बन गया। इसके कैप्शन ने छवि कैप्शनिंग के लिए अनुक्रम-से-अनुक्रम मॉडल के विकास को भी बढ़ावा दिया, जो मल्टीमॉडल लर्निंग के उदय में सीधे योगदान देता है।
आधुनिक AI विकास में भूमिका
2020 के दशक तक, COCO 2014 कृत्रिम बुद्धिमत्ता में सबसे अधिक उद्धृत डेटासेट में से एक बना हुआ है। यह वस्तु पहचान में तंत्रिका नेटवर्क का मूल्यांकन करने के लिए एक सामान्य परीक्षण मंच के रूप में कार्य करता है, जिसमें Detectron2 और YOLO जैसे फ्रेमवर्क नियमित रूप से इसके मेट्रिक्स पर रिपोर्ट करते हैं। 2014 के विभाजन प्रतिलिपि प्रस्तुत करने योग्यता के लिए विशेष रूप से मूल्यवान हैं: बाद के COCO 2017 संस्करण के विपरीत, जिसने प्रशिक्षण/वैल विभाजन आकार बदल दिए और 118k/5k छवियों पर स्थानांतरित हो गया, 2014 संस्करण की सटीक संरचना व्यापक रूप से संग्रहीत और अध्ययन की गई है। कई मशीन लर्निंग चिकित्सक अभी भी मूल डाउनलोड करते हैं क्योंकि पूर्व-प्रशिक्षित मॉडल और कोडबेस अक्सर 2014 की निर्देशिका लेआउट और एनोटेशन आईडी की अपेक्षा करते हैं।
बाद के संस्करणों से अंतर
COCO 2014 कई तकनीकी तरीकों से 2017 संस्करण से अलग है। 2014 के प्रशिक्षण सेट में 82,783 छवियाँ शामिल हैं, जबकि 2017 के प्रशिक्षण में 118,287 हैं, और 2014 का वैल सेट (40,504) 2017 के (5,000) से बहुत बड़ा है। 2017 के परीक्षण सेट भी बड़े थे। इसके अलावा, 2014 के संस्करण में कोई आधिकारिक 'अनलेबल' उपसमूह नहीं था; 2017 ने अर्ध-पर्यवेक्षित लर्निंग के लिए 123,000 अनलेबल छवियाँ जोड़ीं। 2014 में कीपॉइंट एनोटेशन केवल कुछ हज़ार छवियों के लिए उपलब्ध हैं, जबकि 2017 ने सभी प्रशिक्षण और सत्यापन छवियों को कवर करने के लिए विस्तार किया। इन अंतरों का मतलब है कि 2014 डेटा का उपयोग करते समय समकालीन बेंचमार्क से परिणामों की तुलना करने में सावधानी बरतनी चाहिए, हालाँकि कई क्लासिक पेपर 2014 विभाजन पर रिपोर्ट करते थे, जो इसे ऐतिहासिक विश्लेषण के लिए प्रासंगिक बनाए रखता है।
विरासत और निरंतर उपयोग
COCO 2014 की सफलता ने समृद्ध रूप से एनोटेट, संदर्भ-भारी डेटासेट के मूल्य को प्रदर्शित किया, जिससे LVIS और Open Images जैसे बाद के प्रयासों को प्रभावित किया। इसकी एनोटेशन योजना COCO API जैसे आधुनिक उपकरणों में बनी हुई है, जो बहुभुज मास्क को पार्स करने और उदाहरण विभाजन का मूल्यांकन करने के लिए डिफ़ॉल्ट बनी हुई है। यहाँ तक कि जैसे-जैसे नए डेटासेट उभरते हैं, COCO 2014 का पैमाना, एनोटेशन गहराई और सार्वजनिक विभाजन स्थिरता का संयोजन एल्गोरिदम विकास के लिए एक "सैद्धांतिक मानक" के रूप में इसकी भूमिका सुनिश्चित करता है। जबकि क्षेत्र बड़े मल्टीमॉडल डेटासेट की ओर स्थानांतरित हो गया है, COCO 2014 अभी भी अनगिनत डॉक्टरेट शोध प्रबंधों और औद्योगिक मॉडल मूल्यांकन को रेखांकित करता है, जो विज़न अनुसंधान में इसकी स्थायी उपयोगिता की पुष्टि करता है।
यह भी देखें
- Data Augmentation - COCO छवियों पर प्रशिक्षण के दौरान अक्सर उपयोग की जाने वाली तकनीकें
- Loss Functions - पहचान और विभाजन हानियों में उपयोग किए जाने वाले फ़ंक्शन प्रकार
- AWS - COCO को होस्ट और प्रोसेस करने के लिए आमतौर पर उपयोग किए जाने वाले क्लाउड प्लेटफ़ॉर्म
- Stanford AI Lab - एक शोध समूह जिसने COCO-आधारित मूल्यांकन में योगदान दिया है