ADE20K दृश्य पार्सिंग के लिए एक बड़े पैमाने का डेटासेट है, जो एक कंप्यूटर विज़न कार्य है जिसमें छवि के हर पिक्सेल को एक शब्दार्थ श्रेणी, जैसे 'व्यक्ति', 'कार', 'दीवार' या 'आकाश' के साथ लेबल करना शामिल है। 2016 में MIT कंप्यूटर विज्ञान और कृत्रिम बुद्धिमत्ता प्रयोगशाला के शोधकर्ताओं द्वारा जारी किया गया, यह डेटासेट पहले के डेटासेट की सीमाओं को संबोधित करने के लिए बनाया गया था जो कम वस्तु श्रेणियों को कवर करते थे या मोटे एनोटेशन प्रदान करते थे। ADE20K में प्रशिक्षण के लिए 20,000 से अधिक छवियाँ और सत्यापन के लिए 2,000 छवियाँ शामिल हैं, साथ ही बेंचमार्क मूल्यांकन के लिए एक अतिरिक्त परीक्षण सेट भी है। छवियाँ वास्तविक दुनिया के दृश्यों की एक विविध श्रेणी से ली गई हैं, जिसमें रसोई और बैठक कक्ष जैसे इनडोर वातावरण, साथ ही सड़कों, पार्कों और समुद्र तटों जैसे बाहरी सेटिंग्स शामिल हैं।
डेटासेट 150 शब्दार्थ श्रेणियों के लिए घने, पिक्सेल-स्तरीय एनोटेशन प्रदान करता है, जिसमें 'स्टफ' वर्ग (जैसे, आकाश, सड़क, घास) और 'थिंग' वर्ग (जैसे, व्यक्ति, कुर्सी, कुत्ता) दोनों शामिल हैं। एनोटेशन मानव एनोटेटरों द्वारा एक विस्तृत लेबलिंग प्रोटोकॉल का उपयोग करके बनाए गए थे, और प्रत्येक छवि में एक ही श्रेणी के कई उदाहरण हो सकते हैं, जिससे इंस्टेंस-स्तरीय विभाजन भी संभव होता है। ADE20K में कुछ वस्तुओं के लिए अतिरिक्त विशेषताएँ भी शामिल हैं, जैसे अवरोध और गहराई क्रम, जो अधिक उन्नत दृश्य समझ कार्यों का समर्थन करते हैं। डेटासेट अक्सर शब्दार्थ विभाजन, इंस्टेंस विभाजन और दृश्य पार्सिंग के लिए एक मानक बेंचमार्क के रूप में उपयोग किया जाता है, और इसे प्रमुख कंप्यूटर विज़न चुनौतियों में शामिल किया गया है, जिसमें एआई समुदाय की वार्षिक मान्यता प्रतियोगिताएँ शामिल हैं।
निर्माण और एनोटेशन
ADE20K डेटासेट लेबलमे डेटासेट और अन्य सार्वजनिक छवि भंडारों से प्राप्त छवियों के संग्रह से बनाया गया था। एनोटेशन प्रक्रिया में प्रशिक्षित एनोटेटरों की एक टीम शामिल थी जिन्होंने प्रत्येक वस्तु के चारों ओर बहुभुज सीमाएँ खींचने और एक शब्दार्थ लेबल निर्दिष्ट करने के लिए एक कस्टम वेब-आधारित टूल का उपयोग किया। स्थिरता सुनिश्चित करने के लिए, डेटासेट में एक विस्तृत एनोटेशन दिशानिर्देश शामिल है जो 150 श्रेणियों में से प्रत्येक को परिभाषित करता है, जिसमें अस्पष्ट मामले और किनारे की स्थितियाँ शामिल हैं। एनोटेशन प्रयास के परिणामस्वरूप प्रशिक्षण और सत्यापन सेटों में 500,000 से अधिक लेबल किए गए वस्तु उदाहरण प्राप्त हुए। डेटासेट को शैक्षणिक अनुसंधान के लिए एक अनुमोदक लाइसेंस के तहत जारी किया गया था, और तब से इसे कंप्यूटर विज़न समुदाय द्वारा व्यापक रूप से अपनाया गया है।
दृश्य पार्सिंग अनुसंधान में भूमिका
दृश्य पार्सिंग कंप्यूटर विज़न में एक मौलिक समस्या है जिसके लिए केवल व्यक्तिगत वस्तुओं का पता लगाने के बजाय छवि के पूर्ण संदर्भ को समझने की आवश्यकता होती है। ADE20K को सामान्य वस्तुओं और पृष्ठभूमि तत्वों दोनों को कवर करने वाली श्रेणियों का एक समृद्ध सेट प्रदान करके इस लक्ष्य का समर्थन करने के लिए डिज़ाइन किया गया था। डेटासेट का उपयोग प्रारंभिक पूर्ण रूप से संयोजित नेटवर्क से लेकर आधुनिक ट्रांसफॉर्मर-आधारित आर्किटेक्चर तक मॉडलों की एक विस्तृत श्रृंखला को प्रशिक्षित और मूल्यांकन करने के लिए किया गया है। उदाहरण के लिए, 2021 में पेश किया गया सेगफॉर्मर मॉडल, ADE20K पर अत्याधुनिक प्रदर्शन की रिपोर्ट करता है, जो सत्यापन सेट पर 51% से अधिक का औसत प्रतिच्छेदन-ओवर-यूनियन (mIoU) स्कोर प्राप्त करता है। डेटासेट का उपयोग डोमेन अनुकूलन, कुछ-शॉट सीखने और खुले-शब्दावली विभाजन का अध्ययन करने के लिए भी किया गया है, जहाँ मॉडलों को प्रशिक्षण के दौरान नहीं देखी गई वस्तुओं को विभाजित करने की आवश्यकता होती है।
कंप्यूटर विज़न पर प्रभाव
ADE20K सिटीस्केप्स और COCO जैसे अन्य डेटासेट के साथ, दृश्य पार्सिंग एल्गोरिदम का मूल्यांकन करने के लिए एक वास्तविक मानक बन गया है। इसकी बड़ी संख्या में श्रेणियाँ और विविध दृश्य प्रकार इसे एक चुनौतीपूर्ण बेंचमार्क बनाते हैं जो मॉडल प्रदर्शन की सीमाओं को आगे बढ़ाता है। डेटासेट ने संबंधित संसाधनों के विकास को भी प्रभावित किया है, जैसे ADE20K प्लेसेस365 उपसमुच्चय, जो दृश्य वर्गीकरण पर केंद्रित है, और MIT दृश्य पार्सिंग बेंचमार्क, जो विभिन्न विधियों की तुलना के लिए एक लीडरबोर्ड प्रदान करता है। शोधकर्ताओं ने दृश्य संदर्भ और वस्तु पहचान के बीच संबंध का अध्ययन करने के लिए ADE20K का उपयोग किया है, जिससे अंतर्दृष्टि प्राप्त हुई है कि मॉडल स्थानीय भविष्यवाणियों को बेहतर बनाने के लिए वैश्विक दृश्य जानकारी का लाभ कैसे उठा सकते हैं।
सीमाएँ और विस्तार
अपनी सफलता के बावजूद, ADE20K की सीमाएँ हैं। डेटासेट हाल के बड़े पैमाने के डेटासेट की तुलना में अपेक्षाकृत छोटा है, और इसकी श्रेणियाँ निश्चित हैं, जो नवीन वस्तु प्रकारों के सामान्यीकरण को सीमित कर सकती हैं। एनोटेशन गुणवत्ता, हालांकि उच्च है, फिर भी इसमें त्रुटियाँ हो सकती हैं, विशेष रूप से छोटी या भारी रूप से अवरुद्ध वस्तुओं के लिए। इन मुद्दों को संबोधित करने के लिए, शोधकर्ताओं ने ADE20K-फुल जैसे विस्तार प्रस्तावित किए हैं, जिसमें अतिरिक्त छवियाँ और श्रेणियाँ शामिल हैं, और ADE20K-आउटऑफकॉन्टेक्स्ट, जो असामान्य वस्तु प्लेसमेंट के लिए मॉडल मजबूती का परीक्षण करता है। डेटासेट का उपयोग मॉडलों के लिए एक प्रीट्रेनिंग स्रोत के रूप में भी किया गया है जिन्हें बाद में अन्य कार्यों पर ठीक-ट्यून किया जाता है, जो दृश्य पार्सिंग से परे इसकी उपयोगिता को प्रदर्शित करता है।
भविष्य की दिशाएँ
2020 के दशक के मध्य तक, ADE20K एक प्रासंगिक बेंचमार्क बना हुआ है, लेकिन क्षेत्र बड़े और अधिक विविध डेटासेट की ओर बढ़ रहा है, जैसे कि बड़े भाषा मॉडल और मल्टीमॉडल सिस्टम के प्रशिक्षण के लिए उपयोग किए जाने वाले। दृश्य पार्सिंग का अन्य कार्यों के साथ एकीकरण, जैसे गहन शिक्षण-आधारित छवि निर्माण और जनरेटिव एआई, ने दृश्य दृश्यों की मॉडल समझ का मूल्यांकन करने के लिए ADE20K को एक परीक्षण मंच के रूप में उपयोग करने के नए रास्ते खोले हैं। शैक्षणिक अनुसंधान और उद्योग अनुप्रयोगों में डेटासेट का निरंतर उपयोग कंप्यूटर विज़न के लिए एक मौलिक संसाधन के रूप में इसके महत्व को रेखांकित करता है।
यह भी देखें
संदर्भ
ADE20K डेटासेट को बोलेई झोउ एट अल. द्वारा 2017 में प्रकाशित पेपर 'सेमेंटिक अंडरस्टैंडिंग ऑफ सीन्स थ्रू द ADE20K डेटासेट' में पेश किया गया था। डेटासेट MIT CSAIL वेबसाइट से डाउनलोड के लिए उपलब्ध है, और इसका आधिकारिक दस्तावेज़ीकरण एनोटेशन दिशानिर्देशों और मूल्यांकन प्रोटोकॉल के बारे में विस्तृत जानकारी प्रदान करता है।