NYU Depth V2 एक बड़े पैमाने का RGB-D डेटासेट है, जिसे इनडोर दृश्य समझ के लिए 2012 में न्यूयॉर्क विश्वविद्यालय के शोधकर्ताओं द्वारा जारी किया गया था। इसमें Microsoft Kinect सेंसर से रिकॉर्ड किए गए वीडियो अनुक्रम शामिल हैं, जो रंग (RGB) छवियों और संरेखित गहराई मानचित्रों दोनों को कैप्चर करते हैं। यह डेटासेट एकल-दृश्य गहराई अनुमान, सिमेंटिक विभाजन और दृश्य पार्सिंग जैसे कार्यों के लिए एक मानक बेंचमार्क है, और यह इनडोर धारणा के लिए गहन-शिक्षण दृष्टिकोणों को आगे बढ़ाने में सहायक रहा है।
डेटासेट में RGB और गहराई छवियों के 1,449 घनी लेबल वाले जोड़े शामिल हैं, जहां प्रत्येक पिक्सेल को 894 वस्तु श्रेणियों में से एक के साथ एनोटेट किया गया है (बाद में सामान्य बेंचमार्क के लिए 40 वर्गों में समेकित)। इसके अतिरिक्त, यह 464 विविध इनडोर दृश्यों से 407,024 अलेबल फ्रेम प्रदान करता है, जिसमें बेडरूम, लिविंग रूम, कार्यालय और रसोई जैसे कमरे शामिल हैं। दृश्यों को पहले-व्यक्ति परिप्रेक्ष्य से कैप्चर किया गया था, जो एक व्यक्ति के स्थान में घूमने की नकल करता है, जिससे यह डेटा रोबोटिक्स और संवर्धित वास्तविकता अनुप्रयोगों के लिए विशेष रूप से प्रासंगिक बन जाता है।
अधिग्रहण और एनोटेशन
मूल NYU Depth डेटासेट (V1) 2011 में जारी किया गया था, लेकिन V2 ने दृश्यों की संख्या का विस्तार किया और एनोटेशन गुणवत्ता में सुधार किया। RGB-D डेटा को Kinect सेंसर का उपयोग करके रंग और गहराई दोनों स्ट्रीम के लिए 640x480 पिक्सेल के रिज़ॉल्यूशन पर रिकॉर्ड किया गया था। गहराई मानचित्रों को संरचित प्रकाश का उपयोग करके कैप्चर किया गया था, जो मिलीमीटर में मीट्रिक गहराई जानकारी प्रदान करता है। लेबल किए गए उपसमुच्चय बनाने के लिए, शोधकर्ताओं ने वीडियो अनुक्रमों से फ्रेम चुने और एक कस्टम टूल का उपयोग करके उन्हें मैन्युअल रूप से एनोटेट किया, प्रत्येक पिक्सेल को एक सिमेंटिक वर्ग के साथ लेबल किया। एनोटेशन प्रक्रिया में स्थिरता सुनिश्चित करने के लिए कई पास शामिल थे, और अंतिम लेबल मानव रेटर्स द्वारा सत्यापित किए गए थे।
बेंचमार्क कार्य
NYU Depth V2 मुख्य रूप से दो कार्यों के लिए उपयोग किया जाता है: गहराई अनुमान और सिमेंटिक विभाजन। गहराई अनुमान के लिए, मॉडल को एक एकल RGB छवि से घने गहराई मानचित्र की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, जिसमें मूल माध्य वर्ग त्रुटि (RMSE) और सापेक्ष त्रुटि जैसे मूल्यांकन मेट्रिक्स शामिल हैं। सिमेंटिक विभाजन के लिए, मॉडल प्रत्येक पिक्सेल को 40 वर्गों में से एक में वर्गीकृत करते हैं, जिसमें पिक्सेल सटीकता और माध्य प्रतिच्छेदन-ओवर-यूनियन (mIoU) जैसे मेट्रिक्स शामिल हैं। डेटासेट मल्टी-टास्क लर्निंग का भी समर्थन करता है, जहां एक मॉडल एक साथ गहराई और सिमेंटिक्स की भविष्यवाणी करता है, जो आधुनिक तंत्रिका-नेटवर्क आर्किटेक्चर में सामान्य है।
अनुसंधान पर प्रभाव
अपनी रिलीज़ के बाद से, NYU Depth V2 इनडोर दृश्य समझ के लिए एक आधारशिला रहा है। इसका उपयोग सैकड़ों पेपरों में किया गया है, जिसमें अवशिष्ट-नेटवर्क-आधारित एनकोडर पर प्रारंभिक कार्य और बाद में ट्रांसफॉर्मर-आधारित मॉडल शामिल हैं। डेटासेट के गहराई मानचित्रों का उपयोग 3D पुनर्निर्माण और दृश्य पूर्णता कार्यों के लिए भी किया गया है। इसकी लोकप्रियता यथार्थवादी इनडोर वातावरण और घने लेबल और बड़े अलेबल डेटा दोनों की उपलब्धता से उत्पन्न होती है, जो अर्ध-पर्यवेक्षित और स्व-पर्यवेक्षित शिक्षण तकनीकों को सक्षम बनाती है। शोधकर्ताओं ने डेटा-वृद्धि और कंट्रास्टिव लर्निंग के साथ मॉडलों को पूर्व-प्रशिक्षित करने के लिए अलेबल फ्रेम का भी उपयोग किया है।
सीमाएं और विस्तार
डेटासेट में ज्ञात सीमाएं हैं, जैसे गहराई मानचित्रों में सेंसर शोर, विशेष रूप से परावर्तक या अंधेरे सतहों पर, और आवासीय इंटीरियर की ओर पूर्वाग्रह। 40-वर्ग लेबल सेट मोटा है, जो कई सूक्ष्म-श्रेणी श्रेणियों को मिलाता है। इन मुद्दों को संबोधित करने के लिए, बेहतर लेबल के साथ NYU Depth V2 और सिंथेटिक डेटासेट जैसे विस्तार प्रस्तावित किए गए हैं। इन चुनौतियों के बावजूद, NYU Depth V2 इनडोर धारणा एल्गोरिदम की तुलना के लिए एक संदर्भ बिंदु बना हुआ है, और इसका प्रभाव रोबोटिक्स और अमेज़न-वेब-सेवाओं क्लाउड-आधारित विज़न सेवाओं में वाणिज्यिक अनुप्रयोगों तक फैला हुआ है।
यह भी देखें
- मशीन-लर्निंग
- कंप्यूटर-विज़न (सूची में नहीं, लेकिन संबंधित)
- यू-नेट
- बैच-सामान्यीकरण