NUS-WIDE एक बहु-लेबल छवि डेटासेट है, जो फोटो-साझाकरण मंच Flickr पर अपलोड की गई छवियों से निर्मित है। इसे 2009 में सिंगापुर के राष्ट्रीय विश्वविद्यालय के शोधकर्ताओं, जिनमें Tat-Seng Chua और उनके सहयोगी शामिल थे, द्वारा जारी किया गया था। यह डेटासेट छवि एनोटेशन, पुनर्प्राप्ति और बहु-लेबल वर्गीकरण में अनुसंधान का समर्थन करने के लिए डिज़ाइन किया गया था, जो विविध दृश्य सामग्री और संबद्ध पाठ्य मेटाडेटा के साथ एक बड़े पैमाने का, वास्तविक-विश्व संग्रह प्रदान करता है।
डेटासेट में 269,648 छवियाँ शामिल हैं, जिनमें से प्रत्येक को 81 अवधारणा लेबल (टैग) में से एक या अधिक के साथ एनोटेट किया गया है, जो रोज़मर्रा के दृश्यों और वस्तुओं की एक विस्तृत श्रृंखला को कवर करते हैं, जैसे 'आकाश', 'पानी', 'लोग', 'जानवर' और 'इमारतें'। ये लेबल उन टैगों से प्राप्त किए गए थे जो उपयोगकर्ताओं ने मूल रूप से Flickr पर अपनी तस्वीरों को सौंपे थे, लेकिन बाद में डेटासेट निर्माताओं द्वारा साफ और मानकीकृत किए गए। अवधारणा लेबल के अतिरिक्त, NUS-WIDE 500-आयामी SIFT डिस्क्रिप्टर पर आधारित बैग-ऑफ-वर्ड्स विशेषताएँ, 64-आयामी रंग हिस्टोग्राम, और 144-आयामी रंग कोरेलोग्राम, साथ ही 225-आयामी ब्लॉक-वार रंग क्षण प्रदान करता है। ये पूर्व-गणना की गई विशेषताएँ शोधकर्ताओं को कच्ची छवियों को संसाधित किए बिना एल्गोरिदम का बेंचमार्क करने की अनुमति देती हैं।
निर्माण और एनोटेशन
डेटासेट का निर्माण Flickr से बड़ी संख्या में छवियों को डाउनलोड करके किया गया था, जिन पर 81 पूर्व-परिभाषित अवधारणाओं के साथ टैग किया गया था। चयन प्रक्रिया ने अवधारणाओं के बीच संतुलित वितरण सुनिश्चित किया, प्रत्येक अवधारणा के लिए न्यूनतम संख्या में छवियाँ रखी गईं। ग्राउंड-ट्रुथ लेबल को मानव एनोटेटरों द्वारा मैन्युअल रूप से सत्यापित किया गया ताकि सटीकता सुनिश्चित हो सके, जो NUS-WIDE को उन डेटासेटों से अलग करता है जो केवल उपयोगकर्ता-जनित टैगों पर निर्भर करते हैं। अंतिम संग्रह में मूल छवियाँ और पूर्व-गणना की गई फीचर वेक्टर दोनों शामिल हैं, जिससे यह Machine learning कार्यों की एक विस्तृत श्रृंखला के लिए सुलभ है।
अनुसंधान में उपयोग
NUS-WIDE कंप्यूटर विज़न और Artificial intelligence के क्षेत्र में एक मानक बेंचमार्क बन गया है, विशेष रूप से बहु-लेबल वर्गीकरण और छवि पुनर्प्राप्ति से संबंधित कार्यों के लिए। शोधकर्ताओं ने स्वचालित छवि टैगिंग के तरीकों का मूल्यांकन करने के लिए इसका उपयोग किया है, जहाँ लक्ष्य किसी छवि के लिए प्रासंगिक लेबलों के एक सेट की भविष्यवाणी करना है। इसका उपयोग Data Augmentation और Deep learning आर्किटेक्चर, जैसे Residual Network (ResNet) और U-Net वेरिएंट पर अध्ययनों में भी किया गया है, हालाँकि बाद वाला विभाजन कार्यों में अधिक सामान्य है। डेटासेट की बहु-लेबल प्रकृति इसे उन एल्गोरिदम के लिए एक चुनौतीपूर्ण परीक्षण मैदान बनाती है जिन्हें अवधारणाओं के बीच सहसंबंधों को संभालना होता है, जैसे 'आकाश' अक्सर 'बादलों' के साथ सह-घटित होता है।
विशेषताएँ और बेसलाइन
प्रदान की गई फीचर सेट व्यापक प्रीप्रोसेसिंग के बिना त्वरित प्रयोग को सक्षम बनाती हैं। 500-आयामी बैग-ऑफ-वर्ड्स विशेषताएँ स्थानीय दृश्य पैटर्न को कैप्चर करती हैं, जबकि रंग हिस्टोग्राम और कोरेलोग्राम वैश्विक रंग जानकारी प्रदान करते हैं। कई प्रकाशित पेपर NUS-WIDE पर पारंपरिक तरीकों जैसे सपोर्ट वेक्टर मशीन और K-Nearest Neighbors, साथ ही अधिक हाल के Neural network दृष्टिकोणों का उपयोग करके बेसलाइन परिणाम रिपोर्ट करते हैं। डेटासेट में प्रशिक्षण और परीक्षण सेटों में एक विभाजन भी शामिल है, आमतौर पर प्रशिक्षण के लिए 161,789 छवियाँ और परीक्षण के लिए 107,859, हालाँकि कुछ अध्ययन विभिन्न विभाजनों का उपयोग करते हैं।
प्रभाव और विरासत
NUS-WIDE ने बाद के डेटासेटों, जैसे Microsoft COCO और Visual Genome, के विकास को प्रभावित किया है, जो समृद्ध एनोटेशन प्रदान करते हैं लेकिन पैमाने में छोटे हैं। वास्तविक-विश्व, उपयोगकर्ता-जनित सामग्री पर इसका जोर अधिक क्यूरेटेड डेटासेटों के विपरीत है, जिससे यह शोर और विविध दृश्य डेटा की चुनौतियों का अध्ययन करने के लिए मूल्यवान बनता है। 2020 के दशक की शुरुआत तक, यह व्यापक रूप से उद्धृत और शैक्षणिक अनुसंधान में उपयोग किया जाता रहा है, विशेष रूप से बहु-लेबल-सीखने और Transfer learning जैसे क्षेत्रों में। डेटासेट अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपलब्ध है, और इसकी आधिकारिक वेबसाइट दस्तावेज़ीकरण और डाउनलोड लिंक प्रदान करती है, हालाँकि मूल छवियाँ Flickr पर होस्ट की जाती हैं और उपलब्धता के अधीन हो सकती हैं।
सीमाएँ
NUS-WIDE की एक सीमा यह है कि इसके लेबल अपेक्षाकृत मोटे हैं, केवल 81 अवधारणाओं को कवर करते हैं, जो सूक्ष्म अंतरों को पकड़ नहीं सकते। इसके अतिरिक्त, पूर्व-गणना की गई विशेषताएँ SIFT जैसी पुरानी तकनीकों पर आधारित हैं, जिन्हें Deep learning मॉडलों से सीखे गए प्रतिनिधित्वों द्वारा प्रतिस्थापित किया गया है। शोधकर्ता अक्सर आधुनिक आर्किटेक्चर का उपयोग करके कच्ची छवियों से नई विशेषताएँ निकालते हैं, लेकिन इसके लिए अतिरिक्त भंडारण और गणना की आवश्यकता होती है। डेटासेट लेबल असंतुलन से भी ग्रस्त है, कुछ अवधारणाएँ दूसरों की तुलना में कहीं अधिक बार दिखाई देती हैं, जो मूल्यांकन मेट्रिक्स को पक्षपाती बना सकती हैं।
इन सीमाओं के बावजूद, NUS-WIDE बहु-लेबल छवि विश्लेषण के बेंचमार्किंग और समझ के लिए एक मूल्यवान संसाधन बना हुआ है। इसका पैमाना, वास्तविक-विश्व इमेजरी और बहु-लेबल एनोटेशन का संयोजन Machine learning अनुसंधान की एक विस्तृत श्रृंखला का समर्थन करना जारी रखता है, शास्त्रीय तरीकों से लेकर समकालीन Deep learning दृष्टिकोणों तक।