Places365 दृश्य पहचान के लिए एक बड़े पैमाने का डेटासेट है, जिसमें 365 अलग-अलग दृश्य श्रेणियों से 1.8 मिलियन से अधिक छवियाँ शामिल हैं। इसे 2016 में मैसाचुसेट्स इंस्टीट्यूट ऑफ टेक्नोलॉजी (MIT) के शोधकर्ताओं द्वारा पेश किया गया था, जिनमें बोलेई झोउ, आदित्य खोसला, ऑड ओलिवा और एंटोनियो टोराल्बा शामिल थे। यह डेटासेट कंप्यूटर विज़न के क्षेत्र को आगे बढ़ाने के लिए डिज़ाइन किया गया है, विशेष रूप से दृश्य समझ के क्षेत्र में, जिसमें उस संदर्भ या वातावरण की पहचान करना शामिल है जिसमें एक छवि कैप्चर की गई थी। Places365 दृश्य वर्गीकरण कार्यों पर डीप लर्निंग मॉडल के प्रदर्शन का मूल्यांकन करने के लिए एक मानक बेंचमार्क बन गया है, जो ImageNet जैसे वस्तु-केंद्रित डेटासेट का पूरक है।
डेटासेट को दो संस्करणों में व्यवस्थित किया गया है: Places365-Standard और Places365-Challenge। Places365-Standard में लगभग 1.8 मिलियन प्रशिक्षण छवियाँ हैं, जिनमें प्रत्येक श्रेणी में 3,000 से 5,000 छवियाँ हैं। Places365-Challenge एक बड़ा संस्करण है जिसमें 8 मिलियन से अधिक प्रशिक्षण छवियाँ हैं, जिसका उपयोग 2016 में कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में आयोजित Places Challenge प्रतियोगिता के लिए किया गया था। छवियाँ वेब से प्राप्त की गई हैं और उन्हें 365 दृश्य श्रेणियों में से एक के साथ एनोटेट किया गया है, जो "पहाड़" और "समुद्र तट" जैसे प्राकृतिक दृश्यों से लेकर "रसोई" और "कार्यालय" जैसे इनडोर वातावरण तक हैं। श्रेणियाँ Places2 डेटासेट से ली गई हैं, जो स्वयं पहले के Places205 डेटासेट का विस्तार है।
विकास और प्रेरणा
Places365 को एक व्यापक दृश्य पहचान डेटासेट की आवश्यकता को पूरा करने के लिए बनाया गया था। जबकि वस्तु पहचान में ImageNet जैसे डेटासेट के साथ महत्वपूर्ण प्रगति हुई थी, दृश्य समझ अपेक्षाकृत अविकसित बनी रही। MIT टीम का उद्देश्य एक बड़ा, विविध और अच्छी तरह से एनोटेटेड डेटासेट प्रदान करना था जो दृश्य वर्गीकरण के लिए न्यूरल नेटवर्क मॉडल के प्रशिक्षण का समर्थन कर सके। डेटासेट का निर्माण वेब से छवियाँ एकत्र करके और फिर स्वचालित और मानव-आधारित एनोटेशन प्रक्रियाओं के संयोजन का उपयोग करके किया गया था। 365 श्रेणियों का अंतिम सेट रोजमर्रा के वातावरण की एक विस्तृत श्रृंखला को कवर करने के लिए चुना गया था, यह सुनिश्चित करते हुए कि Places365 पर प्रशिक्षित मॉडल स्वायत्त ड्राइविंग, रोबोटिक्स और छवि पुनर्प्राप्ति जैसे वास्तविक दुनिया के अनुप्रयोगों के लिए सामान्यीकरण कर सकें।
Places365 का निर्माण Places डेटाबेस बनाने के व्यापक प्रयास का हिस्सा था, जिसमें Places205 डेटासेट और Places2 डेटासेट भी शामिल हैं। Places205, जिसे 2014 में पेश किया गया था, में 205 दृश्य श्रेणियाँ थीं और इसका उपयोग प्रारंभिक बेंचमार्क के रूप में किया गया था। Places365 ने इसे 365 श्रेणियों तक विस्तारित किया, जिससे दृश्य प्रकारों का अधिक व्यापक कवरेज प्रदान किया गया। डेटासेट को शोध समुदाय द्वारा व्यापक रूप से अपनाया गया है, और इसके जारी होने से दृश्य पहचान एल्गोरिदम में कई प्रगति हुई है।
वास्तुकला और सामग्री
Places365 में अलग-अलग रिज़ॉल्यूशन की छवियाँ शामिल हैं, जो आमतौर पर प्रीप्रोसेसिंग के बाद लगभग 224×224 पिक्सेल होती हैं। प्रत्येक छवि को एक एकल दृश्य श्रेणी के साथ लेबल किया जाता है, जिससे यह एक एकल-लेबल वर्गीकरण कार्य बन जाता है। डेटासेट में एक प्रशिक्षण सेट, एक सत्यापन सेट और एक परीक्षण सेट शामिल है। सत्यापन और परीक्षण सेट में प्रति श्रेणी 50 छवियाँ हैं, जबकि प्रशिक्षण सेट में प्रति श्रेणी हजारों छवियाँ हैं। छवियाँ JPEG प्रारूप में संग्रहीत हैं और श्रेणी के अनुसार निर्देशिकाओं में व्यवस्थित हैं।
Places365 का एक उल्लेखनीय पहलू व्यक्तिगत वस्तुओं के बजाय दृश्य-स्तरीय संदर्भ पर इसका ध्यान केंद्रित है। यह इसे वस्तु पहचान डेटासेट से अलग बनाता है, क्योंकि मॉडल को समग्र वातावरण को पहचानना सीखना चाहिए। डेटासेट में एक शब्दार्थ पदानुक्रम भी शामिल है, जो 365 श्रेणियों को 16 सुपर-श्रेणियों जैसे "इनडोर", "आउटडोर प्राकृतिक" और "आउटडोर मानव-निर्मित" में समूहित करता है। यह पदानुक्रम मॉडल प्रदर्शन के अधिक संरचित मूल्यांकन और विश्लेषण की अनुमति देता है।
अनुप्रयोग और प्रभाव
Places365 का व्यापक रूप से मशीन लर्निंग अनुसंधान में उपयोग किया गया है, विशेष रूप से दृश्य वर्गीकरण के लिए कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) के प्रशिक्षण के लिए। ResNet और DenseNet जैसे कई अत्याधुनिक मॉडलों का Places365 पर मूल्यांकन किया गया है, और डेटासेट ने विभिन्न आर्किटेक्चर की तुलना के लिए एक बेंचमार्क के रूप में कार्य किया है। वर्गीकरण के अलावा, Places365 का उपयोग दृश्य पार्सिंग, शब्दार्थ विभाजन और ट्रांसफर लर्निंग जैसे कार्यों के लिए किया गया है। उदाहरण के लिए, Places365 पर पूर्व-प्रशिक्षित मॉडल को वस्तु पहचान और छवि कैप्शनिंग सहित अन्य विज़न कार्यों के लिए फाइन-ट्यून किया गया है।
डेटासेट ने उद्योग में कृत्रिम बुद्धिमत्ता प्रणालियों के विकास को भी प्रभावित किया है। Google DeepMind और OpenAI जैसी कंपनियों ने अपने मॉडलों में दृश्य समझ क्षमताओं को शामिल किया है, और Places365 का उपयोग बड़े पैमाने के विज़न मॉडल के प्रदर्शन का मूल्यांकन करने के लिए किया गया है। इसके अलावा, डेटासेट का उपयोग मानव दृश्य धारणा पर अध्ययन में किया गया है, जो इस बात की अंतर्दृष्टि प्रदान करता है कि मनुष्य पर्यावरण को कैसे वर्गीकृत करते हैं।
सीमाएँ और भविष्य की दिशाएँ
अपनी सफलता के बावजूद, Places365 में कई सीमाएँ हैं। डेटासेट पश्चिमी, अंग्रेजी-भाषी संदर्भों की ओर पक्षपाती है, क्योंकि छवियाँ वेब से एकत्र की गई थीं, जो सभी वैश्विक वातावरणों का समान रूप से प्रतिनिधित्व नहीं कर सकती हैं। इसके अतिरिक्त, एकल-लेबल प्रारूप वास्तविक दुनिया के दृश्यों की जटिलता को नहीं पकड़ता है, जिसमें अक्सर कई ओवरलैपिंग संदर्भ होते हैं। शोधकर्ताओं ने विस्तार और विकल्प प्रस्तावित किए हैं, जैसे मल्टी-लेबल दृश्य डेटासेट और अधिक विविध भौगोलिक कवरेज वाले डेटासेट। जैसे-जैसे जनरेटिव AI और बड़े भाषा मॉडल आगे बढ़ते रहते हैं, मल्टीमॉडल मॉडल को बढ़ाने के लिए दृश्य समझ का उपयोग करने में बढ़ती रुचि है, और Places365 ऐसी प्रणालियों के प्रशिक्षण और मूल्यांकन के लिए एक प्रासंगिक संसाधन बना हुआ है।