Open Images एक बड़े पैमाने का डेटासेट है जिसे Google ने कंप्यूटर विज़न अनुसंधान के लिए बनाया है। इसमें लाखों छवियाँ शामिल हैं जिन्हें विभिन्न लेबल और मेटाडेटा के साथ एनोटेट किया गया है, जिसे मशीन-लर्निंग मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह डेटासेट अपने पैमाने और विविधता के लिए उल्लेखनीय है, जो रोज़मर्रा की वस्तुओं और दृश्यों की एक विस्तृत श्रृंखला को कवर करता है, जिसमें एनोटेशन में छवि-स्तरीय लेबल, ऑब्जेक्ट बाउंडिंग बॉक्स और विज़ुअल रिलेशनशिप ट्रिपलेट शामिल हैं।
Open Images का पहला संस्करण 2016 में जारी किया गया था, जिसमें लगभग 9 मिलियन छवियाँ थीं, जिनमें लगभग 6,000 श्रेणियों में छवि-स्तरीय लेबल थे। बाद के संस्करणों ने डेटासेट का विस्तार 30 मिलियन से अधिक छवियों तक किया, जिसमें 600 से अधिक वर्गों में वस्तुओं को चिह्नित करने वाले 15 मिलियन से अधिक बाउंडिंग बॉक्स शामिल थे। एनोटेशन स्वचालित विधियों और मानव सत्यापन के संयोजन के माध्यम से तैयार किए गए थे, जो कृत्रिम-बुद्धिमत्ता क्षमताओं को आगे बढ़ाने के लिए Google के बड़े पैमाने पर डेटा इंफ्रास्ट्रक्चर में निवेश को दर्शाता है।
डेटासेट संरचना
Open Images को कई कंप्यूटर विज़न कार्यों का समर्थन करने के लिए संरचित किया गया है। मुख्य घटकों में छवि संग्रह, वस्तुओं या अवधारणाओं की उपस्थिति को इंगित करने वाले छवि-स्तरीय लेबल, और बाउंडिंग बॉक्स और सेगमेंटेशन मास्क जैसे स्थानीय एनोटेशन शामिल हैं। प्रत्येक छवि के लिए, डेटासेट एक अद्वितीय पहचानकर्ता, मूल URL, और लेबल की अनुमानित विश्वसनीयता जैसे मेटाडेटा प्रदान करता है। बाउंडिंग बॉक्स एनोटेशन एक मानकीकृत प्रारूप में दिए गए हैं, जो छवि आयामों के सापेक्ष निर्देशांक सूचीबद्ध करते हैं, साथ ही ऑब्जेक्ट वर्ग के लिए एक लेबल भी शामिल होता है।
इसके अतिरिक्त, डेटासेट में विज़ुअल रिलेशनशिप एनोटेशन का एक सेट शामिल है जो वस्तुओं के बीच परस्पर क्रियाओं का वर्णन करता है, जैसे "व्यक्ति घोड़े की सवारी कर रहा है" या "कुत्ता गेंद का पीछा कर रहा है।" ये संबंध विषय-विधेय-वस्तु ट्रिपलेट के रूप में स्वरूपित हैं। यह समृद्ध एनोटेशन परत संबंधपरक तर्क और दृश्य समझ में अनुसंधान को सक्षम बनाती है, जो दृश्य पहचान और डीप-लर्निंग अनुसंधान के भीतर सक्रिय क्षेत्र हैं।
एनोटेशन पद्धति
Open Images का निर्माण एक अर्ध-स्वचालित पाइपलाइन पर निर्भर था जिसने मशीन-जनित उम्मीदवारों को मानव क्यूरेशन के साथ जोड़ा। Google की आंतरिक प्रणालियों ने पहले मौजूदा छवि क्लासिफायर और वेब-स्केल डेटा माइनिंग का उपयोग करके शोर-युक्त लेबल उम्मीदवार उत्पन्न किए। इन उम्मीदवारों को फिर क्राउडसोर्सिंग प्लेटफार्मों के माध्यम से मानव एनोटेटरों के सामने प्रस्तुत किया गया, जहाँ कार्यकर्ताओं ने लेबल सत्यापित या सही किए और बाउंडिंग बॉक्स को परिष्कृत किया। इस हाइब्रिड दृष्टिकोण ने डेटासेट को लाखों छवियों तक विस्तारित करने की अनुमति दी, साथ ही आधुनिक तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए उपयुक्त गुणवत्ता का स्तर बनाए रखा।
बाउंडिंग बॉक्स के लिए, एनोटेटरों को निर्देश दिया गया था कि वे लक्ष्य वर्ग के प्रत्येक दृश्य उदाहरण के चारों ओर सबसे कसकर संभव बॉक्स बनाएं। अंतिम एनोटेशन को गुणवत्ता जांच की एक श्रृंखला के माध्यम से मान्य किया गया, जिसमें छवियों के एक उपसमूह पर कई एनोटेटरों के बीच सहमति विश्लेषण शामिल था। परिणामस्वरूप, डेटासेट एकल-लेबल और बहु-लेबल वर्गीकरण, साथ ही ऑब्जेक्ट डिटेक्शन दोनों के लिए एक बेंचमार्क बन गया है।
अनुसंधान पर प्रभाव
Open Images का व्यापक रूप से शैक्षणिक और औद्योगिक अनुसंधान समूहों दोनों द्वारा उपयोग किया गया है। यह कई सार्वजनिक बेंचमार्क चुनौतियों की नींव के रूप में कार्य किया, जिसमें Kaggle पर आयोजित Open Images चैलेंज शामिल है, जो 2018 और 2019 में चला। इन चुनौतियों ने सैकड़ों भाग लेने वाली टीमों को आकर्षित किया और ऑब्जेक्ट डिटेक्शन और विज़ुअल रिलेशनशिप डिटेक्शन में अत्याधुनिक स्थिति को आगे बढ़ाया। डेटासेट को हजारों शोध पत्रों में उद्धृत किया गया है, जिसने बड़े पैमाने पर न्यूरल-नेटवर्क प्रशिक्षण और ट्रांसफर लर्निंग के दृष्टिकोण को प्रभावित किया है।
एक बड़े और विविध लेबल वाले डेटासेट की उपलब्धता ने जनरेटिव-एआई प्रणालियों के विकास का भी समर्थन किया, जिन्हें वास्तविक दुनिया की दृश्य अवधारणाओं में आधार की आवश्यकता होती है। Open Images पर पूर्व-प्रशिक्षित मॉडल का उपयोग छवि कैप्शनिंग, विज़ुअल प्रश्न उत्तर, और स्वायत्त ड्राइविंग धारणा जैसे डाउनस्ट्रीम कार्यों के लिए किया गया है। डेटासेट ImageNet और COCO जैसे अन्य संसाधनों का पूरक है, जो वर्गों का एक व्यापक सेट और रोज़मर्रा की छवियों का अधिक यथार्थवादी वितरण प्रदान करता है।
संस्करण और उपलब्धता
Google ने Open Images के कई संस्करण क्रिएटिव कॉमन्स लाइसेंस के तहत जारी किए, जिससे यह अनुसंधान और वाणिज्यिक उपयोग के लिए स्वतंत्र रूप से उपलब्ध हो गया। संस्करण 4, जो 2018 में पेश किया गया, ने विज़ुअल रिलेशनशिप एनोटेशन जोड़े और छवियों की संख्या 9 मिलियन से अधिक तक बढ़ाई, जिसमें 30 मिलियन बॉक्स-स्तरीय एनोटेशन थे। संस्करण 5, जो 2019 में जारी हुआ, ने बाउंडिंग बॉक्स वर्गों की संख्या 600 तक बढ़ाई और छवियों के एक उपसमूह के लिए सेगमेंटेशन मास्क जोड़े। डेटासेट Google की स्टोरेज इंफ्रास्ट्रक्चर के माध्यम से सुलभ है और आधिकारिक वेबसाइट पर एक इंटरैक्टिव विज़ुअलाइज़ेशन टूल के माध्यम से भी खोजा जा सकता है।
सभी फ़ाइलें CSV प्रारूप में प्रदान की गई हैं, जिसमें प्रत्येक एनोटेशन प्रकार के लिए अलग फ़ाइलें हैं। डेटासेट के साथ एक साथी पेपर है जिसे पहली बार 2017 कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन में प्रस्तुत किया गया था, जिसमें इसके निर्माण और आँकड़ों का विवरण दिया गया है। परियोजना को Google अनुसंधान टीम द्वारा बनाए रखा गया है, जिसमें समुदाय की प्रतिक्रिया और आंतरिक अनुसंधान आवश्यकताओं द्वारा संचालित अद्यतन शामिल हैं। 2025 तक, डेटासेट बड़े पैमाने पर दृश्य पहचान बेंचमार्क के लिए एक मानक संदर्भ बिंदु बना हुआ है।
सीमाएँ और भविष्य की दिशाएँ
अपने पैमाने के बावजूद, Open Images में अंतर्निहित सीमाएँ हैं। छवि-स्तरीय लेबल मशीन-जनित भविष्यवाणियों पर आधारित हैं और इनमें शोर हो सकता है, और वर्ग वितरण वेब इमेजरी में पाई जाने वाली सामान्य वस्तुओं की ओर पक्षपाती है। एनोटेशन मुख्य रूप से ऑब्जेक्ट उपस्थिति और मोटे संबंधों पर केंद्रित हैं, जिनमें कुछ छोटे डेटासेट में उपलब्ध बारीक विशेषताएँ या विस्तृत दृश्य ग्राफ़ शामिल नहीं हैं। शोधकर्ता अक्सर विशेष कार्यों पर काम करते समय Open Images को अन्य स्रोतों के साथ पूरक करते हैं या डोमेन अनुकूलन तकनीक लागू करते हैं।
डेटासेट के लिए भविष्य की दिशाओं में अधिक व्यापक वीडियो एनोटेशन, समृद्ध संबंध प्रकार, या पाठ विवरण जैसे मल्टी-मोडल डेटा का समावेश शामिल हो सकता है। Open Images की सफलता ने Amazon AI और अन्य क्लाउड प्रदाताओं सहित समान बड़े पैमाने पर डेटा संग्रह प्रयासों को प्रेरित किया है, जो कृत्रिम-बुद्धिमत्ता में प्रगति को तेज करने के लिए विशाल एनोटेटेड कॉर्पोरा को सुलभ बनाने की व्यापक प्रवृत्ति को दर्शाता है।