Open Images एक बड़े पैमाने का डेटासेट है जिसे कंप्यूटर विज़न और मशीन लर्निंग में अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है। यह छवियों का एक विशाल संग्रह प्रदान करता है, जिसमें लेबल, ऑब्जेक्ट बाउंडिंग बॉक्स और विज़ुअल रिलेशनशिप जानकारी का एक समृद्ध सेट शामिल है। यह डेटासेट ऑब्जेक्ट डिटेक्शन, इमेज क्लासिफिकेशन और विज़ुअल रिलेशनशिप समझ जैसे कार्यों में मॉडलों को प्रशिक्षित करने और मूल्यांकन करने के लिए व्यापक रूप से उपयोग किया जाता है। इसका पैमाना और विविधता इसे कृत्रिम बुद्धिमत्ता और गहन शिक्षण के क्षेत्र में एक आधारभूत संसाधन बनाती है।
Open Images को 2016 में Google द्वारा पेश किया गया था और इसके कई प्रमुख संस्करण जारी किए गए हैं। यह डेटासेट अपने आकार के लिए उल्लेखनीय है, जिसमें इसके पूर्ण संस्करण में 9 मिलियन से अधिक छवियाँ हैं, और एनोटेशन हजारों ऑब्जेक्ट क्लासेस को कवर करते हैं। एनोटेशन स्वचालित विधियों और मानव सत्यापन के संयोजन से प्राप्त किए गए हैं, जो पैमाने और गुणवत्ता के बीच संतुलन सुनिश्चित करते हैं। डेटासेट में एक प्रशिक्षण विभाजन, एक सत्यापन विभाजन और एक परीक्षण विभाजन शामिल है, जो मॉडलों के मानकीकृत बेंचमार्किंग की अनुमति देता है।
डेटासेट संरचना और एनोटेशन
Open Images डेटासेट कई प्रकार के एनोटेशन प्रदान करता है। प्राथमिक एनोटेशन इमेज-स्तरीय लेबल हैं, जहाँ प्रत्येक छवि कुछ वस्तुओं या अवधारणाओं की उपस्थिति को इंगित करने वाले क्लास लेबल के एक सेट से जुड़ी होती है। इसके अतिरिक्त, डेटासेट में ऑब्जेक्ट्स के लिए बाउंडिंग बॉक्स शामिल हैं, जो एक छवि के भीतर वस्तुओं के उदाहरणों को स्थानीयकृत करने वाले अक्ष-संरेखित आयत हैं। ये बाउंडिंग बॉक्स छवियों के एक उपसमुच्चय के लिए प्रदान किए जाते हैं, जिससे ऑब्जेक्ट डिटेक्शन जैसे कार्य सक्षम होते हैं। इसके अलावा, डेटासेट में विज़ुअल रिलेशनशिप एनोटेशन शामिल हैं, जो वस्तुओं के बीच जोड़ीवार संबंधों का वर्णन करते हैं, जैसे "कुत्ता स्केटबोर्ड के ऊपर" या "व्यक्ति छाता पकड़े हुए"। ये संबंध विषय-विधेय-वस्तु त्रिक के रूप में संरचित हैं, जो दृश्य समझ में अनुसंधान की सुविधा प्रदान करते हैं।
एनोटेशन कक्षाओं के एक पदानुक्रमित वर्गीकरण में व्यवस्थित हैं, जो मोटे से बारीक वर्गीकरण की अनुमति देता है। डेटासेट में "नकारात्मक" लेबल का एक सेट भी शामिल है, जो इंगित करता है कि एक विशेष क्लास छवि में अनुपस्थित है, जो नकारात्मक उदाहरणों के साथ क्लासिफायर को प्रशिक्षित करने के लिए उपयोगी है। बाउंडिंग बॉक्स एक सामान्यीकृत प्रारूप में प्रदान किए जाते हैं, जिसमें निर्देशांक छवि आयामों के सापेक्ष होते हैं, जिससे उन्हें मानक गहन शिक्षण ढाँचे के साथ उपयोग करना आसान हो जाता है।
संस्करण और विकास
Open Images को कई संस्करणों में जारी किया गया है। 2016 में प्रारंभिक रिलीज़ में इमेज-स्तरीय लेबल के साथ लगभग 9 मिलियन छवियाँ शामिल थीं। एक बाद का संस्करण, Open Images v4, ने डेटासेट को 19,957 कक्षाओं में 30 मिलियन इमेज-स्तरीय लेबल तक विस्तारित किया, और 600 कक्षाओं के लिए 1.74 मिलियन बाउंडिंग बॉक्स जोड़े। सबसे हालिया प्रमुख संस्करण, Open Images v6, ने 600 कक्षाओं के लिए बाउंडिंग बॉक्स की संख्या को 12 मिलियन से अधिक तक बढ़ा दिया, और विज़ुअल रिलेशनशिप एनोटेशन जोड़े। प्रत्येक संस्करण के साथ डेटासेट निर्माण और आँकड़ों का वर्णन करने वाला एक विस्तृत पेपर भी शामिल है।
डेटासेट को विविधता पर ध्यान केंद्रित करके तैयार किया गया है, जिसमें विभिन्न स्रोतों और डोमेन से छवियाँ शामिल हैं। छवियाँ Flickr से क्रिएटिव कॉमन्स लाइसेंस के तहत प्राप्त की गई हैं, जो अनुसंधान उद्देश्यों के लिए कानूनी उपयोगिता सुनिश्चित करती है। एनोटेशन प्रक्रिया में मशीन लर्निंग मॉडल और मानव एनोटेटर का संयोजन शामिल था, जिसमें सटीकता सुनिश्चित करने के लिए गुणवत्ता नियंत्रण तंत्र था।
अनुसंधान और उद्योग में उपयोग
Open Images कंप्यूटर विज़न में एक मानक बेंचमार्क बन गया है। इसका उपयोग अक्सर ऑब्जेक्ट डिटेक्शन मॉडल को प्रशिक्षित करने के लिए किया जाता है, जैसे कि अवशिष्ट-नेटवर्क आर्किटेक्चर पर आधारित, और उनके प्रदर्शन का मूल्यांकन करने के लिए। डेटासेट का बड़ा पैमाना और विविध एनोटेशन इसे लाखों पैरामीटर वाले मॉडलों को प्रशिक्षित करने के लिए उपयुक्त बनाते हैं, जो बैच-सामान्यीकरण और डेटा-वृद्धि जैसी तकनीकों का लाभ उठाते हैं। शोधकर्ताओं ने Open Images का उपयोग ऐसे मॉडल विकसित करने के लिए किया है जो COCO जैसे अन्य डेटासेटों पर अच्छी तरह से सामान्यीकरण करते हैं, वस्तुओं और दृश्यों की विविधता के कारण।
उद्योग में, Open Images का उपयोग कंपनियों द्वारा स्वायत्त ड्राइविंग, रोबोटिक्स और सामग्री मॉडरेशन जैसे अनुप्रयोगों के लिए विज़न सिस्टम बनाने के लिए किया जाता है। उदाहरण के लिए, वेमो और टेस्ला-ऑटोपायलट ने धारणा प्रणाली विकसित की है जो बड़े पैमाने के डेटासेट से लाभान्वित होती है, हालाँकि वे अक्सर स्वामित्व डेटा का भी उपयोग करते हैं। डेटासेट का उपयोग स्टैनफोर्ड-एआई-लैब और एमआईटी-सीएसएआईएल जैसे संस्थानों में शैक्षणिक अनुसंधान में मशीन लर्निंग में नई विधियों का पता लगाने के लिए भी किया जाता है।
चुनौतियाँ और सीमाएँ
अपने पैमाने के बावजूद, Open Images की कुछ सीमाएँ हैं। एनोटेशन संपूर्ण नहीं हैं; छवियों में कई वस्तुएँ अलेबल हो सकती हैं, जो प्रशिक्षण के दौरान गलत नकारात्मकता पैदा कर सकती हैं। बाउंडिंग बॉक्स केवल कक्षाओं के एक उपसमुच्चय के लिए प्रदान किए जाते हैं, और विज़ुअल रिलेशनशिप एनोटेशन विरल हैं। इसके अतिरिक्त, डेटासेट Flickr पर आमतौर पर पाई जाने वाली वस्तुओं और दृश्यों की ओर पक्षपाती है, जो सभी वास्तविक-विश्व वितरणों का प्रतिनिधित्व नहीं कर सकता है। शोधकर्ताओं को अक्सर इन मुद्दों को हल करने के लिए Open Images को अन्य डेटासेट के साथ संयोजित करने या पाठ्यक्रम-शिक्षण जैसी तकनीकों का उपयोग करने की आवश्यकता होती है।
एक और चुनौती इतने बड़े डेटासेट पर प्रशिक्षण की कम्प्यूटेशनल लागत है। मॉडलों को महत्वपूर्ण संसाधनों की आवश्यकता होती है, जो अक्सर एडब्ल्यूएस-ट्रेनियम या गूगल-क्लाउड TPU जैसे विशेष हार्डवेयर का उपयोग करते हैं। डेटासेट का आकार भंडारण और I/O चुनौतियाँ भी पैदा करता है, जिन्हें कुशल डेटा लोडिंग पाइपलाइनों और मॉडल आकार को कम करने के लिए मॉडल-प्रूनिंग तकनीकों का उपयोग करके कम किया जाता है।
प्रभाव और भविष्य की दिशाएँ
Open Images ने कंप्यूटर विज़न के क्षेत्र पर महत्वपूर्ण प्रभाव डाला है, जिससे अधिक सटीक और मजबूत मॉडलों के विकास को सक्षम किया गया है। इसे हजारों शोध पत्रों में उद्धृत किया गया है और इसने बाद के डेटासेट के डिज़ाइन को प्रभावित किया है। डेटासेट का रखरखाव जारी है, जिसमें नए एनोटेशन और कक्षाओं को शामिल करने के लिए आवधिक अपडेट शामिल हैं। भविष्य की दिशाओं में डेटासेट को वीडियो डेटा या सेगमेंटेशन मास्क जैसे अधिक सूक्ष्म एनोटेशन शामिल करने के लिए विस्तार करना शामिल हो सकता है। जैसे-जैसे जनरेटिव-एआई का क्षेत्र बढ़ता है, Open Images का उपयोग छवियों को उत्पन्न करने या संपादित करने वाले मॉडलों को प्रशिक्षित करने के लिए भी किया जा सकता है, हालाँकि ऐसे अनुप्रयोगों के लिए नैतिक निहितार्थों पर सावधानीपूर्वक विचार करने की आवश्यकता होती है।
कुल मिलाकर, Open Images कंप्यूटर विज़न अनुसंधान के लिए एक आधारशिला संसाधन बना हुआ है, जो छवियों का एक समृद्ध और विविध सेट प्रदान करता है जो मशीन लर्निंग मॉडल जो हासिल कर सकते हैं उसकी सीमाओं को आगे बढ़ाता है।