अंग्रेज़ी से अनुवादित

LabelMe MIT CSAIL द्वारा निर्मित एक वेब-आधारित छवि एनोटेशन उपकरण और गतिशील डेटासेट है, जो कंप्यूटर विज़न अनुसंधान के लिए निःशुल्क, सार्वजनिक रूप से योगदान किए गए बहुभुज एनोटेशन प्रदान करता है। 2010 तक, इसमें 187,000 से अधिक छवियाँ और लगभग 659,000 लेबल किए गए ऑब्जेक्ट शामिल थे।

LabelMe एक परियोजना है जो MIT कंप्यूटर विज्ञान और कृत्रिम बुद्धिमत्ता प्रयोगशाला से उत्पन्न हुई है, जो डिजिटल छवियों का एक स्वतंत्र रूप से सुलभ, विकसित होता डेटासेट प्रदान करती है, जिसमें उपयोगकर्ता-जनित एनोटेशन शामिल हैं। मुख्य रूप से कंप्यूटर विज्ञान अनुसंधान के लिए डिज़ाइन किया गया, यह बहुभुज सीमाओं का उपयोग करके मनमाने दृश्यों में कई वस्तुओं को लेबल करने में सक्षम बनाता है। 31 अक्टूबर 2010 तक, डेटासेट में 187,240 छवियाँ शामिल थीं, जिनमें से 62,197 एनोटेट की गई थीं, जिनमें 658,992 लेबल वाली वस्तुएँ थीं। यह परियोजना सार्वजनिक योगदान के लिए खुली है, जिससे कोई भी एनोटेशन जोड़ या संपादित कर सकता है, जिससे यह अनुसंधान समुदाय के लिए एक गतिशील संसाधन बन जाता है।

LabelMe पहल पहले के कंप्यूटर विज्ञान डेटासेट की कमियों को दूर करने के लिए उभरी, जो अक्सर विशिष्ट अनुसंधान समस्याओं के अनुरूप होते थे और वस्तु की उपस्थिति और दृश्य संदर्भ में विविधता की कमी रखते थे। पारंपरिक डेटासेट के विपरीत, जिनमें एकल वस्तुओं की क्रॉप की गई, सामान्यीकृत छवियाँ होती थीं, LabelMe जटिल, अपरिवर्तित दृश्यों के भीतर वस्तु वर्गों की पहचान का समर्थन करता है, जो कई कोण, आकार और अभिविन्यास प्रदान करता है। यह वस्तु वर्गों की एक बड़ी विविधता भी प्रदान करता है और उपयोगकर्ताओं को आसानी से नए वर्ग बनाने की अनुमति देता है।

एनोटेशन उपकरण

LabelMe का वेब-आधारित एनोटेशन उपकरण उपयोगकर्ताओं को विशेष सॉफ़्टवेयर की आवश्यकता के बिना डेटासेट में योगदान करने में सक्षम बनाता है। किसी भी JavaScript-सक्षम वेब ब्राउज़र के माध्यम से सुलभ, यह उपकरण संग्रह से एक यादृच्छिक रूप से चयनित छवि प्रदर्शित करता है, जिसमें मौजूदा बहुभुज एनोटेशन को अलग-अलग रंगों में ओवरले किया जाता है। उपयोगकर्ता किसी वस्तु की सीमा के साथ बिंदुओं पर क्लिक करके नए बहुभुज बना सकते हैं, फिर पॉप-अप इंटरफ़ेस के माध्यम से एक टेक्स्ट लेबल निर्दिष्ट कर सकते हैं। लेबल उपयोगकर्ता-परिभाषित होते हैं, जिससे 'dog,' 'canine,' या 'hound' जैसी विविधता उत्पन्न होती है। एनोटेटर मौजूदा बहुभुजों को संपादित या हटा भी सकते हैं, और परिवर्तन तुरंत सहेजे जाते हैं और डाउनलोड के लिए सार्वजनिक रूप से उपलब्ध कराए जाते हैं, जिससे एक निरंतर अद्यतन होने वाला समुदाय-संचालित डेटासेट बढ़ावा मिलता है।

प्रेरणा और डिज़ाइन सिद्धांत

यह परियोजना पहले के सार्वजनिक रूप से उपलब्ध कंप्यूटर विज्ञान डेटासेट की सीमाओं से प्रेरित थी, जो अक्सर विशिष्ट अनुसंधान समस्याओं के अनुरूप होते थे और नए शोधकर्ताओं को अतिरिक्त डेटा एकत्र करने की आवश्यकता होती थी। LabelMe को एकल उदाहरणों के बजाय वस्तु वर्गों की पहचान का समर्थन करने के लिए डिज़ाइन किया गया था, जिसमें मनमाने दृश्यों में कई कोण, आकार और अभिविन्यास की वस्तुएँ शामिल हैं। क्रॉप या सामान्यीकृत छवियों वाले डेटासेट के विपरीत, LabelMe बहुभुज रूपरेखाओं के माध्यम से प्रति छवि कई वस्तुओं के एनोटेशन की अनुमति देता है, जिससे जटिल दृश्य समझ संभव होती है। यह वस्तु वर्गों के एक बड़े और विस्तारित सेट का भी समर्थन करता है, विविध इमेजरी शामिल करता है, और खुले सार्वजनिक योगदान के साथ गैर-कॉपीराइट छवियाँ प्रदान करता है।

एनोटेशन उपकरण

एनोटेशन उपकरण JavaScript समर्थन वाले एक मानक वेब ब्राउज़र में काम करता है, और उपयोगकर्ता इसे गुमनाम रूप से या मुफ्त खाते के साथ एक्सेस कर सकते हैं। लोड होने पर, उपकरण डेटासेट से एक यादृच्छिक छवि का चयन करता है और किसी भी मौजूदा वस्तु लेबल को छवि पर रंगीन बहुभुज के रूप में प्रदर्शित करता है, जिसमें प्रत्येक अलग लेबल को एक अलग रंग दिया जाता है। एक एनोटेशन जोड़ने के लिए, एक उपयोगकर्ता किसी वस्तु की सीमा के साथ बिंदुओं पर क्लिक करके एक बहुभुज बनाता है और लेबल दर्ज करने के लिए संकेत को ट्रिगर करने के लिए आकृति को बंद करता है। उपयोगकर्ता अपनी पसंद का कोई भी टेक्स्ट लेबल चुन सकते हैं, और मौजूदा बहुभुजों को उनकी रूपरेखाओं पर क्लिक करके और लेबल टेक्स्ट को संशोधित करके संपादित या हटा भी सकते हैं। परिवर्तन तुरंत सहेजे जाते हैं और डेटासेट में सार्वजनिक रूप से उपलब्ध हो जाते हैं, जो एक निरंतर विकसित होने वाले संग्रह में योगदान करते हैं। इंटरफ़ेस में अगली यादृच्छिक छवि पर जाने के लिए एक 'Show me another image' लिंक शामिल है।

डेटासेट विशेषताएँ

31 अक्टूबर 2010 तक, LabelMe में 187,240 छवियाँ थीं, जिनमें से 62,197 एनोटेट की गई थीं, जिनमें कुल 658,992 लेबल वाली वस्तुएँ थीं। डेटासेट की गतिशील प्रकृति का मतलब है कि तब से ये संख्याएँ बढ़ी हैं। छवियाँ विभिन्न प्रकार के दृश्यों से ली गई हैं, मुख्य रूप से मानव फोटोग्राफरों द्वारा कैप्चर की गईं, जिसके परिणामस्वरूप फ्रेम के भीतर वस्तु के आकार और स्थानों का असमान वितरण होता है। खुला-योगदान मॉडल एनोटेशन शैली में परिवर्तनशीलता लाता है: एनोटेटर तय करते हैं कि किन वस्तुओं को लेबल करना है (जैसे, क्या अस्पष्ट वस्तुओं की रूपरेखा तैयार करनी है), बहुभुज सीमाओं की सटीकता, और लेबल के लिए उपयोग किया जाने वाला सटीक टेक्स्ट। यह परिवर्तनशीलता जानबूझकर है, क्योंकि निर्माताओं का मानना है कि यह प्राकृतिक लेबलिंग आदतों को दर्शाती है और शोधकर्ताओं को ऐसी असंगतियों के प्रति मजबूत एल्गोरिदम विकसित करने में मदद करती है।

संबंधित कार्य और प्रभाव

LabelMe ने कंप्यूटर विज्ञान डेटासेट में पहले के प्रयासों, जैसे PASCAL VOC और Caltech डेटासेट, पर निर्माण किया, लेकिन अपने पैमाने और खुलेपन से खुद को अलग किया। इसकी गतिशील प्रकृति और समुदाय-संचालित दृष्टिकोण ने क्षेत्र में बाद के एनोटेशन प्लेटफार्मों और डेटासेट को प्रभावित किया। यह परियोजना वस्तु पहचान और विभाजन एल्गोरिदम के प्रशिक्षण और मूल्यांकन के लिए व्यापक रूप से उपयोग की गई है, और इसने मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में बड़े पैमाने पर, सार्वजनिक रूप से उपलब्ध डेटा की ओर व्यापक आंदोलन में योगदान दिया।

डेटा के साथ समस्याएँ

डेटासेट एनोटेटरों को दी गई स्वतंत्रता के कारण परिवर्तनशीलता प्रदर्शित करता है, जो कुछ चुनौतियाँ पेश करता है। वस्तुएँ आकार और छवि स्थान में भिन्न हो सकती हैं क्योंकि फोटोग्राफर दिलचस्प विषयों को केंद्रित करते हैं। उपयोगकर्ता चुन सकते हैं कि किन वस्तुओं को लेबल करना है, जिससे असंगतियाँ उत्पन्न होती हैं, जैसे कि अस्पष्ट वस्तुओं या आकाश को लेबल करना है या नहीं। एनोटेशन सटीकता भी भिन्न होती है, क्योंकि उपयोगकर्ता तय करते हैं कि बहुभुज कितने विस्तृत होने चाहिए। टेक्स्ट लेबल प्रतिबंधित नहीं हैं, इसलिए एक ही वस्तु को अलग-अलग नाम मिल सकते हैं, जैसे "person," "man," या "pedestrian।" निर्माताओं ने जानबूझकर इन निर्णयों को एनोटेटरों पर छोड़ दिया, यह मानते हुए कि प्राकृतिक लेबलिंग परिवर्तनशीलता शोधकर्ताओं को वास्तविक दुनिया की असंगतियों के प्रति मजबूत एल्गोरिदम विकसित करने में मदद करती है।

डेटा संगठन और WordNet एकीकरण

टेक्स्ट लेबल की परिवर्तनशीलता को संबोधित करने के लिए, LabelMe टीम ने डेटाबेस में WordNet को एकीकृत किया। WordNet शब्दों को एक संरचित शब्दार्थ पदानुक्रम में व्यवस्थित करता है, प्रत्येक शब्द को एक "अर्थ" (sense) सौंपता है। स्वचालित अर्थ असाइनमेंट अविश्वसनीय साबित हुआ, इसलिए लेबल को मैन्युअल रूप से WordNet अर्थों में मैप किया गया। यह प्रयास, हालांकि श्रम-गहन था, प्रबंधनीय रहा क्योंकि अलग-अलग शब्दों की संख्या बहुभुजों की संख्या के सापेक्ष धीरे-धीरे बढ़ी। WordNet एकीकरण के साथ, खोजें अधिक प्रभावी हो गईं: "animal" क्वेरी करने पर कुत्ते, बिल्ली और साँप जैसी लेबल वाली वस्तुएँ प्राप्त हो सकती थीं, जबकि "dog walking" या जटिल वाक्यांशों वाले अप्रासंगिक मिलानों को बाहर रखा जा सकता था। सिस्टम ने भाग-संबंधों की पहचान का भी समर्थन किया, जैसे वाहनों के हिस्सों के रूप में पहिये, जिससे वस्तु पहचान अनुसंधान के लिए डेटासेट की उपयोगिता बढ़ी।

प्रभाव और अनुप्रयोग

LabelMe का कंप्यूटर विज्ञान अनुसंधान में व्यापक रूप से उपयोग किया गया है, जो वस्तु पहचान, विभाजन और दृश्य समझ जैसे कार्यों के लिए एक बेंचमार्क प्रदान करता है। इसकी खुली और गतिशील प्रकृति इसे स्थिर डेटासेट से अलग करती है, जिससे निरंतर विस्तार और शोधन संभव होता है। यह परियोजना समान क्राउडसोर्स्ड एनोटेशन प्रयासों को प्रेरित करती रही है और क्षेत्र में एक मौलिक संसाधन बनी हुई है। शोधकर्ताओं ने विविध, वास्तविक दुनिया के संदर्भों में वस्तुओं को पहचानने के लिए एल्गोरिदम को प्रशिक्षित और मूल्यांकन करने के लिए LabelMe का लाभ उठाया है, जो छवि समझ और मशीन लर्निंग और कंप्यूटर विज़न के संबंधित क्षेत्रों में प्रगति में योगदान देता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·datasets·annotation-tools·mit
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास