अंग्रेज़ी से अनुवादित

विज़ुअल जीनोम बड़े पैमाने पर घनी एनोटेटेड छवियों का एक डेटासेट है, जो एआई अनुसंधान के लिए दृश्य सामग्री को संरचित पाठ्य विवरणों से जोड़ता है। यह क्षेत्र विवरण, वस्तुएं, विशेषताएं और संबंध प्रदान करता है, जो कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण में कार्यों का समर्थन करता है।

Visual Genome एक बड़े पैमाने का डेटासेट है जिसे दृश्य समझ को प्राकृतिक भाषा से जोड़ने के लिए डिज़ाइन किया गया है। इसमें 108,000 से अधिक छवियाँ शामिल हैं, जिनमें से प्रत्येक को क्षेत्र विवरण, वस्तुओं, विशेषताओं और संबंधों के घने सेट के साथ एनोटेट किया गया है। यह डेटासेट मशीन लर्निंग मॉडल को किसी छवि में वस्तुओं के बीच जटिल अंतःक्रियाओं के बारे में तर्क करने में सक्षम बनाने के लिए बनाया गया था, जो सरल वस्तु पहचान से आगे बढ़कर अधिक व्यापक दृश्य समझ की ओर अग्रसर होता है। इसे 2016 में स्टैनफोर्ड विश्वविद्यालय और टोरंटो विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिनमें रंजय कृष्णा, युके झू, ओलिवर ग्रोथ, जस्टिन जॉनसन, केनजी हाटा, जोशुआ क्राविट्ज़, स्टेफनी चेन, यानिस कलांतिडिस, ली-जिया ली, डेविड ए. शम्मा, माइकल एस. बर्नस्टीन और ली फेई-फेई शामिल हैं।

Visual Genome का प्राथमिक लक्ष्य कृत्रिम बुद्धिमत्ता प्रणालियों के विकास का समर्थन करने के लिए एक संसाधन प्रदान करना है जो छवियों के बारे में प्रश्नों के उत्तर देने, वर्णनात्मक कैप्शन उत्पन्न करने और दृश्य तर्क करने में सक्षम हों। एकल वस्तु वर्गीकरण या सरल कैप्शनिंग पर केंद्रित डेटासेट के विपरीत, Visual Genome किसी छवि की सामग्री का एक संरचित प्रतिनिधित्व प्रदान करता है। प्रत्येक छवि को औसतन 35 वस्तुओं, 26 विशेषताओं और वस्तुओं के बीच 21 जोड़ीवार संबंधों के साथ एनोटेट किया गया है। इन एनोटेशन को एक दृश्य ग्राफ में व्यवस्थित किया गया है, जो एक निर्देशित ग्राफ है जहाँ नोड्स वस्तुओं का प्रतिनिधित्व करते हैं और किनारे "सवारी करना," "पहनना," या "बगल में" जैसे संबंधों का प्रतिनिधित्व करते हैं। यह संरचना एल्गोरिदम को एक छवि को एक अर्थपूर्ण प्रतिनिधित्व में पार्स करने की अनुमति देती है जिसे क्वेरी और हेरफेर किया जा सकता है।

डेटासेट संरचना और एनोटेशन प्रक्रिया

डेटासेट में कई प्रमुख घटक शामिल हैं: क्षेत्र विवरण, वस्तुएँ, विशेषताएँ, संबंध और प्रश्न-उत्तर जोड़े। क्षेत्र विवरण छोटे, प्राकृतिक भाषा के वाक्य हैं जो किसी छवि के एक विशिष्ट क्षेत्र का वर्णन करते हैं। वस्तुएँ लेबल किए गए बाउंडिंग बॉक्स हैं जिनमें संबंधित नाम होते हैं, जबकि विशेषताएँ रंग, आकार या आकृति जैसे गुणों का वर्णन करती हैं। संबंध दो वस्तुओं को एक विधेय के साथ जोड़ते हैं, जैसे "आदमी सर्फ़बोर्ड पकड़े हुए।" इसके अतिरिक्त, Visual Genome में 1.7 मिलियन से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनका उपयोग दृश्य प्रश्न उत्तर प्रणालियों के प्रशिक्षण के लिए किया जाता है। एनोटेशन प्रक्रिया में क्राउडसोर्स किए गए कार्यकर्ता शामिल थे जिन्हें स्थिरता सुनिश्चित करने के लिए विस्तृत निर्देश दिए गए थे। प्रत्येक छवि को कई कार्यकर्ताओं द्वारा एनोटेट किया गया था, और गुणवत्ता बनाए रखने के लिए परिणामों को एकत्र और फ़िल्टर किया गया था। डेटासेट में 80,000 छवियों का एक सेट भी शामिल है जिसमें अधिक घनी रूप से जुड़े क्षेत्र ग्राफ हैं, जो जटिल मॉडलों के प्रशिक्षण के लिए एक समृद्ध स्रोत प्रदान करते हैं।

मशीन लर्निंग में अनुप्रयोग

Visual Genome कंप्यूटर विज़न और मशीन लर्निंग में कार्यों के लिए एक मानक बेंचमार्क बन गया है। इसका व्यापक रूप से दृश्य ग्राफ निर्माण पर मॉडलों के प्रशिक्षण और मूल्यांकन के लिए उपयोग किया जाता है, जहाँ लक्ष्य किसी छवि से वस्तुओं और उनके संबंधों की भविष्यवाणी करना है। यह दृश्य प्रश्न उत्तर, छवि कैप्शनिंग और संदर्भित अभिव्यक्ति समझ का भी समर्थन करता है, जहाँ एक मॉडल को प्राकृतिक भाषा वाक्यांश द्वारा वर्णित किसी वस्तु का पता लगाना चाहिए। डेटासेट के संरचित एनोटेशन तंत्रिका नेटवर्क वास्तुकलाओं पर शोध को आगे बढ़ाने में सहायक रहे हैं जो दृश्य और पाठ्य जानकारी को जोड़ते हैं, जैसे ट्रांसफॉर्मर-आधारित मॉडल। उदाहरण के लिए, विज़ुअल ट्रांसफॉर्मर और विभिन्न बड़े भाषा मॉडल-निर्देशित विज़न सिस्टम जैसे मॉडल को Visual Genome पर प्रशिक्षित किया गया है ताकि दृश्य सामग्री में भाषा को आधारित करने की उनकी क्षमता में सुधार हो सके। शोधकर्ताओं ने रचनात्मक सामान्यीकरण का अध्ययन करने के लिए भी डेटासेट का उपयोग किया है, जहाँ मॉडलों को ज्ञात वस्तुओं और संबंधों के नए संयोजनों को समझना चाहिए।

प्रभाव और सीमाएँ

अपनी रिलीज़ के बाद से, Visual Genome ने बाद के डेटासेटों के डिज़ाइन को प्रभावित किया है, जैसे कि Open Images डेटासेट और COCO डेटासेट के विस्तारित एनोटेशन। इसका उपयोग अन्य संसाधनों के साथ मिलकर मूर्त AI और रोबोटिक्स के लिए अधिक व्यापक बेंचमार्क बनाने के लिए भी किया गया है, जहाँ एजेंटों को दुनिया में कार्य करने के लिए दृश्य दृश्यों की व्याख्या करनी चाहिए। हालाँकि, डेटासेट में ज्ञात सीमाएँ हैं। एनोटेशन सामान्य वस्तुओं और रोज़मर्रा के दृश्यों की ओर पक्षपाती हैं, जिससे मॉडल दुर्लभ या असामान्य वस्तुओं पर खराब प्रदर्शन कर सकते हैं। एनोटेशन की क्राउडसोर्स प्रकृति शोर पेश करती है, और कुछ संबंध अस्पष्ट या असंगत रूप से लेबल किए जा सकते हैं। इसके अतिरिक्त, डेटासेट स्थिर है और वास्तविक दुनिया के वातावरण की विविधता को प्रतिबिंबित नहीं करता है, जैसे कि कई अस्पष्ट वस्तुओं वाले इनडोर स्थान या अलग-अलग प्रकाश स्थितियों वाले बाहरी दृश्य। शोधकर्ताओं ने डेटा को साफ करने के तरीके विकसित करके या इसे सिमुलेशन से सिंथेटिक डेटा के साथ जोड़कर इन मुद्दों को संबोधित किया है।

अन्य AI संसाधनों से संबंध

Visual Genome गहन शिक्षण में प्रगति को चलाने वाले डेटासेट और मॉडलों के व्यापक पारिस्थितिकी तंत्र का हिस्सा है। यह ImageNet जैसे डेटासेटों का पूरक है, जो वस्तु वर्गीकरण पर केंद्रित है, और MS COCO, जो इंस्टेंस सेगमेंटेशन और कैप्शनिंग प्रदान करता है। Visual Genome द्वारा पेश किया गया दृश्य ग्राफ प्रतिनिधित्व अन्य परियोजनाओं द्वारा अपनाया गया है, जैसे कि Scene Graph Benchmark और GQA डेटासेट, जो अधिक जटिल प्रश्नों के साथ दृश्य तर्क पर केंद्रित है। आधुनिक AI के संदर्भ में, Visual Genome का उपयोग विज़न-भाषा मॉडलों को पूर्व-प्रशिक्षित करने के लिए किया गया है, जिन्हें बाद में विशिष्ट कार्यों के लिए ठीक-ट्यून किया जाता है। ये मॉडल, जो अक्सर ट्रांसफॉर्मर वास्तुकलाओं पर निर्मित होते हैं, गूगल डीपमाइंड, ओपनएआई और एंथ्रोपिक जैसे संगठनों द्वारा विकसित किए गए हैं, हालाँकि Visual Genome स्वयं एक शैक्षणिक संसाधन है न कि एक वाणिज्यिक उत्पाद। डेटासेट अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपलब्ध है और एक समर्पित वेबसाइट पर होस्ट किया गया है, जिसमें एनोटेशन डाउनलोड करने और देखने के लिए उपकरण शामिल हैं।

भविष्य की दिशाएँ

2020 के दशक के मध्य तक, यह क्षेत्र बड़े, अधिक विविध डेटासेट और मल्टीमॉडल मॉडलों की ओर बढ़ गया है जो छवियों के साथ वीडियो, ऑडियो और पाठ को संभाल सकते हैं। Visual Genome घने एनोटेशन और दृश्य ग्राफ निर्माण के सिद्धांतों को समझने के लिए एक मूल्यवान संसाधन बना हुआ है। शोधकर्ता इसका उपयोग फ्यू-शॉट लर्निंग के लिए नए एल्गोरिदम विकसित करने के लिए करना जारी रखते हैं, जहाँ मॉडलों को कुछ उदाहरणों से सामान्यीकरण करना चाहिए, और ज़ीरो-शॉट तर्क के लिए, जहाँ मॉडल अनदेखी श्रेणियों को संभालते हैं। संबंधों और विशेषताओं पर डेटासेट का जोर विज़न में कारणात्मक तर्क पर काम को भी प्रेरित किया है, जहाँ मॉडलों को न केवल यह अनुमान लगाना चाहिए कि क्या मौजूद है बल्कि कुछ वस्तुएँ क्यों अंतःक्रिया करती हैं। जबकि नए डेटासेट अधिक पैमाने या विविधता प्रदान कर सकते हैं, Visual Genome के विस्तृत एनोटेशन दृश्य दृश्यों की रचनात्मक प्रकृति का अध्ययन करने के लिए एक अद्वितीय आधार प्रदान करते हैं, एक चुनौती जो मानव-स्तरीय दृश्य बुद्धिमत्ता प्राप्त करने के लिए केंद्रीय बनी हुई है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·scene-graph·visual-reasoning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास