अंग्रेज़ी से अनुवादित

MMQA एक मल्टीमॉडल प्रश्न उत्तर डेटासेट है जो पाठ, छवियों, तालिकाओं और वीडियो को मिलाकर AI मॉडलों की क्षमता का मूल्यांकन करता है कि वे कई मोडैलिटीज़ में जटिल प्रश्नों के उत्तर दे सकें, इसे 2019 में Facebook AI Research द्वारा प्रस्तुत किया गया था।

MMQA (मल्टीमॉडल प्रश्न उत्तर) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की उन प्रश्नों का उत्तर देने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिनके लिए पाठ, चित्र, तालिकाओं और वीडियो सहित कई प्रकार के डेटा में तर्क की आवश्यकता होती है। 2019 में फेसबुक एआई रिसर्च (अब मेटा एआई का हिस्सा) के शोधकर्ताओं द्वारा पेश किया गया, यह डेटासेट पहले के प्रश्न उत्तर बेंचमार्क की सीमा को संबोधित करता है जो एकल मोडैलिटी पर केंद्रित थे, जैसे कि केवल पाठ या केवल चित्र इनपुट। MMQA विभिन्न प्रकार के प्रश्न और संबंधित उत्तर प्रदान करता है जो विभिन्न स्रोतों से जानकारी के एकीकरण की आवश्यकता को दर्शाते हैं, जो Machine learning और Deep learning मॉडल की सीमाओं को अधिक मानव-समान समझ की ओर धकेलता है।

यह डेटासेट उन मॉडलों के विकास का समर्थन करने के लिए बनाया गया था जो वास्तविक दुनिया के प्रश्नों को संभाल सकते हैं जहां जानकारी विभिन्न प्रारूपों में बिखरी हुई है। पारंपरिक डेटासेट के विपरीत जो सत्य के एकल स्रोत को मानते हैं, MMQA के लिए सिस्टम को एक साथ कई मोडैलिटी से साक्ष्य का पता लगाने, संयोजन करने और तर्क करने की आवश्यकता होती है। यह इसे Neural network आर्किटेक्चर के लिए एक चुनौतीपूर्ण परीक्षण मंच बनाता है, विशेष रूप से Transformer (architecture) मॉडल पर आधारित, जो Natural language processing और मल्टीमॉडल समझ में प्रमुख दृष्टिकोण बन गए हैं।

निर्माण और संरचना

MMQA का निर्माण क्राउडवर्कर्स से प्रश्न एकत्र करके किया गया था, जिन्हें विकिपीडिया लेखों का एक सेट दिखाया गया था, जिनमें से प्रत्येक में पाठ, चित्र, तालिकाएँ और कुछ मामलों में वीडियो शामिल थे। श्रमिकों को ऐसे प्रश्न उत्पन्न करने के लिए कहा गया था जिनका उत्तर केवल कम से कम दो अलग-अलग मोडैलिटी से जानकारी को संयोजित करके दिया जा सकता था। उदाहरण के लिए, एक प्रश्न के लिए आँकड़ों की तालिका पढ़ने और संबंध का अनुमान लगाने के लिए एक छवि देखने की आवश्यकता हो सकती है, या एक वीडियो क्लिप देखने और तथ्यात्मक प्रश्न का उत्तर देने के लिए एक पाठ अनुच्छेद पढ़ने की आवश्यकता हो सकती है।

अंतिम डेटासेट में 12,000 से अधिक प्रश्न-उत्तर जोड़े शामिल हैं, जिनमें से प्रत्येक प्रश्न एक विशिष्ट विकिपीडिया पृष्ठ से जुड़ा हुआ है। उत्तर पाठ के छोटे खंड हैं, आमतौर पर कुछ शब्द, जो स्रोत सामग्री से निकाले जाते हैं। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट का उपयोग आधिकारिक मूल्यांकन के लिए किया जाता है। प्रश्न जटिल होने के लिए डिज़ाइन किए गए हैं और अक्सर बहु-चरणीय तर्क की आवश्यकता होती है, जिससे डेटासेट SQuAD या VQA जैसे एकल-मोडैलिटी बेंचमार्क की तुलना में काफी अधिक कठिन हो जाता है।

मूल्यांकन और मेट्रिक्स

मॉडलों का मूल्यांकन MMQA पर मानक प्रश्न उत्तर मेट्रिक्स का उपयोग करके किया जाता है, मुख्य रूप से सटीक मिलान (EM) और F1 स्कोर। EM उन प्रश्नों के प्रतिशत को मापता है जहां मॉडल का अनुमानित उत्तर ग्राउंड ट्रुथ से बिल्कुल मेल खाता है, जबकि F1 भविष्यवाणी और ग्राउंड ट्रुथ के बीच टोकन के ओवरलैप की गणना करता है, जिससे आंशिक क्रेडिट की अनुमति मिलती है। चूंकि उत्तर छोटे खंड हैं, ये मेट्रिक्स सटीकता का एक सीधा माप प्रदान करते हैं।

MMQA पर सफल होने के लिए, एक मॉडल को न केवल प्रत्येक मोडैलिटी को व्यक्तिगत रूप से समझना चाहिए, बल्कि उनके बीच जानकारी को संरेखित और संलयन करना भी सीखना चाहिए। इसके लिए परिष्कृत आर्किटेक्चर की आवश्यकता होती है जो चित्रों, तालिकाओं और वीडियो को एक सामान्य प्रतिनिधित्व स्थान में एन्कोड कर सकते हैं, अक्सर पूर्व-प्रशिक्षित विज़न और भाषा मॉडल का उपयोग करते हुए। प्रारंभिक बेसलाइन, जैसे कि सुविधाओं का सरल संयोजन, खराब प्रदर्शन करते थे, जो अधिक उन्नत मल्टीमॉडल संलयन तकनीकों की आवश्यकता को उजागर करता है।

प्रभाव और संबंधित कार्य

MMQA ने मल्टीमॉडल समझ में बाद के शोध को प्रभावित किया है और कई अध्ययनों में एक बेंचमार्क के रूप में उपयोग किया गया है। इसे अक्सर विज़ुअल प्रश्न उत्तर (VQA) और TextVQA जैसे अन्य मल्टीमॉडल डेटासेट के साथ उद्धृत किया जाता है, लेकिन यह तालिकाओं और वीडियो को शामिल करने के कारण अलग है, जो अन्य बेंचमार्क में कम आम हैं। डेटासेट ने उन मॉडलों के विकास को प्रोत्साहित किया है जो पाठ और चित्रों पर संयुक्त रूप से तर्क कर सकते हैं, और बाद के विस्तारों ने ऑडियो और अन्य मोडैलिटी को शामिल किया है।

MMQA की रिलीज़ Large language model और Generative AI प्रणालियों के उदय के साथ हुई, जिन्होंने मल्टीमॉडल कार्यों में उल्लेखनीय क्षमताएँ दिखाई हैं। हालांकि, 2024 तक के सबसे आधुनिक मॉडल भी MMQA को चुनौतीपूर्ण पाते हैं, विशेष रूप से उन प्रश्नों के लिए जिनमें तालिकाओं या वीडियो पर सूक्ष्म तर्क की आवश्यकता होती है। इसने MMQA को वास्तविक दुनिया के परिदृश्यों में Artificial intelligence प्रणालियों की मजबूती का मूल्यांकन करने के लिए एक मूल्यवान तनाव परीक्षण बना दिया है।

सीमाएँ और भविष्य की दिशाएँ

MMQA की एक सीमा यह है कि यह विकिपीडिया लेखों पर निर्भर करता है, जो मुख्य रूप से अंग्रेजी में हैं और पश्चिमी-केंद्रित पूर्वाग्रह रखते हैं। यह डेटासेट में प्रस्तुत सांस्कृतिक और भाषाई संदर्भों की विविधता को सीमित करता है। इसके अतिरिक्त, उत्तर छोटे खंडों तक सीमित हैं, जो कुछ प्रश्नों की पूर्ण जटिलता को पकड़ नहीं सकते हैं जिनके लिए लंबे स्पष्टीकरण की आवश्यकता होती है।

इस क्षेत्र में भविष्य के कार्य में MMQA को अधिक भाषाओं, अधिक विविध स्रोतों और लंबे-रूप वाले उत्तरों को शामिल करने के लिए विस्तारित करना शामिल हो सकता है। शोधकर्ता यह भी खोज रहे हैं कि मॉडलों को अधिक व्याख्यात्मक कैसे बनाया जाए, ताकि वे अपने उत्तरों के पीछे तर्क प्रक्रिया को समझा सकें। जैसे-जैसे मल्टीमॉडल एआई विकसित होता रहता है, MMQA जैसे डेटासेट प्रगति को मापने और उन क्षेत्रों की पहचान करने के लिए आवश्यक रहेंगे जहां मॉडल मानव-स्तरीय समझ से कम हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:question-answering·multimodal-dataset·benchmark·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास