MS MARCO (Microsoft Machine Reading Comprehension) 2016 में Microsoft द्वारा मशीन रीडिंग कॉम्प्रिहेंशन और पैसेज रैंकिंग कार्यों के लिए पेश किया गया एक बड़े पैमाने का डेटासेट है। यह डेटासेट पहले के प्रश्न-उत्तर बेंचमार्क की सीमाओं को दूर करने के लिए डिज़ाइन किया गया था, जिसमें Bing सर्च इंजन लॉग से वास्तविक उपयोगकर्ता क्वेरी, वेब दस्तावेज़ों से प्रासंगिक पैसेज और मानव-जनित प्राकृतिक भाषा उत्तर शामिल हैं। इसके निर्माण और सार्वजनिक रिलीज़ ने शोधकर्ताओं को बड़े पैमाने पर पाठ को पुनर्प्राप्त करने और व्याख्या करने वाली प्रणालियों को विकसित और मूल्यांकन करने में सक्षम बनाया, जिससे पारंपरिक सूचना पुनर्प्राप्ति और डीप लर्निंग-आधारित कॉम्प्रिहेंशन मॉडल के बीच की खाई को पाटा गया।
MS MARCO में प्रत्येक नमूने में एक वास्तविक उपयोगकर्ता क्वेरी, प्रासंगिकता के लिए निर्धारित पैसेज का एक सेट, और (नमूनों के एक उपसमुच्चय के लिए) एक मानव-लिखित उत्तर शामिल है। डेटासेट में मूल प्रश्न-उत्तर कार्य के लिए 100,000 से अधिक क्वेरी शामिल हैं, साथ ही पैसेज रैंकिंग के लिए एक बड़ा संस्करण भी है। जारी किए गए डेटा में क्राउडसोर्सिंग के माध्यम से उत्पन्न प्रासंगिकता लेबल शामिल हैं, और उत्तर मानव एनोटेटरों द्वारा लिखे गए थे। MS MARCO का व्यापक रूप से पैसेज री-रैंकिंग, मशीन रीडिंग कॉम्प्रिहेंशन और ओपन-डोमेन प्रश्न-उत्तर जैसे कार्यों के लिए एक मानक बेंचमार्क के रूप में उपयोग किया गया है।
Dataset Structure
मूल MS MARCO डेटासेट क्वेरी को आवश्यक उत्तर के प्रकार के आधार पर तीन मुख्य श्रेणियों में व्यवस्थित करता है: एंटिटी, संख्यात्मक और पैसेज-शैली प्रश्न। पैसेज-रैंकिंग कार्यों के लिए, डेटासेट मानव एनोटेटर निर्णयों के आधार पर नकारात्मक उदाहरण (गैर-प्रासंगिक पैसेज) और सकारात्मक लेबल प्रदान करता है। डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेट में विभाजित किया गया है। समय के साथ, Microsoft ने कई संस्करण और व्युत्पन्न कार्य जारी किए, जिनमें एक संवादात्मक खोज उपसमुच्चय (MS MARCO ConvSearch) और एक बड़ा पैसेज-रैंकिंग संग्रह शामिल है। वास्तविक खोज लॉग से लिया गया डेटासेट का पैमाना और यथार्थवाद, इसे पहले के सिंथेटिक डेटासेट से अलग बनाता है।
Benchmark Tasks
MS MARCO ने कई मानक मूल्यांकन कार्य पेश किए। प्राथमिक कार्य पैसेज री-रैंकिंग है, जहां एक मॉडल को मानव लेबल का उपयोग करके क्वेरी के लिए प्रासंगिकता के अनुसार पुनर्प्राप्त पैसेज के एक सेट को क्रमबद्ध करना होता है। दूसरा प्रमुख कार्य मशीन रीडिंग कॉम्प्रिहेंशन (MaRC) है, जहां एक मॉडल एक प्रासंगिक पैसेज पढ़ता है और एक सटीक उत्तर (एक स्पैन) उत्पन्न करता है या एक अमूर्त धाराप्रवाह उत्तर तैयार करता है। बाद में, एक पूर्ण-पैराग्राफ रैंकिंग कार्य और अतिरिक्त संदर्भ के साथ प्रश्न-उत्तर भी शामिल किए गए। प्रदर्शन को आमतौर पर MRR (Mean Reciprocal Rank), nDCG (Normalized Discounted Cumulative Gain) और रिकॉल जैसे मेट्रिक्स का उपयोग करके मापा जाता है। बेंचमार्क ने ट्रांसफॉर्मर-आधारित पुनर्प्राप्ति प्रणालियों में महत्वपूर्ण प्रगति को बढ़ावा दिया है।
Applications and Impact
MS MARCO तंत्रिका पुनर्प्राप्ति मॉडल के विकास के लिए एक आधारभूत संसाधन बन गया। इसका उपयोग अक्सर प्रमुख शोध समूहों द्वारा किया जाता था, जिनमें MIT CSAIL और Stanford AI Lab जैसे विश्वविद्यालयों के साथ-साथ Google DeepMind और Anthropic जैसी औद्योगिक प्रयोगशालाएं शामिल हैं, जो बड़े भाषा मॉडल और डेंस पुनर्प्राप्ति प्रणालियों को फाइन-ट्यून करने के लिए उपयोग करती हैं। इस डेटासेट का उपयोग करके विकसित उन्नत मॉडलों ने खोज इंजन और संवादात्मक सहायकों के डिज़ाइन को प्रभावित किया है, जो शाब्दिक मिलान से शब्दार्थ एम्बेडिंग और तंत्रिका री-रैंकिंग पाइपलाइनों की ओर बढ़ रहे हैं। डेटासेट की सफलता ने इसे TREC (Text Retrieval Conference) ट्रैक्स में एक आधिकारिक मूल्यांकन स्तंभ के रूप में एकीकृत करने में भी अग्रणी भूमिका निभाई।
Continued Relevance
MS MARCO ने आधुनिक बेंचमार्क जैसे कि दस्तावेज़ रैंकिंग के लिए MS MARCO के अग्रदूत के रूप में भी काम किया है, जिसने ColBERT जैसे मल्टी-वेक्टर मॉडल को प्रशिक्षित करने के लिए पैसेज और दस्तावेज़ वैक्टर प्रदान किए। 2024 तक, डेटासेट डेंस पुनर्प्राप्ति और रीडिंग कॉम्प्रिहेंशन दोनों में नई तकनीकों का मूल्यांकन करने के लिए एक व्यापक रूप से उद्धृत और आमतौर पर उपयोग किया जाने वाला बेंचमार्क बना हुआ है। कई समकालीन पुनर्प्राप्ति प्रणालियाँ, जिनमें Transformer (architecture) आर्किटेक्चर और Pretraining पद्धतियों का उपयोग करने वाली प्रणालियाँ शामिल हैं, का मूल्यांकन MS MARCO के खिलाफ [owning] लीडरबोर्ड पर किया जाता है। इसकी वास्तविक-दुनिया की नींव डोमेन शिफ्ट, डेटा अक्षमता और फ्यू-शॉट लर्निंग में अनुसंधान का समर्थन करना जारी रखती है।
Related Prompts
डेटासेट के डिज़ाइन सिद्धांत OpenAI और Anthropic जैसी कंपनियों की शोध टीमों द्वारा बनाए गए अन्य बड़े पैमाने के संसाधनों के साथ संरेखित हैं, हालांकि वे जनरेटिव कार्यों पर केंद्रित हैं। पैसेज और प्रश्न-उत्तर से इसकी प्रासंगिकता Neural network प्रशिक्षण, Microsoft Azure बुनियादी ढांचे और कर्मचारी की रोबोटिक्स द्वारा Amazon पृष्ठों से खुले स्रोत से भी ओवरलैप होती है[छोड़ा गया।