अंग्रेज़ी से अनुवादित

Natural Questions Open एक बेंचमार्क डेटासेट है जो ओपन-डोमेन प्रश्न उत्तरण के लिए है, जो Google खोज क्वेरी से प्राप्त होता है और जिसमें उत्तर मानव द्वारा एनोटेट किए जाते हैं।

Natural Questions Open खुले-डोमेन प्रश्न उत्तर (QA) के लिए एक बेंचमार्क डेटासेट है। इसे 2019 में Google द्वारा Natural Questions (NQ) डेटासेट के हिस्से के रूप में पेश किया गया था, जिसमें Google खोज इंजन को भेजे गए वास्तविक अनामित क्वेरी शामिल हैं। 'Open' संस्करण एकल विकिपीडिया पृष्ठ के संदर्भ को हटा देता है और विकिपीडिया जैसे बड़े कॉर्पस से सीधे प्रश्नों का उत्तर देने की आवश्यकता होती है, जिससे यह पुनर्प्राप्ति-संवर्धित QA प्रणालियों के लिए एक मानक मूल्यांकन सेट बन जाता है।

डेटासेट में 300,000 से अधिक प्राकृतिक प्रश्न शामिल हैं, जिनमें से प्रत्येक एक छोटे उत्तर (पाठ का एक स्पैन) और एक लंबे उत्तर (एक विकिपीडिया पैराग्राफ) के साथ जोड़ा गया है। Open संस्करण, जिसे औपचारिक रूप से Natural Questions - Open के रूप में जाना जाता है, पृष्ठ-स्तरीय पर्यवेक्षण को हटाकर और एक खुले दस्तावेज़ संग्रह से उत्तर खोजने की प्रणाली की क्षमता का मूल्यांकन करके मूल कार्य को सरल बनाता है। यह सेटअप खुले-डोमेन QA मॉडल की तुलना के लिए एक विहित परीक्षण मंच बन गया है, जिसमें Transformer (architecture) आर्किटेक्चर और बड़े भाषा मॉडल पर आधारित मॉडल शामिल हैं।

Natural Questions Open का विकास कृत्रिम बुद्धिमत्ता में व्यापक प्रगति के साथ संरेखित है, विशेष रूप से मशीन लर्निंग और डीप लर्निंग में। इस बेंचमार्क का उपयोग BERT जैसे तंत्रिका नेटवर्क और बाद में जनरेटिव AI मॉडल पर निर्मित प्रणालियों के प्रदर्शन को मापने के लिए किया गया है। शोधकर्ता अक्सर पुनर्प्राप्ति-संवर्धित जनरेशन को उन मॉडलों के साथ जोड़ते हैं जो पुनर्प्राप्त पाठों पर तर्क करने के लिए मल्टी-हेड अटेंशन और पोजिशनल एन्कोडिंग का लाभ उठाते हैं।

कार्य और मूल्यांकन

खुले-डोमेन सेटिंग में, एक प्रणाली को प्रत्येक प्रश्न के लिए एक उत्तर, आमतौर पर एक छोटा स्पैन, लौटाना होता है। मूल्यांकन सटीक मिलान (EM) और F1 स्कोर मेट्रिक्स का उपयोग करता है, जो पूर्वानुमानित उत्तर की तुलना एनोटेटेड उत्तर से करता है, जिसमें विराम चिह्न और लेखों के लिए सामान्यीकरण होता है। कुल डेटासेट में dev और test विभाजन शामिल हैं, जो मजबूत मॉडल विकास और तुलना की अनुमति देते हैं।

सिस्टम आमतौर पर दो-चरणीय दृष्टिकोण अपनाते हैं: पहले, एक पुनर्प्राप्तिकर्ता विकिपीडिया से प्रासंगिक अनुच्छेदों का चयन करता है; दूसरे, एक पाठक (अक्सर एक Encoder-Decoder Architecture या Sequence-to-Sequence (Seq2Seq) मॉडल) उत्तर निकालता है। बीम सर्च डिकोडिंग और टॉप-के सैंपलिंग उत्तर उत्पन्न करने के लिए सामान्य रणनीतियाँ हैं।

बेंचमार्क प्रभाव

Natural Questions Open SQuAD और TriviaQA के साथ खुले-डोमेन QA के लिए व्यापक रूप से अपनाए गए बेंचमार्क में से एक बन गया। इसने REALM (2020) और RAG (2020) जैसे पुनर्प्राप्ति-संवर्धित आर्किटेक्चर के उदय में योगदान दिया, जिन्होंने Transformer (architecture)-आधारित पुनर्प्राप्ति और जनरेशन को संयोजित किया। 2021 में, Andorra प्रणाली ने एक पुनर्प्राप्तिकर्ता-पाठक आर्किचेक्चर को एक फाइन-ट्यून Generative AI मॉडल के साथ जोड़ा। डेटासेट का उपयोग Google DeepMind और अन्य कृत्रिम बुद्धिमत्ता प्रयोगशालाओं द्वारा प्रश्न उत्तर क्षमताओं को आगे बढ़ाने के लिए भी किया गया है।

खुले-डोमेन QA का कार्य Natural Questions मूल के निर्माण से निकटता से संबंधित है, जिसमें लंबे उत्तरों के साथ एक समृद्ध एनोटेशन शामिल है। खुलापन इसे बड़े भाषा मॉडल प्रणालियों के लिए एक चुनौती बनाता है, जिन्हें स्पष्ट पुनर्प्राप्ति के बिना उत्तर देना पड़ सकता है।

हाल के विकास

2020 के दशक की शुरुआत तक, बड़े पूर्व-प्रशिक्षित मॉडल पर आधारित प्रणालियों ने परीक्षण सेट पर मजबूत परिणाम प्राप्त किए हैं, जिसमें EM स्कोर 50% से अधिक है। उदाहरण के लिए, Google Research का 2021 का एक मॉडल परीक्षण सेट पर 54.6% का EM प्राप्त करता है, जबकि Generative AI के साथ पुनर्प्राप्ति को जोड़ने वाला एक दृष्टिकोण बाद में 56.4% तक पहुंच गया। 2022 में, AI प्रयोगशालाओं के नोटिस ने पाठ जनरेशन को संरेखित करने के लिए सुदृढीकरण लर्निंग के साथ RLAIF के अनुप्रयोग पर ध्यान दिया। हालांकि, सटीक लीडरबोर्ड दावे समय के साथ भिन्न हो सकते हैं।

वास्तविक-विश्व अनुप्रयोग

Natural Questions Open खोज से अंतर्दृष्टि ने वाणिज्यिक प्रणालियों को प्रभावित किया है, उदाहरण के लिए: प्रश्न कमजोर पड़ने की पुनर्प्राप्ति गिरावट और घने पुनर्प्राप्ति की आवश्यकता का उपयोग Google Cloud और Amazon Web Services द्वारा खोज के लिए किया जाता है। एक समान सेट अक्सर वॉयस असिस्टेंट और कंप्यूटर-आधारित प्रणालियों का मूल्यांकन करने के लिए उपयोग किया जाता है। फिर भी, डेटासेट QA अनुसंधान की एक स्थायी उप-रेखा के रूप में बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·question-answering·benchmark·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास