अंग्रेज़ी से अनुवादित

WebQuestions एक बेंचमार्क डेटासेट है जिसमें Freebase पर 5,810 प्रश्न-उत्तर जोड़े शामिल हैं, जिसका उपयोग सिमेंटिक पार्सिंग और प्रश्न उत्तर प्रणालियों का मूल्यांकन करने के लिए किया जाता है। इसे 2013 में Google शोधकर्ताओं द्वारा पेश किया गया था।

WebQuestions कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में एक बेंचमार्क डेटासेट है, जो संरचित ज्ञान ग्राफ Freebase पर प्रश्न उत्तर प्रणालियों का मूल्यांकन करने के लिए उपयोग किया जाता है। इस डेटासेट में 5,810 प्रश्न-उत्तर जोड़े शामिल हैं, जहाँ प्रत्येक प्रश्न एक प्राकृतिक भाषा क्वेरी है और उत्तर Freebase से संस्थाओं या मानों का एक समूह है। इसे 2013 में Google के शोधकर्ताओं द्वारा पेश किया गया था, ताकि सिमेंटिक पार्सिंग और ज्ञान आधार प्रश्न उत्तर के लिए बड़े पैमाने पर, यथार्थवादी बेंचमार्क की कमी को दूर किया जा सके।

WebQuestions का निर्माण Google Suggest API का उपयोग करके किया गया था, ताकि वास्तविक प्रश्नों को खोजा जा सके जो लोग वास्तव में टाइप करते हैं, फिर एनोटेटर्स ने प्रत्येक प्रश्न को Freebase में संस्थाओं और उत्तरों से मिलाया। यह डिज़ाइन प्रश्नों को पहले के सिंथेटिक बेंचमार्क की तुलना में वास्तविक दुनिया के उपयोगकर्ता क्वेरीज़ का अधिक प्रतिनिधित्व करता है। डेटासेट को 3,778 प्रश्नों के प्रशिक्षण सेट और 2,032 प्रश्नों के परीक्षण सेट में विभाजित किया गया है। 200 प्रश्नों का एक सामान्य रूप से उपयोग किया जाने वाला विकास सेट भी बनाया गया था, हालाँकि यह आधिकारिक वितरण का हिस्सा नहीं है। यह बेंचमार्क जल्दी ही उन प्रणालियों के लिए एक मानक परीक्षण मंच बन गया जो प्राकृतिक भाषा को तार्किक रूपों या सीधे ज्ञान आधार में उत्तरों में मैप करते हैं।

निर्माण और एनोटेशन

प्रश्न Google के खोज सुझाव लॉग से चुने गए थे, विशेष रूप से उन प्रश्नों को लक्षित करते हुए जो "क्या", "कौन", "कब" और "कहाँ" जैसे वाक्यांशों से शुरू होते हैं। प्रत्येक प्रश्न को पूर्व-परिभाषित शब्दकोश का उपयोग करके SPARQL-जैसी क्वेरी के साथ मैन्युअल रूप से एनोटेट किया गया था, और अंतिम उत्तर Freebase डेटाबेस के विरुद्ध उस क्वेरी को निष्पादित करने का परिणाम है। एनोटेशन क्राउडसोर्सिंग (Amazon Mechanical Turk) के माध्यम से बनाए गए थे और फिर कार्यकर्ताओं के दूसरे दौर द्वारा सत्यापित किए गए थे। डेटासेट का एक उल्लेखनीय पहलू यह है कि कुछ प्रश्न अस्पष्ट हैं - एक प्रश्न के कई वैध उत्तर हो सकते हैं जो व्याख्या पर निर्भर करते हैं, और एनोटेटर्स को सबसे सामान्य रूप से अपेक्षित उत्तर चुनने का निर्देश दिया गया था।

बेंचमार्क का आधिकारिक पेपर, "Semantic Parsing on Freebase from Question-Answer Pairs" (EMNLP 2013), ने डेटासेट और आधार रेखा परिणाम पेश किए। लेखक माइकल जे. कैफरेला, जोनाथन बेरेंट, एंड्रयू चाउ, और पर्सी लियांग - मुख्य लेखक - कैलिफोर्निया विश्वविद्यालय, बर्कले में थे। webQuestions डेटासेट ने कई बाद की प्रणालियों के लिए केंद्रीय मूल्यांकन संसाधन के रूप में कार्य किया, जिसमें पेपर का अपना lambda-DCS आधारित सिमेंटिक पार्सर शामिल था।

प्रश्न उत्तर अनुसंधान के लिए प्रासंगिकता

WebQuestions को 2000 के दशक के प्रमुख सिंटैक्टिक पार्सिंग डेटासेट, जैसे GeoQuery या ATIS के सिमेंटिक पार्सिंग, के विरुद्ध प्रतिक्रिया देने के लिए डिज़ाइन किया गया था, जो सिंथेटिक प्रश्नों और सीमित डोमेन का उपयोग करते थे। इसके विपरीत, WebQuestions खुले-डोमेन है और इसमें बहुत बड़ा शब्दावली और Freebase संस्थाओं का व्यापक कवरेज है। इसने उन प्रणालियों के विकास को सक्षम किया जो शाब्दिक सिमेंटिक पार्सिंग को एम्बेडिंग-आधारित समानता के साथ जोड़ती हैं। रिलीज़ के बाद के वर्षों में, शोधकर्ताओं ने कई विस्तार बनाए, जिनमें WebQSP (WebQuestions - एक अधिक सूक्ष्म एंटेलमेंट विभाजन) और तंत्रिका मॉडल का उपयोग करके बेहतर उत्तर निष्कर्षण शामिल हैं।

WebQuestions की एक उल्लेखनीय सीमा यह है कि उत्तर सीधे Freebase से जुड़े हैं, जो एक ज्ञान ग्राफ है जिसे Google ने 2015 में बंद कर दिया था (हालाँकि डेटा स्नैपशॉट के माध्यम से सुलभ रहता है)। यह कई मॉडलों की वर्तमान ज्ञान आधारों में स्थानांतरण क्षमता को प्रभावित करता है। फिर भी, यह बेंचमार्क प्रश्न उत्तर में रचनात्मक सामान्यीकरण का मूल्यांकन करने के लिए एक प्रमुख साधन बना हुआ है।

डेटासेट एक प्रमुख चुनौती भी उजागर करता है: मुक्त-रूप प्राकृतिक भाषा और ज्ञान आधार की स्कीमा शर्तों के बीच शाब्दिक अंतर। कई प्रश्नों में समानार्थक शब्द, संक्षिप्ताक्षर, या अप्रत्यक्ष संबंधों को पहचानने की आवश्यकता होती है। इसने अव्यक्त मेंशन डिटेक्शन और एंटिटी लिंकिंग को अर्ध-पर्यवेक्षित तरीके से सीखने या विस्तारित करने के लिए अनुसंधान की एक श्रृंखला को प्रेरित किया, जो बाद में आधुनिक बड़े भाषा मॉडल युग के दृष्टिकोणों में शामिल हो गया।

पद्धति और मेट्रिक्स

प्राथमिक मूल्यांकन मीट्रिक औसत F1 है, जहाँ प्रत्येक प्रश्न के लिए, सिस्टम द्वारा भविष्यवाणी किए गए Freebase संस्थाओं/मानों के सेट की तुलना स्वर्ण उत्तर सेट से की जाती है। परिशुद्धता भविष्यवाणी किए गए उत्तरों का वह अंश है जो स्वर्ण सेट में पाए जाते हैं, पुनर्प्राप्ति वह अंश है जो सिस्टम स्वर्ण उत्तरों में से पाता है, और F1 स्कोर हार्मोनिक माध्य है। आधिकारिक मूल्यांकन कोड webQuestions GitHub रिपॉजिटरी पर साझा किया गया है। प्रारंभिक आधार रेखा प्रणालियों ने लगभग 0.30 के F1 स्कोर प्राप्त किए, और मूल परीक्षण सेट पर समकालीन प्रणालियाँ लगभग 2020 तक 0.78 से 0.79 तक पहुँच गईं, मुख्य रूप से GrailQA या Transformer-आधारित रीडर जैसे तंत्रिका एंड-टू-एंड दृष्टिकोण का उपयोग करते हुए। 2023 में, लगभग 0.84 के Sota प्रदर्शन की रिपोर्ट की गई है, लेकिन कुछ में विस्तारित एंटिटी लिंकिंग रणनीतियाँ शामिल हैं।

विरासत और प्रभाव

WebQuestions ने अन्य बेंचमार्क निर्माण प्रयासों को प्रभावित किया है, जैसे "ComplexQuestions" और "QALD" (लिंक्ड डेटा पर प्रश्न उत्तर)। इसका उपयोग ज्ञान ग्राफ एम्बेडिंग के साथ मॉडलों के विरोधात्मक परीक्षण के आधार के रूप में भी किया गया है। कई लोकप्रिय ओपन-सोर्स QA फ्रेमवर्क (जैसे KELT-DELER, या freebase) WebQuestions का उपयोग सैनिटी जांच के लिए करते हैं। यह सिमेंटिक पार्सिंग की मजबूती के लिए एक लगातार उपयोग किया जाने वाला बेंचमार्क बना हुआ है, विशेष रूप से जब एक पूर्व-प्रशिक्षित भाषा मॉडल को बाहरी ज्ञान आधार के साथ जोड़ा जाता है।

WebQuestions डेटासेट इसके निर्माताओं द्वारा बनाए रखा गया है, लेकिन 2023 तक, यह GitHub ("webquestions") पर संग्रहीत है और स्वतंत्र रूप से सुलभ है। डेटासेट में प्रश्न आईडी वाली एक फ़ाइल है जो अलग-अलग QR एंटिटी जोड़े से जुड़ती है, जिससे KG इंडेक्सिंग के साथ उपयोग करना आसान हो जाता है, लेकिन उपयोगकर्ताओं को यह सुनिश्चित करना होगा कि उनका Freebase डंप संस्करण एनोटेशन से मेल खाता है।

यह भी देखें

--कुछ उदाहरण हैं जो संयुक्त प्रतिनिधित्व स्थान के समान विचार पर आधारित हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:question-answering·dataset·knowledge-graph·nlp
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास