अंग्रेज़ी से अनुवादित

WebQuestionsSP फ्रीबेस पर प्रश्न उत्तर देने के लिए एक सिमेंटिक पार्सिंग डेटासेट है, जिसमें 4,737 प्रश्न-SPARQL क्वेरी जोड़े शामिल हैं, जिनका उपयोग उन प्रणालियों को प्रशिक्षित और मूल्यांकन करने के लिए किया जाता है जो प्राकृतिक भाषा के प्रश्नों को निष्पादन योग्य [[knowledge-graph|ज्ञान ग्राफ]] क्वेरी में बदलती हैं।

WebQuestionsSP (WebQSP) कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में एक बेंचमार्क डेटासेट है, जिसे नॉलेज ग्राफ पर सिमेंटिक पार्सिंग के कार्य के लिए डिज़ाइन किया गया है। इसमें 4,737 प्राकृतिक भाषा प्रश्न शामिल हैं, जिनके साथ उनके संबंधित SPARQL क्वेरी जोड़े गए हैं, जो Freebase नॉलेज बेस को लक्षित करते हैं। यह डेटासेट 2016 में वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा पेश किया गया था, और तब से यह संरचित डेटा पर काम करने वाले प्रश्न उत्तर प्रणालियों के लिए एक मानक मूल्यांकन सेट बन गया है।

WebQuestionsSP का प्राथमिक उद्देश्य प्राकृतिक भाषा समझ और संरचित क्वेरी निष्पादन के बीच की खाई को पाटना है। पहले के डेटासेट के विपरीत, जो सरल तथ्यात्मक उत्तरों पर केंद्रित थे, WebQuestionsSP को सिस्टम से निष्पादन योग्य SPARQL क्वेरी उत्पन्न करने की आवश्यकता होती है जो Freebase से उत्तर प्राप्त कर सकें। यह इसे उन मॉडलों के लिए एक चुनौतीपूर्ण परीक्षण मंच बनाता है जिन्हें भाषाई अभिव्यक्तियों को तार्किक रूपों में मैप करना, मल्टी-हॉप तर्क को संभालना और जटिल बाधाओं का प्रबंधन करना सीखना होता है।

डेटासेट निर्माण

WebQuestionsSP को मूल WebQuestions डेटासेट का विस्तार करके बनाया गया था, जिसमें वास्तविक उपयोगकर्ता क्वेरी से एकत्रित प्रश्न-उत्तर जोड़े शामिल थे। निर्माताओं ने 4,737 प्रश्नों का एक उपसमूह चुना जिन्हें Freebase का उपयोग करके उत्तर दिया जा सकता था, और प्रत्येक को मैन्युअल रूप से SPARQL क्वेरी के साथ एनोटेट किया। प्रश्न विभिन्न विषयों को कवर करते हैं, जिनमें लोग, स्थान और घटनाएँ शामिल हैं, और सरल एकल-संबंध क्वेरी से लेकर अधिक जटिल बहु-संबंध और मल्टी-हॉप क्वेरी तक होते हैं।

एनोटेशन प्रक्रिया में यह सुनिश्चित करना शामिल था कि प्रत्येक प्रश्न का Freebase में एक अद्वितीय उत्तर सेट हो, और SPARQL क्वेरी सही और न्यूनतम दोनों हो। डेटासेट को प्रशिक्षण (2,837 प्रश्न), विकास (250 प्रश्न) और परीक्षण (1,650 प्रश्न) सेट में विभाजित किया गया था, जो विभिन्न दृष्टिकोणों की तुलना के लिए एक मानकीकृत बेंचमार्क प्रदान करता है।

मूल्यांकन और मेट्रिक्स

WebQuestionsSP पर मूल्यांकन किए गए सिस्टम को आमतौर पर सटीक मिलान (F1) और उत्तर सटीकता जैसे सटीकता मेट्रिक्स का उपयोग करके स्कोर किया जाता है। सटीक मिलान के लिए पूर्वानुमानित उत्तर सेट को ग्राउंड ट्रुथ के समान होना आवश्यक है, जबकि उत्तर सटीकता पूर्वानुमानित और सही उत्तरों के बीच ओवरलैप के आधार पर आंशिक क्रेडिट की अनुमति देती है। डेटासेट का उपयोग सिमेंटिक पार्सिंग में प्रगति को मापने के लिए किया गया है, जिसमें शुरुआती मॉडल लगभग 50% सटीकता प्राप्त करते हैं और हाल के तंत्रिका नेटवर्क-आधारित दृष्टिकोण 70% से अधिक तक पहुँचते हैं।

अनुसंधान में भूमिका

WebQuestionsSP ने नॉलेज बेस पर प्रश्न उत्तर देने के अनुसंधान को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। इसका उपयोग अनुक्रम-से-अनुक्रम आर्किटेक्चर, ट्रांसफॉर्मर-आधारित एनकोडर और बड़े भाषा मॉडल फाइन-ट्यूनिंग का उपयोग करने वाले मॉडलों को प्रशिक्षित और मूल्यांकन करने के लिए किया गया है। डेटासेट संरचित आउटपुट जनरेशन के संदर्भ में मल्टी-हेड अटेंशन तंत्र और बीम-सर्च डिकोडिंग रणनीतियों का अध्ययन करने के लिए भी एक संसाधन के रूप में कार्य करता है।

शोधकर्ताओं ने सामान्यीकरण में सुधार के लिए डेटा-वृद्धि, पाठ्यक्रम-शिक्षण और मॉडल-प्रूनिंग जैसी तकनीकों का पता लगाने के लिए WebQuestionsSP का उपयोग किया है। डेटासेट प्रतीकात्मक तर्क को तंत्रिका दृष्टिकोण के साथ संयोजित करने वाली विधियों को विकसित करने के साथ-साथ वितरण से बाहर के प्रश्नों को संभालने की मॉडलों की क्षमता का मूल्यांकन करने में भी सहायक रहा है।

सीमाएँ और विस्तार

अपनी उपयोगिता के बावजूद, WebQuestionsSP में ज्ञात सीमाएँ हैं। यह Freebase पर आधारित है, जिसे 2015 में बंद कर दिया गया था, जिससे मूल नॉलेज बेस के खिलाफ क्वेरी निष्पादित करना मुश्किल हो जाता है। हालाँकि, डेटासेट ऑफ़लाइन मूल्यांकन के लिए मूल्यवान बना हुआ है, और कई सिस्टम Freebase का कैश्ड संस्करण उपयोग करते हैं या क्वेरी को अन्य प्रारूपों में परिवर्तित करते हैं। इसके अतिरिक्त, प्रश्न अपेक्षाकृत छोटे हैं और वास्तविक दुनिया के उपयोगकर्ता प्रश्नों की पूर्ण जटिलता को पकड़ नहीं सकते हैं।

WebQuestionsSP के विस्तार में WebQSP-DBpedia शामिल है, जो DBpedia के साथ काम करने के लिए क्वेरी का अनुवाद करता है, और अन्य डेटासेट जो अस्थायी या बहुभाषी पहलुओं को शामिल करते हैं। ये विस्तार मूल डेटासेट की कुछ बाधाओं को संबोधित करने और इसकी प्रयोज्यता को व्यापक बनाने का लक्ष्य रखते हैं।

प्रभाव और विरासत

WebQuestionsSP सिमेंटिक पार्सिंग समुदाय में एक वास्तविक मानक बन गया है, जिसने ComplexWebQuestions और KQA Pro जैसे बाद के बेंचमार्क के डिज़ाइन को प्रभावित किया है। निष्पादन योग्य क्वेरी पर इसका ध्यान ऐसे मॉडलों के विकास को प्रोत्साहित करता है जो व्याख्या योग्य मध्यवर्ती प्रतिनिधित्व उत्पन्न करते हैं, जो AI सिस्टम में डिबगिंग और विश्वास के लिए महत्वपूर्ण है। डेटासेट को जनरेटिव एआई और डीप लर्निंग पर अनुसंधान में उद्धृत किया जाता रहा है, जो यह समझने के लिए एक आधार के रूप में कार्य करता है कि मशीनें प्राकृतिक भाषा को सटीक, संरचित क्रियाओं में कैसे अनुवाद कर सकती हैं।

यह भी देखें

संदर्भ

  • Yih, W., et al. (2016). "Value-based search for semantic parsing." Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics.
  • Berant, J., et al. (2013). "Semantic parsing on Freebase from question-answer pairs." Proceedings of the 2013 Conference on Empirical Methods in Natural Language Processing.
  • Abujabal, A., et al. (2017). "Automated template generation for question answering over knowledge graphs." Proceedings of the 26th International Conference on World Wide Web.

बाहरी लिंक

  • WebQuestionsSP डेटासेट पृष्ठ (बाहरी URL प्रतिबंध के कारण उपलब्ध नहीं)

श्रेणियाँ

इन्फोबॉक्स

  • प्रकार: सिमेंटिक पार्सिंग डेटासेट
  • पेश किया गया: 2016
  • पेशकर्ता: वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस
  • संबंधित: freebase, sparql, question-answering

टैग

  • semantic-parsing
  • question-answering
  • knowledge-graph
  • benchmark
  • natural-language-processing

---

यह लेख WebQuestionsSP का एक व्यापक अवलोकन प्रदान करता है, जो इसके निर्माण, मूल्यांकन और AI के क्षेत्र पर इसके प्रभाव को उजागर करता है। डेटासेट उन शोधकर्ताओं के लिए एक महत्वपूर्ण संसाधन बना हुआ है जो संरचित ज्ञान को समझने और क्वेरी करने वाली प्रणालियों का विकास कर रहे हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:semantic-parsing·question-answering·knowledge-graph·benchmark-dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास