TriviaQA प्रश्न उत्तर (QA) और पठन समझ के लिए एक बड़े पैमाने का बेंचमार्क डेटासेट है, जिसे 2017 में वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था। इसे पहले के QA डेटासेट की सीमाओं को संबोधित करने के लिए बनाया गया था, जिसमें स्वाभाविक रूप से उत्पन्न प्रश्नों के साथ जटिल, बहु-वाक्य उत्तर और पर्याप्त सहायक साक्ष्य प्रदान किए गए थे। यह डेटासेट Machine learning मॉडलों, विशेष रूप से Deep learning और Transformer (architecture) आर्किटेक्चर पर आधारित मॉडलों के लिए एक मानक मूल्यांकन उपकरण बन गया है।
डेटासेट में 650,000 से अधिक प्रश्न-उत्तर-साक्ष्य ट्रिपल शामिल हैं, जो तीन ट्रिविया वेबसाइटों - QuizLeague, Wikipedia, और ट्रिविया पृष्ठों के वेब क्रॉल से एकत्र किए गए 95,000 प्रश्न-उत्तर जोड़ों से प्राप्त हुए हैं। प्रत्येक प्रश्न के साथ कई साक्ष्य दस्तावेज़ जोड़े गए हैं, आमतौर पर Wikipedia लेखों से, जिनमें उत्तर होता है। यह डिज़ाइन मॉडलों को लंबे अनुच्छेदों को पुनर्प्राप्त करने और उन पर तर्क करने के लिए मजबूर करता है, जिससे यह SQuAD जैसे पहले के डेटासेट की तुलना में अधिक चुनौतीपूर्ण हो जाता है, जो एकल-अनुच्छेद निष्कर्षण पर केंद्रित था।
निर्माण और आँकड़े
TriviaQA का निर्माण पहले वेब से ट्रिविया प्रश्नों और उनके उत्तरों को स्क्रैप करके किया गया था। प्रश्न स्वाभाविक रूप से वाक्यांशित होते हैं, जिनमें अक्सर मल्टी-हॉप तर्क, अस्थायी तर्क, या सामान्य विश्व ज्ञान शामिल होता है। प्रत्येक प्रश्न के लिए, लेखकों ने प्रासंगिक साक्ष्य दस्तावेज़ एकत्र करने के लिए Bing खोज और Wikipedia लिंक मिलान के संयोजन का उपयोग किया, जिसके परिणामस्वरूप प्रति प्रश्न औसतन छह साक्ष्य दस्तावेज़ मिले।
डेटासेट को प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित किया गया है। प्रशिक्षण सेट में 78,785 प्रश्न-उत्तर जोड़े, विकास सेट में 8,837, और परीक्षण सेट में 11,313 शामिल हैं। एक उल्लेखनीय विशेषता 'वेब-ओनली' विभाजन का समावेश है, जहाँ साक्ष्य वेब दस्तावेज़ों तक सीमित है, और 'विकिपीडिया-ओनली' विभाजन, जहाँ साक्ष्य विशेष रूप से Wikipedia से आता है। यह शोधकर्ताओं को डोमेन-विशिष्ट पुनर्प्राप्ति के प्रभावों को अलग करने की अनुमति देता है।
मूल्यांकन और मेट्रिक्स
TriviaQA के लिए मानक मूल्यांकन अन्य QA बेंचमार्क के समान, सटीक मिलान (EM) और F1 स्कोर का उपयोग करता है। EM उन भविष्यवाणियों का प्रतिशत मापता है जो स्वीकृत उत्तरों में से एक से बिल्कुल मेल खाती हैं, जबकि F1 टोकन-स्तरीय ओवरलैप की गणना करता है। मॉडलों का आमतौर पर दो सेटिंग्स में मूल्यांकन किया जाता है: क्लोज्ड-बुक (बाहरी पुनर्प्राप्ति के बिना, पैरामीट्रिक ज्ञान पर निर्भर) और ओपन-बुक (प्रदान किए गए साक्ष्य से पुनर्प्राप्ति के साथ)।
अपनी रिलीज़ के बाद से, TriviaQA Large language model अनुसंधान में प्रगति का एक प्रमुख चालक रहा है। प्रारंभिक Neural network मॉडल, जैसे BiDAF और DrQA, ने मामूली स्कोर प्राप्त किए, लेकिन BERT और T5 जैसे Transformer (architecture)-आधारित मॉडलों के आगमन से महत्वपूर्ण सुधार हुए। 2021 तक, OpenAI के GPT-3 और Google के T5 जैसे मॉडल विकास सेट पर 70% EM से अधिक प्राप्त कर सकते थे, और 2023 तक, GPT-4 और Claude जैसी Generative AI प्रणालियों ने लगभग मानव-स्तरीय प्रदर्शन प्रदर्शित किया, कुछ रिपोर्टों में कुछ उपसमुच्चयों पर 90% से अधिक EM के साथ।
AI अनुसंधान पर प्रभाव
TriviaQA ने Artificial intelligence अनुसंधान के कई क्षेत्रों को प्रभावित किया है। इसने पठन समझ प्रणालियों के प्रशिक्षण और मूल्यांकन के लिए बड़े पैमाने पर, स्वाभाविक रूप से उत्पन्न प्रश्नों के उपयोग को लोकप्रिय बनाया। डेटासेट ने ओपन-डोमेन QA पर काम को भी प्रेरित किया, जहाँ सिस्टम को पूर्व-चयनित साक्ष्य के बिना एक बड़े कॉर्पस को पुनर्प्राप्त करना और उस पर तर्क करना होता है। अनुसंधान की यह पंक्ति घने अनुच्छेद पुनर्प्राप्ति (DPR) और अन्य पुनर्प्राप्ति-संवर्धित जनन तकनीकों के विकास में योगदान देती है, जो अब कई उत्पादन QA प्रणालियों का अभिन्न अंग हैं।
इसके अलावा, TriviaQA का उपयोग मॉडल मजबूती और अंशांकन का अध्ययन करने के लिए किया गया है। शोधकर्ताओं ने विश्लेषण किया है कि मॉडल अस्पष्ट प्रश्नों, मल्टी-हॉप तर्क और उत्तर प्रारूपों को कैसे संभालते हैं। डेटासेट के विविध प्रश्न प्रकारों ने इसे Natural Questions और HotpotQA जैसे अन्य डेटासेट के साथ, Large language model के ज्ञान और तर्क क्षमताओं की जांच के लिए एक सामान्य बेंचमार्क बना दिया है।
सीमाएँ और आलोचनाएँ
अपनी लोकप्रियता के बावजूद, TriviaQA की ज्ञात सीमाएँ हैं। प्रश्न मुख्य रूप से तथ्य-आधारित और ट्रिविया-उन्मुख हैं, जो वास्तविक दुनिया की QA आवश्यकताओं जैसे संवादात्मक या कार्य-उन्मुख क्वेरी को प्रतिबिंबित नहीं कर सकते हैं। साक्ष्य दस्तावेज़ कभी-कभी शोरगुल वाले होते हैं या उत्तर कई रूपों में होता है, जिससे मूल्यांकन में असंगतियाँ हो सकती हैं। इसके अतिरिक्त, डेटासेट की संभावित उत्तर रिसाव के लिए आलोचना की गई है: क्योंकि प्रश्न वेब से स्क्रैप किए गए थे, कुछ उत्तर बड़े भाषा मॉडल के प्रशिक्षण कॉर्पस में मौजूद हो सकते हैं, जिससे क्लोज्ड-बुक सेटिंग्स में प्रदर्शन बढ़ जाता है।
इन मुद्दों को संबोधित करने के लिए, शोधकर्ताओं ने फ़िल्टर किए गए संस्करण प्रस्तावित किए हैं या अधिक मजबूत बेंचमार्क बनाने के लिए TriviaQA को अन्य डेटासेट के साथ जोड़ा है। फिर भी, TriviaQA मॉडल प्रदर्शन की तुलना के लिए एक व्यापक रूप से उपयोग किया जाने वाला संदर्भ बिंदु बना हुआ है, विशेष रूप से ओपन-डोमेन QA और ज्ञान-गहन कार्यों के संदर्भ में।
विरासत और निरंतर उपयोग
TriviaQA प्रमुख AI अनुसंधान संगठनों, जिनमें Google DeepMind, Anthropic, और Stanford AI Lab और BAIR (Berkeley AI Research) जैसी शैक्षणिक प्रयोगशालाएँ शामिल हैं, के मूल्यांकन सूट में एक प्रमुख घटक बना हुआ है। इसे अक्सर सामान्य ज्ञान और तर्क के माप के रूप में मॉडल कार्ड और तकनीकी रिपोर्टों में शामिल किया जाता है। डेटासेट के डिज़ाइन ने Natural Questions और WebQuestions जैसे बाद के बेंचमार्क को भी प्रेरित किया है, जो समान बहु-साक्ष्य संरचनाओं को अपनाते हैं।
2020 के दशक के मध्य तक, TriviaQA प्रासंगिक बना हुआ है, हालाँकि अत्याधुनिक मॉडल अक्सर मानव आधार रेखाओं के करीब या उससे अधिक स्कोर प्राप्त करते हैं, जिससे कुछ लोग तर्क देते हैं कि बेंचमार्क संतृप्ति के करीब पहुँच रहा है। फिर भी, यह QA प्रणालियों के विकास में एक ऐतिहासिक मील का पत्थर के रूप में कार्य करता है और शैक्षणिक और औद्योगिक सेटिंग्स में फाइन-ट्यूनिंग और मूल्यांकन के लिए उपयोग किया जाता रहा है।