TweetQA एक प्रश्न उत्तर (QA) के लिए एक बेंचमार्क डेटासेट है जो सोशल मीडिया प्लेटफॉर्म ट्विटर (अब X) की सामग्री पर केंद्रित है। 2019 में दक्षिणी कैलिफोर्निया विश्वविद्यालय और अमेज़न के शोधकर्ताओं द्वारा पेश किया गया, इसे मौजूदा QA डेटासेट की सीमाओं को संबोधित करने के लिए बनाया गया था, जो आम तौर पर विकिपीडिया या समाचार लेखों जैसे अच्छी तरह से संपादित स्रोतों पर निर्भर करते हैं। TweetQA यह मूल्यांकन करने के लिए एक परीक्षण मंच प्रदान करता है कि कृत्रिम बुद्धिमत्ता प्रणालियाँ सोशल मीडिया पोस्ट में आम अनौपचारिक, संक्षिप्त और संदर्भ-निर्भर भाषा को कितनी अच्छी तरह संभाल सकती हैं।
डेटासेट में 4,000+ ट्वीट्स से प्राप्त 13,000+ प्रश्न-उत्तर जोड़े शामिल हैं। प्रत्येक ट्वीट को एक मानव-जनित प्रश्न और एक संक्षिप्त उत्तर के साथ जोड़ा गया है, जिसके लिए अक्सर ट्वीट के कई हिस्सों में जानकारी के संश्लेषण या निहित अर्थों के बारे में अनुमान की आवश्यकता होती है। ट्वीट्स में समाचार घटनाओं, व्यक्तिगत उपाख्यानों और सार्वजनिक घोषणाओं सहित विविध विषय शामिल हैं, और ये हैशटैग, मेंशन, इमोजी और गैर-मानक व्याकरण द्वारा विशेषता हैं।
डिज़ाइन और निर्माण
TweetQA डेटासेट अमेज़न मैकेनिकल टर्क के माध्यम से क्राउडसोर्सिंग द्वारा बनाया गया था। श्रमिकों को एक ट्वीट पढ़ने और एक प्राकृतिक-भाषा प्रश्न उत्पन्न करने के लिए कहा गया था जिसका उत्तर एक मानव अकेले ट्वीट से दे सकता है, फिर संबंधित उत्तर प्रदान करें। गुणवत्ता सुनिश्चित करने के लिए, कई श्रमिकों ने प्रत्येक ट्वीट को एनोटेट किया, और अंतिम डेटासेट में केवल वे उदाहरण शामिल हैं जहां उत्तरों की सटीकता के लिए मान्य किया गया था। रचनाकारों ने जानबूझकर ऐसे ट्वीट्स का चयन किया जो बाहरी संदर्भ के बिना उत्तर देने की अनुमति देने के लिए पर्याप्त रूप से आत्म-निहित थे, हालांकि कुछ प्रश्नों के लिए निहित सामाजिक संकेतों या सामान्य ज्ञान की समझ की आवश्यकता होती है।
मूल्यांकन और मेट्रिक्स
TweetQA आम तौर पर एक पर्यवेक्षित शिक्षण बेंचमार्क के रूप में उपयोग किया जाता है। मॉडलों को प्रशिक्षण विभाजन (डेटा का लगभग 70%) पर प्रशिक्षित किया जाता है और एक अलग रखे गए परीक्षण सेट पर मूल्यांकन किया जाता है। प्राथमिक मूल्यांकन मेट्रिक्स सटीक मिलान (EM) और F1 स्कोर हैं, जो भविष्यवाणी और संदर्भ उत्तरों के बीच टोकन-स्तरीय ओवरलैप को मापते हैं। चूंकि उत्तर अक्सर छोटे वाक्यांश या एकल इकाइयाँ होते हैं, ये मेट्रिक्स पढ़ने की समझ और तर्क का एक सख्त मूल्यांकन प्रदान करते हैं। बेंचमार्क को कई शोध प्रयासों में अपनाया गया है, जिसमें मशीन लर्निंग समुदाय भी शामिल है, ताकि सोशल मीडिया पाठ पर मॉडल प्रदर्शन की तुलना की जा सके।
चुनौतियाँ और महत्व
SQuAD जैसे पारंपरिक QA डेटासेट के विपरीत, जो औपचारिक गद्य का उपयोग करते हैं, TweetQA अद्वितीय चुनौतियाँ प्रस्तुत करता है। ट्वीट्स 280 वर्णों तक सीमित हैं, जिससे संक्षिप्ताक्षरों, स्लैंग और लापता विराम चिह्नों का भारी उपयोग होता है। वे अक्सर बाहरी संदर्भ पर भी निर्भर करते हैं, जैसे कि चल रही घटनाएँ या उपयोगकर्ता-विशिष्ट संदर्भ, जो अस्पष्ट हो सकते हैं। इसके अतिरिक्त, उत्तरों के लिए कई खंडों से जानकारी के संयोजन या व्यंग्य और विडंबना की व्याख्या की आवश्यकता हो सकती है। ये कारक TweetQA को तंत्रिका नेटवर्क मॉडलों के लिए एक कठिन परीक्षण बनाते हैं, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर पर आधारित, जो अधिक औपचारिक पाठ पर पूर्व-प्रशिक्षित होते हैं।
डेटासेट का उपयोग बड़े भाषा मॉडल प्रणालियों की मजबूती का अध्ययन करने के लिए किया गया है, जिसमें ओपनएआई और अन्य संगठनों के मॉडल शामिल हैं, शोर इनपुट को संभालने में। इसने डोमेन-अनुकूली पूर्व-प्रशिक्षण विधियों के विकास को भी सूचित किया है, जहां TweetQA पर मूल्यांकन करने से पहले मॉडलों को सोशल मीडिया कॉर्पोरा पर फाइन-ट्यून किया जाता है।
संबंधित कार्य और विस्तार
TweetQA स्टोरी क्लोज़ टेस्ट और SituatedQA बेंचमार्क जैसे पहले के प्रयासों पर आधारित है, लेकिन यह माइक्रोब्लॉगिंग सामग्री पर अपने फोकस में विशिष्ट है। बाद के शोध ने इस विचार को अन्य सोशल प्लेटफार्मों, जैसे कि Reddit और Facebook, और बहुभाषी सेटिंग्स तक विस्तारित किया है। डेटासेट का उपयोग मल्टी-टास्क लर्निंग फ्रेमवर्क में एक घटक के रूप में भी किया गया है, जहां सामान्यीकरण में सुधार के लिए एक एकल मॉडल को कई QA बेंचमार्क पर प्रशिक्षित किया जाता है।
सीमाएँ
आलोचकों ने नोट किया है कि TweetQA के उत्तर अक्सर निष्कर्षणात्मक होते हैं, जिसका अर्थ है कि उन्हें सीधे ट्वीट पाठ से उठाया जा सकता है, जो गहरे तर्क का परीक्षण करने की इसकी क्षमता को सीमित कर सकता है। डेटासेट संग्रह के समय एनोटेटरों और ट्विटर उपयोगकर्ता आधार के जनसांख्यिकीय और भाषाई पूर्वाग्रहों को भी दर्शाता है। 2025 तक, डेटासेट अनुसंधान उद्देश्यों के लिए सार्वजनिक रूप से उपलब्ध है, लेकिन सोशल मीडिया भाषा के तेजी से विकास और अधिक जटिल बेंचमार्क के उदय को देखते हुए इसकी प्रासंगिकता पर सवाल उठाए गए हैं।
यह भी देखें
संदर्भ
- Xiong, W., et al. (2019). "TweetQA: A Social Media Focused Question Answering Dataset." Proceedings of ACL.
- सोशल मीडिया QA के संदर्भ में TweetQA का हवाला देने वाले शोध पत्र।