Yahoo! Answers एक समुदाय-संचालित प्रश्न-उत्तर मंच था, जिसे 2005 में Yahoo! द्वारा लॉन्च किया गया था। यह उपयोगकर्ताओं को विषयों की एक विस्तृत श्रृंखला पर प्रश्न पोस्ट करने और अन्य समुदाय के सदस्यों से उत्तर प्राप्त करने की अनुमति देता था। यह मंच 2021 में बंद होने तक संचालित रहा, लेकिन इसका संग्रहीत डेटा मशीन लर्निंग अनुसंधान के लिए एक मूल्यवान संसाधन बन गया है, विशेष रूप से पाठ वर्गीकरण कार्यों के लिए।
Yahoo! Answers डेटासेट, जो मंच की सामग्री से प्राप्त हुआ है, प्राकृतिक भाषा प्रसंस्करण में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है। इसमें प्रश्न और उनके संबंधित उत्तर शामिल हैं, जिन्हें 10 अलग-अलग विषय वर्गों में लेबल किया गया है। यह डेटासेट विषय वर्गीकरण और प्रश्न उत्तर देने जैसे कार्यों के लिए तंत्रिका नेटवर्क मॉडल को प्रशिक्षित करने और मूल्यांकन करने में सहायक रहा है।
डेटासेट संरचना और वर्ग
Yahoo! Answers डेटासेट में 1.4 मिलियन से अधिक प्रश्न और उत्तर शामिल हैं, जिनमें से प्रत्येक को 10 श्रेणियों में से एक को सौंपा गया है: समाज और संस्कृति, विज्ञान और गणित, स्वास्थ्य, शिक्षा और संदर्भ, कंप्यूटर और इंटरनेट, खेल, व्यवसाय और वित्त, मनोरंजन और संगीत, परिवार और रिश्ते, और राजनीति और सरकार। डेटासेट को अक्सर प्रशिक्षण और परीक्षण सेटों में विभाजित किया जाता है, जिसमें सामान्य विभाजन 1.4 मिलियन प्रशिक्षण नमूने और 60,000 परीक्षण नमूने होते हैं। प्रत्येक नमूने में प्रश्न का शीर्षक, प्रश्न की सामग्री और सर्वोत्तम उत्तर, साथ ही श्रेणी लेबल शामिल होता है।
मशीन लर्निंग अनुसंधान में भूमिका
डेटासेट का उपयोग मशीन लर्निंग अनुसंधान में वर्गीकरण एल्गोरिदम को बेंचमार्क करने के लिए व्यापक रूप से किया गया है। यह गहन शिक्षण मॉडल, जिसमें ट्रांसफॉर्मर-आधारित आर्किटेक्चर शामिल हैं, के मूल्यांकन के लिए एक मानक बेंचमार्क है। शोधकर्ताओं ने इसका उपयोग बड़े भाषा मॉडल और अन्य जनरेटिव एआई प्रणालियों के प्रदर्शन का परीक्षण करने के लिए किया है, ताकि उपयोगकर्ता-जनित सामग्री को समझने और वर्गीकृत करने की उनकी क्षमता का आकलन किया जा सके। डेटासेट की बहु-वर्गीय प्रकृति और वास्तविक दुनिया का पाठ इसे मॉडल सामान्यीकरण के लिए एक चुनौतीपूर्ण और यथार्थवादी परीक्षण मंच बनाता है।
एआई विकास पर प्रभाव
Yahoo! Answers डेटासेट की उपलब्धता ने कृत्रिम बुद्धिमत्ता में प्रगति में योगदान दिया है, जो प्रशिक्षण और मूल्यांकन के लिए एक बड़ा, लेबल किया हुआ कोर्पस प्रदान करता है। इसका उपयोग विभिन्न हानि फलनों, अनुकूलन तकनीकों और डेटा संवर्धन विधियों की प्रभावशीलता की तुलना करने वाले अध्ययनों में किया गया है। डेटासेट स्थानांतरण शिक्षण और कुछ-शॉट शिक्षण में अनुसंधान का भी समर्थन करता है, जहां बड़े कोर्पस पर पूर्व-प्रशिक्षित मॉडल को इस तरह के छोटे लेबल किए गए डेटासेट पर ठीक-ट्यून किया जाता है।
विरासत और निरंतर उपयोग
मंच के बंद होने के बावजूद, Yahoo! Answers डेटासेट शैक्षणिक और औद्योगिक अनुसंधान में एक लोकप्रिय संसाधन बना हुआ है। यह कई बेंचमार्क सुइट्स में शामिल है और नए मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए उपयोग किया जाता है, जिसमें मल्टी-हेड अटेंशन और स्थितीय एन्कोडिंग पर आधारित मॉडल शामिल हैं। डेटासेट की दीर्घायु कृत्रिम बुद्धिमत्ता अनुसंधान को आगे बढ़ाने के लिए समुदाय-जनित सामग्री के मूल्य को रेखांकित करती है।