अंग्रेज़ी से अनुवादित

Yahoo! Answers एक समुदाय-संचालित प्रश्न-उत्तर मंच था, जिसे 2005 में लॉन्च किया गया था, जहाँ उपयोगकर्ता प्रश्न पूछते थे और जनता से उत्तर प्राप्त करते थे। इसका 10 विषय वर्गों का डेटासेट मशीन लर्निंग में पाठ वर्गीकरण बेंचमार्क के लिए उपयोग किया जाता है।

Yahoo! Answers एक समुदाय-संचालित प्रश्न-उत्तर मंच था, जिसे 2005 में Yahoo! द्वारा लॉन्च किया गया था। यह उपयोगकर्ताओं को विषयों की एक विस्तृत श्रृंखला पर प्रश्न पोस्ट करने और अन्य समुदाय के सदस्यों से उत्तर प्राप्त करने की अनुमति देता था। यह मंच 2021 में बंद होने तक संचालित रहा, लेकिन इसका संग्रहीत डेटा मशीन लर्निंग अनुसंधान के लिए एक मूल्यवान संसाधन बन गया है, विशेष रूप से पाठ वर्गीकरण कार्यों के लिए।

Yahoo! Answers डेटासेट, जो मंच की सामग्री से प्राप्त हुआ है, प्राकृतिक भाषा प्रसंस्करण में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है। इसमें प्रश्न और उनके संबंधित उत्तर शामिल हैं, जिन्हें 10 अलग-अलग विषय वर्गों में लेबल किया गया है। यह डेटासेट विषय वर्गीकरण और प्रश्न उत्तर देने जैसे कार्यों के लिए तंत्रिका नेटवर्क मॉडल को प्रशिक्षित करने और मूल्यांकन करने में सहायक रहा है।

डेटासेट संरचना और वर्ग

Yahoo! Answers डेटासेट में 1.4 मिलियन से अधिक प्रश्न और उत्तर शामिल हैं, जिनमें से प्रत्येक को 10 श्रेणियों में से एक को सौंपा गया है: समाज और संस्कृति, विज्ञान और गणित, स्वास्थ्य, शिक्षा और संदर्भ, कंप्यूटर और इंटरनेट, खेल, व्यवसाय और वित्त, मनोरंजन और संगीत, परिवार और रिश्ते, और राजनीति और सरकार। डेटासेट को अक्सर प्रशिक्षण और परीक्षण सेटों में विभाजित किया जाता है, जिसमें सामान्य विभाजन 1.4 मिलियन प्रशिक्षण नमूने और 60,000 परीक्षण नमूने होते हैं। प्रत्येक नमूने में प्रश्न का शीर्षक, प्रश्न की सामग्री और सर्वोत्तम उत्तर, साथ ही श्रेणी लेबल शामिल होता है।

मशीन लर्निंग अनुसंधान में भूमिका

डेटासेट का उपयोग मशीन लर्निंग अनुसंधान में वर्गीकरण एल्गोरिदम को बेंचमार्क करने के लिए व्यापक रूप से किया गया है। यह गहन शिक्षण मॉडल, जिसमें ट्रांसफॉर्मर-आधारित आर्किटेक्चर शामिल हैं, के मूल्यांकन के लिए एक मानक बेंचमार्क है। शोधकर्ताओं ने इसका उपयोग बड़े भाषा मॉडल और अन्य जनरेटिव एआई प्रणालियों के प्रदर्शन का परीक्षण करने के लिए किया है, ताकि उपयोगकर्ता-जनित सामग्री को समझने और वर्गीकृत करने की उनकी क्षमता का आकलन किया जा सके। डेटासेट की बहु-वर्गीय प्रकृति और वास्तविक दुनिया का पाठ इसे मॉडल सामान्यीकरण के लिए एक चुनौतीपूर्ण और यथार्थवादी परीक्षण मंच बनाता है।

एआई विकास पर प्रभाव

Yahoo! Answers डेटासेट की उपलब्धता ने कृत्रिम बुद्धिमत्ता में प्रगति में योगदान दिया है, जो प्रशिक्षण और मूल्यांकन के लिए एक बड़ा, लेबल किया हुआ कोर्पस प्रदान करता है। इसका उपयोग विभिन्न हानि फलनों, अनुकूलन तकनीकों और डेटा संवर्धन विधियों की प्रभावशीलता की तुलना करने वाले अध्ययनों में किया गया है। डेटासेट स्थानांतरण शिक्षण और कुछ-शॉट शिक्षण में अनुसंधान का भी समर्थन करता है, जहां बड़े कोर्पस पर पूर्व-प्रशिक्षित मॉडल को इस तरह के छोटे लेबल किए गए डेटासेट पर ठीक-ट्यून किया जाता है।

विरासत और निरंतर उपयोग

मंच के बंद होने के बावजूद, Yahoo! Answers डेटासेट शैक्षणिक और औद्योगिक अनुसंधान में एक लोकप्रिय संसाधन बना हुआ है। यह कई बेंचमार्क सुइट्स में शामिल है और नए मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए उपयोग किया जाता है, जिसमें मल्टी-हेड अटेंशन और स्थितीय एन्कोडिंग पर आधारित मॉडल शामिल हैं। डेटासेट की दीर्घायु कृत्रिम बुद्धिमत्ता अनुसंधान को आगे बढ़ाने के लिए समुदाय-जनित सामग्री के मूल्य को रेखांकित करती है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·datasets·natural-language-processing·question-answering
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास