अंग्रेज़ी से अनुवादित

सोशल आईक्यूए (Social IQA) सामाजिक सामान्य ज्ञान तर्क (social commonsense reasoning) के लिए एक बेंचमार्क डेटासेट है, जिसमें रोजमर्रा की सामाजिक अंतःक्रियाओं के बारे में 38,000 बहुविकल्पीय प्रश्न शामिल हैं, जिनका उपयोग एआई मॉडल की सामाजिक मानदंडों और व्यवहारों की समझ का मूल्यांकन करने के लिए किया जाता है।

सोशल आईक्यूए (सोशल इंटरैक्शन प्रश्नोत्तर) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की सामाजिक सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2019 में वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा पेश किया गया, इस डेटासेट में लगभग 38,000 बहुविकल्पीय प्रश्न शामिल हैं जो 1,500 रोजमर्रा की सामाजिक स्थितियों से प्राप्त हुए हैं। प्रत्येक प्रश्न मॉडल की संभावित इरादों, प्रतिक्रियाओं और मानवीय अंतःक्रियाओं को नियंत्रित करने वाले सामाजिक मानदंडों का अनुमान लगाने की क्षमता का परीक्षण करता है, जैसे कि यह समझना कि कोई व्यक्ति किसी सहकर्मी की प्रशंसा क्यों कर सकता है या सहायता प्रदान करने के बाद कोई व्यक्ति क्या अपेक्षा करता है।

यह डेटासेट एआई मूल्यांकन में एक अंतर को संबोधित करने के लिए बनाया गया था: जबकि कई बेंचमार्क तथ्यात्मक ज्ञान या भाषाई प्रवाह पर केंद्रित थे, कुछ ने उस सूक्ष्म, अंतर्निहित ज्ञान का परीक्षण किया जिसका उपयोग मनुष्य सामाजिक संदर्भों में नेविगेट करने के लिए करते हैं। सोशल आईक्यूए प्रत्येक परिदृश्य को किसी पात्र की पूर्व-स्थिति, प्रेरणा या भावनात्मक प्रतिक्रिया के बारे में एक प्रश्न के साथ तैयार करता है, जिसमें तीन उत्तर विकल्प प्रदान किए जाते हैं। उदाहरण के लिए, कथन "जॉर्डन ने एलेक्स को घर तक सवारी की पेशकश की" को देखते हुए, एक प्रश्न पूछ सकता है "जॉर्डन ने ऐसा क्यों किया?" जिसके विकल्प होंगे "मददगार होने के लिए," "दिखावा करने के लिए," या "एलेक्स से बचने के लिए।" सही उत्तर परोपकार और शिष्टाचार के बारे में सांस्कृतिक रूप से साझा अपेक्षाओं पर निर्भर करता है।

निर्माण और एनोटेशन

डेटासेट का निर्माण क्राउडसोर्स्ड परिदृश्य निर्माण और संरचित एनोटेशन के संयोजन का उपयोग करके किया गया था। अमेज़न मैकेनिकल तुर्क पर काम करने वाले श्रमिकों ने रोजमर्रा की सामाजिक अंतःक्रियाओं के संक्षिप्त विवरण लिखे, जिन्हें बाद में स्पष्टता और विविधता के लिए फ़िल्टर किया गया। एनोटेटर्स के एक अलग समूह ने प्रत्येक परिदृश्य के लिए प्रश्न और उत्तर उत्पन्न किए, एक टेम्पलेट का पालन करते हुए जिसमें तीन आयाम शामिल थे: इरादा (कोई क्रिया क्यों हुई), प्रतिक्रिया (एक पात्र ने कैसा महसूस किया), और पूर्व-स्थिति (घटना से पहले क्या सत्य रहा होगा)। यह डिज़ाइन सुनिश्चित करता है कि मॉडल का परीक्षण कारणात्मक और भावनात्मक तर्क पर किया जाता है, न कि केवल पैटर्न मिलान पर।

गुणवत्ता बनाए रखने के लिए, निर्माताओं ने कठोर सत्यापन चरण लागू किए। प्रत्येक प्रश्न की समीक्षा कई एनोटेटर्स द्वारा की गई, और अस्पष्ट या अत्यधिक व्यक्तिपरक वस्तुओं को हटा दिया गया। अंतिम डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया था, जिसमें परीक्षण सेट को ओवरफिटिंग को रोकने के लिए निजी रखा गया था। एनोटेशन प्रक्रिया में कई महीने लगे और इसमें 2,000 से अधिक अद्वितीय श्रमिक शामिल थे, जो सामाजिक सूक्ष्मता को पकड़ने के लिए आवश्यक प्रयास के पैमाने को दर्शाता है।

बेंचमार्क महत्व

सोशल आईक्यूए जल्दी ही प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया। जब जारी किया गया, तो बीईआरटी जैसे अत्याधुनिक मॉडलों ने लगभग 55% की सटीकता हासिल की, जो 33% के यादृच्छिक आधार रेखा से मुश्किल से ऊपर थी। इस स्पष्ट अंतर ने मशीनों के लिए सामाजिक तर्क की कठिनाई को उजागर किया, जो अक्सर मानव व्यवहार की वास्तविक समझ के बजाय सांख्यिकीय सहसंबंधों पर निर्भर करते हैं। बेंचमार्क ने सामान्य ज्ञान ज्ञानकोषों और तर्क आर्किटेक्चर में अनुसंधान को प्रेरित किया, जिससे रोबर्टा और बाद में बड़े भाषा मॉडल जैसे मॉडलों में सुधार हुआ।

2023 तक, जीपीटी-4 और क्लॉड जैसे बड़े मॉडलों ने 90% से अधिक सटीकता स्कोर के साथ कार्य पर मानव-स्तरीय प्रदर्शन के करीब पहुंचना शुरू कर दिया। हालांकि, शोधकर्ता चेतावनी देते हैं कि सोशल आईक्यूए पर उच्च स्कोर आवश्यक रूप से मजबूत सामाजिक बुद्धिमत्ता का संकेत नहीं देते हैं, क्योंकि मॉडल भाषाई संकेतों या डेटासेट पूर्वाग्रहों का फायदा उठा सकते हैं। बेंचमार्क प्रगति को ट्रैक करने के लिए उपयोगी बना हुआ है, लेकिन सामान्यीकरण का आकलन करने के लिए इसे अक्सर प्रतिकूल या वितरण-बाह्य परीक्षणों के साथ जोड़ा जाता है।

सीमाएं और आलोचनाएं

सोशल आईक्यूए के बारे में कई आलोचनाएं उठाई गई हैं। पहला, डेटासेट पश्चिमी, अंग्रेजी-भाषी सांस्कृतिक मानदंडों की ओर भारी रूप से झुका हुआ है, जो वैश्विक संदर्भों में इसकी प्रयोज्यता को सीमित करता है। एक व्यवहार जो एक संस्कृति में विनम्र माना जाता है वह दूसरे में असभ्य हो सकता है, फिर भी डेटासेट एक एकल, सजातीय सामाजिक ढांचा मानता है। दूसरा, बहुविकल्पीय प्रारूप सामाजिक तर्क को असतत विकल्पों में सरल बनाता है, जबकि वास्तविक दुनिया की अंतःक्रियाओं में निरंतर, संदर्भ-निर्भर निर्णय शामिल होते हैं। तीसरा, कुछ प्रश्न मनुष्यों के लिए भी अस्पष्ट हैं, जिससे शोरगुल वाले एनोटेशन और संभावित गलत लेबलिंग होती है।

शोधकर्ताओं ने यह भी नोट किया है कि मॉडल गहन तर्क में संलग्न होने के बजाय सतही पैटर्न को याद करके उच्च स्कोर प्राप्त कर सकते हैं। उदाहरण के लिए, कुछ उत्तर विकल्प प्रशिक्षण डेटा में अधिक बार दिखाई देते हैं, और मॉडल इन सांख्यिकीय नियमितताओं का फायदा उठा सकते हैं। इसे कम करने के लिए, सोशल आईक्यूए 2.0 जैसे बाद के बेंचमार्क ने कठिन प्रश्न और प्रतितथ्यात्मक परिदृश्य पेश किए हैं, लेकिन मूल डेटासेट व्यापक रूप से उद्धृत बना हुआ है।

अनुप्रयोग और प्रभाव

सोशल आईक्यूए से प्राप्त अंतर्दृष्टि ने संवाद एजेंटों, आभासी सहायकों और रोबोटिक्स जैसे क्षेत्रों में सामाजिक रूप से जागरूक एआई प्रणालियों के विकास को प्रभावित किया है। गूगल डीपमाइंड और ओपनएआई जैसी कंपनियों ने सहानुभूति या सामाजिक चातुर्य की आवश्यकता वाले कार्यों के लिए मॉडलों को फाइन-ट्यून करने के लिए डेटासेट का उपयोग किया है, जैसे ग्राहक सेवा चैटबॉट या मानसिक स्वास्थ्य सहायता उपकरण। बेंचमार्क ने कॉमेट जैसे सामान्य ज्ञान तर्क मॉडल के डिजाइन को भी सूचित किया, जो सामाजिक स्थितियों के बारे में स्पष्ट अनुमान उत्पन्न करता है।

अकादमिक अनुसंधान में, सोशल आईक्यूए को 1,000 से अधिक पत्रों में उद्धृत किया गया है, जो कम्प्यूटेशनल सामाजिक विज्ञान से लेकर एआई में नैतिकता तक के क्षेत्रों में फैला हुआ है। यह अध्ययन के लिए एक मौलिक संसाधन बन गया है कि मशीनें मानव अंतःक्रिया के अलिखित नियमों को कैसे सीख सकती हैं, और यह नए डेटासेट के लिए एक संदर्भ बिंदु बना हुआ है जिसका उद्देश्य अधिक जटिल सामाजिक घटनाओं, जैसे विडंबना, धोखे या क्रॉस-सांस्कृतिक मतभेदों को पकड़ना है।

भविष्य की दिशाएं

जैसे-जैसे एआई प्रणालियां दैनिक जीवन में अधिक एकीकृत होती जा रही हैं, सामाजिक संदर्भ के बारे में तर्क करने की क्षमता तेजी से महत्वपूर्ण होती जा रही है। सोशल आईक्यूए ने अधिक गतिशील बेंचमार्क का मार्ग प्रशस्त किया है जो स्थिर पाठ से आगे बढ़कर वीडियो, ऑडियो और इंटरैक्टिव सेटिंग्स को शामिल करते हैं। शोधकर्ता विविध सांस्कृतिक पृष्ठभूमि के एनोटेटर्स को शामिल करके और कई मान्य उत्तरों के लिए जिम्मेदार मीट्रिक विकसित करके ऐसे डेटासेट को अधिक समावेशी बनाने के तरीकों की भी खोज कर रहे हैं। अंतिम लक्ष्य ऐसा एआई बनाना है जो न केवल तथ्यों को समझे बल्कि सामाजिक सीमाओं का सम्मान करे और प्रभावी ढंग से संवाद करे, एक चुनौती जिसे सोशल आईक्यूए ने क्षेत्र के अग्रभाग में लाने में मदद की है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·commonsense-reasoning·natural-language-processing·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास