सोशल आईक्यूए (सोशल इंटरैक्शन प्रश्नोत्तर) एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की सामाजिक सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2019 में वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं द्वारा पेश किया गया, इस डेटासेट में लगभग 38,000 बहुविकल्पीय प्रश्न शामिल हैं जो 1,500 रोजमर्रा की सामाजिक स्थितियों से प्राप्त हुए हैं। प्रत्येक प्रश्न मॉडल की संभावित इरादों, प्रतिक्रियाओं और मानवीय अंतःक्रियाओं को नियंत्रित करने वाले सामाजिक मानदंडों का अनुमान लगाने की क्षमता का परीक्षण करता है, जैसे कि यह समझना कि कोई व्यक्ति किसी सहकर्मी की प्रशंसा क्यों कर सकता है या सहायता प्रदान करने के बाद कोई व्यक्ति क्या अपेक्षा करता है।
यह डेटासेट एआई मूल्यांकन में एक अंतर को संबोधित करने के लिए बनाया गया था: जबकि कई बेंचमार्क तथ्यात्मक ज्ञान या भाषाई प्रवाह पर केंद्रित थे, कुछ ने उस सूक्ष्म, अंतर्निहित ज्ञान का परीक्षण किया जिसका उपयोग मनुष्य सामाजिक संदर्भों में नेविगेट करने के लिए करते हैं। सोशल आईक्यूए प्रत्येक परिदृश्य को किसी पात्र की पूर्व-स्थिति, प्रेरणा या भावनात्मक प्रतिक्रिया के बारे में एक प्रश्न के साथ तैयार करता है, जिसमें तीन उत्तर विकल्प प्रदान किए जाते हैं। उदाहरण के लिए, कथन "जॉर्डन ने एलेक्स को घर तक सवारी की पेशकश की" को देखते हुए, एक प्रश्न पूछ सकता है "जॉर्डन ने ऐसा क्यों किया?" जिसके विकल्प होंगे "मददगार होने के लिए," "दिखावा करने के लिए," या "एलेक्स से बचने के लिए।" सही उत्तर परोपकार और शिष्टाचार के बारे में सांस्कृतिक रूप से साझा अपेक्षाओं पर निर्भर करता है।
निर्माण और एनोटेशन
डेटासेट का निर्माण क्राउडसोर्स्ड परिदृश्य निर्माण और संरचित एनोटेशन के संयोजन का उपयोग करके किया गया था। अमेज़न मैकेनिकल तुर्क पर काम करने वाले श्रमिकों ने रोजमर्रा की सामाजिक अंतःक्रियाओं के संक्षिप्त विवरण लिखे, जिन्हें बाद में स्पष्टता और विविधता के लिए फ़िल्टर किया गया। एनोटेटर्स के एक अलग समूह ने प्रत्येक परिदृश्य के लिए प्रश्न और उत्तर उत्पन्न किए, एक टेम्पलेट का पालन करते हुए जिसमें तीन आयाम शामिल थे: इरादा (कोई क्रिया क्यों हुई), प्रतिक्रिया (एक पात्र ने कैसा महसूस किया), और पूर्व-स्थिति (घटना से पहले क्या सत्य रहा होगा)। यह डिज़ाइन सुनिश्चित करता है कि मॉडल का परीक्षण कारणात्मक और भावनात्मक तर्क पर किया जाता है, न कि केवल पैटर्न मिलान पर।
गुणवत्ता बनाए रखने के लिए, निर्माताओं ने कठोर सत्यापन चरण लागू किए। प्रत्येक प्रश्न की समीक्षा कई एनोटेटर्स द्वारा की गई, और अस्पष्ट या अत्यधिक व्यक्तिपरक वस्तुओं को हटा दिया गया। अंतिम डेटासेट को प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित किया गया था, जिसमें परीक्षण सेट को ओवरफिटिंग को रोकने के लिए निजी रखा गया था। एनोटेशन प्रक्रिया में कई महीने लगे और इसमें 2,000 से अधिक अद्वितीय श्रमिक शामिल थे, जो सामाजिक सूक्ष्मता को पकड़ने के लिए आवश्यक प्रयास के पैमाने को दर्शाता है।
बेंचमार्क महत्व
सोशल आईक्यूए जल्दी ही प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया। जब जारी किया गया, तो बीईआरटी जैसे अत्याधुनिक मॉडलों ने लगभग 55% की सटीकता हासिल की, जो 33% के यादृच्छिक आधार रेखा से मुश्किल से ऊपर थी। इस स्पष्ट अंतर ने मशीनों के लिए सामाजिक तर्क की कठिनाई को उजागर किया, जो अक्सर मानव व्यवहार की वास्तविक समझ के बजाय सांख्यिकीय सहसंबंधों पर निर्भर करते हैं। बेंचमार्क ने सामान्य ज्ञान ज्ञानकोषों और तर्क आर्किटेक्चर में अनुसंधान को प्रेरित किया, जिससे रोबर्टा और बाद में बड़े भाषा मॉडल जैसे मॉडलों में सुधार हुआ।
2023 तक, जीपीटी-4 और क्लॉड जैसे बड़े मॉडलों ने 90% से अधिक सटीकता स्कोर के साथ कार्य पर मानव-स्तरीय प्रदर्शन के करीब पहुंचना शुरू कर दिया। हालांकि, शोधकर्ता चेतावनी देते हैं कि सोशल आईक्यूए पर उच्च स्कोर आवश्यक रूप से मजबूत सामाजिक बुद्धिमत्ता का संकेत नहीं देते हैं, क्योंकि मॉडल भाषाई संकेतों या डेटासेट पूर्वाग्रहों का फायदा उठा सकते हैं। बेंचमार्क प्रगति को ट्रैक करने के लिए उपयोगी बना हुआ है, लेकिन सामान्यीकरण का आकलन करने के लिए इसे अक्सर प्रतिकूल या वितरण-बाह्य परीक्षणों के साथ जोड़ा जाता है।
सीमाएं और आलोचनाएं
सोशल आईक्यूए के बारे में कई आलोचनाएं उठाई गई हैं। पहला, डेटासेट पश्चिमी, अंग्रेजी-भाषी सांस्कृतिक मानदंडों की ओर भारी रूप से झुका हुआ है, जो वैश्विक संदर्भों में इसकी प्रयोज्यता को सीमित करता है। एक व्यवहार जो एक संस्कृति में विनम्र माना जाता है वह दूसरे में असभ्य हो सकता है, फिर भी डेटासेट एक एकल, सजातीय सामाजिक ढांचा मानता है। दूसरा, बहुविकल्पीय प्रारूप सामाजिक तर्क को असतत विकल्पों में सरल बनाता है, जबकि वास्तविक दुनिया की अंतःक्रियाओं में निरंतर, संदर्भ-निर्भर निर्णय शामिल होते हैं। तीसरा, कुछ प्रश्न मनुष्यों के लिए भी अस्पष्ट हैं, जिससे शोरगुल वाले एनोटेशन और संभावित गलत लेबलिंग होती है।
शोधकर्ताओं ने यह भी नोट किया है कि मॉडल गहन तर्क में संलग्न होने के बजाय सतही पैटर्न को याद करके उच्च स्कोर प्राप्त कर सकते हैं। उदाहरण के लिए, कुछ उत्तर विकल्प प्रशिक्षण डेटा में अधिक बार दिखाई देते हैं, और मॉडल इन सांख्यिकीय नियमितताओं का फायदा उठा सकते हैं। इसे कम करने के लिए, सोशल आईक्यूए 2.0 जैसे बाद के बेंचमार्क ने कठिन प्रश्न और प्रतितथ्यात्मक परिदृश्य पेश किए हैं, लेकिन मूल डेटासेट व्यापक रूप से उद्धृत बना हुआ है।
अनुप्रयोग और प्रभाव
सोशल आईक्यूए से प्राप्त अंतर्दृष्टि ने संवाद एजेंटों, आभासी सहायकों और रोबोटिक्स जैसे क्षेत्रों में सामाजिक रूप से जागरूक एआई प्रणालियों के विकास को प्रभावित किया है। गूगल डीपमाइंड और ओपनएआई जैसी कंपनियों ने सहानुभूति या सामाजिक चातुर्य की आवश्यकता वाले कार्यों के लिए मॉडलों को फाइन-ट्यून करने के लिए डेटासेट का उपयोग किया है, जैसे ग्राहक सेवा चैटबॉट या मानसिक स्वास्थ्य सहायता उपकरण। बेंचमार्क ने कॉमेट जैसे सामान्य ज्ञान तर्क मॉडल के डिजाइन को भी सूचित किया, जो सामाजिक स्थितियों के बारे में स्पष्ट अनुमान उत्पन्न करता है।
अकादमिक अनुसंधान में, सोशल आईक्यूए को 1,000 से अधिक पत्रों में उद्धृत किया गया है, जो कम्प्यूटेशनल सामाजिक विज्ञान से लेकर एआई में नैतिकता तक के क्षेत्रों में फैला हुआ है। यह अध्ययन के लिए एक मौलिक संसाधन बन गया है कि मशीनें मानव अंतःक्रिया के अलिखित नियमों को कैसे सीख सकती हैं, और यह नए डेटासेट के लिए एक संदर्भ बिंदु बना हुआ है जिसका उद्देश्य अधिक जटिल सामाजिक घटनाओं, जैसे विडंबना, धोखे या क्रॉस-सांस्कृतिक मतभेदों को पकड़ना है।
भविष्य की दिशाएं
जैसे-जैसे एआई प्रणालियां दैनिक जीवन में अधिक एकीकृत होती जा रही हैं, सामाजिक संदर्भ के बारे में तर्क करने की क्षमता तेजी से महत्वपूर्ण होती जा रही है। सोशल आईक्यूए ने अधिक गतिशील बेंचमार्क का मार्ग प्रशस्त किया है जो स्थिर पाठ से आगे बढ़कर वीडियो, ऑडियो और इंटरैक्टिव सेटिंग्स को शामिल करते हैं। शोधकर्ता विविध सांस्कृतिक पृष्ठभूमि के एनोटेटर्स को शामिल करके और कई मान्य उत्तरों के लिए जिम्मेदार मीट्रिक विकसित करके ऐसे डेटासेट को अधिक समावेशी बनाने के तरीकों की भी खोज कर रहे हैं। अंतिम लक्ष्य ऐसा एआई बनाना है जो न केवल तथ्यों को समझे बल्कि सामाजिक सीमाओं का सम्मान करे और प्रभावी ढंग से संवाद करे, एक चुनौती जिसे सोशल आईक्यूए ने क्षेत्र के अग्रभाग में लाने में मदद की है।