सामान्य ज्ञान (कॉमनसेंस) बुनियादी, व्यावहारिक तथ्यों का संग्रह है जिन्हें अधिकांश लोग सामान्य रूप से मान लेते हैं, जैसे यह जानना कि पानी गीला होता है, वस्तुएं गिरने पर नीचे गिरती हैं, या लोग भूख महसूस कर सकते हैं। यह रोजमर्रा के तर्क और संचार को रेखांकित करता है, जिससे मनुष्य बिना स्पष्ट निर्देश के समझदार अनुमान लगा सकते हैं। कृत्रिम बुद्धिमत्ता में, सामान्य ज्ञान को लंबे समय से एक प्रमुख चुनौती के रूप में मान्यता दी गई है क्योंकि यह शायद ही कभी पाठ या डेटा में स्पष्ट रूप से कहा जाता है, फिर भी यह मजबूत प्राकृतिक भाषा समझ, योजना और भौतिक वातावरण के साथ बातचीत के लिए आवश्यक है।
विशेषज्ञ ज्ञान के विपरीत, सामान्य ज्ञान व्यापक, अंतर-सांस्कृतिक और अक्सर अंतर्निहित होता है। इसमें भौतिक अंतर्ज्ञान (जैसे, ठोस वस्तुएं एक-दूसरे से नहीं गुजर सकतीं), सामाजिक मानदंड (जैसे, लोग आमतौर पर अभिवादन का जवाब देते हैं), और लौकिक तर्क (जैसे, घटनाएं क्रम में होती हैं) शामिल हैं। एआई सिस्टम, विशेष रूप से Machine learning और Deep learning पर आधारित, आमतौर पर बड़े डेटासेट से सीखते हैं जिनमें ऐसे स्पष्ट सत्य शामिल नहीं हो सकते हैं, जिससे नई या अस्पष्ट स्थितियों को संभालने की उनकी क्षमता में अंतराल पैदा होता है।
ऐतिहासिक दृष्टिकोण
एआई में सामान्य ज्ञान को औपचारिक रूप देने के शुरुआती प्रयास 1970 और 1980 के दशक में हुए, जिसमें जॉन मैकार्थी जैसे शोधकर्ताओं ने सामान्य ज्ञान के तार्किक औपचारिकरण की वकालत की। 1984 में डगलस लेनाट द्वारा शुरू की गई साइक (Cyc) जैसी परियोजनाओं का उद्देश्य लाखों सामान्य ज्ञान तथ्यों को मशीन-पठनीय ऑन्टोलॉजी में मैन्युअल रूप से एन्कोड करना था। जबकि साइक ने स्पष्ट ज्ञान प्रतिनिधित्व की व्यवहार्यता प्रदर्शित की, इसकी स्केलेबिलिटी और रखरखाव कठिन साबित हुआ। समवर्ती रूप से, फ्रेम-आधारित सिस्टम और स्क्रिप्ट, जैसे रोजर शैंक का वैचारिक निर्भरता पर काम, ने रेस्तरां में खाने जैसे रोजमर्रा के परिदृश्यों को मॉडल करने का प्रयास किया।
इन प्रतीकात्मक दृष्टिकोणों को भंगुर और अपूर्ण होने के लिए आलोचना का सामना करना पड़ा, क्योंकि वे सामान्य ज्ञान की विशाल, सूक्ष्म और संदर्भ-निर्भर प्रकृति को आसानी से संभाल नहीं सकते थे। 1990 के दशक तक, सांख्यिकीय तरीकों ने गति पकड़ी, लेकिन वे शुरू में शब्द-भेद और पार्सिंग जैसे संकीर्ण कार्यों पर केंद्रित थे, जिससे सामान्य ज्ञान काफी हद तक अनसुलझा रह गया।
आधुनिक मशीन लर्निंग और तंत्रिका मॉडल
Neural network आर्किटेक्चर, विशेष रूप से Transformer (architecture)-आधारित मॉडलों के उदय ने पाठ से सामान्य ज्ञान को अंतर्निहित रूप से सीखने की ओर ध्यान केंद्रित किया। OpenAI और Anthropic जैसे संगठनों द्वारा विकसित बड़े पैमाने के भाषा मॉडल, इंटरनेट से अरबों शब्दों पर प्रशिक्षित होते हैं, जिनमें कुछ सामान्य ज्ञान कथन शामिल होते हैं लेकिन बहुत सारा शोर भी होता है। ये मॉडल सरल सामान्य ज्ञान प्रश्नों, जैसे "आप रोटी काटने के लिए क्या उपयोग करते हैं?" का उच्च सटीकता के साथ उत्तर दे सकते हैं, लेकिन वे अक्सर प्रतिकूल या प्रति-तथ्यात्मक उदाहरणों पर विफल हो जाते हैं, जिससे पता चलता है कि उनका ज्ञान सांख्यिकीय है न कि भौतिक अनुभव पर आधारित।
शोधकर्ताओं ने इन क्षमताओं का मूल्यांकन करने के लिए कॉमनसेंसक्यूए और फिजिकल इंटरेक्शन क्यूए जैसे बेंचमार्क पेश किए हैं। उदाहरण के लिए, एक मॉडल से पूछा जा सकता है, "यदि आप कठोर फर्श पर गिलास गिराते हैं, तो क्या होता है?" और उसे "यह टूट जाता है" और "यह तैरता है" के बीच चयन करना होता है। जबकि आधुनिक मॉडल ऐसे परीक्षणों पर अच्छा प्रदर्शन करते हैं, वे सूक्ष्म त्रुटियों के प्रति संवेदनशील रहते हैं, जैसे स्थानिक संबंधों या लौकिक क्रम को भ्रमित करना। यह सीमा विशेष रूप से Large language model में स्पष्ट होती है जब वे प्रशंसनीय लेकिन तथ्यात्मक रूप से गलत प्रतिक्रियाएं उत्पन्न करते हैं, एक घटना जिसे अक्सर उनके मजबूत विश्व मॉडल की कमी के लिए जिम्मेदार ठहराया जाता है।
ज्ञान ग्राफ और हाइब्रिड सिस्टम
तंत्रिका दृष्टिकोणों को पूरक करने के लिए, कुछ शोधकर्ताओं ने कॉन्सेप्टनेट जैसे सामान्य ज्ञान ज्ञान ग्राफ बनाए हैं, जो क्राउडसोर्सिंग और मौजूदा संसाधनों से तथ्यों को एकत्र करते हैं। इन ग्राफों में अवधारणाओं के लिए नोड्स और "के लिए उपयोग किया जाता है," "सक्षम है," और "पर स्थित है" जैसे संबंधों के लिए किनारे होते हैं। हाइब्रिड सिस्टम इन प्रतीकात्मक संरचनाओं को तंत्रिका मॉडल के साथ जोड़ते हैं, जिससे मॉडल अनुमान के दौरान प्रासंगिक तथ्यों को पुनः प्राप्त कर सकता है। उदाहरण के लिए, एक प्रश्न-उत्तर प्रणाली उत्तर उत्पन्न करने से पहले यह सत्यापित करने के लिए कॉन्सेप्टनेट से पूछताछ कर सकती है कि चाकू काटने के लिए उपयोग किया जाता है।
Google DeepMind जैसी कंपनियों और MIT CSAIL और Stanford AI Lab जैसी शैक्षणिक प्रयोगशालाओं ने सुदृढीकरण सीखने वाले एजेंटों में सामान्य ज्ञान को एकीकृत करने का पता लगाया है, जहां एजेंट को वस्तु क्षमताओं और भौतिक गतिशीलता के बारे में तर्क करना होता है। ये प्रयास अक्सर स्थिर डेटा पर भरोसा करने के बजाय बातचीत के माध्यम से एजेंटों को सामान्य ज्ञान सिखाने के लिए सिमुलेशन वातावरण का उपयोग करते हैं। हालांकि, प्रतीकात्मक ज्ञान और निरंतर धारणा के बीच की खाई को पाटना एक खुली समस्या बनी हुई है।
चुनौतियां और सीमाएं
एक प्रमुख चुनौती "ज्ञान अधिग्रहण बाधा" है: सामान्य ज्ञान को मैन्युअल रूप से एन्कोड करना श्रम-गहन है, जबकि पाठ से स्वचालित निष्कर्षण शोरगुल और अपूर्ण है। एक और मुद्दा सांस्कृतिक और प्रासंगिक परिवर्तनशीलता है; जो एक समुदाय में सामान्य ज्ञान है वह दूसरे में मान्य नहीं हो सकता है, जिससे सार्वभौमिक मॉडल कठिन हो जाते हैं। इसके अतिरिक्त, सामान्य ज्ञान तर्क के लिए अक्सर कई तौर-तरीकों, जैसे दृष्टि और भाषा, को एकीकृत करने की आवश्यकता होती है, जिसे वर्तमान मॉडल केवल आंशिक रूप से संभालते हैं।
मूल्यांकन भी समस्याग्रस्त है। कई बेंचमार्क संतृप्त हो सकते हैं, जिसका अर्थ है कि मॉडल वास्तविक समझ प्रदर्शित करने के बजाय पैटर्न याद करके उच्च स्कोर प्राप्त कर सकते हैं। Melanie Mitchell और Joshua Tenenbaum जैसे शोधकर्ताओं ने अधिक कठोर परीक्षणों की वकालत की है जो कारण तर्क और प्रति-तथ्यात्मक सोच की जांच करते हैं। उदाहरण के लिए, "यदि गुरुत्वाकर्षण कमजोर होता तो क्या होता?" पूछने के लिए लचीली मानसिक सिमुलेशन की आवश्यकता होती है, जो अधिकांश एआई सिस्टम में कमी है।
भविष्य की दिशाएं
उभरते दृष्टिकोणों में Curriculum Learning का उपयोग करके मॉडलों को धीरे-धीरे अधिक जटिल सामान्य ज्ञान कार्यों पर प्रशिक्षित करना, और किनारे के मामलों को कवर करने वाले सिंथेटिक प्रशिक्षण उदाहरण उत्पन्न करने के लिए Data Augmentation का लाभ उठाना शामिल है। कुछ काम भाषा को मूर्त एजेंटों में आधारित करने का पता लगाते हैं, जैसे Figure AI या Sanctuary AI के रोबोट, जिन्हें शारीरिक परीक्षण और त्रुटि के माध्यम से सामान्य ज्ञान सीखना चाहिए। इसके अतिरिक्त, Reinforcement Learning from AI Feedback (RLAIF) में उपयोग किए जाने वाले मानव प्रतिक्रिया से Reinforcement learning मॉडल आउटपुट को सामान्य ज्ञान की मानवीय अपेक्षाओं के साथ संरेखित करने में मदद कर सकता है।
प्रगति के बावजूद, सामान्य ज्ञान एआई में एक परिभाषित अनसुलझी समस्या बनी हुई है। जैसे-जैसे मॉडल अधिक सक्षम होते जाते हैं, उनकी वास्तविक समझ की कमी अधिक स्पष्ट होती जाती है, विशेष रूप से सुरक्षा-महत्वपूर्ण अनुप्रयोगों में। यह क्षेत्र एक एकीकृत ढांचे की तलाश जारी रखता है जो प्रतीकात्मक तर्क, सांख्यिकीय सीखने और मूर्त बातचीत की ताकत को जोड़ता है, जिसका लक्ष्य ऐसी प्रणालियां बनाना है जो रोजमर्रा की दुनिया में मनुष्यों की तरह सहजता से नेविगेट कर सकें।