एक विश्व मॉडल, कृत्रिम बुद्धिमत्ता में, एक आंतरिक प्रतिनिधित्व है जिसका उपयोग एक एजेंट यह भविष्यवाणी करने के लिए करता है कि उसका वातावरण समय के साथ कैसे बदलेगा, जिसमें उसके अपने कार्यों के प्रति प्रतिक्रिया भी शामिल है, जिससे एजेंट को वास्तविक वातावरण में कार्य किए बिना परिणामों का निरीक्षण करने के लिए योजना बनाने, परिणामों की कल्पना करने और विकल्पों का मूल्यांकन करने की अनुमति मिलती है। इस शब्द की जड़ें शास्त्रीय नियंत्रण सिद्धांत और मॉडल-आधारित सुदृढीकरण-सीखने में हैं, जहाँ एक एजेंट का पर्यावरण गतिशीलता का मॉडल स्पष्ट रूप से योजना के लिए उपयोग किया जाता है, लेकिन हाल के वर्षों में इसने व्यापक महत्व प्राप्त किया है क्योंकि शोधकर्ताओं ने प्रस्तावित किया है कि कच्चे संवेदी डेटा, विशेष रूप से वीडियो से एक भविष्य कहनेवाला विश्व मॉडल सीखना, केवल पाठ पर प्रशिक्षण की तुलना में अधिक सामान्य और मजबूत बुद्धिमत्ता का मार्ग हो सकता है।
सुदृढीकरण सीखने में उत्पत्ति
मॉडल-आधारित सुदृढीकरण सीखने ने लंबे समय से कार्य करने से पहले भविष्य की स्थितियों का अनुकरण करने के लिए स्पष्ट या सीखे गए गतिशीलता मॉडल का उपयोग किया है, मॉडल-मुक्त दृष्टिकोणों के विपरीत जो परीक्षण और त्रुटि से सीधे एक नीति या मूल्य फ़ंक्शन सीखते हैं। डेविड हा और जुर्गन श्मिडहुबर द्वारा 2018 का एक व्यापक रूप से उद्धृत पेपर, जिसका शीर्षक केवल "विश्व मॉडल" है, ने प्रदर्शित किया कि एक एजेंट एक वीडियो-गेम वातावरण का एक संपीड़ित जनरेटिव मॉडल सीख सकता है और फिर लगभग पूरी तरह से उस सीखे गए अनुकरण के अंदर एक नीति प्रशिक्षित कर सकता है, जिससे आधुनिक एआई अर्थ में इस शब्द को लोकप्रिय बनाया गया और भविष्य कहनेवाला, स्व-मॉडलिंग एजेंटों पर पहले के काम पर निर्माण किया गया।
वीडियो भविष्यवाणी और जनरेटिव विश्व मॉडल
अनुसंधान की एक नई पंक्ति बड़े पैमाने पर वीडियो भविष्यवाणी को ही एक विश्व मॉडल को अंतर्निहित रूप से सीखने के तरीके के रूप में मानती है, बिना किसी हाथ से डिज़ाइन किए गए सिम्युलेटर के। गूगल डीपमाइंड का जेनी, जिसे 2024 में पेश किया गया था, ने बिना लेबल वाले इंटरनेट वीडियो से पूरी तरह से खेलने योग्य, इंटरैक्टिव 2D वातावरण उत्पन्न करना सीखा, बिना अंतर्निहित गेम इंजन राज्यों या क्रिया लेबल तक पहुंच के, यह प्रदर्शित करते हुए कि क्रिया-अनुकूलित विश्व गतिशीलता निष्क्रिय अवलोकन से सीखी जा सकती है। सोरा जैसी वीडियो-जनरेशन प्रणालियों को उनके डेवलपर्स द्वारा इसी तरह प्रारंभिक, सामान्य-उद्देश्य "विश्व सिम्युलेटर" के रूप में वर्णित किया गया है, इस तर्क पर कि एक वीडियो कैसे जारी रहना चाहिए, इसकी सटीक भविष्यवाणी करने के लिए भौतिकी, वस्तु स्थिरता और कारण और प्रभाव का एक अंतर्निहित मॉडल आवश्यक है, हालांकि आलोचकों का कहना है कि ऐसे मॉडल अक्सर बुनियादी भौतिक स्थिरता का उल्लंघन करते हैं और धाराप्रवाह वीडियो जनरेशन का मतलब एक विश्वसनीय या सामान्यीकरण योग्य आंतरिक भौतिकी मॉडल नहीं है।
JEPA और लेकुन का प्रस्ताव
यान लेकुन ने संयुक्त एम्बेडिंग भविष्य कहनेवाला वास्तुकला, या JEPA, को विशुद्ध रूप से जनरेटिव वीडियो मॉडल और मानक ऑटोरेग्रेसिव-मॉडल भाषा मॉडलिंग दोनों के विकल्प के रूप में प्रस्तावित किया है। कच्चे पिक्सेल या टोकन की भविष्यवाणी करने के बजाय, JEPA-शैली के मॉडल एक अमूर्त, सीखे गए प्रतिनिधित्व स्थान में भविष्य की स्थितियों की भविष्यवाणी करते हैं, एक दृष्टिकोण जिसे लेकुन का तर्क है कि यह अधिक कुशल है और बनावट शोर जैसे अप्रासंगिक विवरण को अनदेखा करने में अधिक सक्षम है, जबकि योजना के लिए आवश्यक कारण संरचना को पकड़ता है। लेकुन ने इस तरह से निर्मित विश्व मॉडल को मूर्त-एआई के लिए और आज की बड़े-भाषा-मॉडल प्रणालियों की क्षमताओं से परे प्रगति के लिए एक केंद्रीय लापता घटक के रूप में तैयार किया है, इस विचार को मुख्य रूप से पाठ-आधारित पूर्व-प्रशिक्षण को बढ़ाने पर दांव लगाने वाली प्रयोगशालाओं के सीधे विपरीत रखा है।
महत्व
विश्व मॉडल तेजी से न केवल रोबोटिक्स और गेम-खेलने वाले एजेंटों के लिए बल्कि कृत्रिम-सामान्य-बुद्धिमत्ता के बारे में व्यापक प्रश्नों के लिए भी प्रासंगिक माने जाते हैं, क्योंकि अपने पर्यावरण के सटीक आंतरिक मॉडल वाला एक एजेंट, सिद्धांत रूप में, लंबे क्षितिज पर योजना बना सकता है और केवल तत्काल इनपुट पर प्रतिक्रिया करने वाले की तुलना में अधिक कुशलता से नई स्थितियों में सामान्यीकरण कर सकता है। 2020 के दशक के मध्य तक, विश्व मॉडल अनुसंधान एक सक्रिय और अनसुलझा क्षेत्र बना हुआ है, जिसमें इस बात पर पर्याप्त असहमति है कि इसका कितना हिस्सा निष्क्रिय वीडियो से सीखा जा सकता है बनाम कितना मूर्त बातचीत की आवश्यकता है।