अंग्रेज़ी से अनुवादित

विश्व मॉडल एक आंतरिक प्रतिनिधित्व है, जो सीखा या इंजीनियर किया गया होता है, जिसे एक AI प्रणाली यह अनुमान लगाने के लिए उपयोग करती है कि क्रियाओं के जवाब में पर्यावरण कैसे बदलेगा, जिससे वास्तविकता में कार्य किए बिना योजना बनाना और सिमुलेशन संभव होता है।

एक विश्व मॉडल, कृत्रिम बुद्धिमत्ता में, एक आंतरिक प्रतिनिधित्व है जिसका उपयोग एक एजेंट यह भविष्यवाणी करने के लिए करता है कि उसका वातावरण समय के साथ कैसे बदलेगा, जिसमें उसके अपने कार्यों के प्रति प्रतिक्रिया भी शामिल है, जिससे एजेंट को वास्तविक वातावरण में कार्य किए बिना परिणामों का निरीक्षण करने के लिए योजना बनाने, परिणामों की कल्पना करने और विकल्पों का मूल्यांकन करने की अनुमति मिलती है। इस शब्द की जड़ें शास्त्रीय नियंत्रण सिद्धांत और मॉडल-आधारित सुदृढीकरण-सीखने में हैं, जहाँ एक एजेंट का पर्यावरण गतिशीलता का मॉडल स्पष्ट रूप से योजना के लिए उपयोग किया जाता है, लेकिन हाल के वर्षों में इसने व्यापक महत्व प्राप्त किया है क्योंकि शोधकर्ताओं ने प्रस्तावित किया है कि कच्चे संवेदी डेटा, विशेष रूप से वीडियो से एक भविष्य कहनेवाला विश्व मॉडल सीखना, केवल पाठ पर प्रशिक्षण की तुलना में अधिक सामान्य और मजबूत बुद्धिमत्ता का मार्ग हो सकता है।

सुदृढीकरण सीखने में उत्पत्ति

मॉडल-आधारित सुदृढीकरण सीखने ने लंबे समय से कार्य करने से पहले भविष्य की स्थितियों का अनुकरण करने के लिए स्पष्ट या सीखे गए गतिशीलता मॉडल का उपयोग किया है, मॉडल-मुक्त दृष्टिकोणों के विपरीत जो परीक्षण और त्रुटि से सीधे एक नीति या मूल्य फ़ंक्शन सीखते हैं। डेविड हा और जुर्गन श्मिडहुबर द्वारा 2018 का एक व्यापक रूप से उद्धृत पेपर, जिसका शीर्षक केवल "विश्व मॉडल" है, ने प्रदर्शित किया कि एक एजेंट एक वीडियो-गेम वातावरण का एक संपीड़ित जनरेटिव मॉडल सीख सकता है और फिर लगभग पूरी तरह से उस सीखे गए अनुकरण के अंदर एक नीति प्रशिक्षित कर सकता है, जिससे आधुनिक एआई अर्थ में इस शब्द को लोकप्रिय बनाया गया और भविष्य कहनेवाला, स्व-मॉडलिंग एजेंटों पर पहले के काम पर निर्माण किया गया।

वीडियो भविष्यवाणी और जनरेटिव विश्व मॉडल

अनुसंधान की एक नई पंक्ति बड़े पैमाने पर वीडियो भविष्यवाणी को ही एक विश्व मॉडल को अंतर्निहित रूप से सीखने के तरीके के रूप में मानती है, बिना किसी हाथ से डिज़ाइन किए गए सिम्युलेटर के। गूगल डीपमाइंड का जेनी, जिसे 2024 में पेश किया गया था, ने बिना लेबल वाले इंटरनेट वीडियो से पूरी तरह से खेलने योग्य, इंटरैक्टिव 2D वातावरण उत्पन्न करना सीखा, बिना अंतर्निहित गेम इंजन राज्यों या क्रिया लेबल तक पहुंच के, यह प्रदर्शित करते हुए कि क्रिया-अनुकूलित विश्व गतिशीलता निष्क्रिय अवलोकन से सीखी जा सकती है। सोरा जैसी वीडियो-जनरेशन प्रणालियों को उनके डेवलपर्स द्वारा इसी तरह प्रारंभिक, सामान्य-उद्देश्य "विश्व सिम्युलेटर" के रूप में वर्णित किया गया है, इस तर्क पर कि एक वीडियो कैसे जारी रहना चाहिए, इसकी सटीक भविष्यवाणी करने के लिए भौतिकी, वस्तु स्थिरता और कारण और प्रभाव का एक अंतर्निहित मॉडल आवश्यक है, हालांकि आलोचकों का कहना है कि ऐसे मॉडल अक्सर बुनियादी भौतिक स्थिरता का उल्लंघन करते हैं और धाराप्रवाह वीडियो जनरेशन का मतलब एक विश्वसनीय या सामान्यीकरण योग्य आंतरिक भौतिकी मॉडल नहीं है।

JEPA और लेकुन का प्रस्ताव

यान लेकुन ने संयुक्त एम्बेडिंग भविष्य कहनेवाला वास्तुकला, या JEPA, को विशुद्ध रूप से जनरेटिव वीडियो मॉडल और मानक ऑटोरेग्रेसिव-मॉडल भाषा मॉडलिंग दोनों के विकल्प के रूप में प्रस्तावित किया है। कच्चे पिक्सेल या टोकन की भविष्यवाणी करने के बजाय, JEPA-शैली के मॉडल एक अमूर्त, सीखे गए प्रतिनिधित्व स्थान में भविष्य की स्थितियों की भविष्यवाणी करते हैं, एक दृष्टिकोण जिसे लेकुन का तर्क है कि यह अधिक कुशल है और बनावट शोर जैसे अप्रासंगिक विवरण को अनदेखा करने में अधिक सक्षम है, जबकि योजना के लिए आवश्यक कारण संरचना को पकड़ता है। लेकुन ने इस तरह से निर्मित विश्व मॉडल को मूर्त-एआई के लिए और आज की बड़े-भाषा-मॉडल प्रणालियों की क्षमताओं से परे प्रगति के लिए एक केंद्रीय लापता घटक के रूप में तैयार किया है, इस विचार को मुख्य रूप से पाठ-आधारित पूर्व-प्रशिक्षण को बढ़ाने पर दांव लगाने वाली प्रयोगशालाओं के सीधे विपरीत रखा है।

महत्व

विश्व मॉडल तेजी से न केवल रोबोटिक्स और गेम-खेलने वाले एजेंटों के लिए बल्कि कृत्रिम-सामान्य-बुद्धिमत्ता के बारे में व्यापक प्रश्नों के लिए भी प्रासंगिक माने जाते हैं, क्योंकि अपने पर्यावरण के सटीक आंतरिक मॉडल वाला एक एजेंट, सिद्धांत रूप में, लंबे क्षितिज पर योजना बना सकता है और केवल तत्काल इनपुट पर प्रतिक्रिया करने वाले की तुलना में अधिक कुशलता से नई स्थितियों में सामान्यीकरण कर सकता है। 2020 के दशक के मध्य तक, विश्व मॉडल अनुसंधान एक सक्रिय और अनसुलझा क्षेत्र बना हुआ है, जिसमें इस बात पर पर्याप्त असहमति है कि इसका कितना हिस्सा निष्क्रिय वीडियो से सीखा जा सकता है बनाम कितना मूर्त बातचीत की आवश्यकता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·embodied-ai·generative-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास