अंग्रेज़ी से अनुवादित

PlaNet एक गहन सुदृढीकरण सीखने का मॉडल है जो छवि इनपुट से विश्व मॉडल सीखता है, जिससे अव्यक्त स्थानों में योजना बनाना संभव होता है। Google शोधकर्ताओं द्वारा विकसित, इसने मॉडल-मुक्त तरीकों की तुलना में कम अंतःक्रियाओं के साथ नियंत्रण कार्यों को प्राप्त किया।

PlaNet (Deep Planning Network) एक तंत्रिका नेटवर्क वास्तुकला है जो मॉडल-आधारित सुदृढीकरण सीखने के लिए है, जिसे 2019 में गूगल डीपमाइंड के शोधकर्ताओं द्वारा प्रस्तुत किया गया था। यह उच्च-आयामी छवि अवलोकनों से एक गुप्त गतिशीलता मॉडल सीखता है और योजना बनाने के लिए उस मॉडल का उपयोग करता है, जिससे एक एजेंट मॉडल-मुक्त दृष्टिकोणों की तुलना में काफी कम पर्यावरणीय अंतःक्रियाओं के साथ नियंत्रण कार्यों को हल कर सकता है। यह प्रणाली "Learning Latent Dynamics for Planning from Pixels" नामक पेपर में प्रस्तुत की गई थी, जिसे डैनिजार हफनर, टिमोथी लिलिक्रैप, इयान फिशर, रूबेन विलेगास, डेविड हा, होंगलाक ली और जेम्स डेविडसन द्वारा लिखा गया था।

मॉडल-मुक्त गहन शिक्षण एजेंटों के विपरीत, जिन्हें लाखों परीक्षणों की आवश्यकता होती है, PlaNet पर्यावरण की गतिशीलता का एक संक्षिप्त प्रतिनिधित्व सीखता है और सीधे उस गुप्त स्थान में योजना बनाता है। यह दृष्टिकोण कुछ कार्यों पर नमूना जटिलता को 5000 गुना तक कम कर देता है, जिससे यह कृत्रिम बुद्धिमत्ता और मॉडल-आधारित मशीन लर्निंग के क्षेत्र में एक मौलिक योगदान बन जाता है।

वास्तुकला और गुप्त गतिशीलता

PlaNet पर्यावरण का एक गुप्त प्रतिनिधित्व सीखने के लिए एक आवर्ती राज्य-स्थान मॉडल (RSSM) का उपयोग करता है। मॉडल में एक नियतात्मक आवर्ती घटक और एक स्टोकेस्टिक घटक शामिल है, जो एक साथ दुनिया के पूर्वानुमानित और अनिश्चित पहलुओं को पकड़ते हैं। एन्कोडर कच्चे पिक्सेल अवलोकनों को एक गुप्त स्थिति में संपीड़ित करता है, जबकि संक्रमण मॉडल क्रियाओं को देखते हुए भविष्य की गुप्त स्थितियों की भविष्यवाणी करता है। यह डिज़ाइन एजेंट को पूर्ण छवियां उत्पन्न किए बिना भविष्य के प्रक्षेपवक्र की कल्पना करने की अनुमति देता है, जो कम्प्यूटेशनल रूप से कुशल है।

प्रशिक्षण उद्देश्य एक पुनर्निर्माण हानि (यह सुनिश्चित करने के लिए कि गुप्त स्थितियों में पर्याप्त जानकारी है) और एक भविष्यवाणी हानि (सटीक आगे की गतिशीलता सुनिश्चित करने के लिए) को जोड़ता है। मॉडल को समय के माध्यम से बैकप्रॉपैगेशन का उपयोग करके एंड-टू-एंड प्रशिक्षित किया जाता है, जो एक आवर्ती तंत्रिका नेटवर्क को प्रशिक्षित करने के समान है।

योजना और नियंत्रण

PlaNet में योजना प्रक्रिया क्रॉस-एन्ट्रॉपी विधि (CEM) का एक प्रकार उपयोग करती है, जो एक व्युत्पन्न-मुक्त अनुकूलन एल्गोरिदम है। प्रत्येक समय चरण पर, एजेंट उम्मीदवार क्रिया अनुक्रमों का एक सेट नमूना करता है, सीखे गए गुप्त मॉडल का उपयोग करके उनके परिणामों का अनुकरण करता है, और उस अनुक्रम का चयन करता है जो भविष्यवाणी किए गए संचयी इनाम को अधिकतम करता है। यह पुनरावृत्त रूप से दोहराया जाता है, क्रिया वितरण को परिष्कृत करता है। सर्वोत्तम अनुक्रम की पहली क्रिया निष्पादित की जाती है, और प्रक्रिया दोहराई जाती है।

यह योजना दृष्टिकोण पूरी तरह से सीखा गया है और मॉडल के लिए पूर्वनिर्धारित इनाम फ़ंक्शन की आवश्यकता नहीं है; इसके बजाय, इनाम गुप्त स्थिति से भविष्यवाणी की जाती है। PlaNet विशुद्ध रूप से छवि-आधारित सेटिंग में काम करता है, केवल कच्चे पिक्सेल इनपुट प्राप्त करता है, पर्यावरण की वास्तविक स्थिति तक पहुंच के बिना।

प्रायोगिक परिणाम

PlaNet का मूल्यांकन डीपमाइंड कंट्रोल सूट से निरंतर नियंत्रण कार्यों के एक सूट पर किया गया, जिसमें कार्टपोल स्विंग-अप, फिंगर स्पिन, चीता रन, वॉकर वॉक, बॉल इन कप और रीचर शामिल हैं। अधिकांश कार्यों पर, PlaNet ने अत्याधुनिक मॉडल-मुक्त एल्गोरिदम के बराबर या बेहतर प्रदर्शन हासिल किया, लेकिन काफी कम अंतःक्रियाओं के साथ। उदाहरण के लिए, कार्टपोल स्विंग-अप कार्य पर, PlaNet ने लगभग 100 एपिसोड में कार्य हल किया, जबकि D4PG जैसे मॉडल-मुक्त तरीकों को हजारों एपिसोड की आवश्यकता थी।

लेखकों ने बताया कि PlaNet ने चीता रन कार्य पर मॉडल-मुक्त आधार रेखा की तुलना में लगभग 5000 गुना कम अंतःक्रियाओं का उपयोग किया, जबकि समान अंतिम प्रदर्शन तक पहुंच गया। इन परिणामों ने नमूना-कुशल सुदृढीकरण सीखने के लिए मॉडल-आधारित दृष्टिकोणों की क्षमता को उजागर किया, जो वास्तविक दुनिया के अनुप्रयोगों में एक प्रमुख चुनौती है जहां डेटा संग्रह महंगा है।

प्रभाव और विरासत

PlaNet ने मॉडल-आधारित सुदृढीकरण सीखने में बाद के काम को प्रभावित किया, जिसमें ड्रीमर श्रृंखला के मॉडल शामिल हैं, जिन्होंने विचारों को बड़े पैमाने के कार्यों और अधिक कुशल योजना तक बढ़ाया। गुप्त स्थान में विश्व मॉडल सीखने की अवधारणा जनरेटिव एआई अनुसंधान में एक केंद्रीय विषय बन गई, जिसमें नियंत्रण से परे अनुप्रयोग हैं, जैसे बड़े भाषा मॉडल जो तर्क के लिए आंतरिक विश्व प्रतिनिधित्व का उपयोग करते हैं।

यह कार्य गहन शिक्षण में नमूना दक्षता के महत्व पर व्यापक चर्चा में भी योगदान देता है, विशेष रूप से रोबोटिक्स और स्वायत्त प्रणालियों में। PlaNet का गुप्त स्थान में योजना बनाने का दृष्टिकोण विभिन्न रूपों में अन्य शोध समूहों द्वारा अपनाया गया है और मॉडल-आधारित एआई विकास के लिए ढांचे में एकीकृत किया गया है।

सीमाएं और भविष्य की दिशाएं

अपनी सफलताओं के बावजूद, PlaNet की सीमाएं थीं। यह लंबी-क्षितिज योजना या अत्यधिक स्टोकेस्टिक वातावरण की आवश्यकता वाले कार्यों के साथ संघर्ष करता था, और इसकी योजना लूप अनुमान के समय कम्प्यूटेशनल रूप से गहन थी। मॉडल को सावधानीपूर्वक हाइपरपैरामीटर ट्यूनिंग की भी आवश्यकता थी और यह गुप्त आयामों और प्रशिक्षण अनुसूची की पसंद के प्रति संवेदनशील था।

बाद के सुधारों, जैसे ड्रीमर और ड्रीमरV2, ने शुद्ध योजना के बजाय सीखे गए मूल्य फ़ंक्शन और अभिनेता-आलोचक विधियों का उपयोग करके इनमें से कुछ मुद्दों को संबोधित किया, जिससे बेहतर प्रदर्शन और स्केलेबिलिटी प्राप्त हुई। PlaNet क्षेत्र में एक मील का पत्थर बना हुआ है, यह दर्शाता है कि मॉडल-आधारित विधियां नमूना-कुशल और प्रतिस्पर्धी दोनों हो सकती हैं, और यह विश्व मॉडल और भविष्य कहनेवाला सीखने में अनुसंधान को प्रेरित करना जारी रखता है।

संदर्भ और आगे पढ़ना

मूल पेपर 2019 इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशंस (ICLR) में प्रकाशित हुआ था। लेखकों ने ओपन-सोर्स कोड जारी किया, जिसका शोध समुदाय में व्यापक रूप से उपयोग किया गया है। रुचि रखने वालों के लिए, संबंधित ड्रीमर पेपर (2020) और ड्रीमरV2 (2021) एक्सटेंशन और तुलना प्रदान करते हैं। PlaNet के विचार तंत्रिका नेटवर्क आधारित विश्व मॉडल पर पहले के काम से भी जुड़ते हैं, जैसे हा और श्मिधुबर द्वारा विश्व मॉडल पेपर, जिसने नियंत्रण के लिए समान गुप्त-स्थान दृष्टिकोण का उपयोग किया था।

2025 तक, PlaNet का प्रभाव आधुनिक सुदृढीकरण सीखने अनुसंधान में बना हुआ है, विशेष रूप से स्वायत्त ड्राइविंग और रोबोटिक्स जैसे क्षेत्रों में, जहां नमूना दक्षता महत्वपूर्ण है। इसकी विरासत दुनिया के आंतरिक मॉडल सीखने की शक्ति का एक प्रमाण है, एक अवधारणा जो एआई नवाचार में सबसे आगे बनी हुई है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·deep-learning·world-models·google-deepmind
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास