Dreamer मॉडल-आधारित सुदृढीकरण सीखने एल्गोरिदम का एक परिवार है, जिसे गूगल डीपमाइंड में विकसित किया गया है, और यह उच्च नमूना दक्षता के साथ सीधे छवि इनपुट से जटिल व्यवहार सीखने के लिए उल्लेखनीय है। मुख्य विचार यह है कि एक एजेंट पिछले अनुभव से पर्यावरण की गतिशीलता को दर्शाते हुए एक कॉम्पैक्ट अव्यक्त-स्थान विश्व मॉडल सीखता है, और फिर उस अव्यक्त प्रतिनिधित्व के भीतर पूरी तरह से भविष्य की अवस्थाओं के रोलआउट की "कल्पना" करके नीति और मूल्य फ़ंक्शन को प्रशिक्षित करता है। यह दृष्टिकोण मॉडल-मुक्त विधियों के विपरीत है, जिन्हें व्यापक वास्तविक-दुनिया इंटरैक्शन की आवश्यकता होती है, जिससे Dreamer अधिक नमूना-कुशल कृत्रिम एजेंटों की दिशा में एक महत्वपूर्ण कदम बन जाता है।
पहला संस्करण, Dreamer, डैनियर हाफनर, टिमोथी लिलिक्रैप, जिमी बा और मोहम्मद नोरूज़ी द्वारा 2020 के एक पेपर में पेश किया गया था। इसने अव्यक्त कल्पना के प्रतिमान को स्थापित किया, जहां एजेंट अवलोकनों और क्रियाओं को स्टोकेस्टिक अव्यक्त अवस्थाओं में एन्कोड करने के लिए एक आवर्तक राज्य-स्थान मॉडल (RSSM) सीखता है। नीति को काल्पनिक अव्यक्त प्रक्षेपवक्रों के माध्यम से मूल्य ग्रेडिएंट्स को बैकप्रोपेगेट करके अद्यतन किया जाता है। DeepMind Control Suite और Atari खेलों पर बेंचमार्क कार्यों में, Dreamer ने DQN और D4PG जैसे मॉडल-मुक्त एल्गोरिदम के प्रदर्शन से मेल खाया या उसे पार किया, जबकि काफी कम पर्यावरण इंटरैक्शन की आवश्यकता थी।
एल्गोरिथमिक विकास
DreamerV2, जो 2021 में प्रकाशित हुआ, ने विश्व मॉडल में श्रेणीबद्ध वितरण के साथ असतत अव्यक्त चर पेश करके आर्किटेक्चर को परिष्कृत किया। यह परिवर्तन, KL संतुलन और मुक्त बिट्स जैसी तकनीकों के साथ, मॉडल की बहु-मोडल गतिशीलता को पकड़ने की क्षमता में सुधार करता है। DreamerV2 पहला एजेंट बन गया जिसने एक ही हाइपरपैरामीटर सेट का उपयोग करके सभी 55 Atari खेलों में महारत हासिल की, मानव-स्तर के स्कोर को पार करते हुए और उस बेंचमार्क पर नमूना-कुशल RL के लिए एक नया राज्य-कला स्थापित किया।
DreamerV3, जो 2023 में जारी हुआ, ने लोकोमोशन, हेरफेर और वीडियो गेम के 150 विविध कार्यों में बिना किसी कार्य-विशिष्ट ट्यूनिंग के मजबूत प्रदर्शन प्राप्त करके व्यापक सामान्यता का प्रदर्शन किया। इसकी स्थिर विधि में सामान्यीकृत भविष्यवाणियां, सिमलॉग हानि स्केलिंग और मजबूत मूल्य अनुमान के लिए बेसलाइन सामान्यीकरण शामिल हैं। DreamerV3 विशेष रूप से कच्चे पिक्सेल और क्रियाओं से Minecraft खेल में हीरे इकट्ठा करने वाला पहला एजेंट बन गया, एक ऐसा कार्य जिसके लिए लंबी-क्षितिज योजना और विरल पुरस्कारों की आवश्यकता होती है, जो एल्गोरिदम की व्यावहारिक मजबूती को रेखांकित करता है।
मुख्य घटक
Dreamer परिवार तीन सीखे गए घटकों पर निर्भर करता है। पहला, विश्व मॉडल - एक RSSM जो अव्यक्त गतिशीलता सीखता है: यह उच्च-आयामी अवलोकनों (जैसे पिक्सेल) को एक कॉम्पैक्ट अव्यक्त वेक्टर में एन्कोड करता है, क्रियाओं को देखते हुए बाद की अव्यक्त अवस्थाओं की भविष्यवाणी करता है, और अवलोकनों और पुरस्कारों का पुनर्निर्माण करता है। दूसरा, क्रिटिक (मूल्य नेटवर्क) किसी भी अव्यक्त अवस्था से अपेक्षित छूट वाले रिटर्न का अनुमान लगाता है। तीसरा, अभिनेता (नीति नेटवर्क) वर्तमान अव्यक्त अवस्था को देखते हुए क्रियाएं उत्पन्न करता है। प्रशिक्षण के दौरान, एजेंट विश्व मॉडल का उपयोग करके एक प्रारंभिक अव्यक्त अवस्था से कई समय चरणों तक कल्पना करता है, रिटर्न का मूल्यांकन करने के लिए क्रिटिक का उपयोग करता है, और अभिनेता को उन्हें अधिकतम करने के लिए प्रशिक्षित करता है, अक्सर ग्रेडिएंट के सीधे-माध्यम से अनुमान के माध्यम से।
प्रभाव और अनुप्रयोग
Dreamer की अव्यक्त कल्पना दृष्टिकोण ने मॉडल-आधारित RL में कई अनुवर्ती कार्यों को प्रेरित किया है, जिसमें MuZero जैसे एल्गोरिदम शामिल हैं, जो एक सीखा हुआ मॉडल लेकिन अलग प्रतिनिधित्व के साथ उपयोग करता है, और अन्य अव्यक्त-स्थान योजनाकार शामिल हैं। इसकी नमूना दक्षता ने इसे रोबोटिक्स और नियंत्रण के लिए आकर्षक बना दिया है जहां वास्तविक इंटरैक्शन महंगा है। शोधकर्ताओं ने वास्तविक-दुनिया के कार्यों जैसे मानव-सदृश रोबोट के साथ रोबोट पकड़ने और स्वायत्त ड्राइविंग सिमुलेशन में Dreamer वेरिएंट लागू किए हैं। कोड खुला-स्रोत है, जो उद्योग और शिक्षा में व्यापक अपनाने की अनुमति देता है, और इसे अक्सर शोध में सुदृढीकरण सीखने पर बेसलाइन के रूप में उपयोग किया जाता है।
मॉडल-मुक्त विधियों से तुलना
गहरे Q-नेटवर्क और नीति ग्रेडिएंट जैसे मॉडल-मुक्त एल्गोरिदम को कार्यों में महारत हासिल करने के लिए लाखों कदमों की आवश्यकता होती है क्योंकि वे गतिशीलता संरचना को अनदेखा करते हैं। Dreamer सीखे हुए मॉडल का उपयोग आभासी अनुभव उत्पन्न करने के लिए करता है, जिससे लोकोमोशन और नेविगेशन जैसे कार्यों में समान प्रदर्शन के लिए 10-100 गुना कम वास्तविक पर्यावरण इंटरैक्शन मिलता है। हालांकि, मॉडल-आधारित विधियां विश्व मॉडल में चक्रवृद्धि भविष्यवाणी त्रुटियों से पीड़ित हो सकती हैं, जिसे Dreamer छोटी कल्पना क्षितिज और स्टोकेस्टिक अव्यक्त अवस्थाओं का उपयोग करके कम करता है। बहुत उच्च-आयामी अवलोकनों या गैर-स्थिर गतिशीलता पर, मॉडल-मुक्त विधियां अभी भी बेहतर हो सकती हैं।
व्यापक संदर्भ
Dreamer कृत्रिम बुद्धिमत्ता में आत्म-पर्यवेक्षित शिक्षा और विश्व मॉडल की ओर एक बड़ी प्रवृत्ति का हिस्सा है, जो जनरेटिव एआई और मॉडल-आधारित योजना को भी प्रभावित करता है। यह संज्ञानात्मक विज्ञान में मानसिक सिमुलेशन और कल्पना के बारे में विचारों से जुड़ा है, जो निर्णय लेने के लिए एक तंत्र है। बड़े भाषा मॉडल के उदय के साथ, Dreamer-शैली विश्व मॉडल को ट्रांसफॉर्मर आर्किटेक्चर के साथ जोड़ने पर चल रहे शोध हैं ताकि एजेंट बनाए जा सकें जो पाठ और भौतिक वातावरण दोनों के बारे में तर्क कर सकें। एल्गोरिदम का खुला-स्रोत पारिस्थितिकी तंत्र और पुनरुत्पादक परिणाम इसे आधुनिक AI अनुसंधान में एक मौलिक संदर्भ बनाते हैं।
भविष्य की दिशाएं
चल रहे कार्य में Dreamer को बहु-एजेंट सेटिंग्स तक विस्तारित करना, इसे पदानुक्रमित क्रिया स्थानों के साथ जोड़ना, और पॉइंट क्लाउड इनपुट जैसे उच्च-आयामी अवलोकनों के साथ निरंतर नियंत्रण के लिए इसकी स्केलेबिलिटी में सुधार करना शामिल है। शोधकर्ता खुली-दुनिया के वातावरण में मजबूती में सुधार के लिए विश्व मॉडल के भीतर अनिश्चितता की मात्रा निर्धारण भी खोज रहे हैं। जैसे-जैसे कम्प्यूटेशनल संसाधन बढ़ते हैं, Dreamer-शैली की अव्यक्त कल्पना से सीमित डेटा के साथ लंबे क्षितिज पर योजना बनाने वाले एजेंटों का एक मुख्य घटक बनने की उम्मीद है।