अस्थायी अंतर अधिगम (Temporal Difference Learning)

अंग्रेज़ी से अनुवादित

टेम्पोरल डिफरेंस (TD) लर्निंग एक रीइन्फोर्समेंट लर्निंग विधि है जो मोंटे कार्लो और डायनेमिक प्रोग्रामिंग के विचारों को जोड़ती है, जो अंतिम परिणामों की प्रतीक्षा किए बिना भविष्य के पुरस्कारों की भविष्यवाणियों के आधार पर मूल्य अनुमानों को अद्यतन करती है।

टेम्पोरल डिफरेंस (TD) लर्निंग एक मौलिक रीइन्फोर्समेंट लर्निंग तकनीक है जो मोंटे कार्लो विधियों और डायनेमिक प्रोग्रामिंग के बीच की खाई को पाटती है। यह एक एजेंट को पर्यावरण की गतिशीलता के मॉडल के बिना कच्चे अनुभव से सीखने में सक्षम बनाती है, साथ ही अन्य सीखे गए अनुमानों के आधार पर अनुमानों को अद्यतन करती है, जिसे बूटस्ट्रैपिंग के रूप में जाना जाता है। यह संयोजन TD लर्निंग को कम्प्यूटेशनल रूप से कुशल और ऑनलाइन, वृद्धिशील सीखने के कार्यों पर लागू करने योग्य बनाता है, जिससे यह आधुनिक कृत्रिम बुद्धिमत्ता प्रणालियों की आधारशिला बन जाती है।

TD लर्निंग का मुख्य विचार प्रत्येक समय चरण के तुरंत बाद एक मूल्य अनुमान को अद्यतन करना है, जिसमें देखा गया पुरस्कार और अगली अवस्था का अनुमानित मूल्य उपयोग किया जाता है। यह मोंटे कार्लो विधियों के विपरीत है, जिन्हें वास्तविक प्रतिफल की गणना करने के लिए एक एपिसोड के अंत तक प्रतीक्षा करने की आवश्यकता होती है, और डायनेमिक प्रोग्रामिंग के विपरीत है, जिसे पर्यावरण के पूर्ण मॉडल की आवश्यकता होती है। एक-चरणीय अग्रदृष्टि का उपयोग करके, TD लर्निंग अधूरे अनुक्रमों से सीख सकती है और उसे अंतिम परिणाम की प्रतीक्षा करने की आवश्यकता नहीं होती, जिससे यह निरंतर कार्यों के लिए उपयुक्त बन जाती है।

एल्गोरिथमिक आधार

TD लर्निंग का सबसे सरल रूप TD(0) है, जहाँ एक अवस्था का मूल्य सूत्र का उपयोग करके अद्यतन किया जाता है: V(s) ← V(s) + α [r + γ V(s') - V(s)], जहाँ α सीखने की दर है, r प्राप्त पुरस्कार है, γ छूट कारक है, और s' अगली अवस्था है। कोष्ठक में दिया गया पद TD त्रुटि है, जो वर्तमान अनुमान और देखे गए पुरस्कार तथा अगली अवस्था पर आधारित बेहतर अनुमान के बीच के अंतर को मापता है। यह अद्यतन नियम बूटस्ट्रैपिंग का एक रूप है क्योंकि यह V(s) को अद्यतन करने के लिए V(s') के वर्तमान अनुमान का उपयोग करता है।

TD लर्निंग को TD(λ) के रूप में सामान्यीकृत किया जा सकता है, जो पात्रता ट्रेस का उपयोग करके TD(0) और मोंटे कार्लो विधियों के बीच अंतर्कलन करता है। पैरामीटर λ बूटस्ट्रैपिंग और पूर्ण प्रतिफल के उपयोग के बीच संतुलन को नियंत्रित करता है। जब λ = 0 होता है, एल्गोरिथम TD(0) के बराबर होता है, और जब λ = 1 होता है, यह एक मोंटे कार्लो विधि बन जाता है। यह लचीलापन TD(λ) को पूर्वाग्रह और विचरण के बीच समझौता करने की अनुमति देता है, जिससे अक्सर दोनों चरम सीमाओं की तुलना में तेज़ अभिसरण होता है।

ऐतिहासिक विकास

TD लर्निंग की अवधारणा रिचर्ड सटन द्वारा 1988 के अपने पेपर "लर्निंग टू प्रेडिक्ट बाय द मेथड्स ऑफ टेम्पोरल डिफरेंसेस" में पेश की गई थी। सटन, जो उस समय GTE प्रयोगशालाओं में थे, ने इस विचार को मोंटे कार्लो और डायनेमिक प्रोग्रामिंग के लाभों को संयोजित करने के एक तरीके के रूप में औपचारिक रूप दिया। उनका कार्य पशु सीखने और मनोविज्ञान में पहले के शोध से प्रभावित था, विशेष रूप से भविष्यवाणी और पुरस्कार भविष्यवाणी त्रुटि के विचार से। यह एल्गोरिथम 1990 के दशक में प्रमुखता से उभरा जब इसे TD-गैमन प्रोग्राम में उपयोग किया गया, जिसने स्व-खेल के माध्यम से विश्व स्तरीय स्तर पर बैकगैमन खेलना सीखा, जटिल डोमेन में TD लर्निंग की शक्ति का प्रदर्शन किया।

रीइन्फोर्समेंट लर्निंग में अनुप्रयोग

TD लर्निंग कई रीइन्फोर्समेंट लर्निंग एल्गोरिदम का एक मुख्य घटक है। इसका उपयोग Q-लर्निंग में किया जाता है, जो एक मॉडल-मुक्त एल्गोरिथम है जो अवस्था-क्रिया युग्मों का मूल्य सीखता है, और SARSA (स्टेट-एक्शन-रिवॉर्ड-स्टेट-एक्शन) में, जो अनुसरण की जा रही नीति का मूल्य सीखता है। दोनों एल्गोरिदम अपने अनुमानों को परिष्कृत करने के लिए TD अद्यतन का उपयोग करते हैं। TD लर्निंग अभिनेता-आलोचक विधियों को भी रेखांकित करती है, जहाँ एक अभिनेता नीति सीखता है और एक आलोचक TD त्रुटियों का उपयोग करके मूल्य फलन सीखता है। इन विधियों को रोबोटिक्स, खेल खेलने और स्वायत्त प्रणालियों में सफलतापूर्वक लागू किया गया है।

आधुनिक गहन रीइन्फोर्समेंट लर्निंग में, TD लर्निंग को उच्च-आयामी अवस्था स्थानों को संभालने के लिए तंत्रिका नेटवर्क के साथ जोड़ा जाता है। उदाहरण के लिए, डीप Q-नेटवर्क (DQN) एल्गोरिथम, जिसे 2013 में डीपमाइंड द्वारा विकसित किया गया था, Q-फलन का अनुमान लगाने के लिए एक तंत्रिका नेटवर्क का उपयोग करता है और इसे TD लक्ष्यों का उपयोग करके अद्यतन करता है। इस दृष्टिकोण ने अटारी खेलों पर मानव-स्तरीय प्रदर्शन प्राप्त किया, जो कृत्रिम बुद्धिमत्ता में एक महत्वपूर्ण मील का पत्थर था। बाद के सुधार, जैसे डबल DQN और ड्यूएलिंग DQN, अति-अनुमान को कम करने और स्थिरता में सुधार करने के लिए TD अद्यतन को और परिष्कृत करते हैं।

अन्य सीखने के प्रतिमानों से संबंध

TD लर्निंग अन्य मशीन लर्निंग तकनीकों के साथ वैचारिक समानताएँ साझा करती है। बूटस्ट्रैपिंग का इसका उपयोग उस तरीके के अनुरूप है जिसमें तंत्रिका नेटवर्क परतों के माध्यम से त्रुटियों को पीछे की ओर प्रसारित करते हैं। TD त्रुटि को भविष्यवाणी त्रुटि के एक रूप के रूप में देखा जा सकता है, जो पर्यवेक्षित सीखने में उपयोग किए जाने वाले हानि फलनों के समान है। हालाँकि, TD लर्निंग इस मायने में अलग है कि यह स्पष्ट लेबल के बिना अवस्थाओं और पुरस्कारों के अनुक्रमों से सीखती है, जिससे यह पर्यवेक्षित सीखने के बजाय रीइन्फोर्समेंट लर्निंग का एक रूप बन जाती है।

टेम्पोरल डिफरेंस का विचार अन्य क्षेत्रों में भी दिखाई देता है। कृत्रिम बुद्धिमत्ता में, यह तंत्रिका विज्ञान में भविष्य कहनेवाला कोडिंग सिद्धांतों से संबंधित है, जहाँ मस्तिष्क को भविष्यवाणी त्रुटियों को कम करने के लिए माना जाता है। अर्थशास्त्र में, समान अवधारणाएँ सीखने और अपेक्षा निर्माण के मॉडल में दिखाई देती हैं। यह अंतर-विषयक प्रासंगिकता TD लर्निंग को कंप्यूटर विज्ञान से परे, मनोविज्ञान और संज्ञानात्मक विज्ञान सहित, अध्ययन का विषय बनाती है।

सीमाएँ और विस्तार

अपनी ताकत के बावजूद, TD लर्निंग की सीमाएँ हैं। यह सीखने की दर और छूट कारक की पसंद के प्रति संवेदनशील हो सकती है, और कुछ सेटिंग्स में फलन सन्निकटन के साथ संयुक्त होने पर यह विचलित हो सकती है। बूटस्ट्रैपिंग, फलन सन्निकटन और ऑफ-पॉलिसी सीखने की घातक त्रयी अस्थिरता का कारण बन सकती है। शोधकर्ताओं ने इन मुद्दों को संबोधित करने के लिए ग्रेडिएंट TD विधियों और जोरदार TD एल्गोरिदम जैसे विस्तार विकसित किए हैं, जो अधिक मजबूत अभिसरण गारंटी प्रदान करते हैं।

एक और सीमा यह है कि TD लर्निंग नमूना-अकुशल हो सकती है, जिसके लिए पर्यावरण के साथ कई अंतःक्रियाओं की आवश्यकता होती है। इसने मॉडल-आधारित विधियों के विकास को प्रेरित किया है जो पर्यावरण का एक मॉडल सीखते हैं और योजना के लिए इसका उपयोग करते हैं, जिसे अक्सर TD अद्यतन के साथ जोड़ा जाता है। डायना-Q जैसे एल्गोरिदम मॉडल-आधारित और मॉडल-मुक्त सीखने को एकीकृत करते हैं, मूल्य फलन और मॉडल दोनों को परिष्कृत करने के लिए TD अद्यतन का उपयोग करते हैं। ये संकर दृष्टिकोण मॉडल-आधारित विधियों की नमूना दक्षता को TD लर्निंग की सरलता के साथ संयोजित करने का लक्ष्य रखते हैं।

भविष्य की दिशाएँ

TD लर्निंग अनुसंधान का एक सक्रिय क्षेत्र बनी हुई है। हाल के कार्य बड़े पैमाने की सेटिंग्स में TD विधियों की स्थिरता और दक्षता में सुधार पर केंद्रित हैं, जैसे कि गहन सीखने और बड़े भाषा मॉडल से जुड़ी सेटिंग्स। शोधकर्ता TD लर्निंग को अन्य प्रतिमानों, जैसे मेटा-लर्निंग और बहु-एजेंट प्रणालियों के साथ संयोजित करने के तरीकों की खोज कर रहे हैं। TD लर्निंग के सिद्धांतों को नए डोमेन में भी लागू किया जा रहा है, जिसमें व्यक्तिगत अनुशंसाएँ, स्वास्थ्य सेवा और वित्तीय मॉडलिंग शामिल हैं, जहाँ अनुक्रमिक निर्णय लेना महत्वपूर्ण है।

जैसे-जैसे कृत्रिम बुद्धिमत्ता आगे बढ़ती है, एजेंटों को अनुभव से सीखने में सक्षम बनाने में TD लर्निंग की भूमिका केंद्रीय बनी रहती है। मॉडल की आवश्यकता के बिना ऑनलाइन और वृद्धिशील रूप से सीखने की इसकी क्षमता इसे अनुकूली प्रणालियों के निर्माण के लिए एक बहुमुखी उपकरण बनाती है। TD लर्निंग का आधुनिक कम्प्यूटेशनल तकनीकों के साथ चल रहा एकीकरण नई अंतर्दृष्टि और अनुप्रयोगों का वादा करता है, जो रीइन्फोर्समेंट लर्निंग में एक मौलिक अवधारणा के रूप में इसकी स्थिति को मजबूत करता है।

यह भी देखें

संदर्भ

  • सटन, आर. एस. (1988)। लर्निंग टू प्रेडिक्ट बाय द मेथड्स ऑफ टेम्पोरल डिफरेंसेस। मशीन लर्निंग, 3(1), 9-44।
  • सटन, आर. एस., और बार्टो, ए. जी. (2018)। रीइन्फोर्समेंट लर्निंग: एन इंट्रोडक्शन। एमआईटी प्रेस।
  • मनिह, वी., एट अल. (2015)। ह्यूमन-लेवल कंट्रोल थ्रू डीप रीइन्फोर्समेंट लर्निंग। नेचर, 518(7540), 529-533।
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·machine-learning·artificial-intelligence·algorithms
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास