टेम्पोरल डिफरेंस (TD) लर्निंग एक मौलिक रीइन्फोर्समेंट लर्निंग तकनीक है जो मोंटे कार्लो विधियों और डायनेमिक प्रोग्रामिंग के बीच की खाई को पाटती है। यह एक एजेंट को पर्यावरण की गतिशीलता के मॉडल के बिना कच्चे अनुभव से सीखने में सक्षम बनाती है, साथ ही अन्य सीखे गए अनुमानों के आधार पर अनुमानों को अद्यतन करती है, जिसे बूटस्ट्रैपिंग के रूप में जाना जाता है। यह संयोजन TD लर्निंग को कम्प्यूटेशनल रूप से कुशल और ऑनलाइन, वृद्धिशील सीखने के कार्यों पर लागू करने योग्य बनाता है, जिससे यह आधुनिक कृत्रिम बुद्धिमत्ता प्रणालियों की आधारशिला बन जाती है।
TD लर्निंग का मुख्य विचार प्रत्येक समय चरण के तुरंत बाद एक मूल्य अनुमान को अद्यतन करना है, जिसमें देखा गया पुरस्कार और अगली अवस्था का अनुमानित मूल्य उपयोग किया जाता है। यह मोंटे कार्लो विधियों के विपरीत है, जिन्हें वास्तविक प्रतिफल की गणना करने के लिए एक एपिसोड के अंत तक प्रतीक्षा करने की आवश्यकता होती है, और डायनेमिक प्रोग्रामिंग के विपरीत है, जिसे पर्यावरण के पूर्ण मॉडल की आवश्यकता होती है। एक-चरणीय अग्रदृष्टि का उपयोग करके, TD लर्निंग अधूरे अनुक्रमों से सीख सकती है और उसे अंतिम परिणाम की प्रतीक्षा करने की आवश्यकता नहीं होती, जिससे यह निरंतर कार्यों के लिए उपयुक्त बन जाती है।
एल्गोरिथमिक आधार
TD लर्निंग का सबसे सरल रूप TD(0) है, जहाँ एक अवस्था का मूल्य सूत्र का उपयोग करके अद्यतन किया जाता है: V(s) ← V(s) + α [r + γ V(s') - V(s)], जहाँ α सीखने की दर है, r प्राप्त पुरस्कार है, γ छूट कारक है, और s' अगली अवस्था है। कोष्ठक में दिया गया पद TD त्रुटि है, जो वर्तमान अनुमान और देखे गए पुरस्कार तथा अगली अवस्था पर आधारित बेहतर अनुमान के बीच के अंतर को मापता है। यह अद्यतन नियम बूटस्ट्रैपिंग का एक रूप है क्योंकि यह V(s) को अद्यतन करने के लिए V(s') के वर्तमान अनुमान का उपयोग करता है।
TD लर्निंग को TD(λ) के रूप में सामान्यीकृत किया जा सकता है, जो पात्रता ट्रेस का उपयोग करके TD(0) और मोंटे कार्लो विधियों के बीच अंतर्कलन करता है। पैरामीटर λ बूटस्ट्रैपिंग और पूर्ण प्रतिफल के उपयोग के बीच संतुलन को नियंत्रित करता है। जब λ = 0 होता है, एल्गोरिथम TD(0) के बराबर होता है, और जब λ = 1 होता है, यह एक मोंटे कार्लो विधि बन जाता है। यह लचीलापन TD(λ) को पूर्वाग्रह और विचरण के बीच समझौता करने की अनुमति देता है, जिससे अक्सर दोनों चरम सीमाओं की तुलना में तेज़ अभिसरण होता है।
ऐतिहासिक विकास
TD लर्निंग की अवधारणा रिचर्ड सटन द्वारा 1988 के अपने पेपर "लर्निंग टू प्रेडिक्ट बाय द मेथड्स ऑफ टेम्पोरल डिफरेंसेस" में पेश की गई थी। सटन, जो उस समय GTE प्रयोगशालाओं में थे, ने इस विचार को मोंटे कार्लो और डायनेमिक प्रोग्रामिंग के लाभों को संयोजित करने के एक तरीके के रूप में औपचारिक रूप दिया। उनका कार्य पशु सीखने और मनोविज्ञान में पहले के शोध से प्रभावित था, विशेष रूप से भविष्यवाणी और पुरस्कार भविष्यवाणी त्रुटि के विचार से। यह एल्गोरिथम 1990 के दशक में प्रमुखता से उभरा जब इसे TD-गैमन प्रोग्राम में उपयोग किया गया, जिसने स्व-खेल के माध्यम से विश्व स्तरीय स्तर पर बैकगैमन खेलना सीखा, जटिल डोमेन में TD लर्निंग की शक्ति का प्रदर्शन किया।
रीइन्फोर्समेंट लर्निंग में अनुप्रयोग
TD लर्निंग कई रीइन्फोर्समेंट लर्निंग एल्गोरिदम का एक मुख्य घटक है। इसका उपयोग Q-लर्निंग में किया जाता है, जो एक मॉडल-मुक्त एल्गोरिथम है जो अवस्था-क्रिया युग्मों का मूल्य सीखता है, और SARSA (स्टेट-एक्शन-रिवॉर्ड-स्टेट-एक्शन) में, जो अनुसरण की जा रही नीति का मूल्य सीखता है। दोनों एल्गोरिदम अपने अनुमानों को परिष्कृत करने के लिए TD अद्यतन का उपयोग करते हैं। TD लर्निंग अभिनेता-आलोचक विधियों को भी रेखांकित करती है, जहाँ एक अभिनेता नीति सीखता है और एक आलोचक TD त्रुटियों का उपयोग करके मूल्य फलन सीखता है। इन विधियों को रोबोटिक्स, खेल खेलने और स्वायत्त प्रणालियों में सफलतापूर्वक लागू किया गया है।
आधुनिक गहन रीइन्फोर्समेंट लर्निंग में, TD लर्निंग को उच्च-आयामी अवस्था स्थानों को संभालने के लिए तंत्रिका नेटवर्क के साथ जोड़ा जाता है। उदाहरण के लिए, डीप Q-नेटवर्क (DQN) एल्गोरिथम, जिसे 2013 में डीपमाइंड द्वारा विकसित किया गया था, Q-फलन का अनुमान लगाने के लिए एक तंत्रिका नेटवर्क का उपयोग करता है और इसे TD लक्ष्यों का उपयोग करके अद्यतन करता है। इस दृष्टिकोण ने अटारी खेलों पर मानव-स्तरीय प्रदर्शन प्राप्त किया, जो कृत्रिम बुद्धिमत्ता में एक महत्वपूर्ण मील का पत्थर था। बाद के सुधार, जैसे डबल DQN और ड्यूएलिंग DQN, अति-अनुमान को कम करने और स्थिरता में सुधार करने के लिए TD अद्यतन को और परिष्कृत करते हैं।
अन्य सीखने के प्रतिमानों से संबंध
TD लर्निंग अन्य मशीन लर्निंग तकनीकों के साथ वैचारिक समानताएँ साझा करती है। बूटस्ट्रैपिंग का इसका उपयोग उस तरीके के अनुरूप है जिसमें तंत्रिका नेटवर्क परतों के माध्यम से त्रुटियों को पीछे की ओर प्रसारित करते हैं। TD त्रुटि को भविष्यवाणी त्रुटि के एक रूप के रूप में देखा जा सकता है, जो पर्यवेक्षित सीखने में उपयोग किए जाने वाले हानि फलनों के समान है। हालाँकि, TD लर्निंग इस मायने में अलग है कि यह स्पष्ट लेबल के बिना अवस्थाओं और पुरस्कारों के अनुक्रमों से सीखती है, जिससे यह पर्यवेक्षित सीखने के बजाय रीइन्फोर्समेंट लर्निंग का एक रूप बन जाती है।
टेम्पोरल डिफरेंस का विचार अन्य क्षेत्रों में भी दिखाई देता है। कृत्रिम बुद्धिमत्ता में, यह तंत्रिका विज्ञान में भविष्य कहनेवाला कोडिंग सिद्धांतों से संबंधित है, जहाँ मस्तिष्क को भविष्यवाणी त्रुटियों को कम करने के लिए माना जाता है। अर्थशास्त्र में, समान अवधारणाएँ सीखने और अपेक्षा निर्माण के मॉडल में दिखाई देती हैं। यह अंतर-विषयक प्रासंगिकता TD लर्निंग को कंप्यूटर विज्ञान से परे, मनोविज्ञान और संज्ञानात्मक विज्ञान सहित, अध्ययन का विषय बनाती है।
सीमाएँ और विस्तार
अपनी ताकत के बावजूद, TD लर्निंग की सीमाएँ हैं। यह सीखने की दर और छूट कारक की पसंद के प्रति संवेदनशील हो सकती है, और कुछ सेटिंग्स में फलन सन्निकटन के साथ संयुक्त होने पर यह विचलित हो सकती है। बूटस्ट्रैपिंग, फलन सन्निकटन और ऑफ-पॉलिसी सीखने की घातक त्रयी अस्थिरता का कारण बन सकती है। शोधकर्ताओं ने इन मुद्दों को संबोधित करने के लिए ग्रेडिएंट TD विधियों और जोरदार TD एल्गोरिदम जैसे विस्तार विकसित किए हैं, जो अधिक मजबूत अभिसरण गारंटी प्रदान करते हैं।
एक और सीमा यह है कि TD लर्निंग नमूना-अकुशल हो सकती है, जिसके लिए पर्यावरण के साथ कई अंतःक्रियाओं की आवश्यकता होती है। इसने मॉडल-आधारित विधियों के विकास को प्रेरित किया है जो पर्यावरण का एक मॉडल सीखते हैं और योजना के लिए इसका उपयोग करते हैं, जिसे अक्सर TD अद्यतन के साथ जोड़ा जाता है। डायना-Q जैसे एल्गोरिदम मॉडल-आधारित और मॉडल-मुक्त सीखने को एकीकृत करते हैं, मूल्य फलन और मॉडल दोनों को परिष्कृत करने के लिए TD अद्यतन का उपयोग करते हैं। ये संकर दृष्टिकोण मॉडल-आधारित विधियों की नमूना दक्षता को TD लर्निंग की सरलता के साथ संयोजित करने का लक्ष्य रखते हैं।
भविष्य की दिशाएँ
TD लर्निंग अनुसंधान का एक सक्रिय क्षेत्र बनी हुई है। हाल के कार्य बड़े पैमाने की सेटिंग्स में TD विधियों की स्थिरता और दक्षता में सुधार पर केंद्रित हैं, जैसे कि गहन सीखने और बड़े भाषा मॉडल से जुड़ी सेटिंग्स। शोधकर्ता TD लर्निंग को अन्य प्रतिमानों, जैसे मेटा-लर्निंग और बहु-एजेंट प्रणालियों के साथ संयोजित करने के तरीकों की खोज कर रहे हैं। TD लर्निंग के सिद्धांतों को नए डोमेन में भी लागू किया जा रहा है, जिसमें व्यक्तिगत अनुशंसाएँ, स्वास्थ्य सेवा और वित्तीय मॉडलिंग शामिल हैं, जहाँ अनुक्रमिक निर्णय लेना महत्वपूर्ण है।
जैसे-जैसे कृत्रिम बुद्धिमत्ता आगे बढ़ती है, एजेंटों को अनुभव से सीखने में सक्षम बनाने में TD लर्निंग की भूमिका केंद्रीय बनी रहती है। मॉडल की आवश्यकता के बिना ऑनलाइन और वृद्धिशील रूप से सीखने की इसकी क्षमता इसे अनुकूली प्रणालियों के निर्माण के लिए एक बहुमुखी उपकरण बनाती है। TD लर्निंग का आधुनिक कम्प्यूटेशनल तकनीकों के साथ चल रहा एकीकरण नई अंतर्दृष्टि और अनुप्रयोगों का वादा करता है, जो रीइन्फोर्समेंट लर्निंग में एक मौलिक अवधारणा के रूप में इसकी स्थिति को मजबूत करता है।
यह भी देखें
- मशीन लर्निंग
- कृत्रिम बुद्धिमत्ता
- तंत्रिका नेटवर्क
- गहन सीखना
- कार्नेगी मेलन विश्वविद्यालय
- बर्कले एआई अनुसंधान
- एमआईटी सीएसएआईएल
- स्टैनफोर्ड एआई प्रयोगशाला
- गूगल डीपमाइंड
- ओपनएआई
- एंथ्रोपिक
- ज़ेरॉक्स पीएआरसी
- टोरंटो विश्वविद्यालय
- ऑक्सफोर्ड विश्वविद्यालय
- अमेज़न वेब सेवाएँ
- एज़्योर
- गूगल क्लाउड
- ओरेकल क्लाउड
- एडब्ल्यूएस ट्रेनियम
संदर्भ
- सटन, आर. एस. (1988)। लर्निंग टू प्रेडिक्ट बाय द मेथड्स ऑफ टेम्पोरल डिफरेंसेस। मशीन लर्निंग, 3(1), 9-44।
- सटन, आर. एस., और बार्टो, ए. जी. (2018)। रीइन्फोर्समेंट लर्निंग: एन इंट्रोडक्शन। एमआईटी प्रेस।
- मनिह, वी., एट अल. (2015)। ह्यूमन-लेवल कंट्रोल थ्रू डीप रीइन्फोर्समेंट लर्निंग। नेचर, 518(7540), 529-533।