रिचर्ड सटन एक कंप्यूटर वैज्ञानिक हैं जिन्हें व्यापक रूप से आधुनिक सुदृढीकरण-अधिगम के संस्थापकों में से एक माना जाता है, जो मशीन-अधिगम की वह शाखा है जो उन एजेंटों से संबंधित है जो पुरस्कार संकेतों से परीक्षण और त्रुटि के माध्यम से सीखते हैं।
करियर और योगदान
सटन ने 1984 में यूनिवर्सिटी ऑफ मैसाचुसेट्स एमहर्स्ट से कंप्यूटर विज्ञान में पीएचडी प्राप्त की, एंड्रयू बार्टो के साथ काम करते हुए, जिनके साथ उन्होंने टेम्पोरल डिफरेंस (TD) लर्निंग विकसित की, जो अंतिम परिणाम की प्रतीक्षा करने के बजाय क्रमिक भविष्यवाणियों के बीच अंतर के आधार पर मूल्य अनुमानों को अद्यतन करने की एक विधि है। TD लर्निंग सुदृढीकरण-अधिगम में केंद्रीय एल्गोरिथमिक विचारों में से एक बन गई, जिसे बाद में तंत्रिका-नेटवर्क फ़ंक्शन अनुमान के साथ जोड़ा गया, जो 1990 के दशक में जेराल्ड टेसाउरो के बैकगैमन-खेलने वाले TD-गैमन से लेकर अल्फागो और उसके उत्तराधिकारियों तक की प्रणालियों में शामिल था, जो दशकों बाद गूगल-डीपमाइंड में डेविड-सिल्वर सहित शोधकर्ताओं द्वारा विकसित किया गया, जिन्होंने सटन के अधीन अध्ययन किया। सटन और बार्टो की पाठ्यपुस्तक, रेनफोर्समेंट लर्निंग: एन इंट्रोडक्शन, जो पहली बार 1998 में प्रकाशित हुई, इस क्षेत्र में मानक संदर्भ बनी हुई है।
सटन ने अपने करियर का अधिकांश समय अल्बर्टा विश्वविद्यालय में प्रोफेसर और गूगल डीपमाइंड की अल्बर्टा प्रयोगशाला में विशिष्ट शोध वैज्ञानिक के रूप में बिताया, और वे अल्बर्टा मशीन इंटेलिजेंस इंस्टीट्यूट (Amii) के मुख्य वैज्ञानिक सलाहकार के रूप में कार्य करते हैं, जो उन केंद्रों में से एक है जिसने कनाडा को सुदृढीकरण-अधिगम अनुसंधान का केंद्र स्थापित करने में मदद की।
"द बिटर लेसन"
2019 में, सटन ने "द बिटर लेसन" शीर्षक से एक छोटा, व्यापक रूप से चर्चित निबंध प्रकाशित किया, जिसमें तर्क दिया गया कि एआई अनुसंधान के इतिहास में, सामान्य-उद्देश्यीय विधियाँ जो बढ़ती गणना का लाभ उठाती हैं, जैसे कि खोज और अधिगम, ने लगातार उन दृष्टिकोणों से बेहतर प्रदर्शन किया है जो मानव डोमेन ज्ञान को हाथ से एन्कोड करने पर निर्भर करते हैं, और शोधकर्ता बार-बार इस पाठ का विरोध करते हैं क्योंकि यह समझ को छोड़ने जैसा महसूस हो सकता है। यह निबंध स्केलिंग-नियमों और बड़े-भाषा-मॉडल प्रणालियों के डिज़ाइन पर बहसों में एक आधारशिला बन गया है, जिसे अक्सर हाथ से बनाई गई अनुमानी विधियों पर पैमाने और सामान्य एल्गोरिदम को प्राथमिकता देने को उचित ठहराने के लिए उद्धृत किया जाता है, और इसे अक्सर परीक्षण-समय-गणना और तर्क-मॉडल प्रणालियों पर हाल के कार्यों के साथ पढ़ा जाता है जो सत्यापन योग्य कार्यों पर सुदृढीकरण-अधिगम-शैली प्रशिक्षण का उपयोग करते हैं।
सटन ने 2024 का ट्यूरिंग पुरस्कार एंड्रयू बार्टो के साथ "सुदृढीकरण-अधिगम की वैचारिक और एल्गोरिथमिक नींव विकसित करने के लिए" साझा किया, यह मान्यता ऐसे समय में मिली जब सुदृढीकरण-अधिगम तकनीकें, जिनमें आरएलएचएफ शामिल है, न केवल खेल-खेलने वाली प्रणालियों के लिए बल्कि आधुनिक संवादी एआई के व्यवहार को संरेखित करने के लिए भी केंद्रीय बन गई थीं।