अंग्रेज़ी से अनुवादित

रिचर्ड सटन एक कनाडाई-अमेरिकी कंप्यूटर वैज्ञानिक हैं, जिन्हें आधुनिक सुदृढीकरण अधिगम का संस्थापक माना जाता है। वे अस्थायी अंतर अधिगम, निबंध [[the-bitter-lesson|द बिटर लेसन]], और 2024 के ट्यूरिंग पुरस्कार के लिए जाने जाते हैं।

रिचर्ड सटन एक कंप्यूटर वैज्ञानिक हैं जिन्हें व्यापक रूप से आधुनिक सुदृढीकरण-अधिगम के संस्थापकों में से एक माना जाता है, जो मशीन-अधिगम की वह शाखा है जो उन एजेंटों से संबंधित है जो पुरस्कार संकेतों से परीक्षण और त्रुटि के माध्यम से सीखते हैं।

करियर और योगदान

सटन ने 1984 में यूनिवर्सिटी ऑफ मैसाचुसेट्स एमहर्स्ट से कंप्यूटर विज्ञान में पीएचडी प्राप्त की, एंड्रयू बार्टो के साथ काम करते हुए, जिनके साथ उन्होंने टेम्पोरल डिफरेंस (TD) लर्निंग विकसित की, जो अंतिम परिणाम की प्रतीक्षा करने के बजाय क्रमिक भविष्यवाणियों के बीच अंतर के आधार पर मूल्य अनुमानों को अद्यतन करने की एक विधि है। TD लर्निंग सुदृढीकरण-अधिगम में केंद्रीय एल्गोरिथमिक विचारों में से एक बन गई, जिसे बाद में तंत्रिका-नेटवर्क फ़ंक्शन अनुमान के साथ जोड़ा गया, जो 1990 के दशक में जेराल्ड टेसाउरो के बैकगैमन-खेलने वाले TD-गैमन से लेकर अल्फागो और उसके उत्तराधिकारियों तक की प्रणालियों में शामिल था, जो दशकों बाद गूगल-डीपमाइंड में डेविड-सिल्वर सहित शोधकर्ताओं द्वारा विकसित किया गया, जिन्होंने सटन के अधीन अध्ययन किया। सटन और बार्टो की पाठ्यपुस्तक, रेनफोर्समेंट लर्निंग: एन इंट्रोडक्शन, जो पहली बार 1998 में प्रकाशित हुई, इस क्षेत्र में मानक संदर्भ बनी हुई है।

सटन ने अपने करियर का अधिकांश समय अल्बर्टा विश्वविद्यालय में प्रोफेसर और गूगल डीपमाइंड की अल्बर्टा प्रयोगशाला में विशिष्ट शोध वैज्ञानिक के रूप में बिताया, और वे अल्बर्टा मशीन इंटेलिजेंस इंस्टीट्यूट (Amii) के मुख्य वैज्ञानिक सलाहकार के रूप में कार्य करते हैं, जो उन केंद्रों में से एक है जिसने कनाडा को सुदृढीकरण-अधिगम अनुसंधान का केंद्र स्थापित करने में मदद की।

"द बिटर लेसन"

2019 में, सटन ने "द बिटर लेसन" शीर्षक से एक छोटा, व्यापक रूप से चर्चित निबंध प्रकाशित किया, जिसमें तर्क दिया गया कि एआई अनुसंधान के इतिहास में, सामान्य-उद्देश्यीय विधियाँ जो बढ़ती गणना का लाभ उठाती हैं, जैसे कि खोज और अधिगम, ने लगातार उन दृष्टिकोणों से बेहतर प्रदर्शन किया है जो मानव डोमेन ज्ञान को हाथ से एन्कोड करने पर निर्भर करते हैं, और शोधकर्ता बार-बार इस पाठ का विरोध करते हैं क्योंकि यह समझ को छोड़ने जैसा महसूस हो सकता है। यह निबंध स्केलिंग-नियमों और बड़े-भाषा-मॉडल प्रणालियों के डिज़ाइन पर बहसों में एक आधारशिला बन गया है, जिसे अक्सर हाथ से बनाई गई अनुमानी विधियों पर पैमाने और सामान्य एल्गोरिदम को प्राथमिकता देने को उचित ठहराने के लिए उद्धृत किया जाता है, और इसे अक्सर परीक्षण-समय-गणना और तर्क-मॉडल प्रणालियों पर हाल के कार्यों के साथ पढ़ा जाता है जो सत्यापन योग्य कार्यों पर सुदृढीकरण-अधिगम-शैली प्रशिक्षण का उपयोग करते हैं।

सटन ने 2024 का ट्यूरिंग पुरस्कार एंड्रयू बार्टो के साथ "सुदृढीकरण-अधिगम की वैचारिक और एल्गोरिथमिक नींव विकसित करने के लिए" साझा किया, यह मान्यता ऐसे समय में मिली जब सुदृढीकरण-अधिगम तकनीकें, जिनमें आरएलएचएफ शामिल है, न केवल खेल-खेलने वाली प्रणालियों के लिए बल्कि आधुनिक संवादी एआई के व्यवहार को संरेखित करने के लिए भी केंद्रीय बन गई थीं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reinforcement-learning·history-of-ai·academia
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास