डेविड सिल्वर एक ब्रिटिश कंप्यूटर वैज्ञानिक और गूगल डीपमाइंड में मुख्य शोधकर्ता हैं, जिन्हें मुख्य रूप से सुदृढीकरण-अधिगम कार्यक्रमों का निर्देशन करने के लिए जाना जाता है, जिन्होंने अल्फागो, अल्फाजीरो और म्यूज़ीरो का निर्माण किया। उन्होंने कैम्ब्रिज विश्वविद्यालय से पीएचडी की उपाधि प्राप्त की और बाद में रिचर्ड सटन के साथ अल्बर्टा विश्वविद्यालय में अस्थायी-अंतर अधिगम विधियों पर काम किया, इससे पहले कि वे यूनिवर्सिटी कॉलेज लंदन में व्याख्याता के रूप में और फिर 2013 में डीपमाइंड की संस्थापक शोध टीम में शामिल हुए। उस शैक्षणिक मार्ग से पहले, सिल्वर ने एलिक्सिर स्टूडियोज़ में एक गेम एआई प्रोग्रामर के रूप में काम किया, जो डेमिस हसाबिस द्वारा सह-स्थापित एक लंदन गेम कंपनी थी, और यह एक प्रारंभिक सहयोग था जिसे दोनों ने बाद में तब नवीनीकृत किया जब दोनों डीपमाइंड में शामिल हुए।
अल्फागो और स्व-खेल सुदृढीकरण अधिगम
सिल्वर ने लगभग 2014 से अल्फागो परियोजना का नेतृत्व किया, जिसमें गहरे तंत्रिका नेटवर्क को सुदृढीकरण-अधिगम और स्व-खेल के माध्यम से प्रशिक्षित मोंटे कार्लो ट्री खोज के साथ जोड़ा गया। इस प्रणाली ने अक्टूबर 2015 में यूरोपीय चैंपियन फैन हुई को हराया और फिर मार्च 2016 में सियोल में आयोजित अल्फागो बनाम ली सेडोल मैच में विश्व चैंपियन ली सेडोल को 4-1 से हराया, एक परिणाम जो अधिकांश विशेषज्ञों द्वारा गो के खेल के लिए भविष्यवाणी से वर्षों पहले आया था। सिल्वर और डीपमाइंड के सहयोगियों ने, डेमिस हसाबिस के अधीन, 2016 में नेचर में अल्फागो की पद्धति प्रकाशित की, और सिल्वर को पेपर का मुख्य लेखक नामित किया गया।
उन्होंने 2017 में अल्फाजीरो का नेतृत्व किया, जिसने शतरंज, शोगी और गो को पूरी तरह से स्व-खेल के माध्यम से सीखने के लिए दृष्टिकोण को सामान्यीकृत किया, बिना मानव खेल रिकॉर्ड या हस्तनिर्मित विशेषताओं के, और प्रत्येक खेल में मौजूदा सबसे मजबूत कार्यक्रमों से मेल खाते या उनसे आगे निकलते हुए केवल घंटों के प्रशिक्षण के बाद। एक उत्तराधिकारी प्रणाली, म्यूज़ीरो, 2019 में आई, जिसने विधि को उन सेटिंग्स तक विस्तारित किया जहां पर्यावरण के नियम पहले से नहीं दिए गए हैं, एजेंट को खेल या कार्य का अपना आंतरिक भविष्यवाणी मॉडल सीखने की अनुमति देकर।
पुरस्कार पर्याप्त है
काम का यह निकाय एक व्यापक शोध सिद्धांत को पोषित करता है जिसे सिल्वर ने सामान्य बुद्धिमत्ता के बारे में आगे बढ़ाया है। 2021 के एक पेपर "रिवार्ड इज़ इनफ" शीर्षक से, जो सतींदर सिंह, डोइना प्रीकप और रिचर्ड सटन के साथ सह-लेखक था, उन्होंने तर्क दिया कि एजेंट जो पूरी तरह से पर्याप्त समृद्ध पुरस्कार संकेत को अधिकतम करने के लिए प्रशिक्षित होते हैं, पर्याप्त जटिल वातावरण में, सिद्धांत रूप में बुद्धिमान व्यवहार के कई लक्षण विकसित कर सकते हैं, जिसमें योजना, अन्वेषण, स्मृति और सामान्यीकरण शामिल हैं, बिना उन क्षमताओं को अलग से इंजीनियर किए। पेपर ने सुदृढीकरण-अधिगम को अधिक सक्षम प्रणालियों तक पहुंचने के लिए एक उम्मीदवार सामान्य ढांचे के रूप में स्थापित किया, एक दावा जो बड़े भाषा मॉडल द्वारा लिए गए स्केलिंग-आधारित दृष्टिकोण के साथ बहस का विषय बना हुआ है।
मान्यता
अल्फागो कार्य के लिए, सिल्वर ने 2019 का एसीएम पुरस्कार कंप्यूटिंग में साझा किया। वे गूगल डीपमाइंड में अपनी शोध भूमिका के साथ-साथ यूनिवर्सिटी कॉलेज लंदन में प्रोफेसरशिप जारी रखते हैं, और स्व-खेल और मॉडल-आधारित सुदृढीकरण-अधिगम पर उनके पेपर क्षेत्र में सबसे अधिक उद्धृत किए जाने वालों में बने हुए हैं।