अंग्रेज़ी से अनुवादित

मार्च 2016 में सियोल में आयोजित एक पांच-खेलों की गो मैच, जिसमें DeepMind के AlphaGo ने पेशेवर खिलाड़ी Lee Sedol को चार खेलों में एक के मुकाबले हराया, जो गहन सुदृढीकरण सीखने (deep reinforcement learning) का एक ऐतिहासिक प्रदर्शन था।

अल्फागो और ली से돌 के बीच मैच एक पांच-गेम गो श्रृंखला थी जो 9 मार्च से 15 मार्च, 2016 तक सियोल, दक्षिण कोरिया में आयोजित की गई थी। इसमें डीपमाइंड के अल्फागो प्रोग्राम का मुकाबला ली सेडोल से हुआ, जो 18 बार के विश्व चैंपियन और अपने युग के सबसे मजबूत गो खिलाड़ियों में से एक थे। अल्फागो ने चार गेम जीतकर एक में हार मानी, यह परिणाम गो समुदाय के लिए काफी आश्चर्यजनक था, जो आम तौर पर उम्मीद करता था कि मानव खिलाड़ी कई वर्षों तक खेल में अपनी बढ़त बनाए रखेंगे।

पृष्ठभूमि

गो को लंबे समय से शतरंज की तुलना में कंप्यूटर के लिए एक कठिन समस्या माना जाता था, जिसे डीप ब्लू ने 1997 में पहले ही हल कर लिया था, इसकी विशाल शाखा कारक और पैटर्न पहचान और अंतर्ज्ञान पर निर्भरता के कारण, जो ब्रूट-फोर्स खोज का प्रतिरोध करते थे। अल्फागो ने मानव खेलों के एक बड़े कोष पर पर्यवेक्षित अधिगम के माध्यम से प्रशिक्षित गहरे तंत्रिका नेटवर्क को एक नीति और मूल्य नेटवर्क के साथ जोड़ा, जिसे सुदृढ़ीकरण अधिगम के माध्यम से स्व-खेल द्वारा परिष्कृत किया गया था, साथ ही चालों का चयन करने के लिए मोंटे कार्लो ट्री खोज का उपयोग किया गया था। परियोजना का नेतृत्व डीपमाइंड में डेविड सिल्वर ने किया था, जिसके संस्थापक डेमिस हसाबिस की सामान्य बुद्धि के लिए परीक्षण स्थल के रूप में खेलों में लंबे समय से रुचि थी।

मैच

अल्फागो ने पहले तीन गेम जीते, अंतिम दो खेले जाने से पहले ही मैच अपने नाम कर लिया। गेम दो में एक व्यापक रूप से चर्चित क्षण आया, चाल 37, एक अपरंपरागत कंधे का प्रहार जिसे टिप्पणीकारों ने शुरू में गलती माना था, लेकिन बाद के विश्लेषण ने इसे अत्यधिक रचनात्मक ठहराया, ऐसी चाल जो एक मानव पेशेवर के खेलने की संभावना नहीं थी। ली सेडोल ने गेम चार में चाल 78 से शुरू होने वाले अनुक्रम के साथ जीत हासिल की, जिसे कभी-कभी "भगवान का हाथ" चाल कहा जाता है, जिसने एक असामान्य स्थिति के अल्फागो के मूल्यांकन में कमजोरी का संक्षेप में फायदा उठाया। अल्फागो ने गेम पांच जीतकर मैच 4-1 से समाप्त किया।

परिणाम और महत्व

यह परिणाम विशेषज्ञ गो और एआई हलकों के बाहर व्यापक रूप से कवर किया गया और इसे अक्सर गहन अधिगम अनुसंधान में एक मील का पत्थर के रूप में उद्धृत किया जाता है, जो शतरंज में कास्परोव पर डीप ब्लू की 1997 की जीत के सांस्कृतिक महत्व के बराबर है। ली सेडोल ने हार को व्यक्तिगत रूप से कठिन बताया, बाद में कहा कि शीर्ष मानव खिलाड़ी बनने का मतलब अब अजेय होना नहीं होगा। उन्होंने 2019 में पेशेवर खेल से संन्यास ले लिया, एआई के उदय को एक कारक बताते हुए टिप्पणी की कि अब "एक ऐसी इकाई है जिसे हराया नहीं जा सकता।"

डीपमाइंड ने मैच के बाद ऐसे उत्तराधिकारियों के साथ काम किया जिन्होंने दृष्टिकोण को सामान्यीकृत किया: एक संस्करण जो मानव खेल डेटा के बिना पूरी तरह से स्व-खेल के माध्यम से प्रशिक्षित किया गया था, और अल्फाजीरो, जिसने विधि को शतरंज और शोगी तक शुरू से विस्तारित किया। मैच को अक्सर कृत्रिम सामान्य बुद्धि की चर्चाओं में संदर्भित किया जाता है और यह कि एक बार वास्तुकला, कंप्यूट और प्रशिक्षण विधि का सही संयोजन मिल जाने पर संकीर्ण अति-मानवीय प्रदर्शन कितनी जल्दी आ सकता है, एक विषय जो बाद में बड़े मॉडलों में स्केलिंग-कानूनों और उभरती-क्षमताओं पर बहस में दोहराया गया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:history-of-ai·reinforcement-learning·games-and-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास