अल्फागो बनाम ली सेडोल मैच, जिसे डीपमाइंड चैलेंज मैच के रूप में भी जाना जाता है, ली सेडोल, एक शीर्ष पेशेवर गो खिलाड़ी, और अल्फागो, गूगल डीपमाइंड द्वारा विकसित एक कंप्यूटर प्रोग्राम, के बीच एक पांच-गेम गो प्रतियोगिता थी। 9 मार्च से 15 मार्च 2016 तक दक्षिण कोरिया के सियोल में आयोजित, अल्फागो ने पांच में से चार गेम जीते, सभी गेम समर्पण द्वारा समाप्त हुए। इस घटना को व्यापक रूप से कृत्रिम बुद्धिमत्ता में एक मील का पत्थर माना जाता है, जिसकी तुलना अक्सर 1997 के शतरंज मैच से की जाती है जिसमें आईबीएम के डीप ब्लू ने विश्व चैंपियन गैरी कास्परोव को हराया था।
मैच ने वैश्विक ध्यान आकर्षित किया क्योंकि गो को लंबे समय से कंप्यूटर के लिए एक कठिन चुनौती माना जाता था। खेल का विशाल शाखा कारक और अंतर्ज्ञान और पैटर्न पहचान पर निर्भरता ने इसे शतरंज की तुलना में महारत हासिल करना काफी कठिन बना दिया। अल्फागो से पहले, सर्वश्रेष्ठ गो प्रोग्राम पूर्ण 19x19 बोर्ड पर केवल शौकिया डैन स्तर तक पहुंच सकते थे, और कई शोधकर्ताओं का मानना था कि कंप्यूटर को एक शीर्ष मानव खिलाड़ी को हराने में एक और दशक लगेगा। अल्फागो की जीत ने प्रदर्शित किया कि मशीन-लर्निंग और तंत्रिका-नेटवर्क तकनीकें जटिल रणनीतिक क्षेत्रों में पारंपरिक हार्ड-कोडेड दृष्टिकोणों से आगे निकल सकती हैं।
पृष्ठभूमि
गो एक बोर्ड गेम है जिसके लिए रणनीतिक सोच, रचनात्मकता और स्थिति की सहज समझ की आवश्यकता होती है। इसकी जटिलता संभावित बोर्ड विन्यासों की विशाल संख्या से उत्पन्न होती है, जो ब्रूट-फोर्स खोज को अव्यवहारिक बनाती है। गणितज्ञ आई. जे. गुड ने 1965 में लिखा था कि गो को अच्छी तरह से खेलने के लिए कंप्यूटर प्रोग्राम करना शतरंज से भी अधिक कठिन होगा, क्योंकि अच्छी रणनीति के सिद्धांत अधिक गुणात्मक और रहस्यमय हैं। 2015 से पहले, सबसे मजबूत गो प्रोग्राम केवल शौकिया डैन स्तर तक पहुंचे थे, हालांकि कुछ ने छोटे 9x9 बोर्ड पर बेहतर प्रदर्शन किया। जोनाथन शेफ़र जैसे शोधकर्ताओं ने निकट भविष्य की प्रगति के बारे में संदेह व्यक्त किया था, और डीपमाइंड के शुरुआती निवेशक एलन मस्क ने 2016 में नोट किया था कि विशेषज्ञों का मानना था कि एआई एक शीर्ष पेशेवर को हराने से लगभग दस साल दूर था।
अल्फागो पहले के प्रयासों से भिन्न था क्योंकि इसने गहन-शिक्षण और सुदृढीकरण-शिक्षण तकनीकों का उपयोग किया। इसके तंत्रिका नेटवर्क को शुरू में केजीएस गो सर्वर पर मजबूत शौकिया खिलाड़ियों द्वारा खेले गए 160,000 खेलों से लगभग 30 मिलियन चालों के डेटाबेस पर प्रशिक्षित किया गया था। एक निश्चित दक्षता तक पहुंचने के बाद, अल्फागो ने अपनी रणनीति को परिष्कृत करने के लिए सुदृढीकरण सीखने का उपयोग करते हुए, खुद के खिलाफ लाखों गेम खेलकर सुधार किया। सिस्टम ने संभावित चालों का मूल्यांकन करने के लिए मोंटे कार्लो ट्री सर्च का भी उपयोग किया। पारंपरिक शतरंज कार्यक्रमों के विपरीत, अल्फागो पूर्व-प्रोग्राम किए गए चाल डेटाबेस पर निर्भर नहीं था; इसके निर्णय प्रशिक्षण प्रक्रिया से उभरे, जिसे इसके निर्माताओं ने उनके लिए भी अप्रत्याशित बताया।
फैन हुई के खिलाफ पिछली जीत
अक्टूबर 2015 में, अल्फागो ने यूरोपीय चैंपियन फैन हुई, एक 2 डैन पेशेवर, को 5-0 के स्कोर से हराया। यह पहली बार था जब कृत्रिम बुद्धिमत्ता ने बिना किसी बाधा के पूर्ण आकार के बोर्ड पर एक पेशेवर मानव खिलाड़ी को हराया था। हालांकि, टिप्पणीकारों ने नोट किया कि फैन ली सेडोल, एक 9 डैन पेशेवर, से काफी नीचे रैंक पर था। ज़ेन और क्रेज़ी स्टोन जैसे पिछले कंप्यूटर प्रोग्रामों ने केवल बड़े बाधाओं के साथ शीर्ष पेशेवरों को हराया था। फैन हुई मैच के बाद टिप्पणी करते हुए, शेफ़र ने अल्फागो की तुलना अनुभव की कमी वाले एक बाल प्रतिभा से की और भविष्यवाणी की कि ली मार्च मैच जीतेंगे। फैन हुई ने बाद में कहा कि अनुभव ने उन्हें खेल को अलग तरह से देखना सिखाया, और मार्च 2016 तक उनकी विश्व रैंकिंग लगभग 633 से सुधरकर लगभग 300 हो गई।
तैयारी
गो विशेषज्ञों ने फैन के खिलाफ अल्फागो के खेल में कमजोरियों की पहचान की थी, विशेष रूप से पूरे बोर्ड के बारे में इसकी जागरूकता के संबंध में। यह स्पष्ट नहीं था कि ली मैच से पहले के महीनों में कार्यक्रम में कितना सुधार हुआ था। अल्फागो का प्रशिक्षण इंटरनेट गो सर्वरों से खेलों के साथ शुरू हुआ और फिर इसमें स्व-खेल के करोड़ों गेम शामिल थे। अंतर्राष्ट्रीय गो महासंघ के महासचिव और पेशेवर खिलाड़ी हाजिन ली ने मैच के बारे में उत्साह व्यक्त किया और सोचा कि दोनों खिलाड़ियों के पास जीतने के समान अवसर थे।
खिलाड़ी
अल्फागो
अल्फागो को गूगल-डीपमाइंड द्वारा विकसित किया गया था, जो 2014 में गूगल द्वारा अधिग्रहित एक लंदन स्थित एआई अनुसंधान कंपनी है। कार्यक्रम ने मशीन-लर्निंग को ट्री सर्च तकनीकों के साथ जोड़ा। इसके तंत्रिका नेटवर्क को पहले ऐतिहासिक गेम रिकॉर्ड का उपयोग करके मानव खेल की नकल करने के लिए प्रशिक्षित किया गया था, फिर खुद के खिलाफ खेलकर सुदृढीकरण सीखने के माध्यम से परिष्कृत किया गया। सिस्टम ने चाल डेटाबेस का उपयोग नहीं किया; इसके बजाय, इसकी चालें प्रशिक्षण एल्गोरिदम की एक उभरती हुई संपत्ति थीं। ली के खिलाफ मैच में, अल्फागो ने फैन हुई मैच के समान लगभग समान कंप्यूटिंग शक्ति का उपयोग किया, रिपोर्टों में 1,202 सीपीयू और 176 जीपीयू, या 1,920 सीपीयू और 280 जीपीयू तक का उल्लेख किया गया। गूगल ने यह भी कहा कि मैच के दौरान इसके मालिकाना टेंसर प्रोसेसिंग यूनिट का उपयोग किया गया था।
ली सेडोल
ली सेडोल 9 डैन रैंक के पेशेवर गो खिलाड़ी थे, जिन्हें व्यापक रूप से खेल के इतिहास में सबसे मजबूत खिलाड़ियों में से एक माना जाता था। उन्होंने 1996 में अपना करियर शुरू किया, 12 साल की उम्र में पेशेवर डैन रैंक पर पदोन्नत हुए, और मैच के समय तक 18 अंतर्राष्ट्रीय खिताब जीते थे। ली अपनी आक्रामक और रचनात्मक शैली के लिए जाने जाते थे, और उनकी भागीदारी ने मैच को महत्वपूर्ण प्रतिष्ठा दी।
मैच सारांश
मैच पांच गेमों में हुआ, जिसमें 9 मार्च से 15 मार्च 2016 तक प्रत्येक दिन एक गेम खेला गया। अल्फागो ने गेम एक, दो, तीन और पांच जीते, जबकि ली ने गेम चार जीता। सभी गेम हारने वाले खिलाड़ी के समर्पण के साथ समाप्त हुए। पहले तीन गेम अल्फागो के लिए निर्णायक जीत थे, जिससे कई पर्यवेक्षकों ने निष्कर्ष निकाला कि कार्यक्रम ने मानव क्षमता से परे खेल का स्तर हासिल कर लिया था। गेम चार में ली की जीत को मानवीय विजय के रूप में मनाया गया और प्रदर्शित किया कि अल्फागो अजेय नहीं था। गेम पांच कड़ी टक्कर था, लेकिन अल्फागो अंततः विजयी रहा।
पुरस्कार और परिणाम
विजेता को $1 मिलियन प्राप्त करने की योजना थी। चूंकि अल्फागो जीता, गूगल डीपमाइंड ने घोषणा की कि पुरस्कार यूनिसेफ और गो संगठनों सहित दान में दिया जाएगा। ली को $170,000 प्राप्त हुए, जिसमें सभी पांच गेमों में भाग लेने के लिए $150,000 और एक गेम जीतने के लिए अतिरिक्त $20,000 शामिल थे। मैच के बाद, कोरिया बादुक एसोसिएशन ने गो में उच्चतम ग्रैंडमास्टर स्तर, खेल में महारत हासिल करने के अपने "ईमानदार प्रयासों" की मान्यता में अल्फागो को मानद 9 डैन रैंक प्रदान किया। मैच को 22 दिसंबर 2016 को साइंस पत्रिका द्वारा वर्ष की सफलता के लिए उपविजेता नामित किया गया था।
जीत के कृत्रिम-बुद्धिमत्ता अनुसंधान के लिए व्यापक निहितार्थ थे। इसने प्रदर्शित किया कि तंत्रिका नेटवर्क और सुदृढीकरण सीखना उन समस्याओं से निपट सकते हैं जिन्हें पहले मानव अंतर्ज्ञान की आवश्यकता माना जाता था। अल्फागो में उपयोग की जाने वाली तकनीकों को तब से प्रोटीन फोल्डिंग और वैज्ञानिक खोज सहित अन्य क्षेत्रों में लागू किया गया है। मैच ने एआई नैतिकता और मानव और मशीन बुद्धिमत्ता के बीच संबंधों में भी रुचि बढ़ाई। संबंधित शोध ने संज्ञानात्मक विज्ञान, पैटर्न पहचान और मशीन-लर्निंग जैसे क्षेत्रों को अधिक व्यापक रूप से प्रभावित किया है।
विरासत
अल्फागो बनाम ली सेडोल मैच को अक्सर एआई की सार्वजनिक धारणा में एक महत्वपूर्ण मोड़ के रूप में उद्धृत किया जाता है। इसने दिखाया कि मशीनें रणनीतिक निर्णय की आवश्यकता वाले कार्यों में उत्कृष्ट हो सकती हैं, न कि केवल कम्प्यूटेशनल गति में। इस घटना ने गहन-शिक्षण और तंत्रिका-नेटवर्क वास्तुकला की क्षमता को भी उजागर किया, जो बाद में जनरेटिव-एआई और बड़े-भाषा-मॉडल प्रणालियों में विकास के लिए आधार बन गई। मैच कृत्रिम बुद्धिमत्ता की क्षमताओं और सीमाओं के बारे में चर्चाओं में एक संदर्भ बिंदु बना हुआ है।