AlphaGo एक कंप्यूटर प्रोग्राम है जिसे DeepMind द्वारा बोर्ड गेम Go खेलने के लिए विकसित किया गया था, एक ऐसा खेल जिसे लंबे समय से कृत्रिम बुद्धिमत्ता के लिए एक प्रमुख अनसुलझी चुनौती माना जाता था, क्योंकि इसका विशाल खोज स्थान, शतरंज से कहीं अधिक बड़ा, ने Deep Blue में उपयोग किए गए ब्रूट-फोर्स दृष्टिकोणों को कम्प्यूटेशनल रूप से अव्यवहारिक बना दिया था। AlphaGo ने गहरे तंत्रिका नेटवर्क को मोंटे कार्लो ट्री सर्च के साथ जोड़ा, जिसमें मानव विशेषज्ञ खेलों और स्व-खेल सुदृढीकरण सीखने दोनों पर प्रशिक्षित नेटवर्क का उपयोग करके बोर्ड स्थितियों का मूल्यांकन किया और चालों का चयन किया।
ली सेडोल मैच
AlphaGo अंतरराष्ट्रीय स्तर पर 2016 के अपने मैच के माध्यम से प्रसिद्ध हुआ, जो दुनिया के सबसे मजबूत पेशेवर Go खिलाड़ियों में से एक ली सेडोल के खिलाफ था, जो 9 मार्च से 15 मार्च, 2016 तक सियोल, दक्षिण कोरिया में आयोजित किया गया था। AlphaGo ने पांच-खेलों की श्रृंखला 4 खेलों से 1 में जीती, एक परिणाम जिसने Go और AI समुदायों के अधिकांश लोगों को आश्चर्यचकित कर दिया, जिन्होंने आम तौर पर उम्मीद की थी कि खेल की जटिलता को देखते हुए मानवीय निपुणता कम से कम एक और दशक तक मशीनों के खिलाफ बनी रहेगी। यह मैच वैश्विक स्तर पर प्रसारित किया गया और अनुमानित 200 मिलियन लोगों द्वारा देखा गया, जिससे यह उस समय तक AI क्षमता का सबसे दृश्यमान सार्वजनिक प्रदर्शन बन गया, और तर्कसंगत रूप से वह क्षण जब गहरी सीख ChatGPT के लॉन्च के सात साल बाद जिस तरह से मुख्यधारा की सार्वजनिक जागरूकता में प्रवेश करेगी, उसी तरह से उसमें प्रवेश कर गई।
चाल 37
मैच के दूसरे खेल ने एक क्षण उत्पन्न किया जो AlphaGo की नवीनता का प्रतीक बन गया: चाल 37 पर, AlphaGo ने बोर्ड की पांचवीं पंक्ति पर एक चाल खेली जिसे पेशेवर कमेंटेटर और ली सेडोल स्वयं शुरू में अत्यधिक असामान्य, यहां तक कि संभावित गलती मानते थे, क्योंकि यह सदियों से संचित मानव Go रणनीति का खंडन करती थी। यह चाल बाद में उस खेल में AlphaGo की जीत के लिए निर्णायक साबित हुई, और इसे व्यापक रूप से इस बात के प्रमाण के रूप में उद्धृत किया गया कि सिस्टम ने वास्तव में नवीन रणनीतिक अंतर्दृष्टि प्राप्त की थी, न कि केवल मानव खेल की नकल या उसके बीच अंतर्वेशन किया था, एक दावा जिसे बाद में सिस्टम के आंतरिक चाल-संभावना अनुमानों के विश्लेषण ने व्यापक रूप से समर्थन दिया। चाल 37 AI अनुसंधान और लोकप्रिय लेखन दोनों में एक मशीन सीखने प्रणाली द्वारा रचनात्मक, गैर-मानवीय समस्या-समाधान उत्पन्न करने का एक अक्सर संदर्भित उदाहरण बन गई।
AlphaZero का पूर्ववर्ती
AlphaGo का प्रशिक्षण शुरू में अपने नीति नेटवर्क को बूटस्ट्रैप करने के लिए रिकॉर्ड किए गए मानव विशेषज्ञ खेलों के एक बड़े डेटासेट पर निर्भर था, इससे पहले कि स्व-खेल सुदृढीकरण सीखने ने इसे और परिष्कृत किया। DeepMind ने बाद में AlphaGo Zero विकसित किया, जिसकी घोषणा 2017 में की गई, जिसने बिना किसी मानव खेल डेटा का उपयोग किए, यादृच्छिक आरंभीकरण से पूरी तरह से स्व-खेल के माध्यम से Go सीखा, और जिसने मूल AlphaGo की खेल शक्ति को पार कर लिया। अनुसंधान की यह श्रृंखला सीधे AlphaZero की ओर ले गई, जो उसी स्व-खेल दृष्टिकोण का शतरंज और शोगी के साथ-साथ Go तक एक सामान्यीकरण था, जिसे बाद में 2017 में जारी किया गया।
स्वागत और विरासत
ली सेडोल पर AlphaGo की जीत को व्यापक रूप से AI के इतिहास में एक ऐतिहासिक घटना माना जाता है, जो सांस्कृतिक महत्व में शतरंज में गैरी कास्परोव की 1997 की Deep Blue हार के तुलनीय है, लेकिन यह AlphaGo की व्यापक खोज के बजाय सीखी गई पैटर्न पहचान पर निर्भरता से प्रतिष्ठित है, जो AI अनुसंधान में प्रतीकात्मक और ब्रूट-फोर्स तरीकों से गहरी-सीखने-आधारित दृष्टिकोणों की ओर बदलाव को दर्शाता है। ली सेडोल ने 2019 में पेशेवर Go प्रतियोगिता से संन्यास ले लिया, आंशिक रूप से इस भावना का हवाला देते हुए कि AI खेल में अजेय हो गया था, और टिप्पणी की कि शीर्ष खिलाड़ी होते हुए भी वह "एक ऐसी इकाई को हरा नहीं सकता जिसे हराया नहीं जा सकता।" DeepMind का AlphaGo अनुसंधान कार्यक्रम अक्सर AlphaFold के साथ DeepMind की व्यापक रणनीति के प्रमाण के रूप में उद्धृत किया जाता है, जो सुदृढीकरण सीखने और गहरी सीखने को अच्छी तरह से परिभाषित, पहले से अनसुलझी समस्याओं पर लागू करने की है।