अंग्रेज़ी से अनुवादित

OpenAI Five, OpenAI द्वारा विकसित एक AI प्रणाली थी, जिसने 2019 में वीडियो गेम Dota 2 में विश्व चैंपियनों को हराया, जटिल, वास्तविक-समय वातावरणों में उन्नत सुदृढ़ीकरण सीखने (reinforcement learning) का प्रदर्शन किया।

OpenAI Five एक कंप्यूटर प्रोग्राम है जिसे OpenAI द्वारा विकसित किया गया है और यह पांच-बनाम-पांच वीडियो गेम Dota 2 खेलता है। यह पहली कृत्रिम बुद्धिमत्ता प्रणाली थी जिसने अप्रैल 2019 में एक पेशेवर ईस्पोर्ट्स मैच में वर्तमान विश्व चैंपियनों को हराया। इस परियोजना का उद्देश्य मशीन लर्निंग को आगे बढ़ाना था, एक ऐसे खेल से निपटकर जिसमें निरंतर क्रिया स्थान, आंशिक अवलोकन क्षमता और दीर्घकालिक रणनीति शामिल है, जिससे अधिक सामान्य समस्या-समाधान प्रणालियाँ विकसित की जा सकें।

प्रणाली का विकास नवंबर 2016 में शुरू हुआ, और इसकी पहली सार्वजनिक उपस्थिति The International 2017 में हुई, जहाँ इसने पेशेवर खिलाड़ी Dendi को एक-बनाम-एक मैच में हराया। 2018 तक, यह पाँच खिलाड़ियों की पूरी टीम के रूप में खेल सकता था, और 2019 में इसने The International 2018 के चैंपियन OG के खिलाफ बेस्ट-ऑफ-थ्री श्रृंखला जीती। OpenAI Five के एल्गोरिदम को बाद में अन्य परियोजनाओं के लिए अनुकूलित किया गया, जिसमें एक रोबोटिक हाथ भी शामिल है। इसकी तुलना अक्सर AlphaGo, Deep Blue और AlphaStar जैसी अन्य गेम-खेलने वाली AI प्रणालियों से की जाती है।

इतिहास

OpenAI ने नवंबर 2016 में Dota 2 बॉट्स के लिए एल्गोरिदम विकसित करना शुरू किया। कंपनी ने Dota 2 को चुना क्योंकि यह स्ट्रीमिंग प्लेटफॉर्म Twitch पर लोकप्रिय था, इसमें मूल Linux समर्थन था, और डेवलपर्स के लिए एक एप्लिकेशन प्रोग्रामिंग इंटरफेस (API) उपलब्ध था। पहला सार्वजनिक प्रदर्शन अगस्त में The International 2017 में हुआ, जहाँ बॉट ने यूक्रेनी पेशेवर खिलाड़ी Dendi को लाइव एक-बनाम-एक मुकाबले में हराया। मैच के बाद, OpenAI के CTO Greg Brockman ने समझाया कि बॉट ने दो सप्ताह के वास्तविक समय में खुद के खिलाफ खेलकर सीखा था, सुदृढीकरण लर्निंग का उपयोग करके, एक ऐसी विधि जिसमें सिस्टम परीक्षण और त्रुटि से सुधरता है।

जून 2018 तक, बॉट्स पाँच खिलाड़ियों की पूरी टीम के रूप में एक साथ खेल सकते थे और उन्होंने शौकिया और अर्ध-पेशेवर टीमों को हराया। The International 2018 में, OpenAI Five ने पेशेवर टीमों - paiN Gaming और पूर्व चीनी खिलाड़ियों की एक ऑल-स्टार टीम - के खिलाफ दो प्रदर्शनी मैच खेले, लेकिन दोनों हार गया। हार के बावजूद, OpenAI ने इस आयोजन को सफल माना, क्योंकि इसने एल्गोरिदम को परिष्कृत करने के लिए मूल्यवान डेटा प्रदान किया। अंतिम सार्वजनिक प्रदर्शन अप्रैल 2019 में था, जब OpenAI Five ने सैन फ्रांसिस्को में एक लाइव इवेंट में वर्तमान विश्व चैंपियन OG के खिलाफ बेस्ट-ऑफ-थ्री श्रृंखला जीती। उसी महीने, एक ऑनलाइन इवेंट ने जनता को बॉट्स के खिलाफ खेलने की अनुमति दी; चार दिनों में, बॉट्स ने 42,729 गेम खेले और उनमें से 99.4% जीते।

वास्तुकला

प्रत्येक OpenAI Five बॉट एक तंत्रिका नेटवर्क था जिसमें एक एकल परत थी जिसमें 4096-यूनिट LSTM (लॉन्ग शॉर्ट-टर्म मेमोरी) शामिल थी जो Dota 2 API से निकाली गई वर्तमान गेम स्थिति को संसाधित करती थी। नेटवर्क ने कई एक्शन हेड्स के माध्यम से क्रियाएँ उत्पन्न कीं, जिनमें से प्रत्येक का एक विशिष्ट अर्थ था, जैसे कि क्रिया से पहले की देरी, क्रिया का प्रकार और लक्ष्य निर्देशांक। सिस्टम ने दुनिया को 20,000 संख्याओं की सूची के रूप में देखा और एक क्रिया को परिभाषित करने के लिए आठ मानों की एक सूची तैयार की। इसे "Rapid" इंफ्रास्ट्रक्चर पर सुदृढीकरण लर्निंग का उपयोग करके प्रशिक्षित किया गया था, जो हजारों मशीनों का प्रबंधन करता था। 2018 तक, OpenAI Five ने लगभग 180 वर्षों का गेम समय खेला था, जिसमें 256 GPU और 128,000 CPU कोर का उपयोग किया गया था, साथ ही प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन एल्गोरिदम का उपयोग किया गया था।

अन्य गेम AI प्रणालियों के साथ तुलना

OpenAI Five पहले के गेम-खेलने वाले AI जैसे Deep Blue (शतरंज), AlphaGo (गो) और Watson (Jeopardy!) से कई प्रमुख पहलुओं में भिन्न था:

  • दीर्घकालिक दृष्टिकोण: Dota 2 मैच लगभग 45 मिनट तक 30 फ्रेम प्रति सेकंड पर चलते हैं, जिसके परिणामस्वरूप प्रति गेम लगभग 80,000 टिक होते हैं। OpenAI Five हर चौथे फ्रेम का अवलोकन करता था, जिससे 20,000 चालें उत्पन्न होती थीं। इसके विपरीत, शतरंज आमतौर पर 40 चालों के भीतर समाप्त होता है, और गो 150 के भीतर।
  • आंशिक रूप से देखी गई स्थिति: Dota 2 में युद्ध का कोहरा है जो दुश्मन इकाइयों और आंदोलनों को छुपाता है, जिससे खिलाड़ियों को अधूरी जानकारी के आधार पर निर्णय लेने की आवश्यकता होती है। शतरंज और गो पूर्ण-सूचना वाले खेल हैं जिनमें कोई छिपा हुआ तत्व नहीं होता।
  • निरंतर क्रिया स्थान: Dota 2 में प्रत्येक नायक इकाइयों या स्थितियों को लक्षित करते हुए दर्जनों क्रियाएँ कर सकता है, डेवलपर्स प्रति नायक 170,000 संभावित क्रियाओं की अनुमति देते हैं। औसतन, प्रत्येक टिक पर लगभग 1,000 मान्य क्रियाएँ उपलब्ध होती हैं, जबकि शतरंज में 35 और गो में 250 होती हैं।
  • निरंतर अवलोकन स्थान: गेम स्थिति को 20,000 संख्याओं द्वारा दर्शाया जाता है, जबकि शतरंज बोर्ड लगभग 70 मानों और गो बोर्ड लगभग 400 मानों का होता है।

इन विशेषताओं ने Dota 2 को AI के लिए एक अधिक जटिल चुनौती बना दिया, जिसके लिए सिस्टम को वास्तविक समय में निर्णय लेने, दीर्घकालिक योजना और टीमवर्क को संभालने की आवश्यकता थी।

स्वागत

OpenAI Five को AI, तकनीक और गेमिंग समुदायों से व्यापक मान्यता मिली। Microsoft के संस्थापक Bill Gates ने इसकी जीत को एक "बड़ी बात" कहा क्योंकि उन्हें टीमवर्क और सहयोग की आवश्यकता थी। शतरंज चैंपियन Garry Kasparov, जो 1997 में Deep Blue से हार गए थे, ने कहा कि The International 2018 में बॉट्स की हार के बावजूद, वे "वहाँ पहुँचेंगे, और उम्मीद से जल्दी।" MIT Technology Review द्वारा साक्षात्कार किए गए AI विशेषज्ञों ने कहा कि Dota 2 एक "अत्यंत जटिल खेल" था, जिससे गैर-पेशेवर खिलाड़ियों पर भी जीत प्रभावशाली थी। PC Gamer ने लिखा कि पेशेवर खिलाड़ियों के खिलाफ जीत AI अनुसंधान के लिए एक महत्वपूर्ण मील का पत्थर थी, जो जटिल, वास्तविक समय की स्थितियों को संभालने की प्रणाली की क्षमता को उजागर करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·dota-2·reinforcement-learning·openai
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास