Genie एक जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल है जिसे Google DeepMind द्वारा विकसित किया गया है, जो एकल टेक्स्ट प्रॉम्प्ट, स्केच या छवि से खेलने योग्य, इंटरैक्टिव 2D वीडियो गेम वातावरण बना सकता है। फरवरी 2024 में पेश किया गया, यह मॉडल जनरेटिव AI में एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है, जो स्थिर सामग्री निर्माण से आगे बढ़कर पूरी तरह से इंटरैक्टिव, वास्तविक समय की आभासी दुनिया उत्पन्न करता है। Genie पूरी तरह से अनुपयोगी वीडियो डेटा पर प्रशिक्षित है, जो स्पष्ट निर्देशों या लेबल किए गए उदाहरणों के बिना गेम वातावरण की गतिशीलता को मॉडल करना सीखता है।
नाम Genie, Generative Interactive Environments का संक्षिप्त रूप है, जो इसके मूल उद्देश्य को दर्शाता है: ऐसे वातावरण उत्पन्न करना जिन्हें उपयोगकर्ता तुरंत खोज और इंटरैक्ट कर सकें। पारंपरिक गेम इंजनों के विपरीत, जिन्हें भौतिकी, नियमों और चरित्र व्यवहारों की स्पष्ट प्रोग्रामिंग की आवश्यकता होती है, Genie इन तत्वों को दृश्य डेटा से अप्रत्यक्ष रूप से सीखता है। यह दृष्टिकोण इसे यथार्थवादी परिदृश्यों से लेकर अमूर्त, कार्टून जैसे दृश्यों तक, विभिन्न दृश्य शैलियों में सामान्यीकरण करने की अनुमति देता है।
आर्किटेक्चर और प्रशिक्षण
Genie एक ट्रांसफॉर्मर आर्किटेक्चर पर आधारित है, जो कई आधुनिक बड़े भाषा मॉडल में उपयोग किया जाने वाला मूलभूत मॉडल प्रकार है। हालाँकि, इसका प्रशिक्षण डेटा टेक्स्ट के बजाय 200,000 घंटे से अधिक सार्वजनिक रूप से उपलब्ध 2D प्लेटफ़ॉर्मर गेम वीडियो से बना है। मॉडल को तीन मुख्य घटकों में प्रशिक्षित किया गया है: एक वीडियो टोकनाइज़र, एक अव्यक्त क्रिया मॉडल और एक गतिशीलता मॉडल।
वीडियो टोकनाइज़र कच्चे वीडियो फ़्रेम को असतत टोकन में संपीड़ित करता है, जैसे कि एक तंत्रिका नेटवर्क छवि पैच को संसाधित कर सकता है। अव्यक्त क्रिया मॉडल प्रशिक्षण वीडियो में खिलाड़ी द्वारा किए गए कार्यों का अनुमान लगाता है, बिना किसी मानव लेबलिंग के आठ संभावित क्रियाओं (जैसे बाएँ, दाएँ, कूदना या रुकना) का एक सेट खोजता है। गतिशीलता मॉडल फिर वर्तमान फ़्रेम और अनुमानित क्रिया को देखते हुए अगले फ़्रेम की भविष्यवाणी करता है, जिससे वास्तविक समय में इंटरैक्शन संभव होता है।
यह प्रशिक्षण प्रक्रिया पूरी तरह से अनुपयोगी है, जिसका अर्थ है कि Genie को क्रियाओं या गेम नियमों के लिए स्पष्ट लेबल कभी नहीं मिलते। इसके बजाय, यह दृश्य परिवर्तनों को अव्यक्त क्रियाओं से जोड़ना सीखता है, एक तकनीक जो इसे अनुमान के समय नए वातावरणों के अनुकूल होने की अनुमति देती है। मॉडल वीडियो में अस्थायी निर्भरताओं को संसाधित करने के लिए मल्टी-हेड अटेंशन के साथ एक अनुक्रम-से-अनुक्रम ढांचे का उपयोग करता है।
क्षमताएँ और इंटरैक्शन
Genie विभिन्न इनपुट से एक खेलने योग्य वातावरण उत्पन्न कर सकता है, जिसमें टेक्स्ट विवरण, हाथ से बनाए गए स्केच या पूर्ण-रंग छवियाँ शामिल हैं। उदाहरण के लिए, एक उपयोगकर्ता एक चरित्र और एक प्लेटफ़ॉर्म का सरल लाइन ड्राइंग प्रदान कर सकता है, और Genie एक पूर्ण गेम दुनिया उत्पन्न करेगा जहाँ चरित्र चल सकता है, कूद सकता है और बाधाओं के साथ इंटरैक्ट कर सकता है। मॉडल 160x256 पिक्सेल के रिज़ॉल्यूशन पर काम करता है और वर्तमान हार्डवेयर पर लगभग 1 फ़्रेम प्रति सेकंड की दर से फ़्रेम उत्पन्न करता है, जो वास्तविक समय से धीमा है लेकिन अवधारणा को प्रदर्शित करने के लिए पर्याप्त है।
आठ क्रियाओं का अव्यक्त क्रिया स्थान प्रशिक्षण डेटा से सीखा गया है और विभिन्न उत्पन्न वातावरणों में सुसंगत है। इसका मतलब है कि एक बार जब कोई उपयोगकर्ता Genie-जनित गेम के लिए नियंत्रण सीख लेता है, तो वे उन्हीं नियंत्रणों को मॉडल द्वारा बनाए गए किसी भी अन्य वातावरण पर लागू कर सकते हैं। मॉडल कुछ हद तक स्थिरता भी प्रदर्शित करता है, कई फ़्रेमों में वातावरण की स्थिति बनाए रखता है, जो सुसंगत गेमप्ले के लिए आवश्यक है।
अन्य AI मॉडलों से संबंध
Genie आर्टिफिशियल इंटेलिजेंस अनुसंधान में इंटरैक्टिव और सन्निहित AI की ओर व्यापक प्रवृत्ति का हिस्सा है। जबकि OpenAI के GPT श्रृंखला या Anthropic के Claude जैसे मॉडल टेक्स्ट निर्माण पर ध्यान केंद्रित करते हैं, Genie विश्व मॉडलिंग की चुनौती को संबोधित करता है - यह समझना कि क्रियाओं के जवाब में वातावरण समय के साथ कैसे बदलते हैं। यह क्षमता अधिक सामान्य मशीन लर्निंग प्रणालियों की ओर एक कदम के रूप में देखी जाती है जो भौतिक या अनुकरणित दुनिया में काम कर सकती हैं।
बड़े भाषा मॉडल के विपरीत जो विशाल टेक्स्ट कॉर्पोरा पर निर्भर करते हैं, Genie की वीडियो डेटा पर निर्भरता इसे दृश्य और भौतिक गतिशीलता को पकड़ने की अनुमति देती है जिन्हें शब्दों में व्यक्त करना कठिन है। मॉडल का अनुपयोगी शिक्षण दृष्टिकोण AI फीडबैक से सुदृढीकरण सीखना जैसे तरीकों के विपरीत है, जिन्हें स्पष्ट पुरस्कार संकेतों की आवश्यकता होती है। निष्क्रिय अवलोकन से सीखने की Genie की क्षमता पाठ्यक्रम सीखना और डेटा संवर्धन में अनुसंधान के साथ संरेखित होती है, हालाँकि यह इन तकनीकों का सीधे उपयोग नहीं करता है।
सीमाएँ और भविष्य की दिशाएँ
Genie के वर्तमान संस्करण में कई सीमाएँ हैं। इसका आउटपुट रिज़ॉल्यूशन कम है, और फ़्रेम दर अभी तक व्यावसायिक गेमिंग अनुप्रयोगों के लिए उपयुक्त नहीं है। मॉडल जटिल भौतिकी, जैसे गुरुत्वाकर्षण और टकराव का पता लगाने, के साथ भी संघर्ष करता है, जो उत्पन्न वातावरणों में असंगत व्यवहार का कारण बन सकता है। इसके अतिरिक्त, क्योंकि यह प्लेटफ़ॉर्मर गेम पर प्रशिक्षित है, यह पहले-व्यक्ति शूटर या पहेली गेम जैसी अन्य शैलियों को उत्पन्न करने में कम प्रभावी है।
Google DeepMind ने संकेत दिया है कि Genie के भविष्य के संस्करण मॉडल को स्केल करके, उच्च-रिज़ॉल्यूशन प्रशिक्षण डेटा को शामिल करके और संभावित रूप से अन्य डोमेन से गहन शिक्षण तकनीकों को एकीकृत करके इन मुद्दों का समाधान करेंगे। टीम गेमिंग से परे अनुप्रयोगों का पता लगाने की भी योजना बना रही है, जैसे रोबोटिक्स और सिमुलेशन, जहाँ इंटरैक्टिव वातावरण उत्पन्न करने की क्षमता भौतिक एजेंटों के लिए प्रशिक्षण को तेज कर सकती है। 2025 की शुरुआत तक, Genie एक उपभोक्ता उत्पाद के बजाय एक शोध प्रदर्शन बना हुआ है, लेकिन इसने विश्व निर्माण के अपने नवीन दृष्टिकोण के लिए AI समुदाय में काफी रुचि पैदा की है।
प्रभाव और स्वागत
Genie की घोषणा शोधकर्ताओं और प्रौद्योगिकीविदों से उत्साह के साथ मिली, जिन्होंने इसे इंटरैक्टिव AI के भविष्य की एक झलक के रूप में देखा। इसने प्रदर्शित किया कि जनरेटिव मॉडल स्थिर आउटपुट उत्पन्न करने से आगे बढ़कर वास्तविक समय के सिमुलेशन के क्षेत्र में प्रवेश कर सकते हैं। मॉडल के अनुपयोगी शिक्षण प्रतिमान की विशेष रूप से महंगे मानव एनोटेशन की आवश्यकता को कम करने के लिए प्रशंसा की गई, जो गहन शिक्षण परियोजनाओं में एक सामान्य बाधा है।
Genie ने AI-जनित इंटरैक्टिव सामग्री के नैतिक निहितार्थों के बारे में भी प्रश्न उठाए, विशेष रूप से कॉपीराइट और दुरुपयोग की संभावना के संबंध में। चूंकि मॉडल सार्वजनिक रूप से उपलब्ध वीडियो पर प्रशिक्षित है, जिनमें से कुछ कॉपीराइट हो सकते हैं, इसके आउटपुट की कानूनी स्थिति के बारे में चल रही चर्चाएँ हैं। हालाँकि, अब तक, Genie के संबंध में Google DeepMind के खिलाफ कोई बड़ी कानूनी चुनौती दर्ज नहीं की गई है। मॉडल ने इंटरैक्टिव निर्माण में अन्य शोध प्रयासों को भी प्रेरित किया है, जिसमें स्टैनफोर्ड AI लैब और बर्कले AI रिसर्च में काम शामिल है, जो विश्व मॉडलिंग के समान दृष्टिकोणों की खोज कर रहे हैं।