साकाना फुगु एक जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल है जिसे टोक्यो स्थित स्टार्टअप साकाना एआई द्वारा विकसित किया गया है। 2024 में जारी, यह पाठ और छवियों के कुशल निर्माण के लिए डिज़ाइन किया गया है, जो मिश्रण-ऑफ-एक्सपर्ट्स वास्तुकला का लाभ उठाता है ताकि प्रति अनुमान चरण में केवल अपने मापदंडों का एक उपसमूह सक्रिय हो सके। यह मॉडल साकाना एआई के प्रकृति-प्रेरित एल्गोरिदम पर व्यापक शोध का हिस्सा है, जो विकासवादी कंप्यूटिंग और सामूहिक बुद्धिमत्ता की अवधारणाओं पर आधारित है। इसका नाम, 'फुगु', जापानी पफरफिश को संदर्भित करता है, जो स्वादिष्टता और मॉडल के कॉम्पैक्ट, कुशल डिज़ाइन दोनों का प्रतीक है।
साकाना फुगु की पहली घोषणा 2024 की शुरुआत में एक तकनीकी ब्लॉग पोस्ट में की गई थी, जिसके बाद उसी वर्ष बाद में सार्वजनिक रिलीज़ हुई। यह मॉडल एक अनुमेय ओपन-सोर्स लाइसेंस के तहत उपलब्ध है, जो शैक्षणिक और वाणिज्यिक दोनों उपयोग की अनुमति देता है। इसे सार्वजनिक रूप से उपलब्ध पाठ और छवियों के एक क्यूरेटेड डेटासेट पर प्रशिक्षित किया गया था, जिसमें जापानी और अंग्रेजी सामग्री पर ध्यान केंद्रित किया गया था, जो साकाना एआई के द्वि-भाषा अनुसंधान लक्ष्यों को दर्शाता है।
वास्तुकला और डिज़ाइन
मॉडल एक ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क का उपयोग करता है जिसमें एक स्पार्स मिश्रण-ऑफ-एक्सपर्ट्स परत होती है, जो प्रत्येक टोकन या छवि पैच को कुछ विशेषज्ञ मॉड्यूल में मार्गदर्शित करती है। यह डिज़ाइन समान पैरामीटर गणना वाले घने मॉडल की तुलना में अनुमान के दौरान कम्प्यूटेशनल लागत को कम करता है। साकाना फुगु पाठ और छवि दोनों मोडैलिटी के लिए मल्टी-हेड-अटेंशन तंत्र का उपयोग करता है, जिसमें प्रत्येक इनपुट प्रकार के लिए अलग एनकोडर होते हैं। छवि निर्माण घटक एक यू-नेट-शैली डिकोडर पर आधारित है, जिसे ट्रांसफॉर्मर ढांचे के लिए अनुकूलित किया गया है, और प्रशिक्षण को स्थिर करने के लिए पूरे समय अवशिष्ट कनेक्शन का उपयोग करता है।
प्रशिक्षण में एडम ऑप्टिमाइज़र का उपयोग किया गया था, जिसमें सीखने की दर अनुसूची शामिल है जिसमें वार्मअप और कोसाइन क्षय शामिल है। मॉडल को एएमडी जीपीयू के एक क्लस्टर पर प्रशिक्षित किया गया था, जो गहन शिक्षण अनुसंधान में एनवीडिया हार्डवेयर के प्रभुत्व को देखते हुए एक उल्लेखनीय विकल्प है। साकाना एआई ने इस निर्णय के लिए लागत दक्षता और आपूर्ति श्रृंखला विचारों का हवाला दिया।
क्षमताएं और प्रदर्शन
साकाना फुगु सुसंगत पाठ अनुच्छेद उत्पन्न कर सकता है, प्रश्नों का उत्तर दे सकता है, और पाठ्य विवरण से छवियां बना सकता है। साकाना एआई द्वारा प्रकाशित बेंचमार्क में, मॉडल ने जापानी भाषा समझ कार्यों पर प्रतिस्पर्धी स्कोर हासिल किए, जैसे कि एलएलएम मूल्यांकन सुइट का जापानी संस्करण, और छवि निर्माण गुणवत्ता मेट्रिक्स जैसे एफआईडी (फ्रेचेट इंसेप्शन दूरी) पर। मॉडल पाठ के लिए 8,192 टोकन की संदर्भ विंडो का समर्थन करता है और 1024x1024 पिक्सेल तक के रिज़ॉल्यूशन पर छवियां उत्पन्न करता है। यह नियंत्रित निर्माण के लिए टॉप-पी सैंपलिंग और तापमान स्केलिंग का भी समर्थन करता है।
एक विशिष्ट विशेषता एक ही फॉरवर्ड पास में मल्टीमॉडल निर्माण करने की इसकी क्षमता है, जो अलग फाइन-ट्यूनिंग के बिना छवि कैप्शनिंग और टेक्स्ट-टू-इमेज संश्लेषण जैसे कार्यों की अनुमति देती है। मॉडल की दक्षता इसे एज डिवाइसों पर तैनाती के लिए उपयुक्त बनाती है, हालांकि आधिकारिक दस्तावेज़ीकरण नोट करता है कि पूर्ण प्रदर्शन के लिए कम से कम 8 जीबी मेमोरी वाले जीपीयू की आवश्यकता होती है।
रिलीज़ और अपनाना
प्रारंभिक रिलीज़ में बेस मॉडल और एक निर्देश-ट्यून किए गए संस्करण दोनों के लिए पूर्व-प्रशिक्षित वेट शामिल थे। निर्देश-ट्यून किए गए संस्करण को आरएलएचएफ (मानव प्रतिक्रिया से सुदृढीकरण सीखना) और अतिरिक्त पाठ्यक्रम सीखने चरणों का उपयोग करके संरेखित किया गया था। रिलीज़ के कुछ महीनों के भीतर, साकाना फुगु ने ओपन-सोर्स समुदाय में, विशेष रूप से जापानी डेवलपर्स के बीच गति प्राप्त की। इसे कई स्थानीय आर्टिफिशियल इंटेलिजेंस टूलकिट में एकीकृत किया गया है और कुशल मशीन लर्निंग पर शैक्षणिक पत्रों में एक संदर्भ मॉडल के रूप में उद्धृत किया गया है।
2024 के अंत तक, साकाना फुगु का उपयोग विकिप्रोम्प्ट प्लेटफ़ॉर्म पर 71 प्रॉम्प्ट में किया गया है, जो एआई मॉडल के मूल्यांकन के लिए एक क्राउडसोर्स्ड डेटासेट है, जो कॉम्पैक्ट जनरेटिव मॉडल के लिए एक बेंचमार्क के रूप में इसकी मान्यता को दर्शाता है। मॉडल का कोड और दस्तावेज़ीकरण GitHub पर होस्ट किया गया है, जिसमें सक्रिय समुदाय योगदान हैं।
तुलना और संदर्भ
साकाना फुगु ओपनएआई के छोटे जीपीटी वेरिएंट और एंथ्रोपिक के क्लॉड इंस्टेंट जैसे अन्य ओपन-सोर्स मॉडल के साथ प्रतिस्पर्धा करता है, हालांकि यह मल्टीमॉडल दक्षता और जापानी भाषा समर्थन पर अपने स्पष्ट फोकस में भिन्न है। गूगल डीपमाइंड के मॉडल के विपरीत, जो अक्सर क्लाउड-आधारित होते हैं, साकाना फुगु स्थानीय तैनाती के लिए डिज़ाइन किया गया है। इसका मिश्रण-ऑफ-एक्सपर्ट्स दृष्टिकोण गूगल डीपमाइंड और नोकिया बेल लैब्स के पहले के शोध से लिया गया है, लेकिन साकाना एआई ने इसे छोटे पैरामीटर गणना के लिए अनुकूलित किया है, जिससे यह व्यक्तिगत शोधकर्ताओं के लिए सुलभ हो गया है।
साकाना एआई में विकास टीम में पूर्व में स्टैनफोर्ड एआई लैब और बर्कले एआई रिसर्च से संबद्ध शोधकर्ता शामिल हैं, और कंपनी को अमेज़न वेब सर्विसेज के स्टार्टअप कार्यक्रम से धन प्राप्त हुआ है। मॉडल की रिलीज़ कुशल, ओपन-सोर्स एआई की ओर एक व्यापक प्रवृत्ति के साथ संरेखित है, जैसा कि एआई21 लैब्स और इन्फ्लेक्शन एआई के प्रयासों में देखा गया है।
सीमाएं और भविष्य का कार्य
साकाना फुगु की प्राथमिक सीमाओं में बड़े मॉडल की तुलना में छोटा ज्ञान आधार शामिल है, विशेष रूप से गैर-जापानी और गैर-अंग्रेजी भाषाओं के लिए, और जटिल दृश्यों के लिए कम विस्तृत छवियां उत्पन्न करने की प्रवृत्ति। डेवलपर्स ने अपने दस्तावेज़ीकरण में इन मुद्दों को स्वीकार किया है और एक बड़े उत्तराधिकारी मॉडल के लिए योजनाएं रेखांकित की हैं, जो अनंतिम रूप से 2025 के लिए निर्धारित है। भविष्य के कार्य में पाठ और छवि मोडैलिटी के बीच क्रॉस-अटेंशन तंत्र में सुधार और अतिरिक्त भाषाओं के लिए समर्थन का विस्तार भी शामिल है।
इन बाधाओं के बावजूद, साकाना फुगु कुशल जनरेटिव आर्टिफिशियल इंटेलिजेंस डिज़ाइन का एक उल्लेखनीय उदाहरण प्रस्तुत करता है, जो उन मॉडलों के बढ़ते पारिस्थितिकी तंत्र में योगदान देता है जो पहुंच और संसाधन संरक्षण को प्राथमिकता देते हैं।