फी 4 बड़े भाषा मॉडल का एक परिवार है जिसे माइक्रोसॉफ्ट रिसर्च द्वारा विकसित किया गया है। यह श्रृंखला अग्रणी प्रणालियों की तुलना में अपेक्षाकृत कॉम्पैक्ट मॉडल आकारों की विशेषता रखती है, जबकि तर्क, गणित और कोडिंग कार्यों पर प्रतिस्पर्धी प्रदर्शन का लक्ष्य रखती है। फी 4 के कई वेरिएंट सार्वजनिक LLM और मीडिया लीडरबोर्ड पर दिखाई दिए हैं, जिनमें बेंचमार्क स्नैपशॉट में कम से कम चार अलग-अलग कॉन्फ़िगरेशन दर्ज किए गए हैं।
पहला सार्वजनिक रूप से प्रलेखित फी 4 मॉडल 2024 के अंत में जारी किया गया था, जो पहले की फी-3 श्रृंखला पर आधारित था। माइक्रोसॉफ्ट ने फी 4 को एक शोध-उन्मुख मॉडल के रूप में स्थापित किया, जो केवल पैमाने के बजाय डेटा गुणवत्ता और सिंथेटिक डेटा निर्माण पर जोर देता है। प्रमुख वेरिएंट, फी-4 (14B), ने MATH और GSM8K जैसे मानक तर्क बेंचमार्क पर मजबूत परिणाम प्रदर्शित किए, जो अक्सर अन्य संगठनों के बड़े मॉडलों से बेहतर प्रदर्शन करते हैं।
मॉडल वेरिएंट और बेंचमार्क
सार्वजनिक लीडरबोर्ड, जिनमें AI मूल्यांकन प्लेटफार्मों द्वारा होस्ट किए गए शामिल हैं, कम से कम चार फी 4 वेरिएंट सूचीबद्ध करते हैं। इनमें बेस 14B मॉडल, एक 14B निर्देश-ट्यून किया गया संस्करण, और छोटे कॉन्फ़िगरेशन (जैसे, 7B और 3.8B) शामिल हैं जो कम कम्प्यूटेशनल आवश्यकताओं के लिए कुछ सटीकता का व्यापार करते हैं। बेंचमार्क स्नैपशॉट में, 14B निर्देश-ट्यून मॉडल लगातार शीर्ष कॉम्पैक्ट मॉडलों में रैंक करता है, जो कोड जनरेशन (HumanEval) और तार्किक निगमन (ARC) जैसे कार्यों पर 70B या अधिक पैरामीटर वाले मॉडलों के बराबर स्कोर प्राप्त करता है।
मॉडलों को ट्रांसफॉर्मर आर्किटेक्चर के साथ मल्टी-हेड अटेंशन और पोजिशनल एन्कोडिंग का उपयोग करके प्रशिक्षित किया जाता है। प्रशिक्षण में क्यूरेटेड वेब डेटा, फ़िल्टर किए गए कोड रिपॉजिटरी, और बड़े शिक्षक मॉडलों द्वारा उत्पन्न सिंथेटिक डेटासेट का मिश्रण शामिल था। माइक्रोसॉफ्ट ने पूर्ण प्रशिक्षण विवरण का खुलासा नहीं किया है, लेकिन दृष्टिकोण पाठ्यक्रम सीखने के सिद्धांतों के अनुरूप है, जो धीरे-धीरे कार्य जटिलता को बढ़ाता है।
तकनीकी विशिष्टताएँ
फी 4 मॉडल एक घने, गैर-moe (मिश्रण-ऑफ-एक्सपर्ट्स) डिज़ाइन का उपयोग करते हैं, जो मानक हार्डवेयर पर तैनाती को सरल बनाता है। 14B वेरिएंट में 14 बिलियन पैरामीटर, 8,192 टोकन की संदर्भ विंडो है, और जनरेशन के लिए टॉप-के और टॉप-पी सैंपलिंग का समर्थन करता है। मॉडल एक अनुमेय लाइसेंस के तहत जारी किए जाते हैं (अनुसंधान और वाणिज्यिक उपयोग के लिए MIT, 14B संस्करण पर कुछ प्रतिबंधों के साथ)।
इन्फ्रेंस Azure क्लाउड और स्थानीय तैनाती दोनों के लिए अनुकूलित है। मॉडल Hugging Face Transformers और vLLM जैसे लोकप्रिय फ्रेमवर्क के साथ संगत हैं। माइक्रोसॉफ्ट ने बताया कि फी 4 बेहतर कर्नेल फ्यूजन के कारण AWS ट्रेनियम इंस्टेंस पर फी-3 की तुलना में 2x गति प्राप्त करता है।
प्रदर्शन और सीमाएँ
सार्वजनिक लीडरबोर्ड पर, फी 4 वेरिएंट गणित और तर्क में मजबूत प्रदर्शन दिखाते हैं, लेकिन वे OpenAI और Google DeepMind के अग्रणी मॉडलों से खुले-अंत रचनात्मक लेखन और सूक्ष्म निर्देश पालन में पीछे रहते हैं। मॉडल तथ्यात्मक प्रश्नों पर कभी-कभी भ्रम प्रदर्शित करते हैं, जो क्षेत्र में एक सामान्य मुद्दा है। माइक्रोसॉफ्ट ने संरेखण में सुधार के लिए RLHF (मानव प्रतिक्रिया से सुदृढीकरण सीखना) डेटा प्रकाशित किया है, लेकिन मॉडल विशिष्ट विषयों पर प्रशंसनीय लेकिन गलत उत्तर उत्पन्न करने के लिए प्रवण रहते हैं।
3.8B वेरिएंट एज डिवाइसों, जिनमें स्मार्टफोन और एम्बेडेड सिस्टम शामिल हैं, पर चलने के लिए उल्लेखनीय है, हालांकि मेमोरी बाधाओं के भीतर फिट होने के लिए क्वांटाइजेशन की आवश्यकता होती है। यह फी 4 को Apple और सैमसंग इलेक्ट्रॉनिक्स के प्रयासों के समान, ऑन-डिवाइस जनरेटिव AI अनुप्रयोगों के लिए एक उम्मीदवार बनाता है।
पारिस्थितिकी तंत्र और अपनाना
फी 4 को माइक्रोसॉफ्ट के Azure AI फाउंड्री में एकीकृत किया गया है और API के माध्यम से उपलब्ध है। Groq और SambaNova जैसे तृतीय-पक्ष प्लेटफार्म 14B मॉडल के लिए त्वरित इन्फ्रेंस प्रदान करते हैं। खुले वेट्स ने विशेष डोमेन के लिए समुदाय फाइन-ट्यून को बढ़ावा दिया है, जिसमें चिकित्सा और कानूनी तर्क शामिल हैं, हालांकि ये आधिकारिक रूप से समर्थित नहीं हैं।
स्टैनफोर्ड AI लैब और बर्कले AI रिसर्च के शोधकर्ताओं ने डेटा दक्षता पर अध्ययन में फी 4 का हवाला दिया है, यह देखते हुए कि इसका प्रदर्शन कच्चे पैरामीटर गणना पर प्रशिक्षण डेटा क्यूरेशन के महत्व को सुझाता है। मॉडल का उपयोग मॉडल प्रूनिंग प्रयोगों में भी किया गया है, यह दिखाते हुए कि न्यूनतम सटीकता हानि के साथ 30% तक वेट्स हटाए जा सकते हैं।
भविष्य की दिशाएँ
माइक्रोसॉफ्ट ने फी 5 की घोषणा नहीं की है, लेकिन कंपनी सिंथेटिक डेटा जनरेशन और लॉस फंक्शन पर शोध प्रकाशित करना जारी रखती है जो भविष्य के पुनरावृत्तियों को सूचित कर सकते हैं। 2025 की शुरुआत तक, फी 4 कॉम्पैक्ट, उच्च-प्रदर्शन मॉडलों के लिए एक संदर्भ बिंदु बना हुआ है, और इसके वेरिएंट अक्सर कुशल डीप लर्निंग पर शैक्षणिक पत्रों में बेसलाइन के रूप में उपयोग किए जाते हैं।
मॉडल परिवार छोटे, विशेष मॉडलों की ओर एक व्यापक प्रवृत्ति का हिस्सा है जो उपभोक्ता हार्डवेयर पर चल सकते हैं, इस धारणा को चुनौती देते हुए कि पैमाना ही क्षमता का एकमात्र मार्ग है। क्या यह दृष्टिकोण आगे बढ़ेगा यह एक खुला प्रश्न बना हुआ है, लेकिन फी 4 ने प्रदर्शित किया है कि सावधानीपूर्वक क्यूरेटेड डेटा कम पैरामीटरों की आंशिक रूप से भरपाई कर सकता है।