Phi-1 बड़ा भाषा मॉडल है जिसे माइक्रोसॉफ्ट द्वारा विकसित किया गया था, और जून 2023 में जारी किया गया था। 1.3 बिलियन पैरामीटर के साथ, यह एक कॉम्पैक्ट ट्रांसफॉर्मर आर्किटेक्चर है जिसे विशेष रूप से कोड निर्माण और समझ कार्यों के लिए डिज़ाइन किया गया है। Phi-1 को पाठ्यपुस्तक-गुणवत्ता वाले कोड और सिंथेटिक अभ्यासों के एक क्यूरेटेड डेटासेट पर प्रशिक्षित किया गया था, जिसमें विशाल पैमाने पर डेटा गुणवत्ता पर जोर दिया गया था। इसका विकास मशीन लर्निंग अनुसंधान में एक उल्लेखनीय बदलाव का संकेत था, जो दर्शाता है कि छोटे मॉडल सावधानीपूर्वक फ़िल्टर किए गए डेटा पर प्रशिक्षित होने पर बहुत बड़े समकक्षों को टक्कर दे सकते हैं।
मॉडल को माइक्रोसॉफ्ट की Phi श्रृंखला के हिस्से के रूप में पेश किया गया था, जो प्रशिक्षण डेटा गुणवत्ता और मॉडल प्रदर्शन के बीच संबंध का पता लगाती है। Phi-1 ने अपने आकार पर कई कोडिंग बेंचमार्क में अत्याधुनिक परिणाम प्राप्त किए, जिनमें HumanEval और MBPP शामिल हैं, और कई गुना बड़े मॉडलों को पीछे छोड़ दिया। इसकी सफलता ने पाठ्यक्रम-आधारित शिक्षण और गहन शिक्षण में डेटा चयन रणनीतियों की क्षमता को उजागर किया।
आर्किटेक्चर और प्रशिक्षण
Phi-1 एक मानक डिकोडर-ओनली ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है जिसमें 24 परतें, 32 ध्यान हेड और 2048 का छिपा हुआ आयाम है। यह मल्टी-हेड अटेंशन, लेयर नॉर्मलाइज़ेशन, और अवशिष्ट नेटवर्क कनेक्शन का उपयोग करता है, जो अन्य आधुनिक बड़े भाषा मॉडल के समान है। मॉडल को 1.4 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, लेकिन मुख्य नवाचार डेटासेट संरचना थी: 70% डेटा कोड के फ़िल्टर किए गए वेब कॉर्पस से आया था, जबकि 30% एक बड़े भाषा मॉडल (संभवतः GPT-3.5 या समान) का उपयोग करके सिंथेटिक अभ्यास और पाठ्यपुस्तक-शैली के उदाहरण बनाने के लिए उत्पन्न किया गया था।
प्रशिक्षण प्रक्रिया में एडम ऑप्टिमाइज़र का उपयोग किया गया था, जिसमें सीखने की दर अनुसूची शामिल थी जिसमें वार्मअप चरण और कोसाइन क्षय शामिल था। ग्रेडिएंट क्लिपिंग को प्रशिक्षण को स्थिर करने के लिए लागू किया गया था। मॉडल को लगभग 12 दिनों के लिए 512 A100 GPU पर प्रशिक्षित किया गया था, जिसमें लगभग 1.5 पेटाफ्लॉप-दिन की गणना खपत हुई। यह GPT-3 या ओपनएआई के बाद के मॉडल जैसे बड़े मॉडलों के लिए उपयोग की जाने वाली गणना से काफी कम है।
डेटा क्यूरेशन और सिंथेटिक डेटा
Phi-1 का एक केंद्रीय पहलू डेटा गुणवत्ता पर जोर है। प्रशिक्षण कॉर्पस, जिसे CodeTextbook कहा जाता है, GitHub रिपॉजिटरी से उच्च-गुणवत्ता, स्व-निहित कोड नमूनों के लिए फ़िल्टर करके बनाया गया था। फ़िल्टरिंग प्रक्रिया ने अनावश्यक, निम्न-गुणवत्ता, या खराब दस्तावेज वाले कोड को हटा दिया। इसके अतिरिक्त, एक शिक्षक मॉडल का उपयोग करके सिंथेटिक डेटा उत्पन्न किया गया था ताकि पाठ्यपुस्तक समस्याओं की नकल करने वाले अभ्यास बनाए जा सकें, जैसे "एक फ़ंक्शन लिखें जो फाइबोनैचि अनुक्रम की गणना करता है" और साथ में स्पष्टीकरण।
यह दृष्टिकोण पाठ्यक्रम-आधारित शिक्षण से प्रेरणा लेता है, जहां मॉडल को धीरे-धीरे अधिक जटिल उदाहरणों पर प्रशिक्षित किया जाता है। सिंथेटिक डेटा निर्माण शैक्षिक सामग्री के सिद्धांतों द्वारा निर्देशित था, यह सुनिश्चित करते हुए कि उदाहरण स्पष्ट, संक्षिप्त और शैक्षणिक रूप से सुदृढ़ थे। डेटा क्यूरेशन पर यह ध्यान केंद्रित करने से Phi-1 को अपने अपेक्षाकृत छोटे आकार के बावजूद कोडिंग कार्यों पर उच्च सटीकता प्राप्त करने की अनुमति मिली।
प्रदर्शन और बेंचमार्क
Phi-1 का मूल्यांकन कई मानक कोड निर्माण बेंचमार्क पर किया गया था। HumanEval पर, इसने 50.6% की pass@1 सटीकता हासिल की, जो Codex (जिसमें 12B पैरामीटर पर 28.8% था) और यहां तक कि कुछ बड़े मॉडलों से बेहतर प्रदर्शन किया। MBPP पर, इसने 55.5% pass@1 स्कोर किया। ये परिणाम उल्लेखनीय थे क्योंकि Phi-1 गूगल डीपमाइंड या एंथ्रोपिक जैसे कई प्रतिस्पर्धी मॉडलों की तुलना में काफी छोटा था।
मॉडल ने कोड स्पष्टीकरण और पूर्णता कार्यों पर भी मजबूत प्रदर्शन दिखाया, हालांकि यह विविध पाठ पर प्रशिक्षित मॉडलों की तुलना में सामान्य भाषा समझ में कम सक्षम था। कोड में इसकी विशेषज्ञता ने इसे डेवलपर्स के लिए एक उपयोगी उपकरण बना दिया, और इसे कोड-संबंधित अनुप्रयोगों के लिए माइक्रोसॉफ्ट की एज़्योर AI सेवाओं में एकीकृत किया गया था।
प्रभाव और स्वागत
Phi-1 की रिलीज़ ने कृत्रिम बुद्धिमत्ता में दक्षता के बारे में व्यापक चर्चा में योगदान दिया। इसने इस प्रचलित धारणा को चुनौती दी कि बड़े मॉडल हमेशा बेहतर होते हैं, यह सुझाव देते हुए कि डेटा गुणवत्ता और क्यूरेशन पैमाने के समान महत्वपूर्ण हो सकते हैं। इसने बाद के अनुसंधान को प्रभावित किया, जिसमें Phi श्रृंखला के बाद के मॉडल, जैसे Phi-1.5 और Phi-2, शामिल हैं, जिन्होंने दृष्टिकोण को सामान्य पाठ तक बढ़ाया।
Phi-1 ने सिंथेटिक डेटा निर्माण में भी रुचि जगाई, एक तकनीक जिसे बाद में अन्य प्रयोगशालाओं द्वारा अपनाया गया। इसकी सफलता को इस विचार के सत्यापन के रूप में देखा गया कि छोटे, विशेष मॉडल एज डिवाइसों पर तैनात किए जा सकते हैं, जिससे विशाल क्लाउड बुनियादी ढांचे पर निर्भरता कम हो जाती है। हालांकि, कुछ शोधकर्ताओं ने नोट किया कि सिंथेटिक डेटा निर्माण एक शक्तिशाली शिक्षक मॉडल पर निर्भर था, जो दृष्टिकोण की स्केलेबिलिटी को सीमित कर सकता है।
सीमाएं और भविष्य की दिशाएं
अपनी ताकत के बावजूद, Phi-1 की सीमाएं थीं। इसे विशेष रूप से कोड पर प्रशिक्षित किया गया था, इसलिए इसमें सामान्य ज्ञान की कमी थी और यह प्राकृतिक भाषा संवाद या तथ्यात्मक प्रश्न उत्तर जैसे कार्य नहीं कर सकता था। वितरण से बाहर के कोड पर इसका प्रदर्शन, जैसे कम सामान्य भाषाओं में कोड या असामान्य शैली के साथ, कम मजबूत था। इसके अतिरिक्त, मॉडल को निर्देश पालन के लिए फाइन-ट्यून नहीं किया गया था, इसलिए इसे सावधानीपूर्वक प्रॉम्प्टिंग की आवश्यकता थी।
Phi श्रृंखला में भविष्य के काम का उद्देश्य अधिक विविध डेटा और निर्देश ट्यूनिंग को शामिल करके इन अंतरालों को संबोधित करना था। Phi-1 से डेटा क्यूरेशन और सिंथेटिक डेटा के सिद्धांतों को आगे बढ़ाया गया, जिससे बाद के मॉडलों के विकास को प्रभावित किया गया जिन्होंने दक्षता बनाए रखते हुए व्यापक क्षमताएं हासिल कीं।