अंग्रेज़ी से अनुवादित

Phi-1 माइक्रोसॉफ्ट द्वारा विकसित एक 1.3 बिलियन पैरामीटर वाला ट्रांसफॉर्मर-आधारित बड़ा भाषा मॉडल है, जो कोड निर्माण और समझ में विशेषज्ञता रखता है। यह दर्शाता है कि उच्च-गुणवत्ता वाला क्यूरेटेड डेटा छोटे मॉडलों को प्रतिस्पर्धात्मक प्रदर्शन प्राप्त करने में सक्षम बना सकता है।

Phi-1 बड़ा भाषा मॉडल है जिसे माइक्रोसॉफ्ट द्वारा विकसित किया गया था, और जून 2023 में जारी किया गया था। 1.3 बिलियन पैरामीटर के साथ, यह एक कॉम्पैक्ट ट्रांसफॉर्मर आर्किटेक्चर है जिसे विशेष रूप से कोड निर्माण और समझ कार्यों के लिए डिज़ाइन किया गया है। Phi-1 को पाठ्यपुस्तक-गुणवत्ता वाले कोड और सिंथेटिक अभ्यासों के एक क्यूरेटेड डेटासेट पर प्रशिक्षित किया गया था, जिसमें विशाल पैमाने पर डेटा गुणवत्ता पर जोर दिया गया था। इसका विकास मशीन लर्निंग अनुसंधान में एक उल्लेखनीय बदलाव का संकेत था, जो दर्शाता है कि छोटे मॉडल सावधानीपूर्वक फ़िल्टर किए गए डेटा पर प्रशिक्षित होने पर बहुत बड़े समकक्षों को टक्कर दे सकते हैं।

मॉडल को माइक्रोसॉफ्ट की Phi श्रृंखला के हिस्से के रूप में पेश किया गया था, जो प्रशिक्षण डेटा गुणवत्ता और मॉडल प्रदर्शन के बीच संबंध का पता लगाती है। Phi-1 ने अपने आकार पर कई कोडिंग बेंचमार्क में अत्याधुनिक परिणाम प्राप्त किए, जिनमें HumanEval और MBPP शामिल हैं, और कई गुना बड़े मॉडलों को पीछे छोड़ दिया। इसकी सफलता ने पाठ्यक्रम-आधारित शिक्षण और गहन शिक्षण में डेटा चयन रणनीतियों की क्षमता को उजागर किया।

आर्किटेक्चर और प्रशिक्षण

Phi-1 एक मानक डिकोडर-ओनली ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है जिसमें 24 परतें, 32 ध्यान हेड और 2048 का छिपा हुआ आयाम है। यह मल्टी-हेड अटेंशन, लेयर नॉर्मलाइज़ेशन, और अवशिष्ट नेटवर्क कनेक्शन का उपयोग करता है, जो अन्य आधुनिक बड़े भाषा मॉडल के समान है। मॉडल को 1.4 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, लेकिन मुख्य नवाचार डेटासेट संरचना थी: 70% डेटा कोड के फ़िल्टर किए गए वेब कॉर्पस से आया था, जबकि 30% एक बड़े भाषा मॉडल (संभवतः GPT-3.5 या समान) का उपयोग करके सिंथेटिक अभ्यास और पाठ्यपुस्तक-शैली के उदाहरण बनाने के लिए उत्पन्न किया गया था।

प्रशिक्षण प्रक्रिया में एडम ऑप्टिमाइज़र का उपयोग किया गया था, जिसमें सीखने की दर अनुसूची शामिल थी जिसमें वार्मअप चरण और कोसाइन क्षय शामिल था। ग्रेडिएंट क्लिपिंग को प्रशिक्षण को स्थिर करने के लिए लागू किया गया था। मॉडल को लगभग 12 दिनों के लिए 512 A100 GPU पर प्रशिक्षित किया गया था, जिसमें लगभग 1.5 पेटाफ्लॉप-दिन की गणना खपत हुई। यह GPT-3 या ओपनएआई के बाद के मॉडल जैसे बड़े मॉडलों के लिए उपयोग की जाने वाली गणना से काफी कम है।

डेटा क्यूरेशन और सिंथेटिक डेटा

Phi-1 का एक केंद्रीय पहलू डेटा गुणवत्ता पर जोर है। प्रशिक्षण कॉर्पस, जिसे CodeTextbook कहा जाता है, GitHub रिपॉजिटरी से उच्च-गुणवत्ता, स्व-निहित कोड नमूनों के लिए फ़िल्टर करके बनाया गया था। फ़िल्टरिंग प्रक्रिया ने अनावश्यक, निम्न-गुणवत्ता, या खराब दस्तावेज वाले कोड को हटा दिया। इसके अतिरिक्त, एक शिक्षक मॉडल का उपयोग करके सिंथेटिक डेटा उत्पन्न किया गया था ताकि पाठ्यपुस्तक समस्याओं की नकल करने वाले अभ्यास बनाए जा सकें, जैसे "एक फ़ंक्शन लिखें जो फाइबोनैचि अनुक्रम की गणना करता है" और साथ में स्पष्टीकरण।

यह दृष्टिकोण पाठ्यक्रम-आधारित शिक्षण से प्रेरणा लेता है, जहां मॉडल को धीरे-धीरे अधिक जटिल उदाहरणों पर प्रशिक्षित किया जाता है। सिंथेटिक डेटा निर्माण शैक्षिक सामग्री के सिद्धांतों द्वारा निर्देशित था, यह सुनिश्चित करते हुए कि उदाहरण स्पष्ट, संक्षिप्त और शैक्षणिक रूप से सुदृढ़ थे। डेटा क्यूरेशन पर यह ध्यान केंद्रित करने से Phi-1 को अपने अपेक्षाकृत छोटे आकार के बावजूद कोडिंग कार्यों पर उच्च सटीकता प्राप्त करने की अनुमति मिली।

प्रदर्शन और बेंचमार्क

Phi-1 का मूल्यांकन कई मानक कोड निर्माण बेंचमार्क पर किया गया था। HumanEval पर, इसने 50.6% की pass@1 सटीकता हासिल की, जो Codex (जिसमें 12B पैरामीटर पर 28.8% था) और यहां तक कि कुछ बड़े मॉडलों से बेहतर प्रदर्शन किया। MBPP पर, इसने 55.5% pass@1 स्कोर किया। ये परिणाम उल्लेखनीय थे क्योंकि Phi-1 गूगल डीपमाइंड या एंथ्रोपिक जैसे कई प्रतिस्पर्धी मॉडलों की तुलना में काफी छोटा था।

मॉडल ने कोड स्पष्टीकरण और पूर्णता कार्यों पर भी मजबूत प्रदर्शन दिखाया, हालांकि यह विविध पाठ पर प्रशिक्षित मॉडलों की तुलना में सामान्य भाषा समझ में कम सक्षम था। कोड में इसकी विशेषज्ञता ने इसे डेवलपर्स के लिए एक उपयोगी उपकरण बना दिया, और इसे कोड-संबंधित अनुप्रयोगों के लिए माइक्रोसॉफ्ट की एज़्योर AI सेवाओं में एकीकृत किया गया था।

प्रभाव और स्वागत

Phi-1 की रिलीज़ ने कृत्रिम बुद्धिमत्ता में दक्षता के बारे में व्यापक चर्चा में योगदान दिया। इसने इस प्रचलित धारणा को चुनौती दी कि बड़े मॉडल हमेशा बेहतर होते हैं, यह सुझाव देते हुए कि डेटा गुणवत्ता और क्यूरेशन पैमाने के समान महत्वपूर्ण हो सकते हैं। इसने बाद के अनुसंधान को प्रभावित किया, जिसमें Phi श्रृंखला के बाद के मॉडल, जैसे Phi-1.5 और Phi-2, शामिल हैं, जिन्होंने दृष्टिकोण को सामान्य पाठ तक बढ़ाया।

Phi-1 ने सिंथेटिक डेटा निर्माण में भी रुचि जगाई, एक तकनीक जिसे बाद में अन्य प्रयोगशालाओं द्वारा अपनाया गया। इसकी सफलता को इस विचार के सत्यापन के रूप में देखा गया कि छोटे, विशेष मॉडल एज डिवाइसों पर तैनात किए जा सकते हैं, जिससे विशाल क्लाउड बुनियादी ढांचे पर निर्भरता कम हो जाती है। हालांकि, कुछ शोधकर्ताओं ने नोट किया कि सिंथेटिक डेटा निर्माण एक शक्तिशाली शिक्षक मॉडल पर निर्भर था, जो दृष्टिकोण की स्केलेबिलिटी को सीमित कर सकता है।

सीमाएं और भविष्य की दिशाएं

अपनी ताकत के बावजूद, Phi-1 की सीमाएं थीं। इसे विशेष रूप से कोड पर प्रशिक्षित किया गया था, इसलिए इसमें सामान्य ज्ञान की कमी थी और यह प्राकृतिक भाषा संवाद या तथ्यात्मक प्रश्न उत्तर जैसे कार्य नहीं कर सकता था। वितरण से बाहर के कोड पर इसका प्रदर्शन, जैसे कम सामान्य भाषाओं में कोड या असामान्य शैली के साथ, कम मजबूत था। इसके अतिरिक्त, मॉडल को निर्देश पालन के लिए फाइन-ट्यून नहीं किया गया था, इसलिए इसे सावधानीपूर्वक प्रॉम्प्टिंग की आवश्यकता थी।

Phi श्रृंखला में भविष्य के काम का उद्देश्य अधिक विविध डेटा और निर्देश ट्यूनिंग को शामिल करके इन अंतरालों को संबोधित करना था। Phi-1 से डेटा क्यूरेशन और सिंथेटिक डेटा के सिद्धांतों को आगे बढ़ाया गया, जिससे बाद के मॉडलों के विकास को प्रभावित किया गया जिन्होंने दक्षता बनाए रखते हुए व्यापक क्षमताएं हासिल कीं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·code-generation·microsoft·transformer
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास