अंग्रेज़ी से अनुवादित

Phi-2 एक 2.7-अरब-पैरामीटर वाला बड़ा भाषा मॉडल है जिसे माइक्रोसॉफ्ट ने विकसित किया है, दिसंबर 2023 में जारी किया गया, जो अपने आकार के सापेक्ष मजबूत तर्क क्षमताओं और उच्च-गुणवत्ता वाले पाठ्यपुस्तक-जैसे डेटा पर प्रशिक्षण के लिए जाना जाता है।

Phi-2 एक 2.7-अरब-पैरामीटर बड़ा भाषा मॉडल है, जिसे Microsoft द्वारा विकसित किया गया और दिसंबर 2023 में जारी किया गया। यह Phi श्रृंखला के छोटे भाषा मॉडलों का हिस्सा है, जिसे तर्क कार्यों पर प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए डिज़ाइन किया गया है, जबकि यह समकालीन अग्रणी मॉडलों से काफी छोटा है। Phi-2 ने प्रदर्शित किया कि प्रशिक्षण डेटा का सावधानीपूर्वक चयन, उच्च-गुणवत्ता वाली पाठ्यपुस्तक-जैसी सामग्री पर केंद्रित, बिना विशाल पैमाने की आवश्यकता के मजबूत तर्क क्षमताएँ उत्पन्न कर सकता है।

मॉडल को 1.4 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, जो इसके आकार के लिए एक अपेक्षाकृत मामूली डेटासेट है, लेकिन एक जो "पाठ्यपुस्तक-गुणवत्ता" डेटा पर जोर देता है - जिसमें बड़े मॉडलों द्वारा उत्पन्न सिंथेटिक डेटासेट और फ़िल्टर की गई वेब सामग्री शामिल है। यह दृष्टिकोण, पाठ्यक्रम-आधारित शिक्षण सिद्धांतों में निहित, Phi-2 को GSM-8K (गणितीय तर्क) और BIG-Bench जैसे बेंचमार्क पर 25 गुना बड़े मॉडलों से बेहतर प्रदर्शन करने की अनुमति देता है। Microsoft ने Phi-2 को एक शोध उपकरण के रूप में स्थापित किया, इसे शैक्षणिक और वाणिज्यिक उपयोग के लिए एक अनुमेय लाइसेंस के तहत जारी किया, जिसका लक्ष्य छोटे मॉडल दक्षता के आगे के अध्ययन को सक्षम करना था।

आर्किटेक्चर और प्रशिक्षण

Phi-2 एक डिकोडर-केवल ट्रांसफॉर्मर मॉडल है, जो अधिकांश आधुनिक बड़े भाषा मॉडलों में उपयोग किए जाने वाले मानक आर्किटेक्चर का पालन करता है। इसमें 32 परतें, 2560 का छिपा हुआ आकार, और 32 ध्यान शीर्ष हैं, जिसमें 2048 टोकन की संदर्भ विंडो है। मॉडल GPT परिवार के विशिष्ट बहु-शीर्ष ध्यान और स्थितीय एन्कोडिंग तकनीकों का उपयोग करता है। कुछ बड़े मॉडलों के विपरीत, यह मिश्रण-ऑफ-विशेषज्ञ या अन्य स्पार्सिटी तकनीकों का उपयोग नहीं करता है, बल्कि घने गणना पर निर्भर करता है।

प्रशिक्षण लगभग 14 दिनों में 96 NVIDIA A100 GPU के क्लस्टर पर आयोजित किया गया था। डेटासेट में 1.4 ट्रिलियन टोकन शामिल थे, जिसका एक महत्वपूर्ण हिस्सा GPT-3.5 और GPT-4 जैसे बड़े मॉडलों द्वारा सिंथेटिक रूप से उत्पन्न किया गया था, साथ ही "RefinedWeb" कोरपस से फ़िल्टर किए गए वेब पृष्ठ भी शामिल थे। सिंथेटिक डेटा को चरण-दर-चरण तर्क सिखाने के लिए डिज़ाइन किया गया था, जबकि वेब डेटा ने सामान्य ज्ञान प्रदान किया। Microsoft ने एडम ऑप्टिमाइज़र और ग्रेडिएंट-क्लिपिंग के साथ एक सीखने की दर अनुसूची का उपयोग किया, और स्थिरता के लिए परत-सामान्यीकरण लागू किया। सिंथेटिक उत्पादन प्रक्रिया के अलावा कोई डेटा-वृद्धि का उपयोग नहीं किया गया।

प्रदर्शन और बेंचमार्क

Phi-2 ने मानक तर्क बेंचमार्क पर उल्लेखनीय परिणाम प्राप्त किए। GSM-8K पर, इसने 56.7% सटीकता प्राप्त की, जो 7B-पैरामीटर Llama-2 और 13B-पैरामीटर Llama-2 से बेहतर प्रदर्शन करती है, और GPT-3.5 जैसे बहुत बड़े मॉडलों के प्रदर्शन के करीब पहुंचती है। BIG-Bench Hard सूट पर, इसने 57.4% स्कोर किया, फिर से अपने आकार के कई गुना मॉडलों को पार करते हुए। कोडिंग कार्यों में, इसने HumanEval पर मजबूत प्रदर्शन दिखाया, 48.4% pass@1 प्राप्त किया, जो StarCoder-15B जैसे मॉडलों के साथ प्रतिस्पर्धी था।

ये परिणाम आर्किटेक्चरल नवाचार के बजाय प्रशिक्षण डेटा की गुणवत्ता के लिए जिम्मेदार थे। Microsoft के शोधकर्ताओं ने नोट किया कि Phi-2 का तर्क कार्यों पर प्रदर्शन इसके आकार के लिए "आश्चर्यजनक रूप से मजबूत" था, जो सुझाव देता है कि तंत्रिका नेटवर्क की क्षमता कुशलता से उपयोग की गई थी। हालांकि, मॉडल ने तथ्यात्मक ज्ञान और लंबे-रूप पीढ़ी में सीमाएँ प्रदर्शित कीं, जो इसके छोटे पैमाने और केंद्रित प्रशिक्षण डेटा के अनुरूप हैं।

रिलीज़ और पहुंच

Phi-2 को 12 दिसंबर 2023 को MIT लाइसेंस के तहत Hugging Face मॉडल हब के माध्यम से जारी किया गया था। इस अनुमेय लाइसेंस ने वाणिज्यिक अनुप्रयोगों सहित अप्रतिबंधित उपयोग की अनुमति दी, जो उस समय इसकी क्षमता के मॉडलों के लिए असामान्य था। Microsoft ने Phi-2 को अपने एज़्योर क्लाउड प्लेटफ़ॉर्म में भी एकीकृत किया, जिससे Azure AI Studio और Azure Machine Learning के माध्यम से तैनाती सक्षम हुई। मॉडल फाइन-ट्यूनिंग और अनुमान के लिए उपलब्ध था, जिसमें CPU और GPU दोनों निष्पादन के लिए समर्थन था।

रिलीज़ AI अनुसंधान को लोकतांत्रिक बनाने की Microsoft की व्यापक रणनीति का हिस्सा थी, जो उपभोक्ता हार्डवेयर पर चल सकने वाले बड़े मॉडलों के लिए एक हल्का विकल्प प्रदान करती है। Phi-2 का छोटा आकार (FP16 में लगभग 5.4 GB) इसे व्यक्तिगत डेवलपर्स और शोधकर्ताओं के लिए सुलभ बनाता है, जो GPT-4 या Claude जैसे मॉडलों की संसाधन आवश्यकताओं के विपरीत है।

प्रभाव और विरासत

Phi-2 ने कुशल मशीन लर्निंग और छोटे मॉडल डिज़ाइन में बाद के शोध को प्रभावित किया। इसकी सफलता ने मात्रा पर डेटा गुणवत्ता के महत्व को उजागर किया, जो प्रचलित धारणा को चुनौती देता है कि पैमाना क्षमता का प्राथमिक चालक था। दृष्टिकोण ने गूगल डीपमाइंड और एंथ्रोपिक सहित अन्य संगठनों को अपने छोटे मॉडलों के लिए समान डेटा क्यूरेशन रणनीतियों का पता लगाने के लिए प्रेरित किया।

Microsoft के भीतर, Phi-2 Phi-3 परिवार के अग्रदूत के रूप में कार्य करता था, जिसने बड़े पैरामीटर गणनाओं (14B तक) और बेहतर प्रदर्शन के साथ समान सिद्धांतों का विस्तार किया। मॉडल ने AI के पर्यावरणीय प्रभाव के बारे में चर्चाओं में भी योगदान दिया, क्योंकि इसके प्रशिक्षण के लिए बड़े पैमाने के मॉडलों की तुलना में काफी कम कंप्यूट की आवश्यकता थी, जो स्थिरता लक्ष्यों के साथ संरेखित था। 2024 तक, Phi-2 मॉडल आकार, डेटा गुणवत्ता और तर्क क्षमता के बीच व्यापार-नापसंद का अध्ययन करने वाले शोधकर्ताओं के लिए एक संदर्भ बिंदु बना हुआ है।

सीमाएँ

अपनी ताकत के बावजूद, Phi-2 में ज्ञात सीमाएँ थीं। इसका ज्ञान कटऑफ 2023 के अंत में था, और यह वास्तविक समय की जानकारी तक पहुंच नहीं सकता था। मॉडल कभी-कभी प्रशंसनीय लेकिन गलत उत्तर उत्पन्न करता था, विशेष रूप से अपने प्रशिक्षण वितरण के बाहर के डोमेन में। इसकी 2048 टोकन की संदर्भ विंडो कई समकालीन मॉडलों की तुलना में छोटी थी, जो लंबे-दस्तावेज़ कार्यों के लिए इसके उपयोग को सीमित करती थी। इसके अतिरिक्त, जबकि यह तर्क में उत्कृष्ट था, यह रचनात्मक लेखन और सूक्ष्म तथ्यात्मक स्मरण के साथ संघर्ष करता था, जो इसके प्रशिक्षण डेटा के संकीर्ण फोकस को दर्शाता है।

Microsoft ने उपयोगकर्ताओं को Phi-2 को उत्पादन-तैयार प्रणाली के बजाय एक शोध कलाकृति के रूप में मानने की सलाह दी, विशिष्ट अनुप्रयोगों के लिए फाइन-ट्यूनिंग की सिफारिश की। मॉडल सुरक्षा के लिए संरेखित नहीं था, और यदि संकेत दिया जाए तो पक्षपाती या हानिकारक सामग्री उत्पन्न कर सकता था, जो उसके युग के मॉडलों के लिए एक सामान्य मुद्दा था।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·microsoft·transformer·reasoning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास