अंग्रेज़ी से अनुवादित

मेटा ने 18 अप्रैल, 2024 को लामा 3 जारी किया, जो ओपन-वेट बड़े भाषा मॉडलों का एक परिवार है, जिसमें 8B और 70B पैरामीटर आकार शामिल हैं, और इसे 15 ट्रिलियन टोकन पर प्रशिक्षित किया गया। इसने बेंचमार्क पर कई वाणिज्यिक प्रतिद्वंद्वियों को पीछे छोड़ दिया और चिंचिला-इष्टतम डेटा से परे स्केलिंग कानूनों की ओर बदलाव को चिह्नित किया।

मेटा ने 18 अप्रैल 2024 को अपनी चल रही लामा श्रृंखला के हिस्से के रूप में बड़े भाषा मॉडल (LLMs) का एक परिवार, लामा 3 जारी किया। इस रिलीज़ में दो मॉडल आकार शामिल थे: 8 बिलियन और 70 बिलियन पैरामीटर, दोनों को सार्वजनिक रूप से उपलब्ध स्रोतों से लगभग 15 ट्रिलियन टोकन पाठ पर पूर्व-प्रशिक्षित किया गया था। निर्देश-ट्यून किए गए वेरिएंट को सार्वजनिक निर्देश डेटासेट और 10 मिलियन से अधिक मानव-एनोटेटेड उदाहरणों पर फाइन-ट्यून किया गया था। मेटा ने लामा 3 को ओपन-वेट AI में एक महत्वपूर्ण कदम के रूप में स्थापित किया, जिसमें 70B मॉडल ने रिलीज़ के समय कई वाणिज्यिक प्रतिद्वंद्वियों को मानक बेंचमार्क पर पीछे छोड़ दिया।

लामा श्रृंखला फरवरी 2023 में लामा 1 के साथ शुरू हुई, जिसे शुरू में केवल शोधकर्ताओं के लिए गैर-वाणिज्यिक लाइसेंस के तहत जारी किया गया था। मार्च 2023 में बिटटोरेंट के माध्यम से अनधिकृत लीक के बाद, मेटा ने जुलाई 2023 में लामा 2 के साथ रणनीति बदली, जिसमें कस्टम लाइसेंस के तहत व्यापक वाणिज्यिक उपयोग के लिए वेट पेश किए गए। लामा 3 ने इस प्रक्षेपवक्र को जारी रखा, पहुंच और प्रदर्शन पर जोर दिया। यह रिलीज़ मेटा AI के साथ मेल खाती है, जो लामा पर निर्मित एक सहायक है, जो एक समर्पित वेबसाइट के माध्यम से उपलब्ध है और फेसबुक और व्हाट्सएप में एकीकृत है।

मॉडल आर्किटेक्चर और प्रशिक्षण

लामा 3 मॉडल पिछले संस्करणों की तुलना में सुधारों के साथ एक मानक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करते हैं। 8B और 70B मॉडल को 15 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, जो 8B आकार (200 बिलियन टोकन) के लिए चिंचिला-इष्टतम मात्रा से 75 गुना बड़ा डेटासेट है। इष्टतम डेटा बिंदु से अधिक होने के बावजूद, प्रदर्शन लॉग-रैखिक रूप से स्केल करना जारी रखा, जिसने पारंपरिक स्केलिंग कानूनों को चुनौती दी। मेटा ने बताया कि 70B मॉडल प्रशिक्षण के अंत में अभी भी सुधार कर रहा था, लेकिन टीम ने GPU संसाधनों को कहीं और आवंटित करने के लिए रोकने का विकल्प चुना।

प्रशिक्षण डेटा सार्वजनिक रूप से उपलब्ध स्रोतों से क्यूरेट किया गया था, जिसमें गुणवत्ता और विविधता पर जोर दिया गया था। निर्देश फाइन-ट्यूनिंग ने सार्वजनिक डेटासेट और मानव-एनोटेटेड उदाहरणों के संयोजन का उपयोग किया, जिससे जटिल निर्देशों का पालन करने की मॉडल की क्षमता बढ़ी। मेटा ने भविष्य के संस्करणों को बहुभाषी, मल्टीमॉडल और कोडिंग और तर्क में बेहतर बनाने की योजना भी घोषित की, जिसमें बढ़ा हुआ संदर्भ विंडो शामिल है।

प्रदर्शन और बेंचमार्क

अप्रैल 2024 में, मेटा के आंतरिक परीक्षण से पता चला कि लामा 3 70B ने अधिकांश बेंचमार्क पर जेमिनी प्रो 1.5 और क्लाउड 3 सोनेट को पीछे छोड़ दिया, जिसमें तर्क, कोडिंग और सामान्य ज्ञान कार्य शामिल हैं। मार्क जुकरबर्ग ने बताया कि 8B मॉडल लगभग सबसे बड़े लामा 2 मॉडल (70B) जितना शक्तिशाली था, जो महत्वपूर्ण दक्षता लाभ प्रदर्शित करता है। इन परिणामों ने लामा 3 को OpenAI, Anthropic, और Google DeepMind जैसी कंपनियों के मालिकाना मॉडल के लिए एक प्रतिस्पर्धी विकल्प के रूप में स्थापित किया।

मॉडलों का मूल्यांकन मानक NLP बेंचमार्क पर किया गया, जिसमें 70B वेरिएंट ने उस समय ओपन-वेट मॉडल के बीच अत्याधुनिक परिणाम प्राप्त किए। देखा गया स्केलिंग व्यवहार - चिंचिला-इष्टतम डेटा से परे निरंतर सुधार - ने सुझाव दिया कि बड़े डेटासेट आगे लाभ दे सकते हैं, जिसने Machine learning और Deep learning में बाद के शोध को प्रभावित किया।

रिलीज़ और पारिस्थितिकी तंत्र

लामा 3 को एक कस्टम लाइसेंस के तहत जारी किया गया था जो वाणिज्यिक उपयोग की अनुमति देता है, हालांकि एक स्वीकार्य उपयोग नीति के साथ जो कुछ अनुप्रयोगों को प्रतिबंधित करती थी, जिससे यह बहस हुई कि क्या यह ओपन सोर्स के रूप में योग्य है। वेट डाउनलोड के लिए उपलब्ध कराए गए थे, और मॉडल को Amazon Web Services, Microsoft Azure, Google Cloud, और Oracle Cloud Infrastructure सहित विभिन्न प्लेटफार्मों में एकीकृत किया गया था। Groq और SambaNova जैसे विशेष हार्डवेयर प्रदाताओं ने लामा 3 के लिए अनुमान को अनुकूलित किया, जिससे तेजी से तैनाती संभव हुई।

रिलीज़ ने लामा 2 के आसपास उभरे पारिस्थितिकी तंत्र के समान, फाइन-ट्यून किए गए वेरिएंट और टूल्स की एक लहर को प्रेरित किया। डेवलपर्स ने विशिष्ट डोमेन के लिए मॉडल को अनुकूलित करने के लिए Reinforcement Learning from AI Feedback (RLAIF) और Curriculum Learning जैसी तकनीकों का उपयोग किया। ओपन-वेट दृष्टिकोण प्रतिस्पर्धियों के बंद मॉडल के विपरीत था, जिसने Generative AI अनुप्रयोगों में नवाचार को बढ़ावा दिया।

बाद के विकास

लामा 3.1 23 जुलाई 2024 को जारी किया गया था, जिसमें 405B पैरामीटर मॉडल पेश किया गया और संदर्भ विंडो का विस्तार किया गया। इस संस्करण ने AI परिदृश्य में लामा की स्थिति को और मजबूत किया। श्रृंखला अप्रैल 2025 में लामा 4 के साथ जारी रही, और अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने प्रतिस्थापन के रूप में म्यूज़ स्पार्क जारी किया। लामा के विकास ने व्यापक क्षेत्र को प्रभावित किया, शोधकर्ताओं ने स्केलिंग कानूनों और प्रशिक्षण दक्षता का अध्ययन किया, जैसा कि Transformer (architecture) आर्किटेक्चर और Loss Functions पर काम में देखा गया।

रिलीज़ ने बड़े पैमाने पर कंप्यूट की भूमिका को भी उजागर किया, मेटा ने मॉडल को कुशलतापूर्वक प्रशिक्षित करने के लिए AMD, Intel, और TSMC जैसे चिप निर्माताओं के साथ साझेदारी का लाभ उठाया। लामा 3 की सफलता ने Artificial intelligence के भविष्य और खुले और मालिकाना विकास के बीच संतुलन के बारे में चर्चाओं में योगदान दिया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·meta-ai·artificial-intelligence·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास