अंग्रेज़ी से अनुवादित

मेटा ने 18 अप्रैल, 2024 को लामा 3 जारी किया, जो एक ओपन-वेट लार्ज लैंग्वेज मॉडल परिवार है, जिसमें 8B और 70B पैरामीटर संस्करण शामिल थे, जिन्हें बाद में 405B मॉडल तक विस्तारित किया गया।

मेटा लामा 3 बड़े भाषा मॉडलों का एक परिवार है जिसे मेटा एआई द्वारा 18 अप्रैल 2024 को जारी किया गया था। प्रारंभिक रिलीज़ में दो मॉडल आकार शामिल थे: 8 बिलियन और 70 बिलियन पैरामीटर, दोनों फाउंडेशन और इंस्ट्रक्शन-ट्यून किए गए वेरिएंट के रूप में उपलब्ध थे। लामा 3 अपने लगभग 15 ट्रिलियन टोकन सार्वजनिक रूप से उपलब्ध पाठ के बड़े पैमाने पर प्रीट्रेनिंग और समकालीन मालिकाना मॉडलों के खिलाफ अपने प्रतिस्पर्धी प्रदर्शन के लिए उल्लेखनीय था। एक बाद का संस्करण, लामा 3.1, ने परिवार का विस्तार करते हुए 405-बिलियन-पैरामीटर मॉडल शामिल किया, जो 23 जुलाई 2024 को जारी किया गया था। लामा 3 श्रृंखला ने मेटा की खुले-वजन एआई विकास की रणनीति में एक महत्वपूर्ण कदम का प्रतिनिधित्व किया, जो पहले के लामा 1 और लामा 2 रिलीज़ पर आधारित थी।

लामा 3 मॉडल व्यापक रूप से सुलभ होने के लिए डिज़ाइन किए गए थे, जिनके वजन एक सामुदायिक लाइसेंस के तहत जारी किए गए थे जो वाणिज्यिक उपयोग की अनुमति देता था, जो मूल लामा के अधिक प्रतिबंधात्मक लाइसेंसिंग से एक बदलाव था। रिलीज़ के साथ मेटा एआई का रोलआउट भी हुआ, जो फेसबुक और व्हाट्सएप में एकीकृत एक सहायक था, जो मॉडलों के व्यावहारिक अनुप्रयोग को प्रदर्शित करता था। मॉडलों को एक विविध डेटासेट पर प्रशिक्षित किया गया था और तर्क, कोडिंग और सामान्य ज्ञान में बेंचमार्क पर मजबूत प्रदर्शन दिखाया, जिससे वे OpenAI, Anthropic, और Google DeepMind के मॉडलों के लिए एक प्रतिस्पर्धी विकल्प के रूप में स्थापित हुए।

पृष्ठभूमि और संदर्भ

लामा 3 का विकास Large language model अनुसंधान में तेजी से प्रगति की पृष्ठभूमि में हुआ, जो 2022 के अंत में चैटजीपीटी की सफलता से उत्प्रेरित था। OpenAI के GPT-3 की रिलीज़ और उसके बाद चैटजीपीटी की लोकप्रियता के बाद, क्षेत्र में मॉडलों को बड़ा करने के प्रयासों में वृद्धि देखी गई, जिनमें से कुछ ने तर्क और निर्देश पालन में उभरती क्षमताओं का प्रदर्शन किया। मेटा की प्रारंभिक प्रतिक्रिया, लामा 1, फरवरी 2023 में एक शोध-केंद्रित मॉडल के रूप में जारी की गई थी, जिसके वजन केवल अनुमोदित शैक्षणिक शोधकर्ताओं के लिए उपलब्ध थे। मार्च 2023 में मॉडल का लीक, जो बिटटोरेंट के माध्यम से फैला, ने खुले एक्सेस की मांग को उजागर किया और एआई विकास में खुले मॉडलों की भूमिका के बारे में व्यापक चर्चा को जन्म दिया।

लामा 2, जुलाई 2023 में माइक्रोसॉफ्ट के साथ साझेदारी में जारी किया गया, अधिक खुले एक्सेस की ओर एक बदलाव का संकेत था, जो अनुमत लाइसेंस के तहत वाणिज्यिक उपयोग की अनुमति देता था। इसने लामा 3 के लिए मंच तैयार किया, जिसका उद्देश्य पैमाने और क्षमता के मामले में खुले-वजन मॉडलों की सीमाओं को आगे बढ़ाना था। लामा 3 की रिलीज़ ऐसे समय में भी आई जब Generative AI मुख्यधारा का फोकस बन रहा था, जिसमें क्लाउड प्रदाताओं और हार्डवेयर कंपनियों से बड़े निवेश हो रहे थे।

मॉडल आर्किटेक्चर और प्रशिक्षण

लामा 3 मॉडल Transformer (architecture) आर्किटेक्चर पर आधारित हैं, जो आधुनिक बड़े भाषा मॉडलों के लिए प्रमुख डिज़ाइन है। आर्किटेक्चर में पिछले लामा संस्करणों पर सुधार शामिल हैं, जिसमें एक बड़ा शब्दावली आकार (128,256 टोकन) और 8,192 टोकन की बढ़ी हुई संदर्भ लंबाई शामिल है, जिसे बाद के अपडेट में और बढ़ाया गया। मॉडल Multi-Head Attention और Positional Encoding के साथ एक मानक डिकोडर-ओनली डिज़ाइन का उपयोग करते हैं, और उन्हें अगले-टोकन भविष्यवाणी उद्देश्य का उपयोग करके प्रशिक्षित किया गया था।

लामा 3 के प्रशिक्षण की एक प्रमुख विशेषता डेटा का पैमाना था। मॉडलों को सार्वजनिक रूप से उपलब्ध स्रोतों से लगभग 15 ट्रिलियन टोकन पाठ पर प्रीट्रेन किया गया था, जो लामा 2 के लिए उपयोग किए गए 2 ट्रिलियन टोकन से काफी अधिक था। प्रशिक्षण डेटा को उच्च-गुणवत्ता वाले स्रोतों पर जोर देने के लिए क्यूरेट किया गया था, जिसमें वेब पेज, किताबें और वैज्ञानिक लेख शामिल थे, जिसमें बहुभाषी और कोड सामग्री पर ध्यान केंद्रित किया गया था। इंस्ट्रक्शन-ट्यून किए गए संस्करणों को सार्वजनिक रूप से उपलब्ध इंस्ट्रक्शन डेटासेट और 10 मिलियन से अधिक मानव-एनोटेट उदाहरणों पर आगे फाइन-ट्यून किया गया था, जिसमें Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखना) और पर्यवेक्षित फाइन-ट्यूनिंग जैसी तकनीकों का उपयोग किया गया था।

स्केलिंग कानूनों के संबंध में, लामा 3 टीम ने देखा कि प्रदर्शन चिंचिला-इष्टतम टोकन संख्या से काफी आगे प्रशिक्षण देने पर भी लॉग-रैखिक रूप से सुधार जारी रहा। 8B मॉडल के लिए, चिंचिला-इष्टतम डेटासेट आकार लगभग 200 बिलियन टोकन अनुमानित किया गया था, लेकिन मॉडल को पूरे 15 ट्रिलियन टोकन पर प्रशिक्षण से लाभ मिलता रहा, जो दर्शाता है कि बड़े डेटासेट पारंपरिक सिफारिशों से परे लाभ दे सकते हैं।

प्रदर्शन और बेंचमार्क

अप्रैल 2024 में मेटा के आंतरिक मूल्यांकन में, लामा 3 70B मॉडल ने कई प्रमुख मालिकाना मॉडलों को कई बेंचमार्क पर पीछे छोड़ दिया। विशेष रूप से, यह Google DeepMind के जेमिनी प्रो 1.5 और Anthropic के क्लॉड 3 सोनेट को अधिकांश मानक एनएलपी कार्यों में पार कर गया, जिसमें तर्क, कोडिंग और सामान्य ज्ञान शामिल हैं। 8B मॉडल, हालांकि छोटा था, मेटा सीईओ मार्क जुकरबर्ग द्वारा लगभग सबसे बड़े लामा 2 मॉडल (70B) जितना शक्तिशाली बताया गया था, जो बड़े प्रशिक्षण डेटासेट से दक्षता लाभ प्रदर्शित करता था।

मॉडलों ने कोड जनरेशन और गणितीय तर्क में विशेष रूप से मजबूत प्रदर्शन दिखाया, जो व्यावहारिक अनुप्रयोगों के लिए महत्वपूर्ण क्षेत्र हैं। 405B मॉडल, जो बाद में लामा 3.1 के हिस्से के रूप में जारी किया गया, ने इन परिणामों में और सुधार किया, कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया, जो GPT-4 और क्लॉड 3.5 सोनेट जैसे मॉडलों के बराबर था।

रिलीज़ और उपलब्धता

18 अप्रैल 2024 को प्रारंभिक लामा 3 रिलीज़ में 8B और 70B मॉडल शामिल थे, जिनमें बेस और इंस्ट्रक्शन-ट्यून दोनों संस्करण थे। मॉडल मेटा की वेबसाइट और Hugging Face जैसे साझेदार प्लेटफार्मों के माध्यम से डाउनलोड के लिए उपलब्ध कराए गए थे। वजन लामा 3 सामुदायिक लाइसेंस के तहत जारी किए गए थे, जो वाणिज्यिक उपयोग की अनुमति देता है लेकिन एक स्वीकार्य उपयोग नीति शामिल करता है जो कुछ अनुप्रयोगों को प्रतिबंधित करता है, जैसे सैन्य उपयोग या हानिकारक सामग्री उत्पन्न करना। यह लाइसेंस ओपन-सोर्स-इनिशिएटिव द्वारा ओपन सोर्स नहीं माना जाता है, लेकिन यह कई मालिकाना मॉडलों की तुलना में अनुमत है।

मेटा ने लामा 3 को अपने एआई सहायक, मेटा एआई में भी एकीकृत किया, जो फेसबुक, व्हाट्सएप और एक समर्पित वेबसाइट पर उपलब्ध हो गया। इस एकीकरण ने उपयोगकर्ताओं को सीधे मॉडलों के साथ बातचीत करने की अनुमति दी, जिससे चैट, लेखन और कोडिंग कार्यों में उनकी क्षमताओं का प्रदर्शन हुआ। रिलीज़ के साथ क्लाउड प्रदाताओं के साथ साझेदारी भी हुई, जिसमें Amazon Web Services, Microsoft Azure, Google Cloud, और Oracle Cloud Infrastructure शामिल थे, जिससे मॉडल प्रबंधित सेवाओं के माध्यम से सुलभ हो गए।

पारिस्थितिकी तंत्र और हार्डवेयर समर्थन

लामा 3 की खुली-वजन प्रकृति ने एआई पारिस्थितिकी तंत्र में तेजी से अपनाने की सुविधा प्रदान की। हार्डवेयर विक्रेताओं ने लामा 3 इन्फ्रेंस के लिए अपने प्लेटफार्मों को अनुकूलित किया, जिसमें AMD, Intel, और NVIDIA शामिल हैं। विशेष एआई चिप कंपनियों जैसे Groq और SambaNova ने उच्च गति इन्फ्रेंस समाधान प्रदान किए, जबकि Qualcomm और Arm Holdings ने एज तैनाती पर ध्यान केंद्रित किया। क्लाउड प्रदाताओं ने पूर्व-कॉन्फ़िगर वातावरण प्रदान किए, और AWS Trainium और अन्य कस्टम सिलिकॉन का उपयोग फाइन-ट्यूनिंग और प्रशिक्षण के लिए किया गया।

मॉडलों को विभिन्न सॉफ्टवेयर फ्रेमवर्क और टूल्स में भी एकीकृत किया गया, जिससे डेवलपर्स न्यूनतम प्रयास के साथ एप्लिकेशन बना सकें। कई मॉडल आकारों की उपलब्धता ने एज डिवाइस से लेकर डेटा सेंटर तक विभिन्न हार्डवेयर पर तैनाती की अनुमति दी, जिससे लामा 3 अनुसंधान और उत्पादन दोनों के लिए एक बहुमुखी विकल्प बन गया।

प्रभाव और स्वागत

लामा 3 की रिलीज़ को एआई समुदाय से महत्वपूर्ण रुचि के साथ मिला, कई लोगों ने मॉडलों के प्रदर्शन और वजन की खुलेपन की प्रशंसा की। इसे OpenAI और Anthropic के बंद दृष्टिकोणों के प्रतिकूल के रूप में देखा गया, जो शोधकर्ताओं और डेवलपर्स के लिए एक विकल्प प्रदान करता था जो पारदर्शिता और नियंत्रण पसंद करते थे। बेंचमार्क पर मॉडलों के मजबूत प्रदर्शन ने खुले-वजन मॉडलों के लिए मानक भी बढ़ाया, जिससे अन्य संगठनों को अपने विकास प्रयासों में तेजी लाने के लिए प्रेरित किया।

हालांकि, रिलीज़ ने खुले मॉडलों के संभावित दुरुपयोग के बारे में चर्चा भी शुरू की, जिसमें गलत सूचना, स्पैम और अन्य दुर्भावनापूर्ण उपयोगों के बारे में चिंताएं शामिल थीं। मेटा का एक स्वीकार्य उपयोग नीति शामिल करने का निर्णय इन जोखिमों को कम करने का एक प्रयास था, लेकिन आलोचकों ने तर्क दिया कि वजन सार्वजनिक रूप से उपलब्ध होने के बाद ऐसी नीतियों को लागू करना मुश्किल है। यह बहस लामा 1 के लीक के बाद की पहले की चर्चाओं को प्रतिध्वनित करती थी।

भविष्य के विकास

प्रारंभिक रिलीज़ के बाद, मेटा ने लामा 3 परिवार पर पुनरावृत्ति जारी रखी। लामा 3.1, 23 जुलाई 2024 को जारी, ने 405B मॉडल पेश किया और संदर्भ लंबाई को 128,000 टोकन तक बढ़ाया, जिससे लंबे-रूप तर्क और दस्तावेज़ प्रसंस्करण सक्षम हुआ। 405B मॉडल को दक्षता में सुधार के लिए डेटा प्रूनिंग और Model Pruning तकनीकों के संयोजन का उपयोग करके प्रशिक्षित किया गया था। मेटा ने लामा 3 को बहुभाषी और मल्टीमॉडल बनाने की योजना भी घोषित की, जिसमें छवि और वीडियो समझ के साथ-साथ बेहतर कोडिंग और तर्क क्षमताओं का समर्थन शामिल था।

अप्रैल 2025 में, मेटा ने लामा 4 जारी किया, जो परिवार की अगली पीढ़ी थी, जिसने मॉडल आकारों का और विस्तार किया और मिश्रण-ऑफ-एक्सपर्ट्स आर्किटेक्चर पेश किया। आगे देखते हुए, मेटा सुपरइंटेलिजेंस लैब्स ने अप्रैल 2026 में लामा के प्रतिस्थापन के रूप में म्यूज़ स्पार्क जारी किया, जो कंपनी की एआई रणनीति में एक बदलाव का संकेत देता है। इसके बावजूद, लामा 3 खुले बड़े भाषा मॉडलों के विकास में एक महत्वपूर्ण मील का पत्थर बना हुआ है, जो क्षेत्र में बाद के अनुसंधान और विकास को प्रभावित करता है।

निष्कर्ष

मेटा लामा 3 ने खुले-वजन बड़े भाषा मॉडलों में एक प्रमुख प्रगति का प्रतिनिधित्व किया, जो बड़े पैमाने पर प्रशिक्षण को प्रतिस्पर्धी प्रदर्शन और व्यापक पहुंच के साथ जोड़ता था। इसकी रिलीज़ ने अनुसंधान और उद्योग दोनों में खुले मॉडलों को अपनाने को उत्प्रेरित किया, और इसका प्रभाव Artificial intelligence प्रौद्योगिकियों के चल रहे विकास में महसूस किया जा रहा है। मॉडलों की सफलता ने एक क्षेत्र में खुले दृष्टिकोणों की व्यवहार्यता को रेखांकित किया जो अक्सर मालिकाना प्रणालियों द्वारा हावी होता है, और इसने भविष्य की रिलीज़ के लिए एक मिसाल स्थापित की।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·meta-ai·open-weight·ai-release
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास