अंग्रेज़ी से अनुवादित

Llama बड़े भाषा मॉडलों का एक परिवार है जिसे Meta AI ने फरवरी 2023 से जारी किया, पहले संस्करण के वज़न मार्च 2023 में ऑनलाइन लीक हुए, जिसने एक ओपन-सोर्स पारिस्थितिकी तंत्र को बढ़ावा दिया।

Llama (शैलीबद्ध रूप में LLaMA, जिसमें "Large Language Model Meta AI" एक बैक्रोनिम के रूप में है) बड़े भाषा मॉडल (LLMs) का एक परिवार है, जिसे मेटा AI द्वारा विकसित किया गया है, और पहली बार फरवरी 2023 में जारी किया गया था। मॉडलों का आकार 1 बिलियन से 2 ट्रिलियन पैरामीटर तक होता है। प्रारंभ में, पहला संस्करण एक फाउंडेशन मॉडल था जो केवल शोधकर्ताओं के लिए गैर-वाणिज्यिक लाइसेंस के तहत उपलब्ध था, लेकिन Llama 2 से शुरू करके, मेटा ने फाउंडेशन मॉडल के साथ-साथ निर्देश-फाइन-ट्यून किए गए संस्करण जारी किए, जिनमें व्यापक लाइसेंसिंग थी। मार्च 2023 में बिटटोरेंट के माध्यम से पहले मॉडल के वजन का अनधिकृत रिसाव ओपन-सोर्स LLM व्युत्पन्नों और उपकरणों के प्रसार को काफी तेज कर दिया।

Llama मॉडल ट्रांसफॉर्मर आर्किटेक्चर पर आधारित हैं, जो अन्य समकालीन LLMs के समान है। उन्हें कई संस्करणों में जारी किया गया है, जिनमें से प्रत्येक पैमाने, प्रशिक्षण डेटा और क्षमताओं में सुधार लाता है। 2025 तक, नवीनतम संस्करण Llama 4 है, जो अप्रैल 2025 में जारी किया गया था, और मेटा ने Llama को अपने मेटा AI सहायक में भी एकीकृत किया है।

पृष्ठभूमि

GPT-3 जैसे पहले के बड़े भाषा मॉडलों के जारी होने के बाद, एक प्रमुख शोध फोकस मॉडलों को ऊपर-स्केल करना था, जिससे कुछ मामलों में उभरती क्षमताओं में महत्वपूर्ण लाभ हुए। 2022 के अंत में ChatGPT के लॉन्च और इसकी अप्रत्याशित सफलता ने LLMs पर सार्वजनिक और उद्योग का ध्यान नाटकीय रूप से बढ़ा दिया। प्रतिक्रिया में, मेटा के मुख्य AI वैज्ञानिक यान लेकुन ने टिप्पणी की कि बड़े भाषा मॉडल लेखन में सहायता के लिए सबसे उपयुक्त हैं, जो अन्य तकनीकी कंपनियों के आक्रामक तैनाती की तुलना में एक सतर्क रुख को दर्शाता है।

प्रारंभिक रिलीज़

Llama का पहला संस्करण (कभी-कभी Llama 1 के रूप में संदर्भित) 24 फरवरी, 2023 को एक ब्लॉग पोस्ट और एक पेपर के माध्यम से घोषित किया गया था, जिसमें इसके प्रशिक्षण, आर्किटेक्चर और प्रदर्शन का विवरण था। अनुमान कोड ओपन-सोर्स GPLv3 लाइसेंस के तहत जारी किया गया था, लेकिन मॉडल वजन तक पहुंच एक आवेदन प्रक्रिया के पीछे गेटेड थी, जिसमें शैक्षणिक शोधकर्ताओं, सरकार, नागरिक समाज और उद्योग अनुसंधान प्रयोगशालाओं को मामले-दर-मामले आधार पर पहुंच दी गई थी। मॉडल को विशेष रूप से सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित किया गया था, जिसमें विभिन्न हार्डवेयर क्षमताओं को समायोजित करने के लिए विभिन्न मॉडल आकार (7B, 13B, 33B, और 65B पैरामीटर) शामिल थे। यह केवल एक फाउंडेशन मॉडल था, हालांकि पेपर में निर्देश फाइन-ट्यूनिंग के उदाहरण शामिल थे।

मेटा ने बताया कि 13B पैरामीटर मॉडल ने अधिकांश NLP बेंचमार्क पर बहुत बड़े GPT-3 (175B पैरामीटर) को बेहतर प्रदर्शन किया, और सबसे बड़ा 65B मॉडल PaLM और Chinchilla जैसे अत्याधुनिक मॉडलों के साथ प्रतिस्पर्धी था।

रिसाव और उसके परिणाम

3 मार्च, 2023 को, Llama के वजन वाला एक टोरेंट अपलोड किया गया था, जिसका लिंक 4chan इमेजबोर्ड पर साझा किया गया था और बाद में ऑनलाइन AI समुदायों के माध्यम से फैल गया। उसी दिन, आधिकारिक Llama रिपॉजिटरी पर एक पुल रिक्वेस्ट ने दस्तावेज़ीकरण में मैग्नेट लिंक जोड़ने का अनुरोध किया। 4 मार्च को, एक और पुल रिक्वेस्ट ने मॉडल को होस्ट करने वाले HuggingFace रिपॉजिटरी के लिंक जोड़े। मेटा ने 6 मार्च को टेकडाउन अनुरोध दायर किए, जिसमें वितरण को अनधिकृत बताया गया, और HuggingFace ने अनुपालन किया। 20 मार्च को, मेटा ने एक मिरर से Llama डाउनलोड करने के लिए एक स्क्रिप्ट वाले रिपॉजिटरी के खिलाफ DMCA टेकडाउन दायर किया, और GitHub ने अगले दिन अनुपालन किया।

रिसाव पर प्रतिक्रियाएं मिश्रित थीं। कुछ ने अनुमान लगाया कि मॉडल का उपयोग दुर्भावनापूर्ण उद्देश्यों के लिए किया जा सकता है, जैसे अधिक परिष्कृत स्पैम। अन्य ने पहुंच का जश्न मनाया, यह देखते हुए कि छोटे संस्करण अपेक्षाकृत सस्ते में चल सकते हैं, संभावित रूप से आगे के शोध को बढ़ावा दे सकते हैं। साइमन विलिसन जैसे टिप्पणीकारों ने Llama की तुलना स्टेबल डिफ्यूजन से की, जो एक खुले तौर पर वितरित टेक्स्ट-टू-इमेज मॉडल है जिसने तेजी से उपकरण विकास को प्रेरित किया, और LLMs के लिए समान प्रभाव का सुझाव दिया।

Llama 2

18 जुलाई, 2023 को, माइक्रोसॉफ्ट के साथ साझेदारी में, मेटा ने अगली पीढ़ी के Llama 2 की घोषणा की, जिसमें 7B, 13B, और 70B पैरामीटर के मॉडल आकार थे। आर्किटेक्चर काफी हद तक Llama 1 से अपरिवर्तित रहा, लेकिन प्रशिक्षण में 40% अधिक डेटा का उपयोग किया गया। Llama 2 में फाउंडेशन और चैट फाइन-ट्यून दोनों मॉडल शामिल थे, और सभी वजन कई वाणिज्यिक उपयोगों के लिए जारी किए गए थे। हालांकि, क्योंकि लाइसेंस में एक स्वीकार्य उपयोग नीति शामिल है, इसे ओपन सोर्स इनिशिएटिव द्वारा ओपन सोर्स नहीं माना जाता है, और मेटा के शब्द के उपयोग पर विवाद हुआ है।

कोड Llama, कोड-विशिष्ट डेटासेट पर Llama 2 का एक फाइन-ट्यून, संस्करणों में जारी किया गया था: 24 अगस्त, 2023 को 7B, 13B, और 34B, और 29 जनवरी, 2024 को एक 70B संस्करण। फाउंडेशन मॉडल को कोड डेटा के अतिरिक्त 500B टोकन पर प्रशिक्षित किया गया था, फिर लंबे-संदर्भ डेटा के 20B टोकन, और 5B टोकन पर आगे निर्देश ट्यूनिंग की गई। एक पायथन-विशिष्ट मॉडल को पायथन कोड के 100B टोकन पर प्रशिक्षित किया गया था।

Llama 3

18 अप्रैल, 2024 को, मेटा ने Llama 3 को दो आकारों में जारी किया: 8B और 70B पैरामीटर। मॉडलों को सार्वजनिक रूप से उपलब्ध स्रोतों से लगभग 15 ट्रिलियन टोकन पर पूर्व-प्रशिक्षित किया गया था, जिसमें सार्वजनिक निर्देश डेटासेट और 10 मिलियन से अधिक मानव-एनोटेटेड उदाहरणों पर फाइन-ट्यून किए गए निर्देश मॉडल शामिल थे। मेटा के परीक्षण से पता चला कि Llama 3 70B ने अधिकांश बेंचमार्क पर Gemini Pro 1.5 और Claude 3 Sonnet से बेहतर प्रदर्शन किया। मेटा ने Llama 3 को बहुभाषी, मल्टीमॉडल, कोडिंग और तर्क में बेहतर बनाने और इसकी संदर्भ विंडो बढ़ाने की योजना की घोषणा की।

स्केलिंग कानूनों के संबंध में, Llama 3 मॉडलों ने अनुभवजन्य रूप से दिखाया कि प्रदर्शन चिंचिला-इष्टतम प्रशिक्षण डेटा की मात्रा से परे भी लॉग-रैखिक रूप से स्केल करना जारी रखता है। उदाहरण के लिए, Llama 3 8B के लिए चिंचिला-इष्टतम डेटासेट 200 बिलियन टोकन है, लेकिन प्रदर्शन 15 ट्रिलियन टोकन (75 गुना अधिक) तक सुधरा। एक साक्षात्कार में, मार्क जुकरबर्ग ने नोट किया कि 8B संस्करण लगभग सबसे बड़े Llama 2 जितना शक्तिशाली था, और 70B मॉडल अभी भी प्रशिक्षण के अंत में सीख रहा था, जिसे GPU संसाधनों को कहीं और आवंटित करने के लिए रोक दिया गया था।

Llama 3.1 23 जुलाई, 2024 को जारी किया गया था, जिसमें एक 405B पैरामीटर मॉडल पेश किया गया था, साथ ही अद्यतन 8B और 70B संस्करण, 128K टोकन की लंबी संदर्भ विंडो और बेहतर बहुभाषी समर्थन के साथ।

Llama 4 और उससे आगे

Llama 4 अप्रैल 2025 में जारी किया गया था, जिसमें 2 ट्रिलियन पैरामीटर तक के आकार के साथ एक मिश्रण-ऑफ-एक्सपर्ट्स आर्किटेक्चर शामिल था। इसने मल्टीमॉडल क्षमताओं और बेहतर तर्क पेश किया। अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने Llama के प्रतिस्थापन के रूप में Muse Spark जारी किया, जो मेटा की AI रणनीति में बदलाव का संकेत देता है।

प्रभाव और पारिस्थितिकी तंत्र

Llama 1 वजन के रिसाव ने एक जीवंत ओपन-सोर्स पारिस्थितिकी तंत्र को उत्प्रेरित किया, जिसमें कई फाइन-ट्यून और व्युत्पन्न उभरे। इसने शोधकर्ताओं और शौकीनों को API लागत के बिना LLMs के साथ प्रयोग करने में सक्षम बनाया, जिससे क्वांटाइजेशन, कुशल अनुमान और स्थानीय तैनाती में नवाचार हुए। 7B और 13B जैसे छोटे मॉडलों की उपलब्धता ने उपभोक्ता हार्डवेयर पर LLMs चलाना संभव बना दिया, जिससे पहुंच का लोकतंत्रीकरण हुआ। यह ओपनएआई और एंथ्रोपिक जैसी अन्य प्रमुख प्रयोगशालाओं के बंद दृष्टिकोणों के विपरीत था, और अन्य संगठनों के बाद के रिलीज़ को प्रभावित किया। लाइसेंसिंग पर विवाद ने ओपन-सोर्स आदर्शों और कॉर्पोरेट नियंत्रण के बीच तनाव को भी उजागर किया, एक बहस जो AI समुदाय में जारी है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·meta-ai·open-source-software·ai-leak
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास