अंग्रेज़ी से अनुवादित

LLaMA (Large Language Model Meta AI) मेटा एआई द्वारा फरवरी 2023 से जारी बड़े भाषा मॉडलों का एक परिवार है, जिसमें 1 बिलियन से 2 ट्रिलियन पैरामीटर तक के मॉडल शामिल हैं, जिनके संस्करणों में Llama 1, 2, 3 और 4 शामिल हैं।

LLaMA (Large Language Model Meta AI, एक बैक्रोनिम के रूप में कार्य करता है) बड़े भाषा मॉडल (LLMs) का एक परिवार है जिसे Meta AI द्वारा फरवरी 2023 से जारी किया गया। ये मॉडल विभिन्न आकारों में आते हैं, जो 1 बिलियन से 2 ट्रिलियन पैरामीटर तक होते हैं। प्रारंभ में एक फाउंडेशन मॉडल के रूप में जारी, Llama 2 से शुरू करके, Meta AI ने फाउंडेशन मॉडल के साथ-साथ निर्देश-फाइन-ट्यून किए गए संस्करण भी जारी किए। नवीनतम संस्करण Llama 4 है, जो अप्रैल 2025 में जारी हुआ। अप्रैल 2026 में, Meta Superintelligence Labs ने Llama के प्रतिस्थापन के रूप में Muse Spark जारी किया।

पृष्ठभूमि

GPT-3 जैसे बड़े भाषा मॉडल के जारी होने के बाद, शोध का ध्यान मॉडलों को बड़ा करने पर केंद्रित था, जिसमें कुछ मामलों में उभरती क्षमताओं में बड़ी वृद्धि देखी गई। ChatGPT का जारी होना और इसकी आश्चर्यजनक सफलता ने बड़े भाषा मॉडलों पर ध्यान बढ़ाया। ChatGPT के अन्य प्रतिक्रियाओं की तुलना में, Meta के मुख्य AI वैज्ञानिक Yann LeCun ने कहा कि बड़े भाषा मॉडल लेखन में सहायता के लिए सबसे उपयुक्त हैं।

संस्करण

प्रारंभिक रिलीज़

Llama का पहला संस्करण (शैलीबद्ध रूप से LLaMA और कभी-कभी Llama 1 के रूप में संदर्भित) 24 फरवरी, 2023 को एक ब्लॉग पोस्ट और एक पेपर के माध्यम से घोषित किया गया था, जिसमें मॉडल के प्रशिक्षण, वास्तुकला और प्रदर्शन का वर्णन था। मॉडल को चलाने के लिए उपयोग किया जाने वाला इन्फ्रेंस कोड ओपन-सोर्स GPLv3 लाइसेंस के तहत सार्वजनिक रूप से जारी किया गया था। मॉडल के वेट तक पहुंच एक आवेदन प्रक्रिया द्वारा प्रबंधित की गई थी, जिसमें पहुंच "मामले-दर-मामले आधार पर शैक्षणिक शोधकर्ताओं; सरकार, नागरिक समाज और शिक्षा जगत के संगठनों से जुड़े लोगों; और दुनिया भर की उद्योग अनुसंधान प्रयोगशालाओं" को दी जानी थी।

Llama को केवल सार्वजनिक रूप से उपलब्ध जानकारी पर प्रशिक्षित किया गया था, और इसे विभिन्न मॉडल आकारों में प्रशिक्षित किया गया था, जिसका उद्देश्य इसे विभिन्न हार्डवेयर के लिए अधिक सुलभ बनाना था। मॉडल विशेष रूप से एक फाउंडेशन मॉडल था, हालांकि पेपर में मॉडल के निर्देश-फाइन-ट्यून किए गए संस्करणों के उदाहरण शामिल थे। Meta AI ने बताया कि 13B पैरामीटर मॉडल का प्रदर्शन अधिकांश NLP बेंचमार्क पर बहुत बड़े GPT-3 (175B पैरामीटर के साथ) से बेहतर था, और सबसे बड़ा 65B मॉडल PaLM और Chinchilla जैसे अत्याधुनिक मॉडलों के साथ प्रतिस्पर्धी था।

#### लीक

3 मार्च, 2023 को, Llama के वेट युक्त एक टोरेंट अपलोड किया गया था, जिसका लिंक 4chan इमेजबोर्ड पर साझा किया गया और बाद में ऑनलाइन AI समुदायों में फैल गया। उसी दिन, मुख्य Llama रिपॉजिटरी पर एक पुल रिक्वेस्ट खोली गई, जिसमें आधिकारिक दस्तावेज़ीकरण में मैग्नेट लिंक जोड़ने का अनुरोध किया गया। 4 मार्च को, मॉडल वाले HuggingFace रिपॉजिटरी के लिंक जोड़ने के लिए एक पुल रिक्वेस्ट खोली गई। 6 मार्च को, Meta ने पुल रिक्वेस्ट में लिंक किए गए HuggingFace रिपॉजिटरी को हटाने के लिए तकनीकी अनुरोध दायर किए, इसे मॉडल का "अनधिकृत वितरण" बताते हुए। HuggingFace ने अनुरोधों का अनुपालन किया। 20 मार्च को, Meta ने एक मिरर से Llama डाउनलोड करने वाली स्क्रिप्ट वाले रिपॉजिटरी के खिलाफ कॉपीराइट उल्लंघन के लिए DMCA तकनीकी अनुरोध दायर किया, और GitHub ने अगले दिन अनुपालन किया।

लीक पर प्रतिक्रियाएं भिन्न थीं। कुछ ने अनुमान लगाया कि मॉडल का उपयोग दुर्भावनापूर्ण उद्देश्यों के लिए किया जाएगा, जैसे अधिक परिष्कृत स्पैम। कुछ ने मॉडल की पहुंच का जश्न मनाया, साथ ही इस तथ्य का भी कि मॉडल के छोटे संस्करण अपेक्षाकृत सस्ते में चलाए जा सकते हैं, यह सुझाव देते हुए कि यह अतिरिक्त शोध विकास के विकास को बढ़ावा देगा। Simon Willison जैसे कई टिप्पणीकारों ने Llama की तुलना Stable Diffusion से की, जो एक टेक्स्ट-टू-इमेज मॉडल है, जो अपने पहले के तुलनीय परिष्कृत मॉडलों के विपरीत, खुले तौर पर वितरित किया गया था, जिससे संबंधित उपकरणों, तकनीकों और सॉफ्टवेयर का तेजी से प्रसार हुआ।

Llama 2

18 जुलाई, 2023 को, Microsoft के साथ साझेदारी में, Meta ने Llama 2 (शैलीबद्ध रूप से LLaMa 2) की घोषणा की, जो Llama की अगली पीढ़ी है। Meta ने Llama 2 को तीन मॉडल आकारों में प्रशिक्षित और जारी किया: 7, 13, और 70 बिलियन पैरामीटर। मॉडल वास्तुकला काफी हद तक Llama 1 मॉडल के समान बनी हुई है, लेकिन फाउंडेशन मॉडल को प्रशिक्षित करने के लिए 40% अधिक डेटा का उपयोग किया गया था।

Llama 2 में फाउंडेशन मॉडल और चैट के लिए फाइन-ट्यून किए गए मॉडल शामिल हैं। मूल Llama संस्करण से एक और अंतर में, सभी मॉडल वेट के साथ जारी किए गए हैं और कई व्यावसायिक उपयोग मामलों के लिए उपयोग किए जा सकते हैं। क्योंकि Llama का लाइसेंस एक स्वीकार्य उपयोग नीति लागू करता है जो Llama को कुछ उद्देश्यों के लिए उपयोग करने से रोकता है, यह ओपन सोर्स नहीं है। Llama का वर्णन करने के लिए Meta द्वारा ओपन-सोर्स शब्द के उपयोग पर Open Source Initiative (जो The Open Source Definition बनाए रखता है) और अन्य लोगों द्वारा विवाद किया गया है।

Code Llama, Llama 2 का कोड-विशिष्ट डेटासेट के साथ एक फाइन-ट्यून है। 7B, 13B, और 34B संस्करण 24 अगस्त, 2023 को जारी किए गए थे, और 70B संस्करण 29 जनवरी, 2024 को जारी किया गया था। Llama 2 के फाउंडेशन मॉडल से शुरू करके, Meta AI कोड डेटासेट के अतिरिक्त 500B टोकन प्रशिक्षित करेगा, फिर लंबे-संदर्भ डेटा के अतिरिक्त 20B टोकन, जिससे Code Llama फाउंडेशन मॉडल बनेंगे। इस फाउंडेशन मॉडल को निर्देश-फाइन-ट्यून बनाने के लिए 5B निर्देश-अनुसरण टोकन पर आगे प्रशिक्षित किया गया था। Python कोड के लिए एक और फाउंडेशन मॉडल बनाया गया था, जिसे लंबे-संदर्भ डेटा से पहले केवल Python कोड के 100B टोकन पर प्रशिक्षित किया गया था।

Llama 3

18 अप्रैल, 2024 को, Meta ने Llama 3 को दो आकारों में जारी किया: 8B और 70B पैरामीटर। मॉडलों को "सार्वजनिक रूप से उपलब्ध स्रोतों" से एकत्रित लगभग 15 ट्रिलियन टोकन टेक्स्ट पर पूर्व-प्रशिक्षित किया गया है, जिसमें निर्देश मॉडल "सार्वजनिक रूप से उपलब्ध निर्देश डेटासेट, साथ ही 10M से अधिक मानव-एनोटेटेड उदाहरणों" पर फाइन-ट्यून किए गए हैं। Meta AI के परीक्षण ने अप्रैल 2024 में दिखाया कि Llama 3 70B अधिकांश बेंचमार्क पर Gemini Pro 1.5 और Claude 3 Sonnet को हरा रहा था। Meta ने Llama 3 को बहुभाषी और मल्टीमॉडल बनाने, कोडिंग और तर्क में बेहतर बनाने, और इसके संदर्भ विंडो को बढ़ाने की योजना भी घोषित की।

स्केलिंग कानूनों के संबंध में, Llama 3 मॉडलों ने अनुभवजन्य रूप से दिखाया कि जब एक मॉडल को "Chinchilla-इष्टतम" मात्रा से अधिक डेटा पर प्रशिक्षित किया जाता है, तो प्रदर्शन लॉग-रैखिक रूप से बढ़ता रहता है। उदाहरण के लिए, Llama 3 8B के लिए Chinchilla-इष्टतम डेटासेट 200 बिलियन टोकन है, लेकिन प्रदर्शन 15 ट्रिलियन टोकन के 75 गुना बड़े डेटासेट तक लॉग-रैखिक रूप से बढ़ता रहा। Dwarkesh Patel के साथ एक साक्षात्कार के दौरान, Mark Zuckerberg ने कहा कि Llama 3 का 8B संस्करण लगभग सबसे बड़े Llama 2 जितना शक्तिशाली था। पिछले मॉडलों की तुलना में, Zuckerberg ने कहा कि टीम आश्चर्यचकित थी कि 70B मॉडल 15T टोकन प्रशिक्षण के अंत में भी सीख रहा था। GPU शक्ति को कहीं और केंद्रित करने के लिए प्रशिक्षण समाप्त करने का निर्णय लिया गया।

Llama 3.1 23 जुलाई, 2024 को जारी किया गया था, जिसमें 8B, 70B, और 405B पैरामीटर आकार शामिल थे। 405B मॉडल पहला Llama था जो मिश्रण-विशेषज्ञ मॉडल था, और इसे एक लाइसेंस के तहत जारी किया गया था जो पुनर्वितरण और संशोधन की अनुमति देता है, लेकिन अन्य बड़े भाषा मॉडलों को बेहतर बनाने के लिए इसका उपयोग करने पर प्रतिबंध लगाता है। Llama 3.2 25 सितंबर, 2024 को जारी किया गया था, जिसमें एज डिवाइसों के लिए 1B और 3B, और विज़न कार्यों के लिए 11B और 90B आकार शामिल थे। Llama 3.3 6 दिसंबर, 2024 को जारी किया गया था, जिसमें एक 70B मॉडल था जो दक्षता के लिए अनुकूलित था।

Llama 4

Llama 4 अप्रैल 2025 में जारी किया गया था। प्रारंभिक रिलीज़ में Llama 4 Scout, Maverick, और Behemoth शामिल थे। Scout और Maverick को ओपन-वेट मॉडल के रूप में जारी किया गया था, जबकि Behemoth को एक पूर्वावलोकन के रूप में जारी किया गया था। Scout एक 17B पैरामीटर मॉडल है जिसमें 10 मिलियन टोकन संदर्भ विंडो है, और Maverick एक 400B पैरामीटर मिश्रण-विशेषज्ञ मॉडल है जिसमें 1 मिलियन टोकन संदर्भ विंडो है। Behemoth एक 2 ट्रिलियन पैरामीटर मिश्रण-विशेषज्ञ मॉडल है जो रिलीज़ के समय अभी भी प्रशिक्षण में था।

स्वागत और प्रभाव

Llama की प्रारंभिक रिलीज़, विशेष रूप से लीक, का AI समुदाय पर महत्वपूर्ण प्रभाव पड़ा। छोटे मॉडलों की पहुंच ने उपभोक्ता हार्डवेयर पर अनुसंधान और विकास को सक्षम किया, जिससे फाइन-ट्यून किए गए वेरिएंट और उपकरणों का प्रसार हुआ। Llama मॉडल व्यापक रूप से शैक्षणिक अनुसंधान और वाणिज्यिक अनुप्रयोगों में उपयोग किए गए हैं, और उन्होंने अन्य संगठनों से बाद के ओपन-वेट मॉडल रिलीज़ को प्रभावित किया है। Llama 3 और Llama 4 की रिलीज़ ने इस प्रवृत्ति को जारी रखा, जिसमें Meta ने Llama को OpenAI, Anthropic, और Google DeepMind के स्वामित्व वाले मॉडलों के लिए एक अग्रणी ओपन-वेट विकल्प के रूप में स्थापित किया।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·meta-ai·artificial-intelligence·open-source-software
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास