Llama 2 परिवार बड़े भाषा मॉडल (LLMs) का एक समूह है जिसे मेटा एआई ने जुलाई 2023 में विकसित और जारी किया था। यह मूल Llama मॉडल का उत्तराधिकारी है और इसे अपने पूर्ववर्ती की तुलना में अधिक सुलभ और व्यावसायिक रूप से उपयोग योग्य बनाने के लिए डिज़ाइन किया गया है। Llama 2 में 7, 13, और 70 अरब पैरामीटर वाले मॉडल शामिल हैं, जिनमें से प्रत्येक एक आधार संस्करण और चैट अनुप्रयोगों के लिए फाइन-ट्यून किए गए संस्करण में उपलब्ध है। मॉडलों को वेट्स के साथ जारी किया गया है, जिससे व्यापक उपयोग संभव हो सके, लेकिन एक लाइसेंस के तहत जो कुछ अनुप्रयोगों को प्रतिबंधित करता है, जिससे यह बहस छिड़ गई है कि क्या वे ओपन सोर्स के रूप में योग्य हैं।
Llama 2 की वास्तुकला काफी हद तक मूल Llama का अनुसरण करती है, लेकिन प्रशिक्षण डेटा में 40% की वृद्धि की गई थी। इस विस्तार का उद्देश्य विभिन्न प्राकृतिक भाषा प्रसंस्करण कार्यों में प्रदर्शन और सामान्यीकरण में सुधार करना था। Llama 2 का जारी होना मेटा की रणनीति में एक महत्वपूर्ण कदम था, जिसमें OpenAI और Google DeepMind जैसे अन्य LLM प्रदाताओं के साथ प्रतिस्पर्धा करने के लिए एक शक्तिशाली और सुलभ विकल्प पेश किया गया।
पृष्ठभूमि
Llama 2 का विकास बड़े भाषा मॉडलों में तेजी से प्रगति की पृष्ठभूमि में हुआ, विशेष रूप से GPT-3 के जारी होने और उसके बाद ChatGPT की लोकप्रियता के बाद। इन मॉडलों ने प्रदर्शित किया कि तंत्रिका नेटवर्क को बड़ा करने से क्षमताओं में महत्वपूर्ण सुधार हो सकते हैं, जिससे इस क्षेत्र में गहरी रुचि पैदा हुई। मेटा के मुख्य एआई वैज्ञानिक, यान लेकुन ने कहा कि LLM लेखन सहायता के लिए विशेष रूप से प्रभावी हैं, और Llama को रचनात्मक और पेशेवर लेखन कार्यों के लिए एक उपकरण के रूप में स्थापित किया।
मूल Llama, जो फरवरी 2023 में जारी किया गया था, शुरू में केवल शोधकर्ताओं के लिए एक गैर-व्यावसायिक लाइसेंस के तहत उपलब्ध था। हालांकि, इसके वेट्स मार्च 2023 में ऑनलाइन लीक हो गए, जिससे व्यापक अनौपचारिक वितरण हुआ। यह लीक, हालांकि विवादास्पद था, सुलभ LLM की मांग को भी उजागर करता है और मेटा के Llama 2 को अधिक अनुमेय लाइसेंस के साथ जारी करने के निर्णय को प्रभावित करता है।
संस्करण
प्रारंभिक जारी
Llama का पहला संस्करण, जिसे कभी-कभी Llama 1 भी कहा जाता है, 24 फरवरी 2023 को घोषित किया गया था। इसे सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित किया गया था और यह 1 अरब से 65 अरब पैरामीटर तक के आकार में आया था। 13B पैरामीटर मॉडल ने कई बेंचमार्क पर बहुत बड़े GPT-3 से बेहतर प्रदर्शन किया, जबकि 65B मॉडल PaLM और Chinchilla जैसे अत्याधुनिक मॉडलों के साथ प्रतिस्पर्धी था। वेट्स तक पहुंच शैक्षणिक शोधकर्ताओं और उद्योग प्रयोगशालाओं तक सीमित थी, लेकिन अनुमान कोड ओपन-सोर्स GPLv3 लाइसेंस के तहत जारी किया गया था।
#### लीक
3 मार्च 2023 को, Llama के वेट्स वाला एक टोरेंट 4chan पर अपलोड किया गया, और लिंक जल्दी से ऑनलाइन एआई समुदायों में फैल गए। मेटा ने HuggingFace और GitHub से हटाने के अनुरोध दायर किए, लेकिन लीक ने पहले ही व्यापक उपयोग को सुविधाजनक बना दिया था। टिप्पणीकारों ने स्थिति की तुलना स्टेबल डिफ्यूजन के जारी होने से की, यह सुझाव देते हुए कि खुली पहुंच नवाचार और उपकरण विकास को बढ़ावा दे सकती है, दुरुपयोग की चिंताओं के बावजूद।
Llama 2
Llama 2 की घोषणा 18 जुलाई 2023 को माइक्रोसॉफ्ट की साझेदारी में की गई थी। इसे तीन आकारों में जारी किया गया: 7B, 13B, और 70B पैरामीटर। वास्तुकला Llama 1 के समान रही, लेकिन प्रशिक्षण डेटा में 40% की वृद्धि की गई। अपने पूर्ववर्ती के विपरीत, Llama 2 के वेट्स व्यावसायिक उपयोग के लिए उपलब्ध कराए गए, एक स्वीकार्य उपयोग नीति के अधीन। यह नीति कुछ अनुप्रयोगों को प्रतिबंधित करती है, जिससे ओपन सोर्स इनिशिएटिव ने मेटा के Llama को ओपन सोर्स के रूप में चित्रित करने पर विवाद किया।
Llama 2 ने कोड Llama के आधार के रूप में भी काम किया, जो कोड जनरेशन के लिए फाइन-ट्यून किया गया एक विशेष संस्करण है। कोड Llama अगस्त 2023 और जनवरी 2024 में जारी किया गया था, जिसमें 7B से 70B पैरामीटर तक के संस्करण शामिल थे, जो अतिरिक्त कोड-विशिष्ट डेटासेट पर प्रशिक्षित थे।
Llama 3
18 अप्रैल 2024 को, मेटा ने 8B और 70B पैरामीटर आकारों के साथ Llama 3 जारी किया। इन मॉडलों को लगभग 15 ट्रिलियन टोकन सार्वजनिक रूप से उपलब्ध पाठ पर पूर्व-प्रशिक्षित किया गया था, जिसमें 10 मिलियन से अधिक मानव-एनोटेटेड उदाहरणों पर निर्देश फाइन-ट्यूनिंग की गई थी। Llama 3 70B ने कई बेंचमार्क पर Gemini Pro 1.5 और Claude 3 Sonnet से बेहतर प्रदर्शन किया। मॉडलों ने प्रदर्शित किया कि प्रदर्शन में सुधार जारी रहता है, भले ही डेटा चिंचिला-इष्टतम मात्रा से कहीं अधिक हो, जिसमें 8B मॉडल ने 15 ट्रिलियन टोकन तक लॉग-रैखिक स्केलिंग दिखाई।
मेटा ने Llama 3 को बहुभाषी और मल्टीमॉडल बनाने और इसकी संदर्भ विंडो बढ़ाने की योजना भी घोषित की। नवीनतम संस्करण, Llama 4, अप्रैल 2025 में जारी किया गया था, और अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने Llama के प्रतिस्थापन के रूप में Muse Spark पेश किया।
प्रभाव और स्वागत
Llama 2 और बाद के संस्करणों के जारी होने का एआई परिदृश्य पर महत्वपूर्ण प्रभाव पड़ा है। खुले वेट्स प्रदान करके, मेटा ने शोधकर्ताओं और डेवलपर्स को विशिष्ट अनुप्रयोगों के लिए मॉडलों को फाइन-ट्यून करने में सक्षम बनाया, जिससे उपकरणों और व्युत्पन्नों का एक जीवंत पारिस्थितिकी तंत्र विकसित हुआ। हालांकि, लाइसेंसिंग शर्तों ने ओपन सोर्स की परिभाषा पर बहस छेड़ दी है, आलोचकों का तर्क है कि स्वीकार्य उपयोग नीति स्वतंत्रता को प्रतिबंधित करती है।
Llama मॉडलों को शिक्षा और उद्योग दोनों में व्यापक रूप से अपनाया गया है, जिसमें चैटबॉट से लेकर कोड जनरेशन तक के अनुप्रयोग शामिल हैं। मॉडलों का प्रदर्शन, विशेष रूप से उनके आकार के संबंध में, उन्हें सीमित कम्प्यूटेशनल संसाधनों वाले संगठनों के लिए आकर्षक बनाता है। 2025 तक, Llama सबसे प्रमुख ओपन-वेट LLM परिवारों में से एक बना हुआ है, जो बाद के मॉडलों के विकास को प्रभावित करता है और एआई पहुंच और शासन के बारे में चर्चाओं को आकार देता है।