LLaMA 2 (शैलीबद्ध रूप में LLaMa 2) बड़े भाषा मॉडल का एक परिवार है, जिसे मेटा एआई ने माइक्रोसॉफ्ट के साथ साझेदारी में 18 जुलाई 2023 को जारी किया था। इसने मूल LLaMA मॉडल का स्थान लिया और मॉडल वेट को व्यावसायिक उपयोग के लिए उपलब्ध कराने के लिए उल्लेखनीय था, जो पहले के संस्करण की प्रतिबंधित शैक्षणिक-केवल पहुंच से एक बदलाव था। रिलीज़ में फाउंडेशन मॉडल और निर्देश-फाइन-ट्यून किए गए चैट वेरिएंट दोनों शामिल थे, जिनके आकार 7, 13 और 70 बिलियन पैरामीटर थे।
मॉडल आर्किटेक्चर LLaMA 1 से काफी हद तक अपरिवर्तित रहा, लेकिन प्रशिक्षण डेटा में 40% की वृद्धि की गई। LLaMA 2 को सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित किया गया था, और चैट संस्करणों को आरएलएचएफ (मानव प्रतिक्रिया से सुदृढीकरण सीखना) जैसी तकनीकों का उपयोग करके फाइन-ट्यून किया गया था। मॉडल को एक कस्टम लाइसेंस के तहत वितरित किया गया था जो व्यावसायिक उपयोग की अनुमति देता था लेकिन एक स्वीकार्य उपयोग नीति लागू करता था, जिससे यह विवाद हुआ कि क्या वे ओपन-सोर्स सॉफ्टवेयर के रूप में योग्य हैं।
पृष्ठभूमि
2022 के अंत में चैटजीपीटी की रिलीज़ और इसकी तेजी से बढ़ती लोकप्रियता ने जनरेटिव एआई और बड़े भाषा मॉडल में रुचि बढ़ा दी। मेटा के मुख्य एआई वैज्ञानिक, यान लेकुन ने पहले कहा था कि ऐसे मॉडल लेखन में सहायता के लिए सबसे उपयुक्त हैं, जो व्यापक एआई परिदृश्य में मेटा के दृष्टिकोण को स्थापित करता है।
LLaMA 1, जिसे 24 फरवरी 2023 को घोषित किया गया था, 1B से 65B पैरामीटर तक का एक फाउंडेशन मॉडल परिवार था। इसके वेट शुरू में केवल शोधकर्ताओं के लिए गैर-व्यावसायिक लाइसेंस के तहत मामले-दर-मामले आधार पर उपलब्ध थे। मार्च 2023 में, LLaMA 1 की अनधिकृत प्रतियां BitTorrent और HuggingFace के माध्यम से लीक हो गईं, जिससे मेटा को हटाने के अनुरोध दर्ज करने पड़े। लीक की तुलना स्टेबल डिफ्यूजन के खुले वितरण से की गई, जिसने तेजी से सामुदायिक नवाचार को बढ़ावा दिया था।
रिलीज़ और विशेषताएं
LLaMA 2 की घोषणा 18 जुलाई 2023 को तीन पैरामीटर आकारों के साथ की गई: 7B, 13B और 70B। फाउंडेशन मॉडल को सार्वजनिक रूप से उपलब्ध डेटा के 2 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, जो LLaMA 1 से 40% अधिक है। चैट मॉडल को 1 मिलियन से अधिक मानव एनोटेशन पर फाइन-ट्यून किया गया था और उपयोगकर्ता के इरादे के साथ प्रतिक्रियाओं को संरेखित करने के लिए आरएलएचएफ का उपयोग किया गया था।
LLaMA 2 का लाइसेंस व्यावसायिक उपयोग की अनुमति देता था, लेकिन इसमें अन्य बड़े भाषा मॉडल को बेहतर बनाने के लिए उपयोग पर प्रतिबंध जैसे प्रतिबंध शामिल थे। इसके कारण ओपन सोर्स इनिशिएटिव ने तर्क दिया कि मेटा द्वारा शब्द के उपयोग के बावजूद LLaMA 2 वास्तव में ओपन सोर्स नहीं था।
व्यावसायिक और पारिस्थितिकी तंत्र प्रभाव
LLaMA 2 की व्यावसायिक उपलब्धता ने इसे ओपनएआई और एंथ्रोपिक के स्वामित्व वाले मॉडल के विकल्प की तलाश करने वाले स्टार्टअप और उद्यमों के लिए एक लोकप्रिय विकल्प बना दिया। इसे अमेज़न वेब सर्विसेज (AWS), एज़्योर और गूगल क्लाउड प्लेटफार्मों में एकीकृत किया गया, जिससे प्रबंधित सेवाओं के माध्यम से तैनाती संभव हुई। 70B मॉडल विशेष रूप से बेंचमार्क पर अपने प्रदर्शन के लिए उल्लेखनीय था, जो अक्सर बड़े स्वामित्व वाले मॉडलों को टक्कर देता था।
अगस्त 2023 में, मेटा ने कोड लामा जारी किया, जो LLaMA 2 का एक फाइन-ट्यून संस्करण है जो कोड जनरेशन के लिए विशेषीकृत है, जिसके आकार 7B, 13B, 34B और बाद में 70B थे। इसने सॉफ्टवेयर विकास कार्यों के लिए LLaMA 2 की प्रयोज्यता का विस्तार किया।
उत्तराधिकारी और विरासत
LLaMA 2 का स्थान 18 अप्रैल 2024 को LLaMA 3 ने लिया, जिसने 15 ट्रिलियन टोकन पर प्रशिक्षित 8B और 70B मॉडल पेश किए। LLaMA 3 ने प्रदर्शित किया कि चिंचिला-इष्टतम प्रशिक्षण डेटा मात्रा से परे भी प्रदर्शन में सुधार जारी रहा, एक खोज जिसने स्केलिंग प्रथाओं को प्रभावित किया। LLaMA 3.1 23 जुलाई 2024 को 405B पैरामीटर मॉडल के साथ आया, और LLaMA 4 अप्रैल 2025 में जारी किया गया।
अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने LLaMA के प्रतिस्थापन के रूप में Muse Spark पेश किया, जो मेटा की एआई मॉडल रणनीति में बदलाव का संकेत देता है। LLaMA 2 ओपन-वेट बड़े भाषा मॉडल के इतिहास में एक महत्वपूर्ण मील का पत्थर बना हुआ है, जिसने व्यावसायिक पहुंच के लिए एक मिसाल कायम की और जनरेटिव एआई के पारिस्थितिकी तंत्र को आकार दिया।