LLaMA 2 बड़े भाषा मॉडल (LLMs) का एक परिवार है जिसे मेटा एआई ने 18 जुलाई, 2023 को माइक्रोसॉफ्ट के साथ साझेदारी में जारी किया था। यह फरवरी 2023 में पहली बार जारी होने के बाद LLaMA (लार्ज लैंग्वेज मॉडल मेटा एआई) श्रृंखला की दूसरी पीढ़ी का प्रतिनिधित्व करता है। मॉडल तीन पैरामीटर आकारों में उपलब्ध कराए गए थे - 7 बिलियन, 13 बिलियन और 70 बिलियन - और इसमें फाउंडेशन मॉडल और चैट अनुप्रयोगों के लिए फाइन-ट्यून किए गए संस्करण दोनों शामिल थे। अपने पूर्ववर्ती से एक प्रमुख बदलाव लाइसेंसिंग था: सभी LLaMA 2 मॉडल वजन के साथ जारी किए गए थे और कई व्यावसायिक उपयोग के मामलों की अनुमति देते थे, हालांकि लाइसेंस की स्वीकार्य उपयोग नीति का मतलब था कि इसे ओपन सोर्स इनिशिएटिव द्वारा ओपन सोर्स नहीं माना गया था।
यह रिलीज़ एआई मॉडल वितरण के प्रति मेटा के दृष्टिकोण में एक महत्वपूर्ण बदलाव का प्रतीक थी। जबकि पहला LLaMA मॉडल शैक्षणिक शोधकर्ताओं तक सीमित था, LLaMA 2 को व्यावसायिक संस्थाओं सहित व्यापक दर्शकों के लिए सुलभ बनाया गया था। यह कदम उद्योग में अधिक खुले मॉडल रिलीज़ की ओर व्यापक प्रवृत्ति का हिस्सा था, हालांकि इसने एआई के संदर्भ में ओपन सोर्स की परिभाषा पर बहस भी छेड़ दी। मॉडल आर्किटेक्चर LLaMA 1 से काफी हद तक अपरिवर्तित रहा, लेकिन प्रशिक्षण डेटा में 40% की वृद्धि की गई, जिससे विभिन्न बेंचमार्क में प्रदर्शन में सुधार हुआ।
पृष्ठभूमि और संदर्भ
LLaMA 2 का विकास बड़े भाषा मॉडल में तेजी से प्रगति की पृष्ठभूमि में हुआ। GPT-3 जैसे मॉडलों की सफलता और ChatGPT की अप्रत्याशित लोकप्रियता के बाद, सक्षम LLM बनाने के लिए तकनीकी कंपनियों के बीच भयंकर प्रतिस्पर्धा थी। मेटा के मुख्य एआई वैज्ञानिक यान लेकुन ने सार्वजनिक रूप से कहा था कि बड़े भाषा मॉडल लेखन कार्यों में सहायता के लिए सबसे उपयुक्त हैं, जो एआई क्षमताओं पर व्यापक प्रवचन के भीतर मेटा के दृष्टिकोण को स्थापित करता है।
पहला LLaMA मॉडल, जिसकी घोषणा 24 फरवरी, 2023 को की गई थी, ने पहले ही प्रदर्शित कर दिया था कि छोटे मॉडल बहुत बड़े मॉडलों के साथ प्रतिस्पर्धा कर सकते हैं। 13B पैरामीटर संस्करण ने अधिकांश एनएलपी बेंचमार्क पर GPT-3 (175B पैरामीटर) को पीछे छोड़ दिया, जबकि 65B मॉडल PaLM और Chinchilla जैसी अत्याधुनिक प्रणालियों के साथ प्रतिस्पर्धी था। यह दक्षता आंशिक रूप से सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षण और डीप लर्निंग और न्यूरल नेटवर्क डिजाइन में उन्नत तकनीकों के उपयोग के कारण थी।
मॉडल आर्किटेक्चर और प्रशिक्षण
LLaMA 2 का आर्किटेक्चर Transformer (architecture) ढांचे पर आधारित था, जो बड़े भाषा मॉडल के लिए मानक बन गया था। मॉडलों को LLaMA 1 के डिजाइन के अनुरूप मल्टी-हेड अटेंशन तंत्र और पोजिशनल एन्कोडिंग का उपयोग करके प्रशिक्षित किया गया था। प्रशिक्षण प्रक्रिया में पहले संस्करण की तुलना में डेटासेट को 40% तक बढ़ाना शामिल था, जिससे मॉडलों को पाठ के अधिक व्यापक कोष से सीखने की अनुमति मिली।
70B पैरामीटर मॉडल परिवार में सबसे बड़ा था, जिसे उच्च-प्रदर्शन अनुप्रयोगों के लिए डिज़ाइन किया गया था, जबकि 7B और 13B संस्करणों ने सीमित कंप्यूटेशनल संसाधनों वाले शोधकर्ताओं और डेवलपर्स के लिए अधिक सुलभ विकल्प पेश किए। सभी मॉडल फाउंडेशन मॉडल और निर्देश-ट्यून किए गए संस्करणों दोनों के रूप में जारी किए गए थे, बाद वाले चैट और संवादात्मक कार्यों के लिए फाइन-ट्यून किए गए थे। यह दोहरी रिलीज़ LLaMA श्रृंखला के लिए पहली थी, जो शुरू में विशेष रूप से फाउंडेशन मॉडल थी।
लाइसेंसिंग और व्यावसायिक उपलब्धता
LLaMA 2 की एक परिभाषित विशेषता इसका लाइसेंसिंग मॉडल था। LLaMA 1 के विपरीत, जो गैर-व्यावसायिक लाइसेंस के तहत शैक्षणिक शोधकर्ताओं तक सीमित था, LLaMA 2 को एक लाइसेंस के तहत जारी किया गया था जो स्वीकार्य उपयोग नीति के अधीन व्यावसायिक उपयोग की अनुमति देता था। यह नीति कुछ अनुप्रयोगों को प्रतिबंधित करती है, जैसे अवैध गतिविधियों या नुकसान से जुड़े, लेकिन वैध उपयोगों की एक विस्तृत श्रृंखला की अनुमति देती है।
मेटा द्वारा LLaMA 2 को "ओपन सोर्स" के रूप में चित्रित करना ओपन सोर्स इनिशिएटिव द्वारा विवादित था, जो ओपन सोर्स परिभाषा को बनाए रखता है। आलोचकों ने तर्क दिया कि स्वीकार्य उपयोग नीति और अन्य प्रतिबंधों का मतलब था कि लाइसेंस सच्चे ओपन सोर्स के मानदंडों को पूरा नहीं करता था। इस बहस ने मॉडल रिलीज़ में खुलेपन के बारे में एआई समुदाय में चल रहे तनाव को उजागर किया।
LLaMA 2 की व्यावसायिक उपलब्धता व्यवसायों और स्टार्टअप के लिए महत्वपूर्ण थी, जिससे उन्हें मालिकाना प्रदाताओं से महंगी लाइसेंसिंग फीस के बिना उत्पादों में मॉडल को एकीकृत करने में सक्षम बनाया गया। इसे OpenAI और Anthropic जैसी कंपनियों के बंद मॉडलों के प्रभुत्व के प्रतिकार के रूप में देखा गया।
प्रभाव और स्वागत
LLaMA 2 की रिलीज़ को एआई समुदाय में काफी दिलचस्पी मिली। इसका प्रदर्शन, विशेष रूप से 70B मॉडल, उस समय के अन्य प्रमुख मॉडलों के साथ प्रतिस्पर्धी था, और अनुमेय लाइसेंस ने इसे अनुसंधान और व्यावसायिक तैनाती दोनों के लिए एक आकर्षक विकल्प बना दिया। कई आकारों की उपलब्धता ने उपयोगकर्ताओं को अपने हार्डवेयर क्षमताओं से मेल खाने वाला मॉडल चुनने की अनुमति दी, एज डिवाइस से लेकर बड़े पैमाने पर सर्वर तक।
LLaMA 2 के बाद, मेटा ने श्रृंखला विकसित करना जारी रखा, कोड-विशिष्ट कार्यों के लिए अगस्त 2023 में कोड LLaMA जारी किया, और बाद में अप्रैल 2024 में बेहतर प्रदर्शन और बड़े प्रशिक्षण डेटासेट के साथ LLaMA 3 जारी किया। LLaMA परिवार मेटा की एआई रणनीति की आधारशिला बन गया, जिसकी परिणति LLaMA पर निर्मित एक सहायक मेटा एआई के विकास और अप्रैल 2025 में LLaMA 4 की अंततः रिलीज़ में हुई। अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने LLaMA के प्रतिस्थापन के रूप में म्यूज़ स्पार्क पेश किया, जो मेटा के एआई मॉडल के अगले विकास को चिह्नित करता है।
तकनीकी विवरण और विविधताएं
LLaMA 2 मॉडलों को आधुनिक एलएलएम विकास में आम तकनीकों का उपयोग करके प्रशिक्षित किया गया था, जिसमें एडम ऑप्टिमाइज़र और लर्निंग रेट शेड्यूल शामिल हैं। प्रशिक्षण प्रक्रिया में प्रशिक्षण को स्थिर करने और अभिसरण में सुधार के लिए ग्रेडिएंट क्लिपिंग और लेयर नॉर्मलाइज़ेशन भी नियोजित किया गया। ये विधियां क्षेत्र में मानक थीं, जो उस समय मशीन लर्निंग में अत्याधुनिकता को दर्शाती हैं।
कोड LLaMA, LLaMA 2 का एक विशेष संस्करण, कोड-विशिष्ट डेटासेट पर फाइन-ट्यून किया गया था। 7B, 13B और 34B संस्करण 24 अगस्त, 2023 को जारी किए गए थे, जिसमें 70B संस्करण 29 जनवरी, 2024 को जारी किया गया था। प्रशिक्षण में कोड डेटा के अतिरिक्त 500 बिलियन टोकन शामिल थे, इसके बाद लंबे-संदर्भ डेटा के 20 बिलियन टोकन शामिल थे, जिससे सामान्य कोड पीढ़ी के लिए फाउंडेशन मॉडल तैयार हुए। निर्देश-अनुसरण टोकन के 5 बिलियन पर आगे फाइन-ट्यूनिंग ने निर्देश संस्करण तैयार किए, और एक अलग पायथन-केंद्रित मॉडल को पायथन कोड के 100 बिलियन टोकन पर प्रशिक्षित किया गया।
इन तकनीकी विकासों ने LLaMA 2 को प्राकृतिक भाषा प्रसंस्करण से लेकर सॉफ्टवेयर विकास तक विभिन्न अनुप्रयोगों के लिए एक बहुमुखी मंच के रूप में स्थापित किया। रिलीज़ ने व्यापक पारिस्थितिकी तंत्र में नवाचार को भी प्रेरित किया, जिसमें अमेज़न वेब सर्विसेज और एज़्योर जैसी कंपनियों ने अपने क्लाउड प्लेटफॉर्म पर LLaMA 2 की पेशकश की, जिससे यह उपयोगकर्ताओं की एक व्यापक श्रेणी के लिए सुलभ हो गया।