Llama 2 बड़े भाषा मॉडल (LLMs) का एक परिवार है, जिसे Meta AI द्वारा विकसित किया गया था और Microsoft के साथ साझेदारी में 18 जुलाई 2023 को जारी किया गया था। यह मूल Llama मॉडल का उत्तराधिकारी है और इसमें फाउंडेशन मॉडल और इंस्ट्रक्शन-ट्यून्ड चैट संस्करण दोनों शामिल हैं। अपने पूर्ववर्ती के विपरीत, Llama 2 को व्यापक वाणिज्यिक उपयोग के लिए वेट्स के साथ उपलब्ध कराया गया था, जो एक स्वीकार्य उपयोग नीति के अधीन था, जिसने ओपन-सोर्स AI पारिस्थितिकी तंत्र को महत्वपूर्ण रूप से प्रभावित किया।
Llama 2 मॉडल व्यापक Large language model परिदृश्य का हिस्सा हैं, जो Transformer (architecture) आर्किटेक्चर और Deep learning तकनीकों में प्रगति पर आधारित हैं। इस रिलीज़ को शक्तिशाली AI तक पहुंच को लोकतांत्रिक बनाने की दिशा में एक बड़ा कदम माना गया, जो OpenAI और Google DeepMind जैसी कंपनियों के मालिकाना मॉडलों के लिए एक प्रतिस्पर्धी विकल्प प्रदान करता है।
पृष्ठभूमि
2020 के दशक की शुरुआत में बड़े भाषा मॉडलों की तीव्र प्रगति, जिसने Llama के लिए मंच तैयार किया, Generative AI उपकरणों की सफलता से जुड़ी हुई है। GPT-3 की रिलीज़ ने प्रदर्शित किया कि मॉडल आकार को बढ़ाने से क्षमताओं में नाटकीय सुधार हो सकते हैं। नवंबर 2022 में, OpenAI ने ChatGPT लॉन्च किया, जिसने व्यापक ध्यान आकर्षित किया और AI अनुसंधान और निवेश में वृद्धि को प्रेरित किया।
Meta AI, Meta का AI अनुसंधान प्रभाग, इस क्षेत्र में सक्रिय था, जिसमें Google DeepMind और अन्य के शोधकर्ताओं द्वारा विकसित Transformer (architecture) आर्किटेक्चर जैसे उल्लेखनीय योगदान शामिल थे। Meta के मुख्य AI वैज्ञानिक, Yann LeCun, ने बड़े भाषा मॉडलों के प्रचार के बारे में सार्वजनिक रूप से संदेह व्यक्त किया, यह कहते हुए कि वे लेखन कार्यों में सहायता के लिए सबसे उपयुक्त हैं, जो AI को अधिक व्यावहारिक और सुलभ बनाने पर Meta के ध्यान को दर्शाता है।
प्रारंभिक रिलीज़ और लीक
मूल Llama परिवार (Llama 1, शैलीबद्ध LLaMA) की घोषणा 24 फरवरी 2023 को एक ब्लॉग पोस्ट और एक तकनीकी पेपर के माध्यम से की गई थी। यह 1 बिलियन से 65 बिलियन पैरामीटर तक के आकारों में उपलब्ध था, जो सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित था। प्रारंभ में, मॉडल वेट्स केवल शोधकर्ताओं के लिए गैर-वाणिज्यिक लाइसेंस के तहत मामले-दर-मामले आधार पर सुलभ थे।
हालांकि, वेट्स जल्द ही ऑनलाइन लीक हो गए। मार्च 2023 में, वेट्स का एक टोरेंट 4chan पर साझा किया गया और तेजी से फैल गया। Meta ने मॉडल होस्ट करने वाले रिपॉजिटरी के लिए HuggingFace और GitHub को हटाने के अनुरोध भेजे, लेकिन लीक ने व्यापक निजी उपयोग और अनुसंधान को सक्षम किया। कई लोगों ने लीक को ओपन AI के लिए एक महत्वपूर्ण मोड़ के रूप में देखा, जिसकी तुलना Stable Diffusion से की गई, जिसने नवाचार को तेज किया।
Llama 2 रिलीज़
18 जुलाई 2023 को, Microsoft के साथ साझेदारी में, Meta ने Llama 2 की घोषणा की, जो Llama परिवार की अगली पीढ़ी है। कंपनी ने तीन पैरामीटर आकार जारी किए: 7 बिलियन, 13 बिलियन और 70 बिलियन पैरामीटर। Meta ने फाउंडेशन मॉडल और फाइन-ट्यून किए गए वेरिएंट दोनों भी जारी किए। विशेष रूप से, चैट फाइन-ट्यून्स को संवादात्मक उपयोग के लिए डिज़ाइन किया गया था।
मॉडलों को मूल Llama की तुलना में 40% अधिक डेटा पर प्रशिक्षित किया गया था, लेकिन आर्किटेक्चर काफी हद तक अपरिवर्तित रहा। Llama 2 मॉडल ने Residual Network (ResNet) ब्लॉक्स का उपयोग किया, जिसमें अटेंशन मैकेनिज्म शामिल था, और Layer Normalization और अन्य नवाचारों से लाभान्वित हुए। इंस्ट्रक्शन फाइन-ट्यूनिंग ने RLAIF - शैली की तकनीकों का उपयोग किया, जिसमें पर्यवेक्षित फाइन-ट्यूनिंग और मानव प्रतिक्रिया को संयोजित किया गया।
वाणिज्यिक उपलब्धता और लाइसेंस
Llama 2 रिलीज़ का सबसे उल्लेखनीय पहलू कई वाणिज्यिक अनुप्रयोगों के लिए वेट्स को मुफ्त उपयोग के लिए प्रदान करने का निर्णय था। Meta ने मॉडलों को एक कस्टम लाइसेंस के तहत जारी किया जो वाणिज्यिक और अनुसंधान दोनों उद्देश्यों के लिए उपयोग, पुनरुत्पादन और संशोधन की अनुमति देता है, नीति द्वारा परिभाषित उपयोग के मामलों पर कुछ प्रतिबंधों के साथ।
स्वीकार्य उपयोग नीति और अन्य शर्तों के कारण, कई आलोचकों ने तर्क दिया कि Llama 2 ओपन सोर्स इनिशिएटिव (OSI) के मानकों के अनुसार सच्चा ओपन सोर्स नहीं था। फिर भी, वाणिज्यिक उपयोग के लिए खुला एक शक्तिशाली भाषा मॉडल की उपलब्धता एक मील का पत्थर थी, जिससे छोटे संगठनों और व्यक्तियों को भुगतान किए गए API पर निर्भर हुए बिना तकनीक पर निर्माण करने में सक्षम बनाया गया।
Microsoft की साझेदारी उल्लेखनीय थी, क्योंकि इसने रिलीज़ को अपने Microsoft Azure इंफ्रास्ट्रक्चर के साथ एकीकृत किया। मॉडल Azure AI मॉडल कैटलॉग पर उपलब्ध कराए गए थे, लेकिन उन्हें सीधे भी डाउनलोड किया जा सकता था, जिससे पहुंच बढ़ गई।
मॉडल आर्किटेक्चर और प्रशिक्षण
Llama 2 ने अपने पूर्ववर्ती के समान आर्किटेक्चर का उपयोग किया, लेकिन स्केलिंग में समायोजन के साथ। मॉडल का आकार 70 बिलियन पैरामीटर तक पहुंच गया, जिससे यह अधिक जटिल पैटर्न को पकड़ सका। प्रशिक्षण में वेब पेज, किताबें और अन्य सार्वजनिक डेटा सहित स्रोतों का मिश्रण उपयोग किया गया, जिसमें गुणवत्ता फ़िल्टरिंग पर ध्यान केंद्रित किया गया।
प्रशिक्षण प्रक्रिया का एक प्रमुख पहलू क्रॉस-एंट्रॉपी लॉस को अनुकूलित करना है, जिसमें Learning Rate Scheduling और Model Pruning जैसे सिद्धांतों का उपयोग किया जाता है। Meta ने प्रदर्शन में सुधार के लिए Dropout और Weight Initialization जैसी तकनीकों को भी शामिल किया।
7B, 13B और 70B मॉडल उपलब्ध हैं, जिसमें 70B मॉडल को कई GPU पर चलाने के लिए डिज़ाइन किया गया है। Llama 2 का मूल्यांकन GPT-3 और Chinchilla जैसे समकालीन मॉडलों के खिलाफ किया गया, जिसमें तर्क और कोडिंग सहित विभिन्न बेंचमार्क कार्यों पर प्रतिस्पर्धी परिणाम प्राप्त हुए।
ओपन-सोर्स AI पारिस्थितिकी तंत्र पर प्रभाव
Llama 2 की रिलीज़, वाणिज्यिक पहुंच के साथ, ओपन-सोर्स AI पारिस्थितिकी तंत्र के विकास को काफी तेज कर दिया। इसने मालिकाना मॉडलों का एक विकल्प प्रदान किया, जिससे डेवलपर्स, शोधकर्ताओं और स्टार्टअप्स का एक समुदाय विकसित हुआ। AI21-Labs और Inflection AI जैसी कई कंपनियों ने अपने स्वयं के मॉडलों के लिए Llama 2 को आधार के रूप में उपयोग किया।
इसके अलावा, रिलीज़ के साथ Amazon Web Services, Google Cloud और Oracle Cloud Infrastructure जैसी क्लाउड सेवाओं में एकीकरण हुआ, जिससे तैनाती सुलभ हो गई। इसके अलावा, हार्डवेयर विक्रेताओं AMD, Intel और Qualcomm ने Llama को कुशलतापूर्वक चलाने के लिए अपने चिप्स को अनुकूलित किया।
व्युत्पन्न और फाइन-ट्यून्स
Llama 2 मॉडल विभिन्न अनुप्रयोगों के लिए अक्सर फाइन-ट्यून किए गए थे। एक उल्लेखनीय उदाहरण Code Llama है, जो विशेष कोड डेटासेट के साथ एक फाइन-ट्यून है। 24 अगस्त 2023 को जारी, शुरू में 7B, 13B और 34B संस्करणों में, और बाद में 29 जनवरी 2024 को 70B संस्करण। Code Llama को फाउंडेशन मॉडल के बाद 500 बिलियन टोकन कोड डेटा पर प्रशिक्षित किया गया था। Generative AI समुदाय ने कई अन्य फाइन-ट्यून्स का उत्पादन किया, जैसे रचनात्मक लेखन, कानूनी सहायता और चिकित्सा सलाह के लिए मॉडल।
मॉडल वेट्स की पहुंच ने शोधकर्ताओं को Model Pruning, Quantization और वेट्स जैसी तकनीकों को लागू करने की अनुमति दी, जिससे छोटी AI कंपनियों और शैक्षणिक संस्थानों के लिए तकनीक का अध्ययन और अनुकूलन संभव हो गया।
प्रतिक्रिया और आलोचना
Llama 2 पर प्रतिक्रियाएं आम तौर पर सकारात्मक थीं, लेकिन चिंताजनक भी थीं। समर्थकों ने AI को लोकतांत्रिक बनाने और नवाचार को बढ़ावा देने की इसकी क्षमता की प्रशंसा की, यह देखते हुए कि यह GPT-3.5 जैसे वाणिज्यिक मॉडलों के साथ प्रतिस्पर्धा कर सकता है। हालांकि, कुछ आलोचकों ने बताया कि लाइसेंस प्रतिबंध अभी भी पूरी तरह से "खुले" नहीं थे जैसा कि परिभाषित किया गया है, जिससे उनकी स्वतंत्रता की सीमा सीमित हो गई।
स्वीकार्य उपयोग नीति ने निगरानी, स्पैमिंग और मैलवेयर जैसे क्षेत्रों में अनुप्रयोगों को प्रतिबंधित किया। इसे दुरुपयोग को रोकने के प्रयास के रूप में बहस किया गया, लेकिन लचीलापन भी सीमित किया।
कुछ शोधकर्ताओं ने Llama 2 जैसे बड़े मॉडलों के प्रशिक्षण के पर्यावरणीय और संसाधन संबंधी चिंताओं पर भी ध्यान दिया। प्रशिक्षण के लिए महत्वपूर्ण कंप्यूटिंग शक्ति की आवश्यकता थी, जिससे नैतिक और व्यावहारिक मुद्दे उठे।
विरासत और भविष्य
Llama 2 ने ओपन AI के लिए एक नया मानक स्थापित किया, जिससे अप्रैल 2024 में Llama 3 की बाद की रिलीज़ हुई। रिलीज़ का उद्योग पर स्थायी प्रभाव पड़ा, जिसने प्रमुख वाणिज्यिक प्रयोगशालाओं को यह पुनर्विचार करने के लिए प्रेरित किया कि मॉडल कैसे साझा किए जा सकते हैं। इसने अन्य उत्पादों के आधार के रूप में ओपन AI संग्रह के विकास को भी प्रोत्साहित किया।
Llama 2 का प्रतिबंधों के साथ वेट्स देने का दृष्टिकोण अन्य डेवलपर्स द्वारा Meta AI जैसे AI सहायकों को बनाने के लिए अपनाया गया है, जो अब Llama 3 पर बनाया गया है। 2025 के अंत तक, Llama मॉडलों का एक परिवार है, और नए मॉडलों के उभरने के बावजूद, Llama 2 एक मौलिक मील का पत्थर बना हुआ है।
सारांश
संक्षेप में, Meta Llama 2 की घोषणा जनरेटिव AI की प्रगति में एक महत्वपूर्ण घटना थी। मजबूत प्रदर्शन को अनुमेय वेट्स के साथ जोड़कर, Meta के निर्णय ने ओपन AI पारिस्थितिकी तंत्र को आकार देने में मदद की। इस घटना को अक्सर उन किनारों में से एक के रूप में उद्धृत किया जाता है जिसने वाणिज्यिक AI की रुचि को गर्म किया।
अपनी रिलीज़ के समय, Llama 2 ने अन्य AI मॉडलों के अधिक प्रतिबंधित प्रथाओं से एक विचलन को चिह्नित किया, और इसका प्रभाव व्यापक था।