LLaMA 1 (Large Language Model Meta AI) मेटा के बड़े भाषा मॉडल परिवार की पहली रिलीज़ थी, जिसकी घोषणा 24 फरवरी 2023 को की गई थी। मॉडल को एक फाउंडेशन मॉडल के रूप में डिज़ाइन किया गया था, जिसे केवल सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित किया गया था, और यह 7 बिलियन से 65 बिलियन पैरामीटर आकारों में आया था। इसकी रिलीज़ ने बड़े भाषा मॉडल के परिदृश्य में एक महत्वपूर्ण बदलाव को चिह्नित किया, क्योंकि इसने बहुत बड़े मालिकाना सिस्टम के मुकाबले प्रतिस्पर्धात्मक प्रदर्शन दिखाया, जबकि शोध उद्देश्यों के लिए अधिक सुलभ था।
LLaMA 1 का प्रारंभिक वितरण गैर-वाणिज्यिक लाइसेंस के तहत शैक्षणिक शोधकर्ताओं और उद्योग प्रयोगशालाओं तक सीमित था, जिसमें मामला-दर-मामला आधार पर पहुंच प्रदान की गई थी। हालांकि, इसकी घोषणा के कुछ हफ्तों के भीतर, मॉडल के वेट ऑनलाइन लीक हो गए, जिससे व्यापक अनधिकृत वितरण हुआ और AI सिस्टम तक खुली पहुंच के बारे में बहस छिड़ गई।
पृष्ठभूमि और संदर्भ
LLaMA 1 का विकास OpenAI के GPT-3 की रिलीज़ और उसके बाद ChatGPT के लॉन्च के बाद बड़े भाषा मॉडलों में गहरी रुचि की अवधि के दौरान हुआ। इन सिस्टमों की सफलता ने तंत्रिका नेटवर्क आर्किटेक्चर को बढ़ाने की क्षमता को उजागर किया, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर, जो प्राकृतिक भाषा प्रसंस्करण में प्रमुख दृष्टिकोण बन गया था।
मेटा के मुख्य AI वैज्ञानिक यान लेकुन ने बड़े भाषा मॉडलों को लेखन कार्यों में सहायता के लिए विशेष रूप से उपयोगी बताया, जिससे मेटा का दृष्टिकोण उन प्रतिस्पर्धियों से अलग हुआ जिन्होंने व्यापक क्षमताओं पर जोर दिया। कंपनी का लक्ष्य एक अधिक कुशल मॉडल बनाना था जो कम शक्तिशाली हार्डवेयर पर चल सके, जिससे सीमित कम्प्यूटेशनल संसाधनों वाले शैक्षणिक संस्थानों के लिए उन्नत AI शोध अधिक सुलभ हो सके।
प्रारंभिक रिलीज़ और आर्किटेक्चर
LLaMA का पहला संस्करण एक ब्लॉग पोस्ट और साथ में शोध पत्र के माध्यम से घोषित किया गया था, जिसमें इसकी प्रशिक्षण पद्धति, आर्किटेक्चर और प्रदर्शन विशेषताओं का वर्णन किया गया था। इन्फ़रेंस कोड ओपन-सोर्स GPLv3 लाइसेंस के तहत जारी किया गया था, जबकि मॉडल वेट एक आवेदन प्रक्रिया के पीछे गेटेड रहे। यह हाइब्रिड दृष्टिकोण शोध पारदर्शिता और संभावित दुरुपयोग की चिंताओं के बीच संतुलन बनाने के लिए था।
मेटा ने LLaMA 1 को कई स्केल पर प्रशिक्षित किया, जिसमें 13 बिलियन पैरामीटर संस्करण ने अधिकांश NLP बेंचमार्क पर GPT-3 (175 बिलियन पैरामीटर) से बेहतर प्रदर्शन किया। सबसे बड़ा 65 बिलियन पैरामीटर मॉडल पालम और चिंचिला जैसे अत्याधुनिक सिस्टम के साथ प्रतिस्पर्धात्मक परिणाम प्राप्त करने में सफल रहा। प्रशिक्षण डेटा में पूरी तरह से सार्वजनिक रूप से उपलब्ध स्रोत शामिल थे, और मॉडलों को उनके बड़े समकक्षों की तुलना में अधिक कम्प्यूटेशनल रूप से कुशल बनाने के लिए डिज़ाइन किया गया था।
लीक और उसके बाद के परिणाम
3 मार्च 2023 को, LLaMA के वेट वाला एक टोरेंट 4chan इमेजबोर्ड पर अपलोड और साझा किया गया, जिसके लिंक बाद में ऑनलाइन AI समुदायों में फैल गए। कुछ ही दिनों में, आधिकारिक LLaMA रिपॉज़िटरी पर मैग्नेट लिंक और हगिंगफेस रिपॉज़िटरी संदर्भ जोड़ने के लिए पुल रिक्वेस्ट खोले गए। मेटा ने 6 मार्च को टेकडाउन अनुरोध दायर किया, जिसमें वितरण को अनधिकृत बताया गया, और हगिंगफेस ने अनुरोधों का अनुपालन किया।
20 मार्च को, मेटा ने एक स्क्रिप्ट वाले रिपॉज़िटरी के खिलाफ DMCA टेकडाउन अनुरोध दायर किया जो मिरर से LLaMA डाउनलोड करता था, और गिटहब ने अगले दिन अनुपालन किया। इन प्रयासों के बावजूद, मॉडल विभिन्न मिरर साइटों और टोरेंट नेटवर्क के माध्यम से व्यापक रूप से सुलभ रहा।
लीक पर प्रतिक्रियाएं विभाजित थीं। कुछ टिप्पणीकारों ने संभावित दुर्भावनापूर्ण अनुप्रयोगों, जैसे परिष्कृत स्पैम निर्माण, के बारे में चिंता व्यक्त की। अन्य ने बढ़ी हुई पहुंच का जश्न मनाया, यह देखते हुए कि मॉडल के छोटे संस्करण अपेक्षाकृत सस्ते में चलाए जा सकते थे, जिससे शोध और नवाचार में तेजी आ सकती थी। साइमन विलिसन और अन्य टिप्पणीकारों ने स्टेबल डिफ्यूज़न के साथ तुलना की, जो खुले तौर पर वितरित टेक्स्ट-टू-इमेज मॉडल था जिसने समान रूप से उपकरणों और तकनीकों के तेजी से प्रसार को जन्म दिया था।
विरासत और प्रभाव
LLaMA 1 की रिलीज़ और उसके बाद के लीक का AI पारिस्थितिकी तंत्र पर स्थायी प्रभाव पड़ा। इसने दिखाया कि बड़े भाषा मॉडल बड़ी तकनीकी कंपनियों के बाहर प्रभावी ढंग से वितरित किए जा सकते हैं, जिससे यह धारणा चुनौती हुई कि ऐसे सिस्टम के लिए विशाल कम्प्यूटेशनल बुनियादी ढांचे की आवश्यकता होती है। मॉडल की आर्किटेक्चर और प्रशिक्षण दृष्टिकोण ने बाद के ओपन-वेट मॉडलों को प्रभावित किया और बढ़ते ओपन-सोर्स AI आंदोलन में योगदान दिया।
LLaMA 1 के साथ अनुभव ने बाद की रिलीज़ के लिए मेटा के दृष्टिकोण को आकार दिया। Llama 2, जो 18 जुलाई 2023 को माइक्रोसॉफ्ट के साथ साझेदारी में जारी किया गया था, में व्यापक वाणिज्यिक लाइसेंसिंग के साथ फाउंडेशन और इंस्ट्रक्शन-ट्यून्ड दोनों मॉडल शामिल थे। Llama 3 18 अप्रैल 2024 को आया, जिसमें 15 ट्रिलियन टोकन पर प्रशिक्षित मॉडल और बेहतर प्रदर्शन शामिल था। यह वंश अप्रैल 2025 में Llama 4 के साथ जारी रहा, और मेटा सुपरइंटेलिजेंस लैब्स ने अप्रैल 2026 में म्यूज़ स्पार्क को प्रतिस्थापन के रूप में जारी किया।
LLaMA 1 की विरासत इस प्रदर्शन में निहित है कि अपेक्षाकृत मामूली पैरामीटर संख्या और सार्वजनिक रूप से उपलब्ध डेटा के साथ प्रतिस्पर्धात्मक बड़े भाषा मॉडल बनाए जा सकते हैं, साथ ही यह भी उजागर करता है कि एक बार जारी होने के बाद शक्तिशाली AI सिस्टम तक पहुंच को नियंत्रित करने की चुनौतियां क्या हैं।