लामा लीक मार्च 2023 में मेटा एआई के LLaMA (लार्ज लैंग्वेज मॉडल मेटा एआई) मॉडल वेट्स के अनधिकृत वितरण को संदर्भित करता है। यह घटना लार्ज लैंग्वेज मॉडल के विकास में एक महत्वपूर्ण मोड़ साबित हुई, क्योंकि इसने मेटा की नियंत्रित पहुंच नीति को दरकिनार कर दिया और वेट्स को बिटटोरेंट और हगिंगफेस के माध्यम से जनता के लिए उपलब्ध करा दिया। इस लीक ने ओपन-सोर्स एआई अनुसंधान को तेज किया, जिससे डेवलपर्स और शोधकर्ताओं के एक व्यापक समुदाय को मॉडलों के साथ प्रयोग करने और उन पर निर्माण करने में सक्षम बनाया गया, दुरुपयोग के शुरुआती चिंताओं के बावजूद।
यह लीक मेटा द्वारा 24 फरवरी 2023 को LLaMA की घोषणा के तुरंत बाद हुआ, जो 1 बिलियन से 65 बिलियन पैरामीटर तक के फाउंडेशन मॉडलों का एक परिवार था। OpenAI के GPT-3 जैसे समकालीन मॉडलों के विपरीत, जो बंद थे, LLaMA के वेट्स शैक्षणिक शोधकर्ताओं के लिए एक गैर-वाणिज्यिक लाइसेंस के तहत थे। लीक ने पहुंच को लोकतांत्रिक बना दिया, जिससे फाइन-ट्यून किए गए वेरिएंट और उपकरणों का प्रसार हुआ, और मेटा के बाद के Llama 2 और Llama 3 रिलीज़ को प्रभावित किया, जिन्हें अधिक खुले तौर पर उपलब्ध कराया गया।
पृष्ठभूमि
2020 के दशक की शुरुआत में, कृत्रिम बुद्धिमत्ता के क्षेत्र में OpenAI के ChatGPT के नवंबर 2022 में रिलीज़ होने के बाद रुचि में वृद्धि देखी गई। इसने तकनीकी कंपनियों के बीच अधिक शक्तिशाली लार्ज लैंग्वेज मॉडल विकसित करने की होड़ शुरू कर दी। मेटा ने अपने एआई अनुसंधान प्रभाग मेटा एआई के तहत खुले अनुसंधान की रणनीति अपनाई, लेकिन मॉडल पहुंच पर प्रतिबंधों के साथ। मेटा के मुख्य एआई वैज्ञानिक यान लेकुन ने प्रचार के प्रति संदेह व्यक्त किया, यह कहते हुए कि लार्ज लैंग्वेज मॉडल लेखन में सहायता के लिए सबसे अच्छे हैं, मानव-स्तरीय बुद्धिमत्ता प्राप्त करने के लिए नहीं।
LLaMA परियोजना का उद्देश्य कुशल मॉडल बनाना था जो उपभोक्ता हार्डवेयर पर चल सकें, GPT-3 (175 बिलियन पैरामीटर) जैसे मॉडलों के विशाल पैमाने के विपरीत। मेटा ने LLaMA को सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित किया, ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करते हुए, और ओपन-सोर्स लाइसेंस के तहत अनुमान कोड जारी किया, लेकिन वेट्स को गेटेड रखा।
प्रारंभिक रिलीज़ और लीक
24 फरवरी 2023 को, मेटा एआई ने एक ब्लॉग पोस्ट और एक पेपर के माध्यम से LLaMA की घोषणा की, जिसमें इसके प्रशिक्षण और प्रदर्शन का विवरण था। मॉडल 7B, 13B, 33B और 65B पैरामीटर आकारों में आए। मेटा ने बताया कि 13B मॉडल ने कई NLP बेंचमार्क पर GPT-3 को बेहतर प्रदर्शन किया, और 65B मॉडल PaLM और Chinchilla जैसे अत्याधुनिक मॉडलों के साथ प्रतिस्पर्धी था। वेट्स तक पहुंच शैक्षणिक शोधकर्ताओं, सरकार, नागरिक समाज और उद्योग अनुसंधान प्रयोगशालाओं को मामले-दर-मामले आधार पर दी गई थी।
3 मार्च 2023 को, वेट्स वाला एक टोरेंट अपलोड किया गया, जिसका लिंक 4chan पर साझा किया गया और ऑनलाइन एआई समुदायों में तेजी से फैल गया। उसी दिन, आधिकारिक LLaMA रिपॉजिटरी पर एक पुल रिक्वेस्ट ने दस्तावेज़ीकरण में मैग्नेट लिंक जोड़ने का अनुरोध किया। 4 मार्च को, एक और पुल रिक्वेस्ट ने मॉडल होस्ट करने वाले हगिंगफेस रिपॉजिटरी के लिंक जोड़े। मेटा ने 6 मार्च को हगिंगफेस के साथ तकदown अनुरोध दायर करके जवाब दिया, वितरण को अनधिकृत बताते हुए, और हगिंगफेस ने अनुपालन किया। 20 मार्च को, मेटा ने एक डाउनलोड स्क्रिप्ट वाले GitHub रिपॉजिटरी के खिलाफ DMCA तकdown दायर किया, जिसे अगले दिन हटा दिया गया।
लीक को मिश्रित प्रतिक्रियाओं का सामना करना पड़ा। कुछ ने दुर्भावनापूर्ण उपयोग का डर व्यक्त किया, जैसे परिष्कृत स्पैम या गलत सूचना। अन्य ने पहुंच का जश्न मनाया, यह देखते हुए कि छोटे मॉडल मामूली हार्डवेयर पर चल सकते हैं, जिससे अनुसंधान और नवाचार को बढ़ावा मिलता है। साइमन विलिसन जैसे टिप्पणीकारों ने LLaMA की तुलना स्टेबल डिफ्यूजन से की, जो एक ओपन टेक्स्ट-टू-इमेज मॉडल है जिसने तेजी से पारिस्थितिकी तंत्र विकास को प्रेरित किया। लीक ने प्रभावी रूप से मेटा को अपनी रिलीज़ रणनीति पर पुनर्विचार करने के लिए मजबूर किया।
Llama 2
18 जुलाई 2023 को, मेटा ने माइक्रोसॉफ्ट के साथ साझेदारी में, अगली पीढ़ी के Llama 2 की घोषणा की। Llama 2 को तीन आकारों में जारी किया गया: 7B, 13B और 70B पैरामीटर। आर्किटेक्चर काफी हद तक Llama 1 से अपरिवर्तित था, लेकिन प्रशिक्षण डेटा में 40% की वृद्धि की गई। मूल के विपरीत, Llama 2 में फाउंडेशन मॉडल और चैट के लिए निर्देश फाइन-ट्यून किए गए संस्करण दोनों शामिल थे। सभी मॉडल वेट्स के साथ जारी किए गए और एक स्वीकार्य उपयोग नीति के अधीन वाणिज्यिक उपयोग की अनुमति दी गई। हालांकि, यह लाइसेंस ओपन सोर्स इनिशिएटिव द्वारा अनुमोदित नहीं था, जिससे Llama 2 को ओपन सोर्स कहा जा सकता है या नहीं, इस पर विवाद हुआ।
Llama 2 की रिलीज़ ने अधिक खुले वितरण की ओर बदलाव को चिह्नित किया, आंशिक रूप से लीक से प्रभावित। इसने फाइन-ट्यून किए गए मॉडलों और वाणिज्यिक अनुप्रयोगों की एक लहर को सक्षम किया। मेटा ने कोड जनरेशन के लिए Llama 2 का एक फाइन-ट्यून, कोड लामा भी जारी किया, जिसके संस्करण 24 अगस्त 2023 (7B, 13B, 34B) और 29 जनवरी 2024 (70B) को आए।
Llama 3
18 अप्रैल 2024 को, मेटा ने 8B और 70B पैरामीटर आकारों के साथ Llama 3 जारी किया। इन मॉडलों को लगभग 15 ट्रिलियन टोकन सार्वजनिक रूप से उपलब्ध पाठ पर पूर्व-प्रशिक्षित किया गया था, जिसमें 10 मिलियन से अधिक मानव-एनोटेटेड उदाहरणों पर निर्देश फाइन-ट्यूनिंग की गई थी। मेटा के बेंचमार्क ने दिखाया कि Llama 3 70B ने कई कार्यों पर Gemini Pro 1.5 और Claude 3 Sonnet से बेहतर प्रदर्शन किया। मेटा ने बहुभाषी और मल्टीमॉडल क्षमताओं, लंबे संदर्भ विंडो और बेहतर कोडिंग और तर्क की योजना की घोषणा की।
Llama 3 ने प्रदर्शित किया कि प्रदर्शन चिंचिला-इष्टतम प्रशिक्षण डेटा मात्रा से परे भी लॉग-रैखिक रूप से स्केल करना जारी रखता है। उदाहरण के लिए, 8B मॉडल के लिए चिंचिला-इष्टतम डेटासेट 200 बिलियन टोकन था, लेकिन प्रदर्शन 15 ट्रिलियन टोकन तक सुधर गया। एक साक्षात्कार के दौरान, मार्क जुकरबर्ग ने नोट किया कि 8B मॉडल लगभग सबसे बड़े Llama 2 के रूप में शक्तिशाली था, और 70B मॉडल अभी भी प्रशिक्षण के अंत में सीख रहा था, लेकिन GPU संसाधनों को कहीं और आवंटित करने के लिए प्रशिक्षण रोक दिया गया था।
Llama 3.1 को 23 जुलाई 2024 को जारी किया गया, जिसमें आगे सुधार शामिल थे, जिसमें एक 405B पैरामीटर मॉडल शामिल था, और ओपन-वेट रिलीज़ की प्रवृत्ति जारी रही।
ओपन-सोर्स एआई पर प्रभाव
लामा लीक ने ओपन-सोर्स एआई आंदोलन को उत्प्रेरित किया। लीक से पहले, अत्याधुनिक LLM तक पहुंच काफी हद तक कुछ संगठनों तक सीमित थी। लीक ने स्वतंत्र शोधकर्ताओं और शौकीनों को स्थानीय रूप से मॉडल चलाने और फाइन-ट्यून करने की अनुमति दी, जिससे मॉडल प्रूनिंग, डेटा ऑगमेंटेशन और कुशल अनुमान में नवाचार हुए। इसने ओपन-सोर्स पारिस्थितिकी तंत्रों के निर्माण को भी प्रेरित किया, जैसे हगिंगफेस रिपॉजिटरी और llama.cpp जैसे उपकरण, जिन्होंने CPU-आधारित अनुमान सक्षम किया।
लीक ने मेटा को बाद के संस्करणों के लिए अधिक अनुमेय लाइसेंस अपनाने के लिए भी दबाव डाला, जैसा कि Llama 2 और Llama 3 के साथ देखा गया। इस बदलाव ने मिस्ट्रल एआई जैसी अन्य कंपनियों को ओपन-वेट मॉडल जारी करने के लिए प्रभावित किया। हालांकि, एआई में "ओपन सोर्स" क्या गठित करता है, इस पर बहस जारी रही, ओपन सोर्स इनिशिएटिव जैसे संगठनों ने तर्क दिया कि उपयोग और पुनर्वितरण पर प्रतिबंध ओपन सोर्स परिभाषा का उल्लंघन करते हैं।
प्रतिक्रियाएं और विवाद
लीक पर प्रतिक्रियाएं ध्रुवीकृत थीं। सुरक्षा विशेषज्ञों ने संभावित दुरुपयोग की चेतावनी दी, जैसे फ़िशिंग ईमेल या गलत सूचना उत्पन्न करना। कुछ शोधकर्ताओं ने एआई के लोकतंत्रीकरण का जश्न मनाया, जिससे ऐसे प्रयोग सक्षम हुए जो अन्यथा असंभव होते। लीक ने शक्तिशाली मॉडल जारी करने की नैतिकता के बारे में भी सवाल उठाए, जिससे जिम्मेदार एआई विकास पर चर्चा हुई।
लीक के लिए मेटा की प्रतिक्रिया शुरू में कानूनी थी, लेकिन कंपनी ने अंततः खुलेपन को अपनाया। 2024 तक, मेटा ने लामा को एक अग्रणी ओपन-वेट मॉडल परिवार के रूप में स्थापित किया, जो OpenAI और गूगल डीपमाइंड के बंद मॉडलों के साथ प्रतिस्पर्धा कर रहा था। लीक ने डिजिटल वितरण को नियंत्रित करने की कठिनाई को भी उजागर किया, क्योंकि एक बार वेट्स सार्वजनिक हो जाने के बाद, उन्हें पूरी तरह से वापस नहीं लिया जा सकता।
विरासत
लामा लीक को एआई इतिहास में एक महत्वपूर्ण घटना माना जाता है। इसने ओपन-सोर्स LLM के विकास को तेज किया, जिससे मॉडलों और अनुप्रयोगों का एक विविध पारिस्थितिकी तंत्र बना। इसने एआई विनियमन और खुलेपन और सुरक्षा के बीच संतुलन पर नीति चर्चाओं को भी प्रभावित किया। 2025 तक, लामा मॉडल अनुसंधान और उद्योग में व्यापक रूप से उपयोग किए जाते हैं, और मेटा नए संस्करण जारी करना जारी रखता है, जिसमें अप्रैल 2025 में Llama 4 शामिल है। अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने लामा के प्रतिस्थापन के रूप में म्यूज़ स्पार्क जारी किया, जो मेटा की एआई यात्रा में अगले अध्याय को चिह्नित करता है।
लीक ने प्रदर्शित किया कि खुली पहुंच नवाचार को चला सकती है, लेकिन संभावित नुकसानों पर सावधानीपूर्वक विचार करने की भी आवश्यकता है। यह डिजिटल युग में एआई तकनीक को नियंत्रित करने की चुनौतियों में एक केस स्टडी बना हुआ है।