लामा लीक और ओपन-सोर्सिंग मार्च 2023 में मेटा एआई के LLaMA (लार्ज लैंग्वेज मॉडल मेटा एआई) वेट्स के बिटटोरेंट के माध्यम से अनधिकृत वितरण को संदर्भित करती है, जिसने एआई पहुंच में बदलाव को उत्प्रेरित किया। इस लीक ने दुनिया भर के शोधकर्ताओं और डेवलपर्स को मॉडल का उपयोग और संशोधन करने की अनुमति दी, जिससे ओपन-सोर्स व्युत्पन्न मॉडलों का प्रसार हुआ और मेटा के बाद के संस्करणों को अधिक अनुमेय लाइसेंस के तहत जारी करने के निर्णय को प्रभावित किया। इस घटना की तुलना अक्सर टेक्स्ट-टू-इमेज डोमेन में स्टेबल डिफ्यूजन की रिलीज़ से की जाती है, क्योंकि इसने बड़े भाषा मॉडलों तक पहुंच को लोकतांत्रिक बनाया और क्षेत्र में नवाचार को बढ़ावा दिया।
मेटा प्लेटफॉर्म्स की सहायक कंपनी मेटा एआई ने फरवरी 2023 में LLaMA को 1 बिलियन से 2 ट्रिलियन पैरामीटर तक के बड़े भाषा मॉडलों के परिवार के रूप में पेश किया। प्रारंभ में, मॉडल वेट्स केवल शैक्षणिक शोधकर्ताओं के लिए गैर-वाणिज्यिक लाइसेंस के तहत मामले-दर-मामले आधार पर उपलब्ध थे। लीक ने इन प्रतिबंधों को दरकिनार कर दिया, जिससे वेट्स सार्वजनिक रूप से सुलभ हो गए और ओपन-सोर्स एआई और इसके निहितार्थों पर व्यापक चर्चा शुरू हो गई।
पृष्ठभूमि
लामा लीक से पहले, कृत्रिम बुद्धिमत्ता के क्षेत्र में ओपनएआई जैसी कंपनियों के स्वामित्व वाले मॉडलों का वर्चस्व था, जिन्होंने 2020 में GPT-3 और नवंबर 2022 में ChatGPT जारी किया था। ChatGPT की सफलता ने बड़े भाषा मॉडलों की क्षमताओं को उजागर किया और प्रतिस्पर्धा को तेज किया। मेटा के मुख्य एआई वैज्ञानिक, यान लेकुन ने सार्वजनिक रूप से कहा कि बड़े भाषा मॉडल लेखन में सहायता के लिए सबसे उपयुक्त हैं, जिससे मेटा का दृष्टिकोण अन्य तकनीकी दिग्गजों से अलग स्थापित हुआ।
LLaMA का विकास मेटा के Machine learning और Deep learning में व्यापक शोध प्रयासों का हिस्सा था। मॉडल को सार्वजनिक रूप से उपलब्ध डेटा पर प्रशिक्षित किया गया था, जिसमें दक्षता और पहुंच पर ध्यान केंद्रित किया गया था। मेटा का लक्ष्य एक ऐसा मॉडल बनाना था जो उपभोक्ता हार्डवेयर पर चल सके, जिससे यह GPT-3 जैसे बड़े मॉडलों की तुलना में अधिक सुलभ हो, जिन्हें महत्वपूर्ण कम्प्यूटेशनल संसाधनों की आवश्यकता थी।
प्रारंभिक रिलीज़ और लीक
LLaMA की घोषणा 24 फरवरी 2023 को एक ब्लॉग पोस्ट और इसकी वास्तुकला और प्रदर्शन का विवरण देने वाले एक पेपर के माध्यम से की गई थी। अनुमान कोड को ओपन-सोर्स GPLv3 लाइसेंस के तहत जारी किया गया था, लेकिन मॉडल वेट्स एक आवेदन प्रक्रिया के पीछे गेटेड थे। मेटा ने कहा कि शैक्षणिक शोधकर्ताओं, सरकार, नागरिक समाज और उद्योग अनुसंधान प्रयोगशालाओं को मामले-दर-मामले आधार पर पहुंच प्रदान की जाएगी।
3 मार्च 2023 को, LLaMA के वेट्स वाला एक टोरेंट अपलोड किया गया, जिसका लिंक 4chan इमेजबोर्ड पर साझा किया गया और बाद में ऑनलाइन एआई समुदायों में फैल गया। उसी दिन, आधिकारिक लामा रिपॉजिटरी पर एक पुल रिक्वेस्ट ने दस्तावेज़ीकरण में मैग्नेट लिंक जोड़ने का अनुरोध किया। 4 मार्च को, एक और पुल रिक्वेस्ट ने मॉडल होस्ट करने वाले हगिंगफेस रिपॉजिटरी के लिंक जोड़े। मेटा ने 6 मार्च को वितरण को अनधिकृत बताते हुए टेकडाउन अनुरोध दायर किए, और हगिंगफेस ने अनुपालन किया। 20 मार्च को, मेटा ने डाउनलोड स्क्रिप्ट वाले एक रिपॉजिटरी के खिलाफ DMCA टेकडाउन दायर किया, और गिटहब ने अगले दिन अनुपालन किया।
लीक पर प्रतिक्रियाएं मिश्रित थीं। कुछ ने परिष्कृत स्पैम जैसे संभावित दुर्भावनापूर्ण उपयोगों के बारे में चिंता व्यक्त की। अन्य ने पहुंच का जश्न मनाया, यह देखते हुए कि मॉडल के छोटे संस्करण अपेक्षाकृत सस्ते में चलाए जा सकते हैं, जिससे आगे शोध को बढ़ावा मिला। साइमन विलिसन जैसे टिप्पणीकारों ने लामा की तुलना स्टेबल डिफ्यूजन से की, जो एक खुले तौर पर वितरित टेक्स्ट-टू-इमेज मॉडल है जिसने तेजी से उपकरण प्रसार को जन्म दिया।
लामा 2: खोलना
18 जुलाई 2023 को, मेटा ने माइक्रोसॉफ्ट के साथ साझेदारी में लामा 2 की घोषणा की। यह संस्करण तीन आकारों में आया: 7, 13 और 70 बिलियन पैरामीटर। वास्तुकला काफी हद तक लामा 1 से अपरिवर्तित रही, लेकिन प्रशिक्षण डेटा में 40% की वृद्धि की गई। लामा 2 में फाउंडेशन मॉडल और चैट फाइन-ट्यून संस्करण दोनों शामिल थे। मूल के विपरीत, सभी मॉडल वेट्स के साथ जारी किए गए और वाणिज्यिक उपयोग की अनुमति दी गई, हालांकि लाइसेंस में एक स्वीकार्य उपयोग नीति शामिल थी, जिससे ओपन सोर्स इनिशिएटिव से "ओपन सोर्स" शब्द पर विवाद हुआ।
कोड लामा, कोड जनरेशन के लिए लामा 2 का एक फाइन-ट्यून, 24 अगस्त 2023 को 7B, 13B और 34B आकारों में जारी किया गया था, जिसमें 29 जनवरी 2024 को 70B संस्करण शामिल था। प्रशिक्षण में अतिरिक्त 500B टोकन कोड डेटा और 20B टोकन लंबे-संदर्भ डेटा शामिल थे, जिसमें पायथन-विशिष्ट संस्करण 100B टोकन पायथन कोड पर प्रशिक्षित था।
लामा 3 और स्केलिंग लॉ
18 अप्रैल 2024 को, मेटा ने 8B और 70B पैरामीटर आकारों के साथ लामा 3 जारी किया। मॉडलों को लगभग 15 ट्रिलियन टोकन सार्वजनिक रूप से उपलब्ध पाठ पर पूर्व-प्रशिक्षित किया गया था, जिसमें 10 मिलियन से अधिक मानव-एनोटेटेड उदाहरणों पर निर्देश फाइन-ट्यूनिंग की गई थी। मेटा के परीक्षण से पता चला कि लामा 3 70B ने अधिकांश बेंचमार्क पर जेमिनी प्रो 1.5 और क्लाउड 3 सोनेट को पीछे छोड़ दिया। मेटा ने बहुभाषी और मल्टीमॉडल क्षमताओं, बेहतर कोडिंग और तर्क, और एक बड़े संदर्भ विंडो की योजना की घोषणा की।
लामा 3 ने प्रदर्शित किया कि प्रदर्शन चिंचिला-इष्टतम डेटा मात्रा से परे लॉग-रैखिक रूप से स्केल करना जारी रखता है। उदाहरण के लिए, 8B मॉडल का इष्टतम डेटासेट 200 बिलियन टोकन था, लेकिन प्रदर्शन 15 ट्रिलियन टोकन तक सुधर गया। मार्क जुकरबर्ग ने नोट किया कि 70B मॉडल प्रशिक्षण के अंत में भी सीख रहा था, और रोकने का निर्णय GPU संसाधनों को कहीं और आवंटित करने के लिए किया गया था।
लामा 3.1 को 23 जुलाई 2024 को आगे के सुधारों के साथ जारी किया गया था।
प्रभाव और व्युत्पन्न
लामा के लीक और बाद के ओपन-सोर्सिंग ने व्युत्पन्न मॉडलों और उपकरणों में वृद्धि की। वेट्स की पहुंच ने शोधकर्ताओं को विशिष्ट कार्यों के लिए लामा को फाइन-ट्यून करने की अनुमति दी, जिससे Generative AI और Large language model अनुप्रयोगों में नवाचार हुए। इस घटना ने मेटा की रणनीति को भी प्रभावित किया, क्योंकि कंपनी ने प्रत्येक पुनरावृत्ति के साथ अधिक खुले दृष्टिकोण को अपनाया।
स्टेबल डिफ्यूजन से तुलना उपयुक्त है: दोनों मॉडल, जब खुले तौर पर वितरित किए गए, ने रचनात्मक विस्फोट को जन्म दिया। लामा के मामले में, लीक ने हल्के मॉडलों के विकास को सक्षम किया जो उपभोक्ता हार्डवेयर पर चल सकते थे, जिससे एआई क्षमताओं तक पहुंच का लोकतंत्रीकरण हुआ जो पहले बड़े निगमों तक सीमित थी।
एआई पहुंच के लिए व्यापक निहितार्थ
लामा लीक ने एआई विकास में स्वामित्व नियंत्रण और खुली पहुंच के बीच तनाव को उजागर किया। जबकि मेटा ने शुरू में पहुंच को प्रतिबंधित करने की मांग की, लीक ने जारी होने के बाद मॉडल वेट्स को नियंत्रित करने की कठिनाई का प्रदर्शन किया। इसका अन्य एआई कंपनियों, जैसे OpenAI और Anthropic, के लिए निहितार्थ है, जिन्होंने खुलेपन की अलग-अलग डिग्री अपनाई है।
इस घटना ने ओपन-सोर्स एआई पर बहस में भी योगदान दिया, जिसमें समर्थकों ने तर्क दिया कि खुली पहुंच नवाचार और पारदर्शिता को बढ़ावा देती है, जबकि आलोचकों ने संभावित दुरुपयोग की चेतावनी दी। OpenPanel और अन्य संगठनों ने संतुलित नीतियों की आवश्यकता पर विचार व्यक्त किया है।
विरासत और भविष्य
2025 तक, मेटा ने अप्रैल 2025 में लामा 4 जारी किया, जो ओपन-सोर्सिंग की प्रवृत्ति को जारी रखता है। अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने लामा के प्रतिस्थापन के रूप में म्यूज़ स्पार्क जारी किया, जो एक नई दिशा का संकेत देता है। लामा लीक एआई इतिहास में एक महत्वपूर्ण क्षण बना हुआ है, जो समुदाय-संचालित वितरण की शक्ति और उन्नत तकनीक को नियंत्रित करने की चुनौतियों को प्रदर्शित करता है।
लीक की विरासत ओपन-सोर्स मॉडलों के संपन्न पारिस्थितिकी तंत्र में स्पष्ट है, जिसमें mistral से Falcon तक शामिल हैं, जिन्होंने लामा की नींव पर निर्माण किया है। इस घटना ने नीति चर्चाओं को भी प्रभावित किया, जिसमें सरकारें और संस्थान एआई में नवाचार और सुरक्षा को संतुलित करने पर विचार कर रहे हैं।
निष्कर्ष
लामा लीक और ओपन-सोर्सिंग ने एआई पहुंच में एक महत्वपूर्ण मोड़ चिह्नित किया, एक प्रतिबंधित शोध मॉडल को व्यापक रूप से उपयोग किए जाने वाले खुले संसाधन में बदल दिया। इस घटना ने ओपन-सोर्स एआई के विकास को तेज किया और प्रौद्योगिकी के भविष्य को आकार देने में समुदाय की भागीदारी के महत्व को उजागर किया। जैसे-जैसे एआई विकसित होता रहेगा, लामा लीक से सीखे गए पाठ संभवतः मॉडल रिलीज़ और शासन पर भविष्य के निर्णयों को सूचित करेंगे।