Llama 3 बड़े भाषा मॉडल का एक परिवार है, जिसे मेटा एआई द्वारा विकसित किया गया और 18 अप्रैल 2024 को जारी किया गया। यह Llama श्रृंखला का हिस्सा है, जो फरवरी 2023 में शुरू हुई थी, और यह ओपन-वेट मॉडल प्रदर्शन में एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है। प्रारंभिक रिलीज़ में दो मॉडल आकार शामिल थे: 8 बिलियन (8B) और 70 बिलियन (70B) पैरामीटर, जिनमें फाउंडेशन और इंस्ट्रक्शन-ट्यून्ड दोनों संस्करण शामिल थे। Llama 3 मॉडल को सार्वजनिक रूप से उपलब्ध स्रोतों से लगभग 15 ट्रिलियन टोकन पाठ पर पूर्व-प्रशिक्षित किया गया था, जिसमें इंस्ट्रक्शन-ट्यून्ड वेरिएंट को सार्वजनिक निर्देश डेटासेट और 10 मिलियन से अधिक मानव-एनोटेटेड उदाहरणों पर आगे फाइन-ट्यून किया गया था।
Llama 3 अपने पूर्ववर्तियों के वास्तुशिल्प सिद्धांतों पर आधारित है, लेकिन प्रशिक्षण डेटा पैमाने और प्रदर्शन में उल्लेखनीय सुधार पेश करता है। अप्रैल 2024 में मेटा एआई के परीक्षण के अनुसार, 70B मॉडल ने अधिकांश बेंचमार्क पर जेमिनी प्रो 1.5 और क्लॉड 3 सोनेट जैसे प्रतिस्पर्धी मॉडलों से बेहतर प्रदर्शन किया। रिलीज़ ने मेटा एआई के रोलआउट को भी चिह्नित किया, जो Llama पर निर्मित एक एआई सहायक है, जो एक समर्पित वेबसाइट के माध्यम से उपलब्ध है और फेसबुक और व्हाट्सएप में एकीकृत है।
पृष्ठभूमि
Llama 3 का विकास जनरेटिव एआई में तेजी से प्रगति की पृष्ठभूमि में हुआ, विशेष रूप से 2022 के अंत में चैटजीपीटी की रिलीज़ के बाद। चैटजीपीटी की सफलता ने बड़े भाषा मॉडलों में रुचि तेज कर दी, जिससे कंपनियों को इन प्रणालियों को स्केल करने और परिष्कृत करने में भारी निवेश करने के लिए प्रेरित किया। मेटा के मुख्य एआई वैज्ञानिक, यान लेकुन ने पहले व्यक्त किया था कि बड़े भाषा मॉडल लेखन में सहायता के लिए सबसे उपयुक्त हैं, यह दृष्टिकोण Llama मॉडल के डिज़ाइन को प्रभावित करता है।
Llama 3 मॉडल वितरण में मेटा के दृष्टिकोण में बदलाव को भी दर्शाता है। जबकि मूल Llama गैर-वाणिज्यिक लाइसेंस के तहत शैक्षणिक शोधकर्ताओं तक सीमित था, बाद के संस्करणों, जिनमें Llama 3 शामिल है, को कुछ वाणिज्यिक उपयोग की अनुमति देने वाले लाइसेंस के तहत व्यापक दर्शकों के लिए सुलभ बनाया गया। इस खुलेपन ने नवाचार को बढ़ावा दिया है, लेकिन एआई समुदाय में "ओपन सोर्स" की परिभाषा पर बहस भी उठाई है।
वास्तुकला और प्रशिक्षण
Llama 3 मॉडल एक मानक ट्रांसफॉर्मर वास्तुकला का उपयोग करते हैं, जो पहले के Llama संस्करणों के समान है, लेकिन प्रशिक्षण पद्धति में संवर्द्धन के साथ। मॉडलों को 15 ट्रिलियन टोकन के डेटासेट पर प्रशिक्षित किया गया था, जो Llama 2 के लिए उपयोग किए गए 1.4 ट्रिलियन टोकन से काफी वृद्धि है। इस पैमाने ने मॉडलों को विभिन्न प्रकार के कार्यों में बेहतर प्रदर्शन प्राप्त करने की अनुमति दी।
Llama 3 प्रशिक्षण से एक प्रमुख निष्कर्ष स्केलिंग कानूनों से संबंधित था। मॉडलों ने अनुभवजन्य रूप से प्रदर्शित किया कि प्रदर्शन लॉग-रैखिक रूप से सुधारना जारी रखता है, भले ही प्रशिक्षण डेटा "चिंचिला-इष्टतम" मात्रा से अधिक हो। उदाहरण के लिए, 8B मॉडल के लिए चिंचिला-इष्टतम डेटासेट 200 बिलियन टोकन है, लेकिन प्रदर्शन 15 ट्रिलियन टोकन तक बढ़ता रहा, जो 75 गुना बड़ा है। इस अवलोकन का भविष्य के मॉडल प्रशिक्षण रणनीतियों पर प्रभाव है।
ड्वार्केश पटेल के साथ एक साक्षात्कार के दौरान, मेटा सीईओ मार्क जुकरबर्ग ने नोट किया कि Llama 3 का 8B संस्करण लगभग सबसे बड़े Llama 2 मॉडल जितना शक्तिशाली था। उन्होंने यह भी उल्लेख किया कि 70B मॉडल अपने 15 ट्रिलियन टोकन प्रशिक्षण के अंत में अभी भी सीख रहा था, लेकिन GPU संसाधनों को कहीं और आवंटित करने के लिए प्रशिक्षण रोकने का निर्णय लिया गया।
प्रदर्शन और बेंचमार्क
Llama 3 मॉडल ने रिलीज़ के समय कई प्राकृतिक भाषा प्रसंस्करण बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त किए। विशेष रूप से 70B मॉडल ने तर्क, कोडिंग और सामान्य ज्ञान जैसे कार्यों पर जेमिनी प्रो 1.5 और क्लॉड 3 सोनेट सहित कई मालिकाना मॉडलों से बेहतर प्रदर्शन किया। 8B मॉडल, अपने छोटे आकार के बावजूद, प्रतिस्पर्धी प्रदर्शन दिया, जिससे यह कम शक्तिशाली हार्डवेयर पर तैनाती के लिए उपयुक्त हो गया।
मेटा एआई के मूल्यांकन से पता चला कि Llama 3 70B गणितीय तर्क और कोड निर्माण जैसे क्षेत्रों में उत्कृष्ट था, जबकि 8B मॉडल ने दक्षता और क्षमता का एक मजबूत संतुलन पेश किया। इन परिणामों ने Llama 3 को एक अग्रणी ओपन-वेट मॉडल के रूप में स्थापित किया, जो बंद-स्रोत प्रणालियों के प्रभुत्व को चुनौती देता है।
उपलब्धता और पारिस्थितिकी तंत्र
Llama 3 को एक लाइसेंस के तहत जारी किया गया था जो वाणिज्यिक उपयोग की अनुमति देता है, जिसमें एक स्वीकार्य उपयोग नीति है जो कुछ अनुप्रयोगों को प्रतिबंधित करती है। मॉडल मेटा की वेबसाइट से और विभिन्न क्लाउड प्लेटफार्मों के माध्यम से डाउनलोड के लिए उपलब्ध हैं, जिनमें अमेज़न वेब सर्विसेज, एज़्योर और गूगल क्लाउड शामिल हैं। इस पहुंच ने अनुसंधान और उद्योग में व्यापक अपनाने की सुविधा प्रदान की है।
Llama 3 की रिलीज़ मेटा एआई के लॉन्च के साथ भी हुई, एक सहायक जो मॉडल की क्षमताओं का लाभ उठाता है। मेटा एआई फेसबुक, व्हाट्सएप और एक समर्पित वेबसाइट में एकीकृत है, जो उपयोगकर्ताओं को संवादात्मक एआई सेवाएं प्रदान करता है। Llama 3 के आसपास के पारिस्थितिकी तंत्र में फाइन-ट्यूनिंग, क्वांटाइजेशन और तैनाती के लिए उपकरण शामिल हैं, जो डेवलपर्स को विशिष्ट उपयोग मामलों के लिए मॉडल को अनुकूलित करने में सक्षम बनाता है।
विरासत और भविष्य
Llama 3 ने ओपन-वेट बड़े भाषा मॉडल के विकास में एक मील का पत्थर चिह्नित किया, यह प्रदर्शित करते हुए कि ऐसे मॉडल मालिकाना समकक्षों का मुकाबला कर सकते हैं। इसकी सफलता ने बाद के विकास को प्रभावित किया, जिसमें 23 जुलाई 2024 को जारी Llama 3.1 शामिल है, जिसने आगे सुधार पेश किए। Llama श्रृंखला अप्रैल 2025 में Llama 4 के साथ जारी रही, और अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने Llama के प्रतिस्थापन के रूप में Muse Spark जारी किया।
Llama 3 का प्रभाव तकनीकी उपलब्धियों से परे है, क्योंकि इसने एआई सुरक्षा, पहुंच और उन्नत एआई प्रौद्योगिकियों के लोकतंत्रीकरण के बारे में चर्चाओं में योगदान दिया। इसकी ओपन-वेट प्रकृति ने दुनिया भर के शोधकर्ताओं और डेवलपर्स को मॉडल पर प्रयोग करने और निर्माण करने में सक्षम बनाया है, जिससे नवाचार का एक जीवंत पारिस्थितिकी तंत्र विकसित हुआ है।