LLaMA 3 बड़े भाषा मॉडल का एक परिवार है जिसे Meta AI ने 18 अप्रैल 2024 को जारी किया था। यह Llama श्रृंखला की तीसरी पीढ़ी है, जो Llama 2 के बाद आई है, और इसमें दो प्रारंभिक मॉडल आकार शामिल हैं: 8 अरब और 70 अरब पैरामीटर। मॉडलों को सार्वजनिक रूप से उपलब्ध स्रोतों से लगभग 15 ट्रिलियन टोकन पाठ पर पूर्व-प्रशिक्षित किया गया था, जिसमें निर्देश-ट्यून किए गए संस्करण सार्वजनिक निर्देश डेटासेट और 10 मिलियन से अधिक मानव-एनोटेटेड उदाहरणों पर फाइन-ट्यून किए गए थे। LLaMA 3 ने कई बेंचमार्क पर Gemini Pro 1.5 और Claude 3 Sonnet जैसे मालिकाना मॉडलों के खिलाफ प्रतिस्पर्धात्मक प्रदर्शन दिखाया, और Meta ने इसे बहुभाषी, मल्टीमॉडल, और कोडिंग और तर्क में बेहतर बनाने की योजना की घोषणा की।
पृष्ठभूमि
LLaMA 3 का विकास जनरेटिव AI में तेजी से प्रगति के बीच हुआ, जो OpenAI के ChatGPT की सफलता और पहले Llama मॉडलों की रिलीज़ के बाद आया। Meta के मुख्य AI वैज्ञानिक Yann LeCun ने कहा था कि बड़े भाषा मॉडल लेखन में सहायता के लिए सबसे उपयुक्त हैं, जो व्यावहारिक अनुप्रयोगों पर Meta के ध्यान को दर्शाता है। Llama श्रृंखला फरवरी 2023 में मूल LLaMA के साथ शुरू हुई, जो शुरू में केवल शोधकर्ताओं के लिए गैर-वाणिज्यिक लाइसेंस के तहत उपलब्ध थी। BitTorrent के माध्यम से वजन के अनधिकृत रिसाव के बाद, बाद के संस्करण, जिनमें Llama 2 शामिल है, को वाणिज्यिक उपयोग की अनुमति के साथ अधिक सुलभ बनाया गया।
मॉडल आर्किटेक्चर और प्रशिक्षण
LLaMA 3 पिछले Llama मॉडलों में उपयोग किए गए ट्रांसफॉर्मर आर्किटेक्चर को बनाए रखता है, लेकिन प्रशिक्षण डेटा के पैमाने और गुणवत्ता में सुधार के साथ। मॉडलों को 15 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, जो उनके आकार के लिए Chinchilla-इष्टतम मात्रा से काफी अधिक है। उदाहरण के लिए, 8B मॉडल के लिए Chinchilla-इष्टतम डेटासेट 200 अरब टोकन है, फिर भी प्रदर्शन उस मात्रा के 75 गुना तक लॉग-रैखिक रूप से बढ़ता रहा। इस अनुभवजन्य निष्कर्ष ने पहले से इष्टतम माने जाने वाले डेटासेट से बड़े डेटासेट पर प्रशिक्षण के लाभों को उजागर किया। 70B मॉडल प्रशिक्षण के अंत में अभी भी सीख रहा था, लेकिन Meta ने GPU संसाधनों को कहीं और आवंटित करने के लिए रोकने का निर्णय लिया। मॉडलों को Adam ऑप्टिमाइज़र और गहन शिक्षण में सामान्य अन्य तकनीकों का उपयोग करके प्रशिक्षित किया गया था।
रिलीज़ और उपलब्धता
LLaMA 3 को 18 अप्रैल 2024 को जारी किया गया था, जिसमें फाउंडेशन और निर्देश-ट्यून दोनों संस्करणों के लिए वजन उपलब्ध थे। मूल LLaMA के विपरीत, जिसे मामले-दर-मामले अनुमोदन की आवश्यकता थी, LLaMA 3 को वाणिज्यिक उपयोग की अनुमति देने वाले लाइसेंस के तहत उपलब्ध कराया गया था, हालांकि स्वीकार्य उपयोग नीतियों के साथ जो कुछ लोग तर्क देते हैं कि इसे वास्तव में ओपन सोर्स होने से रोकती हैं। रिलीज़ में Meta AI के लिए एक समर्पित वेबसाइट, LLaMA 3 पर निर्मित एक सहायक, और Facebook और WhatsApp में एकीकरण शामिल था। Meta ने बड़े मॉडलों और विस्तारित क्षमताओं के लिए भविष्य की योजनाओं की भी घोषणा की।
प्रदर्शन और स्वागत
Meta के आंतरिक परीक्षण में, LLaMA 3 70B ने अधिकांश बेंचमार्क पर Google DeepMind के Gemini Pro 1.5 और Anthropic के Claude 3 Sonnet से बेहतर प्रदर्शन किया। Mark Zuckerberg ने बताया कि 8B मॉडल लगभग सबसे बड़े Llama 2 मॉडल जितना शक्तिशाली था। रिलीज़ को AI समुदाय में अच्छी तरह से प्राप्त किया गया, कई लोगों ने उच्च-प्रदर्शन मॉडलों की खुली उपलब्धता की प्रशंसा की। हालांकि, कुछ टिप्पणीकारों ने नोट किया कि लाइसेंस प्रतिबंधों का मतलब था कि यह पूरी तरह से ओपन सोर्स नहीं था, एक बिंदु जो Open Source Initiative द्वारा भी उठाया गया था। LLaMA 3 की सफलता ने ओपन-वेट मॉडलों के प्रसार में योगदान दिया और बाद की रिलीज़ों को प्रभावित किया, जिसमें जुलाई 2024 में Llama 3.1 और अप्रैल 2025 में Llama 4 शामिल हैं।
प्रभाव और विरासत
LLaMA 3 की रिलीज़ ने मालिकाना प्रणालियों को चुनौती देने वाले ओपन-वेट मॉडलों की प्रवृत्ति को मजबूत किया। इसके प्रशिक्षण डेटा का पैमाना और प्रदर्शन ने मॉडल विकास में डेटा की मात्रा के महत्व को प्रदर्शित किया। Hugging Face जैसे प्लेटफार्मों और AWS और Azure जैसी क्लाउड सेवाओं के माध्यम से मॉडल की उपलब्धता ने व्यापक अपनाने की सुविधा प्रदान की। अप्रैल 2026 में, Meta Superintelligence Labs ने Llama के प्रतिस्थापन के रूप में Muse Spark जारी किया, जो Llama श्रृंखला के अंत का प्रतीक है। फिर भी, LLaMA 3 कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के विकास में एक महत्वपूर्ण मील का पत्थर बना हुआ है।