अंग्रेज़ी से अनुवादित

मेटा लामा 4, जो अप्रैल 2025 में जारी हुआ, एक देशी मल्टीमॉडल बड़ा भाषा मॉडल है जिसमें 10 मिलियन टोकन का संदर्भ विंडो है, जो लामा 3 के बाद और 2026 में म्यूज़ स्पार्क से पहले आया।

Meta Llama 4 बड़े भाषा मॉडलों का एक परिवार है जिसे Meta AI द्वारा विकसित किया गया है, जिसे अप्रैल 2025 में Llama 3 के उत्तराधिकारी के रूप में जारी किया गया था। यह एक मूल मल्टीमॉडल मॉडल होने के लिए उल्लेखनीय है, जो पाठ और छवियों को संसाधित और उत्पन्न करने में सक्षम है, और इसके 10 मिलियन टोकन के विस्तारित संदर्भ विंडो के लिए, जो इसे एक ही पास में बहुत लंबे दस्तावेज़ों या मल्टीमॉडल इनपुट को संभालने की अनुमति देता है। यह रिलीज़ मेटा की ओपन-वेट वितरण रणनीति को जारी रखती है, जिससे मॉडल एक लाइसेंस के तहत अनुसंधान और वाणिज्यिक उपयोग के लिए उपलब्ध होते हैं जो कई अनुप्रयोगों की अनुमति देता है, हालांकि ओपन सोर्स इनिशिएटिव की परिभाषा के अनुसार पूरी तरह से ओपन सोर्स नहीं है।

Llama श्रृंखला फरवरी 2023 में Llama 1 के प्रारंभिक रिलीज़ के साथ शुरू हुई, जो केवल शोधकर्ताओं के लिए एक गैर-वाणिज्यिक लाइसेंस के तहत उपलब्ध थी, लेकिन इसके वेट शीघ्र ही बिटटोरेंट के माध्यम से सार्वजनिक रूप से लीक हो गए। जुलाई 2023 में Llama 2 से शुरू होने वाले बाद के संस्करण, अधिक अनुमेय लाइसेंस के साथ जारी किए गए, जिससे वाणिज्यिक उपयोग की अनुमति मिली। अप्रैल 2024 में जारी Llama 3 ने 70 बिलियन पैरामीटर तक के मॉडल पेश किए और 15 ट्रिलियन टोकन पर प्रशिक्षित किया गया। Llama 4 ने इस नींव पर निर्माण किया, मूल मल्टीमॉडलिटी और नाटकीय रूप से बड़ी संदर्भ विंडो जोड़ते हुए, इसे OpenAI, Anthropic, और Google DeepMind के मॉडलों के लिए एक प्रतिस्पर्धी प्रतिक्रिया के रूप में स्थापित किया।

पृष्ठभूमि

Llama 4 का विकास Large language model क्षमताओं में तेजी से प्रगति के संदर्भ में हुआ। नवंबर 2022 में ChatGPT की रिलीज़ ने जनरेटिव एआई में रुचि और निवेश में वृद्धि को बढ़ावा दिया, जिससे तकनीकी कंपनियों के बीच अधिक शक्तिशाली और कुशल मॉडल बनाने की होड़ शुरू हो गई। मेटा के मुख्य एआई वैज्ञानिक, यान लेकुन ने पहले बड़े भाषा मॉडलों की अंतिम क्षमता के बारे में संदेह व्यक्त किया था, यह सुझाव देते हुए कि वे सामान्य बुद्धि प्राप्त करने के बजाय लेखन में सहायता के लिए सबसे उपयुक्त हैं। फिर भी, मेटा ने अपनी Llama श्रृंखला में भारी निवेश जारी रखा, जिसका उद्देश्य ओपन-वेट विकल्पों की पेशकश करके मालिकाना मॉडलों के साथ प्रतिस्पर्धा करना था।

2025 तक, परिदृश्य में OpenAI से GPT-4, Anthropic से Claude, और Google DeepMind से Gemini जैसे मॉडल शामिल थे, जो सभी Transformer (architecture) आर्किटेक्चर के साथ संभव की सीमाओं को आगे बढ़ा रहे थे। Llama 4 के साथ मेटा का दृष्टिकोण खुले एक्सेस और तकनीकी नवाचारों के माध्यम से अंतर करना था, जैसे कि मूल मल्टीमॉडलिटी और एक अत्यंत लंबी संदर्भ विंडो, जो दस्तावेज़ विश्लेषण, कोड जनरेशन और मल्टीमॉडल तर्क में नए अनुप्रयोगों को सक्षम कर सकती है।

आर्किटेक्चर और क्षमताएं

Llama 4 को एक मूल मल्टीमॉडल मॉडल के रूप में डिज़ाइन किया गया था, जिसका अर्थ है कि इसे शुरू से ही पाठ और छवि डेटा दोनों पर प्रशिक्षित किया गया था, न कि दृष्टि क्षमताओं को बाद में जोड़कर। यह दृष्टिकोण मॉडल को मोडैलिटी में सामग्री को समझने और उत्पन्न करने की अनुमति देता है, जिससे छवि कैप्शनिंग, दृश्य प्रश्न उत्तर, और इंटरलीव्ड टेक्स्ट-इमेज जनरेशन जैसे कार्य सक्षम होते हैं। मॉडल का आर्किटेक्चर Transformer (architecture) ढांचे पर आधारित है, जिसमें मल्टीमॉडल इनपुट और आउटपुट का समर्थन करने के लिए संशोधन किए गए हैं।

Llama 4 की सबसे महत्वपूर्ण विशेषताओं में से एक इसकी 10 मिलियन टोकन संदर्भ विंडो है। यह पिछले मॉडलों की तुलना में एक महत्वपूर्ण वृद्धि है, जो आमतौर पर 128,000 टोकन या उससे कम की संदर्भ विंडो का समर्थन करते थे। बड़ी संदर्भ विंडो मॉडल को एक ही पास में पूरी किताबें, लंबे कोडबेस, या व्यापक मल्टीमॉडल दस्तावेज़ों को संसाधित करने की अनुमति देती है, जिससे सुसंगतता में सुधार होता है और चंकिंग या सारांशीकरण की आवश्यकता कम होती है। यह क्षमता Positional Encoding और Multi-Head Attention में प्रगति के कारण संभव हुई जो लंबे अनुक्रमों के कुशल संचालन को सक्षम बनाती है।

Llama 4 कई आकारों में जारी किया गया था, जिसमें एज डिवाइसों के लिए उपयुक्त छोटे मॉडल से लेकर क्लाउड तैनाती के लिए बड़े मॉडल तक शामिल थे। सटीक पैरामीटर संख्या पूरी तरह से प्रकट नहीं की गई थी, लेकिन परिवार में पिछले संस्करणों में देखे गए स्केलिंग रुझानों के बाद, अरबों से सैकड़ों अरबों पैरामीटर वाले मॉडल शामिल थे। मॉडलों को सार्वजनिक रूप से उपलब्ध पाठ और छवियों के विविध डेटासेट पर प्रशिक्षित किया गया था, जिसमें प्रदर्शन में सुधार के लिए उच्च-गुणवत्ता वाले डेटा पर ध्यान केंद्रित किया गया था।

प्रशिक्षण और डेटा

Meta AI ने Llama 4 को सार्वजनिक रूप से उपलब्ध डेटा के एक बड़े कॉर्पस पर प्रशिक्षित किया, जिसमें वेब टेक्स्ट, किताबें, कोड और छवियां शामिल थीं। प्रशिक्षण प्रक्रिया में Deep learning तकनीकें जैसे Adam (Optimizer) और Learning Rate Scheduling शामिल थीं ताकि मॉडल के पैरामीटर को अनुकूलित किया जा सके। Data Augmentation और Curriculum Learning के उपयोग ने सामान्यीकरण और मजबूती में सुधार करने में मदद की। मॉडलों को फाउंडेशन मॉडल के रूप में पूर्व-प्रशिक्षित किया गया था और फिर निर्देश-अनुसरण डेटा के साथ ठीक-ट्यून किया गया, उपयोगकर्ता इरादे के साथ संरेखित करने के लिए Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखना) जैसे तरीकों का उपयोग करके।

प्रशिक्षण डेटा को भाषाओं और डोमेन की एक विस्तृत श्रृंखला शामिल करने के लिए क्यूरेट किया गया था, जिससे Llama 4 बहुभाषी और विविध कार्यों को संभालने में सक्षम हो गया। छवि डेटा को शामिल करने के लिए मल्टीमॉडल इनपुट को संभालने के लिए नई प्रशिक्षण पाइपलाइनों के विकास की आवश्यकता थी, जिसमें विभिन्न मोडैलिटी से जानकारी को फ्यूज करने के लिए Cross-Attention तंत्र शामिल थे। मेटा ने बड़े पैमाने पर क्लस्टरों पर प्रशिक्षण को स्थिर करने के लिए Gradient Clipping और Batch Normalization जैसी तकनीकों का भी उपयोग किया।

रिलीज़ और उपलब्धता

Llama 4 की घोषणा अप्रैल 2025 में की गई थी, जिसमें मॉडल मेटा की वेबसाइट और साझेदार प्लेटफार्मों से डाउनलोड के लिए उपलब्ध कराए गए थे। रिलीज़ में पिछले Llama रिलीज़ के समान, फाउंडेशन मॉडल और निर्देश-ट्यून किए गए संस्करण दोनों शामिल थे। वेट एक लाइसेंस के तहत वितरित किए गए थे जो वाणिज्यिक उपयोग की अनुमति देता था, लेकिन एक स्वीकार्य उपयोग नीति के साथ जो कुछ अनुप्रयोगों, जैसे स्पैम जनरेशन या निगरानी को प्रतिबंधित करता था। इससे इस बारे में निरंतर बहस हुई कि क्या मॉडलों को वास्तव में ओपन सोर्स माना जा सकता है, क्योंकि OpenPanel और अन्य संगठनों ने बताया कि लाइसेंस ओपन सोर्स परिभाषा को पूरा नहीं करता था।

मेटा ने Llama 4 को अपने मेटा एआई सहायक में भी एकीकृत किया, जो फेसबुक, व्हाट्सएप और एक समर्पित वेबसाइट पर उपलब्ध है। इसने उपयोगकर्ताओं को सवालों के जवाब देने, सामग्री उत्पन्न करने और छवियों का विश्लेषण करने जैसे कार्यों के लिए मॉडल के साथ बातचीत करने की अनुमति दी। रिलीज़ के साथ बेंचमार्क भी थे जो दिखाते थे कि Llama 4 विभिन्न प्राकृतिक भाषा प्रसंस्करण और मल्टीमॉडल कार्यों पर OpenAI, Anthropic और Google DeepMind के प्रमुख मॉडलों के साथ प्रतिस्पर्धात्मक रूप से प्रदर्शन करता है।

स्वागत और प्रभाव

Llama 4 के लॉन्च को एआई समुदाय से महत्वपूर्ण रुचि मिली, विशेष रूप से इसकी मूल मल्टीमॉडलिटी और लंबी संदर्भ विंडो के कारण। शोधकर्ताओं और डेवलपर्स ने ओपन-वेट दृष्टिकोण की प्रशंसा की, जिसने कस्टम हार्डवेयर पर ठीक-ट्यूनिंग और तैनाती की अनुमति दी, जिसमें AMD और Intel चिप्स, साथ ही Amazon Web Services, Microsoft Azure, और Google Cloud जैसे क्लाउड प्लेटफार्म शामिल थे। 10 मिलियन टोकन को संभालने की मॉडल की क्षमता ने कानूनी दस्तावेज़ समीक्षा, वैज्ञानिक अनुसंधान और सॉफ्टवेयर इंजीनियरिंग में अनुप्रयोगों के लिए नई संभावनाएं खोलीं।

हालांकि, कुछ आलोचकों ने नोट किया कि कुछ बेंचमार्क पर मॉडल का प्रदर्शन हमेशा छोटे, अधिक विशिष्ट मॉडलों से बेहतर नहीं था, और इतनी बड़ी संदर्भ विंडो के साथ अनुमान के लिए आवश्यक कम्प्यूटेशनल संसाधन निषेधात्मक हो सकते हैं। रिलीज़ ने मॉडल की मल्टीमॉडल क्षमताओं को देखते हुए, भ्रामक सामग्री या डीपफेक उत्पन्न करने जैसे दुरुपयोग की संभावना के बारे में भी चिंताएं उठाईं। मेटा ने सुरक्षा फिल्टर लागू करके और जिम्मेदार उपयोग के लिए दिशानिर्देश प्रदान करके इन चिंताओं को संबोधित किया।

प्रतिस्पर्धियों के साथ तुलना

Llama 4 एक प्रतिस्पर्धी बाजार में प्रवेश किया जहां OpenAI का GPT-4, Anthropic का Claude 3, और Google DeepMind का Gemini पहले से ही स्थापित थे। इनमें से प्रत्येक मॉडल की अपनी ताकत थी: GPT-4 अपने सामान्य तर्क और कोडिंग क्षमताओं के लिए जाना जाता था, Claude 3 अपने लंबे संदर्भ और सुरक्षा सुविधाओं के लिए, और Gemini अपने मल्टीमॉडल एकीकरण के लिए। Llama 4 के प्रमुख अंतर इसका ओपन-वेट वितरण था, जो अनुकूलन और स्थानीय तैनाती की अनुमति देता था, और इसकी 10 मिलियन टोकन संदर्भ विंडो, जो उस समय अधिकांश प्रतिस्पर्धियों से अधिक थी।

प्रदर्शन के संदर्भ में, Llama 4 के बेंचमार्क ने दिखाया कि यह Machine learning बेंचमार्क जैसे कार्यों पर प्रतिस्पर्धी था, लेकिन हमेशा शीर्ष स्कोरर नहीं था। मॉडल की ओपन-वेट प्रकृति ने इसे शोधकर्ताओं के लिए आकर्षक बना दिया जो मॉडल का अध्ययन या ठीक-ट्यून करना चाहते थे, और उन कंपनियों के लिए जो विक्रेता लॉक-इन से बचना पसंद करती थीं। रिलीज़ ने कुशल अनुमान तकनीकों में नवाचार को भी बढ़ावा दिया, क्योंकि डेवलपर्स ने सीमित हार्डवेयर पर बड़े मॉडल चलाने की मांग की।

भविष्य की दिशाएं

Llama 4 की रिलीज़ के बाद, मेटा ने अपने एआई अनुसंधान में निवेश जारी रखा, मॉडल के तर्क, कोडिंग और बहुभाषी क्षमताओं में सुधार की योजना के साथ। कंपनी ने प्रशिक्षण और अनुमान की कम्प्यूटेशनल लागत को कम करने के तरीकों का भी पता लगाया, संभावित रूप से AWS Trainium या Groq एक्सेलेरेटर जैसे विशेष हार्डवेयर का उपयोग करके। अप्रैल 2026 में, मेटा सुपरइंटेलिजेंस लैब्स ने Llama के प्रतिस्थापन के रूप में Muse Spark जारी किया, जो और भी अधिक क्षमताओं वाले अधिक उन्नत मॉडलों की ओर एक बदलाव का संकेत देता है। Muse Spark से Llama 4 से सीखे गए पाठों पर निर्माण करने की उम्मीद थी, एआई में संभव की सीमाओं को आगे बढ़ाने के लिए नए आर्किटेक्चर और प्रशिक्षण तकनीकों को शामिल करते हुए।

Llama 4 की विरासत इसके प्रदर्शन में निहित है कि ओपन-वेट मॉडल मालिकाना मॉडलों के साथ प्रतिस्पर्धा कर सकते हैं, और यह कि मूल मल्टीमॉडलिटी और लंबी संदर्भ विंडो बड़े पैमाने पर व्यवहार्य हैं। इसने एआई विकास में खुलेपन और सुरक्षा के बीच चल रहे तनाव को भी उजागर किया, एक बहस जो क्षेत्र को आकार देती रहती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-model-release·meta-ai·large-language-model·multimodal-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास