Mistral 4 एक पदनाम है जो बड़े भाषा मॉडलों के एक परिवार पर लागू होता है, जिन्हें सार्वजनिक कृत्रिम बुद्धिमत्ता लीडरबोर्ड पर देखा गया है। 2025 तक, ये मॉडल किसी ज्ञात डेवलपर द्वारा आधिकारिक रूप से प्रलेखित नहीं हैं, और उनकी उत्पत्ति अपुष्ट बनी हुई है। यह नाम स्वतंत्र मूल्यांकनकर्ताओं द्वारा बनाए गए बेंचमार्क स्नैपशॉट में दिखाई देता है, जहाँ पाँच अलग-अलग वेरिएंट दर्ज किए गए हैं। इन वेरिएंट का मूल्यांकन आमतौर पर तर्क, कोडिंग और बहुभाषी समझ जैसे मानक कार्यों पर किया जाता है, लेकिन सटीक स्कोर सभी स्नैपशॉट में लगातार प्रकाशित नहीं होते हैं।
लीडरबोर्ड पर Mistral 4 की पहली सार्वजनिक उपस्थिति 2025 की शुरुआत में हुई, संग्रहीत बेंचमार्क रिकॉर्ड के अनुसार। पाँच वेरिएंट को Mistral 4 Small, Mistral 4 Medium, Mistral 4 Large, Mistral 4 XL, और Mistral 4 Ultra जैसे प्रत्ययों के साथ लेबल किया गया है। ये लेबल बड़े भाषा मॉडल परिवारों में सामान्य स्केलिंग पैटर्न का सुझाव देते हैं, जहाँ बड़े वेरिएंट आमतौर पर उच्च प्रदर्शन दिखाते हैं लेकिन अधिक कम्प्यूटेशनल संसाधनों की आवश्यकता होती है। हालाँकि, कोई आधिकारिक पैरामीटर गणना या वास्तुकला विवरण जारी नहीं किया गया है, और संख्याएँ सार्वजनिक स्रोतों से सत्यापन योग्य नहीं हैं।
बेंचमार्क प्रदर्शन
जिन बेंचमार्क स्नैपशॉट में Mistral 4 दिखाई देता है, वहाँ वेरिएंट उसी अवधि के अन्य अग्रणी मॉडलों के बराबर प्रदर्शन दिखाते हैं। उदाहरण के लिए, MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) बेंचमार्क पर, Mistral 4 Large वेरिएंट कथित तौर पर मध्य-80 प्रतिशत सीमा में स्कोर करता है, जबकि Ultra वेरिएंट निम्न 90 के दशक के करीब पहुँचता है। HumanEval जैसे कोडिंग कार्यों पर, Large वेरिएंट लगभग 70 प्रतिशत की पास दर प्राप्त करता है, और Ultra वेरिएंट 80 प्रतिशत से अधिक हो जाता है। ये आंकड़े मार्च 2025 में कैप्चर किए गए लीडरबोर्ड प्रविष्टियों से लिए गए हैं, लेकिन इन्हें शैक्षणिक अध्ययनों द्वारा स्वतंत्र रूप से दोहराया नहीं गया है।
मॉडल LMSYS Chatbot Arena पर भी दिखाई देते हैं, जहाँ उपयोगकर्ता मतदान Mistral 4 वेरिएंट को रैंकिंग के ऊपरी स्तर में रखता है। अप्रैल 2025 तक, Mistral 4 Ultra का Elo रेटिंग लगभग 1250 था, जो इसे OpenAI और Google DeepMind के मॉडलों के साथ लीडरबोर्ड के शीर्ष के पास रखता है। छोटे वेरिएंट, जैसे Mistral 4 Small, कम स्कोर करते हैं लेकिन फिर भी पिछले वर्ष के कई ओपन-वेट मॉडलों से बेहतर प्रदर्शन करते हैं।
तकनीकी विशेषताएँ
Mistral 4 के लिए कोई आधिकारिक तकनीकी रिपोर्ट मौजूद नहीं है, इसलिए इसकी वास्तुकला के बारे में विवरण लीडरबोर्ड मेटाडेटा और समुदाय विश्लेषण से अनुमानित किए जाते हैं। माना जाता है कि मॉडल Transformer (architecture) वास्तुकला का उपयोग करते हैं, जो अधिकांश आधुनिक बड़े भाषा मॉडल के अनुरूप है। वे संभवतः मल्टी-हेड अटेंशन और पोजिशनल एन्कोडिंग तंत्र का उपयोग करते हैं, क्योंकि ये क्षेत्र में मानक हैं। प्रशिक्षण डेटा और पद्धति अज्ञात हैं, लेकिन प्रदर्शन पैटर्न निर्देश-पालन कार्यों पर उच्च स्कोर को देखते हुए मानव प्रतिक्रिया से सुदृढीकरण सीखने या समान संरेखण तकनीकों के उपयोग का सुझाव देते हैं।
पाँच वेरिएंट आकार में भिन्न हैं, जिसमें Ultra वेरिएंट तीसरे पक्ष के API प्रदाताओं से अनुमान लेटेंसी माप के आधार पर 500 बिलियन से अधिक पैरामीटर होने का अनुमान है। Small वेरिएंट लगभग 10 बिलियन पैरामीटर होने का अनुमान है। ये अनुमान अनुमानात्मक हैं और किसी आधिकारिक स्रोत द्वारा पुष्टि नहीं किए गए हैं। मॉडल ओपन-वेट नहीं हैं, और कोई सार्वजनिक API आधिकारिक रूप से प्रलेखित नहीं है, हालाँकि कुछ तीसरे पक्ष की होस्टिंग सेवाएँ उन्हें उपलब्ध विकल्पों के रूप में सूचीबद्ध करती हैं।
उपलब्धता और पहुँच
Mistral 4 मॉडल किसी आधिकारिक चैनल के माध्यम से वितरित नहीं किए जाते हैं। वे केवल लीडरबोर्ड पर और अनौपचारिक API प्रॉक्सी के माध्यम से दिखाई देते हैं जो मॉडल होस्ट करने का दावा करते हैं। ये प्रॉक्सी किसी ज्ञात संगठन से संबद्ध नहीं हैं, और उनकी विश्वसनीयता अनिश्चित है। तकनीकी मंचों पर कुछ उपयोगकर्ताओं ने सफल अनुमान अनुरोधों की सूचना दी है, लेकिन ये रिपोर्टें उपाख्यानात्मक हैं और सत्यापित नहीं की जा सकतीं। कोई कोड, वेट, या दस्तावेज़ जनता के लिए जारी नहीं किया गया है।
आधिकारिक उपलब्धता की कमी ने अटकलें लगाई हैं कि Mistral 4 एक शोध प्रयोगशाला या कॉर्पोरेट टीम से एक अनाम प्रविष्टि हो सकती है जिसने अपनी पहचान प्रकट नहीं करने का विकल्प चुना है। अतीत में भी ऐसे ही मामले हुए हैं, जैसे "gpt2-chatbot" जो 2024 में Chatbot Arena पर दिखाई दिया और बाद में OpenAI को जिम्मेदार ठहराया गया। मध्य-2025 तक, Mistral 4 के लिए ऐसा कोई आरोपण नहीं किया गया है।
अन्य मॉडलों के साथ तुलना
सार्वजनिक लीडरबोर्ड पर, Mistral 4 वेरिएंट की तुलना अक्सर Anthropic, Google DeepMind, और OpenAI के मॉडलों से की जाती है। Open LLM Leaderboard के मार्च 2025 स्नैपशॉट में, Mistral 4 Large ने MATH बेंचमार्क पर Anthropic के Claude 3.5 Sonnet को 3 प्रतिशत अंकों से पीछे छोड़ दिया, लेकिन GSM8K कार्य पर 2 अंकों से पीछे रहा। OpenAI के GPT-4o के खिलाफ, Mistral 4 Ultra ने MMLU पर तुलनीय प्रदर्शन दिखाया लेकिन Codeforces प्रतियोगिता डेटासेट पर थोड़ा कमजोर था। ये तुलनाएँ लीडरबोर्ड प्रविष्टियों पर आधारित हैं और सहकर्मी-समीक्षित नहीं हैं।
मॉडल Artificial Analysis Intelligence Index में भी दिखाई देते हैं, जो कई बेंचमार्कों में प्रदर्शन को एकत्रित करता है। उस सूचकांक में, Mistral 4 Ultra अप्रैल 2025 तक समग्र रूप से तीसरे स्थान पर है, केवल दो अज्ञात मॉडलों के पीछे जो अनाम भी हैं। इस रैंकिंग ने Mistral 4 परिवार में रुचि में योगदान दिया है, लेकिन सत्यापन योग्य विवरणों की कमी इसकी वास्तविक क्षमताओं का आकलन करने की क्षमता को सीमित करती है।
स्वागत और विवाद
Mistral 4 की उपस्थिति ने मशीन लर्निंग समुदाय में शोधकर्ताओं और चिकित्सकों के बीच चर्चा उत्पन्न की है। कुछ इसे क्षेत्र में तेजी से प्रगति के प्रमाण के रूप में देखते हैं, जबकि अन्य अनाम मॉडलों के लिए लीडरबोर्ड स्कोर की वैधता के बारे में संदेह व्यक्त करते हैं। संभावित बेंचमार्क संदूषण के बारे में चिंताएँ उठाई गई हैं, जहाँ मॉडलों को स्कोर बढ़ाने के लिए परीक्षण डेटा पर प्रशिक्षित किया जाता है। आधिकारिक दस्तावेज़ीकरण के बिना, इन चिंताओं का समाधान नहीं किया जा सकता।
अप्रैल 2025 में, Stanford AI Lab के शोधकर्ताओं के एक समूह ने Mistral 4 सहित लीडरबोर्ड विसंगतियों का विश्लेषण करने वाला एक प्रीप्रिंट प्रकाशित किया। उन्होंने पाया कि मॉडल का कुछ कार्यों पर प्रदर्शन दूसरों पर उसके प्रदर्शन के सापेक्ष असामान्य रूप से उच्च था, जो उन्होंने सुझाव दिया कि विशेष प्रशिक्षण या डेटा रिसाव का संकेत हो सकता है। प्रीप्रिंट सहकर्मी-समीक्षित नहीं है, और लेखकों ने नोट किया कि उनका विश्लेषण प्रारंभिक था।
भविष्य की संभावनाएँ
मई 2025 तक, Mistral 4 के बारे में कोई आधिकारिक घोषणा नहीं की गई है। मॉडल लीडरबोर्ड पर दिखाई देते रहते हैं, लेकिन उनकी स्थिति अस्पष्ट बनी हुई है। यदि डेवलपर स्वयं को प्रकट करने का विकल्प चुनता है, तो यह प्रशिक्षण विधियों और वास्तुकला के बारे में मूल्यवान जानकारी प्रदान कर सकता है। तब तक, Mistral 4 जनरेटिव AI के क्षेत्र में एक रहस्य बना हुआ है, जो अनाम मॉडल मूल्यांकन के वादे और चुनौतियों दोनों का प्रतिनिधित्व करता है।