Grok 4.6 बड़े भाषा मॉडल का एक परिवार है, जिसे xAI द्वारा विकसित किया गया है, जो 2023 में एलन मस्क द्वारा स्थापित एक कंपनी है। यह मॉडल परिवार सार्वजनिक LLM और मीडिया लीडरबोर्ड पर दिखाई दिया है, जिसमें LMArena (पूर्व में Chatbot Arena) लीडरबोर्ड शामिल है, जहां इसे बेंचमार्क स्नैपशॉट में ट्रैक किया गया है। 2025 की शुरुआत तक, Grok 4.6 जारी नहीं किया गया है; xAI द्वारा कोई आधिकारिक घोषणा, तकनीकी रिपोर्ट, या सार्वजनिक API प्रदान नहीं किया गया है। लीडरबोर्ड पर इसकी उपस्थिति अनाम अखाड़ा प्रविष्टियों पर आधारित है, जहां मॉडलों का मूल्यांकन मानव मतदाताओं द्वारा अंध युग्मवार तुलना के माध्यम से किया जाता है।
Grok 4.6 के नौ अलग-अलग वेरिएंट बेंचमार्क स्नैपशॉट में पहचाने गए हैं, जिनमें से प्रत्येक पैरामीटर, क्वांटाइजेशन, या सर्विंग कॉन्फ़िगरेशन में भिन्न है। इन वेरिएंट को आमतौर पर -small, -large, या -fp8 जैसे प्रत्ययों के साथ लेबल किया जाता है, जो मॉडल आकार या परिशुद्धता में अंतर दर्शाते हैं। इन वेरिएंट की सटीक विशिष्टताएं सार्वजनिक रूप से प्रलेखित नहीं हैं, क्योंकि xAI ने Grok 4.6 के लिए आधिकारिक मॉडल कार्ड या वेट जारी नहीं किए हैं।
लीडरबोर्ड प्रदर्शन
LMArena लीडरबोर्ड पर, Grok 4.6 वेरिएंट ने कोडिंग, गणित, और सामान्य तर्क जैसी श्रेणियों में शीर्ष प्रदर्शन करने वाले मॉडलों में लगातार स्थान बनाया है। 2024 के अंत के विशिष्ट बेंचमार्क स्नैपशॉट में, सबसे उच्च रैंक वाले Grok 4.6 वेरिएंट ने 1350 से अधिक का एलो रेटिंग हासिल की, जो इसे OpenAI, Anthropic, और Google DeepMind के मॉडलों के साथ शीर्ष स्तर पर रखता है। हालांकि, क्योंकि मॉडल अनाम है, ये रेटिंग अस्थायी हैं और अधिक वोट एकत्र होने पर परिवर्तन के अधीन हैं।
मीडिया लीडरबोर्ड, जैसे कि Artificial Analysis, ने भी अपनी रैंकिंग में Grok 4.6 को शामिल किया है। इन मूल्यांकनों में, मॉडल ने MMLU-Pro और HumanEval बेंचमार्क पर मजबूत प्रदर्शन दिखाया, जिसमें स्कोर अन्य सीमांत मॉडलों के बराबर थे। उदाहरण के लिए, एक वेरिएंट ने MMLU-Pro पर 87.3% और HumanEval पर 92.1% स्कोर किया, हालांकि ये आंकड़े तृतीय-पक्ष परीक्षण से प्राप्त हैं और आधिकारिक xAI परिणाम नहीं हैं।
तकनीकी विशेषताएं
लीडरबोर्ड व्यवहार और अनुमान पैटर्न के आधार पर, Grok 4.6 को ट्रांसफॉर्मर-आधारित मॉडल माना जाता है, जो Mixture of experts वास्तुकला का उपयोग करता है, जो इसके पूर्ववर्ती Grok 3 के समान है। मॉडल संभवतः मल्टी-हेड अटेंशन और रोटरी पोजीशनल एन्कोडिंग का उपयोग करता है, जो आधुनिक LLM में मानक हैं। हालांकि, आधिकारिक रिलीज़ के बिना, ये विवरण अनुमानित हैं और सार्वजनिक बेंचमार्क और समुदाय विश्लेषण से प्राप्त हैं।
नौ वेरिएंट पैरामीटर संख्या में भिन्न हैं, जिनमें अनुमान 100 बिलियन से लेकर सबसे बड़े संस्करण के लिए 300 बिलियन से अधिक पैरामीटर तक हैं। कुछ वेरिएंट अनुमान लागत को कम करने के लिए 8-बिट परिशुद्धता (FP8) में क्वांटाइज़ किए गए हैं, जो प्रदर्शन को थोड़ा प्रभावित कर सकते हैं। ये अनुमान लीडरबोर्ड प्लेटफार्मों पर देखी गई अनुमान गति और मेमोरी उपयोग पर आधारित हैं, आधिकारिक दस्तावेज़ीकरण पर नहीं।
पूर्ववर्तियों के साथ तुलना
Grok 4.6, Grok 3 का अनुसरण करता है, जिसे xAI ने जुलाई 2024 में जारी किया था। Grok 3 ने X (पूर्व में Twitter) के माध्यम से वास्तविक समय सूचना पहुंच और गणितीय तर्क पर ध्यान केंद्रित करने जैसी सुविधाएं पेश कीं। Grok 4.6 इस आधार पर निर्मित प्रतीत होता है, जिसमें तर्क बेंचमार्क पर बेहतर प्रदर्शन और सर्विंग कॉन्फ़िगरेशन का अधिक विविध सेट है। Grok 3 के विपरीत, जिसमें सार्वजनिक API और आधिकारिक दस्तावेज़ीकरण था, Grok 4.6 को औपचारिक रूप से घोषित नहीं किया गया है, जिससे सीधी तुलना कठिन हो जाती है।
बेंचमार्क स्नैपशॉट में, Grok 4.6 वेरिएंट आम तौर पर LMArena लीडरबोर्ड पर Grok 3 से 5-10 एलो अंकों के अंतर से बेहतर प्रदर्शन करते हैं। यह सुधार प्रशिक्षण डेटा और मॉडल वास्तुकला में वृद्धिशील प्रगति के अनुरूप है, हालांकि विशिष्ट परिवर्तन अज्ञात हैं। मॉडल लंबे-संदर्भ कार्यों पर भी बेहतर प्रदर्शन दिखाता है, जिसमें एक वेरिएंट अखाड़ा परीक्षण संकेतों से अनुमानित 256,000 टोकन तक का संदर्भ विंडो समर्थन करता है।
उपलब्धता और पहुंच
फरवरी 2025 तक, Grok 4.6 जनता के लिए उपलब्ध नहीं है। कोई आधिकारिक API, कोई डाउनलोड करने योग्य वेट, और X पर Grok चैटबॉट जैसे xAI के उपभोक्ता उत्पादों के साथ कोई एकीकरण नहीं है। मॉडल के साथ बातचीत करने का एकमात्र तरीका अनाम अखाड़ा प्रविष्टियों के माध्यम से है, जहां उपयोगकर्ता इसकी पहचान जाने बिना चैट कर सकते हैं। यह xAI की पिछली प्रथा से एक विचलन है, जिसमें Grok 1 और Grok 2 जैसे मॉडल खुले वेट और दस्तावेज़ीकरण के साथ जारी किए गए थे।
आधिकारिक रिलीज़ की कमी ने xAI के इरादों के बारे में अटकलें लगाई हैं। कुछ विश्लेषकों का सुझाव है कि Grok 4.6 भविष्य के मॉडलों के लिए एक परीक्षण मंच है, जबकि अन्य मानते हैं कि यह एक मॉडल के लिए एक प्लेसहोल्डर नाम हो सकता है जिसे एक अलग ब्रांड के तहत जारी किया जाएगा। अब तक, xAI से किसी आधिकारिक बयान ने Grok 4.6 की स्थिति को स्पष्ट नहीं किया है।
स्वागत और प्रभाव
जारी न होने के बावजूद, Grok 4.6 ने अपने मजबूत लीडरबोर्ड प्रदर्शन के कारण AI समुदाय में महत्वपूर्ण रुचि उत्पन्न की है। स्वतंत्र शोधकर्ताओं ने इसकी क्षमताओं का अनुमान लगाने के लिए इसके आउटपुट का विश्लेषण किया है, और कुछ ने कोड निर्माण और गणितीय समस्या-समाधान में इसकी दक्षता पर ध्यान दिया है। हालांकि, पारदर्शिता की कमी ने भी आलोचना आकर्षित की है, कुछ विशेषज्ञों का तर्क है कि अनाम मॉडल बेंचमार्क परिणामों में प्रतिलिपि प्रस्तुतिकरण और विश्वास को कमजोर करते हैं।
लीडरबोर्ड पर मॉडल की उपस्थिति ने प्रतिस्पर्धी परिदृश्य को भी प्रभावित किया है, जिससे अन्य प्रयोगशालाओं को अपनी रिलीज़ में तेजी लाने के लिए प्रेरित किया गया है। उदाहरण के लिए, OpenAI और Anthropic दोनों ने 2024 के अंत में अद्यतन मॉडल जारी किए हैं, आंशिक रूप से Grok 4.6 से कथित खतरे के जवाब में। यह गतिशीलता जनरेटिव AI बाजार को आकार देने में सार्वजनिक लीडरबोर्ड की भूमिका को उजागर करती है, भले ही अंतर्निहित मॉडल आधिकारिक रूप से उपलब्ध न हों।