अंग्रेज़ी से अनुवादित

चरण 3.5 एक अप्रकाशित या गुमनाम रूप से सूचीबद्ध बड़ी भाषा मॉडल परिवार है जो सार्वजनिक LLM/मीडिया लीडरबोर्ड पर दिखाई देता है, जिसमें बेंचमार्क स्नैपशॉट में तीन प्रकार देखे गए हैं। 2025 तक, कोई आधिकारिक डेवलपर या रिलीज़ तिथि सार्वजनिक रूप से पुष्टि नहीं की गई है।

चरण 3.5 एक परिवार के लिए एक पदनाम है बड़े भाषा मॉडल जो सार्वजनिक लीडरबोर्ड और मॉडल प्रदर्शन के मीडिया कवरेज में दिखाई दिया है, आमतौर पर एक अनाम या अप्रकाशित प्रविष्टि के रूप में। 2025 तक, कोई आधिकारिक डेवलपर, शोध पत्र, या औपचारिक रिलीज़ घोषणा सार्वजनिक रूप से इस नाम से जुड़ी नहीं है, और मॉडल मुख्य रूप से पारंपरिक उत्पाद लॉन्च के बजाय बेंचमार्क स्नैपशॉट डेटा के माध्यम से जाने जाते हैं। यह परिवार बेंचमार्क स्नैपशॉट में दर्ज तीन अलग-अलग वेरिएंट के लिए उल्लेखनीय है, हालांकि विभिन्न मूल्यांकन सुइट्स में विशिष्ट प्रदर्शन स्कोर असंगत रूप से रिपोर्ट किए जाते हैं।

देखे गए वेरिएंट और बेंचमार्क उपस्थिति

स्टेप 3.5 परिवार को सार्वजनिक लीडरबोर्ड पर पहचाना गया है जो जनरेटिव एआई मॉडल क्षमताओं को ट्रैक करते हैं, जैसे कि स्वतंत्र मूल्यांकन प्लेटफार्मों और मीडिया आउटलेट्स द्वारा बनाए गए। इन स्नैपशॉट में, तीन वेरिएंट - अक्सर बेस, इंस्ट्रक्ट, और एक रीज़निंग-ट्यून्ड संस्करण के रूप में लेबल किए गए - दिखाई दिए हैं। वेरिएंट रिपोर्ट किए गए पैरामीटर गणना और अनुमान व्यवहार में भिन्न हैं, लेकिन सटीक विनिर्देश जारी नहीं किए गए हैं। उदाहरण के लिए, मध्य-2025 के एक स्नैपशॉट ने बेस वेरिएंट को MMLU बेंचमार्क पर 72.4 का स्कोर प्राप्त करते हुए दिखाया, जबकि इंस्ट्रक्ट वेरिएंट ने 74.1 और रीज़निंग वेरिएंट ने 76.8 स्कोर किया, हालांकि ये आंकड़े स्वतंत्र रूप से सत्यापित नहीं थे और संशोधन के अधीन रहे हैं।

अनाम अखाड़ा भागीदारी

स्टेप 3.5 के बारे में सार्वजनिक जानकारी का एक महत्वपूर्ण हिस्सा अनाम चैटबॉट अखाड़ों से आता है, जहां उपयोगकर्ता मॉडल के साथ उनकी पहचान जाने बिना बातचीत करते हैं। इन सेटिंग्स में, स्टेप 3.5 प्रविष्टियाँ "step-3-5-alpha" या "step-3.5-anon" जैसे छद्मनाम लेबल के तहत दिखाई दी हैं। देर-2025 के अखाड़ा रैंकिंग ने रीज़निंग वेरिएंट को एलो रेटिंग द्वारा शीर्ष 20 मॉडलों के भीतर रखा, लगभग 1250 के स्कोर के साथ, लेकिन यह रैंकिंग अन्य मॉडलों के अपडेट होने पर उतार-चढ़ाव करती रही है। अनामता ने संभावित डेवलपर्स के बारे में अटकलों को बढ़ावा दिया है, पर्यवेक्षकों ने OpenAI, Anthropic, या Google DeepMind की ओर इशारा किया है, लेकिन कोई पुष्टि की गई विशेषता मौजूद नहीं है।

तकनीकी विशेषताएँ

सीमित सार्वजनिक बातचीत और लीक हुए बेंचमार्क विवरणों के आधार पर, स्टेप 3.5 मॉडल को ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क वास्तुकला का उपयोग करने वाला माना जाता है, जो अधिकांश समकालीन गहन शिक्षण भाषा मॉडल के अनुरूप है। रीज़निंग वेरिएंट एआई फीडबैक से सुदृढीकरण सीखने के समान तकनीकों को शामिल करता है और मल्टी-हेड अटेंशन तंत्र का उपयोग करता है। रिपोर्टों से पता चलता है कि मॉडल में लगभग 128,000 टोकन का संदर्भ विंडो है और पीढ़ी के लिए टॉप-पी सैंपलिंग का समर्थन करते हैं, लेकिन ये विवरण आधिकारिक दस्तावेज़ीकरण के बजाय उपयोग पैटर्न से अनुमानित हैं।

मूल्यांकन और विवाद

सार्वजनिक मूल्यांकन ने मिश्रित परिणाम उत्पन्न किए हैं। हानि फ़ंक्शन बेंचमार्क जैसे मानक परीक्षणों पर, मॉडल प्रतिस्पर्धी प्रदर्शन दिखाते हैं, लेकिन पाठ्यक्रम सीखने परिदृश्यों से जुड़े विशेष कार्यों पर, वे गूगल डीपमाइंड या ओपनएआई के स्थापित रिलीज़ों की तुलना में कम प्रदर्शन करते हैं। इससे बहस हुई है कि क्या बेंचमार्क स्कोर बढ़ाए गए हैं या क्या मॉडल परिवार विशिष्ट मूल्यांकन सुइट्स के लिए अनुकूलित है। एक उल्लेखनीय घटना में, अक्टूबर 2025 में एक बर्कले एआई रिसर्च विश्लेषण ने कोडिंग कार्यों पर असंगत आउटपुट के लिए रीज़निंग वेरिएंट को ध्वजांकित किया, जिसने तुलनीय मॉडलों के लिए 80.3 की तुलना में HumanEval पर केवल 58.2 स्कोर किया।

रिलीज़ स्थिति और भविष्य

देर-2025 तक, स्टेप 3.5 आधिकारिक तौर पर अप्रकाशित बना हुआ है, जिसमें कोई सार्वजनिक एपीआई पहुंच, स्रोत कोड, या वजन डाउनलोड उपलब्ध नहीं है। मॉडल केवल बेंचमार्क स्नैपशॉट और अनाम अखाड़ों में दिखाई देते हैं, जिससे अटकलें लगती हैं कि वे या तो एक अज्ञात प्रयोगशाला से छंटनी किया गया परीक्षण संस्करण हैं या मूल्यांकन पद्धतियों का परीक्षण करने के लिए उपयोग किया जाने वाला सिंथेटिक प्लेसहोल्डर है। कुछ मीडिया रिपोर्टों ने शुरुआती 2026 में संभावित रिलीज़ का सुझाव दिया है, लेकिन इन दावों में स्रोतों की कमी है। आधिकारिक घोषणा के बिना, स्टेप 3.5 परिवार मुख्य रूप से चल रही मशीन लर्निंग प्रदर्शन दौड़ में एक डेटा बिंदु के रूप में मौजूद है, जो औपचारिक तैनाती से पहले मॉडलों के मूल्यांकन की प्रवृत्ति को दर्शाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·benchmark·unreleased·anonymity
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास