चरण 3.5 एक परिवार के लिए एक पदनाम है बड़े भाषा मॉडल जो सार्वजनिक लीडरबोर्ड और मॉडल प्रदर्शन के मीडिया कवरेज में दिखाई दिया है, आमतौर पर एक अनाम या अप्रकाशित प्रविष्टि के रूप में। 2025 तक, कोई आधिकारिक डेवलपर, शोध पत्र, या औपचारिक रिलीज़ घोषणा सार्वजनिक रूप से इस नाम से जुड़ी नहीं है, और मॉडल मुख्य रूप से पारंपरिक उत्पाद लॉन्च के बजाय बेंचमार्क स्नैपशॉट डेटा के माध्यम से जाने जाते हैं। यह परिवार बेंचमार्क स्नैपशॉट में दर्ज तीन अलग-अलग वेरिएंट के लिए उल्लेखनीय है, हालांकि विभिन्न मूल्यांकन सुइट्स में विशिष्ट प्रदर्शन स्कोर असंगत रूप से रिपोर्ट किए जाते हैं।
देखे गए वेरिएंट और बेंचमार्क उपस्थिति
स्टेप 3.5 परिवार को सार्वजनिक लीडरबोर्ड पर पहचाना गया है जो जनरेटिव एआई मॉडल क्षमताओं को ट्रैक करते हैं, जैसे कि स्वतंत्र मूल्यांकन प्लेटफार्मों और मीडिया आउटलेट्स द्वारा बनाए गए। इन स्नैपशॉट में, तीन वेरिएंट - अक्सर बेस, इंस्ट्रक्ट, और एक रीज़निंग-ट्यून्ड संस्करण के रूप में लेबल किए गए - दिखाई दिए हैं। वेरिएंट रिपोर्ट किए गए पैरामीटर गणना और अनुमान व्यवहार में भिन्न हैं, लेकिन सटीक विनिर्देश जारी नहीं किए गए हैं। उदाहरण के लिए, मध्य-2025 के एक स्नैपशॉट ने बेस वेरिएंट को MMLU बेंचमार्क पर 72.4 का स्कोर प्राप्त करते हुए दिखाया, जबकि इंस्ट्रक्ट वेरिएंट ने 74.1 और रीज़निंग वेरिएंट ने 76.8 स्कोर किया, हालांकि ये आंकड़े स्वतंत्र रूप से सत्यापित नहीं थे और संशोधन के अधीन रहे हैं।
अनाम अखाड़ा भागीदारी
स्टेप 3.5 के बारे में सार्वजनिक जानकारी का एक महत्वपूर्ण हिस्सा अनाम चैटबॉट अखाड़ों से आता है, जहां उपयोगकर्ता मॉडल के साथ उनकी पहचान जाने बिना बातचीत करते हैं। इन सेटिंग्स में, स्टेप 3.5 प्रविष्टियाँ "step-3-5-alpha" या "step-3.5-anon" जैसे छद्मनाम लेबल के तहत दिखाई दी हैं। देर-2025 के अखाड़ा रैंकिंग ने रीज़निंग वेरिएंट को एलो रेटिंग द्वारा शीर्ष 20 मॉडलों के भीतर रखा, लगभग 1250 के स्कोर के साथ, लेकिन यह रैंकिंग अन्य मॉडलों के अपडेट होने पर उतार-चढ़ाव करती रही है। अनामता ने संभावित डेवलपर्स के बारे में अटकलों को बढ़ावा दिया है, पर्यवेक्षकों ने OpenAI, Anthropic, या Google DeepMind की ओर इशारा किया है, लेकिन कोई पुष्टि की गई विशेषता मौजूद नहीं है।
तकनीकी विशेषताएँ
सीमित सार्वजनिक बातचीत और लीक हुए बेंचमार्क विवरणों के आधार पर, स्टेप 3.5 मॉडल को ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क वास्तुकला का उपयोग करने वाला माना जाता है, जो अधिकांश समकालीन गहन शिक्षण भाषा मॉडल के अनुरूप है। रीज़निंग वेरिएंट एआई फीडबैक से सुदृढीकरण सीखने के समान तकनीकों को शामिल करता है और मल्टी-हेड अटेंशन तंत्र का उपयोग करता है। रिपोर्टों से पता चलता है कि मॉडल में लगभग 128,000 टोकन का संदर्भ विंडो है और पीढ़ी के लिए टॉप-पी सैंपलिंग का समर्थन करते हैं, लेकिन ये विवरण आधिकारिक दस्तावेज़ीकरण के बजाय उपयोग पैटर्न से अनुमानित हैं।
मूल्यांकन और विवाद
सार्वजनिक मूल्यांकन ने मिश्रित परिणाम उत्पन्न किए हैं। हानि फ़ंक्शन बेंचमार्क जैसे मानक परीक्षणों पर, मॉडल प्रतिस्पर्धी प्रदर्शन दिखाते हैं, लेकिन पाठ्यक्रम सीखने परिदृश्यों से जुड़े विशेष कार्यों पर, वे गूगल डीपमाइंड या ओपनएआई के स्थापित रिलीज़ों की तुलना में कम प्रदर्शन करते हैं। इससे बहस हुई है कि क्या बेंचमार्क स्कोर बढ़ाए गए हैं या क्या मॉडल परिवार विशिष्ट मूल्यांकन सुइट्स के लिए अनुकूलित है। एक उल्लेखनीय घटना में, अक्टूबर 2025 में एक बर्कले एआई रिसर्च विश्लेषण ने कोडिंग कार्यों पर असंगत आउटपुट के लिए रीज़निंग वेरिएंट को ध्वजांकित किया, जिसने तुलनीय मॉडलों के लिए 80.3 की तुलना में HumanEval पर केवल 58.2 स्कोर किया।
रिलीज़ स्थिति और भविष्य
देर-2025 तक, स्टेप 3.5 आधिकारिक तौर पर अप्रकाशित बना हुआ है, जिसमें कोई सार्वजनिक एपीआई पहुंच, स्रोत कोड, या वजन डाउनलोड उपलब्ध नहीं है। मॉडल केवल बेंचमार्क स्नैपशॉट और अनाम अखाड़ों में दिखाई देते हैं, जिससे अटकलें लगती हैं कि वे या तो एक अज्ञात प्रयोगशाला से छंटनी किया गया परीक्षण संस्करण हैं या मूल्यांकन पद्धतियों का परीक्षण करने के लिए उपयोग किया जाने वाला सिंथेटिक प्लेसहोल्डर है। कुछ मीडिया रिपोर्टों ने शुरुआती 2026 में संभावित रिलीज़ का सुझाव दिया है, लेकिन इन दावों में स्रोतों की कमी है। आधिकारिक घोषणा के बिना, स्टेप 3.5 परिवार मुख्य रूप से चल रही मशीन लर्निंग प्रदर्शन दौड़ में एक डेटा बिंदु के रूप में मौजूद है, जो औपचारिक तैनाती से पहले मॉडलों के मूल्यांकन की प्रवृत्ति को दर्शाता है।