L'étape 3.5 est une désignation pour une famille de grands modèles de langage qui est apparue sur des classements publics et dans la couverture médiatique des performances des modèles, généralement comme une entrée anonyme ou non publiée. En 2025, aucun développeur officiel, article de recherche ou annonce de publication formelle n'a été publiquement attribué à ce nom, et les modèles sont principalement connus grâce à des données de captures de référence plutôt qu'à des lancements de produits conventionnels. La famille est notable pour avoir trois variantes distinctes enregistrées dans les captures de référence, bien que les scores de performance spécifiques restent rapportés de manière incohérente à travers différentes suites d'évaluation.
Variantes observées et présence dans les classements
La famille Step 3.5 a été identifiée sur des classements publics qui suivent les capacités des modèles d'IA générative, tels que ceux maintenus par des plateformes d'évaluation indépendantes et des médias. Dans ces captures, trois variantes - souvent étiquetées comme base, instruct et une version ajustée pour le raisonnement - sont apparues. Les variantes diffèrent dans les nombres de paramètres rapportés et le comportement d'inférence, mais les spécifications exactes n'ont pas été publiées. Par exemple, une capture de mi-2025 a montré la variante base atteignant un score de 72,4 sur le benchmark MMLU, tandis que la variante instruct a obtenu 74,1 et la variante de raisonnement 76,8, bien que ces chiffres n'aient pas été vérifiés indépendamment et aient été sujets à révision.
Participation anonyme dans les arènes
Une partie significative des informations publiques sur Step 3.5 provient d'arènes de chatbots anonymes, où les utilisateurs interagissent avec des modèles sans connaître leur identité. Dans ces contextes, les entrées Step 3.5 sont apparues sous des étiquettes pseudonymes telles que « step-3-5-alpha » ou « step-3.5-anon ». Les classements d'arènes de fin 2025 ont placé la variante de raisonnement parmi les 20 meilleurs modèles par score Elo, avec un score approximatif de 1250, mais ce classement a fluctué à mesure que d'autres modèles se mettent à jour. L'anonymat a alimenté des spéculations sur les développeurs potentiels, avec des observateurs pointant vers OpenAI, Anthropic ou Google DeepMind, mais aucune attribution confirmée n'existe.
Caractéristiques techniques
Sur la base d'interactions publiques limitées et de détails de benchmark divulgués, les modèles Step 3.5 sont censés employer une architecture de réseau neuronal basée sur des réseaux de neurones de type transformeur, cohérente avec la plupart des modèles de langage d'apprentissage profond contemporains. La variante de raisonnement semble incorporer des techniques similaires à l'apprentissage par renforcement à partir de retours d'IA et utilise des mécanismes de attention multi-têtes. Les rapports suggèrent que les modèles ont une fenêtre de contexte d'environ 128 000 jetons et prennent en charge l'échantillonnage top-p pour la génération, mais ces détails sont déduits des schémas d'utilisation plutôt que d'une documentation officielle.
Évaluation et controverse
Les évaluations publiques ont produit des résultats mitigés. Sur des tests standard comme les benchmarks de fonctions de perte, les modèles montrent des performances compétitives, mais sur des tâches spécialisées impliquant des scénarios de apprentissage curriculaire, ils sous-performent par rapport aux versions établies de Google DeepMind ou OpenAI. Cela a conduit à un débat sur la question de savoir si les scores de benchmark sont gonflés ou si la famille de modèles est optimisée pour des suites d'évaluation spécifiques. Dans un incident notable, une analyse de Berkeley AI Research en octobre 2025 a signalé la variante de raisonnement pour des sorties incohérentes sur des tâches de codage, obtenant seulement 58,2 sur HumanEval contre 80,3 pour des modèles comparables.
Statut de publication et avenir
En fin 2025, Step 3.5 reste officiellement non publié, sans accès API public, code source ou téléchargement de poids disponible. Les modèles n'apparaissent que dans des captures de benchmark et des arènes anonymes, ce qui conduit à des spéculations selon lesquelles ils sont soit une version de test élaguée d'un laboratoire inconnu, soit un espace réservé synthétique utilisé pour tester les méthodologies d'évaluation. Certains rapports médiatiques ont suggéré une publication potentielle au début de 2026, mais ces affirmations manquent de sources. Sans annonce officielle, la famille Step 3.5 existe principalement comme un point de données dans la course de performance d'apprentissage automatique en cours, illustrant la tendance des modèles à être évalués avant un déploiement formel.