Step 3.5是一个用于指代一系列大型语言模型的代号,这些模型出现在公开排行榜和媒体对模型性能的报道中,通常以匿名或未发布条目的形式出现。截至2025年,尚无官方开发者、研究论文或正式发布公告公开归属于该名称,这些模型主要通过基准测试快照数据而非传统产品发布而为人所知。该系列因在基准测试快照中记录了三个不同变体而引人注目,但具体性能得分在不同评估套件中的报告仍不一致。
观察到的变体与基准测试表现
Step 3.5系列已在跟踪生成式AI模型能力的公开排行榜上被识别,例如由独立评估平台和媒体机构维护的榜单。在这些快照中,出现了三个变体,,通常标记为基础版、指令版和推理调优版。这些变体在报告的参数量和推理行为上有所不同,但确切规格尚未公布。例如,2025年年中的一份快照显示,基础版在MMLU基准测试中得分为72.4,指令版得分为74.1,推理版得分为76.8,尽管这些数字未经独立验证,且已被修订。
匿名竞技场参与
关于Step 3.5的大部分公开信息来自匿名聊天机器人竞技场,用户在与模型交互时不知道其身份。在这些环境中,Step 3.5条目以化名标签出现,如“step-3-5-alpha”或“step-3.5-anon”。2025年末的竞技场排名将推理版置于Elo评分前20名之内,大约得分为1250,但该排名随着其他模型的更新而波动。匿名性引发了关于潜在开发者的猜测,观察者指向OpenAI、Anthropic或Google DeepMind,但尚无确认归属。
技术特征
基于有限的公开交互和泄露的基准测试细节,Step 3.5模型被认为采用了基于Transformer的神经网络架构,这与大多数当代深度学习语言模型一致。推理版似乎融入了类似于基于AI反馈的强化学习的技术,并使用多头注意力机制。报告表明,这些模型具有约128,000个令牌的上下文窗口,并支持用于生成的top-p采样,但这些细节是从使用模式推断而来,而非来自官方文档。
评估与争议
公开评估产生了混合结果。在标准测试(如损失函数基准测试)中,这些模型表现出竞争力,但在涉及课程学习场景的专门任务中,它们相对于Google DeepMind或OpenAI的已发布版本表现不佳。这引发了关于基准测试分数是否被夸大或该模型系列是否针对特定评估套件进行优化的争论。在一个值得注意的事件中,2025年10月伯克利AI研究的一项分析指出,推理版在编码任务上输出不一致,在HumanEval上仅得58.2分,而可比模型得分为80.3。
发布状态与未来
截至2025年末,Step 3.5仍处于官方未发布状态,没有公开的API访问、源代码或权重下载。这些模型仅出现在基准测试快照和匿名竞技场中,这引发了猜测,认为它们要么是来自未知实验室的剪枝测试版本,要么是用于测试评估方法的合成占位符。一些媒体报道暗示可能在2026年初发布,但这些说法缺乏来源。在没有官方公告的情况下,Step 3.5系列主要作为持续进行的机器学习性能竞赛中的一个数据点存在,说明了模型在正式部署前被评估的趋势。