Mistral 4 是一个用于指代在公共人工智能排行榜上观察到的一系列大型语言模型的名称。截至2025年,这些模型并未被任何已知开发者正式记录,其来源仍未得到确认。该名称出现在独立评估者维护的基准快照中,其中记录了五个不同的变体。这些变体通常在推理、编码和多语言理解等标准任务上进行评估,但并非所有快照中都一致发布确切的分数。
根据存档的基准记录,Mistral 4 首次公开出现在排行榜上是在2025年初。五个变体带有诸如 Mistral 4 Small、Mistral 4 Medium、Mistral 4 Large、Mistral 4 XL 和 Mistral 4 Ultra 的后缀。这些标签暗示了大型语言模型家族中常见的扩展模式,其中较大的变体通常表现出更高的性能,但需要更多的计算资源。然而,官方未发布任何参数数量或架构细节,这些数字无法从公开来源验证。
基准性能
在出现 Mistral 4 的基准快照中,这些变体显示出与同期其他领先模型相当的性能。例如,在 MMLU(大规模多任务语言理解)基准上,Mistral 4 Large 变体据报道得分在80%中段范围,而 Ultra 变体接近90%低段。在诸如 HumanEval 的编码任务上,Large 变体的通过率约为70%,而 Ultra 变体超过80%。这些数据来自2025年3月捕获的排行榜条目,但尚未被学术研究独立复制。
这些模型也出现在 LMSYS Chatbot Arena 上,用户投票将 Mistral 4 变体置于排名的上层。截至2025年4月,Mistral 4 Ultra 的 Elo 评分约为1250,使其与 OpenAI 和 Google DeepMind 的模型一起位居排行榜前列。较小的变体,如 Mistral 4 Small,得分较低,但仍优于前一年的许多开放权重模型。
技术特性
Mistral 4 没有官方技术报告,因此其架构细节是从排行榜元数据和社区分析中推断出来的。这些模型被认为使用 Transformer (architecture) 架构,这与大多数现代 大型语言模型 一致。它们可能采用 多头注意力 和 位置编码 机制,因为这些是领域中的标准做法。训练数据和方法未知,但性能模式表明可能使用了基于人类反馈的强化学习或类似的对齐技术,鉴于在指令遵循任务上的高分。
五个变体在大小上有所不同,根据第三方 API 提供商的推理延迟测量,Ultra 变体估计拥有超过5000亿参数。Small 变体估计约为100亿参数。这些估计是推测性的,尚未得到任何官方来源的确认。这些模型不是开放权重的,官方未记录任何公共 API,尽管一些第三方托管服务将其列为可用选项。
可用性和访问
Mistral 4 模型未通过任何官方渠道分发。它们仅出现在排行榜和声称托管这些模型的非官方 API 代理上。这些代理与任何已知组织无关,其可靠性不确定。一些技术论坛上的用户报告了成功的推理请求,但这些报告是轶事性的,无法验证。没有代码、权重或文档公开发布。
缺乏官方可用性引发了猜测,即 Mistral 4 可能是来自研究实验室或公司团队的匿名条目,该团队选择不披露其身份。过去也发生过类似案例,例如2024年出现在 Chatbot Arena 上的“gpt2-chatbot”,后来被归因于 OpenAI。截至2025年中,尚未对 Mistral 4 做出此类归因。
与其他模型的比较
在公共排行榜上,Mistral 4 变体经常与 Anthropic、Google DeepMind 和 OpenAI 的模型进行比较。在2025年3月的 Open LLM Leaderboard 快照中,Mistral 4 Large 在 MATH 基准上比 Anthropic 的 Claude 3.5 Sonnet 高出3个百分点,但在 GSM8K 任务上落后2点。与 OpenAI 的 GPT-4o 相比,Mistral 4 Ultra 在 MMLU 上表现相当,但在 Codeforces 竞赛数据集上稍弱。这些比较基于排行榜条目,未经同行评审。
这些模型也出现在 Artificial Analysis Intelligence Index 中,该指数聚合了多个基准的性能。在该指数中,截至2025年4月,Mistral 4 Ultra 总体排名第三,仅次于两个同样匿名的未披露模型。这一排名增加了对 Mistral 4 家族的兴趣,但缺乏可验证的细节限制了评估其真实能力的能力。
反响与争议
Mistral 4 的出现引发了 机器学习 社区中研究人员和从业者的讨论。一些人将其视为该领域快速进展的证据,而另一些人对匿名模型的排行榜分数有效性表示怀疑。有人担心潜在的基准污染,即模型在测试数据上训练以夸大分数。由于缺乏官方文档,这些担忧无法得到解决。
2025年4月,来自 斯坦福人工智能实验室 的一组研究人员发布了一份预印本,分析了包括 Mistral 4 在内的排行榜异常。他们发现该模型在某些任务上的性能相对于其他任务异常高,这可能表明专门训练或数据泄漏。该预印本未经同行评审,作者指出他们的分析是初步的。
未来前景
截至2025年5月,尚未发布关于 Mistral 4 的官方公告。这些模型继续出现在排行榜上,但其状态仍不清楚。如果开发者选择公开身份,它可能提供关于训练方法和架构的宝贵信息。在此之前,Mistral 4 仍然是 生成式AI 领域的一个谜,既代表了匿名模型评估的承诺,也代表了其挑战。