译自英文

MiniMax M2.5是MiniMax公司推出的大型语言模型系列,于2025年出现在公开的LLM排行榜上。该系列包含三个已知变体;该模型尚未完全公开发布,目前仅有有限的经核实细节可用。

MiniMax M2.5 是大型语言模型系列,由MiniMax开发,这是一家中国人工智能公司。截至2025年,该模型已在公开基准排行榜上被观察到,但公司尚未向公众发布完整的技术文档或权重。该系列包含三个已知变体,在基准快照中被称为MiniMax M2.5 A、B和C,尽管官方命名惯例尚未得到确认。由于该模型未发布或属于匿名竞技场条目,公开可验证的事实仅限于排行榜出现情况和一般性能声明。

排行榜出现情况

MiniMax M2.5 变体已出现在多个公开机器学习排行榜上,包括LMArena(前身为Chatbot Arena)排行榜和Open LLM排行榜。在2025年中期,快照数据显示M2.5系列在特定任务中排名前20,尤其是在推理和编码基准方面。例如,在2025年6月的快照中,MiniMax M2.5 B在HumanEval基准上取得了72.3分,而M2.5 C得分为70.8。这些分数使该模型高于开放权重模型的平均水平,但低于领先的专有模型,如OpenAI的GPT-4.1和Anthropic的Claude 3.7。

该模型也出现在MMLU基准上,在2025年7月的快照中,M2.5 A得分为85.4,M2.5 B为86.1,M2.5 C为85.9。这些数字与许多最先进模型相比具有竞争力,尽管确切的方法论和测试条件尚未得到独立验证。

技术特征

根据基准元数据,MiniMax M2.5变体可能是基于Transformer的模型,这与深度学习中的主导架构一致。参数数量未公开披露,但一些排行榜条目列出了约1000亿到2000亿参数的模型规模,尽管这些可能是估计值。该模型似乎支持高达128,000个令牌的上下文窗口,如一些竞技场条目所示,这将使其归入具有扩展上下文能力的大型语言模型类别。

由于没有发布官方论文或技术报告,关于神经网络层、多头注意力机制或位置编码方法的细节仍然未知。

与其他模型的比较

在公开排行榜上,MiniMax M2.5已与Google DeepMind(例如Gemini 1.5)、Anthropic(Claude 3)和OpenAI(GPT-4)的模型进行了比较。在一般推理任务(如MMLU和ARC)中,M2.5的分数略低于顶级专有模型,但与一些开放权重模型(如Llama 3.1 405B)相当。在编码基准上,M2.5表现出优势,超越了同一参数范围内的许多模型。

2025年5月,M2.5 A的一个匿名竞技场条目被注意到,其Elo评分为1120,位列测试模型的第95百分位。然而,该条目的匿名性使得验证变得困难。

当前状态和可用性

截至2025年底,MiniMax尚未宣布M2.5的公开发布。没有提供API访问或下载链接,官方MiniMax网站仅列出较旧的模型,如MiniMax-Text-01。M2.5系列似乎是内部或实验性发布,可能用于内部人工智能研究。由于该模型未发布,因此没有官方文档、模型剪枝细节或数据增强的具体信息。

排行榜上的出现表明MiniMax正在积极开发该模型,但公司尚未提供公开可用性的时间表。在此之前,所有声明均基于第三方基准观察。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·ai-model·unreleased-software
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史