Grok 4.6 是由 xAI 开发的一系列大型语言模型,xAI 是埃隆·马斯克于 2023 年创立的公司。该模型系列已出现在公开的 LLM 和媒体排行榜上,包括 LMArena(前身为 Chatbot Arena)排行榜,并在基准快照中被追踪。截至 2025 年初,Grok 4.6 尚未发布;xAI 未提供任何官方公告、技术报告或公共 API。其在排行榜上的出现基于匿名竞技场条目,模型通过人类投票者的盲法成对比较进行评估。
在基准快照中已识别出 Grok 4.6 的九个不同变体,每个变体在参数、量化或服务配置上有所不同。这些变体通常带有 -small、-large 或 -fp8 等后缀标签,反映模型大小或精度的差异。这些变体的确切规格未公开记录,因为 xAI 尚未发布 Grok 4.6 的官方模型卡或权重。
排行榜表现
在 LMArena 排行榜上,Grok 4.6 变体在编码、数学和通用推理等类别中 consistently 位列表现最佳的模型之列。在 2024 年底的特定基准快照中,排名最高的 Grok 4.6 变体取得了超过 1350 的 Elo 评分,与来自OpenAI、Anthropic和Google DeepMind的模型一同跻身顶级梯队。然而,由于该模型是匿名的,这些评分是临时的,并会随着更多投票的收集而发生变化。
媒体排行榜,如 Artificial Analysis,也将 Grok 4.6 纳入其排名。在这些评估中,该模型在 MMLU-Pro 和 HumanEval 基准上表现出强劲性能,得分与其他前沿模型相当。例如,一个变体在 MMLU-Pro 上得分 87.3%,在 HumanEval 上得分 92.1%,尽管这些数据来自第三方测试而非 xAI 官方结果。
技术特征
根据排行榜行为和推理模式,Grok 4.6 被认为是一种基于transformer的模型,采用Mixture of experts架构,与其前代 Grok 3 类似。该模型可能采用多头注意力和旋转位置编码,这些是现代 LLM 的标准配置。然而,由于没有官方发布,这些细节仍属推测,基于公开基准和社区分析推断得出。
九个变体在参数数量上有所不同,估计范围从 1000 亿到最大版本的超过 3000 亿参数。一些变体被量化为 8 位精度(FP8)以降低推理成本,这可能会略微影响性能。这些估计基于排行榜平台上观察到的推理速度和内存使用情况,而非官方文档。
与前代的比较
Grok 4.6 紧随 Grok 3 之后,后者由 xAI 于 2024 年 7 月发布。Grok 3 引入了通过 X(前身为 Twitter)进行实时信息访问以及专注于数学推理等功能。Grok 4.6 似乎在此基础上构建,在推理基准上表现更佳,并提供更多样化的服务配置。与拥有公共 API 和官方文档的 Grok 3 不同,Grok 4.6 尚未正式发布,这使得直接比较变得困难。
在基准快照中,Grok 4.6 变体在 LMArena 排行榜上通常以 5-10 个 Elo 点的优势超越 Grok 3。这一改进与训练数据和模型架构的渐进式进步一致,尽管具体变化未知。该模型在长上下文任务上也表现更好,一个变体支持高达 256,000 个 token 的上下文窗口,这是从竞技场测试提示中推断得出的。
可用性与访问
截至 2025 年 2 月,Grok 4.6 尚未向公众开放。没有官方 API,没有可下载的权重,也没有与 xAI 消费产品(如 X 上的 Grok 聊天机器人)的集成。与该模型互动的唯一方式是通过匿名竞技场条目,用户可以在不知道其身份的情况下与之聊天。这与 xAI 此前以开放权重和文档发布 Grok 1 和 Grok 2 等模型的做法有所不同。
缺乏官方发布引发了关于 xAI 意图的猜测。一些分析师认为 Grok 4.6 是未来模型的试验场,而另一些人则认为它可能是一个占位名称,对应未来将以不同品牌发布的模型。截至目前,xAI 尚未发布任何官方声明来澄清 Grok 4.6 的状态。
反响与影响
尽管尚未发布,Grok 4.6 因其在排行榜上的强劲表现已在AI社区中引起广泛关注。独立研究人员分析了其输出来推断其能力,一些人注意到其在代码生成和数学问题求解方面的熟练度。然而,缺乏透明度也招致了批评,一些专家认为匿名模型削弱了基准结果的可复现性和可信度。
该模型在排行榜上的存在也影响了竞争格局,促使其他实验室加速自身发布。例如,OpenAI和Anthropic都在 2024 年底发布了更新模型,部分原因是对 Grok 4.6 所构成威胁的回应。这一动态凸显了公开排行榜在塑造生成式 AI市场中的作用,即使底层模型并未正式发布。