Grok 3 是 xAI(埃隆·马斯克创立的人工智能公司)开发的一系列大语言模型。截至 2025 年初,该系列模型已出现在公开的 LLM 和媒体排行榜上,基准快照中记录了九个变体。与其前身 Grok 2(公开发布了版本说明并提供 API 访问)不同,截至知识截止日期,xAI 尚未正式宣布或发布 Grok 3。所有关于 Grok 3 的公开信息均来自第三方基准评估和匿名竞技场条目,而非 xAI 的官方通讯。
Grok 3 的存在最初是在 2024 年底从排行榜条目中推断出来的,当时 LMArena(原 Chatbot Arena)等平台上开始出现具有高绩效分数的未命名模型。独立研究人员和媒体根据响应模式和基准指纹将这些条目归因于 Grok 3。基准快照中的九个变体可能代表不同的配置大小、量化级别或微调阶段,但 xAI 尚未确认这些细节。
基准测试表现
Grok 3 变体已被记录在多个公开排行榜上,包括 Hugging Face 托管的 Open LLM Leaderboard 和 Artificial Analysis Intelligence Index。在这些快照中,这些变体在 MMLU(大规模多任务语言理解)、GSM8K(小学数学)和 HumanEval(代码生成)等标准基准上表现出竞争力。具体分数因变体和快照日期而异,但表现最佳的 Grok 3 条目在这些排行榜上位列顶级模型之列,可与OpenAI、Anthropic和Google DeepMind的模型相媲美。
一个值得注意的表现是 2024 年 12 月出现在 LMArena 排行榜上,一个后来被认定为 Grok 3 变体的匿名模型在编码和数学类别中获得了很高的 Elo 评分。2025 年 1 月的媒体报道引用这些排行榜位置作为 Grok 3 正在进行内部测试或分阶段推出的证据。然而,xAI 尚未发布官方基准分数,用于归因这些匿名条目的确切方法仍不确定。
技术规格
截至最新可用信息,xAI 尚未发布 Grok 3 的官方技术规格。该模型系列被推测基于Transformer架构,与其之前的模型以及更广泛的深度学习领域一致。训练细节,包括数据集大小、计算预算和硬件基础设施,均未公开记录。xAI 在田纳西州孟菲斯运营着一个大规模计算集群,并于 2024 年增加了额外的 GPU,但该公司尚未确认该基础设施是否用于 Grok 3 的训练。
根据排行榜行为,Grok 3 变体似乎支持长上下文窗口和多模态输入,但这些功能尚未得到官方确认。九个变体可能在参数数量上有所不同,估计范围从数百亿到超过一万亿参数不等,但这些数字是推测性的,并非来自 xAI。
与前代模型的关系
Grok 3 是 Grok 2 的继任者,后者于 2024 年 8 月发布,带有公共 API 并集成到 X(原 Twitter)平台。Grok 2 以其对 X 数据的实时访问和“趣味模式”个性而著称。相比之下,截至 2025 年初,Grok 3 尚未集成到任何公共产品中。该模型系列是 xAI 更广泛使命的一部分,即开发能够推理和回答问题、并注重科学准确性和幽默感的生成式 AI系统,如其创始文件所述。
与以开放权重和技术报告形式发布的 Grok 1 和 Grok 2 不同,Grok 3 尚未开源。这标志着 xAI 方法的转变,可能是由于AI行业的竞争压力或对滥用的担忧。缺乏官方文档引发了猜测,即 Grok 3 可能会以分阶段的方式发布,类似于 OpenAI 推出 GPT-4 变体的方式。
公众反响与争议
Grok 3 在未经官方宣布的情况下出现在排行榜上,引发了不同的反应。一些研究人员称赞该模型在推理任务等方面的明显性能提升,而另一些人则批评缺乏透明度。2025 年 1 月,多家 AI 新闻媒体报道了排行榜上的“神秘模型”,后来被认定为 Grok 3 变体。这引发了关于匿名基准提交的伦理以及排行榜排名可靠性的讨论。
还有报道称 Grok 3 被用于 xAI 内部项目,包括对 X 上 Grok 聊天机器人的改进。然而,这些报道基于用户观察,并未得到公司证实。截至知识截止日期,尚未宣布 Grok 3 的官方发布日期、定价或功能列表。
未来展望
鉴于 xAI 之前发布的模式,预计 Grok 3 将在 2025 年的某个时候正式宣布,可能附带技术论文和 API 访问。该公司已为“Grok”及相关术语申请了商标,表明正在进行的商业开发。然而,在 xAI 提供官方信息之前,所有关于 Grok 3 的细节仍基于第三方观察,应被视为暂时性的。九个基准变体可能代表预发布测试阶段,最终公开模型可能与这些快照存在显著差异。
在机器学习领域的更广泛背景下,Grok 3 的出现凸显了模型在正式发布前即被评估的趋势日益增长,这种做法在主要 AI 实验室中已变得普遍。这种方法对社区是有益还是有害,仍是研究人员和从业者争论的话题。