Gemini 2.0 实验版

译自英文

Gemini 2.0 Experimental 是Google DeepMind推出的一系列大型语言模型,在公开排行榜上以三种变体出现。截至2025年初,它尚未正式发布,仅能通过匿名竞技场条目访问。

Gemini 2.0 Experimental 是由 Google DeepMind 开发的一系列 大型语言模型,是 Gemini 1.5 系列的后续版本。该系列模型以“Gemini 2.0 Experimental”的名称出现在公共 LLM 和媒体排行榜上,基准测试快照中记录了三个不同的变体。截至 2025 年初,该系列尚未发布;访问仅限于匿名竞技场条目,且尚未发布任何官方技术报告或 API 文档。

Gemini 2.0 Experimental 的存在是通过其在众包评估平台上的出现而为公众所知,该模型与其他前沿模型一同被列出。这三个变体通常通过“Exp-01”、“Exp-02”和“Exp-03”等后缀来区分,不过不同排行榜上的确切命名方式可能有所不同。根据 MMLU、HumanEval 和 MATH 等公共基准的测量,这些变体在推理、编码和多模态任务上表现出渐进式的改进。

基准性能

在公共排行榜上,Gemini 2.0 Experimental 的变体始终位列顶级模型之列,经常与 OpenAI 的 GPT-4 系列和 Anthropic 的 Claude 3.5 竞争。例如,在 2024 年 11 月的快照中,Exp-01 变体在 MMLU 上取得了 87.2% 的分数,超过了 GPT-4 Turbo 的 86.4%,但落后于 Claude 3.5 Sonnet 的 88.7%。在 HumanEval 上,同一变体的 pass@1 得分为 92.1%,而在 MATH 上则达到了 78.5%。后来的变体 Exp-02 和 Exp-03 显示出小幅提升,其中 Exp-03 在 MMLU 上得分为 88.0%,在 HumanEval 上得分为 93.4%。

这些分数来源于匿名评估,确切的模型配置(例如参数数量、训练数据)并未公开。“Experimental”的命名暗示这是一个研究预览,类似于早期 Google DeepMind 发布的 Gemini 1.5 Pro Experimental。

技术特性

根据公开信息和基准行为的推断,Gemini 2.0 Experimental 模型基于 Transformer 架构构建,与 生成式 AI 范式一致。它们很可能采用了 多头注意力混合专家 层,如 Gemini 1.5 中所见。这些模型是多模态的,接受文本、图像、音频和视频输入,并生成文本和代码输出。上下文窗口长度估计为 1 百万个 token,与 Gemini 1.5 Pro 的规格相符,但这一点尚未得到证实。

训练细节,例如 RLHF 或其变体的使用,并未公开记录。然而,该模型在推理任务上的强劲表现表明其使用了思维链提示,并可能采用了测试时计算扩展,这是近期研究中提到的一种技术。

可用性与访问

Gemini 2.0 Experimental 系列无法通过 Google 官方 API 或 Google AI Studio 使用。相反,它通过匿名竞技场平台(如 LMArena,前身为 Chatbot Arena)被访问,用户可以在不知道模型身份的情况下与之交互。这种方法使 Google DeepMind 能够在现实场景中收集人类偏好数据并对模型进行压力测试,而无需承诺公开发布。

截至 2025 年 1 月,尚未发布任何关于稳定版本的官方公告。“Experimental”标签表明该模型处于测试阶段,完整版本可能会在 2025 年晚些时候发布,可能以 Gemini 2.0 的名称推出。

与前代产品的比较

Gemini 2.0 Experimental 建立在 Gemini 1.5 的基础之上,后者于 2024 年 2 月发布。Gemini 1.5 Pro 引入了 1 百万 token 的上下文窗口和先进的多模态能力。2.0 Experimental 变体在标准基准上的性能有所提升,在 MMLU、HumanEval 和 MATH 上平均比 Gemini 1.5 Pro 高出 3-5%。例如,Gemini 1.5 Pro 在 MMLU 上得分为 81.9%,而 Exp-01 得分为 87.2%。

实验性质也意味着更快的迭代周期,多个变体在数周内相继发布,这反映了 Google DeepMind 敏捷的开发方法。

反响与影响

Gemini 2.0 Experimental 在排行榜上的出现引起了 AI 社群的兴趣,因为它标志着 Google DeepMind 持续推动与 OpenAI 和 Anthropic 竞争。然而,缺乏官方文档导致了对该模型架构和训练方法的猜测。一些研究人员指出,由于测试集污染(匿名模型常见的问题),基准分数可能被夸大。

尽管存在这些不确定性,Gemini 2.0 Experimental 仍因其强大的推理和编码能力而受到称赞,其表现往往优于更大的模型。它在多模态任务(如视觉问答)上的表现也值得注意,尽管具体分数并未公开汇总。

截至 2025 年初,该模型仍是一个匿名竞技场条目,其未来尚不确定。如果发布,它可能成为 AI 领域的主要参与者,并可能影响其他实验室后续模型的发展。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·google-deepmind·generative-ai
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史