译自英文

Gemma 3是由Google DeepMind开发的开源权重大型语言模型系列,于2025年3月发布,提供多种尺寸(1B、4B、12B、27B),具备多模态能力和长上下文支持。

Gemma 3 是一个开放权重大型语言模型家族,由Google DeepMind开发。该模型于2025年3月12日发布,基于与Gemini 2.0模型相同的研究和技术构建,但专为开发者和研究人员设计,以便在本地或自有基础设施上运行。Gemma 3 包含四种主要规模,,1B、4B、12B和27B参数,,每种规模均提供基础版和指令微调版,截至2025年底,公开基准快照中总共出现11个变体。

这些模型以其多模态能力著称,支持文本和图像输入,并支持高达128,000个令牌的上下文窗口。Gemma 3 还支持超过140种语言,相比早期Gemma版本有显著扩展。该家族被定位为OpenAIAnthropic模型的竞争性开放权重替代品,尤其是在低于30B参数范围内。

架构与训练

Gemma 3 模型使用Transformer架构,采用多头注意力机制,并在较大规模中引入分组查询注意力以提高效率。模型训练数据混合了网页文档、代码和数学数据,并注重高质量过滤。27B模型使用SwiGLU激活函数和旋转位置嵌入。训练采用Adam优化器,配合余弦学习率调度梯度裁剪

与某些专有模型不同,Gemma 3 的权重在宽松许可下发布,允许商业使用和微调。指令微调变体通过RLHF(基于人类反馈的强化学习)和监督微调进行对齐,并附加安全过滤。

性能与基准

在公开排行榜上,Gemma 3 27B在MMLU(大规模多任务语言理解)、GSM8K(小学数学)和HumanEval(代码生成)等标准基准上取得具有竞争力的分数。截至2025年年中,27B指令模型在特定推理任务上优于许多更大的专有模型,但在复杂多步推理上仍落后于最大的前沿模型。4B和12B规模针对边缘设备和消费级硬件部署进行了优化,而1B模型适用于移动应用。

Gemma 3 在多语言任务中也表现出色,尤其在低资源语言方面具有优势。与前辈相比,这些模型在长上下文处理方面有所改进,能在128K令牌输入下保持连贯性。

部署与生态系统

Gemma 3 可通过多种渠道获取。它可通过Google Cloud Vertex AI和Amazon Web Services SageMaker访问,也可通过GroqSambaNova进行高速推理。这些模型与标准机器学习框架兼容,包括Hugging Face Transformers和vLLM。

对于本地部署,Gemma 3 支持剪枝4位量化等量化技术,使27B模型能在单个高端GPU上运行。较小的变体可在笔记本电脑和树莓派级设备上运行。Google提供了Gemma Cookbook,其中包含微调和部署示例。

安全与负责任使用

Google DeepMind为Gemma 3实施了分层安全方法。指令微调模型包含经过训练的安全过滤器,用于拒绝有害提示,公司还发布了模型卡,详细说明安全基准评估。然而,作为开放权重模型,Gemma 3 可通过微调移除安全护栏,开发者承认了这一权衡。许可协议禁止将模型用于某些高风险应用,如武器开发或监控。

反响与影响

Gemma 3 在AI社区中获得积极反响,因其在性能和可访问性之间取得了平衡。独立评估指出,27B模型在特定任务上通常能匹配或超越更大封闭模型的质量,同时运行成本显著更低。该发布推动了开放权重模型挑战专有系统的日益增长趋势,与阿里巴巴AI21 Labs等其他组织的努力相呼应。

截至2025年底,Gemma 3 仍是需要本地部署或隐私保护AI的研究和生产应用的热门选择。其继任者Gemma 3n于2025年底发布,但Gemma 3 仍在学术和工业环境中广泛使用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·google-deepmind·open-weight·multimodal
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史