译自英文

Qwen3是阿里巴巴云开发的一系列大型语言模型,于2025年发布。它包含密集型和专家混合变体,权重开放,出现在公开排行榜上。

Qwen3是大型语言模型家族,由阿里云开发。该家族于2025年4月发布,包含密集型和混合专家(MoE)架构,参数规模从0.6亿到2350亿不等。这些模型因其开放权重可用性和在公共基准上的强劲表现而备受关注,出现在媒体和LLM排行榜上。发布时包含了基准快照中的20个变体,覆盖不同规模和配置。

Qwen3系列建立在早期由阿里云开发的Qwen和Qwen2模型家族基础之上。这些模型设计用于多种任务,包括文本生成、推理和编码。它们支持多种语言,特别侧重于英语和中文,反映了阿里面向全球和国内用户群体的需求。

架构与变体

Qwen3模型采用Transformer (architecture)架构,这是现代大型语言模型的标准架构。该家族包括密集型模型(每个token激活所有参数)和MoE模型(每个token仅激活部分参数,以提高效率)。最大的密集型模型有320亿参数,而最大的MoE模型总参数为2350亿,每个token激活220亿参数。

基准快照中的20个变体包括0.6B、1.7B、4B、8B、14B、32B密集参数的模型,以及30B-A3B、57B-A14B、235B-A22B配置的MoE模型(其中第二个数字表示激活参数)。每种规模都有基础版和指令微调版,部分还提供“思考”模式,可在回答前进行扩展推理。

训练与特性

Qwen3模型在大型文本语料库上训练,但阿里云未披露确切的数据集规模。训练过程使用了标准技术,如Adam优化器学习率调度。模型融入了多头注意力位置编码等特性,这些在基于transformer的语言模型中很常见。

Qwen3的一个关键特性是其混合思考模式。用户可以在快速直接响应模式和思考模式之间切换,后者在生成最终答案前会生成内部推理步骤。这与OpenAI的o1系列等其他模型家族采用的方法类似,但Qwen3的实现是开源的。

指令微调版本通过RLHF(基于人类反馈的强化学习)和监督微调等技术进行对齐。模型还支持top-p采样温度缩放,用于控制输出的随机性。

性能与基准

Qwen3模型出现在公共LLM排行榜上,包括LMArena(原Chatbot Arena)和各种学术基准。最大的模型Qwen3-235B-A22B在数学、编码和通用知识等任务上,与OpenAIAnthropicGoogle DeepMind的领先闭源模型相比表现出竞争力。

在基准快照中,20个变体覆盖了不同规模,让用户可以选择在性能和计算成本之间取得平衡的模型。较小的模型(0.6B至8B)适合边缘部署,而较大的模型则需要大量GPU资源。这些模型已在MMLU、HumanEval和GSM8K等标准基准上进行了测试,但具体得分因变体而异。

可用性与生态系统

Qwen3模型在开放许可下发布,允许商业和研究用途。它们可从Hugging Face和其他模型仓库下载。阿里云还通过其云平台提供这些模型,并提供API用于部署。

这些模型得到日益壮大的工具和库生态系统的支持,包括用于本地推理的vLLM和Ollama。它们可使用Hugging Face Transformers和PyTorch等框架进行微调。开放权重的特性催生了社区改编,包括可在消费级硬件上运行的量化版本。

反响与影响

Qwen3的发布因其规模和开放性而引人注目。发布时,它是最大的开放权重模型家族之一,与Meta的Llama系列和Mistral AI的模型竞争。MoE变体的加入使大规模模型更易获取,因为它们在推理期间需要更少的计算资源。

媒体报道强调了Qwen3在推理任务上的强劲表现及其多语言能力。这些模型已被用于各种应用,包括聊天机器人、代码助手和教育工具。然而,与所有大型语言模型一样,存在关于潜在偏见和滥用的担忧,阿里云已通过安全微调和使用指南来应对这些问题。

截至2025年年中,Qwen3仍在持续更新,阿里云发布了补丁和额外变体。该模型家族代表了对开源AI社区的重要贡献,提供了高性能的专有系统替代方案。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·alibaba·open-source·transformer
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史