Qwen3.8是由阿里云开发的一系列大型语言模型。该系列于2025年推出,作为Qwen2.5代的继任者,提供从密集模型到混合专家(MoE)架构的各种参数规模。这些模型既面向开源分发,也通过阿里云平台进行商业部署。
Qwen3.8系列包含多种配置,旗舰密集模型为80亿和320亿参数,同时还有MoE变体,如Qwen3.8-A14B,每个令牌激活22亿参数。这些模型支持131,072个令牌的上下文长度,并基于涵盖30多种语言的多语言数据进行训练,在英语和中文方面表现尤为突出。
架构与训练
Qwen3.8模型采用标准的Transformer (architecture)仅解码器架构,并进行了增强,如多头注意力、SwiGLU激活和旋转位置嵌入。训练过程采用两阶段方法:首先在大规模网络文本、书籍和代码语料上进行预训练,随后进行监督微调和基于AI反馈的强化学习(RLAIF),以与人类偏好对齐。
Qwen3.8的一个显著特点是其混合思考模式,允许模型在快速响应生成和扩展推理之间切换。这通过系统提示进行控制,使用户能够平衡分析的速度和深度。模型在推理过程中还采用了贪婪采样和top-p采样策略。
性能与基准测试
在公开基准测试中,Qwen3.8模型表现出具有竞争力的性能。Qwen3.8-32B模型在MMLU-Pro基准测试中取得75.1分,优于多个更大的模型。在AIME24数学竞赛中,32B模型得分67.0,而MoE变体Qwen3.8-A14B得分81.0。在编码任务中,这些模型在LiveCodeBench和SWE-bench上取得了强劲成绩,其中32B模型在后者的通过率达到45.0。
这些模型已出现在公开的LLM排行榜上,包括LMArena和Open LLM Leaderboard,在其尺寸类别中位列顶级开放权重模型之列。独立评估指出了其效率,尤其是MoE变体,在降低计算成本的同时提供了与密集模型相当的性能。
发布与可用性
Qwen3.8分阶段发布,首先推出较小的0.6B和1.7B模型,随后是8B和32B密集模型,最后是MoE变体。权重在Apache 2.0许可证下分发,允许研究和商业使用。这些模型可通过Hugging Face和ModelScope下载,并可通过阿里云的Model Studio服务进行部署。
硬件支持包括NVIDIA GPU,模型也针对AMD和Intel硬件上的推理进行了优化。部署选项涵盖使用vLLM或SGLang进行本地推理,以及基于云的API。此次发布还包括使用GPTQ和AWQ技术进行量化的版本,以减少内存占用。
反响与影响
Qwen3.8系列在开源AI社区中广受好评,开发者称赞其性能与尺寸之比以及混合思考模式的灵活性。这些模型已被集成到各种应用中,从编码助手到多语言翻译工具。此次发布推动了生成式AI民主化的更广泛趋势,提供了可在消费级硬件上运行的高质量模型。
截至2025年底,Qwen3.8系列仍在积极维护中,定期发布更新和额外的微调变体。这些模型也为模型剪枝和数据增强等领域的进一步研究奠定了基础。