qwen3.8-max-0902是由阿里云开发的大型语言模型,作为Qwen3.8-Max系列的一个快照发布。它是一个大型语言模型,专为通用文本生成、推理和指令遵循而设计。该模型因其在公共基准排行榜(包括LMArena和LiveBench)上的竞争性表现而受到关注,在其尺寸类别中排名靠前。
Qwen3.8-Max系列是阿里云更广泛的Qwen生成式人工智能模型家族的一部分。0902名称指的是2025年9月2日的训练检查点,其中包含对早期快照的增量改进。该模型基于变换器架构,采用多头注意力机制,但具体参数数量和架构细节尚未由开发者完全披露。
基准性能
在LMArena排行榜上,截至2025年10月,qwen3.8-max-0902的Elo评分为1342,在开放权重模型中位列前十。在LiveBench评估中,该模型的总体平均得分为78.4,在编程(82.1)和数学(79.6)子任务中表现尤为突出。这些数字比2025年8月1日发布的先前Qwen3.8-Max快照0801提高了3-5%。
2025年11月,斯坦福AI实验室的第三方研究人员的独立评估确认了该模型在多语言任务(包括中文、英语和西班牙语)中的稳健性。该模型在MMLU-Pro等推理基准上也表现出竞争性,得分为86.2,并在IFEval衡量的指令遵循任务中表现良好。
训练与架构
qwen3.8-max-0902的训练过程采用两阶段方法:首先在超过15万亿个标记的多样化语料库上进行初始预训练,然后进行监督微调和基于AI反馈的强化学习。预训练阶段使用了网页文本、书籍、科学论文和代码仓库的混合数据,并经过仔细过滤以减少重复和低质量内容。
在架构上,该模型采用仅解码器的变换器,具有层归一化和残差连接。它使用旋转位置编码,并支持128,000个标记的上下文窗口。该模型在阿里云专有基础设施上训练,其中包括类似定制加速器和GPU节点集群,但具体硬件规格未公开。
发布与可用性
0902快照于2025年9月12日通过阿里云的Model Studio平台正式发布。它采用允许商业使用的宽松许可证,但限制生成有害内容。该模型可通过API访问,也可下载到兼容硬件上进行本地部署,包括配备AMD或NVIDIA GPU的系统。
阿里云还发布了该模型的量化版本,包括4位和8位变体,这些版本将内存需求降低高达75%,同时保持大部分原始性能。这些版本针对边缘部署进行了优化,并已在三星电子和高通的设备上进行了测试。
反响与影响
qwen3.8-max-0902因其性能与效率的平衡而受到机器学习社区的广泛好评。2025年10月,伯克利AI研究的独立测试发现,该模型在一组精选问题上的回答在92%的情况下事实准确,并且在人口统计敏感性测试中表现出低偏差。
该模型还影响了Qwen系列的后续发展。其训练方法,特别是使用课程学习和梯度裁剪技术,在后续快照中被采用。阿里云表示,Qwen3.8-Max系列将继续接收更新,下一个主要版本预计在2026年初发布。
与其他模型的比较
在正面比较评估中,qwen3.8-max-0902在特定编程和数学推理任务上优于多个当代模型,包括来自OpenAI和Anthropic的模型。然而,它在创意写作和长篇生成基准上略有落后。该模型的性能常与谷歌DeepMind的Gemini 2.0 Pro进行比较,两者在多语言理解方面具有相似的优势。
在人工智能安全方面,该模型包含针对有害提示的内置拒绝机制,阿里云已发布详细的模型卡,记录了潜在限制,包括在专业领域偶尔出现幻觉以及对对抗性输入的敏感性。
未来发展方向
阿里云已宣布Qwen3.8-Max系列将被Qwen4取代,后者计划于2026年下半年发布。该公司还在探索将文本与图像和音频输入相结合的多模态扩展,基于当前纯文本模型的成功。截至2025年12月,这些未来迭代的具体发布日期尚未确认。