qwen3.8-max-0902

译自英文

qwen3.8-max-0902是阿里巴巴云于2025年发布的大型语言模型。它是Qwen3.8-Max系列的一个快照,以在LMArena和LiveBench等公共基准测试中的强劲表现而闻名。

qwen3.8-max-0902是由阿里云开发的大型语言模型,作为Qwen3.8-Max系列的一个快照发布。它是一个大型语言模型,专为通用文本生成、推理和指令遵循而设计。该模型因其在公共基准排行榜(包括LMArena和LiveBench)上的竞争性表现而受到关注,在其尺寸类别中排名靠前。

Qwen3.8-Max系列是阿里云更广泛的Qwen生成式人工智能模型家族的一部分。0902名称指的是2025年9月2日的训练检查点,其中包含对早期快照的增量改进。该模型基于变换器架构,采用多头注意力机制,但具体参数数量和架构细节尚未由开发者完全披露。

基准性能

在LMArena排行榜上,截至2025年10月,qwen3.8-max-0902的Elo评分为1342,在开放权重模型中位列前十。在LiveBench评估中,该模型的总体平均得分为78.4,在编程(82.1)和数学(79.6)子任务中表现尤为突出。这些数字比2025年8月1日发布的先前Qwen3.8-Max快照0801提高了3-5%。

2025年11月,斯坦福AI实验室的第三方研究人员的独立评估确认了该模型在多语言任务(包括中文、英语和西班牙语)中的稳健性。该模型在MMLU-Pro等推理基准上也表现出竞争性,得分为86.2,并在IFEval衡量的指令遵循任务中表现良好。

训练与架构

qwen3.8-max-0902的训练过程采用两阶段方法:首先在超过15万亿个标记的多样化语料库上进行初始预训练,然后进行监督微调和基于AI反馈的强化学习。预训练阶段使用了网页文本、书籍、科学论文和代码仓库的混合数据,并经过仔细过滤以减少重复和低质量内容。

在架构上,该模型采用仅解码器的变换器,具有层归一化残差连接。它使用旋转位置编码,并支持128,000个标记的上下文窗口。该模型在阿里云专有基础设施上训练,其中包括类似定制加速器和GPU节点集群,但具体硬件规格未公开。

发布与可用性

0902快照于2025年9月12日通过阿里云的Model Studio平台正式发布。它采用允许商业使用的宽松许可证,但限制生成有害内容。该模型可通过API访问,也可下载到兼容硬件上进行本地部署,包括配备AMDNVIDIA GPU的系统。

阿里云还发布了该模型的量化版本,包括4位和8位变体,这些版本将内存需求降低高达75%,同时保持大部分原始性能。这些版本针对边缘部署进行了优化,并已在三星电子高通的设备上进行了测试。

反响与影响

qwen3.8-max-0902因其性能与效率的平衡而受到机器学习社区的广泛好评。2025年10月,伯克利AI研究的独立测试发现,该模型在一组精选问题上的回答在92%的情况下事实准确,并且在人口统计敏感性测试中表现出低偏差。

该模型还影响了Qwen系列的后续发展。其训练方法,特别是使用课程学习梯度裁剪技术,在后续快照中被采用。阿里云表示,Qwen3.8-Max系列将继续接收更新,下一个主要版本预计在2026年初发布。

与其他模型的比较

在正面比较评估中,qwen3.8-max-0902在特定编程和数学推理任务上优于多个当代模型,包括来自OpenAIAnthropic的模型。然而,它在创意写作和长篇生成基准上略有落后。该模型的性能常与谷歌DeepMind的Gemini 2.0 Pro进行比较,两者在多语言理解方面具有相似的优势。

人工智能安全方面,该模型包含针对有害提示的内置拒绝机制,阿里云已发布详细的模型卡,记录了潜在限制,包括在专业领域偶尔出现幻觉以及对对抗性输入的敏感性。

未来发展方向

阿里云已宣布Qwen3.8-Max系列将被Qwen4取代,后者计划于2026年下半年发布。该公司还在探索将文本与图像和音频输入相结合的多模态扩展,基于当前纯文本模型的成功。截至2025年12月,这些未来迭代的具体发布日期尚未确认。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·alibaba-cloud·generative-ai·benchmark
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史