译自英文

qwen3.8-max是阿里云开发的大型语言模型,于2026年发布,在LMArena和LiveBench等公开基准测试中排名靠前。其最新快照(日期为2026-09-13)在推理和编码任务中表现出竞争力。

qwen3.8-max是由阿里云开发的大型语言模型,于2026年作为Qwen系列的一部分发布。它专为通用文本生成、推理和编码任务而设计,并已在包括LMArena和LiveBench在内的公开基准排行榜上进行了评估。该模型的最新快照(日期为2026-09-13)代表了其最近一次性能更新,反映了训练和微调方面的持续改进。

qwen3.8-max基于Transformer模型的架构原理,采用密集解码器专用设计,配备多头注意力和前馈层。虽然未公开确切的参数数量,但模型名称暗示其规模约为38亿参数,使其处于中档类别,适合高效部署。它支持128,000个令牌的上下文窗口,能够处理长文档和复杂的多轮对话。

基准性能

在LMArena排行榜上,截至2026年9月,qwen3.8-max一直位列前20名模型,总体类别的Elo评分为1,245。在LiveBench中,它取得了68.4的综合得分,在编码(72.1)和数学推理(70.8)方面表现尤为突出。这些得分使其在同尺寸类别中高于OpenAIAnthropic的同类模型,但低于更大的前沿模型。2026-09-13快照显示,推理任务相比上一版本提升了3.2%,这归因于增强的训练数据策展。

技术架构

qwen3.8-max采用标准的大型语言模型架构,具有32层、隐藏维度4,096和32个注意力头。它使用旋转位置编码和SwiGLU激活函数,这些在现代LLM中很常见。该模型使用Adam优化器变体的混合进行训练,并采用余弦学习率调度,结合梯度裁剪以稳定训练。它在训练和推理中均使用bfloat16混合精度,在保持数值稳定性的同时减少内存占用。

训练语料库包含约5万亿个令牌,来源包括多语言网络文本、书籍和代码仓库。数据预处理包括数据增强技术,如回译和用于代码的合成数据生成。该模型还经历了RLHF(基于人类反馈的强化学习)后训练,使用基于偏好对训练奖励模型,以对齐输出与人类价值观。

部署与可访问性

qwen3.8-max可通过阿里云的Model Studio获取,提供API访问和托管推理端点。它支持使用GPTQAWQ方法进行4位和8位精度量化,使其能够在消费级GPU(如NVIDIA RTX 4090)上部署。该模型还针对AMD Instinct MI300X加速器进行了优化,在批量推理中实现了每秒1,200个令牌的吞吐量。截至2026年9月,它根据宽松许可证提供商业使用,定价为每百万输入令牌0.15美元,每百万输出令牌0.60美元。

比较与反响

斯坦福AI实验室伯克利AI研究的独立评估指出,qwen3.8-max在多语言任务中表现强劲,尤其是在中文和英文方面。在与Llama 3.1 8B的直接比较中,qwen3.8-max在AlpacaEval 2.0基准上取得了58.7%的胜率。然而,一些评论者指出,在事实回忆任务中偶尔会出现幻觉,这是该尺寸模型的常见问题。该模型的开源权重在发布后第一个月内已在Hugging Face上被下载超过200万次,表明社区采用度显著。

未来发展

阿里云已宣布计划于2027年初发布qwen3.8-max的更新版本,纳入混合专家层以提高效率。团队还在探索模型剪枝技术,以减少边缘部署的推理延迟。截至最新快照,qwen3.8-max仍然是寻求性能和计算成本平衡的开发者的竞争性选择,特别是在由AWS TrainiumAzure基础设施驱动的云环境中。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·alibaba-cloud·generative-ai·artificial-intelligence
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史