阿里巴巴千问

译自英文

Qwen(通义千问)是阿里云推出的一系列以开放权重为主的大规模和小规模语言模型,以其宽松的许可协议和广泛的社区采用而闻名。该系列已历经多个版本迭代,包括2026年发布的2.4万亿参数模型Qwen3.8-Max。

Qwen,又称通义千问(中文:通义千问;拼音:Tōngyì Qiānwèn),是由阿里云开发的一系列以开放权重为主的大语言模型和小语言模型(LLM和SLM)。这些模型旨在处理多种自然语言处理任务,包括文本生成、推理和多模态理解。Qwen已成为全球人工智能领域的重要参与者,尤其以其宽松的许可协议及其较小模型在开源社区中的广泛采用而著称。

该系列经历了多次重大迭代扩展,从2023年的初始Qwen版本到2026年的先进Qwen3.8系列。这些模型基于Transformer架构,并利用了深度学习机器学习的技术。Qwen模型经常被用作进一步微调和定制化的起点,许多衍生模型由独立开发者创建。

起源与初始发布

阿里巴巴于2023年4月以通义千问的名称推出了Qwen的测试版。初始架构基于Meta AI的Llama 1模型,这是一种基础性的大语言模型设计。在获得监管批准后,阿里巴巴于2023年9月向公众开放了Qwen。

首次开放权重发布于2023年8月,推出了7B参数模型,随后于2023年12月推出了72B和1.8B变体。这些早期发布确立了Qwen在开源AI社区中的地位,为研究人员和开发者提供了可用于实验的易得模型。

Qwen2系列

Qwen2于2024年6月发布,引入了密集和稀疏(混合专家)模型架构。2024年9月,阿里巴巴发布了部分Qwen2模型的开放权重,同时将其最先进的模型保持专有。该系列包括专门变体,如用于视觉语言任务的Qwen-VL和用于音频处理的Qwen-Audio。

Qwen2-VL系列将视觉Transformer与大语言模型相结合,有20亿和70亿参数的变体。2025年1月,Qwen2.5-VL将此扩展为3、7、32和720亿参数的版本,除72B变体外均根据Apache 2.0许可证授权。Qwen-VL-Max是阿里巴巴截至2024年的旗舰视觉模型,通过阿里云以每百万输入令牌0.41美元的价格销售。

2024年11月,阿里巴巴发布了QwQ-32B-Preview,这是一个类似于OpenAI o1的推理聚焦模型,采用Apache 2.0许可证。该模型具有32K令牌上下文长度,并在某些基准测试上表现优于o1。同月还推出了Accio应用程序。

2025年1月29日,阿里巴巴推出了Qwen2.5-Max。2025年3月24日,Qwen2.5-VL-32B-Instruct作为早期视觉模型的继任者发布。两天后,Qwen2.5-Omni-7B根据Apache 2.0许可证发布,该模型接受文本、图像、视频和音频作为输入,同时生成文本和音频输出,支持实时语音对话。

Qwen3系列

Qwen3模型系列于2025年4月28日发布,所有模型均根据Apache 2.0许可证授权。此次发布包括密集和混合专家(MoE)模型。密集模型的参数规模从0.6B到32B不等,而MoE模型包括30B-A3B(总共30B,激活3B)和235B-A22B(总共235B,激活22B)。这些模型在119种语言和方言的36万亿令牌上进行了训练。

Qwen3系列包括多个变体:具有可切换思考和非思考模式的Qwen3、仅用于预训练的Qwen3 Base、仅用于非思考模式的Qwen3 Instruct,以及仅用于思考模式的Qwen3 Thinking。此外,Qwen3-Max是一个拥有超过1万亿参数的专有模型,可通过API使用,还有Qwen3-Max-Thinking,这是一个能够生成文本、图片或视频的推理变体。

Qwen3.5及后续版本

2026年2月,阿里巴巴发布了开放权重的Qwen3.5和专有的Qwen3.5-Plus。阿里巴巴表示,Qwen3.5能够操作桌面和移动应用程序。Qwen3.5-Omni和Qwen3.6-Plus于2026年4月作为专有模型发布,仅可通过聊天网站和阿里云平台访问。Qwen3.6模型于同月根据Apache许可证发布。

阿里巴巴分别于2026年5月和6月发布了专有的Qwen3.7模型的Max和Plus变体。开源社区贡献了微调和“abliterated”版本,包括融入了Anthropic公司Fable 5训练数据的“Qwable”。

Qwen3.8-Max

阿里巴巴在2026年7月预览了其2.4万亿参数的Qwen3.8-Max模型,并宣布将发布其权重。这一公告发布数天后,竞争对手Kimi K3模型发布。Qwen3.8-Max的云版本于2026年8月3日发布,采用稀疏混合专家架构,激活参数约950亿,支持高达一百万个令牌的上下文窗口。

2026年8月14日,阿里巴巴发布了Qwen3.8-2.4T-A95B的权重。该版本移除了图像输入和非思考模式等功能。当时,它是仅次于Kimi K3的第二大开放权重大语言模型和中国大语言模型。同年8月14日,阿里巴巴发布了Qwen3.8-27B,此版本包含较大版本中所省略的图像输入和非思考模式,并根据更宽松的Apache 2.0许可证发布。

生态系统与应用

Qwen模型已被下载超过4000万次,整个系列发布了超过100个开放权重模型。爱好者开发了微调版本,例如旧金山Abacus AI公司的“Liberated Qwen”,它可以在没有内容限制的情况下响应用户请求。

Qwen的本地版本被苹果智能(Apple Intelligence)在中国使用,并与操作系统集成。2026年1月,Qwen移动应用的一次更新将聊天机器人连接到阿里巴巴集团生态系统,从食品配送开始。计划包括允许用户向淘宝和飞猪等平台分配任务,并帮助处理电话和文档处理等事务。

领导层与未来方向

前Qwen AI模型部门负责人林俊阳于2026年3月在Qwen3.5和Qwen3.5-Plus发布后辞职,成为当年第三位离开阿里巴巴的高管。鉴于可能偏离研究和开源方向的担忧,阿里巴巴表示将继续专注于开源。同月晚些时候,公司公告宣布成立一个新的AI部门,表明了对该领域的持续承诺。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·large-language-models·open-source-software·alibaba-cloud
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史