英語からの翻訳

Qwen(通义千问)是阿里云计算公司推出的一系列以开放权重为主的大型和小型语言模型,以其宽松的许可协议和广泛的社区采用而闻名。该系列已历经多个版本演进,包括于2026年发布的拥有2.4万亿参数的Qwen3.8-Max。

Qwen(中文名:通义千问)是阿里云开发的一系列以开放权重为主的大型和小型语言模型(LLM和SLM)。这些模型旨在处理多种自然语言处理任务,包括文本生成、推理和多模态理解。Qwen已成为全球人工智能领域的重要参与者,尤其以其宽松的许可协议以及在开源社区中被广泛采用的小型模型而闻名。

该系列经历了多次重大迭代,从2023年的初版Qwen发展到2026年的先进Qwen3.8系列。这些模型基于Transformer架构,并利用了深度学习机器学习的技术。Qwen模型经常被用作进一步微调和定制的起点,许多独立开发者基于其创建了衍生模型。

起源与首次发布

阿里巴巴于2023年4月以“通义千问”为名发布了Qwen的测试版。其初始架构基于Meta AI的Llama 1模型,这是一种基础性的大型语言模型设计。在获得监管批准后,阿里巴巴于2023年9月向公众开放了Qwen。

首次开放权重发布发生在2023年8月,推出了70亿参数模型,随后于2023年12月发布了720亿和18亿参数的变体。这些早期发布确立了Qwen在开源AI社区中的地位,为研究人员和开发者提供了易于使用的实验模型。

Qwen2系列

Qwen2于2024年6月发布,引入了密集和稀疏(专家混合)两种模型架构。2024年9月,阿里巴巴发布了部分Qwen2模型的权重,同时保留了其最先进的模型为专有。该系列包括专门化的变体,如用于视觉语言任务的Qwen-VL和用于音频处理的Qwen-Audio。

Qwen2-VL系列将视觉Transformer与LLM相结合,提供了20亿和70亿参数的变体。2025年1月,Qwen2.5-VL扩展了该系列,推出了30亿、70亿、320亿和720亿参数版本,所有这些版本均根据Apache 2.0许可证发布。截至2024年,阿里巴巴的旗舰视觉模型Qwen-VL-Max通过阿里云销售,价格为每百万输入token 0.41美元。

2024年11月,阿里巴巴发布了QwQ-32B-Preview,这是一款专注于推理的模型,类似于OpenAI的o1,采用Apache 2.0许可证。该模型具有32K token的上下文长度,在某些基准测试中表现优于o1。同月,Accio应用也正式上线。

2025年1月29日,阿里巴巴发布了Qwen2.5-Max。2025年3月24日,Qwen2.5-VL-32B-Instruct作为早期视觉模型的继任者发布。两天后,Qwen2.5-Omni-7B发布,采用Apache 2.0许可证,支持文本、图像、视频和音频输入,并可生成文本和音频输出,实现了实时语音对话。

Qwen3系列

Qwen3模型系列于2025年4月28日发布,所有模型均采用Apache 2.0许可证。该系列包括密集和专家混合(MoE)模型。密集模型的参数规模从6亿到320亿不等,而MoE模型包括30B-A3B(总参数300亿,激活参数30亿)和235B-A22B(总参数2350亿,激活参数220亿)。这些模型在119种语言和方言的36万亿token上进行了训练。

Qwen3系列包含多个变体:支持思考和非思考模式切换的Qwen3、用于预训练的Qwen3 Base、仅支持非思考模式的Qwen3 Instruct,以及仅支持思考模式的Qwen3 Thinking。此外,Qwen3-Max是阿里巴巴的专有模型,参数超过1万亿,可通过API访问,Qwen3-Max-Thinking是其推理变体,能够生成文本、图片或视频。

Qwen3.5及后续版本

2026年2月,阿里巴巴发布了开放权重的Qwen3.5和专有的Qwen3.5-Plus。阿里巴巴表示,Qwen3.5能够在桌面和移动应用中运行。2026年4月,Qwen3.5-Omni和Qwen3.6-Plus作为专有模型发布,仅可通过聊天网站和阿里云平台访问。同月,Qwen3.6以Apache许可证发布。

2026年5月和6月,阿里巴巴分别发布了专有的Qwen3.7 Max和Plus变体。开源社区贡献了微调和“去审查”(abliterated)版本,其中包括“Qwable”,该版本使用了Anthropic的Fable 5数据进行微调。

Qwen3.8-Max

2026年7月,阿里巴巴预告了其2.4万亿参数的Qwen3.8-Max模型,并宣布计划开放其权重。这一公告发布在Moonshot AI发布其竞品Kimi K3模型几天之后。Qwen3.8-Max的云版本于2026年8月3日上线,采用稀疏专家混合架构,每次前向传播激活约950亿参数,支持高达100万token的上下文窗口。

2026年8月12日,阿里巴巴以Qwen3.8-2.4T-A95B的名称发布了该模型的权重。这个开放权重模型省略了某些云功能,如图像输入和非思考模式。其许可证要求年收入超过5000万美元的模型提供商必须从阿里巴巴获得商业许可。当时,它是仅次于Kimi K3的第二大、第二强大的开放权重LLM和中文LLM。

2026年8月14日,阿里巴巴发布了Qwen3.8-27B,该模型包含了较大版本中省略的图像输入和非思考模式功能。此版本采用了更为宽松的Apache 2.0许可证。

生态系统与应用

Qwen模型的下载量已超过4000万次,该系列已发布超过100个开放权重模型。爱好者们开发了许多微调版本,例如旧金山AI公司Abacus AI推出的“Liberated Qwen”,该版本在无内容限制的情况下响应用户请求。

苹果智能(Apple Intelligence)在中国使用了一个本地版本的Qwen,并将其集成到操作系统中。2026年1月,Qwen移动应用的一次更新将聊天机器人接入阿里巴巴的生态系统,首先从餐饮外卖服务开始。计划包括允许用户向淘宝和飞猪等平台分配任务,以及帮助处理电话和文档等事务。

领导层与未来方向

2026年3月,Qwen AI模型部门前负责人林俊阳在Qwen3.5和Qwen3.5-Plus发布后辞职,成为当年第三位离开阿里巴巴的高管。在业界对阿里巴巴可能从研究转向、减少开源AI投入的担忧中,阿里巴巴表示将继续专注于开源。同月晚些时候,公司宣布成立一个新的人工智能部门,表明其对该领域的持续承诺。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·large-language-models·open-source-software·alibaba-cloud
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴