译自英文

Qwen2.5 Coder 是阿里巴巴云于2024年发布的一系列大型语言模型,专门用于代码生成和软件工程。该系列包含多种参数规模和变体,以适应不同的部署场景。

Qwen2.5 Coder 是大型语言模型家族,由阿里云开发,用于代码生成、代码补全和软件工程任务。该家族于2024年作为Qwen2.5系列的一部分发布,继承了早期的Qwen2.5基础模型,面向开发者和企业。这些模型基于Transformer (architecture)架构构建,提供多种参数规模,包括0.5B、1.5B、3B、7B、14B和32B变体,并包含基础版和指令微调版。

这些模型旨在处理广泛的编程语言和软件开发工作流程。它们支持代码合成、错误修复、代码解释和单元测试生成等任务。Qwen2.5 Coder 模型已在公开基准上进行了评估,并出现在各种机器学习生成式AI排行榜上,与其他开放权重代码模型相比表现出有竞争力的性能。

架构与训练

Qwen2.5 Coder 模型使用仅解码器的Transformer (architecture)架构,配备多头自注意力旋转位置嵌入。这些模型采用RMSNorm进行归一化,并在前馈层中使用SwiGLU激活函数。训练过程包括在大规模自然语言和代码数据混合上的预训练,随后进行监督微调和针对指令微调变体的基于AI反馈的强化学习

最大的变体Qwen2.5-Coder-32B包含320亿个参数,支持高达131,072个令牌的上下文窗口,使其能够处理长代码文件和代码库。较小的变体专为边缘部署和资源受限环境设计,其中0.5B模型适用于设备端应用。

能力与性能

Qwen2.5 Coder 模型能够生成超过80种编程语言的代码,包括Python、JavaScript、Java、C++、Go和Rust。它们可以补全部分代码片段,从自然语言描述生成完整函数,并协助代码重构和调试。指令微调变体经过优化,能够遵循包含编码规范、风格指南和项目特定上下文的复杂提示。

在HumanEval、MBPP和SWE-bench套件等公开基准上,较大的Qwen2.5 Coder 模型取得了与同规模其他开放权重代码模型相当或更高的分数。32B模型因其在仓库级代码任务上的强劲表现而受到关注,能够处理多文件更改和跨文件依赖。

部署与生态系统

Qwen2.5 Coder 模型在允许商业使用的开放许可下分发,使其能够集成到AWSAzure和其他云平台中。这些模型可通过Hugging Face和ModelScope获取,并可使用Ollama、vLLM和llama.cpp进行本地推理部署。阿里云还通过其Model Studio服务提供这些模型,为企业用户提供托管API访问。

该家族包括专门变体,如针对指令遵循进行微调的Qwen2.5-Coder-Instruct,以及针对代理式编码工作流程优化的Qwen2.5-Coder-32B-Instruct。这些变体旨在与外部工具和集成开发环境配合使用,支持自动补全和基于聊天的代码辅助等功能。

反响与影响

Qwen2.5 Coder 已在开源社区中被广泛采用,并出现在公开的LLM和媒体排行榜上,位列顶级开放权重代码模型之中。其发布推动了开源AI模型与OpenAIAnthropic等公司专有系统竞争的增长趋势。这些模型已被用于学术研究、企业开发流程和教育环境,并在关于深度学习在软件工程中应用的研究中被引用。

特别是32B变体,因其通过量化技术在消费级硬件上运行的能力而受到关注,使高级代码生成对个人开发者变得可及。该模型家族在性能、宽松许可和多语言支持方面的组合,使其成为构建自定义编码助手和自动化软件工具的热门选择。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·code-generation·alibaba-cloud·open-source-ai
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史