华为盘古是一系列由大型语言模型组成的模型家族,由中国科技公司华为开发(列表中无可用链接)。该系列于2021年4月推出,发布了盘古-α,一个拥有2000亿参数的模型,使其成为当时最大的语言模型之一。盘古模型基于Transformer (architecture)架构构建,并在大规模中英文文本语料库上进行训练。它们通过华为云作为其AI服务的一部分部署,应用于自然语言理解、生成、对话和代码补全等领域。
架构与训练
盘古系列包含多种模型变体,如盘古-α、盘古-Coder和盘古-Σ。盘古-α是原始模型,采用密集Transformer架构,并在2.6TB的语料库上训练。盘古-Coder于2022年发布,是专门用于代码生成的模型,在开源代码库上训练。盘古-Σ于2023年推出,是一个具有数千亿参数的稀疏Transformer模型,基于分层架构以降低计算成本。训练在华为昇腾910 AI芯片上进行,并利用残差连接和层归一化来保证稳定性。
能力与应用
盘古模型支持文本摘要、机器翻译、问答和对话生成等任务。在2021年的一次评估中,盘古-α在多个中文自然语言理解任务上进行了基准测试,据报道在多个数据集上的零样本和少样本设置中优于OpenAI的GPT-3。华为已将盘古模型集成到其云服务产品中,包括盘古PanguStudio平台,该平台为企业提供低代码和无代码工具,以构建定制AI应用。这些模型已用于金融、医疗和制造等行业,据报道在TomTom、Intuitive Surgical和Commure等合作伙伴公司中部署用于特定领域任务,尽管具体细节未广泛公开。
架构改进
为提高效率,盘古-Σ引入了诸如“权重提升”方法和“并行注意力”机制等创新。训练过程使用剪枝和数据增强技术来减少参数冗余。后期版本采用RLAIF(基于AI反馈的强化学习)来使输出与用户偏好对齐。模型还在各层中采用多头注意力和交叉注意力块。
发布历史与生态系统
盘古-α于2021年首次发布。2022年,华为发布了盘古-Coder和用于视觉的盘古-CV。2023年,盘古-Σ发布,声称拥有7000亿参数。2024年,华为在其云上推出了盘古Studio和盘古基础模型服务,并集成到鸿蒙操作系统中。这些模型可通过华为的云平台对应服务访问,尽管它们也直接通过华为云提供。与阿里云及其他提供商的合作并未公开。
反响与争议
2021年,早期批评者提出了关于数据集规模和潜在训练数据泄漏的担忧。华为发布的基准测试结果声称盘古-α在某些中文基准上优于GPT-3,但独立验证有限。该模型的发布引发了关于语言模型基准和结果可复现性的讨论,与围绕DeepMind及其他实验室的类似辩论相呼应。盘古也是中国推动国内AI能力、减少对外国作者的依赖的一部分。截至2024年,该模型仍保持活跃,华为持续投资开发,以与GPT-4和Anthropic等其他LLM竞争(列表中无可用链接)。