译自英文

LLaMA 2是由Meta AI于2023年7月18日与微软合作发布的一系列大型语言模型,提供7B、13B和70B参数规模,包含基础版和聊天调优版,以其商业使用许可而著称。

LLaMA 2是由Meta AI于2023年7月18日与微软合作发布的一系列大型语言模型(LLM)。它代表了LLaMA(Meta AI大型语言模型)系列的第二代,紧随2023年2月的首次发布之后。这些模型提供了三种参数规模,,70亿、130亿和700亿,,并包括基础模型和针对聊天应用进行微调的版本。与其前身的一个关键区别在于许可:所有LLaMA 2模型均以开放权重发布,并允许许多商业用例,尽管其许可的可接受使用政策意味着它未被开放源代码促进会视为开源。

此次发布标志着Meta在AI模型分发方式上的重大转变。虽然第一个LLaMA模型仅限于学术研究人员,并需逐案审批,但LLaMA 2面向更广泛的受众开放,包括商业实体。此举是行业向更开放模型发布趋势的一部分,但也引发了关于AI背景下开源定义的争论。模型架构与LLaMA 1相比基本保持不变,但训练数据增加了40%,从而在各项基准测试中提升了性能。

背景与语境

LLaMA 2的开发发生在大语言模型快速发展的背景下。继GPT-3等模型取得成功以及ChatGPT意外流行之后,科技公司之间对开发强大LLM的竞争异常激烈。Meta的首席AI科学家Yann LeCun曾公开表示,大语言模型最适合辅助写作任务,这使Meta的方法在更广泛的AI能力讨论中占据了一席之地。

第一个LLaMA模型于2023年2月24日发布,已经证明较小的模型可以与更大的模型竞争。130亿参数版本在大多数NLP基准测试中优于GPT-3(1750亿参数),而650亿模型则与PaLM和Chinchilla等最先进系统不相上下。这种效率部分归因于在公开可用数据上进行训练,以及使用了深度学习神经网络设计中的先进技术。

模型架构与训练

LLaMA 2的架构基于Transformer (architecture)框架,该框架已成为大语言模型的标准。这些模型使用多头注意力机制和位置编码进行训练,与LLaMA 1的设计保持一致。训练过程涉及将数据集比第一版扩大40%,使模型能够从更广泛的文本语料库中学习。

700亿参数模型是该系列中最大的,专为高性能应用而设计,而70亿和130亿版本则为计算资源有限的研究人员和开发人员提供了更易访问的选择。所有模型均以基础模型和指令微调版本发布,后者针对聊天和对话任务进行了微调。这种双重发布在LLaMA系列中尚属首次,该系列最初仅包含基础模型。

许可与商业可用性

LLaMA 2的一个显著特征是其许可模式。与LLaMA 1仅限于学术研究人员并采用非商业许可不同,LLaMA 2在允许商业使用但受可接受使用政策约束的许可下发布。该政策禁止某些应用,如涉及非法活动或有害行为的应用,但允许广泛的合法用途。

Meta将LLaMA 2描述为“开源”的说法受到了开放源代码促进会的质疑,后者维护着开源定义。批评者认为,可接受使用政策和其他限制意味着该许可不符合真正开源的标准。这场辩论凸显了AI社区中关于模型发布中开放性的持续紧张关系。

LLaMA 2的商业可用性对企业和初创公司具有重要意义,使他们能够将模型集成到产品中,而无需向专有提供商支付昂贵的许可费用。这被视为对OpenAIAnthropic等公司封闭模型主导地位的一种制衡。

影响与反响

LLaMA 2的发布在AI社区引起了相当大的关注。其性能,尤其是700亿模型,与当时其他领先模型不相上下,且宽松的许可使其成为研究和商业部署的有吸引力的选择。多种规模的可用性允许用户选择与其硬件能力相匹配的模型,从边缘设备到大型服务器。

在LLaMA 2之后,Meta继续开发该系列,于2023年8月发布了用于代码特定任务的Code Llama,随后于2024年4月发布了性能更优、训练数据集更大的LLaMA 3。LLaMA系列成为Meta AI战略的基石,最终促成了基于LLaMA构建的助手Meta AI的开发,以及2025年4月LLaMA 4的发布。2026年4月,Meta Superintelligence Labs推出了Muse Spark作为LLaMA的替代品,标志着Meta AI模型的下一次演进。

技术细节与变体

LLaMA 2模型使用了现代LLM开发中的常见技术进行训练,包括Adam优化器学习率调度。训练过程还采用了梯度裁剪层归一化来稳定训练并改善收敛。这些方法是该领域的标准做法,反映了当时机器学习的最新技术水平。

Code Llama是LLaMA 2的一个专门变体,在代码特定数据集上进行了微调。70亿、130亿和340亿版本于2023年8月24日发布,700亿版本随后于2024年1月29日发布。训练涉及额外的5000亿个代码数据令牌,随后是200亿个长上下文数据令牌,从而创建了用于通用代码生成的基础模型。在50亿个指令遵循令牌上进一步微调产生了指令版本,而一个单独的Python专用模型则在1000亿个Python代码令牌上进行了训练。

这些技术发展使LLaMA 2成为适用于从自然语言处理到软件开发等各种应用的通用平台。此次发布还促进了更广泛生态系统中的创新,Amazon Web ServicesAzure等公司在云平台上提供LLaMA 2,使其可供更广泛的用户使用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·meta-ai·artificial-intelligence·machine-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史