译自英文

LLaMA 2,由Meta AI于2023年7月18日发布,是一系列开放权重的大型语言模型,参数规模分别为70亿、130亿和700亿,以其允许商业使用而著称。

LLaMA 2(风格化为 LLaMa 2)是Meta AI于2023年7月18日与微软合作发布的一系列大型语言模型。它继承了最初的LLaMA模型,并因使模型权重可供商业使用而闻名,这与早期版本仅限学术访问的受限做法有所不同。此次发布包括基础模型和指令微调的聊天变体,参数规模分别为70亿、130亿和700亿。

模型架构与LLaMA 1相比基本保持不变,但训练数据增加了40%。LLaMA 2基于公开可用的数据进行训练,聊天版本则使用了RLHF(基于人类反馈的强化学习)等技术进行微调。这些模型在自定义许可下分发,该许可允许商业使用,但施加了可接受使用政策,这引发了关于它们是否符合开源软件资格的争议。

背景

2022年底ChatGPT的发布及其迅速流行,加剧了人们对生成式AI大型语言模型的兴趣。Meta的首席AI科学家Yann LeCun此前曾表示,此类模型最适合辅助写作,这使Meta的方法在更广泛的AI格局中定位明确。

LLaMA 1于2023年2月24日发布,是一个参数规模从1B到65B的基础模型系列。其权重最初仅根据具体情况向研究人员提供,并采用非商业许可。2023年3月,未经授权的LLaMA 1副本通过BitTorrent和HuggingFace泄露,促使Meta提出删除请求。此次泄露被比作Stable Diffusion的开放分发,后者曾激发了社区的快速创新。

发布与特性

LLaMA 2于2023年7月18日发布,提供三种参数规模:7B、13B和70B。基础模型在2万亿个公开可用数据令牌上进行训练,比LLaMA 1增加了40%。聊天模型在超过100万条人工标注上进行了微调,并使用RLHF来使响应与用户意图保持一致。

LLaMA 2的许可允许商业使用,但包含诸如禁止用于改进其他大型语言模型等限制。这导致开源倡议组织认为,尽管Meta使用了“开源”一词,但LLaMA 2并非真正的开源。

商业与生态影响

LLaMA 2的商业可用性使其成为初创公司和企业在寻求OpenAIAnthropic专有模型替代方案时的热门选择。它被集成到Amazon Web Services(AWS)、AzureGoogle Cloud平台中,从而能够通过托管服务进行部署。70B模型因其在基准测试中的表现而特别引人注目,通常能与更大的专有模型相媲美。

2023年8月,Meta发布了Code Llama,这是LLaMA 2针对代码生成进行微调的版本,参数规模为7B、13B、34B,后来扩展到70B。这扩展了LLaMA 2在软件开发任务中的适用性。

后续版本与遗产

LLaMA 2于2024年4月18日被LLaMA 3取代,后者引入了在15万亿个令牌上训练的8B和70B模型。LLaMA 3表明,即使超过Chinchilla最优训练数据量,性能仍能持续提升,这一发现影响了扩展实践。LLaMA 3.1于2024年7月23日发布,包含405B参数模型,而LLaMA 4于2025年4月发布。

2026年4月,Meta Superintelligence Labs推出了Muse Spark作为LLaMA的替代品,标志着Meta AI模型策略的转变。LLaMA 2在开放权重大型语言模型的历史上仍是一个重要里程碑,它为商业可及性树立了先例,并塑造了生成式AI的生态系统。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·meta-ai·open-source-ai·2023-releases
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史