译自英文

Meta Llama是Meta AI开发的一系列开放权重大型语言模型,于2023年2月首次发布,版本包括Llama 2、Llama 3和Llama 4。

Meta Llama是由Meta AI开发的一系列大型语言模型(LLM),于2023年2月首次发布。名称“Llama”是“Large Language Model Meta AI”的逆向首字母缩略词。这些模型旨在为研究和商业用途提供便利,参数规模从10亿到超过2万亿不等。最初,Llama是一个基础模型,但从Llama 2开始,Meta AI还发布了指令微调版本。最新版本Llama 4于2025年4月发布,2026年4月,Meta Superintelligence Labs推出了Muse Spark作为Llama的替代品。

背景

Meta Llama的开发是在大型语言模型快速发展的背景下进行的。在GPT-3等模型发布后,研究重点转向了规模扩展,这有时会带来涌现能力的显著提升。ChatGPT的发布及其意外成功提高了公众和行业对LLM的关注。作为对ChatGPT的回应,Meta的首席AI科学家Yann LeCun评论说,大型语言模型在辅助写作任务方面特别有用,这反映了Meta谨慎但积极参与的态度。

初始发布与泄露

Llama的第一个版本,风格化为LLaMA,有时也称为Llama 1,于2023年2月24日通过一篇博客文章和一篇详细描述其训练、架构和性能的论文宣布。推理代码在开源GPLv3许可证下发布,但模型权重的访问仅限于学术研究人员和附属组织,并逐案授予。该模型在公开可用的数据上训练,并提供多种尺寸以适应不同的硬件能力。Meta报告称,13B参数模型在大多数NLP基准测试中优于更大的GPT-3(175B参数),而最大的65B模型与PaLM和Chinchilla等最先进模型具有竞争力。

2023年3月3日,一个包含Llama权重的种子文件在4chan上泄露,并在AI社区中传播。Meta向HuggingFace仓库和GitHub脚本提交了删除请求,理由是未经授权的分发和版权侵权。反应不一:一些人担心滥用,而另一些人则庆祝其可访问性,将其与Stable Diffusion的开放分发相提并论,后者促进了快速创新。

Llama 2

2023年7月18日,Meta与微软合作,宣布了Llama 2,提供7B、13B和70B参数尺寸。架构与Llama 1基本未变,但训练数据增加了40%。Llama 2包括基础模型和聊天微调模型,权重在包含可接受使用政策的许可证下发布以供商业使用,这引发了关于其是否符合开源定义的争议。开源倡议组织认为,许可证限制使其不能真正开源。

Code Llama是Llama 2的代码生成微调版本,于2023年8月24日发布,提供7B、13B和34B版本,随后于2024年1月29日发布了70B版本。训练涉及额外的500B代码数据标记和20B长上下文数据标记,并进一步微调了指令跟随和Python专用模型。

Llama 3

2024年4月18日,Meta发布了Llama 3,提供8B和70B参数尺寸。这些模型在约15万亿个来自公开来源的标记上进行了预训练,指令模型在公开指令数据集和超过1000万个人工标注示例上进行了微调。Meta的基准测试显示,Llama 3 70B在大多数测试中优于Gemini Pro 1.5和Claude 3 Sonnet。Meta宣布了多语言和多模态能力、改进的编码和推理以及更大上下文窗口的计划。

Llama 3表明,性能即使在Chinchilla最优训练数据量之外也能继续对数线性扩展。例如,8B模型的Chinchilla最优数据集为2000亿个标记,但性能在高达15万亿个标记时仍在提升。Mark Zuckerberg指出,8B版本几乎与最大的Llama 2一样强大,而70B模型在训练结束时仍在学习,训练停止是为了将GPU资源分配到其他地方。

Llama 3.1于2024年7月23日发布,进一步改进并扩展了上下文长度。

Llama 4及继任者

Llama 4于2025年4月发布,继续以增强的能力演进模型家族。2026年4月,Meta Superintelligence Labs发布了Muse Spark作为Llama的替代品,标志着向新一代模型的过渡。

应用与生态系统

Meta Llama模型已集成到各种产品和服务中。与Llama 3一起,Meta推出了Meta AI,一个基于Llama构建的AI助手,可在专用网站和Facebook、WhatsApp等平台上使用。这些模型也被第三方开发者和云提供商使用,包括Amazon Web ServicesMicrosoft AzureGoogle Cloud,为企业提供LLM能力。Llama的开放权重性质促进了微调变体和工具的活跃生态系统,类似于围绕生成式AI模型的社区。

接受度与影响

Llama模型的发布对AI格局产生了重大影响。Llama 1的泄露使强大LLM的访问民主化,使大型企业之外的研究和实验成为可能。Llama 2及后续版本提供了专有模型(如OpenAIAnthropic的模型)的商业可行替代方案。然而,许可条款引发了关于开源定义的辩论,批评者指出可接受使用政策限制了某些应用。尽管如此,Llama已成为开放权重模型的基准,影响了人工智能领域其他开源努力的发展。

技术架构

Llama模型基于Transformer架构,利用多头注意力位置编码。它们采用层归一化残差连接等技术来稳定训练。模型使用SGD变体(如Adam)进行训练,并采用学习率调度梯度裁剪。在推理中,常用top-k采样top-p采样,以及温度缩放。Llama 3中观察到的缩放规律为最优训练数据大小的研究提供了信息,有助于更广泛地理解深度学习神经网络

未来方向

随着2026年Muse Spark的推出,Meta Superintelligence Labs旨在推动AI能力的边界,可能整合机器学习生成式AI的进展。从Llama到Muse Spark的过渡表明,战略上正转向更强大和高效的模型,很可能建立在Llama开发中吸取的经验教训之上。随着领域的发展,Meta的贡献继续塑造开放权重AI模型的格局,在创新与安全和可访问性考虑之间取得平衡。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·meta-ai·open-source-ai·artificial-intelligence
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史