Meta Llama 是由Meta AI开发的一系列大型语言模型(LLM),于2023年2月首次发布。名称“Llama”是“Large Language Model Meta AI”的逆向首字母缩略词。这些模型旨在用于研究和商业用途,参数规模从10亿到超过2万亿不等。最初,Llama是一个基础模型,但从Llama 2开始,Meta还发布了指令微调版本。最新版本Llama 4于2025年4月发布,而Meta Superintelligence Labs于2026年4月推出了Muse Spark作为Llama的替代品。
背景
Meta Llama的开发背景是大型语言模型的快速发展。在GPT-3等模型发布后,研究重点转向了规模扩展,这有时会带来显著的涌现能力。ChatGPT的发布及其意外成功,提高了公众和业界对LLM的关注度。作为回应,Meta的首席AI科学家Yann LeCun评论说,大型语言模型在辅助写作任务方面特别有用,这反映了Meta谨慎但积极参与的态度。
首次发布与泄露
Llama的首个版本(称为Llama 1)于2023年2月24日通过博客文章和论文发布,详细介绍了其训练、架构和性能。推理代码以开源GPLv3许可证发布,但模型权重的访问仅限于学术研究人员和关联组织,需逐案批准。该模型基于公开可用的数据进行训练,并提供多种规模以适应不同的硬件能力。Meta报告称,130亿参数的模型在大多数NLP基准测试中优于规模更大的GPT-3(1750亿参数),而最大的650亿参数模型则与PaLM和Chinchilla等最先进模型相当。
2023年3月3日,一个包含Llama权重的种子文件在4chan上泄露,并在AI社区中广泛传播。Meta对HuggingFace仓库和GitHub脚本发出了下架请求,理由是未经授权的分发和版权侵权。反应褒贬不一:一些人担心滥用,而另一些人则赞赏其可访问性,并将其与Stable Diffusion的开源发布相提并论,认为这促进了快速创新。
Llama 2
2023年7月18日,Meta与微软合作发布了Llama 2,提供70亿、130亿和700亿参数三种规模。其架构与Llama 1基本保持不变,但训练数据增加了40%。Llama 2包括基础模型和聊天微调模型,权重在商业许可下发布,但附带了可接受使用政策,这引发了关于其是否符合开源定义的争议。开源促进会认为,这些许可限制使其不能算作真正的开源。
Code Llama是Llama 2的代码生成微调版本,于2023年8月24日发布,提供70亿、130亿和340亿参数版本,随后于2024年1月29日发布了700亿参数版本。其训练额外使用了5000亿个代码数据标记和200亿个长上下文数据标记,并针对指令遵循和Python专用模型进行了进一步微调。
Llama 3
2024年4月18日,Meta发布了Llama 3,提供80亿和700亿参数两种规模。这些模型在约15万亿个来自公开来源的标记上进行了预训练,指令模型则在公开指令数据集和超过1000万个带人工标注的示例上进行了微调。Meta的基准测试显示,Llama 3 700亿参数模型在大多数测试中优于Gemini Pro 1.5和Claude 3 Sonnet。Meta还宣布了多语言和多模态能力、改进的编码和推理能力,以及更大的上下文窗口的计划。
Llama 3表明,即使超过Chinchilla最优训练数据量,性能仍能呈对数线性提升。例如,对于80亿参数的模型,Chinchilla最优数据量为2000亿个标记,但性能在数据量提升至15万亿个标记时仍在改善。Mark Zuckerberg指出,80亿参数版本几乎与最大的Llama 2模型一样强大,而700亿参数版本在训练停止时仍在学习,停止是为了将GPU资源分配到其他地方。
Llama 3.1于2024年7月23日发布,带来了进一步改进和扩展的上下文长度。
Llama 4与继任者
Llama 4于2025年4月发布,延续了模型家族的发展,并增强了能力。2026年4月,Meta Superintelligence Labs发布了Muse Spark作为Llama的替代品,标志着向新一代模型的过渡。
应用与生态系统
Meta Llama模型已被集成到各种产品和服务中。除了Llama 3,Meta还推出了Meta AI,这是一个基于Llama的AI助手,可在专用网站以及Facebook和WhatsApp等平台上使用。这些模型也被第三方开发者和云服务提供商使用,包括Amazon Web Services、Microsoft Azure和Google Cloud,为企业提供LLM能力。Llama的开源特性催生了一个由微调变体和工具组成的活跃生态系统,类似于生成式AI模型周围的社区。
反响与影响
Llama模型的发布对AI领域产生了重大影响。Llama 1的泄露使得强大的LLM得以普及,使大型企业之外的研究和实验成为可能。Llama 2及后续版本提供了OpenAI和Anthropic等专有模型之外的商业可行替代方案。然而,其许可条款引发了关于开源定义的争论,批评者指出可接受使用政策限制了某些应用。尽管如此,Llama已成为开源权重模型的标杆,影响了人工智能领域其他开源项目的发展。
技术架构
Llama模型基于Transformer架构,利用多头注意力和位置编码。它们采用层归一化和残差连接等技术来稳定训练。模型使用SGD变体(如Adam)进行训练,并采用学习率调度和梯度裁剪。在推理时,常用top-k采样和top-p采样,以及温度缩放。Llama 3中观察到的缩放规律为最优训练数据量的研究提供了信息,加深了对深度学习和神经网络的广泛理解。
未来方向
随着Muse Spark于2026年推出,Meta Superintelligence Labs旨在推动AI能力的边界,可能会整合机器学习和生成式AI的进展。从Llama到Muse Spark的过渡表明,Meta正朝着更强大、更高效的模型进行战略转变,很可能基于Llama开发中积累的经验。随着该领域的发展,Meta的贡献继续塑造着开源权重模型的格局,在创新与安全性和可访问性之间寻求平衡。