LLaMA(Large Language Model Meta AI,作为反向缩略词)是由Meta AI自2023年2月起发布的一系列大型语言模型(LLM)。该系列模型具有多种规模,参数范围从10亿到2万亿不等。最初作为基础模型发布,从Llama 2开始,Meta AI还随基础模型一同发布了指令微调版本。最新版本为Llama 4,于2025年4月发布。2026年4月,Meta超级智能实验室发布了Muse Spark作为Llama的替代品。
背景
在GPT-3等大型语言模型发布之后,研究重点之一是对模型进行扩展,在某些情况下这显示出新兴能力的显著提升。ChatGPT的发布及其意外成功引起了人们对大型语言模型的更多关注。与其他对ChatGPT的回应相比,Meta的首席AI科学家Yann LeCun表示,大型语言模型最适合辅助写作。
版本
初始发布
Llama的第一个版本(风格化为LLaMA,有时称为Llama 1)于2023年2月24日通过一篇博客文章和一篇描述模型训练、架构及性能的论文宣布。用于运行模型的推理代码以开源GPLv3许可证公开发布。模型权重的访问通过申请流程管理,访问权限将“逐案授予学术研究人员;与政府、民间社会和学术界组织有关联的人员;以及世界各地的工业研究实验室”。
Llama仅使用公开可用的信息进行训练,并以多种模型规模进行训练,旨在使其更适用于不同硬件。该模型纯粹是基础模型,尽管论文中包含指令微调版本的示例。Meta AI报告称,13B参数模型在大多数NLP基准测试中的表现超过了规模更大的GPT-3(拥有175B参数),而最大的65B模型则与PaLM和Chinchilla等最先进模型具有竞争力。
#### 泄露
2023年3月3日,一个包含Llama权重的种子文件被上传,种子链接在4chan图像板上分享,随后在在线AI社区中传播。同一天,主Llama仓库中开启了一个拉取请求,要求将磁力链接添加到官方文档中。3月4日,一个拉取请求被开启,要求添加包含该模型的HuggingFace仓库链接。3月6日,Meta提交了删除请求,以移除拉取请求中链接的HuggingFace仓库,将其定性为模型的“未经授权分发”。HuggingFace遵守了这些请求。3月20日,Meta针对一个包含从镜像下载Llama脚本的仓库提交了DMCA删除请求,指控其侵犯版权,GitHub于次日遵守。
对泄露的反应各不相同。一些人推测该模型将被用于恶意目的,例如更复杂的垃圾邮件。一些人则庆祝该模型的可访问性,以及较小版本模型可以相对廉价地运行这一事实,认为这将促进更多研究发展的繁荣。多位评论员,如Simon Willison,将Llama与Stable Diffusion进行了比较,后者是一种文本到图像模型,与之前类似复杂的模型不同,它是公开分发的,导致了相关工具、技术和软件的快速扩散。
Llama 2
2023年7月18日,Meta与微软合作宣布了Llama 2(风格化为LLaMa 2),即Llama的下一代版本。Meta训练并发布了三种模型规模的Llama 2:70亿、130亿和700亿参数。模型架构与Llama 1模型基本保持不变,但用于训练基础模型的数据增加了40%。
Llama 2包括基础模型和针对聊天进行微调的模型。与原始版本Llama的进一步不同之处在于,所有模型均以权重形式发布,并可用于许多商业用例。由于Llama的许可证执行了可接受使用政策,禁止Llama用于某些目的,因此它不是开源的。Meta使用“开源”一词来描述Llama的做法已受到开放源代码倡议组织(维护开源定义)及其他方面的质疑。
Code Llama是Llama 2针对代码特定数据集的微调版本。7B、13B和34B版本于2023年8月24日发布,70B版本于2024年1月29日发布。从Llama 2的基础模型开始,Meta AI将额外训练5000亿个代码数据集令牌,然后再训练200亿个长上下文数据令牌,从而创建Code Llama基础模型。该基础模型进一步在50亿个指令跟随令牌上进行训练,以创建指令微调版本。还创建了另一个针对Python代码的基础模型,该模型在1000亿个纯Python代码令牌上进行训练,然后再进行长上下文数据训练。
Llama 3
2024年4月18日,Meta发布了Llama 3,具有两种规模:80亿和700亿参数。这些模型已在约15万亿个从“公开可用来源”收集的文本令牌上进行了预训练,指令模型则在“公开可用的指令数据集以及超过1000万个带有人工标注的示例”上进行了微调。Meta AI在2024年4月的测试显示,Llama 3 70B在大多数基准测试中优于Gemini Pro 1.5和Claude 3 Sonnet。Meta还宣布计划使Llama 3支持多语言和多模态,改进编码和推理能力,并扩大其上下文窗口。
关于缩放定律,Llama 3模型经验表明,当模型在超过“Chinchilla最优”数量的数据上进行训练时,性能继续以对数线性方式扩展。例如,Llama 3 8B的Chinchilla最优数据集为2000亿个令牌,但性能继续以对数线性方式扩展到15万亿个令牌的数据集,后者是前者的75倍。在与Dwarkesh Patel的采访中,Mark Zuckerberg表示,Llama 3的8B版本几乎与最大的Llama 2一样强大。与之前的模型相比,Zuckerberg表示团队对70B模型即使在15T令牌训练结束时仍在学习感到惊讶。决定结束训练以将GPU算力集中到其他地方。
Llama 3.1于2024年7月23日发布,规模为80亿、700亿和4050亿参数。405B模型是第一个采用混合专家模型的Llama,并以允许再分发和修改的许可证发布,但限制将其用于改进其他大型语言模型。Llama 3.2于2024年9月25日发布,规模为10亿和30亿参数用于边缘设备,以及110亿和900亿参数用于视觉任务。Llama 3.3于2024年12月6日发布,包含一个针对效率优化的700亿参数模型。
Llama 4
Llama 4于2025年4月发布。初始发布包括Llama 4 Scout、Maverick和Behemoth。Scout和Maverick作为开放权重模型发布,而Behemoth作为预览版发布。Scout是一个170亿参数模型,具有1000万令牌的上下文窗口,Maverick是一个4000亿参数的混合专家模型,具有100万令牌的上下文窗口。Behemoth是一个2万亿参数的混合专家模型,在发布时仍在训练中。
反响与影响
Llama的初始发布,尤其是泄露事件,对AI社区产生了重大影响。较小模型的可访问性使得在消费级硬件上进行研究和开发成为可能,促进了微调变体和工具的激增。Llama模型已被广泛用于学术研究和商业应用,并影响了其他组织后续的开放权重模型发布。Llama 3和Llama 4的发布延续了这一趋势,Meta将Llama定位为OpenAI、Anthropic和Google DeepMind专有模型的领先开放权重替代品。