Llama泄露与开源化指的是2023年3月Meta AI的LLaMA(大型语言模型Meta AI)权重通过BitTorrent未经授权分发的事件,这一事件催化了AI可及性的转变。该泄露使全球研究人员和开发者能够使用和修改该模型,导致开源衍生模型的激增,并影响了Meta后来在更宽松许可下发布后续版本的决定。这一事件常被比作文本到图像领域中Stable Diffusion的发布,因为它使大型语言模型的访问民主化,并推动了该领域的创新。
Meta AI是Meta Platforms的子公司,于2023年2月推出了LLaMA,这是一个参数规模从10亿到2万亿不等的大型语言模型家族。最初,模型权重仅根据具体情况在非商业许可下提供给学术研究人员。泄露绕过了这些限制,使权重公开可访问,并引发了关于开源AI及其影响的更广泛讨论。
背景
在Llama泄露之前,人工智能领域由OpenAI等公司的专有模型主导,OpenAI于2020年发布了GPT-3,并于2022年11月发布了ChatGPT。ChatGPT的成功凸显了大型语言模型的能力,并加剧了竞争。Meta的首席AI科学家Yann LeCun公开表示,大型语言模型最适合辅助写作,这使Meta的定位与其他科技巨头有所不同。
LLaMA的开发是Meta在Machine learning和Deep learning领域更广泛研究努力的一部分。该模型基于公开可用的数据进行训练,侧重于效率和可访问性。Meta旨在创建一个能在消费级硬件上运行的模型,使其比GPT-3等需要大量计算资源的更大模型更具可及性。
初始发布与泄露
LLaMA于2023年2月24日通过一篇博客文章和一篇详细描述其架构与性能的论文宣布发布。推理代码在开源GPLv3许可下发布,但模型权重通过申请流程进行门控。Meta表示,访问权限将根据具体情况授予学术研究人员、政府、民间社会和行业研究实验室。
2023年3月3日,一个包含LLaMA权重的种子被上传,链接在4chan图像板上分享,随后在在线AI社区中传播。同一天,官方Llama仓库中的一个拉取请求请求将磁力链接添加到文档中。3月4日,另一个拉取请求添加了托管该模型的HuggingFace仓库链接。Meta于3月6日提交了删除请求,将该分发定性为未经授权,HuggingFace予以配合。3月20日,Meta对包含下载脚本的仓库提交了DMCA删除请求,GitHub次日予以配合。
对泄露的反应褒贬不一。一些人担心潜在的恶意用途,如复杂的垃圾邮件。另一些人则庆祝其可及性,指出较小版本的模型可以相对廉价地运行,从而促进进一步研究。Simon Willison等评论员将Llama比作Stable Diffusion,后者是一种公开分发的文本到图像模型,导致了工具的快速扩散。
Llama 2:开放化
2023年7月18日,Meta与微软合作宣布了Llama 2。该版本提供三种规模:70亿、130亿和700亿参数。架构与Llama 1基本保持不变,但训练数据增加了40%。Llama 2包括基础模型和聊天微调版本。与原始版本不同,所有模型均以权重形式发布并允许商业使用,但许可包含可接受使用政策,这导致了开放源代码倡议对“开源”一词的争议。
Code Llama是Llama 2针对代码生成的微调版本,于2023年8月24日发布,提供7B、13B和34B规模,并于2024年1月29日发布70B版本。训练涉及额外的5000亿个代码数据令牌和200亿个长上下文数据令牌,其中Python专用变体基于1000亿个Python代码令牌进行训练。
Llama 3与缩放定律
2024年4月18日,Meta发布了Llama 3,提供8B和70B参数规模。这些模型基于约15万亿个公开可用文本令牌进行预训练,并在超过1000万个带人类注释的示例上进行指令微调。Meta的测试显示,Llama 3 70B在大多数基准测试中优于Gemini Pro 1.5和Claude 3 Sonnet。Meta宣布了多语言和多模态能力、更好的编码和推理以及更大上下文窗口的计划。
Llama 3证明,性能在Chinchilla最优数据量之外继续以对数线性方式扩展。例如,8B模型的最优数据集为2000亿个令牌,但性能在高达15万亿个令牌时仍在提升。Mark Zuckerberg指出,70B模型在训练结束时仍在学习,停止训练的决定是为了将GPU资源分配到其他地方。
Llama 3.1于2024年7月23日发布,并进行了进一步改进。
影响与衍生模型
Llama的泄露和随后的开源化导致了衍生模型和工具的激增。权重的可访问性使研究人员能够针对特定任务微调Llama,从而推动了Generative AI和Large language model应用的创新。这一事件也影响了Meta的战略,因为该公司在每次迭代中都采用了更开放的方法。
与Stable Diffusion的比较是恰当的:这两种模型在公开分发后都引发了创造性爆发。就Llama而言,泄露使轻量级模型的开发成为可能,这些模型可以在消费级硬件上运行,从而使以前仅限于大公司的AI能力访问民主化。
对AI可及性的更广泛影响
Llama泄露凸显了AI开发中专有控制与开放访问之间的紧张关系。虽然Meta最初试图限制访问,但泄露表明,一旦发布,模型权重很难被控制。这对其他AI公司具有影响,如OpenAI和Anthropic,它们采用了不同程度的开放性。
这一事件也促进了关于开源AI的辩论,支持者认为开放访问促进创新和透明度,而批评者则警告潜在滥用。OpenPanel和其他组织已就平衡政策的需求发表了意见。
遗产与未来
截至2025年,Meta于2025年4月发布了Llama 4,延续了开源化的趋势。2026年4月,Meta Superintelligence Labs发布了Muse Spark作为Llama的替代品,标志着新方向的开始。Llama泄露仍然是AI历史上的关键时刻,展示了社区驱动分发的力量以及控制先进技术的挑战。
泄露的遗产在蓬勃发展的开源模型生态系统中显而易见,从mistral到Falcon,这些模型都建立在Llama的基础上。这一事件也影响了政策讨论,政府和机构正在考虑如何在AI中平衡创新与安全。
结论
Llama泄露与开源化标志着AI可及性的转折点,将一个受限的研究模型转变为广泛使用的开放资源。这一事件加速了开源AI的发展,并凸显了社区参与在塑造技术未来中的重要性。随着AI的持续发展,Llama泄露的教训可能会为未来模型发布和治理的决策提供参考。