Meta Llama 泄露

译自英文

2023年3月Meta的LLaMA模型权重通过BitTorrent泄露,加速了开源AI的发展,促使Meta随后发布了具有商业许可的Llama 2。

Meta Llama泄露事件指的是LLaMA(大型语言模型Meta AI)模型权重的未经授权分发,该模型是由Meta AI开发的一系列大型语言模型。2023年3月3日,一个包含权重的种子文件被上传并分享到4chan,使得该模型在Meta最初按个案审批的访问政策下仍可被公众获取。此次泄露对开源AI社区产生了重大影响,引发了广泛的实验活动,并影响了Meta随后以更宽松许可证发布Llama 2的决定。

LLaMA于2023年2月24日发布,作为一系列基础模型,参数规模从70亿到650亿不等。Meta将其定位为研究工具,仅向学术研究人员和行业实验室提供访问权限。此次泄露绕过了这些限制,使全球开发者能够在消费级硬件上运行和微调模型,从而激发了创新浪潮,并引发了关于强大AI系统可访问性的辩论。

背景

在2020年代初期,GPT-3的发布以及随后2022年11月ChatGPT的推出,凸显了大型语言模型的能力。研究人员专注于扩展模型规模,观察到推理和翻译等涌现能力。Meta的首席AI科学家Yann LeCun对LLM的主导地位表示怀疑,认为它们最适合用于写作辅助而非通用智能。尽管如此,Meta仍继续推进其LLM研究,最终促成了LLaMA的诞生。

初始发布与访问政策

LLaMA的第一个版本通过一篇博客文章和一篇详细介绍其训练、架构和性能的论文发布。推理代码在GPLv3许可证下开源,但权重则通过申请流程进行门控。Meta旨在向学术研究人员、政府机构和行业实验室提供访问权限,并采用逐案审批的方式。该模型基于公开可用数据进行训练,Meta报告称,130亿参数版本在许多基准测试上优于GPT-3,而650亿参数模型则与PaLM和Chinchilla等最先进系统相媲美。

泄露事件

2023年3月3日,一个包含LLaMA权重的种子文件被上传,链接在4chan上分享,随后传播至AI社区。几天内,官方Llama仓库中的拉取请求添加了磁力链接和托管模型的HuggingFace仓库。Meta于3月6日向HuggingFace发出下架请求,理由是未经授权分发,并于3月20日对GitHub仓库提出DMCA请求。此次泄露引发了广泛讨论;一些人担心恶意使用,而另一些人则庆祝AI的民主化。评论者将这一事件与Stable Diffusion的发布相提并论,后者同样加速了生成式AI的发展。

对开源AI的影响

此次泄露使研究人员和爱好者能够针对各种任务微调LLaMA,推动了生成式AI应用的快速进步。较小的模型可以在消费级GPU上运行,降低了进入门槛。这一时期涌现出大量微调变体和工具,培育了一个充满活力的生态系统。泄露事件也迫使Meta重新考虑其分发策略,因为木已成舟。

Llama 2与商业化

2023年7月18日,Meta与微软合作发布了Llama 2,推出了70亿、130亿和700亿参数模型。与原始版本不同,Llama 2包含基础版本和聊天调优版本,权重在自定义许可证下可用于商业用途。然而,该许可证施加了可接受使用限制,导致开源促进会对Meta使用“开源”一词提出异议。Llama 2的训练数据比前代多40%,其发布标志着向更广泛可访问性的转变。

Code Llama是专为编程设计的变体,于2023年8月24日发布,提供70亿、130亿和340亿参数版本,随后于2024年1月29日推出700亿参数版本。这些模型基于代码数据集进行微调,在编程任务上表现出改进的性能。

Llama 3及后续发展

2024年4月18日,Meta发布了Llama 3,提供80亿和700亿参数版本,训练数据约为15万亿个令牌。这些模型表现出强劲性能,在许多基准测试上击败了Gemini Pro 1.5和Claude 3 Sonnet等竞争对手。值得注意的是,Llama 3表明,即使训练数据超过Chinchilla最优数量,性能仍持续提升,这一发现影响了扩展实践。Mark Zuckerberg指出,80亿参数模型几乎与最大的Llama 2相当,而700亿参数模型在训练结束时仍在学习。

Llama 3.1于2024年7月23日发布,引入了4050亿参数模型并扩展了上下文窗口。Meta还推出了Meta AI,这是一个基于Llama构建的助手,集成到Facebook和WhatsApp中。最新版本Llama 4于2025年4月发布,但在2026年4月,Meta Superintelligence Labs发布了Muse Spark作为其继任者,标志着新的方向。

遗产与争议

此次泄露仍是AI历史上的关键时刻,凸显了企业控制与开放访问之间的紧张关系。它加速了开源运动,促进了本地LLM以及Ollama和LM Studio等工具的普及。然而,它也引发了对滥用的担忧,因为权重可能被用于垃圾信息或虚假信息。Meta随后的发布试图在开放性与安全性之间取得平衡,但关于AI中“开源”定义的争论仍在继续。

参见

参考文献

本文基于公开可用信息以及泄露事件和后续发布时期的报告。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-leak·open-source-ai·large-language-models·meta-ai
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史