译自英文

LLaMA 1 是Meta AI的首个大型语言模型系列,于2023年2月发布,最初仅限研究人员使用,但后来通过BitTorrent公开泄露,标志着开放权重AI发展的一个关键时刻。

LLaMA 1(大型语言模型Meta AI)是Meta家族大型语言模型中的首发版本,于2023年2月24日公布。该模型被设计为基础模型,仅使用公开可用的数据进行训练,参数规模从70亿到650亿不等。其发布标志着大型语言模型格局的重大转变,因为它展示了与规模更大的专有系统相比具有竞争力的性能,同时更便于研究用途。

LLaMA 1的初始分发仅限于学术研究人员和行业实验室,采用非商业许可,访问权限按个案审批。然而,在公布后数周内,模型权重被泄露至网络,导致广泛未经授权的分发,并引发了关于AI系统开放获取的讨论。

背景与语境

LLaMA 1的开发发生在OpenAI的GPT-3发布以及随后的ChatGPT推出之后,大型语言模型领域兴趣高涨的时期。这些系统的成功凸显了扩展神经网络架构的潜力,尤其是transformer架构,它已成为自然语言处理中的主导方法。

Meta的首席AI科学家Yann LeCun将大型语言模型定位为特别有助于辅助写作任务,这使Meta的方法区别于强调更广泛能力的竞争对手。公司旨在创建一种更高效的模型,能够在性能较低的硬件上运行,从而使先进AI研究更便于计算资源有限的学术机构获取。

初始发布与架构

LLaMA的第一个版本通过一篇博客文章和随附的研究论文公布,描述了其训练方法、架构和性能特征。推理代码在开源GPLv3许可下发布,而模型权重仍通过申请流程进行门控。这种混合方法旨在平衡研究透明度与对潜在滥用的担忧。

Meta以多种规模训练了LLaMA 1,其中130亿参数版本在大多数NLP基准测试上优于GPT-3(1750亿参数)。最大的650亿参数模型取得了与PaLM和Chinchilla等最先进系统相当的结果。训练数据完全来自公开来源,模型设计旨在比其更大对应版本更具计算效率。

泄露及其后果

2023年3月3日,一个包含LLaMA权重的种子文件被上传并分享至4chan图像板,链接随后在在线AI社区中传播。数天内,官方LLaMA仓库中出现了添加磁力链接和HuggingFace仓库引用的拉取请求。Meta于3月6日提交了删除请求,将分发定性为未经授权,HuggingFace遵从了这些请求。

3月20日,Meta针对一个包含从镜像下载LLaMA脚本的仓库提交了DMCA删除请求,GitHub于次日遵从。尽管采取了这些努力,模型仍通过各种镜像站点和种子网络广泛可获取。

对泄露的反应存在分歧。一些评论者表达了对潜在恶意应用的担忧,例如生成复杂垃圾邮件。其他人则对可访问性的提高表示欢迎,指出较小版本的模型可以相对低成本运行,可能加速研究和创新。Simon Willison和其他评论者将其与Stable Diffusion进行了比较,后者是公开分发的文本到图像模型,同样迅速引发了工具和技术的广泛扩散。

遗产与影响

LLaMA 1的发布及随后的泄露对AI生态系统产生了持久影响。它证明了大型语言模型可以在大型科技公司之外有效分发,挑战了此类系统需要大规模计算基础设施的假设。该模型的架构和训练方法影响了后续开放权重模型,并为不断增长的开源AI运动做出了贡献。

LLaMA 1的经验塑造了Meta对后续发布的方法。Llama 2于2023年7月18日与微软合作发布,包括基础模型和指令调优模型,并提供更广泛的商业许可。Llama 3于2024年4月18日发布,模型在15万亿个令牌上训练,性能有所提升。这一系列延续至2025年4月的Llama 4,Meta超级智能实验室于2026年4月发布了Muse Spark作为替代。

LLaMA 1的遗产在于它证明了具有竞争力的大型语言模型可以用相对适中的参数数量和公开数据构建,同时也凸显了发布后控制强大AI系统访问的挑战。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·meta-ai·artificial-intelligence·open-source-ai
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史