Llama(语言模型)

译自英文

Llama是由Meta AI于2023年2月开始发布的一系列大型语言模型,其首个版本的权重在2023年3月被泄露到网上,从而催生了开源生态系统。

Llama(风格化为LLaMA,其中“Large Language Model Meta AI”为反向缩写)是由Meta AI开发的一系列大型语言模型(LLM),于2023年2月首次发布。模型规模从10亿到2万亿参数不等。最初,第一版是一个基础模型,仅以非商业许可向研究人员开放,但从Llama 2开始,Meta在发布基础模型的同时发布了指令微调版本,并放宽了许可。2023年3月,第一版模型权重通过BitTorrent未经授权泄露,显著加速了开源LLM衍生品和工具的扩散。

Llama模型基于Transformer (architecture)架构,与其他当代LLM类似。它们已发布多个版本,每个版本在规模、训练数据和能力方面都有改进。截至2025年,最新版本是2025年4月发布的Llama 4,Meta还将Llama集成到其Meta AI助手中。

背景

在GPT-3等早期大型语言模型发布后,研究重点之一是模型规模的扩大,这在某些情况下带来了涌现能力的显著提升。2022年底ChatGPT的推出及其意外成功,极大地提高了公众和业界对LLM的关注。作为回应,Meta的首席AI科学家Yann LeCun评论称,大型语言模型最适合辅助写作,这反映了与其他科技公司激进部署相比更为谨慎的态度。

初始发布

Llama的第一版(有时称为Llama 1)于2023年2月24日通过博客文章和一篇详细介绍其训练、架构和性能的论文宣布。推理代码以开源GPLv3许可发布,但模型权重的访问受到申请流程的限制,仅按个案向学术研究人员、政府、民间社会和行业研究实验室授予访问权限。该模型仅使用公开可用数据进行训练,并提供多种模型规模(7B、13B、33B和65B参数)以适应不同的硬件能力。它仅是一个基础模型,尽管论文中包含了指令微调的示例。

Meta报告称,13B参数模型在大多数NLP基准测试上优于规模更大的GPT-3(175B参数),而最大的65B模型与PaLM和Chinchilla等最先进模型具有竞争力。

泄露及后续

2023年3月3日,一个包含Llama权重的种子文件被上传,链接在4chan图像板上分享,随后在在线AI社区中传播。同一天,官方Llama仓库中的一个拉取请求要求将磁力链接添加到文档中。3月4日,另一个拉取请求添加了托管该模型的HuggingFace仓库链接。Meta于3月6日提交了删除请求,称该分发未经授权,HuggingFace予以配合。3月20日,Meta对包含从镜像下载Llama脚本的仓库提交了DMCA删除通知,GitHub次日予以配合。

对泄露的反应褒贬不一。一些人推测该模型可能被用于恶意目的,例如更复杂的垃圾邮件。另一些人则庆祝其可访问性,指出较小版本可以相对廉价地运行,可能促进进一步研究。评论者如Simon Willison将Llama与Stable Diffusion(一种公开分发的文本到图像模型,推动了快速工具开发)进行比较,暗示对LLM可能产生类似影响。

Llama 2

2023年7月18日,Meta与微软合作发布了下一代Llama 2,模型规模为7B、13B和70B参数。架构与Llama 1基本保持不变,但训练使用了多40%的数据。Llama 2包含基础模型和聊天微调模型,所有权重均发布用于许多商业用途。然而,由于许可包含可接受使用政策,它不被开放源代码促进会视为开源,Meta对该术语的使用也受到争议。

Code Llama是Llama 2在代码特定数据集上的微调版本,于2023年8月24日发布了7B、13B和34B版本,并于2024年1月29日发布了70B版本。基础模型额外使用了5000亿个代码数据token进行训练,然后是200亿个长上下文数据token,并进一步在50亿个token上进行指令微调。一个Python特定模型在1000亿个Python代码token上进行了训练。

Llama 3

2024年4月18日,Meta发布了Llama 3,有两种规模:8B和70B参数。这些模型在约15万亿个来自公开来源的token上进行了预训练,指令模型在公开指令数据集和超过1000万个带人类标注的示例上进行了微调。Meta的测试显示,Llama 3 70B在大多数基准测试上优于Gemini Pro 1.5和Claude 3 Sonnet。Meta宣布计划使Llama 3支持多语言、多模态,改进编码和推理能力,并增加其上下文窗口。

关于缩放定律,Llama 3模型经验表明,即使超过Chinchilla最优训练数据量,性能仍继续对数线性提升。例如,Llama 3 8B的Chinchilla最优数据集是2000亿个token,但性能在高达15万亿个token(75倍)时仍有所提升。在一次采访中,Mark Zuckerberg指出,8B版本几乎与最大的Llama 2一样强大,而70B模型在训练结束时仍在学习,训练被停止以将GPU资源分配到他处。

Llama 3.1于2024年7月23日发布,引入了405B参数模型,以及更新的8B和70B版本,上下文窗口更长,为128K个token,并改进了多语言支持。

Llama 4及后续

Llama 4于2025年4月发布,采用混合专家架构,规模高达2万亿参数。它引入了多模态能力和改进的推理能力。2026年4月,Meta超级智能实验室发布了Muse Spark作为Llama的替代品,标志着Meta AI战略的转变。

影响与生态系统

Llama 1权重的泄露催化了一个充满活力的开源生态系统,出现了众多微调版本和衍生品。它使研究人员和爱好者无需API成本即可实验LLM,推动了量化、高效推理和本地部署方面的创新。7B和13B等较小模型的可用性使得在消费级硬件上运行LLM成为可能,普及了访问。这与OpenAIAnthropic等其他主要实验室的封闭方法形成对比,并影响了其他组织的后续发布。关于许可的争议也凸显了开源理想与企业控制之间的紧张关系,这一辩论在AI社区中仍在继续。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·meta-ai·open-source-software·ai-leak
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史