Llama(言語モデル)

英語からの翻訳

Llamaは、2023年2月にMeta AIが公開した大規模言語モデルのファミリーであり、最初のバージョンの重みは2023年3月にオンラインで流出し、オープンソースエコシステムを促進した。

Llama(风格化为LLaMA,其中“Large Language Model Meta AI”为反向缩写)是大语言模型(LLM)家族,由Meta AI开发,于2023年2月首次发布。模型规模从10亿到2万亿参数不等。最初,第一版仅作为基础模型,以非商业许可提供给研究人员,但从Llama 2开始,Meta在发布基础模型的同时发布了指令微调版本,并放宽了许可。2023年3月,第一版模型权重通过BitTorrent未经授权泄露,显著加速了开源LLM衍生品和工具的普及。

Llama模型基于Transformer (architecture)架构,与其他当代LLM类似。它们已发布多个版本,每个版本在规模、训练数据和能力方面均有改进。截至2025年,最新版本为2025年4月发布的Llama 4,Meta还已将Llama集成到其Meta AI助手中。

背景

在GPT-3等早期大语言模型发布后,研究重点之一是模型扩展,这在某些情况下带来了涌现能力的显著提升。2022年末ChatGPT的推出及其意外成功,极大地提高了公众和行业对LLM的关注。作为回应,Meta的首席AI科学家Yann LeCun评论称,大语言模型最适合辅助写作,这反映了与其他科技公司激进部署相比更为谨慎的立场。

初始发布

Llama的第一版(有时称为Llama 1)于2023年2月24日通过博客文章和一篇详细介绍其训练、架构和性能的论文宣布。推理代码以开源GPLv3许可发布,但模型权重的访问需通过申请流程,并逐案授予学术研究人员、政府、民间社会和行业研究实验室。该模型仅使用公开可用数据进行训练,并提供多种模型规模(7B、13B、33B和65B参数)以适应不同硬件能力。它仅为基础模型,尽管论文中包含指令微调的示例。

Meta报告称,13B参数模型在大多数NLP基准测试中优于规模更大的GPT-3(175B参数),而最大的65B模型与PaLM和Chinchilla等最先进模型相当。

泄露及后续

2023年3月3日,一个包含Llama权重的种子文件被上传,链接在4chan图像板上分享,随后在在线AI社区中传播。同一天,官方Llama仓库中的一个拉取请求请求将磁力链接添加到文档中。3月4日,另一个拉取请求添加了指向托管模型的HuggingFace仓库的链接。Meta于3月6日提交了删除请求,称该分发未经授权,HuggingFace予以配合。3月20日,Meta针对一个包含从镜像下载Llama脚本的仓库提交了DMCA删除请求,GitHub次日予以配合。

对泄露的反应褒贬不一。一些人推测该模型可能被用于恶意目的,例如更复杂的垃圾邮件。另一些人则庆祝其可访问性,指出较小版本可以相对廉价地运行,可能促进进一步研究。Simon Willison等评论员将Llama比作Stable Diffusion,这是一种公开分发的文本到图像模型,推动了快速工具开发,并暗示对LLM可能产生类似影响。

Llama 2

2023年7月18日,Meta与微软合作宣布了下一代Llama 2,模型规模为7B、13B和70B参数。架构与Llama 1基本保持不变,但训练使用了多40%的数据。Llama 2包括基础模型和聊天微调模型,所有权重均发布用于许多商业用途。然而,由于许可包含可接受使用政策,它不被开源促进会视为开源,Meta对该术语的使用也受到争议。

Code Llama是Llama 2在代码特定数据集上的微调版本,于2023年8月24日发布了7B、13B和34B版本,并于2024年1月29日发布了70B版本。基础模型额外使用500B代码数据令牌进行训练,然后使用20B长上下文数据令牌,并进一步在5B令牌上进行指令微调。一个Python特定模型使用100B Python代码令牌进行训练。

Llama 3

2024年4月18日,Meta发布了Llama 3,提供两种规模:8B和70B参数。模型在约15万亿个来自公开来源的令牌上进行预训练,指令模型在公开指令数据集和超过1000万个人工标注示例上进行微调。Meta的测试显示,Llama 3 70B在大多数基准测试中优于Gemini Pro 1.5和Claude 3 Sonnet。Meta宣布计划使Llama 3支持多语言、多模态、更好的编码和推理能力,并增加其上下文窗口。

关于缩放定律,Llama 3模型经验表明,性能即使在超过Chinchilla最优训练数据量后仍继续对数线性扩展。例如,Llama 3 8B的Chinchilla最优数据集为2000亿令牌,但性能在高达15万亿令牌(75倍)时仍有所提升。在一次采访中,Mark Zuckerberg指出,8B版本几乎与最大的Llama 2一样强大,而70B模型在训练结束时仍在学习,停止训练是为了将GPU资源分配到其他地方。

Llama 3.1于2024年7月23日发布,引入了405B参数模型,以及更新的8B和70B版本,上下文窗口延长至128K令牌,并改进了多语言支持。

Llama 4及未来

Llama 4于2025年4月发布,采用混合专家架构,规模高达2万亿参数。它引入了多模态能力和改进的推理能力。2026年4月,Meta超级智能实验室发布了Muse Spark作为Llama的替代品,标志着Meta AI战略的转变。

影响与生态系统

Llama 1权重的泄露催化了一个充满活力的开源生态系统,出现了众多微调和衍生品。它使研究人员和爱好者无需API成本即可实验LLM,带来了量化、高效推理和本地部署方面的创新。7B和13B等较小模型的可用性使得在消费级硬件上运行LLM成为可能,从而民主化了访问。这与OpenAIAnthropic等其他主要实验室的封闭方法形成对比,并影响了其他组织的后续发布。许可争议也凸显了开源理想与企业控制之间的紧张关系,这一辩论在AI社区中仍在继续。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·meta-ai·open-source-software·ai-leak
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴