LLaMA(大型语言模型Meta AI)是由Meta AI开发的一系列大型语言模型,于2023年2月首次发布。这些模型的参数规模从10亿到超过2万亿不等,并已发布多个版本,包括Llama 2、Llama 3和Llama 4。最初为基座模型,后续版本包含指令微调变体,且模型在允许部分商业使用的许可下发布,但并非完全开源。
LLaMA的发布标志着生成式AI民主化的重要一步,因为它为OpenAI的GPT系列等专有模型提供了强大的替代方案。其开放分发,尤其是在第一版未经授权泄露后,激发了AI社区的研究与开发浪潮。
背景
在GPT-3等模型发布后,AI研究社区专注于扩大模型规模,这带来了涌现能力。2022年底ChatGPT的推出加剧了对大型语言模型的兴趣。Meta的首席AI科学家Yann LeCun指出,大型语言模型特别有助于辅助写作任务,将LLaMA定位为此类应用的工具。
初始发布与泄露
LLaMA的第一版于2023年2月24日通过博客文章和一篇详细描述其训练、架构和性能的论文宣布。推理代码在开源GPLv3许可下发布,但模型权重的访问仅限于学术研究人员和行业实验室,需逐案审批。Meta在公开数据上训练了从7B到65B参数的各种规模模型,旨在使其在不同硬件上可用。
2023年3月3日,一个包含LLaMA权重的种子文件被上传到4chan,链接在在线AI社区中传播。这次未经授权的泄露导致模型广泛可用,Meta对HuggingFace仓库和GitHub脚本提出了下架请求。反应不一:有人担心滥用,而有人则庆祝其可访问性,将其与Stable Diffusion的开放发布相提并论,后者加速了创新。
Llama 2
2023年7月18日,Meta与微软合作宣布了Llama 2,发布了70亿、130亿和700亿参数的模型。架构与Llama 1基本不变,但训练数据增加了40%。Llama 2包含基座和聊天微调模型,权重已发布用于许多商业用途,但其许可的可接受使用政策意味着并非完全开源。Code Llama(用于代码的微调模型)于2023年8月和2024年1月发布。
Llama 3及后续
2024年4月18日,Meta发布了Llama 3,参数规模为8B和70B,预训练数据约为15万亿个令牌。这些模型表现出强劲性能,在许多基准测试中超越了Gemini Pro 1.5和Claude 3 Sonnet。Meta还宣布了多语言和多模态能力的计划。Llama 3.1于2024年7月23日发布,Llama 4于2025年4月发布。2026年4月,Meta超级智能实验室推出了Muse Spark作为Llama的替代品。
影响与反响
LLaMA系列对AI生态系统产生了深远影响,使研究人员和开发者能够基于强大的开放模型进行构建。其发布引发了关于开源许可和模型分发伦理的辩论,同时也培育了一个充满活力的工具和应用社区。