Meta Llama 2 发布

译自英文

Llama 2是由Meta AI于2023年7月发布的一系列大型语言模型,其特点在于公开提供权重供商业使用,从而扩展了开源AI生态系统。

Llama 2 是由 Meta AI 开发的大型语言模型(LLM)系列,于 2023 年 7 月 18 日与微软合作发布。它是原始 Llama 模型的继任者,包括基础模型和经过指令微调的聊天版本。与其前身不同,Llama 2 的权重可供广泛商业使用,但需遵守可接受使用政策,这显著影响了开源 AI 生态系统。

Llama 2 模型是更广泛的 大型语言模型 领域的一部分,建立在 Transformer 架构和 深度学习 技术的进步之上。此次发布被视为向民主化获取强大 AI 迈出的重要一步,为 OpenAIGoogle DeepMind 等公司的专有模型提供了有竞争力的替代方案。

背景

2020 年代初期大型语言模型的快速发展,为 Llama 的出现奠定了基础,这与 生成式 AI 工具的成功密不可分。GPT-3 的发布表明,扩大模型规模可以带来能力的显著提升。2022 年 11 月,OpenAI 推出了 ChatGPT,获得了广泛关注,并引发了 AI 研究和投资的热潮。

Meta AI 作为 Meta 的 AI 研究部门,在该领域一直很活跃,其贡献包括由 Google DeepMind 等机构的研究人员开发的 Transformer 架构。Meta 的首席 AI 科学家 Yann LeCun 公开表达了对大型语言模型炒作现象的怀疑,称它们最适合辅助写作任务,这反映了 Meta 专注于让 AI 更实用和更易获取的立场。

初次发布与泄露

原始 Llama 系列(Llama 1,风格化为 LLaMA)于 2023 年 2 月 24 日通过博客文章和技术论文宣布。它提供从 1 亿到 650 亿参数的不同规模,基于公开可用的数据进行训练。最初,模型权重仅在非商业许可下,根据具体情况提供给研究人员使用。

然而,权重很快被泄露到网上。2023 年 3 月,权重的种子文件被分享到 4chan 并迅速传播。Meta 向 HuggingFace 和 GitHub 发送了删除请求,要求移除托管该模型的仓库,但这次泄露使得广泛的私人使用和研究成为可能。许多人将这次泄露视为开放 AI 的转折点,并将其与 Stable Diffusion 加速创新相提并论。

Llama 2 发布

2023 年 7 月 18 日,Meta 与微软合作宣布了 Llama 系列的下一代产品 Llama 2。该公司发布了三种参数规模:70 亿、130 亿和 700 亿参数。Meta 还发布了基础模型和微调变体。具体来说,聊天微调版本专为对话使用而设计。

这些模型的训练数据比原始 Llama 多 40%,但架构基本保持不变。Llama 2 模型使用了带有注意力机制的 残差网络 块,并受益于 层归一化 和其他创新。指令微调使用了 RLAIF 风格的技术,结合了监督微调和人类反馈。

商业可用性与许可

Llama 2 发布最引人注目的方面是决定免费提供权重,用于许多商业应用。Meta 在自定义许可下发布了这些模型,允许将其用于商业和研究目的,进行使用、复制和修改,但根据政策对某些用例有限制。

由于可接受使用政策和其他条款,许多批评者认为 Llama 2 不符合开放源代码倡议(OSI)对真正开源的标准。尽管如此,一个强大的语言模型可供商业使用,这本身就是一个里程碑,使较小的组织和个体能够在无需依赖付费 API 的情况下,基于该技术进行构建。

微软的合作关系值得注意,因为它将该版本与其 Azure 基础设施集成在一起。这些模型在 Azure AI 模型目录中提供,但也可以直接下载,这提高了可访问性。

模型架构与训练

Llama 2 采用了与其前身相似的架构,但在扩展方面进行了调整。模型规模最高达 700 亿参数,使其能够捕捉更复杂的模式。训练使用了多种来源,包括网页、书籍和其他公共数据,并侧重于质量过滤。

训练过程的一个关键方面涉及优化交叉熵损失,使用 学习率调度模型剪枝 等原则。Meta 还结合了 丢弃法权重初始化 等技术来提高性能。

提供了 7B、13B 和 70B 模型,其中 70B 模型设计用于在多个 GPU 上运行。Llama 2 与 GPT-3Chinchilla 等当代模型进行了评估,在各种基准任务(包括推理和编码)上取得了有竞争力的结果。

对开源 AI 生态系统的影响

Llama 2 的发布,凭借其商业可用性,显著加速了开源 AI 生态系统的成长。它为专有模型提供了替代方案,培育了一个由开发者、研究人员和初创公司组成的社区。许多公司,如 AI21-LabsInflection AI,使用 Llama 2 作为他们自己模型的基础。

此外,此次发布还伴随着与 Amazon Web ServicesGoogle CloudOracle Cloud 等云服务的集成,使部署变得容易。此外,硬件供应商 AMDIntelQualcomm 优化了他们的芯片,以高效运行 Llama。

衍生模型与微调

Llama 2 模型经常被微调以用于各种应用。一个显著的例子是 Code Llama,一个使用专门代码数据集进行微调的版本。它于 2023 年 8 月 24 日发布,最初提供 7B、13B 和 34B 版本,后来于 2024 年 1 月 29 日发布了 70B 版本。Code Llama 在 5000 亿个代码数据令牌上进行了训练,基于基础模型。生成式 AI 社区还产生了许多其他微调模型,例如用于创意写作、法律协助和医疗建议的模型。

模型权重的可访问性使研究人员能够应用 模型剪枝量化 等技术,这使得小型 AI 公司和教育机构能够研究和改编该技术。

回应与批评

对 Llama 2 的反应总体上是积极的,但也存在担忧。支持者称赞其有潜力使 AI 民主化并促进创新,指出它可以与 GPT-3.5 等商业模型竞争。然而,一些批评者指出,许可限制仍然不完全“开放”,从而限制了其自由程度。

可接受使用政策限制了在监控、垃圾邮件和恶意软件等领域的应用。这被认为是防止滥用的努力,但也限制了灵活性。

一些研究人员还指出了训练像 Llama 2 这样的大型模型所带来的环境和资源问题。训练需要大量的计算能力,引发了伦理和实践方面的问题。

遗产与未来

Llama 2 为开放 AI 设定了新标准,促成了后来于 2024 年 4 月发布的 Llama 3。此次发布对行业产生了持久影响,推动主要商业实验室重新考虑模型的共享方式。它还鼓励了开放 AI 集合作为其他产品基础的成长。

Llama 2 提供带限制权重的做法已被其他开发者采用,用于构建 AI 助手,例如现在基于 Llama 3 构建的 Meta AI。截至 2025 年底,Llama 是一个模型系列,尽管出现了新模型,但 Llama 2 仍然是一个基础性的里程碑。

总结

总而言之,Meta Llama 2 的发布是生成式 AI 发展中的一个重要事件。通过将强大的性能与宽松的权重相结合,Meta 的决定帮助塑造了开放 AI 生态系统。这一事件经常被引用为激发商业 AI 兴趣的转折点之一。

在其发布之时,Llama 2 标志着与其他 AI 模型更严格做法的一次背离,其影响是广泛的。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·open-source-ai·meta-ai·artificial-intelligence
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史