译自英文

LLaMA是Meta AI自2023年2月起发布的一系列开源大型语言模型,参数规模从10亿到超过2万亿不等。它通过其发布版本,包括Llama 2、Llama 3和Llama 4,影响了人工智能领域的发展格局。

LLaMA(大型语言模型Meta AI)是由Meta AI开发的一系列大型语言模型,于2023年2月首次发布。这些模型的参数规模从10亿到超过2万亿不等,并已发布多个版本,包括Llama 2、Llama 3和Llama 4。最初为基座模型,后续版本包含指令微调变体,且模型在允许部分商业使用的许可下发布,但并非完全开源。

LLaMA的发布标志着生成式AI民主化的重要一步,因为它为OpenAI的GPT系列等专有模型提供了强大的替代方案。其开放分发,尤其是在第一版未经授权泄露后,激发了AI社区的研究与开发浪潮。

背景

在GPT-3等模型发布后,AI研究社区专注于扩大模型规模,这带来了涌现能力。2022年底ChatGPT的推出加剧了对大型语言模型的兴趣。Meta的首席AI科学家Yann LeCun指出,大型语言模型特别有助于辅助写作任务,将LLaMA定位为此类应用的工具。

初始发布与泄露

LLaMA的第一版于2023年2月24日通过博客文章和一篇详细描述其训练、架构和性能的论文宣布。推理代码在开源GPLv3许可下发布,但模型权重的访问仅限于学术研究人员和行业实验室,需逐案审批。Meta在公开数据上训练了从7B到65B参数的各种规模模型,旨在使其在不同硬件上可用。

2023年3月3日,一个包含LLaMA权重的种子文件被上传到4chan,链接在在线AI社区中传播。这次未经授权的泄露导致模型广泛可用,Meta对HuggingFace仓库和GitHub脚本提出了下架请求。反应不一:有人担心滥用,而有人则庆祝其可访问性,将其与Stable Diffusion的开放发布相提并论,后者加速了创新。

Llama 2

2023年7月18日,Meta与微软合作宣布了Llama 2,发布了70亿、130亿和700亿参数的模型。架构与Llama 1基本不变,但训练数据增加了40%。Llama 2包含基座和聊天微调模型,权重已发布用于许多商业用途,但其许可的可接受使用政策意味着并非完全开源。Code Llama(用于代码的微调模型)于2023年8月和2024年1月发布。

Llama 3及后续

2024年4月18日,Meta发布了Llama 3,参数规模为8B和70B,预训练数据约为15万亿个令牌。这些模型表现出强劲性能,在许多基准测试中超越了Gemini Pro 1.5和Claude 3 Sonnet。Meta还宣布了多语言和多模态能力的计划。Llama 3.1于2024年7月23日发布,Llama 4于2025年4月发布。2026年4月,Meta超级智能实验室推出了Muse Spark作为Llama的替代品。

影响与反响

LLaMA系列对AI生态系统产生了深远影响,使研究人员和开发者能够基于强大的开放模型进行构建。其发布引发了关于开源许可和模型分发伦理的辩论,同时也培育了一个充满活力的工具和应用社区。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·meta-ai·open-source-ai·generative-ai
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史