译自英文

LLaMA 3是Meta AI于2024年4月发布的开源大型语言模型,提供80亿和700亿参数版本,基于15万亿个令牌进行训练,在基准测试中表现强劲,并计划扩展其功能。

LLaMA 3 是Meta AI于2024年4月18日发布的一系列大型语言模型。它是Llama系列的第三代,接替Llama 2,包含两个初始模型规模:80亿和700亿参数。这些模型在约15万亿个来自公开来源的文本令牌上进行了预训练,指令调优版本则在公开指令数据集和超过1000万个人工标注示例上进行了微调。LLaMA 3在许多基准测试中表现出与Gemini Pro 1.5和Claude 3 Sonnet等专有模型相当的竞争力,Meta宣布计划使其支持多语言、多模态,并提升编码和推理能力。

背景

LLaMA 3的开发发生在生成式人工智能快速发展的背景下,紧随OpenAI的ChatGPT成功以及早期Llama模型的发布。Meta的首席AI科学家Yann LeCun曾表示,大型语言模型最适合辅助写作,这反映了Meta对实际应用的关注。Llama系列始于2023年2月的原始LLaMA,最初仅以非商业许可证向研究人员开放。在权重通过BitTorrent未经授权泄露后,包括Llama 2在内的后续版本变得更加开放,允许商业使用。

模型架构与训练

LLaMA 3保留了先前Llama模型中使用的Transformer架构,但在训练数据的规模和质量上有所改进。这些模型在15万亿个令牌上进行了训练,显著超过其规模对应的Chinchilla最优数量。例如,8B模型的Chinchilla最优数据集为2000亿个令牌,但性能在达到该数量的75倍时仍呈对数线性增长。这一实证发现凸显了在比先前认为最优更大的数据集上训练的好处。70B模型在训练结束时仍在学习,但Meta决定停止训练以将GPU资源分配至其他领域。这些模型使用Adam优化器深度学习中常见的其他技术进行训练。

发布与可用性

LLaMA 3于2024年4月18日发布,基础版本和指令调优版本的权重均可获取。与需要逐案批准的原始LLaMA不同,LLaMA 3在允许商业使用的许可证下发布,尽管其可接受使用政策被一些人认为使其并非真正的开源。此次发布包括一个专门的Meta AI网站、一个基于LLaMA 3构建的助手,以及集成到Facebook和WhatsApp中。Meta还宣布了未来更大模型和扩展功能的计划。

性能与反响

在Meta的内部测试中,LLaMA 3 70B在大多数基准测试上优于Google DeepMind的Gemini Pro 1.5和Anthropic的Claude 3 Sonnet。Mark Zuckerberg报告称,8B模型几乎与最大的Llama 2模型一样强大。此次发布在AI社区中受到好评,许多人称赞高性能模型的开放可用性。然而,一些评论者指出,许可证限制意味着它并非完全开源,开放源代码促进会也提出了这一点。LLaMA 3的成功促进了开放权重模型的普及,并影响了后续发布,包括2024年7月的Llama 3.1和2025年4月的Llama 4。

影响与遗产

LLaMA 3的发布强化了开放权重模型挑战专有系统的趋势。其训练数据规模和性能证明了数据数量在模型开发中的重要性。该模型在Hugging Face等平台以及AWSAzure等云服务上的可用性促进了广泛采用。2026年4月,Meta Superintelligence Labs发布了Muse Spark作为Llama的替代品,标志着Llama系列的终结。尽管如此,LLaMA 3仍然是人工智能机器学习发展中的一个重要里程碑。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·meta-ai·open-source-ai·2024-releases
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史