Meta Llama 3 发布

译自英文

Meta于2024年4月18日发布了Llama 3,这是一个开放权重的大型语言模型系列,包含8B和70B参数版本,后来扩展至405B模型。

Meta Llama 3是Meta AI于2024年4月18日发布的一系列大型语言模型。初始版本包含两种模型规模:80亿和700亿参数,均提供基础版和指令微调版。Llama 3以其在约15万亿个公开文本令牌上的大规模预训练,以及与当代专有模型相比具有竞争力的性能而著称。后续版本Llama 3.1扩展了该系列,于2024年7月23日发布了4050亿参数模型。Llama 3系列代表了Meta在开放权重AI开发战略中的重要一步,建立在早期Llama 1和Llama 2版本的基础上。

Llama 3模型设计旨在广泛可访问,其权重在社区许可下发布,允许商业使用,这与原始Llama的更严格许可有所不同。此次发布还伴随了Meta AI的推出,这是一个集成到Facebook和WhatsApp中的助手,展示了模型的实际应用。这些模型在多样化数据集上训练,并在推理、编码和通用知识等基准测试中表现出色,使其成为OpenAIAnthropicGoogle DeepMind模型的竞争性替代品。

背景与语境

Llama 3的开发发生在Large language model研究快速进步的背景下,这一进步由2022年底ChatGPT的成功所催化。在OpenAI的GPT-3发布及随后ChatGPT的流行之后,该领域出现了扩大模型规模的浪潮,一些模型展示了推理和指令遵循方面的涌现能力。Meta的初步回应是Llama 1,于2023年2月作为研究导向模型发布,其权重仅对获批的学术研究人员开放。该模型在2023年3月的泄露,通过BitTorrent传播,凸显了对开放访问的需求,并引发了关于开放模型在AI开发中作用的更广泛讨论。

Llama 2于2023年7月与微软合作发布,标志着向更开放访问的转变,允许在宽松许可下进行商业使用。这为Llama 3奠定了基础,后者旨在推动开放权重模型在规模和能力上的边界。Llama 3的发布也正值Generative AI成为主流关注焦点之时,云提供商和硬件公司进行了大量投资。

模型架构与训练

Llama 3模型基于Transformer (architecture)架构,这是现代大型语言模型的主导设计。该架构在先前Llama版本的基础上进行了改进,包括更大的词汇量(128,256个令牌)和增加到8,192个令牌的上下文长度,后者在后续更新中得到扩展。这些模型采用标准的仅解码器设计,配备Multi-Head AttentionPositional Encoding,并使用下一个令牌预测目标进行训练。

Llama 3训练的一个关键特点是数据规模。模型在约15万亿个来自公开来源的文本令牌上进行预训练,这比Llama 2使用的2万亿个令牌大幅增加。训练数据经过精心策划,强调高质量来源,包括网页、书籍和科学文章,并重点关注多语言和代码内容。指令微调版本进一步在公开的指令数据集和超过1000万个人工标注示例上进行微调,使用了诸如Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习)和监督微调等技术。

关于缩放定律,Llama 3团队观察到,即使在远超Chinchilla最优令牌数量进行训练时,性能仍呈对数线性持续提升。对于8B模型,Chinchilla最优数据集大小估计为2000亿个令牌,但该模型仍从完整15万亿个令牌的训练中受益,表明更大的数据集可以带来超出传统建议的收益。

性能与基准测试

在Meta于2024年4月进行的内部评估中,Llama 3 70B模型在多项基准测试上超越了多个领先的专有模型。具体来说,它在大多数标准NLP任务上超越了Google DeepMind的Gemini Pro 1.5和Anthropic的Claude 3 Sonnet,包括推理、编码和通用知识。8B模型虽然较小,但据Meta首席执行官马克·扎克伯格称,其能力几乎与最大的Llama 2模型(70B)相当,展示了更大训练数据集带来的效率提升。

这些模型在代码生成和数学推理方面表现尤为突出,这些领域对实际应用至关重要。后来作为Llama 3.1一部分发布的405B模型进一步提升了这些结果,在许多基准测试上达到了最先进水平,与GPT-4和Claude 3.5 Sonnet等模型相媲美。

发布与可用性

2024年4月18日的初始Llama 3发布包括8B和70B模型,均提供基础版和指令微调版。这些模型可通过Meta网站以及合作伙伴平台(如Hugging Face)下载。权重在Llama 3社区许可下发布,该许可允许商业使用,但包含可接受使用政策,限制某些应用,如军事用途或生成有害内容。该许可不被开源倡议视为开源,但相对于许多专有模型更为宽松。

Meta还将Llama 3集成到其AI助手Meta AI中,后者在Facebook、WhatsApp和专用网站上可用。这种集成允许用户直接与模型交互,展示其在聊天、写作和编码任务中的能力。此次发布伴随了与云提供商的合作,包括Amazon Web ServicesMicrosoft AzureGoogle CloudOracle Cloud Infrastructure,使模型可通过托管服务访问。

生态系统与硬件支持

Llama 3的开放权重特性促进了其在AI生态系统中的快速采用。硬件供应商优化了其平台以支持Llama 3推理,包括AMDIntelNVIDIA。专门的AI芯片公司如GroqSambaNova提供了高速推理解决方案,而QualcommArm Holdings则专注于边缘部署。云提供商提供了预配置环境,AWS Trainium和其他定制硅片用于微调和训练。

这些模型还集成到各种软件框架和工具中,使开发人员能够以最小努力构建应用。多种模型规模的可用性允许在从边缘设备到数据中心的广泛硬件上部署,使Llama 3成为研究和生产的通用选择。

影响与反响

Llama 3的发布引起了AI社区的极大兴趣,许多人称赞模型的性能和权重的开放性。它被视为对OpenAIAnthropic封闭方法的反制,为偏好透明度和控制力的研究人员和开发人员提供了替代方案。模型在基准测试中的强劲表现也提高了开放权重模型的标准,促使其他组织加速自身开发工作。

然而,此次发布也引发了关于开放模型潜在滥用的讨论,包括对虚假信息、垃圾邮件和其他恶意使用的担忧。Meta决定包含可接受使用政策是试图缓解这些风险,但批评者认为,一旦权重公开,此类政策难以执行。这一辩论呼应了Llama 1泄露后的早期讨论。

未来发展

在初始发布后,Meta继续迭代Llama 3系列。Llama 3.1于2024年7月23日发布,引入了405B模型,并将上下文长度扩展到128,000个令牌,支持更长形式的推理和文档处理。405B模型使用数据剪枝和Model Pruning技术的组合进行训练以提高效率。Meta还宣布计划使Llama 3支持多语言和多模态,包括图像和视频理解,以及改进的编码和推理能力。

2025年4月,Meta发布了下一代Llama 4,进一步扩大了模型规模并引入了专家混合架构。展望未来,Meta超级智能实验室于2026年4月发布了Muse Spark,作为Llama的替代品,标志着公司AI战略的转变。尽管如此,Llama 3仍然是开放大型语言模型演变中的一个重要里程碑,影响了该领域的后续研究和发展。

结论

Meta Llama 3代表了开放权重大型语言模型的重大进步,结合了大规模训练、竞争性性能和广泛可访问性。其发布促进了开放模型在研究和工业中的采用,其影响在Artificial intelligence技术的持续发展中仍可感受到。这些模型的成功强调了在通常由专有系统主导的领域中开放方法的可行性,并为未来发布设定了先例。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-model·meta-ai·open-weight·ai-release
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史