Meta于2024年4月18日发布了Llama 3,这是其持续进行的Llama系列中的一系列大型语言模型(LLM)。此次发布包括两种模型规模:80亿和700亿参数,两者均在约15万亿个来自公开来源的文本令牌上进行了预训练。指令调优变体在公开指令数据集和超过1000万个人工标注示例上进行了微调。Meta将Llama 3定位为开放权重AI的重要一步,发布时70B模型在标准基准测试中表现优于多个商业竞争对手。
Llama系列始于2023年2月的Llama 1,最初仅以非商业许可向研究人员发布。在2023年3月通过BitTorrent未经授权泄露后,Meta在2023年7月通过Llama 2调整了策略,在定制许可下提供权重供更广泛的商业使用。Llama 3延续了这一轨迹,强调可访问性和性能。此次发布与Meta AI(基于Llama构建的助手)同时进行,该助手可通过专用网站使用,并集成到Facebook和WhatsApp中。
模型架构与训练
Llama 3模型使用标准Transformer架构,并相比先前版本进行了改进。8B和70B模型在15万亿个令牌上训练,该数据集比8B规模的Chinchilla最优量(2000亿个令牌)大75倍。尽管超过了最优数据点,性能仍以对数线性方式持续提升,挑战了传统扩展定律。Meta报告称,70B模型在训练结束时仍在改进,但团队选择停止以将GPU资源分配到其他地方。
训练数据从公开来源中精选,强调质量和多样性。指令微调结合了公共数据集和人工标注示例,增强了模型遵循复杂指令的能力。Meta还宣布计划使未来版本支持多语言、多模态,并在编码和推理方面表现更好,同时增加上下文窗口。
性能与基准测试
2024年4月,Meta的内部测试显示,Llama 3 70B在大多数基准测试中(包括推理、编码和通用知识任务)优于Gemini Pro 1.5和Claude 3 Sonnet。马克·扎克伯格报告称,8B模型几乎与最大的Llama 2模型(70B)一样强大,展示了显著的效率提升。这些结果使Llama 3成为来自OpenAI、Anthropic和Google DeepMind等公司专有模型的竞争性替代品。
这些模型在标准NLP基准测试上进行了评估,70B变体在发布时达到了开放权重模型中的最先进结果。观察到的扩展行为,,在Chinchilla最优数据之外持续改进,,表明更大的数据集可能带来进一步收益,影响了后续在Machine learning和Deep learning方面的研究。
发布与生态系统
Llama 3在定制许可下发布,允许商业使用,但附带可接受使用政策,限制了某些应用,引发了关于其是否符合开源定义的争论。权重可供下载,模型已集成到多个平台,包括Amazon Web Services、Microsoft Azure、Google Cloud和Oracle Cloud Infrastructure。Groq和SambaNova等专业硬件提供商优化了Llama 3的推理,实现了更快的部署。
此次发布催生了一波微调变体和工具,类似于围绕Llama 2出现的生态系统。开发者使用Reinforcement Learning from AI Feedback (RLAIF)和Curriculum Learning等技术来适应特定领域的模型。开放权重方法与其竞争对手的封闭模型形成对比,促进了Generative AI应用中的创新。
后续发展
Llama 3.1于2024年7月23日发布,引入了405B参数模型并扩展了上下文窗口。此版本进一步巩固了Llama在AI领域的地位。该系列在2025年4月继续推出Llama 4,并在2026年4月,Meta Superintelligence Labs发布了Muse Spark作为替代。Llama的演变影响了更广泛的领域,研究人员研究扩展定律和训练效率,如Transformer (architecture)架构和Loss Functions方面的工作所示。
此次发布还凸显了大规模计算的作用,Meta利用与AMD、Intel和TSMC等芯片制造商的合作来高效训练模型。Llama 3的成功促进了关于Artificial intelligence未来以及开放与专有开发之间平衡的讨论。