Phi-2是一个由微软开发的27亿参数大语言模型,于2023年12月发布。它是Phi系列小型语言模型的一部分,旨在推理任务上实现具有竞争力的性能,同时比当代前沿模型小得多。Phi-2证明了,通过精心策划训练数据,专注于高质量的教科书式内容,可以在无需大规模参数的情况下获得强大的推理能力。
该模型在1.4万亿个token上进行了训练,对于其规模而言,这是一个相对适中的数据集,但该数据集强调“教科书质量”的数据,,包括由更大模型生成的合成数据集和经过筛选的网络内容。这种方法根植于课程学习原则,使Phi-2在GSM-8K(数学推理)和BIG-Bench等基准测试中超越了规模高达其25倍的模型。微软将Phi-2定位为研究工具,以宽松许可证发布,供学术和商业使用,其既定目标是进一步研究小型模型的效率。
架构与训练
Phi-2是一个仅解码器的Transformer模型,遵循大多数现代大语言模型中使用的标准架构。它有32层,隐藏大小为2560,32个注意力头,上下文窗口为2048个token。该模型使用了GPT系列典型的多头注意力和位置编码技术。与一些更大的模型不同,它不采用混合专家或其他稀疏技术,而是依赖密集计算。
训练在96块NVIDIA A100 GPU组成的集群上进行了约14天。数据集包含1.4万亿个token,其中很大一部分由GPT-3.5和GPT-4等更大模型合成生成,同时还包括来自“RefinedWeb”语料库的经过筛选的网页。合成数据旨在教授逐步推理,而网络数据则提供通用知识。微软使用了带有Adam优化器和梯度裁剪的学习率调度,并应用了层归一化以保持稳定性。除合成生成过程外,未使用数据增强。
性能与基准
Phi-2在标准推理基准上取得了显著成果。在GSM-8K上,它获得了56.7%的准确率,超越了7B参数的Llama-2和13B参数的Llama-2,并接近GPT-3.5等更大模型的性能。在BIG-Bench Hard套件中,它获得了57.4%的分数,再次超越了规模为其数倍的模型。在编码任务中,它在HumanEval上表现出色,实现了48.4%的pass@1,与StarCoder-15B等模型相当。
这些成果归因于训练数据的质量而非架构创新。微软的研究人员指出,Phi-2在推理任务上的表现“出奇地强大”,表明其神经网络的容量得到了高效利用。然而,该模型在事实知识和长文本生成方面存在局限,这与其较小的规模和聚焦的训练数据一致。
发布与可及性
Phi-2于2023年12月12日通过Hugging Face模型库以MIT许可证发布。这一宽松许可证允许不受限制的使用,包括商业应用,这在当时对于具有类似能力的模型而言并不常见。微软还将Phi-2集成到其Azure云平台中,支持通过Azure AI Studio和Azure机器学习进行部署。该模型可用于微调和推理,并支持CPU和GPU执行。
此次发布是微软更广泛的AI研究民主化战略的一部分,提供了一种比更大模型更轻量级的替代方案,可在消费级硬件上运行。Phi-2的小尺寸(FP16下约5.4 GB)使其对个人开发者和研究人员可及,这与GPT-4或Claude等模型的资源需求形成对比。
影响与遗产
Phi-2影响了后续在高效机器学习和小型模型设计方面的研究。它的成功凸显了数据质量优于数量的重要性,挑战了规模是能力主要驱动因素的普遍假设。这种方法启发了包括谷歌DeepMind和Anthropic在内的其他组织,探索针对其较小模型的类似数据策划策略。
在微软内部,Phi-2是Phi-3系列的前身,Phi-3系列以更大的参数数量(最高达14B)和更优的性能扩展了相同原则。该模型还促进了关于AI环境影响的讨论,因为其训练所需的计算量远小于大规模模型,符合可持续性目标。截至2024年,Phi-2仍是研究人员研究模型规模、数据质量和推理能力之间权衡的参考点。
局限性
尽管有其优势,Phi-2存在已知的局限性。其知识截止日期为2023年末,无法访问实时信息。该模型有时会产生看似合理但错误的答案,尤其是在其训练分布之外的领域。其2048个token的上下文窗口比许多当代模型短,限制了其在长文档任务中的使用。此外,虽然它擅长推理,但在创意写作和细致的事实回忆方面表现不佳,这反映了其训练数据的狭窄焦点。
微软建议用户将Phi-2视为研究产物而非生产就绪系统,并推荐针对特定应用进行微调。该模型未针对安全性进行对齐,如果被提示,可能生成有偏见或有害的内容,这是其时代模型的常见问题。