OpenAI GPT-4o Mini 发布

译自英文

OpenAI于2024年7月18日发布了GPT-4o mini,这是一款成本高效的小型语言模型,以更低的价格提供强劲性能,旨在广泛吸引开发者采用。它在能力与可负担性之间取得平衡,适用于高容量应用场景。

OpenAI于2024年7月18日推出了GPT-4o mini,作为其大型语言模型产品线中的紧凑型补充。该模型旨在以远低于大型系统的成本提供强大的推理和多模态能力,使先进的生成式AI能够用于高容量应用。其定价为每百万输入令牌0.15美元,每百万输出令牌0.60美元,低于许多竞争对手,同时在多项基准测试中保持接近完整版GPT-4o的性能。此次发布标志着向效率的战略转变,目标是那些需要可靠AI且无需高昂费用的开发者。

GPT-4o mini基于支撑现代深度学习模型的transformer架构构建。它处理文本和图像输入,输出文本,并支持128,000个令牌的上下文窗口。模型的知识截止日期为2023年10月,可通过OpenAI API、Azure OpenAI服务和ChatGPT应用向免费及Plus用户提供。早期基准测试显示,它在MMLU(大规模多任务语言理解)测试中得分82%,优于Anthropic的Claude 3 Haiku和Google DeepMind的Gemini 1.5 Flash等较小模型,同时每令牌成本更低。

模型设计与训练

该模型使用监督微调和基于AI反馈的强化学习(RLAIF)的混合方法进行训练,该技术利用AI生成的偏好来使输出与人类期望对齐。这种方法结合课程学习梯度裁剪,有助于稳定训练并提高样本效率。OpenAI未披露确切的参数数量,但“mini”名称表明其规模小于估计拥有超过一万亿参数的GPT-4o。较小的尺寸允许更快的推理和更低的延迟,这对于聊天机器人和编码助手等实时应用至关重要。

训练数据包括公开可用的文本和图像,经过过滤以去除个人信息和有害内容。模型通过层归一化丢弃等技术进行优化以防止过拟合,并在训练后应用模型剪枝以减少冗余。结果是模型保留了GPT-4o的大部分推理能力,同时需要更少的计算资源,这是向普及前沿AI迈出的一步。

性能基准

在标准评估中,GPT-4o mini表现出竞争力。它在MMLU上达到82%,在MGSM(数学应用题)上达到87%,在HumanEval代码生成上达到77%。在多模态任务中,它在MMMU(大规模多学科多模态理解)上得分59.4%,落后于GPT-4o的69.1%,但超过许多同行。模型在IFEval等指令遵循基准上也表现出色,得分87.5%,并在伯克利函数调用排行榜上,在工具使用场景中优于大型模型。

这些数字使GPT-4o mini成为需要序列到序列处理的任务(如翻译、摘要和客户支持)的实用选择。其效率来自多头注意力位置编码等架构选择,这些允许模型处理长序列而无需过多内存使用。开发者指出,模型的top-p采样温度缩放参数提供了对输出创造性的精细控制,适用于各种应用。

成本与可访问性

定价是发布的核心特征。GPT-4o mini每百万输入令牌0.15美元,每百万输出令牌0.60美元,比GPT-4o便宜超过60%,后者分别收费5美元和15美元。这使得它对于每天处理数百万请求的初创企业和企业来说可行。该模型通过AWS Trainium优化实例集成到Amazon Web Services中,Google CloudOracle Cloud也通过其市场提供。GroqSambaNova也宣布支持,利用其定制硬件进行低延迟服务。

OpenAI将该模型定位为GPT-3.5 Turbo的替代品,后者曾是许多开发者的默认选择。公司鼓励迁移,理由是更好的性能和更低的成本。对于AppleSamsung设备集成,较小的模型尺寸在某些情况下支持设备端推理,尽管大多数部署仍基于云。API支持束搜索top-k采样以实现确定性输出,吸引企业用户。

行业背景

此次发布发生在机器学习领域竞争激烈的时期。Anthropic的Claude 3 Haiku和Google DeepMind的Gemini 1.5 Flash是直接竞争对手,各自提供类似的成本与能力权衡。GPT-4o mini的激进定价迫使这些公司调整自己的层级。分析师指出,该模型的效率可能加速生成式AI在医疗保健、金融和教育等领域的采用,这些领域此前因预算限制而使用受限。

此次发布还凸显了向更小、更专业化模型发展的趋势。MIT CSAILStanford AI Lab的研究人员曾倡导此类方法,认为并非每个任务都需要庞大的神经网络。GPT-4o mini体现了这一理念,提供了许多开发者认为有吸引力的平衡。该模型的成功鼓励了对模型剪枝蒸馏技术的进一步投资,阿里巴巴达摩院AI21 Labs也宣布了类似举措。

技术创新

虽然GPT-4o mini没有引入全新的架构,但它改进了现有架构。该模型使用带有交叉注意力层的解码器专用transformer进行多模态融合,使其能够对齐视觉和文本特征。训练采用Adam优化器学习率调度,先预热后衰减,这是一种标准但有效的方法。批归一化应用于稳定早期训练,但后续层依赖层归一化以保持一致性。

模型还整合了残差连接以缓解梯度消失,从而实现更深的堆叠而不会损失性能。权重初始化使用Xavier初始化的变体,损失函数是带有标签平滑的标准交叉熵。这些选择虽然不新颖,但经过调整以在AMDIntel硬件以及NVIDIA GPU上最大化效率。OpenAI声称该模型可以在某些任务上运行于单个台积电制造的芯片上,但这一点未得到独立验证。

部署与用例

早期采用者包括TomTom,它使用GPT-4o mini进行实时导航辅助,以及Intuitive Surgical,它探索将其用于手术文档。Commure将该模型集成到其医疗平台用于患者分诊,而BigBear.ai将其应用于供应链分析。模型的低延迟使其适用于Waymo的自动驾驶车辆通信系统,其中快速响应至关重要。

开发者赞赏模型对函数调用的支持,这使其能够与外部API和数据库交互。这一能力结合RLAIF调优的指令遵循,使其成为构建AI代理的强有力候选。Figure AISanctuary AI尝试使用该模型进行机器人控制,但他们指出物理世界任务需要额外微调。模型的小尺寸也促进了数据增强管道,其中它生成合成示例来训练其他模型。

接受度与批评

接受度总体积极,开发者称赞成本性能比。然而,一些批评者指出,模型仍表现出偏见和偶尔的事实错误,这是大型语言模型中的常见问题。隐私倡导者提出数据处理的担忧,尽管OpenAI表示API输入默认不用于训练。模型的知识截止日期为2023年10月,意味着它缺乏对近期事件的了解,这对于时间敏感应用是一个限制。

竞争对手迅速回应。Google DeepMind降低了Gemini 1.5 Flash的价格,Anthropic为Claude 3 Haiku推出了更便宜的层级。MetaMistral也加速了其小型模型工作。此次发布加剧了高效AI的竞赛,诺基亚贝尔实验室Xerox PARC发表了关于进一步减少模型大小而不牺牲质量的研究。

未来展望

OpenAI表示GPT-4o mini将定期更新,包括改进推理和扩展多模态支持。公司还暗示了一个继任者,可能命名为GPT-4o mini 2,将纳入用户反馈的经验教训。截至2024年底,该模型仍是开发者的热门选择,通过API每天处理超过1亿个令牌。GPT-4o mini的成功强化了较小、成本效益高的模型可以补充较大模型的观点,Berkeley AI Research多伦多大学的研究人员也持类似看法。

该模型的影响超出了商业用途。卡内基梅隆大学牛津大学等学术机构采用它来教授机器学习概念,理由是易于访问。非营利组织使用它进行欠发达地区的文档分析和翻译。随着AI的持续发展,GPT-4o mini作为效率的基准,证明了高性能不必以高昂价格实现。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:openai·large-language-model·generative-ai·ai-launch
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史