GPT-4.5是由OpenAI开发的一种大型语言模型,于2025年2月27日作为研究预览版发布。它代表了对其前身GPT-4的渐进式改进,主要重点是扩展模型的知识库并提高对话准确性。该模型最初向ChatGPT Plus和Pro订阅者以及通过OpenAI API提供,随后于2025年3月向企业客户更广泛地推出。
与一些同时代强调链式推理的模型不同,GPT-4.5被设计为一种通用模型,具有增强的模式识别和创意写作能力。OpenAI将其描述为具有更“自然”的对话语气,与早期版本相比,幻觉实例更少。该模型使用多种机器学习技术进行训练,包括监督学习和基于人类反馈的强化学习,并建立在支撑现代生成式人工智能系统的Transformer (architecture)架构之上。
开发与发布
OpenAI在GPT-4取得商业成功后,于2024年初开始开发GPT-4.5。该项目由包括Jakob Uszkoreit(transformer架构的原始发明者之一)和Mark Chen(此前曾从事扩展语言模型工作)在内的团队领导。训练过程使用了数千个NVIDIA GPU,但OpenAI也尝试使用AMD硬件进行某些推理任务。该模型在超过10万亿个令牌的数据集上进行训练,相比GPT-4所用的大约13万亿个令牌有显著增加。
发布最初限于“研究预览”阶段,允许部分用户测试模型并提供反馈。这种方法与OpenAI早期对GPT-4的策略一致,后者也是逐步推出的。2025年3月5日,该模型向所有ChatGPT Plus订阅者开放,到3月下旬,它被集成到面向开发者的OpenAI API中。API定价为每百万输入令牌75美元,每百万输出令牌150美元,使其比GPT-4o更昂贵,但比某些专门的推理模型更便宜。
技术架构
GPT-4.5保留了其前身的核心神经网络设计,利用带有多头注意力机制的仅解码器Transformer (architecture)架构。该模型拥有约1.8万亿个参数,但由于混合专家设计,并非所有参数在推理期间都处于激活状态。这种方法将网络划分为专门的子网络,允许在保持高性能的同时实现更高效的计算。
训练过程整合了深度学习领域的几项创新,包括层归一化和残差连接以稳定训练。优化使用了Adam (Optimizer),并带有自定义的学习率调度,包括预热和余弦衰减阶段。为防止过拟合,OpenAI采用了Dropout和梯度裁剪技术。该模型还受益于数据增强策略,包括从早期GPT版本生成合成数据。
与GPT-4的一个显著不同之处是减少了对显式推理轨迹的强调。虽然GPT-4及其后继者(如o1和o3)被训练为生成逐步推理,但GPT-4.5被优化为直接、流畅的响应。这使得它在某些应用中速度更快,但在复杂的数学或逻辑任务上能力较弱,OpenAI在其技术文档中承认了这一权衡。
能力与表现
在基准测试中,GPT-4.5在知识密集型任务上表现出色。它在MMLU(大规模多任务语言理解)基准上得分71.4%,略高于GPT-4的69.1%。在HumanEval编码基准上,它实现了71.2%的pass@1率,与GPT-4o相当。然而,在测试高级科学推理的GPQA(研究生级防谷歌问答)基准上,GPT-4.5得分71.0%,显著低于OpenAI的o3推理模型所达到的86.0%。
该模型在创意写作和细致对话方面表现出特别优势。早期测试者报告称,GPT-4.5产生了更自然的对话,并表现出对文化背景更好的理解。OpenAI的内部评估表明,与GPT-4o相比,幻觉率降低了38%,这意味着该模型不太可能捏造事实或引用不存在的来源。
对于企业应用,GPT-4.5被集成到Microsoft Azure OpenAI服务中,允许企业通过云基础设施访问该模型。它还通过各自的AI市场在Amazon Web Services和Google Cloud上可用。该模型支持256,000个令牌的上下文窗口,使其能够处理长文档或多轮对话。
局限性与争议
尽管有所改进,GPT-4.5仍因其高昂的计算成本而面临批评。该模型在推理期间所需的计算量约为GPT-4o的10倍,导致响应时间更慢和能耗更高。一些研究人员,包括Melanie Mitchell,质疑这种渐进式改进是否值得其对环境的影响,并指出训练该模型消耗了约50吉瓦时的电力。
该模型在数学推理和空间任务方面也表现出局限性。在AIME(美国数学邀请赛)2024基准上,GPT-4.5得分36.7%,远低于o3所达到的86.0%。这导致一些观察者认为,OpenAI优先考虑了对话质量而非问题解决能力,这一战略选择与Anthropic的Claude模型和Google DeepMind的Gemini系列等竞争对手不同。
隐私倡导者对模型的训练数据表示担忧,这些数据包括公开可用的网络内容和许可数据集。OpenAI坚持认为,它已实施过滤器以排除个人信息,但Stanford AI Lab等组织的独立审计发现了残余的隐私风险。2025年4月,加利福尼亚州提起了一起集体诉讼,指控GPT-4.5未经授权复制了受版权保护的文本,截至2025年底,此案仍在审理中。
遗产与影响
GPT-4.5被广泛视为一种过渡模型,弥合了GPT-4与预期的GPT-5之间的差距。它的发布影响了更广泛的人工智能行业,表明即使没有架构突破,仅靠扩展也能在知识和流畅性方面带来可衡量的改进。该模型的混合专家设计随后被其他开发者采用,包括AI21 Labs和Inflection AI。
到2025年底,GPT-4.5已被OpenAI的GPT-5所取代,后者更有效地整合了推理能力。然而,GPT-4.5仍用于优先考虑成本效益和创意输出的应用。它的开发也促进了关于机器学习研究轨迹的持续辩论,特别是模型大小、训练数据和推理效率之间的平衡。OpenAI决定将模型作为研究预览版而非完整产品发布,被视为对日益增长的监管审查的回应,因为欧盟等地的政府开始起草全面的AI立法。