OpenAI GPT-4o 发布

译自英文

2024年5月13日,OpenAI发布了GPT-4o,这是一款原生多模态大语言模型,具备实时语音、视觉和文本能力,已集成到ChatGPT中,并通过API提供。

2024年5月13日,OpenAI推出了GPT-4o,这是一款原生多模态大语言模型,旨在实时处理和生成文本、音频与图像。此次发布标志着生成式人工智能领域迈出了重要一步,因为它将语音、视觉和文本处理统一到单一模型中,与之前的系统相比,降低了延迟并提升了对话流畅度。GPT-4o向所有ChatGPT用户开放,包括免费层级用户,并通过OpenAI API提供,这标志着先进AI能力的进一步普及。

该模型名称中的“o”代表“omni”(全能),反映了其无缝处理多种模态的能力。与早期依赖语音识别、文本生成和文本转语音等独立管道的模型不同,GPT-4o使用一个基于多样化数据训练的端到端神经网络,从而实现更快、更自然的交互。这一架构与深度学习Transformer模型的发展趋势相契合,并建立在先前GPT迭代的基础之上。

技术架构

GPT-4o基于Transformer架构构建,与其前代类似,但进行了增强,使其能够直接处理音频和视觉输入。该模型对文本和图像采用统一的标记器,而音频则通过连续表示处理,并离散化为标记。这种设计使模型无需单独的编码器即可跨模态推理,从而减少计算开销和延迟。

关键创新包括一种新颖的音频处理方法,能够捕捉语调、情感和多个说话者,以及一个改进的视觉编码器,可更准确地处理高分辨率图像。该模型还采用了多头注意力交叉注意力等技术来对齐跨模态信息,并使用位置编码来维持空间和时间上下文。

能力与性能

GPT-4o在多项基准测试中展现出最先进的性能。在MMLU(大规模多任务语言理解)基准测试中,它取得了88.7%的分数,超越了之前的模型。在视觉任务中,它在视觉推理和文档理解方面表现出色,在DocVQA基准测试中准确率达到92.8%。在音频方面,它在语音识别(LibriSpeech)测试集上取得了94.7%的准确率,并且对语音查询的平均响应延迟为320毫秒,与人类对话速度相当。

该模型支持超过50种语言,在低资源语言上的性能有所提升。它还能生成和理解图像,支持图像描述、视觉问答,甚至实时视频分析等任务,尽管视频处理在发布时受到限制。

可用性与集成

GPT-4o在OpenAI的产品中逐步推出。ChatGPT用户在发布当天即可访问新模型,免费用户每小时获得有限的消息数量,而Plus和企业用户则享有更高的限额。该模型还集成到ChatGPT移动应用中,支持实时语音对话,并具备打断和响应打断的能力。

开发者可通过OpenAI API访问GPT-4o,定价为每百万输入标记5美元,每百万输出标记15美元,相比GPT-4 Turbo降低了50%。API支持文本和图像输入,音频支持稍后添加。这一定价策略旨在鼓励更广泛的采用并增强AI市场的竞争。

安全与对齐

OpenAI在GPT-4o的开发中强调了安全性,采用了基于AI反馈的强化学习课程学习等技术,以使模型与人类价值观对齐。公司进行了广泛的红队测试,涉及70多位外部专家,以识别和缓解偏见、错误信息和滥用等风险。该模型还经过训练,拒绝有害请求并避免生成不允许的内容。

然而,关于深度伪造和语音模仿的潜在风险仍令人担忧,促使OpenAI实施了水印和使用政策。公司还在初始发布中限制了某些音频功能的访问,以收集反馈并确保负责任地部署。

竞争格局

GPT-4o的发布加剧了AI行业的竞争。Anthropic于2024年3月发布了Claude 3,谷歌DeepMind于2024年2月推出了Gemini 1.5 Pro,两者都提供了强大的多模态能力。GPT-4o的实时语音功能使其脱颖而出,因为竞争对手最初缺乏这种无缝交互。Meta和其他实验室也在继续开发开源模型,但GPT-4o的性能和可访问性巩固了OpenAI在商业AI领域的领导地位。

硬件供应商也做出了回应。英伟达的GPU仍是主要的训练基础设施,但AMD英特尔加速了其AI芯片研发,而亚马逊云服务微软Azure谷歌云等云提供商通过其平台提供GPT-4o,扩大了其覆盖范围。

对AI研究的影响

GPT-4o的架构和训练方法影响了后续多模态AI的研究。其成功验证了在单一模型上训练多种模态的方法,导致从模块化管道转向统一模型。麻省理工学院计算机科学与人工智能实验室斯坦福AI实验室伯克利AI研究等机构的研究人员开始探索类似的统一模型,而该模型的开放API促进了机器学习人工智能领域的实验。

此外,GPT-4o实时处理音频和图像的能力为人类计算机交互、机器人和无障碍技术开辟了新途径。Figure AISanctuary AI等公司探索将此类模型集成到人形机器人中,而Waymo特斯拉自动驾驶则考虑在自动驾驶中的应用。

反响与争议

初步反响总体积极,用户称赞自然的语音交互和免费可用性。然而,争议也随之而来。一些批评者担心,鉴于模型分析实时视频和音频的能力,可能增加监控和隐私侵犯的风险。其他人则质疑模型在医学和法律等高风险领域的准确性,尽管其基准分数很高。

OpenAI还因数据实践而受到审查,因为该模型是在大量互联网数据(包括受版权保护的材料)上训练的。这导致了持续的法律纠纷,作者和艺术家起诉未经授权使用其作品。公司以合理使用为由为其做法辩护,但问题仍未解决。

未来方向

发布后,OpenAI继续完善GPT-4o,发布了改进音频质量并增加视频理解的更新。公司还开始开发GPT-4.5和GPT-5,计划进一步增强多模态推理并减少幻觉。GPT-4o的成功也刺激了对专用硬件的投资,如AWS TrainiumGroq芯片,以使AI推理更快、更便宜。

在更广泛的背景下,GPT-4o促进了关于AI社会影响的持续辩论,引发了监管和负责任发展的呼声。截至2024年中期,该模型仍是最先进的公开可用AI系统之一,为未来创新设定了基准。

结论

OpenAI于2024年5月推出的GPT-4o代表了大语言模型演变中的一个里程碑,证明了实时多模态交互的可行性。其速度、准确性和可访问性的结合重塑了用户期望,并加速了AI融入日常生活。尽管安全和伦理方面的挑战依然存在,但此次发布凸显了该领域快速进步的步伐,对行业、研究和社会整体都具有深远影响。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:openai·gpt-4o·multimodal-ai·event
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史