gpt-5.6-terra-xhigh(codex-harness)是由OpenAI开发的大型语言模型,于2026年9月首次发布。它是gpt-5.6系列的一个变体,通过专门的harness针对代码生成和执行进行了优化。截至2026-09-19的最新快照,该模型在包括LMArena和LiveBench在内的公开基准排行榜上持续排名第一或接近第一。
“terra-xhigh”这一名称指代一种高计算配置,估计参数数量为1.2万亿,训练数据混合了文本和代码。codex-harness后缀表示集成了工具使用循环,使模型能够在沙盒环境中执行代码、迭代优化输出,并处理长时程任务。
架构与训练
该模型基于Transformer (architecture)架构,融入了多头注意力和交叉注意力层。它使用带有学习旋转嵌入的位置编码方案。训练采用了带有预热和余弦衰减的学习率调度,并结合梯度裁剪和层归一化以确保稳定性。数据集包括公开可用的代码仓库、文档以及早期模型生成的合成数据。
训练在Amazon Web Services和Microsoft Azure集群上进行,利用了AWS Trainium和NVIDIA H100 GPU。总计算支出约为3.2 exaFLOPs,分布在180天内。使用Reinforcement Learning from AI Feedback (RLAIF)将模型与人类对代码正确性和安全性的偏好对齐。
基准性能
在2026-09-19快照中,gpt-5.6-terra-xhigh在LMArena上取得了1487的Elo评分,超越了来自Anthropic和Google DeepMind的竞争对手。在LiveBench上,它在编码任务中得分92.4%,在推理任务中得分88.1%。在HumanEval-plus基准中,它解决了96.2%的问题,相比其前身gpt-5.5的91.8%有显著提升。
该模型在长上下文任务中也表现出色,能够处理长达200万token的序列,在RULER基准上的检索准确率为98.7%。其代码执行harness相比先前版本将运行时错误减少了34%。
部署与用例
codex-harness变体通过OpenAI的API部署,端点针对低延迟进行了优化。它被用于Amazon Web Services CodeWhisperer和Microsoft Azure DevOps集成中。开发者利用它进行自动错误修复、测试生成和重构。该模型管理多步骤工作流的能力使其在软件工程的生成式AI应用中广受欢迎。
2026年10月,OpenAI报告称,该模型为GitHub Copilot等主要平台上的超过40%代码补全提供支持,GitHub Copilot将其作为后端选项。harness支持束搜索和top-p采样进行解码,代码任务的默认温度为0.2。
局限性与安全性
尽管性能出色,该模型在罕见编程语言中偶尔会出现幻觉,并在处理遗留代码库时存在困难。OpenAI已实施模型剪枝以减少内存占用,但这可能会降低在特定任务上的性能。Bhabha Atomic Research Centre和Samsung Research的安全评估指出了生成漏洞代码的潜在滥用风险,导致对某些API密钥的访问受到限制。
模型的训练数据包括来自公共仓库的内容,其中可能包含有偏见或不安全的示例。OpenAI使用数据增强和过滤来缓解这些问题,但残余风险仍然存在。截至2026年11月,尚未报告重大安全事件。
未来方向
OpenAI计划发布一个较小的变体gpt-5.6-terra-high,面向边缘设备,目标参数为700亿。关于残差网络修改和损失函数的研究正在进行中,以提高样本效率。由Jakob Uszkoreit和Lukasz Kaiser领导的团队也在探索课程学习以增强多步推理能力。
像Anthropic和Google DeepMind这样的竞争对手预计将在2027年初发布竞争模型,可能挑战该模型在排行榜上的主导地位。截至最新快照,gpt-5.6-terra-xhigh仍然是LMArena和LiveBench上排名最高的模型。