gpt-5.6-terra-xhigh(codex-harness)は、OpenAIによって開発された大規模言語モデルであり、2026年9月に初めてリリースされた。これはgpt-5.6ファミリーの変種であり、専門のハーネスを通じたコード生成と実行に最適化されている。このモデルは、2026年9月19日時点の最新スナップショットにおいて、LMArenaやLiveBenchを含む公開ベンチマークのリーダーボードで一貫して上位または最上位にランクインしている。
「terra-xhigh」という名称は、推定パラメータ数1.2兆の高計算構成を指し、テキストとコードの混合データで訓練されている。codex-harnessという接尾辞は、モデルがサンドボックス環境でコードを実行し、出力を反復的に改善し、長期的なタスクを処理できるようにするツール使用ループとの統合を示している。
アーキテクチャと訓練
このモデルはトランスフォーマーアーキテクチャに基づいており、マルチヘッドアテンションとクロスアテンション層を組み込んでいる。学習された回転埋め込みを用いた位置エンコーディング方式を採用している。訓練では、ウォームアップとコサイン減衰を備えた学習率スケジュールを使用し、安定性のために勾配クリッピングと層正規化を組み合わせた。データセットには、公開されているコードリポジトリ、ドキュメント、および初期モデルによって生成された合成データが含まれていた。
訓練はAmazon Web ServicesとAzureのクラスターで実施され、AWS TrainiumとNVIDIA H100 GPUを利用した。総計算量は約3.2エクサFLOPSで、180日間にわたって分散された。RLAIFは、コードの正確性と安全性に関する人間の好みにモデルを合わせるために使用された。
ベンチマーク性能
2026年9月19日のスナップショットでは、gpt-5.6-terra-xhighはLMArenaでEloレーティング1487を達成し、AnthropicやGoogle DeepMindの競合他社を上回った。LiveBenchでは、コーディングタスクで92.4%、推論タスクで88.1%のスコアを獲得した。HumanEval-plusベンチマークでは、問題の96.2%を解決し、91.8%を達成した前身のgpt-5.5から大幅な改善を示した。
このモデルはまた、長文脈タスクでも強い性能を示し、最大200万トークンのシーケンスを処理し、RULERベンチマークで98.7%の検索精度を達成した。そのコード実行ハーネスは、以前のバージョンと比較してランタイムエラーを34%削減した。
展開と使用例
codex-harness変種は、OpenAIのAPIを通じて展開され、低遅延に最適化されたエンドポイントを備えている。これはAmazon Web ServicesのCodeWhispererやAzure DevOps統合で使用されている。開発者は、自動バグ修正、テスト生成、リファクタリングにこれを採用している。このモデルのマルチステップワークフローを管理する能力は、ソフトウェア工学向けの生成AIアプリケーションで人気を博している。
2026年10月、OpenAIは、このモデルがGitHub Copilotなどの主要プラットフォームでコード補完の40%以上を支えており、バックエンドオプションとして採用されたと報告した。ハーネスはデコードにビームサーチとトップpサンプリングをサポートし、コードタスクのデフォルト温度は0.2である。
制限と安全性
その性能にもかかわらず、このモデルはまれなプログラミング言語で時折幻覚を示し、レガシーコードベースで苦労することがある。OpenAIはメモリフットプリントを削減するためにモデルプルーニングを実装したが、これはニッチなタスクでの性能を低下させる可能性がある。Bhabha Atomic ResearchとSamsung Researchによる安全性評価は、エクスプロイトコード生成における潜在的な悪用を指摘し、特定のAPIキーへのアクセス制限につながった。
このモデルの訓練データには公開リポジトリのコンテンツが含まれており、偏ったまたは安全でない例が含まれている可能性がある。OpenAIはこれらの問題を軽減するためにデータ拡張とフィルタリングを使用しているが、残存リスクは残っている。2026年11月時点で、重大なセキュリティインシデントは報告されていない。
今後の方向性
OpenAIは、エッジデバイス向けに700億パラメータを目標とする小型変種gpt-5.6-terra-highをリリースする計画である。残差ネットワークの修正と損失関数に関する研究は、サンプル効率を向上させるために進行中である。Jakob UszkoreitとLukasz Kaiserが率いるチームは、マルチステップ推論を強化するためのカリキュラム学習も探索している。
AnthropicやGoogle DeepMindなどの競合他社は、2027年初頭に競合モデルをリリースし、このモデルのリーダーボード支配に挑戦すると予想されている。最新のスナップショット時点で、gpt-5.6-terra-xhighはLMArenaとLiveBenchの両方でトップランクのモデルであり続けている。