gpt-5.6-terra-xhigh (codex-harness)는 OpenAI가 개발한 대규모 언어 모델로, 2026년 9월에 처음 출시되었습니다. 이는 gpt-5.6 계열의 변형으로, 특수한 하네스를 통해 코드 생성 및 실행에 최적화되어 있습니다. 이 모델은 2026-09-19 기준 최신 스냅샷에서 LMArena 및 LiveBench를 포함한 공개 벤치마크 리더보드에서 지속적으로 최상위권을 유지하고 있습니다.
'terra-xhigh' 지정은 약 1.2조 개의 추정 매개변수를 가진 고연산 구성으로, 텍스트와 코드 데이터의 혼합으로 훈련되었습니다. codex-harness 접미사는 모델이 샌드박스 환경에서 코드를 실행하고, 출력을 반복적으로 개선하며, 장기 작업을 처리할 수 있게 하는 도구 사용 루프와의 통합을 나타냅니다.
아키텍처 및 훈련
이 모델은 트랜스포머 아키텍처를 기반으로 하며, 다중 헤드 어텐션 및 교차 어텐션 레이어를 통합합니다. 학습된 회전 임베딩을 사용한 위치 인코딩 방식을 사용합니다. 훈련에는 워밍업과 코사인 감쇠를 포함한 학습률 스케줄을 적용했으며, 안정성을 위해 그래디언트 클리핑 및 레이어 정규화를 결합했습니다. 데이터셋에는 공개적으로 이용 가능한 코드 저장소, 문서, 그리고 초기 모델이 생성한 합성 데이터가 포함되었습니다.
훈련은 Amazon Web Services 및 Microsoft Azure 클러스터에서 수행되었으며, AWS Trainium 및 NVIDIA H100 GPU를 활용했습니다. 총 계산 비용은 약 3.2 엑사플롭스로, 180일에 걸쳐 분산되었습니다. Reinforcement Learning from AI Feedback (RLAIF)는 코드 정확성과 안전성에 대한 인간의 선호에 맞춰 모델을 정렬하는 데 사용되었습니다.
벤치마크 성능
2026-09-19 스냅샷에서 gpt-5.6-terra-xhigh는 LMArena에서 1487의 Elo 등급을 달성하여 Anthropic 및 Google DeepMind의 경쟁 모델을 능가했습니다. LiveBench에서는 코딩 작업에서 92.4%, 추론 작업에서 88.1%를 기록했습니다. HumanEval-plus 벤치마크에서는 문제의 96.2%를 해결하여, 91.8%를 기록한 이전 모델 gpt-5.5보다 크게 개선되었습니다.
이 모델은 또한 긴 컨텍스트 작업에서 강력한 성능을 보여주었으며, 최대 200만 토큰의 시퀀스를 처리하고 RULER 벤치마크에서 98.7%의 검색 정확도를 달성했습니다. 코드 실행 하네스는 이전 버전에 비해 런타임 오류를 34% 줄였습니다.
배포 및 사용 사례
codex-harness 변형은 OpenAI의 API를 통해 배포되며, 낮은 지연 시간에 최적화된 엔드포인트를 제공합니다. 이는 Amazon Web Services CodeWhisperer 및 Microsoft Azure DevOps 통합에 사용됩니다. 개발자들은 자동 버그 수정, 테스트 생성, 리팩토링에 이 모델을 사용합니다. 다단계 워크플로우를 관리하는 능력 덕분에 소프트웨어 엔지니어링을 위한 생성형 AI 애플리케이션에서 인기를 얻었습니다.
2026년 10월, OpenAI는 이 모델이 GitHub Copilot과 같은 주요 플랫폼에서 코드 완성의 40% 이상을 지원하며, 이를 백엔드 옵션으로 채택했다고 보고했습니다. 하네스는 디코딩을 위해 빔 서치 및 top-p 샘플링을 지원하며, 코드 작업의 기본 온도는 0.2입니다.
한계 및 안전성
성능에도 불구하고, 이 모델은 드문 프로그래밍 언어에서 가끔 환각을 보이며 레거시 코드베이스에서 어려움을 겪습니다. OpenAI는 메모리 사용량을 줄이기 위해 모델 가지치기를 구현했지만, 이는 틈새 작업에서 성능을 저하시킬 수 있습니다. Bhabha Atomic Research Centre 및 Samsung Research의 안전성 평가는 악용 코드 생성의 잠재적 오용 가능성을 지적하여, 특정 API 키에 대한 접근을 제한했습니다.
모델의 훈련 데이터에는 편향되거나 안전하지 않은 예제가 포함될 수 있는 공개 저장소의 콘텐츠가 포함됩니다. OpenAI는 이러한 문제를 완화하기 위해 데이터 증강 및 필터링을 사용하지만, 잔여 위험은 남아 있습니다. 2026년 11월 현재, 주요 보안 사고는 보고되지 않았습니다.
향후 방향
OpenAI는 엣지 디바이스를 위한 더 작은 변형인 gpt-5.6-terra-high를 출시할 계획이며, 목표 매개변수는 700억 개입니다. 잔차 네트워크 수정 및 손실 함수에 대한 연구는 샘플 효율성을 개선하기 위해 진행 중입니다. jakub uszkoreit 및 Lukasz Kaiser가 이끄는 팀은 다단계 추론을 강화하기 위해 커리큘럼 학습도 탐구하고 있습니다.
Anthropic 및 Google DeepMind와 같은 경쟁사는 2027년 초에 경쟁 모델을 출시하여 이 모델의 리더보드 우위에 도전할 것으로 예상됩니다. 최신 스냅샷 기준으로, gpt-5.6-terra-xhigh는 LMArena와 LiveBench 모두에서 최상위 모델로 남아 있습니다.