GPT-4.5는 OpenAI가 개발한 Large language model로, 2025년 2월 27일 연구 미리보기 버전으로 출시되었다. 이 모델은 이전 모델인 GPT-4에 비해 점진적인 발전을 나타내며, 주로 모델의 지식 기반 확장과 대화 정확도 향상에 초점을 맞추었다. 이 모델은 처음에 ChatGPT Plus 및 Pro 구독자와 OpenAI API를 통해 제공되었으며, 2025년 3월에 기업 고객에게 더 넓게 배포되었다.
일부 동시대 모델들이 연쇄 추론(chain-of-thought reasoning)을 강조한 것과 달리, GPT-4.5는 향상된 패턴 인식과 창의적 글쓰기 능력을 갖춘 범용 모델로 설계되었다. OpenAI는 이 모델이 이전 버전에 비해 환각(hallucination) 사례가 줄어들고 더 "자연스러운" 대화 톤을 가진다고 설명했다. 이 모델은 지도 학습과 인간 피드백 기반 강화 학습을 포함한 Machine learning 기법의 조합을 사용하여 훈련되었으며, 현대 Generative AI 시스템의 기반이 되는 Transformer (architecture) 아키텍처를 기반으로 구축되었다.
개발 및 출시
OpenAI는 GPT-4의 상업적 성공 이후 2024년 초에 GPT-4.5 개발을 시작했다. 이 프로젝트는 transformer 아키텍처의 원래 발명가 중 한 명인 Jakob Uszkoreit와 이전에 언어 모델 확장에 참여했던 Mark Chen을 포함한 팀이 주도했다. 훈련 과정에는 수천 개의 NVIDIA GPU가 사용되었지만, OpenAI는 특정 추론 작업에 AMD 하드웨어도 실험적으로 사용했다. 이 모델은 GPT-4에 사용된 약 13조 토큰보다 크게 증가한 10조 토큰을 초과하는 데이터 세트로 훈련되었다.
출시는 처음에 "연구 미리보기" 단계로 제한되어 일부 사용자가 모델을 테스트하고 피드백을 제공할 수 있도록 했다. 이 접근 방식은 점진적으로 출시된 GPT-4의 초기 전략과 유사했다. 2025년 3월 5일, 이 모델은 모든 ChatGPT Plus 구독자에게 제공되었으며, 3월 말에는 개발자를 위해 OpenAI API에 통합되었다. API 가격은 입력 토큰 100만 개당 75달러, 출력 토큰 100만 개당 150달러로 설정되어 GPT-4o보다 비쌌지만 일부 특화된 추론 모델보다는 저렴했다.
기술 아키텍처
GPT-4.5는 이전 모델의 핵심 Neural network 설계를 유지하며, Multi-Head Attention 메커니즘을 갖춘 디코더 전용 Transformer (architecture) 아키텍처를 사용한다. 이 모델은 약 1.8조 개의 매개변수를 가지고 있지만, 혼합 전문가(mixture-of-experts) 설계로 인해 추론 중에 모든 매개변수가 활성화되지는 않는다. 네트워크를 특수 하위 네트워크로 분할하는 이 접근 방식은 높은 성능을 유지하면서 더 효율적인 계산을 가능하게 한다.
훈련 과정에는 Layer Normalization 및 잔차 연결과 같은 Deep learning 분야의 여러 혁신이 통합되어 훈련을 안정화했다. 최적화에는 워밍업 및 코사인 감쇠 단계를 포함한 사용자 지정 Learning Rate Scheduling과 함께 Adam (Optimizer)가 사용되었다. 과적합을 방지하기 위해 OpenAI는 Dropout 및 Gradient Clipping 기법을 사용했다. 이 모델은 또한 이전 GPT 버전의 합성 데이터 생성과 같은 Data Augmentation 전략의 이점을 얻었다.
GPT-4와의 주목할 만한 차이점은 명시적 추론 흔적에 대한 강조가 줄어든 것이다. GPT-4와 o1, o3 같은 후속 모델은 단계별 추론을 생성하도록 훈련된 반면, GPT-4.5는 직접적이고 유창한 응답에 최적화되었다. 이로 인해 일부 응용 프로그램에서는 더 빨라졌지만 복잡한 수학적 또는 논리적 작업에서는 능력이 떨어졌으며, 이는 OpenAI가 기술 문서에서 인정한 절충점이다.
기능 및 성능
벤치마크 테스트에서 GPT-4.5는 지식 집약적 작업에서 강력한 성능을 보여주었다. MMLU(Massive Multitask Language Understanding) 벤치마크에서 71.4%를 기록하여 GPT-4의 69.1%보다 약간 개선되었다. HumanEval 코딩 벤치마크에서는 pass@1 비율 71.2%를 달성하여 GPT-4o와 비슷했다. 그러나 고급 과학 추론을 테스트하는 GPQA(Graduate-Level Google-Proof Q&A) 벤치마크에서 GPT-4.5는 71.0%를 기록하여 OpenAI의 o3 추론 모델이 달성한 86.0%보다 크게 낮았다.
이 모델은 창의적 글쓰기와 미묘한 대화에서 특히 강점을 보였다. 초기 테스터들은 GPT-4.5가 더 자연스러운 대화를 생성하고 문화적 맥락을 더 잘 이해한다고 보고했다. OpenAI의 내부 평가에 따르면 GPT-4o에 비해 환각 비율이 38% 감소하여, 모델이 사실을 조작하거나 존재하지 않는 출처를 인용할 가능성이 낮아졌다.
기업 응용 프로그램의 경우 GPT-4.5는 Microsoft Azure OpenAI Service에 통합되어 기업이 클라우드 인프라를 통해 모델에 액세스할 수 있게 되었다. 또한 각각의 AI 마켓플레이스를 통해 Amazon Web Services 및 Google Cloud에서도 사용할 수 있게 되었다. 이 모델은 256,000 토큰의 컨텍스트 창을 지원하여 긴 문서나 다중 턴 대화를 처리할 수 있었다.
한계 및 논란
개선에도 불구하고 GPT-4.5는 높은 계산 비용으로 비판을 받았다. 이 모델은 추론 중에 GPT-4o보다 약 10배 더 많은 계산을 필요로 하여 응답 시간이 느리고 에너지 소비가 높았다. Melanie Mitchell을 포함한 일부 연구자들은 훈련에 약 50기가와트시의 전기를 소비한 것으로 추정되는 점을 언급하며 점진적 개선이 환경 영향에 비해 정당한지 의문을 제기했다.
이 모델은 또한 수학적 추론 및 공간 작업에서 한계를 보였다. AIME(American Invitational Mathematics Examination) 2024 벤치마크에서 GPT-4.5는 36.7%를 기록하여 o3가 달성한 86.0%보다 훨씬 낮았다. 이로 인해 일부 관찰자들은 OpenAI가 문제 해결 능력보다 대화 품질을 우선시했으며, 이는 Anthropic의 Claude 모델 및 Google DeepMind의 Gemini 시리즈와 같은 경쟁사와 다른 전략적 선택이라고 주장했다.
개인정보 보호 옹호자들은 공개 웹 콘텐츠와 라이선스 데이터 세트를 포함한 모델의 훈련 데이터에 대해 우려를 제기했다. OpenAI는 개인 정보를 제외하기 위한 필터를 구현했다고 주장했지만, Stanford AI Lab과 같은 조직의 독립적 감사는 잔여 개인정보 보호 위험을 발견했다. 2025년 4월, 캘리포니아에서 GPT-4.5가 허가 없이 저작권 텍스트를 재생산했다는 내용의 집단 소송이 제기되었으며, 이 사건은 2025년 말 현재 계류 중이었다.
유산 및 영향
GPT-4.5는 GPT-4와 예상되는 GPT-5 사이의 다리 역할을 하는 과도기적 모델로 널리 간주되었다. 이 모델의 출시는 아키텍처 혁신 없이도 확장만으로 지식과 유창성에서 측정 가능한 개선을 얻을 수 있음을 보여줌으로써 더 넓은 Artificial intelligence 산업에 영향을 미쳤다. 이 모델의 혼합 전문가 설계는 이후 AI21 Labs 및 Inflection AI를 포함한 다른 개발자들에 의해 채택되었다.
2025년 말까지 GPT-4.5는 추론 기능을 더 효과적으로 통합한 OpenAI의 GPT-5에 의해 대체되었다. 그러나 GPT-4.5는 비용 효율성과 창의적 출력을 우선시하는 응용 프로그램에서 계속 사용되었다. 이 모델의 개발은 또한 모델 크기, 훈련 데이터 및 추론 효율성 간의 균형과 같은 Machine learning 연구의 궤적에 대한 지속적인 논쟁에 기여했다. OpenAI가 전체 제품이 아닌 연구 미리보기로 모델을 출시하기로 한 결정은 유럽연합 및 다른 곳의 정부가 포괄적인 AI 법안을 초안하기 시작하면서 증가하는 규제 조사에 대한 대응으로 여겨졌다.