GPT-4 Turbo는 OpenAI가 개발한 대규모 언어 모델로, 2023년 11월에 이전 GPT-4 모델의 향상된 버전으로 발표되었다. 가장 주목할 만한 개선 사항으로는 128K 토큰 컨텍스트 창을 통해 모델이 훨씬 더 긴 입력을 처리할 수 있게 된 점과 더 낮은 API 가격 구조가 있다. 이번 출시는 텍스트와 이미지를 모두 처리할 수 있는 변형인 GPT-4 Turbo with Vision도 도입했다. GPT-4 Turbo는 2024년 5월에 실시간 멀티모달 처리와 ChatGPT 사용자에게 무료 액세스를 제공한 GPT-4o로 대체되었다.
배경
OpenAI는 2018년에 Transformer (architecture) 아키텍처를 기반으로 하고 대규모 도서 말뭉치로 훈련된 첫 번째 GPT 모델을 도입했다. 이후 2019년의 GPT-2와 2020년의 GPT-3는 매개변수를 확장하고 텍스트 생성을 개선했다. GPT-3.5는 2022년 11월 ChatGPT의 초기 출시를 지원하여 대규모 언어 모델을 주류 관심사로 끌어올렸다. 2023년 3월에 출시된 GPT-4는 텍스트와 이미지 입력을 모두 수용하는 멀티모달 기능을 추가했다. 기본 버전은 8K 컨텍스트 창을 가졌으며, 특수 API 변형은 최대 32K 토큰을 지원했다. GPT-4 Turbo는 전임자의 기반 위에 컨텍스트 길이와 비용의 한계를 해결하기 위해 개발되었다.
발표 및 출시
OpenAI는 2023년 11월 6일 샌프란시스코에서 열린 첫 개발자 컨퍼런스 DevDay에서 GPT-4 Turbo를 발표했다. 이 모델은 OpenAI API를 통해 제공되었으며, 가격은 입력 토큰 1,000개당 $0.01, 출력 토큰 1,000개당 $0.03으로 GPT-4보다 약 3배 저렴했다. 128K 컨텍스트 창은 단일 요청에서 300페이지가 넘는 텍스트 문서를 처리할 수 있게 했다. OpenAI는 또한 텍스트와 함께 이미지를 분석할 수 있는 GPT-4 Turbo with Vision의 업데이트 버전을 도입했다. 이번 발표는 지시 따르기, JSON 모드, 함수 호출의 개선을 강조하여 모델을 개발자 애플리케이션에 더 적합하게 만들었다.
기능
GPT-4 Turbo는 GPT-4의 멀티모달 입력 기능을 유지하여 사용자가 텍스트와 이미지를 모두 제공할 수 있게 했다. 함수 호출을 통해 외부 도구와 상호 작용할 수 있어 웹 검색, API 호출, 이미지 생성과 같은 작업을 가능하게 했다. 확장된 컨텍스트 창은 모델이 더 긴 대화에서 일관성을 유지하고 전체 책이나 코드베이스를 처리할 수 있게 했다. 2023년 Nature 기사에서 프로그래머들은 GPT-4 Turbo가 오류 식별 및 최적화 제안과 같은 코딩 작업을 지원했지만 실수하기 쉬웠다고 보고했다. 89가지 보안 시나리오 테스트에서 GPT-4는 SQL 주입 공격에 취약한 코드를 5%의 비율로 생성했으며, 이는 2021년 GitHub Copilot의 40% 취약성 비율보다 개선된 것이다.
표준화 시험 성과
GPT-4 Turbo의 표준화 시험 성과에 대한 연구는 제한적이었지만, GPT-4의 초기 평가는 강력한 결과를 보여주었다. Torrance 창의적 사고 검사에서 GPT-4는 독창성과 유창성에서 상위 1%에 속했으며, 유연성 점수는 93번째에서 99번째 백분위수 범위였다. 연구자들은 챗봇을 이러한 검사에 적용하는 것이 신뢰할 수 없을 수 있다고 경고했는데, 모델이 그럴듯하지만 부정확한 답변을 생성할 수 있기 때문이다.
의료 응용
Microsoft 연구자들은 GPT-4를 의료 문제에 테스트했으며, 미국 의사 면허 시험에서 합격 점수를 20점 이상 초과하여 GPT-3.5 및 Med-PaLM과 같은 특수 모델보다 우수한 성과를 보였다. 그러나 그들은 부정확한 권장 사항과 주요 사실 오류의 환각을 포함한 심각한 위험에 대해 경고했다. 2023년 4월, Microsoft와 Epic Systems는 환자 질문에 답하고 의료 기록을 분석하기 위해 GPT-4 기반 시스템을 의료 제공자에게 제공할 계획을 발표했으며, 이러한 추세는 GPT-4 Turbo에서도 계속되었다.
한계
전임자와 마찬가지로 GPT-4 Turbo는 환각을 일으킬 수 있으며, 사용자 프롬프트와 모순되거나 허위 정보를 포함한 출력을 생성할 수 있다. 또한 의사 결정의 투명성이 부족했다. 추론 과정을 설명하라는 요청을 받으면 모델은 실제 과정을 반영하는지 검증할 수 없는 사후 설명을 생성했다. 2023년, 연구자들은 추상적 추론을 측정하도록 설계된 ConceptARC 벤치마크에서 GPT-4를 테스트했으며, 모든 범주에서 33% 미만의 점수를 기록한 반면, 특수 모델은 대부분 60%를 기록했고 인간은 최소 91%를 기록했다. 연구에 참여하지 않은 Sam Bowman은 시험의 시각적 특성이 언어 모델에 불리할 수 있다고 지적했다.
편향
GPT-4 Turbo는 두 단계로 훈련되었다. 첫 번째는 대규모 인터넷 텍스트 데이터 세트에서 다음 토큰을 예측하는 것이었고, 두 번째는 안전 지침에 맞추기 위해 인간 피드백 기반 강화 학습을 사용하는 것이었다. Microsoft 연구자들은 GPT-4가 확인 편향, 앵커링, 기준율 무시와 같은 인지 편향을 나타낸다고 제안했다. 훈련 과정은 유해한 출력을 줄이는 것을 목표로 했지만, 편향은 여전히 나타날 수 있었다.
훈련
OpenAI는 GPT-4 Turbo의 훈련에 대한 기술적 세부 사항(모델 크기, 아키텍처, 하드웨어 포함)을 공개하지 않았다. Turbo에도 적용되었을 가능성이 있는 GPT-4의 기술 보고서는 이러한 비밀 유지에 대해 경쟁 및 안전 문제를 이유로 들었다. Sam Altman은 GPT-4 훈련 비용이 1억 달러 이상이라고 밝혔다. 훈련은 인간 및 AI 피드백을 모두 사용한 강화 학습에 이은 지도 학습을 사용했지만, 하이퍼파라미터 및 데이터 세트 구성과 같은 세부 사항은 공개되지 않았다.
수용 및 영향
GPT-4 Turbo는 낮은 비용과 더 큰 컨텍스트 창 덕분에 개발자들로부터 좋은 반응을 얻었으며, 이를 통해 긴 문서 분석 및 복잡한 에이전트 워크플로우와 같은 새로운 애플리케이션이 가능해졌다. 이는 Anthropic 및 Google DeepMind와 같은 경쟁사와 맞서는 대규모 언어 모델의 경쟁 환경에서 OpenAI의 입지를 강화했다. 이번 출시는 또한 더 효율적이고 접근 가능한 AI 모델로의 추세를 부각시켜, 해당 분야의 후속 개발에 영향을 미쳤다. GPT-4 Turbo는 결국 더 새로운 모델로 대체될 때까지 OpenAI API에서 사용 가능했지만, GPT-4 자체는 2025년에 ChatGPT에서 제거되었다.