GPT-4는 OpenAI가 개발한 대규모 언어 모델로, GPT 기반 모델 시리즈 중 네 번째에 해당한다. 2023년 3월 14일에 출시되었으며, GPT-3.5의 뒤를 이었고 이후 GPT-5가 출시되었다. 이전 모델들과 달리 GPT-4는 멀티모달로, 텍스트와 이미지를 모두 입력으로 처리할 수 있다. OpenAI는 경쟁 및 안전상의 우려를 이유로 모델의 크기, 아키텍처, 훈련 하드웨어와 같은 기술적 세부 사항을 공개하지 않았다. 초기 버전은 2023년 2월 Microsoft의 Bing Chat에 통합되었으며, GPT-4는 2023년 3월부터 2025년 제거될 때까지 ChatGPT에서 사용 가능했고, 현재는 OpenAI의 API를 통해 접근할 수 있다.
배경
OpenAI는 2018년 Transformer (architecture) 아키텍처를 기반으로 하고 대규모 도서 말뭉치로 훈련된 최초의 GPT 모델을 도입했다. GPT-2는 2019년에 출시되어 대규모로 일관된 텍스트를 생성했다. 2020년에는 GPT-3가 GPT-2보다 100배 이상 많은 매개변수로 출시되었으며, 이를 정제한 GPT-3.5가 ChatGPT 챗봇을 구동했다. GPT-4는 이러한 계보를 이어받아 멀티모달 기능을 추가하고 여러 벤치마크에서 향상된 성능을 보였다.
기능
기본 GPT-4 버전은 8K 컨텍스트 창을 가졌으며, 최대 32K 토큰을 지원하는 특수 API 변형이 있었다. 멀티모달 모델로서 이미지 입력을 받아들일 수 있어 사용자가 사진을 업로드하여 분석이나 제안을 받을 수 있다. GPT-4는 또한 외부 인터페이스와 상호 작용할 수 있으며, 예를 들어 특정 태그에 쿼리를 넣어 웹 검색을 수행하고 웹페이지를 요약하거나 API를 사용하고 이미지를 생성할 수 있다. 2023년 Nature의 기사에서는 프로그래머들이 오류 식별 및 최적화 제안과 같은 코딩 지원에 GPT-4가 유용하다고 생각하지만 실수를 저지르는 경향이 있다고 언급했다. 보안 테스트에서 GPT-4는 5%의 시나리오에서 SQL 인젝션에 취약한 코드를 생성했으며, 이는 2021년 GitHub Copilot의 40%와 비교된다. 2023년 11월, OpenAI는 128K 컨텍스트 창과 더 낮은 가격을 갖춘 GPT-4 Turbo를 발표했다.
표준화 시험에서의 적성
연구들은 표준화 시험을 통해 챗봇을 실행하는 것의 신뢰성에 의문을 제기했다. Torrance 창의성 검사에서 GPT-4는 독창성과 유창성에서 상위 1%에 들었으며, 유연성 점수는 93번째에서 99번째 백분위수 범위였다.
의료 응용
Microsoft 연구자들은 GPT-4가 특별한 프롬프트 없이도 USMLE 합격 점수를 20점 이상 초과했으며, GPT-3.5 및 Med-PaLM과 같은 의료 특화 모델보다 우수한 성능을 보였다고 밝혔다. 그러나 그들은 부정확한 권장 사항과 환각을 포함한 상당한 위험에 대해 경고했다. 2023년 4월, Microsoft와 Epic Systems는 환자 문의 및 의료 기록 분석을 위해 GPT-4 기반 시스템을 의료 제공자에게 제공할 계획을 발표했다.
GPT-4o
2024년 5월 13일, OpenAI는 텍스트, 오디오, 이미지 모달리티를 실시간으로 처리하고 생성하는 후속 모델인 GPT-4o("o"는 "omni"를 의미)를 도입했다. 이는 인간 대화에 필적하는 응답 시간, 향상된 비영어 성능, 향상된 시각 및 오디오 이해를 제공한다. GPT-4o는 GPT-4와 달리 무료 사용자에게도 제공되었다.
한계
GPT-4는 이전 모델들과 마찬가지로 훈련 데이터나 사용자 프롬프트와 모순되는 출력을 생성하는 환각을 일으킬 수 있다. 또한 의사 결정의 투명성이 부족하며, 설명은 사후에 형성되어 이전 진술과 모순될 수 있다. 2023년 ConceptARC 벤치마크를 사용한 테스트에서 GPT-4는 추상 추론 작업에서 33% 미만의 점수를 기록했으며, 특화 모델은 약 60%, 인간은 최소 91%를 기록했다. 연구자들은 이 테스트가 시각적이고 GPT-4가 언어 모델이기 때문에 추상 추론의 부족을 나타내지 않을 수 있다고 언급했다.
편향
GPT-4는 두 단계로 훈련되었다: 첫째, 대규모 인터넷 텍스트 데이터 세트에서 다음 토큰을 예측하고, 둘째, 인간 피드백 기반 강화 학습을 사용하여 안전 지침에 맞추는 것이다. Microsoft 연구자들은 GPT-4가 확인 편향, 앵커링, 기저율 무시와 같은 인지 편향을 나타낼 수 있다고 제안했다.
훈련
OpenAI는 모델 크기, 아키텍처, 하드웨어, 하이퍼파라미터를 포함한 GPT-4 훈련의 기술적 세부 사항을 공개하지 않았다. 기술 보고서는 인간 및 AI 피드백을 통한 지도 학습과 강화 학습의 조합을 설명했지만 구체적인 내용은 생략했다. Sam Altman은 훈련 비용이 1억 달러를 초과했다고 밝혔다. 보고서는 정보를 보류한 이유로 경쟁 환경과 안전 영향을 언급했다.