GPT-4(Generative Pre-trained Transformer 4)는 OpenAI가 개발한 대규모 언어 모델로, 2023년 3월 14일에 출시되었다. 이는 OpenAI의 GPT 기반 모델 시리즈 중 네 번째로, GPT-3.5의 뒤를 잇고 GPT-5의 앞선다. 이전 모델들과 달리 GPT-4는 멀티모달로, 텍스트와 이미지 입력을 모두 처리할 수 있다. OpenAI는 모델 크기, 아키텍처, 훈련 하드웨어와 같은 기술적 세부 사항을 경쟁 및 안전 문제를 이유로 공개하지 않았다. 이 모델은 2023년 2월 Microsoft의 Bing Chat에 통합되었고, 2023년 3월 ChatGPT에서 사용 가능해졌으며, 2025년 ChatGPT에서 제거되었다. GPT-4는 OpenAI의 API를 통해 계속 접근할 수 있다.
배경
OpenAI는 2018년 Transformer (architecture) 아키텍처를 기반으로 한 첫 GPT 모델을 소개했으며, 이는 대규모 도서 말뭉치로 훈련되었다. GPT-2는 2019년에 이어져 규모 있는 일관된 텍스트를 생성했다. 2020년, GPT-3는 GPT-2 대비 매개변수를 100배 이상 확장했고, 추가 개선을 통해 ChatGPT 챗봇을 구동한 GPT-3.5가 탄생했다. GPT-4는 향상된 기능과 멀티모달 입력으로 이 계보를 이어받았다.
기능
기본 GPT-4 버전은 8K 컨텍스트 창을 제공했으며, API 변형은 최대 32K 토큰을 지원했다. 멀티모달 특성으로 이미지와 텍스트 입력이 가능해 사진 업로드 및 음성 상호작용에 응답할 수 있다. GPT-4는 검색 태그를 사용한 웹 쿼리 수행, 응답에 결과 통합, API 호출, 이미지 생성, 웹페이지 요약과 같은 작업 실행을 위해 외부 인터페이스와 상호작용하도록 프롬프트할 수 있다.
2023년 Nature 기사는 오류 경향에도 불구하고 GPT-4의 코딩 유용성을 강조했다. 한 생물물리학자는 MATLAB에서 Python으로의 포팅을 며칠에서 약 1시간으로 줄였다고 보고했다. 89개 시나리오에 걸친 보안 테스트에서 GPT-4는 5%의 경우 SQL 인젝션 취약 코드를 생성했으며, 2021년 GitHub Copilot은 40%였다. 2023년 11월, OpenAI는 128K 컨텍스트 창과 더 낮은 가격의 GPT-4 Turbo를 발표했다.
표준화 시험 적성
연구들은 챗봇 시험 성능의 신뢰성에 의문을 제기했다. Torrance 창의적 사고 검사에서 GPT-4는 독창성과 유창성에서 상위 1%를 기록했으며, 유연성 점수는 93번째에서 99번째 백분위수였다.
의료 응용
Microsoft 연구자들은 GPT-4가 USMLE 합격 점수를 20점 이상 초과했으며, 특별한 프롬프트 작성 없이 GPT-3.5 및 Med-PaLM과 같은 의료 미세 조정 모델보다 우수하다는 것을 발견했다. 그러나 부정확한 권장 사항과 환각된 사실을 포함한 상당한 위험에 대해 경고했다. 2023년 4월, Microsoft와 Epic Systems는 환자 질문 및 의료 기록 분석을 위한 GPT-4 기반 시스템을 발표했다.
GPT-4o
2024년 5월 13일, OpenAI는 텍스트, 오디오, 이미지 양식을 실시간으로 처리하는 GPT-4o("o"는 "omni"를 의미)를 소개했다. 이는 빠른 응답 시간, 향상된 비영어 성능을 제공했으며, GPT-4와 달리 무료 사용자에게도 제공되었다.
한계
GPT-4는 훈련 데이터에 없거나 프롬프트와 모순되는 출력을 생성하는 환각을 일으킬 수 있다. 의사 결정은 투명성이 부족하며, 설명은 사후적이고 종종 검증 불가능하며, 이전 진술과 모순되는 경우가 있다. 2023년, 추상 추론을 위한 ConceptARC 벤치마크 테스트에서 GPT-4는 모든 범주에서 33% 미만의 점수를 기록했으며, 전문 모델은 60%, 인간은 최소 91%를 기록했다. Sam Bowman은 테스트의 시각적 특성이 언어 모델 추론을 반영하지 않을 수 있다고 언급했다.
편향
GPT-4 훈련은 두 단계로 진행되었다: 인터넷 텍스트에 대한 비지도 사전 훈련, 이어서 유해한 프롬프트를 거부하기 위한 인간 피드백 기반 강화 학습(RLHF)이다. Microsoft 연구자들은 GPT-4가 확인 편향, 앵커링, 기저율 무시와 같은 인지 편향을 나타낼 수 있다고 제안했다.
훈련
OpenAI의 기술 보고서는 모델 크기, 아키텍처, 하드웨어, 데이터 세트 구성, 계산량, 하이퍼파라미터를 생략했다. 훈련은 인간 및 AI 피드백을 통한 지도 학습과 강화 학습을 사용했다. Sam Altman은 훈련 비용이 1억 달러를 초과했다고 밝혔지만, 정확한 수치는 공개되지 않았다.
수용과 영향
GPT-4는 AI 분야에서 새로운 벤치마크를 설정했으며, Anthropic 및 Google DeepMind와 같은 경쟁사의 후속 모델에 영향을 미쳤다. 멀티모달 기능은 창의적 도구에서 의료 진단에 이르기까지 생성형 AI 응용을 확장했다. 환각과 편향을 포함한 모델의 한계는 AI 안전과 투명성에 대한 논쟁을 촉발했으며, 정렬 및 평가 방법에 대한 연구를 유도했다.
유산
GPT-4의 출시는 대규모 언어 모델의 이정표를 표시하며, 다양한 영역에서 실용적 유용성을 입증했다. 후속 모델인 GPT-5는 시리즈를 계속했으며, GPT-4는 멀티모달 AI의 기준점으로 남아 있다. 이 모델의 영향은 인공지능 및 기계 학습의 지속적인 발전에 계속 존재한다.