영어에서 번역됨

GPT-4는 OpenAI가 개발한 멀티모달 대규모 언어 모델로, 2023년 3월에 출시되었다. 텍스트와 이미지를 처리하며, ChatGPT와 Bing Chat을 구동하고 API를 통해 계속 제공된다.

Generative Pre-trained Transformer 4(GPT-4)는 OpenAI가 개발한 대규모 언어 모델로, GPT 기반 모델 시리즈 중 네 번째 모델이다. 2023년 3월 14일에 출시되었으며, GPT-3.5의 뒤를 잇고 GPT-5의 앞선 모델이다. GPT-4는 멀티모달 모델로, 텍스트와 이미지를 모두 입력으로 처리할 수 있어 이전 모델들에 비해 상당한 발전을 이루었다. OpenAI는 GPT-4에 대한 기술적 세부 사항, 즉 모델의 정확한 크기, 아키텍처, 또는 훈련에 사용된 하드웨어를 공개적으로 밝히지 않았다.

GPT-4는 2023년 2월 마이크로소프트의 Bing Chat에 통합되었으며, 그 다음 달 ChatGPT에서 공식 출시되었다. 2025년에 ChatGPT에서 제거되었지만, OpenAI의 API를 통해 계속 접근할 수 있다. 이 모델의 능력과 한계는 광범위한 연구와 공개 논의의 대상이 되어 왔다.

배경

OpenAI는 2018년 트랜스포머 아키텍처를 기반으로 하고 대규모 도서 말뭉치로 훈련된 첫 번째 GPT 모델을 소개했다. 다음 해, GPT-2는 더 큰 규모에서 일관된 텍스트를 생성하는 능력을 입증했다. 2020년에는 GPT-3가 GPT-2보다 100배 이상 많은 매개변수로 출시되었으며, 이후 ChatGPT 챗봇을 구동한 GPT-3.5로 정제되었다. GPT-4는 이 계보를 기반으로 멀티모달 입력 처리와 다양한 벤치마크에서의 개선된 성능을 추가했다.

능력

GPT-4의 기본 버전은 8K 컨텍스트 창을 갖추고 있으며, 특수 API 버전은 최대 32K 토큰을 지원한다. 이전 모델과 달리 GPT-4는 이미지를 입력으로 받아들일 수 있어, 사용자가 사진을 업로드하여 분석하거나 시각적 콘텐츠에 대해 질문할 수 있다. 이 모델은 또한 특정 태그에 쿼리를 포함하여 웹 검색을 수행하는 등 외부 인터페이스와 상호 작용하도록 프롬프트될 수 있으며, 이를 통해 API 호출, 이미지 생성, 웹페이지 요약과 같은 작업을 가능하게 한다.

2023년 Nature에 실린 기사는 GPT-4의 오류 경향에도 불구하고 코딩 지원에서의 유용성을 강조했다. 프로그래머들은 버그 식별과 최적화 제안에 유용하다고 생각했으며, 한 생물물리학자는 MATLAB에서 Python으로 프로그램을 이식하는 시간을 며칠에서 약 한 시간으로 줄였다고 보고했다. 보안 테스트에서 GPT-4는 5%의 경우에 SQL 주입 공격에 취약한 코드를 생성했으며, 이는 2021년 GitHub Copilot의 40%와 비교된다.

2023년 11월, OpenAI는 128K 컨텍스트 창과 더 낮은 가격을 갖춘 GPT-4 Turbo와 GPT-4 Turbo with Vision을 발표했다.

표준화 시험에서의 적성

GPT-4의 표준화 시험 성과에 대한 연구는 엇갈린 결과를 보여 주었다. Torrance 창의적 사고 검사에서 GPT-4는 독창성과 유창성에서 상위 1%에 들었으며, 유연성 점수는 93번째에서 99번째 백분위수 범위였다.

의료 응용

마이크로소프트의 연구자들은 의료 문제에 대해 GPT-4를 테스트했으며, USMLE 합격 점수를 20점 이상 초과하여 GPT-3.5와 Med-PaLM과 같은 의료 지식에 미세 조정된 모델을 능가한다는 것을 발견했다. 그러나 보고서는 잠재적인 부정확성과 환각을 인용하며 의료 응용에서 대규모 언어 모델을 사용할 때의 상당한 위험을 경고했다. 2023년 4월, 마이크로소프트와 Epic Systems는 환자 문의 및 의료 기록 분석을 위한 GPT-4 기반 시스템을 제공할 계획을 발표했다.

GPT-4o

2024년 5월 13일, OpenAI는 텍스트, 오디오, 이미지 양식을 실시간으로 처리하고 생성하는 후속 모델인 GPT-4o("o"는 "omni"를 의미)를 소개했다. GPT-4o는 인간 대화에 필적하는 빠른 응답 시간, 비영어 언어에서의 개선된 성능을 제공했으며, GPT-4와 달리 무료 사용자에게도 제공되었다.

한계

GPT-4는 이전 모델들과 마찬가지로 훈련 데이터에 없는 정보를 포함하거나 사용자 프롬프트와 모순되는 출력을 생성하는 환각 현상으로 알려져 있다. 또한 의사 결정 과정에서 투명성이 부족하며, 추론에 대한 설명은 사후에 형성되어 정확성을 검증할 수 없다. 많은 경우 이러한 설명은 이전 진술과 직접적으로 모순된다.

2023년, 연구자들은 추상 추론 벤치마크인 ConceptARC에서 GPT-4를 테스트했으며 모든 범주에서 33% 미만의 점수를 기록한 반면, 특수 모델은 대부분에서 60%, 인간은 최소 91%를 기록했다. 연구에 참여하지 않은 Sam Bowman은 이 테스트가 시각적이고 GPT-4는 언어 모델이기 때문에 결과가 추상 추론의 부족을 나타내지 않을 수 있다고 언급했다.

편향

GPT-4는 두 단계로 훈련되었다: 첫째, 다음 토큰을 예측하기 위해 대규모 인터넷 텍스트 데이터 세트에서; 둘째, 인간 피드백 기반 강화 학습을 사용하여 행동을 미세 조정하고 유해한 프롬프트를 거부하도록 했다. 마이크로소프트 연구자들은 GPT-4가 확증 편향, 앵커링, 기저율 무시와 같은 인지 편향을 나타낼 수 있다고 제안했다.

훈련

OpenAI는 GPT-4 훈련의 기술적 세부 사항을 공개하지 않았다. 기술 보고서는 경쟁 및 안전 영향을 이유로 모델 크기, 아키텍처 또는 하드웨어를 명시하지 않았다. 이는 인간 및 AI 피드백을 통한 지도 학습과 강화 학습의 결합을 설명했지만, 데이터 세트 구축, 컴퓨팅 성능 및 하이퍼파라미터에 대한 세부 사항은 생략했다. Sam Altman은 훈련 비용이 1억 달러를 초과했다고 밝혔다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·openai·generative-ai·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사