GPT-4 2023年3月

영어에서 번역됨

GPT-4는 OpenAI가 개발한 대규모 언어 모델로, 2023년 3월에 출시되어 GPT-3.5의 후속 모델이다. 이 모델은 다중 모드 기능을 도입하고 성능을 개선했지만, OpenAI는 기술적 세부 사항을 공개하지 않았다. GPT-4는 ChatGPT와 API에서 사용할 수 있었으며, 이후 후속 모델인 GPT-4o가 도입되었다.

GPT-4는 OpenAI가 개발한 대규모 언어 모델로, 2023년 3월 14일에 GPT 기반 모델 시리즈의 4세대 모델로 출시되었다. 이는 GPT-3.5의 뒤를 이었으며, 이후 GPT-5가 뒤따랐다. 전작들과 달리 GPT-4는 텍스트와 이미지 입력을 모두 처리할 수 있는 멀티모달 모델이다. OpenAI는 경쟁 및 안전 문제를 이유로 모델 크기, 아키텍처, 학습 하드웨어와 같은 기술적 세부 사항을 공개하지 않았다. GPT-4는 처음에는 ChatGPT Plus 구독자에게 제공되었으며, 이후 OpenAI API를 통해 제공되었고, 최대 32,000개의 토큰 컨텍스트를 지원하는 버전도 있었다. 2024년 5월, OpenAI는 실시간 오디오 및 비전 기능을 갖춘 후속 모델인 GPT-4o를 출시했으며, 이는 무료 사용자에게도 제공되었다.

배경

OpenAI는 2018년 트랜스포머 아키텍처를 기반으로 하고 대규모 도서 말뭉치로 학습된 첫 번째 GPT 모델을 도입했다. 이듬해 GPT-2는 대규모로 일관된 텍스트를 생성하는 능력을 입증했다. 2020년에는 GPT-3가 GPT-2보다 100배 이상의 매개변수로 출시되었고, 이후 개선을 거쳐 ChatGPT 챗봇을 구동한 GPT-3.5가 등장했다. GPT-4는 이러한 계보를 이어받아 멀티모달 입력과 더욱 발전된 학습 기법을 통합했다.

기능

GPT-4의 기본 버전은 8K 컨텍스트 창을 가졌으며, 특수 API 버전은 최대 32K 토큰을 지원했다. 멀티모달 모델로서 이미지를 입력으로 받아들여 사용자가 사진을 업로드하고 시각적 콘텐츠를 기반으로 제안이나 답변을 받을 수 있었다. GPT-4는 또한 쿼리를 <search></search> 태그로 묶어 웹 검색을 수행하고 결과를 모델 프롬프트에 삽입하여 응답을 구성하는 등 외부 인터페이스와 상호 작용하도록 프롬프트할 수 있었다. 이를 통해 모델은 API를 사용하고, 이미지를 생성하고, 웹페이지를 요약할 수 있었다.

2023년 Nature의 기사에 따르면 프로그래머들은 오류 식별 및 최적화 제안과 같은 코딩 작업에 GPT-4가 유용하다는 것을 발견했지만, 오류를 범하기 쉬운 경향도 있었다. 기사에 인용된 생물물리학자는 MATLAB 프로그램을 Python으로 포팅하는 데 "한 시간 정도"가 걸렸다고 언급했는데, 이는 며칠이 걸리던 것과 대조적이었다. 89가지 보안 시나리오 테스트에서 GPT-4는 SQL 주입 공격에 취약한 코드를 5%의 비율로 생성한 반면, 2021년의 GitHub Copilot은 40%의 비율로 생성했다.

2023년 11월, OpenAI는 128K 컨텍스트 창과 훨씬 낮은 가격을 특징으로 하는 GPT-4 Turbo 및 GPT-4 Turbo with Vision을 발표했다.

표준화된 시험에서의 적성

연구들은 챗봇을 표준화된 시험에 통과시키는 것의 신뢰성에 의문을 제기해 왔다. Torrance 창의성 검사에서 GPT-4는 독창성과 유창성 부문에서 상위 1%에 들었으며, 유연성 점수는 93번째에서 99번째 백분위수에 해당했다.

의료 응용

Microsoft의 연구자들은 의료 문제에 GPT-4를 테스트했으며, 특별한 프롬프트 작성 없이도 USMLE 합격 점수를 20점 이상 초과하여 GPT-3.5와 같은 초기 범용 모델 및 의학 지식에 특별히 미세 조정된 Med-PaLM과 같은 모델보다 우수한 성능을 보였다. 그러나 보고서는 부정확한 권장 사항과 환각으로 인한 사실적 오류를 포함하여 의료 응용 분야에서 대규모 언어 모델을 사용할 때의 "상당한 위험"에 대해 경고했다. 2023년 4월, Microsoft와 Epic Systems는 환자 질문에 답하고 의료 기록을 분석하기 위해 GPT-4 기반 시스템을 의료 제공자에게 제공할 계획을 발표했다.

GPT-4o

2024년 5월 13일, OpenAI는 텍스트, 오디오, 이미지 양식에 걸쳐 실시간으로 출력을 처리하고 생성하는 GPT-4의 후속 모델인 GPT-4o("o"는 "omni"를 의미)를 도입했다. GPT-4o는 인간 대화에 필적하는 빠른 응답 시간, 비영어권 언어에 대한 향상된 성능, 향상된 비전 및 오디오 이해를 보여주었다. GPT-4와 달리 무료 사용자에게도 제공되었다.

한계

전작들과 마찬가지로 GPT-4는 훈련 데이터에 없거나 사용자 프롬프트와 모순되는 정보를 포함할 수 있는 출력을 생성하는 환각 현상을 일으키는 것으로 알려져 있다. 또한 의사 결정 과정의 투명성이 부족하다. 논리를 설명하라는 요청을 받으면 GPT-4는 실제 과정을 반영하지 않을 수 있는 사후 설명을 제공하며, 많은 경우 이러한 설명은 이전 진술과 직접적으로 모순된다.

2023년, 연구자들은 추상적 추론을 측정하도록 설계된 ConceptARC 벤치마크에 대해 GPT-4를 테스트했으며, 모든 범주에서 33% 미만의 점수를 기록한 반면, 특수 모델은 대부분의 범주에서 60%를, 인간은 최소 91%를 기록했다. 연구에 참여하지 않은 Sam Bowman은 이 테스트가 시각적이고 GPT-4는 언어 모델이기 때문에 결과가 추상적 추론의 부족을 나타내지 않을 수 있다고 제안했다.

편향

GPT-4는 두 단계로 훈련되었다. 첫째, 다음 토큰을 예측하기 위해 대규모 인터넷 텍스트 데이터 세트로 훈련되었다. 둘째, 인간 피드백을 사용하여 인간 피드백으로부터의 강화 학습을 통해 시스템을 미세 조정하여 불법 활동, 자해, 또는 선정적인 콘텐츠와 같은 OpenAI가 정의한 유해한 행동을 위반하는 프롬프트를 거부하도록 모델을 훈련시켰다. Microsoft 연구자들은 GPT-4가 확증 편향, 앵커링, 기본율 무시와 같은 인지 편향을 나타낼 수 있다고 제안했다.

훈련

OpenAI는 GPT-4 훈련의 기술적 세부 사항을 공개하지 않았다. 기술 보고서는 모델 크기, 아키텍처 또는 사용된 하드웨어를 명시하지 않았다. 대규모 데이터 세트에 대한 지도 학습과 인간 및 AI 피드백을 통한 강화 학습의 조합을 설명했지만, 데이터 세트 구성, 컴퓨팅 성능, 학습률, 에포크 수, 옵티마이저와 같은 하이퍼파라미터에 대한 세부 사항은 제공하지 않았다. 보고서는 이러한 결정의 이유로 "경쟁 환경과 대규모 모델의 안전 영향"을 언급했다. Sam Altman은 Semafor가 보도한 바와 같이 GPT-4 훈련 비용이 1억 달러를 초과했다고 밝혔다.

반응 및 영향

GPT-4의 출시는 AI 커뮤니티와 그 너머에서 상당한 주목을 받았다. 멀티모달 기능과 표준화된 시험 및 의료 시험을 포함한 벤치마크에서의 향상된 성능은 널리 논의되었다. 그러나 환각, 편향, 투명성 부족에 대한 우려는 지속되었다. 공식 출시 전인 2023년 2월 Bing Chat에 초기 버전이 통합된 것도 비판을 받았다. GPT-4는 2025년 ChatGPT에서 제거된 후에도 OpenAI API에서 계속 사용할 수 있었으며, 후속 모델인 GPT-4o는 모델의 기능을 계속 발전시켰다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·openai·generative-ai·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사