OpenAI는 2024년 7월 18일 대규모 언어 모델 제품군에 컴팩트한 모델로 GPT-4o mini를 출시했다. 이 모델은 대형 시스템 비용의 일부만으로 강력한 추론 및 멀티모달 기능을 제공하도록 설계되어, 대규모 애플리케이션에서 고급 생성형 AI에 대한 접근성을 높였다. 입력 토큰 1백만 개당 0.15달러, 출력 토큰 1백만 개당 0.60달러로 책정된 가격은 여러 경쟁 모델을 능가하는 동시에 여러 벤치마크에서 전체 GPT-4o에 근접한 성능을 유지했다. 이번 출시는 과도한 비용 없이 안정적인 AI가 필요한 개발자를 대상으로 한 효율성 중심의 전략적 전환을 의미했다.
GPT-4o mini는 현대 딥러닝 모델의 기반이 되는 트랜스포머 아키텍처를 기반으로 한다. 텍스트와 이미지 입력을 처리하고 텍스트를 출력하며, 128,000개의 토큰 컨텍스트 창을 지원한다. 모델의 지식 기준 시점은 2023년 10월이며, OpenAI API, Azure OpenAI 서비스, 그리고 무료 및 Plus 사용자를 위한 ChatGPT 앱을 통해 제공되었다. 초기 벤치마크에서 MMLU(대규모 다중 작업 언어 이해) 테스트에서 82%를 기록하며, Anthropic의 Claude 3 Haiku 및 Google DeepMind의 Gemini 1.5 Flash와 같은 소형 모델을 토큰당 비용은 더 낮으면서 능가하는 성능을 보였다.
모델 설계 및 학습
이 모델은 감독 미세 조정과 AI 피드백 기반 강화 학습(RLAIF)을 혼합하여 학습되었으며, 이는 AI 생성 선호도를 사용하여 출력을 인간의 기대에 맞추는 기술이다. 이 접근 방식은 커리큘럼 학습 및 기울기 클리핑과 결합되어 학습 안정성을 높이고 샘플 효율성을 개선했다. OpenAI는 정확한 파라미터 수를 공개하지 않았지만, "mini"라는 명칭은 1조 개 이상의 파라미터로 추정되는 GPT-4o에 비해 더 작은 규모를 의미했다. 크기 감소는 더 빠른 추론과 낮은 지연 시간을 가능하게 했으며, 이는 챗봇 및 코딩 어시스턴트와 같은 실시간 애플리케이션에 중요하다.
학습 데이터에는 공개적으로 이용 가능한 텍스트와 이미지가 포함되었으며, 개인 정보와 유해 콘텐츠를 걸러내기 위해 필터링되었다. 모델은 레이어 정규화 및 드롭아웃과 같은 기술로 최적화되어 과적합을 방지했으며, 학습 후에는 모델 가지치기를 적용하여 중복성을 줄였다. 그 결과 GPT-4o의 추론 능력을 대부분 유지하면서도 더 적은 계산 능력을 요구하는 모델이 탄생했으며, 이는 최첨단 AI에 대한 접근성을 높이는 한 걸음이었다.
성능 벤치마크
표준 평가에서 GPT-4o mini는 경쟁력 있는 성능을 입증했다. MMLU에서 82%, MGSM(수학 단어 문제)에서 87%, 코드 생성 HumanEval에서 77%를 달성했다. 멀티모달 작업에서는 MMMU(대규모 다분야 멀티모달 이해)에서 59.4%를 기록하여 GPT-4o의 69.1%에는 미치지 못했지만 많은 동료 모델을 능가했다. 이 모델은 또한 IFEval과 같은 지시 수행 벤치마크에서 87.5%를 기록했으며, 버클리 함수 호출 리더보드에서는 도구 사용 시나리오에서 더 큰 모델을 능가하는 강력한 결과를 보여주었다.
이러한 수치는 GPT-4o mini를 번역, 요약, 고객 지원과 같은 시퀀스-투-시퀀스 처리가 필요한 작업에 실용적인 선택으로 만들었다. 그 효율성은 멀티 헤드 어텐션 및 위치 인코딩과 같은 아키텍처 선택에서 비롯되었으며, 이를 통해 과도한 메모리 사용 없이 긴 시퀀스를 처리할 수 있다. 개발자들은 모델의 top-p 샘플링 및 온도 스케일링 파라미터가 출력 창의성을 세밀하게 제어하여 다양한 애플리케이션에 유용하다고 언급했다.
비용 및 접근성
가격은 출시의 핵심 요소였다. 입력 토큰 1백만 개당 0.15달러, 출력 토큰 1백만 개당 0.60달러로, GPT-4o mini는 각각 5달러와 15달러를 부과하는 GPT-4o보다 60% 이상 저렴했다. 이는 매일 수백만 건의 요청을 처리하는 스타트업과 기업에게 실현 가능한 선택이 되게 했다. 이 모델은 Amazon Web Services에 AWS Trainium 최적화 인스턴스를 통해 통합되었으며, Google Cloud와 Oracle Cloud는 마켓플레이스를 통해 제공했다. Groq와 SambaNova도 맞춤형 하드웨어를 활용한 저지연 서비스를 지원한다고 발표했다.
OpenAI는 이 모델을 많은 개발자들의 기본 선택이었던 GPT-3.5 Turbo의 대체재로 포지셔닝했다. 회사는 더 나은 성능과 낮은 비용을 근거로 마이그레이션을 권장했다. Apple 및 Samsung 기기 통합의 경우, 모델 크기가 작아 일부 경우 온디바이스 추론이 가능했지만, 대부분의 배포는 클라우드 기반으로 유지되었다. API는 결정적 출력을 위한 빔 서치 및 top-k 샘플링을 지원하여 기업 사용자에게 어필했다.
업계 맥락
이번 출시는 머신러닝 분야의 치열한 경쟁 속에서 이루어졌다. Anthropic의 Claude 3 Haiku와 Google DeepMind의 Gemini 1.5 Flash는 비용과 성능 사이의 유사한 절충안을 제공하는 직접적인 경쟁자였다. GPT-4o mini의 공격적인 가격 책정은 이러한 회사들이 자체 요금제를 조정하도록 압박했다. 분석가들은 이 모델의 효율성이 예산 제약으로 인해 사용이 제한되었던 의료, 금융, 교육 분야에서 생성형 AI 채택을 가속화할 수 있다고 지적했다.
이번 출시는 또한 더 작고 전문화된 모델로의 추세를 강조했다. MIT CSAIL 및 Stanford AI Lab의 연구자들은 모든 작업에 거대한 신경망이 필요한 것은 아니라고 주장하며 이러한 접근 방식을 지지해 왔다. GPT-4o mini는 이러한 철학을 구현하여 많은 개발자들이 매력적으로 여기는 균형을 제공했다. 이 모델의 성공은 모델 가지치기 및 증류 기술에 대한 추가 투자를 장려했으며, Alibaba Damo Academy와 AI21 Labs도 유사한 이니셔티브를 발표했다.
기술 혁신
GPT-4o mini는 급진적으로 새로운 아키텍처를 도입하지는 않았지만 기존 아키텍처를 개선했다. 이 모델은 멀티모달 융합을 위한 크로스 어텐션 레이어를 갖춘 디코더 전용 트랜스포머를 사용하여 시각적 및 텍스트 특징을 정렬할 수 있게 했다. 학습에는 Adam 옵티마이저와 워밍업 후 감쇠하는 학습률 스케줄이 사용되었는데, 이는 표준적이지만 효과적인 접근 방식이다. 배치 정규화는 초기 학습을 안정화하는 데 적용되었지만, 후기 레이어는 일관성을 위해 레이어 정규화에 의존했다.
모델은 또한 기울기 소실을 완화하기 위해 잔차 연결을 통합하여 성능 저하 없이 더 깊은 스택을 가능하게 했다. 가중치 초기화는 Xavier 초기화의 변형을 사용했으며, 손실 함수는 레이블 스무딩이 있는 표준 교차 엔트로피였다. 이러한 선택은 새롭지는 않지만 AMD 및 Intel 하드웨어와 NVIDIA GPU에서 효율성을 극대화하도록 조정되었다. OpenAI는 일부 작업의 경우 모델이 TSMC 제조 칩 하나로 실행될 수 있다고 주장했지만, 이는 독립적으로 검증되지는 않았다.
배포 및 사용 사례
초기 채택 기업으로는 실시간 내비게이션 지원에 GPT-4o mini를 사용한 TomTom, 수술 문서화를 탐구한 Intuitive Surgical이 있다. Commure는 환자 분류를 위해 이 모델을 헬스케어 플랫폼에 통합했으며, BigBear.ai는 공급망 분석에 적용했다. 이 모델의 낮은 지연 시간은 빠른 응답이 중요한 Waymo의 자율주행 차량 통신 시스템에 적합하게 만들었다.
개발자들은 외부 API 및 데이터베이스와 상호 작용할 수 있는 함수 호출 지원을 높이 평가했다. 이 기능은 RLAIF로 조정된 지시 수행과 결합되어 AI 에이전트 구축에 강력한 후보가 되었다. Figure AI와 Sanctuary AI는 로봇 제어에 이 모델을 사용하는 실험을 했지만, 물리적 세계 작업에는 추가 미세 조정이 필요하다고 언급했다. 모델의 작은 크기는 또한 다른 모델 학습을 위한 합성 예제를 생성하는 데이터 증강 파이프라인을 용이하게 했다.
반응 및 비판
반응은 대체로 긍정적이었으며, 개발자들은 비용 대비 성능 비율을 칭찬했다. 그러나 일부 비평가들은 모델이 대규모 언어 모델에서 흔한 편향과 가끔의 사실 오류를 여전히 보인다고 지적했다. 개인정보 보호 옹호론자들은 데이터 처리에 대한 우려를 제기했지만, OpenAI는 API 입력이 기본적으로 학습에 사용되지 않는다고 밝혔다. 모델의 지식 기준 시점이 2023년 10월이라는 점은 최근 사건에 대한 인식이 없어 시간에 민감한 애플리케이션에는 한계로 작용했다.
경쟁사들은 신속하게 대응했다. Google DeepMind는 Gemini 1.5 Flash의 가격을 인하했고, Anthropic은 Claude 3 Haiku에 더 저렴한 요금제를 도입했다. Meta와 Mistral도 소형 모델 개발을 가속화했다. 이번 출시는 효율적인 AI를 향한 경쟁을 심화시켰으며, Nokia Bell Labs와 Xerox PARC는 품질 저하 없이 모델 크기를 더 줄이는 연구를 발표했다.
향후 전망
OpenAI는 GPT-4o mini가 개선된 추론 및 확장된 멀티모달 지원을 포함한 정기적인 업데이트를 받을 것이라고 밝혔다. 회사는 또한 사용자 피드백의 교훈을 통합할 GPT-4o mini 2라는 후속 모델을 암시했다. 2024년 말 현재, 이 모델은 개발자들에게 여전히 인기 있는 선택이었으며, API를 통해 매일 1억 개 이상의 토큰이 처리되었다. GPT-4o mini의 성공은 더 작고 비용 효율적인 모델이 더 큰 모델을 보완할 수 있다는 생각을 강화했으며, 이는 Berkeley AI Research 및 University of Toronto의 연구자들이 공유하는 관점이다.
이 모델의 영향은 상업적 사용을 넘어 확장되었다. Carnegie Mellon University 및 Oxford University와 같은 학술 기관은 접근성을 이유로 머신러닝 개념을 가르치는 데 이 모델을 채택했다. 비영리 단체는 소외된 지역의 문서 분석 및 번역에 사용했다. AI가 계속 진화함에 따라 GPT-4o mini는 높은 성능이 반드시 프리미엄 가격을 요구하지 않음을 보여주는 효율성의 기준점으로 자리 잡고 있다.