OpenAIは2024年7月18日、大規模言語モデルラインナップへのコンパクトな追加としてGPT-4o miniを発表した。このモデルは、より大規模なシステムのコストの一部で強力な推論とマルチモーダル機能を提供するよう設計されており、高容量アプリケーション向けに高度な生成AIを利用しやすくした。価格は入力トークン100万個あたり0.15ドル、出力トークン100万個あたり0.60ドルで、多くの競合製品を下回りながら、いくつかのベンチマークでフル版GPT-4oに近い性能を維持した。このリリースは、法外な費用なしに信頼性の高いAIを必要とする開発者を対象とした、効率性への戦略的転換を示した。
GPT-4o miniは、現代の深層学習モデルを支えるトランスフォーマーアーキテクチャに基づいている。テキストと画像の入力を処理し、テキストを出力し、128,000トークンのコンテキストウィンドウをサポートする。モデルの知識カットオフは2023年10月で、OpenAI API、Azure OpenAI Service、およびChatGPTアプリを通じて無料ユーザーとPlusユーザー向けに利用可能となった。初期のベンチマークでは、MMLU(大規模マルチタスク言語理解)テストで82%をスコアし、AnthropicのClaude 3 HaikuやGoogle DeepMindのGemini 1.5 Flashなどの小型モデルを上回りながら、トークンあたりのコストは低かった。
モデル設計とトレーニング
このモデルは、教師あり微調整とAIフィードバックからの強化学習(RLAIF)の混合を使用してトレーニングされた。これは、AI生成の選好を使用して出力を人間の期待に合わせる技術である。このアプローチは、カリキュラム学習と勾配クリッピングと組み合わせることで、トレーニングの安定化とサンプル効率の向上に役立った。OpenAIは正確なパラメータ数を開示しなかったが、「mini」という指定は、推定1兆以上のパラメータを持つGPT-4oと比較して、より小さなフットプリントを示した。サイズの縮小により、推論の高速化とレイテンシの低下が可能となり、チャットボットやコーディングアシスタントなどのリアルタイムアプリケーションにとって重要となった。
トレーニングデータには、公開されているテキストと画像が含まれ、個人情報や有害なコンテンツを除去するためにフィルタリングされた。モデルは、レイヤー正規化やドロップアウトなどの技術で最適化され、過学習を防ぎ、モデルプルーニングがトレーニング後に適用されて冗長性を低減した。結果として、モデルはGPT-4oの推論能力の多くを保持しながら、必要な計算能力を減らし、フロンティアAIへのアクセスを民主化する一歩となった。
パフォーマンスベンチマーク
標準的な評価では、GPT-4o miniは競争力のあるパフォーマンスを示した。MMLUで82%、MGSM(数学文章問題)で87%、コード生成のHumanEvalで77%を達成した。マルチモーダルタスクでは、MMMU(大規模マルチディシプリン・マルチモーダル理解)で59.4%をスコアし、GPT-4oの69.1%には及ばなかったが、多くの競合を上回った。モデルはまた、IFEvalなどの指示追従ベンチマークで87.5%をスコアし、Berkeley Function Calling Leaderboardでは、ツール使用シナリオでより大きなモデルを上回る強い結果を示した。
これらの数字は、GPT-4o miniを、翻訳、要約、カスタマーサポートなどのシーケンス・ツー・シーケンス処理を必要とするタスクの実用的な選択肢として位置づけた。その効率性は、マルチヘッドアテンションや位置エンコーディングなどのアーキテクチャ上の選択によるもので、モデルが過剰なメモリ使用なしに長いシーケンスを処理できるようにした。開発者は、モデルのトップpサンプリングと温度スケーリングパラメータが、出力の創造性を細かく制御し、さまざまなアプリケーションに役立つと指摘した。
コストとアクセシビリティ
価格設定は発売の中心的な特徴だった。入力トークン100万個あたり0.15ドル、出力トークン100万個あたり0.60ドルで、GPT-4o miniはそれぞれ5ドルと15ドルを請求するGPT-4oよりも60%以上安かった。これにより、毎日数百万のリクエストを処理するスタートアップや企業にとって実行可能となった。モデルは、AWS Trainium最適化インスタンスを通じてAmazon Web Servicesに統合され、Google CloudとOracle Cloudはマーケットプレイスで提供した。GroqとSambaNovaも、カスタムハードウェアを活用した低レイテンシーサーバーでのサポートを発表した。
OpenAIは、このモデルを多くの開発者にとってデフォルトだったGPT-3.5 Turboの代替として位置づけた。同社は、より良いパフォーマンスと低コストを挙げて移行を奨励した。AppleとSamsungのデバイス統合では、モデルの小型サイズにより、一部のケースでオンデバイス推論が可能になったが、ほとんどのデプロイメントはクラウドベースのままであった。APIは、決定論的な出力のためのビームサーチとトップkサンプリングをサポートし、エンタープライズユーザーにアピールした。
業界コンテキスト
この発売は、機械学習セクターでの激しい競争の中で行われた。AnthropicのClaude 3 HaikuとGoogle DeepMindのGemini 1.5 Flashは直接のライバルであり、それぞれコストと能力の間で同様のトレードオフを提供していた。GPT-4o miniの攻撃的な価格設定は、これらの企業に自社のティアを調整するよう圧力をかけた。アナリストは、このモデルの効率性が、予算制約が以前は使用を制限していた医療、金融、教育などのセクターでの生成AIの採用を加速させる可能性があると指摘した。
このリリースはまた、より小さく、専門化されたモデルへのトレンドを浮き彫りにした。MIT CSAILとスタンフォードAIラボの研究者は、すべてのタスクが巨大なニューラルネットワークを必要とするわけではないと主張し、そのようなアプローチを提唱していた。GPT-4o miniはこの哲学を体現し、多くの開発者が魅力的だと感じるバランスを提供した。モデルの成功は、モデルプルーニングと蒸留技術へのさらなる投資を促し、アリババ・ダミアオ・アカデミーとAI21 Labsが同様のイニシアチブを発表した。
技術的革新
GPT-4o miniは根本的に新しいアーキテクチャを導入したわけではないが、既存のものを洗練させた。モデルは、マルチモーダル融合のためのクロスアテンションレイヤーを備えたデコーダーのみのトランスフォーマーを使用し、視覚的およびテキスト的特徴を整列させた。トレーニングでは、Adamオプティマイザーと、ウォームアップ後に減衰する学習率スケジュールを採用した。これは標準的だが効果的なアプローチである。バッチ正規化は初期トレーニングを安定させるために適用されたが、後のレイヤーは一貫性のためにレイヤー正規化に依存した。
モデルはまた、勾配消失を軽減するための残差接続を組み込み、パフォーマンス損失なしでより深いスタックを可能にした。重み初期化はXavier初期化の変種を使用し、損失関数はラベルスムージングを備えた標準的なクロスエントロピーであった。これらの選択は、斬新ではなかったが、AMDとIntelハードウェア、およびNVIDIA GPUでの効率を最大化するために調整された。OpenAIは、一部のタスクでモデルがTSMC製造の単一チップで実行できると主張したが、これは独立して検証されなかった。
デプロイメントとユースケース
初期採用者には、リアルタイムのナビゲーション支援にGPT-4o miniを使用したTomTomや、外科文書化を探求したIntuitive Surgicalが含まれた。Commureは患者トリアージのためにモデルを医療プラットフォームに統合し、BigBear.aiはサプライチェーン分析に適用した。モデルの低レイテンシーは、迅速な応答が重要なWaymoの自動運転車通信システムに適していた。
開発者は、外部APIやデータベースと対話できるようにする関数呼び出しのサポートを高く評価した。この機能は、RLAIFで調整された指示追従と組み合わせることで、AIエージェントを構築するための強力な候補となった。Figure AIとSanctuary AIは、ロボット制御にモデルを使用する実験を行ったが、物理世界のタスクには追加の微調整が必要だと指摘した。モデルの小型サイズはまた、他のモデルをトレーニングするための合成例を生成するデータ拡張パイプラインを容易にした。
評価と批判
評価は概ね肯定的で、開発者はコストパフォーマンス比を賞賛した。しかし、一部の批評家は、モデルが依然としてバイアスや時折の事実誤りを示すと指摘した。これは大規模言語モデルに共通する問題である。プライバシー擁護者はデータ処理について懸念を表明したが、OpenAIはAPI入力がデフォルトでトレーニングに使用されないと述べた。モデルの知識カットオフが2023年10月であることは、最近の出来事に関する認識が欠如していることを意味し、時間に敏感なアプリケーションにとっての制限となった。
競合他社は迅速に対応した。Google DeepMindはGemini 1.5 Flashの価格を引き下げ、AnthropicはClaude 3 Haikuのより安価なティアを導入した。MetaとMistralも小型モデルの取り組みを加速させた。この発売は効率的なAIへの競争を激化させ、ノキア・ベル研究所とゼロックスPARCは、品質を犠牲にすることなくモデルサイズをさらに削減する研究を発表した。
将来の見通し
OpenAIは、GPT-4o miniが定期的なアップデートを受け取り、改善された推論と拡張されたマルチモーダルサポートを含むことを示した。同社はまた、ユーザーフィードバックからの教訓を組み込む、おそらくGPT-4o mini 2と名付けられる後継機を示唆した。2024年後半の時点で、モデルは開発者に人気のある選択肢のままであり、APIを通じて毎日1億以上のトークンが処理された。GPT-4o miniの成功は、より小さく、コスト効率の高いモデルがより大きなモデルを補完できるという考えを強化し、バークレーAIリサーチとトロント大学の研究者がこの見解を支持した。
モデルの影響は商業利用を超えて広がった。カーネギーメロン大学やオックスフォード大学などの学術機関は、そのアクセシビリティを挙げて機械学習の概念を教えるために採用した。非営利団体は、十分なサービスを受けていない地域での文書分析と翻訳に使用した。AIが進化し続ける中、GPT-4o miniは効率性のベンチマークとして立っており、高いパフォーマンスがプレミアム価格を必要としないことを実証している。