OpenAI o3は、OpenAIによってChatGPT向けにOpenAI o1の後継として開発された生成的プレトレーニング変換器(GPT)モデルである。段階的な論理的推論を必要とする質問に対処する際に、追加の熟考時間を費やすように設計されている。このモデルは2024年12月20日に発表され、その後、o3-mini、o3、o4-mini、o3-proを含む複数のバリエーションでリリースされ、コーディング、数学、科学の能力を備えている。
「o3」という名前は、モバイルキャリアブランドのO2との商標衝突を避けるために「o2」の代わりに選ばれた。OpenAIは、2025年1月10日まで安全性およびセキュリティ研究者にモデルへの早期アクセスを申請するよう招待した。前身のo1と同様に、最初の発表にはo3とo3-miniの2つのモデルが含まれていた。
歴史
OpenAI o3モデルは2024年12月20日に発表された。2025年1月31日、OpenAIはo3-miniを無料層ユーザーを含むすべてのChatGPTユーザーと一部のAPIユーザーにリリースした。OpenAIはo3-miniを「精度と速度を必要とする技術分野」向けのo1の「専門的な代替手段」と説明した。o3-miniは、低、中、高の3つの推論努力レベルを備えている。無料版は中レベルを使用し、より多くの計算を使用するバリアントであるo3-mini-highは有料購読者に利用可能である。ChatGPTのPro層の購読者は、o3-miniとo3-mini-highの両方に無制限にアクセスできる。
2025年2月2日、OpenAIはOpenAI Deep Researchを開始した。これは、ウェブ検索に基づいて5〜30分以内に包括的なレポートを作成するo3のバージョンを使用するChatGPTサービスである。2月6日、DeepSeek R1などの競合からの圧力を受けて、OpenAIはo3-miniモデルにおける思考プロセスの透明性を高めることを目的としたアップデートを発表した。2月12日、OpenAIはChatGPT Plus購読者向けにo3-mini-highのレート制限を1日50リクエスト(週50リクエストから増加)にさらに引き上げ、ファイルおよび画像アップロードのサポートを実装した。
2025年4月16日、OpenAIはo3とo3-miniの後継であるo4-miniをリリースした。2025年6月10日、OpenAIは同社がこれまでで最も高性能なモデルであると主張するo3-proをリリースした。OpenAIは次のように述べている。「速度よりも信頼性が重要であり、数分待つことがトレードオフに値する難しい質問に使用することをお勧めします」。2026年5月28日、OpenAIはo3が90日間のサンセット期間を経て、2026年8月26日にChatGPTから廃止されることを発表した。同社は、この変更はChatGPTにのみ適用され、APIには影響しないと述べた。
能力
強化学習は、OpenAIが「プライベート思考連鎖」と呼ぶものを使用して、o3に回答を生成する前に「考える」ことを教えるために使用された。このアプローチにより、モデルは事前に計画し、タスクを推論し、問題の解決を支援するための中間的な推論ステップの一連を実行できるが、追加の計算能力と応答の遅延増加を犠牲にする。
o3は、コーディング、数学、科学を含む複雑なタスクにおいて、o1よりも大幅に優れたパフォーマンスを示す。OpenAIは、o3がオンラインで公開されていない専門家レベルの科学問題を含むGPQA Diamondベンチマークで87.7%のスコアを達成したと報告した。実際のGitHubの問題を解決する能力を評価するソフトウェアエンジニアリングベンチマークであるSWE-bench Verifiedでは、o3は71.7%をスコアし、o1の48.9%と比較された。Codeforcesでは、o3はEloスコア2727に達し、o1は1891をスコアした。AIが新しい論理的およびスキル獲得問題を処理する能力を評価する人工知能用抽象化および推論コーパス(ARC-AGI)ベンチマークでは、o3はo1の3倍の精度を達成した。
モデルバリアント
o3ファミリーには、さまざまなユースケースに合わせた複数のバリアントが含まれている。o3-miniは、精度と速度を必要とする技術分野向けに設計された小型で高速なモデルであり、調整可能な推論努力レベルを備えている。o3は、複雑なベンチマークでより高いパフォーマンスを発揮するフルスケールモデルである。2025年4月16日にo3とともにリリースされたo4-miniは、o3-miniの後継として機能する。2025年6月10日にリリースされたo3-proは、速度よりも信頼性を優先する最も高性能なモデルとして位置付けられている。
各バリアントは、トランスフォーマーアーキテクチャに基づく大規模言語モデルの同じ基盤アーキテクチャを活用し、推論のための深層学習技術とニューラルネットワークを使用している。モデルは強化学習を使用してトレーニングされ、ユーザーに完全に透過的ではない思考連鎖推論の形式であるプライベート思考連鎖を組み込んでいる。
パフォーマンスとベンチマーク
o3のパフォーマンス指標は、以前のモデルに対する進歩を強調している。GPQA Diamondでは、o3は87.7%をスコアし、専門家レベルの科学問題での強力なパフォーマンスを示している。SWE-bench Verifiedでは、o3は71.7%を達成し、o1の48.9%からの大幅な改善であり、実際のソフトウェアエンジニアリング問題を解決する能力を示している。Codeforcesでは、o3のElo評価2727はo1の1891をはるかに上回り、優れた競技プログラミングスキルを反映している。ARC-AGIでは、o3はo1の精度を3倍にし、新しい論理的およびスキル獲得タスクを処理する強化された能力を示唆している。
これらの結果は、o3を人工知能分野の主要な推論モデルとして位置付け、機械学習や生成AIなどの分野での応用がある。モデルの段階的に推論する能力は、慎重な熟考を必要とするタスクに適しているが、計算コストと遅延の増加を伴う。
他のモデルとの比較
AIモデルの競争環境において、o3は他の組織の製品と頻繁に比較される。AnthropicとGoogle DeepMindは独自の推論モデルを開発しており、o3のSWE-bench VerifiedやCodeforcesなどのベンチマークでのパフォーマンスは、その地位を評価するために使用されてきた。2025年1月のo3-miniのリリースは、思考プロセスの透明性を高めるアップデートにつながったDeepSeek R1などのモデルを含む競争圧力への部分的な対応であった。
o3に対するOpenAIのアプローチは、速度を優先するモデルとは対照的に、意図的な推論を強調している。このトレードオフは、o3-miniで利用可能な異なる推論努力レベルに反映されており、ユーザーが精度と応答時間のバランスを取ることができる。モデルのChatGPTおよびAPIサービスへの統合により、無料層からPro購読者まで幅広いユーザーがアクセスできるようになった。
展開とアクセス
o3バリアントの展開は段階的に行われている。o3-miniが最初に広くリリースされ、その後o3とo4-mini、そしてo3-proが続いた。アクセスはChatGPTを通じて提供され、異なる層がさまざまなレベルの使用を提供している。無料層ユーザーは中程度の推論努力でo3-miniを取得し、有料購読者はより高い努力レベルとより頻繁な使用にアクセスできる。Pro購読者はo3-miniとo3-mini-highに無制限にアクセスできる。
o3モデルへのAPIアクセスは時間の経過とともに拡大され、需要に応じてレート制限が調整されている。2026年5月に発表された2026年8月のChatGPTからのo3の廃止は、モデルの計画されたライフサイクルを示しているが、APIアクセスは影響を受けない。この展開戦略は、モデル提供を反復的に改善および更新するOpenAIのアプローチを反映している。
関連項目
- 推論モデル
- 大規模言語モデルの一覧
参考文献
- OpenAIの発表およびドキュメント(2024-2026)
- OpenAIによって報告されたベンチマーク結果
外部リンク
- OpenAI o3およびo4-miniの紹介
- O3は80%安価で、o3-proを導入