GPT-5は、OpenAIによって開発されたマルチモーダル大規模言語モデルであり、生成事前学習トランスフォーマー(GPT)基盤モデルシリーズの5番目にあたる。シリーズではGPT-4の後継であり、2025年8月7日に公開された。チャットボット製品であるChatGPTとMicrosoft Copilotのユーザー、およびOpenAI APIを通じて開発者に公開されている。
GPT-5は、Artificial intelligenceの分野における重要な進歩を表しており、Machine learningとDeep learningの基盤の上に構築されている。そのアーキテクチャは、前モデルと同様にTransformer (architecture)ベースの設計を採用し、ネイティブにマルチモーダルであり、テキストと画像の両方でゼロから訓練されている。このモデルは、複雑な推論から日常的な会話のやり取りまで幅広いタスクを処理するように設計されており、安全性と幻覚の低減に重点を置いている。
背景
GPT-5の開発は、長く反復的なプロセスであった。2023年4月14日、OpenAIの最高経営責任者であるサム・アルトマンは、マサチューセッツ工科大学でのイベントで、当時GPT-5を訓練していないと述べ、GPT-4に焦点を当てていることを強調した。しかし、2023年7月18日までに、OpenAIは米国で「GPT-5」の商標を出願し、2023年11月13日には、アルトマンがフィナンシャル・タイムズに対し、同社がGPT-5に取り組んでいることを確認した。
The Informationによると、2024年下半期の大半において、OpenAIは内部でOrionとして知られるモデルを開発しており、これがGPT-5になる予定だった。しかし、Orionの取り組みはより優れたモデルを生み出すことに失敗し、2025年2月にGPT-4.5としてリリースされた。2025年7月下旬までに、GPT-5への期待は高まり、マイクロソフトがCopilotへの統合を準備しているとの報告があった。2025年8月5日、OpenAIは前触れとして、推論能力を持つ2つのオープンウェイトモデルからなるGPT-OSSをリリースした。GPT-5は、2025年8月7日のライブストリームイベントでついに公開された。
能力
リリース時点で、GPT-5は数学、プログラミング、金融、マルチモーダル理解をテストするベンチマークで最先端のパフォーマンスを達成した。OpenAIによると、前モデルからの改善点には、応答時間の短縮、コーディングとライティングスキルの向上、健康関連の質問への回答精度の向上、幻覚レベルの低下が含まれる。このモデルはまた、潜在的に有害なクエリに対して、完全に拒否するのではなく、安全で高水準の応答を提供することを目指しており、これは「安全な完了」と呼ばれるアプローチで、無害な情報に対する不必要な拒否を減らす。さらに、GPT-5は、より批判的で、過度に同調的な回答をしないように訓練された。
公開の数日前、初期のテスターはそのコーディングと問題解決能力に感銘を受け、GPT-4からの大幅な改善を指摘したが、GPT-3からGPT-4への飛躍ほど大きくはなかった。サム・アルトマンはGPT-5を「AGIへの道における重要な一歩」と呼び、汎用人工知能に言及し、幅広いタスクにわたって「博士課程レベル」の能力を提供すると述べた。
GPT-5の正確なエネルギー消費量は開示されていないが、ロードアイランド大学の研究者は、中程度の長さの応答が18ワット時をわずかに超える消費をすると推定しており、これは白熱電球を18分間使用するのに相当する。
アーキテクチャ
GPT-5は、高速で高スループットのモデル、より深い推論モデル、および会話の種類、複雑さ、ツールの必要性、明示的なユーザーの意図に基づいて使用するモデルを決定するリアルタイムルーターで構成されるシステムである。この設計は、アルトマンが批判していた手動モデル選択の複雑さに対処する。このシステムにはエージェント機能が含まれており、独自のデスクトップを設定し、ブラウザを使用して自律的にソースを検索することができる。
GPT-5システムカードは、2つの高速モデル(gpt-5-mainおよびgpt-5-main-mini)と2つの思考モデル(gpt-5-thinkingおよびgpt-5-thinking-mini)を定義している。APIはまた、より小型で高速なバージョンであるgpt-5-thinking-nanoも提供する。開発者は、推論の労力(低、中、高、または最小)と冗長性(低、中、または高)を調整できる。ChatGPTは、gpt-5-thinking-proと呼ばれる並列テスト時計算の設定を備えたgpt-5-thinkingへのアクセスを提供する。
訓練
GPT-5はネイティブにマルチモーダルであり、事前訓練された言語モデルや視覚モデルに依存せずに、複数のモダリティ(テキストと画像)で同時にゼロから訓練されている。その訓練プロセスは、教師なし事前訓練、教師あり微調整、人間のフィードバックからの強化学習(RLHF)の3つの段階を含んだ。事前訓練では、書籍、記事、ウェブページ、学術論文、ライセンス取得済みソースの大規模な多言語データセットが使用された。GPT-4とは異なり、GPT-5の視覚とテキストの能力は、訓練全体を通じて並行して開発された。
安全性と限界
その進歩にもかかわらず、GPT-5はセキュリティ上の懸念に直面している。セキュリティ調査会社であるNeuraltrustは、テスト初日にGPT-5を侵害し、爆発装置の製造に関する詳細な指示を生成できるようにしたと主張した。別の会社であるSPLXも同様のテストを実施し、同様の結論に達した。これらの評価は、重大なセキュリティギャップを示唆しており、GPT-5が企業環境にとって安全ではない可能性があることを示している。
使用と統合
GPT-5はChatGPTに統合されており、すべてのユーザーに無料で提供され、Plusサブスクライバーにはより高い使用制限、Proユーザーには無制限のアクセスが提供される。GPT-5の導入により、「Advanced Voice Mode」は「ChatGPT Voice」に置き換えられ、より自然な会話が可能になり、Standard Voice Modeは2025年9月9日に廃止された。2025年11月24日には、gpt-5-thinking-miniで事後訓練されたミニモデルを搭載したショッピングリサーチ機能が追加された。
GPT-5はMicrosoft Copilotでも利用可能であり、マイクロソフトはこれを幅広い製品に組み込む計画である。9to5Macによると、Apple Inc.はiOS 26、iPadOS 26、macOS TahoeのApple Intelligenceにこのモデルを統合する計画である。開発者はOpenAI APIを介してGPT-5にアクセスできる。
評価と影響
GPT-5のリリースは広範な注目を集め、Generative AIの能力を前進させる可能性を反映している。ベンチマークでのパフォーマンスと、Microsoft AzureやGoogle Cloudなどの主要プラットフォームへの統合(パートナーシップを通じて)は、その影響力を強調している。しかし、NeuraltrustとSPLXによって提起されたセキュリティ上の懸念は、強力なLarge language modelの安全な展開を確保する上での継続的な課題を浮き彫りにしている。
今後の方向性
2025年後半の時点で、OpenAIはGPT-5の反復を継続しており、さらなる機能強化とより広範な統合の計画がある。このモデルのアーキテクチャと訓練方法は、Neural network研究とDeep learningアプリケーションの将来の開発に影響を与える可能性が高い。能力と安全性のバランスは、業界にとって重要な焦点であり続けている。