GPT-5は、OpenAIによって開発されたマルチモーダル大規模言語モデルであり、生成的プレトレーニング済みトランスフォーマー(GPT)基盤モデルのシリーズにおける5番目のモデルである。シリーズではGPT-4に続くもので、2025年8月7日に公開された。チャットボット製品であるChatGPTとMicrosoft Copilotのユーザー、およびOpenAI APIを通じて開発者にも公開されている。この公開は、生成的AIの進化における重要な一歩を示し、リアルタイムのマルチモーダル理解とエージェント能力に焦点を当てたものであった。
同年、Google DeepMindはAstra(別名Gemini Live)を公開した。これは、消費者市場と企業市場でGPT-5と直接競合するリアルタイムマルチモーダルAIアシスタントである。2025年に行われたAstraの公開は、視覚および聴覚入力とのシームレスな対話を強調し、OpenAIの製品に対する主要な競争相手として位置づけられた。この記事は主にGPT-5に焦点を当て、関連する広範な状況においてAstraに言及する。
背景
2023年4月14日、OpenAIの最高経営責任者であるSam Altmanは、マサチューセッツ工科大学でのイベントで講演し、当時GPT-5を訓練していないと述べた。彼は、OpenAIが「GPT-4の開発を優先している」と述べ、「GPT-5をリリースすることはなく、しばらくはしないだろう」と述べた。7月18日、OpenAIは米国で「GPT-5」の商標を申請した。11月13日、Altmanはフィナンシャル・タイムズに対し、同社がGPT-5の開発に取り組んでいることを確認した。
The Informationによると、「2024年下半期の大部分において、OpenAIは内部でOrionとして知られるモデルを開発しており、GPT-5になることを意図していた」、「しかし、Orionの取り組みはより優れたモデルを生み出すことに失敗し、同社は代わりにそれを2025年2月にGPT-4.5としてリリースした」。2025年7月下旬までに、OpenAIが8月初旬にGPT-5をリリースする計画であると広く予想されていた。7月30日、The Vergeは「MicrosoftがGPT-5の準備を進めている」と報じ、「MicrosoftのAI計画に詳しい情報筋」が編集者に対し、同社がCopilotチャットボットの新モードをテストしており、「タスクに基づいて深く考えるか、素早く考える」モデルを提供する予定であると語った。8月5日、GPT-5のリリースに先立ち、OpenAIは推論能力を持つ2つのオープンウェイトモデルからなるGPT-OSSをリリースした。その後、GPT-5は8月7日のライブストリームイベントで公開された。
能力
リリース時点で、GPT-5は数学、プログラミング、金融、マルチモーダル理解をテストするベンチマークで最先端の性能を有していた。OpenAIによると、前世代モデルからの改善点には、応答時間の短縮、コーディングとライティングスキルの向上、健康関連質問へのより正確な回答、幻覚レベルの低下が含まれる。また、以前のモデルと比較して、GPT-5は潜在的に有害なクエリに対して完全に拒否するのではなく、安全で高水準の応答を提供することを目指しており、OpenAIはこれを「安全な完了」と呼んでいる。これにより、「GPT-5がより多くの安全でない質問を拒否できる一方で、無害な情報を求めるユーザーへの拒否を減らす」ことを目指している。さらに、GPT-5は前世代モデルと比較して、より批判的で「過度に賛成的ではない」回答を提供するように訓練された。
GPT-5の公開の数日前、このモデルの初期テスター2名は、そのコーディング能力と数学・科学問題の解決能力に「感銘を受けた」と述べた。彼らは、このモデルがGPT-4から大きな改善を示しているが、GPT-3からGPT-4への飛躍ほど大きくはないと示唆した。GPT-5のリリースの前日、記者会見で、OpenAIの最高経営責任者であるSam Altmanは、GPT-5を「AGIへの道の重要な一歩」と呼び、人工知能全般を指しており、OpenAIはこれを人間が実行できるあらゆる経済的に価値のあるタスクを実行する能力と定義している。Altmanによると、GPT-5は前世代よりも「大幅に優れており」、幅広いタスクで「博士課程レベル」の能力を提供する。
GPT-5使用の正確なエネルギー消費量はOpenAIによって開示されていない。ロードアイランド大学の研究者は、中程度の長さの応答が18ワット時をわずかに超えるエネルギーを消費し、白熱電球を18分間使用するのに相当すると推定した。
アーキテクチャ
GPT-5は、高速で高スループットのモデル、より深い推論モデル、および会話の種類、複雑さ、ツールのニーズ、明示的なユーザーの意図に基づいて使用するモデルを決定するリアルタイムルーターを含むシステムである。Altmanは以前、手動のモデル選択が過度に複雑であると批判し、統合の必要性を示唆していた。GPT-5にはエージェント機能も含まれており、独自のデスクトップを設定し、ブラウザを使用してタスクに関連する情報源を自律的に検索できる。GPT-5システムカードは、2つの高速で高スループットのモデル(gpt-5-mainおよびgpt-5-main-mini)と2つの思考モデル(gpt-5-thinkingおよびgpt-5-thinking-mini)を定義している。OpenAI APIでは、開発者は思考モデル、そのミニバージョン、および思考モデルのさらに小さく高速なナノバージョンであるgpt-5-thinking-nanoにアクセスできる。API経由でアクセス可能なGPT-5のバージョンは、調整可能な推論努力(低、中、高、または最小)と冗長性(低、中、または高)を備えている。さらに、ChatGPTは、gpt-5-thinking-proと呼ばれる並列テスト時計算を利用する設定でgpt-5-thinkingへのアクセスを提供する。
安全性と限界
セキュリティ調査会社であるNeuraltrustは、GPT-5のテスト初日にそのモデルを侵害することに成功したと主張した。その報告書によると、GPT-5に爆発装置の製造に関する詳細な指示を生成させることができた。別の会社であるSPLXも同様のテストを実施し、GPT-5のセキュリティについて同様の結論に達した。彼らの評価は、GPT-5に重大なセキュリティギャップがあり、企業環境での使用には安全ではない可能性があることを示唆している。
これらの懸念にもかかわらず、OpenAIは「安全な完了」アプローチや人間のフィードバックからの強化学習などの整合技術を含む安全対策を強調している。しかし、外部研究者によって指摘されたセキュリティ脆弱性は、高度なAIシステムの堅牢な安全性を確保する上での継続的な課題を示している。
訓練
AIMultipleによると、GPT-5はネイティブにマルチモーダルであり、既に訓練された言語モデルや視覚モデルに依存せずに、複数のモダリティ(テキストや画像など)を同時にゼロから訓練されたことを意味する。その訓練プロセスは、教師なし事前訓練、教師あり微調整、人間のフィードバックからの強化学習の3段階を含んでいた。事前訓練では、書籍、記事、ウェブページ、学術論文、ライセンスされた情報源の大規模な多言語データセットを使用した。GPT-5の視覚およびテキスト能力は、GPT-4とは異なり、訓練全体を通じて互いに並行して開発されたと説明された。
訓練プロセスは、トランスフォーマーアーキテクチャと大規模言語モデル技術の進歩を活用し、マルチヘッドアテンションや位置エンコーディングを含んでいた。データ拡張とモデルプルーニングの使用も、モデルの効率と性能に貢献した。
使用と統合
GPT-5はChatGPTで使用されている。GPT-5はすべてのChatGPTユーザーに無料であるが、Plusユーザーはより高い使用制限を得られ、ProユーザーはGPT-5への無制限アクセスとGPT-5 Proへの限定的アクセスを得られる。下位層ユーザーに対する1時間あたりの応答数の標準制限は依然として適用される。さらに、GPT-5の導入に伴い、ChatGPTの「高度な音声モード」は「ChatGPT Voice」に置き換えられ、より自然な会話を可能にすることが期待されている。OpenAIは「標準音声モードは2025年9月9日に廃止され、すべてのユーザーをChatGPT Voiceに統合する」と述べた。2025年11月24日、ショッピング調査機能がChatGPTに追加され、gpt-5-thinking-miniで事後訓練されたミニモデルであると主張された。
GPT-5はMicrosoft Copilotでも利用可能であり、MicrosoftはGPT-5を幅広い製品に組み込むと述べた。9to5Macによると、Apple Inc.はこのモデルをiOS 26、iPadOS 26、macOS TahoeオペレーティングシステムのApple Intelligence機能に統合する計画である。また、OpenAI APIを介してアクセス可能であり、開発者がモデル上にアプリケーションを構築できる。
比較すると、GoogleのAstra(Gemini Live)はAndroidやGoogle Assistantを含むGoogleのエコシステムに統合されており、同様のリアルタイムマルチモーダル能力を提供する。OpenAIとGoogle DeepMindの間の競争は、両社がAIアシスタントの可能性の限界を押し広げる中で、この分野の革新を加速させている。
影響と評価
GPT-5の公開はAI業界に大きな影響を与えた。ベンチマークでの最先端の性能は、人工知能システムの新たな基準を設定した。複数のドメインにわたる複雑なタスクを処理するモデルの能力は初期テスターから賞賛されたが、一部はGPT-4からの改善がGPT-3からGPT-4への飛躍ほど劇的ではないと指摘した。
批評家は、特にNeuraltrustとSPLXによって報告された脆弱性に照らして、GPT-5の安全性とセキュリティに関する懸念を提起している。これらの問題は、Joshua TenenbaumやMelanie Mitchellなどの専門家が関与するAI安全性と整合の分野における継続的な研究の必要性を浮き彫りにしている。
これらの課題にもかかわらず、GPT-5は教育、医療、ソフトウェア開発など、さまざまな分野でのAIの広範な採用を促進すると期待されている。Microsoft CopilotやApple Intelligenceなどの製品への統合は、消費者と企業の両方にとって遍在するツールになることを示唆している。
結論
GPT-5は、生成的AIと大規模言語モデルの発展における主要なマイルストーンを表している。2025年8月7日の公開は、GoogleのAstraと並んで、リアルタイムマルチモーダルAIアシスタントの新時代を示すものである。安全性とエネルギー消費の点で課題は残るものの、GPT-5の能力はこの分野で行われている急速な進歩を示している。AIが進化し続けるにつれて、GPT-5のようなモデルは、技術と社会の未来を形作る上で中心的な役割を果たす可能性が高い。