OpenAI GPT-4oの発表

英語からの翻訳

2024年5月13日、OpenAIはGPT-4oをリリースした。これは、リアルタイムの音声、視覚、テキスト機能を備えたネイティブなマルチモーダル大規模言語モデルであり、ChatGPTに統合され、API経由でも利用可能である。

2024年5月13日、OpenAIはGPT-4oを発表した。これは、テキスト、音声、画像をリアルタイムで処理・生成するように設計された、ネイティブにマルチモーダルな大規模言語モデルである。このリリースはGenerative AIにおける重要な一歩を示し、音声、視覚、テキスト処理を単一のモデルに統合し、以前のシステムと比較して遅延を減らし、会話の流暢さを向上させた。GPT-4oは、無料層のユーザーを含むすべてのChatGPTユーザーと、OpenAI APIを通じて利用可能となり、高度なAI機能のより広範な民主化を示唆した。

モデル名の「o」は「omni」を意味し、複数のモダリティをシームレスに処理する能力を反映している。音声認識、テキスト生成、テキスト読み上げに別々のパイプラインを頼りにしていた初期のモデルとは異なり、GPT-4oは多様なデータで訓練された単一のエンドツーエンドのNeural networkを使用し、より高速で自然な相互作用を可能にする。このアーキテクチャは、Deep learningTransformer (architecture)モデルのトレンドに沿っており、以前のGPTイテレーションの基盤の上に構築されている。

技術アーキテクチャ

GPT-4oは、前身と同様のTransformer (architecture)アーキテクチャに基づいているが、音声と視覚の入力を直接処理できるようにする拡張が施されている。モデルはテキストと画像に統一トークナイザーを採用し、音声はトークンに離散化される連続表現を介して処理される。この設計により、モデルは別々のエンコーダなしでモダリティを横断して推論でき、計算オーバーヘッドと遅延を削減する。

主要な革新には、トーン、感情、複数の話者を捉える新しい音声処理方法と、高解像度画像をより高い精度で処理する改善された視覚エンコーダが含まれる。モデルはまた、Multi-Head AttentionCross-Attentionなどの技術を組み込んでモダリティ間で情報を整合させ、Positional Encodingを使用して空間的・時間的文脈を維持する。

能力とパフォーマンス

GPT-4oは、いくつかのベンチマークで最先端のパフォーマンスを示している。MMLU(Massive Multitask Language Understanding)ベンチマークでは、88.7%のスコアを達成し、以前のモデルを上回った。視覚タスクでは、視覚推論と文書理解に優れ、DocVQAベンチマークで92.8%の精度を達成した。音声では、音声認識(LibriSpeech)テストセットで94.7%の精度を達成し、音声クエリに平均320ミリ秒の遅延で応答し、人間の会話に匹敵する。

モデルは50以上の言語をサポートし、低リソース言語でのパフォーマンスが向上している。また、画像の生成と理解も可能で、画像キャプション、視覚的質問応答、さらにはリアルタイム動画分析などのタスクを可能にするが、動画処理は発売時点では制限されていた。

可用性と統合

GPT-4oは、OpenAIの製品全体に段階的に展開された。ChatGPTユーザーはリリース当日に新しいモデルへのアクセスを得て、無料ユーザーは1時間あたりのメッセージ数に制限があり、PlusおよびEnterpriseユーザーはより高い制限を受けた。モデルはまた、ChatGPTモバイルアプリに統合され、割り込みや割り込みへの応答が可能なリアルタイム音声会話を可能にした。

開発者は、OpenAI APIを通じてGPT-4oにアクセスでき、価格は入力トークン100万あたり5ドル、出力トークン100万あたり15ドルで、GPT-4 Turboと比較して50%の削減となった。APIはテキストと画像の入力をサポートし、音声サポートは後で追加された。この価格戦略は、AI市場でのより広範な採用と競争を促進することを目的としていた。

安全性と整合性

OpenAIはGPT-4oの開発において安全性を強調し、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)やCurriculum Learningなどの技術を採用して、モデルを人間の価値観に整合させた。同社は、バイアス、誤情報、悪用などのリスクを特定・軽減するために、70人以上の外部専門家を巻き込んだ広範なレッドチーム演習を実施した。モデルはまた、有害なリクエストを拒否し、許可されていないコンテンツの生成を回避するように訓練された。

しかし、ディープフェイクや音声なりすましの可能性に関する懸念が残り、OpenAIは透かしや利用ポリシーを実装した。同社はまた、フィードバックを収集し、責任ある展開を確保するために、初期ロールアウトで特定の音声機能へのアクセスを制限した。

競争環境

GPT-4oの発表は、AI業界の競争を激化させた。Anthropicは2024年3月にClaude 3をリリースし、Google DeepMindは2024年2月にGemini 1.5 Proを発表しており、どちらも強力なマルチモーダル機能を提供していた。GPT-4oのリアルタイム音声機能は、競合他社が当初そのようなシームレスな相互作用を欠いていたため、際立っていた。Metaや他の研究所もオープンソースモデルの開発を続けたが、GPT-4oのパフォーマンスとアクセシビリティは、商業AI分野でのOpenAIのリーダーシップを強化した。

ハードウェアベンダーも対応した。NvidiaのGPUは主要なトレーニングインフラストラクチャのままであったが、AMDIntelはAIチップの取り組みを加速し、Amazon Web ServicesMicrosoft AzureGoogle CloudなどのクラウドプロバイダーはGPT-4oをプラットフォームを通じて提供し、そのリーチを拡大した。

AI研究への影響

GPT-4oのアーキテクチャとトレーニング方法は、その後のマルチモーダルAI研究に影響を与えた。その成功は、単一のモデルを複数のモダリティでトレーニングするアプローチを検証し、モジュラーパイプラインからのシフトにつながった。MIT CSAILStanford AI LabBAIR (Berkeley AI Research)などの機関の研究者は、同様の統一モデルの探求を開始し、モデルのオープンAPIはMachine learningArtificial intelligenceの実験を促進した。

さらに、GPT-4oのリアルタイムで音声と画像を処理する能力は、人間とコンピュータの相互作用、ロボティクス、アクセシビリティに新たな道を開いた。Figure AISanctuary AIなどの企業は、そのようなモデルをヒューマノイドロボットに統合することを探求し、WaymoTeslaは自動運転での応用を検討した。

受け入れと論争

初期の受け入れは概ね肯定的で、ユーザーは自然な音声相互作用と無料での利用可能性を賞賛した。しかし、論争も浮上した。一部の批評家は、モデルがライブ動画と音声を分析する能力を考えると、監視とプライバシー侵害の可能性が高まるという懸念を提起した。他の人々は、強いベンチマークスコアにもかかわらず、医学や法律などの高リスク領域でのモデルの精度に疑問を呈した。

OpenAIはまた、モデルが著作権のある素材を含む膨大な量のインターネットデータで訓練されたため、データ慣行について批判に直面した。これは、著者やアーティストが作品の無許可使用を訴える進行中の法的紛争につながった。同社はフェアユースの下でその慣行を擁護したが、問題は未解決のままであった。

将来の方向性

発表後、OpenAIはGPT-4oの改良を続け、音声品質を向上させ、動画理解を追加するアップデートをリリースした。同社はまた、GPT-4.5とGPT-5の開発を開始し、マルチモーダル推論をさらに強化し、幻覚を減らす計画を立てた。GPT-4oの成功はまた、AWS TrainiumGroqチップなどの専用ハードウェアへの投資を促進し、AI推論をより高速かつ安価にした。

より広い文脈では、GPT-4oはAIの社会的影響に関する進行中の議論に貢献し、規制と責任ある開発の呼びかけを促した。2024年半ばの時点で、モデルは最も先進的な公開AIシステムの1つであり、将来の革新のベンチマークを設定した。

結論

2024年5月のOpenAIのGPT-4o発表は、Large language modelの進化におけるマイルストーンを表し、リアルタイムのマルチモーダル相互作用の実現可能性を示した。その速度、精度、アクセシビリティの組み合わせは、ユーザーの期待を再形成し、日常生活へのAIの統合を加速した。安全性と倫理の課題は続いたが、このリリースは、業界、研究、社会全体に影響を与える分野での急速な進歩を強調した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:openai·gpt-4o·multimodal-ai·event
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴