英語からの翻訳

GPT-4は、OpenAIによって開発されたマルチモーダル大規模言語モデルであり、2023年3月に公開され、AIの能力と標準化されたテストにおいて新たなベンチマークを打ち立てた。

GPT-4(Generative Pre-trained Transformer 4)は、OpenAIによって開発された大規模言語モデルであり、2023年3月14日に公開された。これはOpenAIのGPT基盤モデルシリーズの4番目であり、GPT-3.5の後継、GPT-5の前身にあたる。前任モデルとは異なり、GPT-4はマルチモーダルであり、テキストと画像の両方の入力を処理できる。OpenAIは、モデルサイズ、アーキテクチャ、トレーニングハードウェアなどの技術的詳細を、競争上および安全性上の懸念を理由に開示していない。このモデルは2023年2月にMicrosoftのBing Chatに統合され、2023年3月にChatGPTで利用可能となり、2025年にChatGPTから削除された。GPT-4はOpenAIのAPIを通じて引き続きアクセス可能である。

背景

OpenAIは2018年に、Transformer (architecture)アーキテクチャに基づき、大量の書籍コーパスでトレーニングされた最初のGPTモデルを導入した。GPT-2は2019年に続き、大規模な一貫性のあるテキストを生成した。2020年には、GPT-3がGPT-2と比較してパラメータを100倍以上に拡張し、さらなる改良によりGPT-3.5が生まれ、ChatGPTチャットボットを支えた。GPT-4は、強化された機能とマルチモーダル入力を備え、この系統に基づいて構築された。

機能

デフォルトのGPT-4バージョンは8Kのコンテキストウィンドウを備え、APIバリアントは最大32Kトークンをサポートした。そのマルチモーダルな性質により、画像とテキストの入力が可能で、写真アップロードや音声対話への応答を実現する。GPT-4は、検索タグを使用してウェブクエリを実行し、結果を応答に統合し、API呼び出し、画像生成、ウェブページ要約などのタスクを実行するなど、外部インターフェースと対話するようにプロンプトできる。

2023年のNature誌の記事は、エラー傾向があるにもかかわらず、コーディングにおけるGPT-4の有用性を強調した。ある生物物理学者は、MATLABからPythonへの移植を数日から約1時間に短縮したと報告した。89のシナリオにわたるセキュリティテストでは、GPT-4はSQLインジェクションに脆弱なコードを5%の割合で生成したのに対し、2021年のGitHub Copilotでは40%だった。2023年11月、OpenAIは128Kのコンテキストウィンドウと低価格を備えたGPT-4 Turboを発表した。

標準テストにおける適性

チャットボットのテストパフォーマンスの信頼性に疑問を呈する研究がある。トーランス創造性テストでは、GPT-4は独創性と流暢性で上位1%を獲得し、柔軟性スコアは93パーセンタイルから99パーセンタイルの範囲だった。

医療応用

Microsoftの研究者は、GPT-4がUSMLEの合格点を20ポイント以上上回り、専門的なプロンプト作成なしで、GPT-3.5やMed-PaLMなどの医療用微調整モデルを上回ることを発見した。しかし、彼らは不正確な推奨や幻覚による事実など、重大なリスクを警告した。2023年4月、MicrosoftとEpic Systemsは、患者の問い合わせと医療記録分析のためのGPT-4搭載システムを発表した。

GPT-4o

2024年5月13日、OpenAIはGPT-4o(「o」は「omni」を意味する)を導入し、テキスト、音声、画像のモダリティをリアルタイムで処理した。これは迅速な応答時間、改善された非英語パフォーマンスを提供し、GPT-4とは異なり無料層のユーザーにも利用可能だった。

制限事項

GPT-4は幻覚を起こす可能性があり、トレーニングデータにない出力やプロンプトと矛盾する出力を生成することがある。その意思決定には透明性が欠けており、説明は事後的なものであり、しばしば検証不可能で、時には以前の記述と矛盾する。2023年、抽象推論のConceptARCベンチマークでのテストでは、GPT-4はカテゴリ全体で33%未満のスコアを示したのに対し、専門モデルは60%、人間は少なくとも91%を獲得した。Sam Bowmanは、テストの視覚的な性質が言語モデルの推論を反映していない可能性があると指摘した。

バイアス

GPT-4のトレーニングは2段階で行われた。インターネットテキストでの教師なし事前トレーニングと、その後の有害なプロンプトを拒否するための人間のフィードバックからの強化学習(RLHF)である。Microsoftの研究者は、GPT-4が確証バイアス、アンカリング、基準率無視などの認知バイアスを示す可能性があると示唆した。

トレーニング

OpenAIの技術レポートは、モデルサイズ、アーキテクチャ、ハードウェア、データセット構築、計算量、ハイパーパラメータを省略した。トレーニングには、人間とAIのフィードバックを用いた教師あり学習と強化学習が使用された。Sam Altmanは、トレーニングコストが1億ドルを超えたと述べたが、正確な数字は非公開のままである。

評価と影響

GPT-4はAIに新しいベンチマークを設定し、AnthropicGoogle DeepMindなどの競合他社のその後のモデルに影響を与えた。そのマルチモーダル機能は、生成AIの応用を、クリエイティブツールから医療診断まで拡大した。幻覚やバイアスを含むモデルの制限は、AIの安全性と透明性に関する議論を引き起こし、アライメントと評価方法の研究を促進した。

遺産

GPT-4のリリースは、大規模言語モデルのマイルストーンを示し、さまざまな領域での実用的な有用性を実証した。その後継であるGPT-5はシリーズを継続し、GPT-4はマルチモーダルAIの参照点であり続けている。このモデルの影響は、人工知能機械学習の継続的な発展に今も残っている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·openai·multimodal-ai·generative-ai
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴