Generative Pre-trained Transformer 4(GPT-4)は、OpenAIによって開発された大規模言語モデルであり、GPT基盤モデルのシリーズにおける4番目のモデルである。2023年3月14日にリリースされ、GPT-3.5の後継であり、GPT-5の前身にあたる。GPT-4はマルチモーダルモデルであり、テキストと画像の両方を入力として処理できる点が、以前のモデルからの大きな進歩である。OpenAIは、GPT-4の技術的詳細、すなわちモデルの正確なサイズ、アーキテクチャ、訓練に使用されたハードウェアについて公に開示していない。
GPT-4は、2023年2月にマイクロソフトのBing Chatに統合され、翌月にChatGPTでの公式リリースが行われた。2025年にはChatGPTから削除されたが、OpenAIのAPIを通じて引き続き利用可能である。このモデルの能力と限界は、広範な研究と公の議論の対象となっている。
背景
OpenAIは2018年に最初のGPTモデルを導入した。これはトランスフォーマーアーキテクチャに基づき、大規模な書籍コーパスで訓練されたものである。翌年、GPT-2はより大規模なスケールで一貫性のあるテキストを生成する能力を示した。2020年には、GPT-2の100倍以上のパラメータを持つGPT-3がリリースされ、その後GPT-3.5に改良され、ChatGPTチャットボットを支えた。GPT-4はこの系統を引き継ぎ、マルチモーダル入力処理を追加し、さまざまなベンチマークで改善された性能を実現した。
能力
GPT-4のデフォルトバージョンは8Kのコンテキストウィンドウを備え、特別なAPIバージョンでは最大32Kトークンに対応していた。以前のモデルとは異なり、GPT-4は画像を入力として受け入れることができ、ユーザーは写真をアップロードして分析を依頼したり、視覚的なコンテンツについて質問したりすることができた。このモデルはまた、特定のタグでクエリを囲むことでウェブ検索を実行するなど、外部インターフェースとの対話を促すこともでき、API呼び出し、画像生成、ウェブページの要約などのタスクを可能にした。
『Nature』誌の2023年の記事は、エラーを起こしやすい傾向があるにもかかわらず、GPT-4のコーディング支援における有用性を強調した。プログラマーは、バグの特定や最適化の提案に役立つと感じており、ある生物物理学者は、MATLABからPythonへのプログラム移植にかかる時間を数日から約1時間に短縮できたと報告した。セキュリティテストでは、GPT-4はSQLインジェクション攻撃に対して脆弱なコードを5%の割合で生成したが、2021年のGitHub Copilotでは40%であった。
2023年11月、OpenAIは128Kのコンテキストウィンドウを備え、価格が低くなったGPT-4 TurboとGPT-4 Turbo with Visionを発表した。
標準テストにおける適性
標準テストにおけるGPT-4の性能に関する研究は、さまざまな結果を示している。トーランス創造的思考テストでは、GPT-4は独創性と流暢性で上位1%に入り、柔軟性スコアは93パーセンタイルから99パーセンタイルの範囲であった。
医療応用
マイクロソフトの研究者は、GPT-4を医学的問題でテストし、USMLEの合格点を20点以上上回り、GPT-3.5やMed-PaLMなどの医学知識に微調整されたモデルを上回ることを発見した。しかし、報告書は、医療応用における大規模言語モデルの使用には重大なリスクがあると警告し、潜在的な不正確さや幻覚を挙げた。2023年4月、マイクロソフトとEpic Systemsは、患者からの問い合わせや医療記録分析のためのGPT-4搭載システムを提供する計画を発表した。
GPT-4o
2024年5月13日、OpenAIはGPT-4o(「o」は「omni」の意)を導入した。これはテキスト、音声、画像のモダリティをリアルタイムで処理・生成する後継モデルである。GPT-4oは、人間の会話に匹敵する迅速な応答時間、非英語言語での改善された性能を提供し、GPT-4とは異なり無料層のユーザーも利用可能であった。
限界
GPT-4は、その前身と同様に、訓練データに含まれない情報やユーザーのプロンプトに矛盾する情報を含む出力を生成する幻覚を起こすことが知られている。また、意思決定における透明性も欠けており、その推論の説明は事後的に形成され、正確であるとは検証できない。多くの場合、これらの説明は以前の記述と直接矛盾する。
2023年、研究者はGPT-4を抽象推論のベンチマークであるConceptARCでテストし、すべてのカテゴリで33%未満のスコアであることを発見した。一方、専門化されたモデルはほとんどの項目で60%以上、人間は少なくとも91%を獲得した。研究に関与していないサム・ボウマンは、このテストは視覚的でありGPT-4は言語モデルであるため、結果は抽象推論の欠如を示していない可能性があると指摘した。
バイアス
GPT-4は2段階で訓練された。第一段階では、大規模なインターネットテキストデータセットで次のトークンを予測し、第二段階では人間のフィードバックからの強化学習を用いて有害なプロンプトを拒否するように微調整された。マイクロソフトの研究者は、GPT-4が確証バイアス、確証バイアス、基本率無視などの認知バイアスを示す可能性があると示唆した。
訓練
OpenAIはGPT-4の訓練に関する技術的詳細を公開しなかった。技術レポートは、競争上および安全上の理由から、モデルのサイズ、アーキテクチャ、ハードウェアを明記しなかった。これは、人間およびAIのフィードバックを用いた教師あり学習と強化学習の組み合わせを説明したが、データセットの構築、計算能力、ハイパーパラメータに関する詳細は省略された。サム・アルトマンは、訓練コストが1億ドルを超えたと述べた。