OpenAI GPT-4のリリース

英語からの翻訳

GPT-4は、2023年3月14日にOpenAIが公開したマルチモーダル大規模言語モデルであり、テキストと画像を処理できる。推論、コーディング、標準化テストにおいて前身モデルから改善されたが、OpenAIは技術的な詳細を公開しなかった。

GPT-4は、OpenAIによって開発された大規模言語モデルであり、2023年3月14日にGPT基盤モデルシリーズの第4作として公開された。マルチモーダルモデルであり、テキストと画像の両方を入力として受け付け、標準化テストやコーディングタスクを含む様々なベンチマークでの高い性能で知られている。OpenAIは、競争上および安全性上の懸念を理由に、モデルサイズ、アーキテクチャ、トレーニングハードウェアなどの技術的詳細を開示していない。GPT-4はGPT-3.5の後継であり、GPT-5の前身である。GPT-4Vというバージョンは画像入力を処理し、後のGPT-4oモデル(2024年5月)はリアルタイムの音声および動画処理に拡張されている。GPT-4は2023年2月にMicrosoftのBing Chatに統合され、2023年3月にChatGPTで公開され、2025年にChatGPTから削除されたが、OpenAIのAPIを通じて引き続き利用可能である。

背景と開発

OpenAIは2018年に、トランスフォーマーアーキテクチャに基づく最初のGPTモデルを導入し、書籍コーパスで言語理解のためにトレーニングした。GPT-2(2019年)は一貫したテキストを生成できるより大規模なモデルであり、GPT-3(2020年)はGPT-2と比較してパラメータを100倍以上に拡張した。GPT-3.5は2022年末に開始されたChatGPTチャットボットを支えた。GPT-4はこの系統に基づいて構築され、マルチモーダル学習、強化学習、安全性アライメントの改善を組み込んだ。初期バージョンは2023年2月からBing Chatでテストされ、一般公開前にMicrosoftユーザーに早期アクセスを提供した。

能力と特徴

デフォルトのGPT-4モデルは8Kトークンのコンテキストウィンドウを持ち、特別なAPIバージョンは最大32Kトークンをサポートした。前身モデルとは異なり、画像を処理でき、ユーザーは分析や質問のために写真をアップロードできた。このモデルは、<search>タグを使用したウェブ検索などの外部ツールと対話するようにプロンプトでき、リアルタイム情報の取得や、テキスト予測を超えたAPI呼び出しや画像生成などのタスクを実行できた。2023年11月、OpenAIはGPT-4 TurboとGPT-4 Turbo with Visionを発表し、より低コストで128Kのコンテキストウィンドウを提供した。

標準化テストでの性能

GPT-4は様々な試験で高い適性を示した。トーランス創造的思考テストでは、独創性と流暢性で上位1%以内を獲得し、柔軟性スコアは93パーセンタイルから99パーセンタイルの範囲であった。Microsoftの研究者は、GPT-4がUSMLEの合格点を20ポイント以上上回り、プロンプトエンジニアリングなしでGPT-3.5やMed-PaLMなどの専門医療モデルを上回ったことを発見した。しかし、同じ研究は、潜在的な不正確さや幻覚による医療応用での重大なリスクを警告した。

応用と影響

2023年のNature誌の記事は、デバッグや最適化などのコーディングにおけるGPT-4の有用性を強調した。ある生物物理学者は、MATLABプログラムをPythonに移植するのに数日ではなく数時間かかったと報告した。セキュリティテストでは、GPT-4はSQLインジェクション脆弱性のあるコードを5%の頻度で生成し、2021年のGitHub Copilotの40%と比較された。医療分野では、MicrosoftとEpic Systemsが2023年4月に、患者の問い合わせ応答や医療記録分析にGPT-4を使用する計画を発表したが、注意が推奨された。

制限とリスク

GPT-4は幻覚を起こすことが知られており、トレーニングデータに基づかない出力や、ユーザーのプロンプトと矛盾する出力を生成する。その意思決定は不透明であり、説明は事後的に生成され、以前の記述と矛盾する可能性がある。2023年、ConceptARCベンチマークでは、GPT-4は抽象推論タスクで33%未満のスコアを示し、専門モデルや人間はより高いスコアを獲得したが、懐疑論者はテストの視覚的性質が言語モデルに不利に働く可能性があると指摘した。

バイアスとアライメント

GPT-4のトレーニングは2段階で行われた。最初にインターネットテキストでの教師なし学習、次に有害な出力を減らすための人間のフィードバックからの強化学習である。Microsoftの研究者は、確証バイアス、アンカリング、基本率無視などの認知バイアスを示す可能性があり、展開における公平性への懸念が生じると示唆した。

トレーニングと技術的秘密主義

GPT-4のOpenAI技術レポートは、モデルサイズ、アーキテクチャ、ハードウェア、トレーニングデータセットの構築、計算能力、学習率やオプティマイザなどのハイパーパラメータを省略した。同社は「競争環境と安全性への影響」を理由として挙げた。CEOのサム・アルトマンは、トレーニングコストが1億ドルを超えたと述べ、Semaforの報告ではより高い数字が示されたが、正確な数字は未検証のままである。

後継モデルと進化

2024年5月13日に導入されたGPT-4oは、テキスト、音声、画像を人間のような応答時間でリアルタイムに処理する。非英語言語の性能が向上し、GPT-4とは異なり無料層のユーザーにも利用可能となった。GPT-4Vは、以前に開始され、GPT-4に画像入力を具体的に追加した。このモデルの遺産には、マルチモーダルAIの進歩と、大規模言語モデルにおける透明性と安全性に関する議論の喚起が含まれる。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·large-language-model·openai·event
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴