GPT-4は、OpenAIによって開発された大規模言語モデルであり、2023年3月14日にGPT基盤モデルシリーズの第4世代として公開された。これはGPT-3.5の後継であり、その後GPT-5が続いた。前身モデルとは異なり、GPT-4はマルチモーダルモデルであり、テキストと画像の両方の入力処理が可能である。OpenAIは、競争上の懸念と安全性の懸念を理由に、モデルサイズ、アーキテクチャ、トレーニングハードウェアなどの技術的詳細を開示しなかった。GPT-4は当初ChatGPT Plus加入者向けに提供され、その後OpenAI APIを通じて利用可能となり、最大32,000トークンのコンテキストをサポートするバージョンも存在した。2024年5月、OpenAIはリアルタイムの音声と視覚機能を備えた後継モデルであるGPT-4oを発表し、これは無料層のユーザーにも提供された。
背景
OpenAIは2018年に、トランスフォーマーアーキテクチャに基づき、大量の書籍コーパスでトレーニングされた最初のGPTモデルを発表した。翌年、GPT-2は大規模なテキスト生成能力を示した。2020年には、GPT-2の100倍以上のパラメータを持つGPT-3がリリースされ、さらなる改良によりGPT-3.5が生まれ、ChatGPTチャットボットを支えた。GPT-4はこの系統を引き継ぎ、マルチモーダル入力とより高度なトレーニング技術を組み込んだ。
機能
GPT-4のデフォルトバージョンは8Kのコンテキストウィンドウを持ち、特別なAPIバージョンは最大32Kトークンをサポートした。マルチモーダルモデルとして、画像を入力として受け付けることができ、ユーザーは写真をアップロードして、視覚コンテンツに基づく提案や回答を得ることができた。GPT-4はまた、クエリを<search></search>タグで囲むことでウェブ検索を実行するなど、外部インターフェースと対話するようにプロンプトを設定することもでき、結果はモデルのプロンプトに挿入されて応答が形成された。これにより、モデルはAPIを使用したり、画像を生成したり、ウェブページを要約したりすることが可能となった。
2023年のNature誌の記事では、プログラマーがGPT-4をコードのエラー特定や最適化提案などのコーディングタスクに有用だと報告しているが、エラーを起こしやすい性質も指摘された。記事で引用された生物物理学者は、MATLABからPythonへのプログラム移植が「1時間程度」で完了したと述べ、従来は数日かかっていたとしている。89のセキュリティシナリオのテストでは、GPT-4はSQLインジェクション攻撃に対して脆弱なコードを5%の割合で生成し、2021年のGitHub Copilotの40%と比較された。
2023年11月、OpenAIは128Kのコンテキストウィンドウと大幅に低い価格設定を備えたGPT-4 TurboおよびGPT-4 Turbo with Visionを発表した。
標準テストにおける能力
チャットボットを標準テストで実行することの信頼性に疑問を呈する研究もある。トーランス創造的思考テストでは、GPT-4は独創性と流暢性で上位1%以内のスコアを獲得し、柔軟性スコアは93パーセンタイルから99パーセンタイルの範囲であった。
医療応用
Microsoftの研究者は、GPT-4を医療問題でテストし、専門的なプロンプト作成なしでもUSMLEの合格点を20ポイント以上上回り、GPT-3.5などの初期の汎用モデルや、Med-PaLMなどの医療知識に特化して微調整されたモデルを上回る性能を示した。しかし、報告書は、不正確な推奨や幻覚による事実誤認など、医療応用における大規模言語モデルの使用には「重大なリスク」があると警告した。2023年4月、MicrosoftとEpic Systemsは、患者の質問への回答や医療記録の分析のために、GPT-4を搭載したシステムを医療提供者に提供する計画を発表した。
GPT-4o
2024年5月13日、OpenAIはGPT-4の後継であるGPT-4o(「o」は「omni」の略)を発表した。これはテキスト、音声、画像の各モダリティにわたる出力をリアルタイムで処理・生成する。GPT-4oは、人間の会話に匹敵する高速な応答時間、非英語言語での性能向上、強化された視覚・音声理解を示した。GPT-4とは異なり、無料層のユーザーにも利用可能であった。
制限
前身モデルと同様に、GPT-4は幻覚を起こすことが知られており、トレーニングデータに含まれない情報やユーザーのプロンプトと矛盾する出力を生成する可能性がある。また、意思決定の透明性にも欠けており、論理の説明を求められると、GPT-4は実際のプロセスを反映しない事後的な説明を提供し、多くの場合、これらの説明は以前の記述と直接矛盾する。
2023年、研究者はGPT-4を抽象推論を測定するように設計されたConceptARCベンチマークでテストし、全カテゴリで33%未満のスコアであることを発見した一方、専門モデルはほとんどのカテゴリで60%を獲得し、人間は少なくとも91%を獲得した。研究に関与していないSam Bowman氏は、このテストは視覚的でありGPT-4は言語モデルであるため、結果は抽象推論の欠如を示さない可能性があると示唆した。
バイアス
GPT-4は2段階でトレーニングされた。まず、大規模なインターネットテキストデータセットで次のトークンを予測するようにトレーニングされた。次に、人間のフィードバックを使用して人間のフィードバックからの強化学習を通じてシステムを微調整し、違法行為、自傷行為、露骨なコンテンツなど、OpenAIの有害行為の定義に違反するプロンプトを拒否するようにモデルを訓練した。Microsoftの研究者は、GPT-4が確証バイアス、アンカリング、基本率無視などの認知バイアスを示す可能性があると示唆した。
トレーニング
OpenAIはGPT-4のトレーニングに関する技術的詳細を公開しなかった。技術報告書は、モデルサイズ、アーキテクチャ、使用ハードウェアの指定を控えた。大規模データセットでの教師あり学習と、それに続く人間およびAIフィードバックによる強化学習の組み合わせを説明したが、データセット構築、計算能力、学習率、エポック数、オプティマイザなどのハイパーパラメータに関する詳細は提供しなかった。報告書は、この決定の理由として「競争環境と大規模モデルの安全性への影響」を挙げた。Sam Altman氏は、GPT-4のトレーニングコストが1億ドルを超えたと述べており、Semaforが報じた。
評価と影響
GPT-4のリリースは、AIコミュニティ内外で大きな注目を集めた。マルチモーダル機能と、標準テストや医学試験を含むベンチマークでの性能向上は広く議論された。しかし、幻覚、バイアス、透明性の欠如に関する懸念は続いた。2023年2月に公式リリース前に初期バージョンがBing Chatに統合されたことも批判の対象となった。GPT-4は2025年にChatGPTから削除された後もOpenAI APIで利用可能であり、その後継モデルであるGPT-4oはモデルの機能を進化させ続けた。