GPT-4 Turboは、OpenAIによって開発された大規模言語モデルであり、2023年11月に初期のGPT-4モデルの強化版として発表された。その最も顕著な改善点には、128Kトークンのコンテキストウィンドウがあり、モデルが大幅に長い入力を処理できるようになり、APIの価格設定も低くなった。このリリースでは、テキストと画像の両方を処理できるバリアントであるGPT-4 Turbo with Visionも導入された。GPT-4 Turboは、2024年5月にGPT-4oに取って代わられ、リアルタイムのマルチモーダル処理とChatGPTユーザーへの無料アクセスを提供した。
背景
OpenAIは2018年に、Transformer (architecture)アーキテクチャに基づき、書籍の大規模なコーパスで訓練された最初のGPTモデルを導入した。その後の反復である2019年のGPT-2と2020年のGPT-3は、パラメータを拡大し、テキスト生成を改善した。GPT-3.5は、2022年11月のChatGPTの初期リリースを支え、大規模言語モデルを主流の注目に押し上げた。2023年3月にリリースされたGPT-4は、テキストと画像の両方の入力を受け入れるマルチモーダル機能を追加した。デフォルトバージョンは8Kのコンテキストウィンドウを持ち、特別なAPIバリアントは最大32Kトークンをサポートした。GPT-4 Turboは、前身の基盤の上に、コンテキスト長とコストの制限に対処するために開発された。
発表とリリース
OpenAIは2023年11月6日、サンフランシスコで開催された最初の開発者会議DevDayでGPT-4 Turboを発表した。このモデルはOpenAI APIを通じて利用可能になり、価格は入力1,000トークンあたり0.01ドル、出力1,000トークンあたり0.03ドルで、GPT-4より約3倍安かった。128Kのコンテキストウィンドウにより、単一のリクエストで300ページを超えるテキスト文書の処理が可能になった。OpenAIはまた、テキストに加えて画像を分析できるGPT-4 Turbo with Visionの更新版も導入した。この発表では、指示追従、JSONモード、関数呼び出しの改善が強調され、モデルが開発者アプリケーションにより適したものになった。
能力
GPT-4 Turboは、GPT-4のマルチモーダル入力機能を維持し、ユーザーがテキストと画像の両方を提供できるようにした。関数呼び出しを通じて外部ツールと対話でき、ウェブ検索、API呼び出し、画像生成などのタスクを可能にした。拡張されたコンテキストウィンドウにより、モデルは長い会話にわたって一貫性を維持し、書籍全体やコードベースを処理できた。2023年のNatureの記事では、プログラマーがGPT-4 Turboがエラーの特定や最適化の提案などのコーディングタスクを支援したと報告したが、間違いを犯しやすいことも指摘された。89のセキュリティシナリオのテストでは、GPT-4はSQLインジェクション攻撃に対して脆弱なコードを5%の頻度で生成し、2021年のGitHub Copilotの40%の脆弱性率から改善された。
標準テストのパフォーマンス
GPT-4 Turboの標準テストでのパフォーマンスに関する研究は限られていたが、GPT-4の初期評価では強い結果が示された。トーランス創造的思考テストでは、GPT-4は独創性と流暢性で上位1%以内にスコアし、柔軟性スコアは93パーセンタイルから99パーセンタイルの範囲だった。研究者は、チャットボットをこのようなテストに通すことは信頼性が低い可能性があると警告した。なぜなら、モデルはもっともらしいが不正確な回答を生成できるからである。
医療応用
マイクロソフトの研究者は、GPT-4を医療問題でテストし、米国医師免許試験の合格点を20ポイント以上上回り、GPT-3.5やMed-PaLMなどの専門モデルよりも優れていることを発見した。しかし、彼らは不正確な推奨や重大な事実誤認の幻覚を含む重大なリスクを警告した。2023年4月、マイクロソフトとEpic Systemsは、患者の質問に答え、医療記録を分析するためのGPT-4搭載システムを医療提供者に提供する計画を発表し、この傾向はGPT-4 Turboでも続いた。
制限
前身と同様に、GPT-4 Turboは幻覚を起こす可能性があり、ユーザーのプロンプトと矛盾する出力や捏造された情報を含む出力を生成することがあった。また、意思決定における透明性も欠けており、推論の説明を求められると、モデルは実際のプロセスを反映しているか検証できない事後的な説明を生成した。2023年、研究者はGPT-4を抽象推論を測定するように設計されたConceptARCベンチマークでテストし、すべてのカテゴリで33%未満のスコアを記録した一方、専門モデルはほとんどのカテゴリで60%、人間は少なくとも91%を記録した。研究に関与していないSam Bowmanは、テストの視覚的な性質が言語モデルにとって不利になる可能性があると指摘した。
バイアス
GPT-4 Turboは2段階で訓練された。まず、大規模なインターネットテキストデータセットで次のトークンを予測し、次に、安全ガイドラインに合わせるために人間のフィードバックからの強化学習を使用した。マイクロソフトの研究者は、GPT-4が確証バイアス、アンカリング、基本率無視などの認知バイアスを示す可能性があると示唆した。訓練プロセスは有害な出力を減らすことを目的としていたが、バイアスは依然として現れる可能性があった。
訓練
OpenAIは、モデルサイズ、アーキテクチャ、ハードウェアを含むGPT-4 Turboの訓練の技術的詳細を開示しなかった。GPT-4の技術レポート(Turboにも適用される可能性が高い)は、この秘密主義の理由として競争上および安全上の懸念を挙げた。Sam Altmanは、GPT-4の訓練に1億ドル以上かかったと述べた。訓練では、教師あり学習に続いて、人間とAIの両方のフィードバックを用いた強化学習が使用されたが、ハイパーパラメータやデータセット構築などの詳細は明らかにされなかった。
受け入れと影響
GPT-4 Turboは、低コストと大きなコンテキストウィンドウにより開発者に好評で、長文書分析や複雑なエージェントワークフローなどの新しいアプリケーションを可能にした。これは、大規模言語モデルの競争環境におけるOpenAIの地位を強化し、AnthropicやGoogle DeepMindなどのライバルと対峙した。このリリースはまた、より効率的でアクセスしやすいAIモデルへの傾向を強調し、その後の分野の発展に影響を与えた。GPT-4 Turboは、新しいモデルに置き換えられるまでOpenAI APIで利用可能であり続けたが、GPT-4自体は2025年にChatGPTから削除された。