InstructGPTは、OpenAIによって開発された大規模言語モデルのファミリーであり、2022年1月に初めて導入されました。これらのモデルは、以前のGPT-3モデルと比較して、ユーザーの指示により良く従い、人間の意図と整合するように設計されています。これらは、人間のフィードバックからの強化学習(RLHF)と呼ばれるトレーニング技術を採用しており、人間の評価者がモデルの出力をランク付けし、モデルはより役立つ、真実味のある、有害性の低い応答を生成するように導かれます。
InstructGPTは、生成的プレトレーニング済みトランスフォーマー(GPT)アーキテクチャの基盤の上に構築されており、これは2017年に導入されたトランスフォーマーアーキテクチャに由来するトランスフォーマーモデルの一種です。2020年にOpenAIによってリリースされた元のGPT-3は、1750億パラメータを持つデコーダーのみのトランスフォーマーでしたが、タスクから外れた出力やユーザーの意図と一致しない出力を生成することがありました。InstructGPTは、人間のフィードバックでモデルを微調整することにより、これらの問題を修正することを目指しました。
トレーニングと方法論
InstructGPTモデルは、GPT-3を教師あり学習で微調整し、その後、人間のフィードバックからの強化学習を適用して作成されました。人間の評価者は、異なるモデルによって生成された応答を比較するよう求められ、その好みは報酬モデルをトレーニングするために使用されました。ポリシー(つまりモデル)は、この報酬を最大化するように更新されると同時に、元のGPT-3分布からの逸脱に対するペナルティも組み込まれ、過度なドリフトを回避しました。
OpenAIは、InstructGPTモデルがGPT-3よりも指示に従う点で大幅に優れており、捏造された事実(幻覚として知られる現象)を生成する頻度が低く、やや有害性の低いコンテンツを生成し、要約やQ&Aなどの特定のタスクでも改善されたパフォーマンスを示したと報告しました。
能力と限界
InstructGPTは、GPT-3の核となる能力を継承しており、一貫性のあるテキストの生成、質問への回答、言語の翻訳、コードの記述などが含まれます。また、少数ショットやゼロショットのプロンプトも処理できました。しかし、その前身と同様に、有毒な入力が与えられると、有害または偏ったコンテンツを生成する可能性がありました。OpenAIは、APIを使用する開発者向けにコンテンツモデレーションツールを実装し、2022年1月時点で、InstructGPTはOpenAI API顧客向けのデフォルトモデルになりました。
前身との比較
元のGPT-3モデルと比較して、InstructGPTは、人間の評価によって証明されるように、ユーザーの意図との整合性において顕著な改善を示しました。例えば、機械学習の研究では、評価者は、意図しないオフトピックな応答の削減を含む、さまざまなプロンプトにわたって、InstructGPTの出力をGPT-3の出力よりも好ましいと判断しました。それにもかかわらず、InstructGPTは、言い回しへの感度や時折の事実誤認など、大規模言語モデルに共通する限界を保持していました。
InstructGPTの開発は、モデルが人間の倫理と安全基準に沿うようにトレーニングされる生成的人工知能のより広い傾向を反映しています。このアプローチは、同様の整合性方法論を使用するChatGPTなどの後続モデルに影響を与えました。
受容と影響
InstructGPTは、役立つ安全なAIに焦点を当てたAIモデルの成長するエコシステムに貢献しました。AnthropicやGoogle DeepMindなどの他の組織の研究者も、同様の整合性技術を探求しました。このモデルは、より実用的なAIアシスタントへの一歩でしたが、AI生成の誤情報のリスクとAIシステムにおける透明性の重要性についての議論も引き起こしました。2025年時点で、OpenAIはInstructGPTによって確立された基盤の上に、整合性技術の反復を続けています。