英語からの翻訳

InstructGPT-175Bは、OpenAIのInstructGPTシリーズの1750億パラメータ版であり、人間のフィードバックからの強化学習を用いて微調整され、指示に従い、より有益で整合性のある応答を生成する大規模言語モデルである。

InstructGPT-175Bは、OpenAIによって開発された大規模言語モデルであり、InstructGPTファミリーにおける最大構成を表す。これはGPT-3アーキテクチャの変種であり、具体的には175Bパラメータ版であり、人間のフィードバックからの強化学習(RLHF)と呼ばれる手法を用いて微調整された。このモデルは、初期のGPT-3モデルがしばしば不正確、有害、またはユーザーの意図と十分に整合しない出力を生成するという限界に対処するために設計された。InstructGPT-175Bは2022年初頭に発表された研究論文で紹介され、同じサイズのベースモデルであるGPT-3と比較して、指示追従と有用性において大幅な改善を示した。

InstructGPT-175Bの開発は、生成的人工知能の分野における転換点となり、RLHFを大規模言語モデルを人間の好みに整合させるための中核的な訓練パラダイムとして確立した。このモデルの訓練プロセスは、人間が書いたデモンストレーションによる教師あり微調整、人間の比較による報酬モデルの訓練、そして近位方策最適化(PPO)を用いた強化学習の最適化という3つの段階を伴った。このアプローチにより、モデルは同じアーキテクチャとパラメータ数でありながら、元のGPT-3からの出力よりも人間の評価者に好まれる応答を生成することが可能となった。

訓練方法

InstructGPT-175Bは、人間のラベラーから収集されたプロンプトと望ましい出力のデータセットを用いて訓練された。初期の教師あり微調整段階では約13,000の訓練プロンプトが使用され、ラベラーがデモンストレーション応答を作成した。その後、報酬モデルが約33,000の比較からなるデータセットで訓練され、ラベラーが同じプロンプトに対する異なるモデル出力をランク付けした。最終的な強化学習段階では、報酬モデルを用いて方策を最適化し、175Bモデルは訓練されたいくつかのサイズ(1.3B、6.7B、13Bの変種を含む)の中で最大のものであった。訓練にはAdamオプティマイザーが学習率スケジュールと勾配クリッピングとともに使用され、安定性を確保した。

評価と結果

人間の評価者は、ほとんどのプロンプトカテゴリにおいて、GPT-3 175Bの出力よりもInstructGPT-175Bの出力を一貫して好み、その好み率は70%を超えた。このモデルは、幻覚の低減、明示的な指示への従順さ、有害または偏った言語の回避において特に改善を示した。しかし、評価により、InstructGPT-175Bは特定の敵対的プロンプトに対して依然として脆弱であり、曖昧なトピックについて質問された場合には誤った情報を生成する可能性があることも明らかになった。標準的なNLPベンチマークでのモデルの性能は概ねGPT-3と同等であったが、ユーザーのニーズへの整合性が向上したため、実世界での有用性は大幅に高かった。

影響と遺産

InstructGPT-175Bの成功は、ChatGPTシリーズを含むOpenAIでのその後のモデル開発に影響を与え、同様のRLHF技術を採用した。また、AnthropicGoogle DeepMindなどの他の組織にも、自社の訓練パイプラインに人間のフィードバックを組み込むよう促した。このモデルは、スケーリングだけでは有用なAIシステムを生み出すには不十分であり、実用的な展開には整合性の技術が不可欠であることを実証した。InstructGPT-175Bは、AI整合性の分野における基礎的な研究としてしばしば引用され、その方法論は後のLLaMAClaudeなどのモデルにとって標準的な参照点となった。

限界と倫理的考慮事項

その改善にもかかわらず、InstructGPT-175Bには顕著な限界があった。過度に冗長で、情報を繰り返すことがあり、曖昧なプロンプトに対して明確化の質問をしないこともあった。また、モデルは訓練データに存在するバイアスを示し、RLHFは有害な出力を完全に排除することはできなかった。OpenAIはこのモデルをAPIを通じて公開したが、悪用を軽減するためにアクセスを制限した。このモデルに付随する研究論文は、これらの限界を率直に議論し、堅牢性、解釈可能性、安全性における継続的な研究の必要性を強調した。これらの議論は、責任あるAI開発と、大規模言語モデルを大規模に展開することの倫理的影響に関するより広範な会話に貢献した。

技術仕様

InstructGPT-175BはGPT-3と同じトランスフォーマーアーキテクチャを使用し、96層、96のアテンションヘッド、隠れサイズ12,288を備える。マルチヘッドアテンションレイヤー正規化を採用し、コンテキストウィンドウは2048トークンである。モデルはウェブテキスト、書籍、その他のソースの混合で訓練され、その微調整プロセスはベースアーキテクチャを変更しなかった。175Bパラメータ数は当時の最大級のモデルの一つであり、訓練と推論の両方にかなりの計算リソースを必要とした。OpenAIは正確な訓練計算量を公開していないが、推定ではNVIDIAハードウェアでの数千GPU日が関与したと示唆されている。

結論

InstructGPT-175Bは、大規模言語モデルを人間の意図に整合させる上での画期的な成果を表す。その開発はRLHFの有効性を実証し、AIシステムにおける有用性と安全性の新たな基準を設定した。より新しいモデルがその能力を超えている一方で、その影響は現代の指示調整モデルの設計に持続している。このモデルの遺産は、AI業界全体での人間のフィードバック技術の広範な採用に明らかであり、現代の機械学習研究と応用の基礎となっている。

参考文献

この記事の主な情報源は、OpenAIの研究論文「Training language models to follow instructions with human feedback」(2022年)であり、Long Ouyang、Jeff Wu、Xu Jiangらが著者である。追加情報は、AIコミュニティにおけるその後の分析とレビューから得られている。

関連項目

カテゴリ

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-models·openai·reinforcement-learning·ai-alignment
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴