GPT-1の論文「Improving Language Understanding by Generative Pre-Training」は、2018年6月11日にOpenAIの研究者らによって発表された。この論文は、最初の生成的プレトレーニング済みトランスフォーマーを導入し、Transformer (architecture)アーキテクチャと、大規模なテキストコーパスでの教師なしプレトレーニング、続いて特定タスクでの教師ありファインチューニングという2段階のトレーニング手法を組み合わせたモデルを提案した。この研究は、単一のモデルが複数の自然言語処理ベンチマークで高い性能を達成できることを示し、タスク固有のアーキテクチャとラベル付きデータへの従来の依存に挑戦した。
背景
2010年代には、機械学習の進歩と大規模データセットの利用可能性により、AIブームが起こった。自然言語処理(NLP)における支配的なパラダイムは、各タスクごとに大量の手動ラベル付きデータでモデルをトレーニングするものであり、これは高コストで時間がかかった。2017年、Googleの研究者らは論文「Attention Is All You Need」でトランスフォーマーアーキテクチャを導入した。これは自己注意機構に依存してシーケンスを並列処理し、トークンを逐次処理するリカレントニューラルネットワーク(RNN)の限界を克服した。このアーキテクチャは、その後の深層学習とNLPの研究の基盤となった。
開発
GPT-1モデルは、1億1700万パラメータを持つデコーダーのみのトランスフォーマーで、さまざまなジャンルの7000冊以上の未出版書籍を含むBookCorpusデータセットでトレーニングされた。プレトレーニングの目的は標準的な言語モデリング、つまりシーケンス内の次のトークンを予測することだった。この教師なしフェーズの後、モデルは教師あり学習を用いて個々のタスクにファインチューニングされ、タスク固有の入力変換を適用して異なる形式に適応させた。論文は、このアプローチが12の研究タスクのうち9つで最先端の結果を達成し、常識推論、質問応答、テキスト含意などを含み、ラベル付きデータでゼロからトレーニングされたモデルをしばしば上回ることを示した。
影響
GPT-1の成功は、プレトレーニングとファインチューニングという生成的AIのパラダイムを確立し、その後のモデルの青写真となった。これは直接的に2019年2月のGPT-2の開発につながり、モデルを15億パラメータにスケールアップし、一貫性のあるテキストを生成する能力を示した。続いて2020年5月にはGPT-3が登場し、1750億パラメータで、プロンプト内のわずかな例だけでタスクを実行できるフューショット学習を導入した。この系統は、人間のフィードバックからの強化学習(RLHF)を用いて出力をユーザーの意図に合わせるInstructGPTへと続き、最終的に2022年11月に公開されたChatGPTがこれらのモデルを広く一般に提供した。
遺産
GPT-1の論文は、大規模言語モデルの分野への基礎的な貢献として広く認識されている。多様なテキストでの生成的プレトレーニングが一般的な言語知識を捉え、下流タスクに効果的に転移できることを実証した。このアプローチは、OpenAIの後のモデルだけでなく、GoogleのGeminiやMetaのLlamaなどの競合システム、およびDeepSeekのようなオープンソースの取り組みにも影響を与えた。また、この論文はトランスフォーマーの生成的タスクへの可能性を強調し、テキスト、画像、音声を処理・生成するマルチモーダルモデルや、長いシーケンスの計算コストを削減するスパース注意機構などの効率改善への道を開いた。