Generative Pre-trained Transformer 3(GPT-3)は、2020年にOpenAIが同社のGPTシリーズのモデルの一部として公開した大規模言語モデルである。前身であるGPT-2と同様に、これは深層ニューラルネットワークのデコーダーのみのトランスフォーマーモデルであり、再帰や畳み込みベースのアーキテクチャを「アテンション」として知られる技術で置き換えている。このアテンション機構により、モデルは最も関連性が高いと予測する入力テキストのセグメントに選択的に焦点を当てることができる。GPT-3は1750億のパラメータを持ち、各パラメータは16ビット精度で、各パラメータが2バイトを占めるため、350GBのストレージが必要である。コンテキストウィンドウサイズは2,048トークンであり、多くのタスクで強力な「ゼロショット」および「フューショット」学習能力を示している。
GPT-3を説明する論文「Language Models are Few-Shot Learners」は、2020年5月28日にOpenAIの31人のエンジニアと研究者のグループによってarXivプレプリントとして公開された。チームはGPT-3の容量を前身であるGPT-2から2桁以上増加させ、当時最大の非スパース言語モデルとした。GPT-3は前身と構造的に類似しているため、その高い精度は容量の増加とパラメータ数の増加に起因するとされている。GPT-3の容量は、当時知られていた次に大きいNLPモデルであるMicrosoftのTuring NLGの10倍である。
背景
The Economistによると、改良されたアルゴリズム、より強力なコンピュータ、そしてデジタル化された資料の量の最近の増加が、機械学習の革命を促進した。2010年代の新しい技術は、「言語の操作」を含む「タスクの急速な改善」をもたらした。ソフトウェアモデルは、「脳の神経アーキテクチャに大まかに基づく構造」で、数千または数百万の例を使用して学習するように訓練される。自然言語処理(NLP)で使用されるアーキテクチャの1つは、2017年に導入された深層学習モデルに基づくニューラルネットワーク、すなわちトランスフォーマーアーキテクチャである。テキスト入力を処理、マイニング、整理、接続、対比し、質問に正確に答えることができるNLPシステムは多数存在する。
2018年6月11日、OpenAIの研究者とエンジニアは、最初の生成的プレトレーニング済みトランスフォーマー(GPT)を紹介する論文を公開した。これは、データセット内の膨大で多様なテキストコーパスでプレトレーニングされ、その後、特定のタスクに焦点を当てるための識別的なファインチューニングが行われる、一種の生成的大規模言語モデルである。GPTモデルは、トランスフォーマーベースの深層学習ニューラルネットワークアーキテクチャである。以前は、最高性能のニューラルNLPモデルは、大量の手動ラベル付きデータからの教師あり学習を一般的に採用しており、非常に大規模な言語モデルの訓練は法外に高価で時間がかかるものとなっていた。最初のGPTモデルはGPT-1として知られ、2019年2月にGPT-2が続いた。前身の直接的なスケールアップとして作成されたGPT-2は、パラメータ数とデータセットサイズの両方が10倍に増加した。15億のパラメータを持ち、800万のウェブページのデータセットで訓練された。
2020年2月、MicrosoftはTuring Natural Language Generation(T-NLG)を発表し、これは「170億パラメータでこれまでに公開された最大の言語モデル」であると主張した。これは、テキストの要約や質問への回答など、さまざまなタスクで他のどの言語モデルよりも優れた性能を発揮した。
トレーニングと能力
論文はGPT-3のトレーニングプロセスを詳述した。GPT-3の重み付きプレトレーニングデータセットの60%は、4100億のバイトペアエンコードトークンからなるCommon Crawlのフィルタリング版に由来する。ファジー重複排除にはApache SparkのMinHashLSHが使用された。他のソースは、重み付き合計の22%を表すWebText2からの190億トークン、8%を表すBooks1からの120億トークン、8%を表すBooks2からの550億トークン、3%を表すWikipediaからの30億トークンである。GPT-3は数千億の単語で訓練され、CSS、JSX、Pythonなどでのコーディングも可能である。
Lambdalabsは、2020年に単一のGPUでGPT-3を訓練するための仮想的なコストを約460万米ドルと355年と推定し、より多くのGPUを並列使用することで実際のトレーニング時間は短縮された。モデルのサイズとトレーニングデータはその性能の鍵であり、ファインチューニングなしで多くのタスクを実行できるようにした。論文は、GPT-3がプロンプトでいくつかの例を与えられるフューショット学習を通じて、翻訳、質問応答、穴埋めタスクなどのタスクで強力な結果を達成できることを強調した。
能力と限界
GPT-3のトレーニングデータは包括的であるため、異なる言語タスクに対してさらなるトレーニングを必要としない。トレーニングデータには時折有害な言語が含まれており、GPT-3はそのトレーニングデータを模倣した結果として時折有害な言語を生成する。ワシントン大学の研究では、GPT-3はGPT-2やCTRLと同様の自然言語処理モデルと同等の毒性レベルで有害な言語を生成することがわかった。OpenAIはGPT-3によって生成される有害な言語の量を制限するためにいくつかの戦略を実装している。その結果、GPT-3は前身モデルであるGPT-1と比較して有害な言語を少なく生成したが、Wikipediaデータのみで訓練された言語モデルであるCTRL Wikiと比較すると、より多くの生成とより高い毒性の有害な言語を生成した。
GPT-3は「人間の評価者が人間が書いた記事と区別するのが難しいニュース記事を生成できる」ため、GPT-3は「言語モデルの有益な用途と有害な用途の両方を前進させる可能性」を持っている。2020年5月28日の論文で、研究者は「GPT-3の有害な影響」の可能性を詳細に説明し、これには「誤情報、スパム、フィッシング、法的および政府プロセスの悪用、詐欺的」活動などが含まれる。論文はまた、モデルが自分自身を繰り返す傾向、過度に冗長であること、物理的推論タスクに苦労することなどの限界にも言及した。
リリースとアクセス
2020年6月11日、OpenAIはユーザーが使いやすいGPT-3 API(「機械学習ツールセット」)へのアクセスをリクエストできると発表し、OpenAIがこの新技術の「強みと限界」を探るのを支援するとした。招待状は、このAPIが通常の単一ユースケースではなく、ほぼ「あらゆる英語タスク」を完了できる汎用の「テキスト入力、テキスト出力」インターフェースを持つことを説明した。OpenAI GPT-3 APIの非公開の早期リリースにアクセスできたあるユーザーによると、GPT-3はわずか数回の簡単なプロンプトで「驚くほど一貫性のあるテキスト」を書くことに「不気味なほど優れていた」。最初の実験では、80人の米国の被験者に、約200語の短い記事が人間によって書かれたかGPT-3によって書かれたかを判断するよう求めた。参加者は52%の確率で正しく判断し、ランダムな推測よりわずかに良いだけだった。
2020年9月22日、MicrosoftはGPT-3を独占的にライセンスしたと発表した。他のユーザーは依然としてその公開APIから出力を受け取ることができるが、基盤となるモデルにアクセスできるのはMicrosoftのみである。2021年11月18日、OpenAIはAPIへのアクセスが無制限になるのに十分な安全対策が実装されたと発表した。OpenAIは開発者に、OpenAIのコンテンツポリシーを遵守するのに役立つコンテンツモデレーションツールを提供した。2022年1月27日、OpenAIは最新のGPT-3言語モデル(総称してInstructGPTと呼ばれる)がAPIで使用されるデフォルトの言語モデルになったと発表した。OpenAIによると、InstructGPTは指示に従うことでユーザーの意図によりよく適合したコンテンツを生成し、作り話の生成が少なく、やや有害なコンテンツを少なく生成した。
影響
GPT-3の論文は、人工知能と生成AIの分野に大きな影響を与えた。モデルサイズとデータのスケーリングがフューショット学習の劇的な改善につながることを実証し、研究の焦点をより大きなモデルに移行させた。これは、OpenAIやGoogle DeepMind、Anthropicなどの他の組織でのその後の研究に影響を与えた。論文はまた、誤情報への悪用の可能性やそのようなモデルのトレーニングの環境コストなど、大規模言語モデルの倫理的影響についての議論を引き起こした。GPT-3の成功は、GPT-4などさらに多くのパラメータを持つ後のモデルへの道を開き、自然言語処理におけるトランスフォーマーベースのアーキテクチャのより広範な採用に貢献した。