Generative Pre-trained Transformer 3(GPT-3)は、2020年にOpenAIが同社のGPTシリーズの一部としてリリースしたLarge language modelである。これは、Deep learningニューラルネットワークアーキテクチャのデコーダーのみのTransformer (architecture)モデルであり、再帰や畳み込みに基づく設計を、入力テキストの関連セグメントに選択的に焦点を当てることを可能にするアテンションメカニズムで置き換えている。GPT-3は1750億のパラメータを持ち、各パラメータは16ビット精度で保存され、350GBのストレージを必要とし、コンテキストウィンドウは2,048トークンである。多くのタスクにおいて、強力なゼロショットおよび少数ショット学習能力を示した。
2020年9月22日、マイクロソフトはGPT-3を独占的にライセンスしたことを発表した。他の企業は依然として公開APIから出力を受け取ることができたが、基盤となるモデルにアクセスできるのはマイクロソフトのみであった。
背景
アルゴリズムの改善、より強力なコンピュータ、そしてデジタル化された資料の増加は、2010年代のMachine learningにおける革命を促進し、言語操作を含むタスクの急速な改善につながった。ソフトウェアモデルは、脳の神経アーキテクチャに大まかに基づく構造で、数千または数百万の例を使用して訓練される。自然言語処理で使用されるアーキテクチャの1つは、2017年に導入されたトランスフォーマーアーキテクチャに基づくニューラルネットワークである。これにより、テキスト入力を処理、マイニング、整理、接続、対比し、質問に答えることができるシステムが可能になった。
2018年6月11日、OpenAIの研究者は、最初の生成的プレトレーニング済みトランスフォーマー(GPT)を紹介する論文を発表した。これは、膨大で多様なテキストコーパスで事前学習された生成型大規模言語モデルの一種であり、特定のタスクのための識別的な微調整が続く。以前は、最高性能のニューラルNLPモデルは、高価で時間のかかる手動ラベル付きデータの大量の教師あり学習を一般的に使用していた。最初のGPTモデルに続いて、2019年2月にGPT-2が登場し、15億のパラメータを持つ直接的なスケールアップで、800万のウェブページで訓練された。2020年2月、マイクロソフトはTuring Natural Language Generation(T-NLG)を導入し、170億のパラメータを持つ最大の言語モデルであると主張した。
訓練と能力
2020年5月28日、OpenAIの31人のエンジニアと研究者によるarXivプレプリントがGPT-3を説明した。これは、第三世代の最先端言語モデルである。チームはGPT-2から容量を2桁以上増やし、GPT-3を当時最大の非スパース言語モデルにした。その高い精度は、容量とパラメータの増加に起因し、マイクロソフトのTuring NLGの10倍の大きさである。Lambdalabsは、2020年に単一のGPUでGPT-3を訓練するための仮想的なコストを約460万ドルと355年と推定し、並列GPUを使用した実際の訓練時間はより短かった。
重み付き事前学習データセットの60%は、4100億のバイトペアエンコードトークンからなるCommon Crawlのフィルタリング版から来た。ファジー重複排除にはApache SparkのMinHashLSHが使用された。他のソースには、WebText2からの190億トークン(重み付き合計の22%)、Books1からの120億トークン(8%)、Books2からの550億トークン(8%)、Wikipediaからの30億トークン(3%)が含まれた。GPT-3は数千億の単語で訓練され、CSS、JSX、Pythonでもコーディングできた。
訓練データは包括的であったため、GPT-3は異なる言語タスクのためにさらなる訓練を必要としなかった。訓練データには時折有害な言語が含まれており、GPT-3はそれを模倣して時折有害な言語を生成した。ワシントン大学の研究では、GPT-3がGPT-2やCTRLと同等のレベルの有害な言語を生成することがわかった。OpenAIは有害な出力を制限する戦略を実装し、その結果、GPT-1よりも有害な言語が少なくなったが、Wikipediaデータのみで訓練されたモデルであるCTRL Wikiよりも多くの生成と高い毒性があった。
公開アクセスと進化
2020年6月11日、OpenAIはユーザーがGPT-3 APIへのアクセスをリクエストできると発表した。これは機械学習ツールセットであり、技術の強みと限界を探るためのものである。APIは汎用のテキスト入力、テキスト出力インターフェースを持ち、ほぼすべての英語タスクを完了できた。初期のユーザーの1人は、GPT-3が単純なプロンプトで一貫したテキストを書くのに不気味なほど優れていると説明した。初期の実験では、80人の米国の被験者が短い記事を人間が書いたものかGPT-3が生成したものかを判断し、正しく識別したのはわずか52%で、ランダムな推測よりわずかに良かった。
2021年11月18日、OpenAIはAPIアクセスを制限なしにするのに十分な安全対策が実装されたと発表し、開発者にコンテンツモデレーションツールを提供した。2022年1月27日、OpenAIは最新のGPT-3モデル(総称してInstructGPTと呼ばれる)がAPIのデフォルトになったと発表し、ユーザーの意図により良く整合したコンテンツを生成し、指示に従い、作り話の生成が少なくなり、やや有害なコンテンツが少なくなった。
影響と懸念
GPT-3は、人間の評価者が人間が書いたものと区別するのが難しいニュース記事を生成できるため、言語モデルの有益なアプリケーションと有害なアプリケーションの両方を進展させる可能性があった。2020年5月28日の論文で、研究者は誤情報、スパム、フィッシング、法的および政府プロセスの悪用、詐欺行為などの潜在的な有害な影響を説明した。モデルの広範な能力は、Generative AIの社会的影響と責任ある展開の必要性についての議論を促進した。
遺産
GPT-3はArtificial intelligenceの発展における重要なマイルストーンを示し、トランスフォーマーモデルのスケーリングが言語理解と生成の劇的な改善をもたらすことを実証した。そのアーキテクチャと訓練アプローチは、OpenAI内の後継モデルや、AnthropicやGoogle DeepMindなどの他の組織の取り組みを含む後続のモデルに影響を与えた。マイクロソフトへの独占ライセンスは、大規模言語モデルの商業的価値を強調し、Microsoft AzureがGPT-3をその提供物に統合することで、クラウドコンピューティングサービスの競争環境を形成した。GPT-3はまた、大規模モデルの整合性、安全性、評価に関する研究を促進し、Neural network研究のより広い分野に貢献した。