GPT-3(Generative Pre-trained Transformer 3の略)は、2020年にOpenAIが同社のGPTシリーズの一部として公開した大規模言語モデルである。これはデコーダーのみのトランスフォーマーモデルであり、注意機構を用いて入力テキストの関連部分に焦点を当て、再帰や畳み込みに基づくアーキテクチャを置き換えた。GPT-3は1750億のパラメータを有し、公開時点で最大の非スパース言語モデルであり、パラメータあたり16ビット精度のため350GBのストレージを必要とした。コンテキストウィンドウは2,048トークンであり、多くのタスクで強力なゼロショットおよび少数ショット学習能力を示した。
GPT-3の公開は生成AIにおける画期的な出来事であり、トランスフォーマーベースのニューラルネットワークのスケーリングの可能性を示した。その能力は大規模言語モデルのその後の発展に影響を与え、そのようなシステムの利点とリスクに関する議論を引き起こした。
背景
GPT-3の開発は、2010年代の機械学習の進歩に根ざしており、改善されたアルゴリズム、より強力なコンピュータ、および増加したデジタル化データによって推進された。2017年に導入されたトランスフォーマーアーキテクチャは、自然言語処理の重要な基盤となった。OpenAIの最初の生成的事前学習トランスフォーマー(GPT-1)は2018年6月に導入され、続いて2019年2月にGPT-2が登場し、パラメータとデータセットサイズを10倍に拡大して15億パラメータに達した。2020年2月には、Microsoftが170億パラメータのTuring Natural Language Generation(T-NLG)を導入し、当時最大の言語モデルとなった。
トレーニングと能力
2020年5月28日、OpenAIの31人の研究者によるarXivプレプリントがGPT-3を説明し、GPT-2と比較して容量を2桁以上増加させた。トレーニングデータセットは、フィルタリングされたCommon Crawl(4,100億トークン)が60%、WebText2が22%、Books1が8%、Books2が8%、Wikipediaが3%で構成されていた。GPT-3は数千億の単語でトレーニングされ、CSS、JSX、Pythonなどの言語でのコーディングも可能だった。Lambda Labsはトレーニングコストを約460万ドルと推定し、単一GPUでは355年かかるとしたが、並列化により実際の時間は短縮された。
GPT-3の包括的なトレーニングデータにより、個別のタスクに対する微調整は不要だったが、データ内のバイアスにより有害な言語を生成する可能性があった。ワシントン大学の研究では、その毒性はGPT-2およびCTRLと同等であると判明した。OpenAIは保護策を実装し、2021年11月までにAPIへのアクセスは無制限となった。2022年1月には、InstructGPTモデルがデフォルトとなり、ユーザーの意図により適合し、有害なコンテンツの生成が少なくなった。
影響と評価
GPT-3が人間が書いた内容と容易に区別できない一貫性のあるテキストを生成する能力は、機会と懸念の両方を引き起こした。実験では、80人の米国人被験者が短い記事を正しく判断できたのは52%のみで、ほぼランダムに近かった。モデルの誤情報、スパム、フィッシングの可能性は元の論文で指摘された。GPT-3はまた、人工知能の広範な分野に影響を与え、大規模言語モデルや生成AIのさらなる研究につながった。
商業化とライセンス
2020年9月22日、MicrosoftはGPT-3の独占ライセンスを発表し、基盤モデルへのアクセスを許可した一方で、他のユーザーは公開APIを引き続き利用できた。この取引は、高度なAIモデルの商業的価値を強調し、業界における将来のパートナーシップの先例を設定した。ライセンス契約は、MicrosoftのOpenAIへのより広範な投資と、Azureなどの製品への統合の一部であった。
遺産
GPT-3の公開は自然言語処理の進歩を加速させ、AnthropicやGoogle DeepMindを含むさまざまな組織からのその後のモデルに影響を与えた。そのアーキテクチャとトレーニングアプローチは、InstructGPTやその他の後継モデルなどの後の開発のベンチマークとなった。このモデルはまた、AI倫理、安全性、およびコンテンツモデレーションの必要性に関する議論を促進し、機械学習の研究と展開の軌跡を形成した。