Generative Pre-trained Transformer 3(GPT-3)は、2020年にOpenAIが同社のGPTシリーズの一環として公開した大規模言語モデルである。これは、トランスフォーマーモデルに基づくデコーダーのみの深層ニューラルネットワークであり、関連する入力セグメントに選択的に焦点を当てるためのアテンション機構を使用している。1750億のパラメータを各16ビット精度で保持するGPT-3は、350GBのストレージを必要とし、2,048トークンのコンテキストウィンドウをサポートする。多くのタスクで強力なゼロショットおよび少数ショット学習を示し、そのAPI経由での公開は2020年6月11日に発表された。
背景
The Economistによると、改良されたアルゴリズム、より強力なコンピュータ、そして増大するデジタル化されたコーパスが機械学習の革命を促進した。2010年代の新しい技術は、脳に大まかに基づくニューラルアーキテクチャに依存し、言語操作の急速な改善をもたらした。2017年に導入されたトランスフォーマーアーキテクチャは、自然言語処理システムの基盤となった。2018年6月、OpenAIは最初の生成的事前学習トランスフォーマー(GPT-1)を公開した。これは大規模なテキストコーパスで訓練され、その後特定のタスクに微調整されるモデルである。GPT-2は2019年2月に続き、パラメータとデータセットの規模を10倍に拡大し、800万のウェブページで訓練された15億のパラメータに達した。2020年2月、MicrosoftはTuring NLGを導入した。これは170億パラメータのモデルであり、当時最大と見なされた。
訓練と能力
2020年5月28日、31人のOpenAIエンジニアと研究者によるarXivプレプリントがGPT-3の開発を説明し、GPT-2からモデル容量を2桁以上増加させ、当時の最大の非スパース言語モデルとした。その精度は、MicrosoftのTuring NLGの10倍の容量とパラメータの増加に由来していた。Lambdalabsは、2020年の訓練コストを460万ドル、単一GPUでの355年と推定した。事前学習データには、フィルタリングされたCommon Crawl(加重データの60%)からの4100億のバイトペアエンコードトークンに加え、WebText2、Books1、Books2、Wikipedia(3%)が含まれていた。GPT-3はPython、JSX、CSSでのコーディングも可能だった。
GPT-3はタスク固有の微調整を欠き、代わりに広範な指示を処理した。しかし、訓練データにはモデルが時折再現できる有害な言語が含まれていた。ワシントン大学の研究では、GPT-3の毒性はGPT-2およびCTRLと同等であることが判明した。OpenAIは緩和戦略を実施し、GPT-1と比較して有害な出力を削減した。
APIアクセスと評価
2020年6月11日、OpenAIはテキスト入力・テキスト出力インターフェースを備えた汎用APIを公開し、単一用途ではなくあらゆる英語タスクを可能にした。初期のテスターは、GPT-3が一貫したテキスト生成において不気味なほど優れていると述べた。80人の米国参加者による実験では、GPT-3の記事と人間が書いた記事を区別できたのはわずか52%の正解率であり、ランダムな推測をわずかに上回る程度だった。2021年11月18日までに、OpenAIはコンテンツモデレーションツールを備えたAPIへのアクセスを拡大した。2022年1月27日、InstructGPTがデフォルトのAPIモデルとなり、指示の追従を改善し、捏造された事実を削減した。
ライセンスと影響
2020年9月22日、MicrosoftはGPT-3の基盤モデルに対する独占ライセンスを発表した。他のユーザーは公開APIを使用できたが、コードと重みにアクセスできるのはMicrosoftのみだった。GPT-3は、人間の文章と区別が難しいニュース記事を生成する可能性を示し、誤情報や詐欺に関する懸念を引き起こした。研究者らは、スパムや法的悪用を含む潜在的な有害な影響を説明した。