GPT-3の登場(2020年)

英語からの翻訳

GPT-3は、2020年にOpenAIが公開した大規模言語モデルであり、1750億のパラメータを持ち、その強力な少数ショット学習とテキスト生成能力で知られている。これは生成AIにおける重要な節目となり、広範なAPIアクセスと商用ライセンス供与につながった。

Generative Pre-trained Transformer 3(GPT-3)は、大規模言語モデルであり、OpenAIが2020年に同社のGPTシリーズの一部として公開した。これは深層学習のデコーダーのみのトランスフォーマーモデルであり、再帰型や畳み込みベースのアーキテクチャに代わり、モデルが関連する入力テキストに選択的に焦点を当てることを可能にするアテンション機構を採用している。GPT-3は1750億のパラメータを持ち、各パラメータは16ビット精度で、350GBのストレージを必要とする。コンテキストウィンドウは2,048トークンであり、多くのタスクで強力なゼロショットおよびフューショット学習能力を示した。

背景

The Economistによると、改良されたアルゴリズム、より強力なコンピュータ、そして増加したデジタル化された資料が機械学習の革命を促進した。2010年代の新しい技術は、言語操作タスクの急速な改善につながった。ソフトウェアモデルは、脳の神経アーキテクチャに緩く基づいた構造で、数千または数百万の例を使用して訓練される。重要なアーキテクチャは2017年に導入されたトランスフォーマーであり、これは自然言語処理システムの中心となった。

2018年6月11日、OpenAIの研究者は、多様なテキストコーパスで事前訓練された生成的大規模言語モデルの一種である最初の生成的事前訓練トランスフォーマー(GPT)を紹介する論文を発表し、その後、識別的な微調整を行った。GPT-1に続いて2019年2月にGPT-2が登場し、パラメータとデータセットサイズを10倍に拡大し、800万のウェブページで訓練された15億のパラメータに達した。2020年2月、Microsoftは170億のパラメータを持つTuring Natural Language Generation(T-NLG)を導入し、これは当時公開された最大の言語モデルであった。

訓練と能力

2020年5月28日、31人のOpenAIエンジニアと研究者によるarXivプレプリントがGPT-3を説明した。これは第三世代の最先端言語モデルである。チームはGPT-2から容量を2桁以上増やし、GPT-3を当時最大の非スパース言語モデルにした。その精度は、容量とパラメータの増加に起因し、MicrosoftのTuring NLGの10倍の大きさである。Lambdalabsは、2020年に単一GPUで訓練する場合の仮想的なコストを約460万ドルと355年と推定し、並列GPUを使用した場合の実際の時間はより短かった。

重み付き事前訓練データセットの60%は、Apache SparkのMinHashLSHを使用したファジー重複排除を備えた、4100億のバイトペアエンコードトークンを含むCommon Crawlのフィルタリング版から来た。他のソースには、WebText2(190億トークン、22%)、Books1(120億トークン、8%)、Books2(550億トークン、8%)、およびWikipedia(30億トークン、3%)が含まれた。GPT-3は数千億の単語で訓練され、CSS、JSX、およびPythonでコーディングできた。

訓練データが包括的であったため、GPT-3は異なるタスクに対してさらなる訓練を必要としない。しかし、訓練データを模倣した有害な言語を時折生成することがある。ワシントン大学の研究では、GPT-3がGPT-2およびCTRLと同等の有害な言語を生成することがわかった。OpenAIは有害性を制限する戦略を実装し、その結果、GPT-1よりも有害な出力が少なく、CTRL Wikiよりも多かった。

APIとアクセス

2020年6月11日、OpenAIはユーザーがGPT-3 APIへのアクセスをリクエストできると発表した。これは、汎用のテキスト入力・テキスト出力インターフェースを備えた機械学習ツールセットである。初期のユーザーの一人は、簡単なプロンプトで一貫したテキストを書くのが不気味なほど得意だと述べた。実験では、80人の米国の被験者が短い記事を人間またはGPT-3が書いたものと判断し、正解率はわずか52%で、ランダムよりわずかに良かった。

2020年9月22日、MicrosoftはGPT-3を独占的にライセンスしたと発表した。他のユーザーは公開APIから出力を受け取ることはできたが、基盤となるモデルにアクセスできるのはMicrosoftのみであった。2021年11月18日、OpenAIはコンテンツモデレーションツールを備えた無制限のAPIアクセスを発表した。2022年1月27日、OpenAIはInstructGPTをデフォルトモデルにし、これは指示に従い、捏造された事実を生成する頻度が低かった。

影響と懸念

GPT-3は、人間の評価者が人間が書いたものと区別するのに苦労するニュース記事を生成でき、有益な用途と有害な用途の両方の可能性がある。2020年5月の論文は、誤情報、スパム、フィッシング、および法的・政府的プロセスの悪用を含む潜在的な害を詳述した。モデルの公開は生成的AIのさらなる発展を促進し、AnthropicGoogle DeepMindのその後のモデルに影響を与えた。そのアーキテクチャと訓練アプローチは後の大規模言語モデルの基盤となり、そのAPIモデルはAzureAmazon Web Services上の商業AIサービスに影響を与えた。

遺産

GPT-3は、大規模言語モデルに対する一般の認識における転換点を示し、トランスフォーマーモデルのスケールアップが創発的な能力をもたらすことを実証した。その1750億パラメータの規模はベンチマークを設定したが、後のモデルはそれを超えることになる。Microsoftへの独占ライセンスは、そのようなモデルの商業的価値を強調した。GPT-3のフューショット学習能力は、タスク固有の微調整の必要性を減らし、RLHFや指示追従の研究に影響を与えた。その公開はまた、AIの安全性、バイアス、および大規模モデルの訓練の環境コストに関する議論を引き起こした。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:large-language-model·openai·generative-ai·machine-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴