OpenAI GPT-3のリリース

英語からの翻訳

GPT-3は、2020年にOpenAIが公開した大規模言語モデルであり、1750億のパラメータを持ち、わずかなプロンプトからテキスト生成やタスク完了を可能にする強力な[[few-shot learning|少数ショット学習]]を備えている。

Generative Pre-trained Transformer 3(GPT-3)は、2020年にOpenAIがGPTシリーズの一部として公開した大規模言語モデルである。これはデコーダーのみのトランスフォーマーモデルであり、深層ニューラルネットワークにおいて、再帰や畳み込みベースのアーキテクチャに代わり、関連する入力テキストへの選択的な焦点を可能にするアテンションメカニズムを採用している。GPT-3は1750億のパラメータを持ち、それぞれが16ビット精度で、350GBのストレージを必要とし、コンテキストウィンドウは2,048トークンであり、多くのタスクで強力なゼロショットおよび少数ショット学習能力を示している。

背景

GPT-3の開発は、改良されたアルゴリズム、より強力なコンピュータ、そして増加したデジタル化データによって推進された、機械学習における広範な革命の一部であった。2017年に導入されたトランスフォーマーアーキテクチャは、自然言語処理(NLP)システムの重要な基盤となった。OpenAIの研究者は2018年6月11日に論文を発表し、最初の生成的プレトレーニング済みトランスフォーマー(GPT-1)を紹介した。これは、大規模なテキストコーパスで事前学習され、特定のタスクに微調整される生成的大規模言語モデルの一種である。2019年2月に公開されたGPT-2は、GPT-1を15億のパラメータにスケールアップし、800万のウェブページで訓練された。2020年2月には、Microsoftが170億のパラメータを持つTuring Natural Language Generation(T-NLG)を導入し、当時最大の言語モデルとなった。

訓練と能力

2020年5月28日、31人のOpenAIエンジニアと研究者によるarXivプレプリントがGPT-3を説明した。これは第三世代の最先端言語モデルである。GPT-3の容量はGPT-2から2桁以上増加し、当時最大の非スパース言語モデルとなった。その精度は、容量とパラメータ数の増加に起因し、MicrosoftのTuring NLGの10倍の大きさである。Lambdalabsは、単一GPUでの仮想的な訓練コストを約460万ドルと355年と推定し、並列GPUを使用した場合の実際の時間はより短いとされた。

事前学習データセットは、60%のフィルタリング済みCommon Crawl(4100億のバイトペアエンコードトークン)、22%のWebText2(190億トークン)、8%のBooks1(120億トークン)、8%のBooks2(550億トークン)、および3%のWikipedia(30億トークン)で構成されていた。ファジー重複排除にはApache SparkのMinHashLSHが使用された。GPT-3は数千億の単語で訓練され、CSS、JSX、Pythonでコーディングできた。

訓練データが包括的であったため、GPT-3は異なるタスクに対して追加の訓練を必要としなかった。しかし、訓練データを模倣するため、時折有害な言語を生成した。ワシントン大学の研究では、GPT-3の毒性はGPT-2やCTRLと同等であると判明した。OpenAIは有害な出力を制限する戦略を実装し、その結果、GPT-1よりも毒性が低く、CTRL Wikiよりも高いものとなった。

2020年6月11日、OpenAIはGPT-3 APIへのアクセスを発表した。これは、あらゆる英語タスク向けのテキスト入力、テキスト出力インターフェースを持つ機械学習ツールセットである。初期のユーザーは、一貫したテキストを書く能力を「不気味なほど優れている」と感じた。実験では、80人の米国の被験者が短い記事を人間またはGPT-3が書いたものと判断し、正しく識別したのはわずか52%で、ランダムよりわずかに優れていた。2021年11月18日、OpenAIはコンテンツモデレーションツールを備えたAPIアクセスを無制限にした。2022年1月27日、InstructGPTモデルがデフォルトとなり、より整合性の高いコンテンツを生成し、作り話の事実や毒性が少なくなった。

GPT-3が人間が書いたものと区別できないニュース記事を生成する能力は、有益な用途と有害な用途の両方の可能性を持ち、誤情報、スパム、フィッシング、法的プロセスの悪用を含む。これは2020年5月28日の論文で詳述されている。

商用ライセンス

2020年9月22日、MicrosoftはGPT-3を独占的にライセンスしたと発表した。他のユーザーは公開APIを引き続き使用できたが、基盤となるモデルにアクセスできるのはMicrosoftのみであった。この独占ライセンスは、投資やAzureサービスへの統合を含む、MicrosoftとOpenAIの広範なパートナーシップの一部であった。

影響と遺産

GPT-3は人工知能の分野に大きな影響を与え、トランスフォーマーモデルのスケーリングの力を実証した。その少数ショット学習能力は、タスク固有の微調整の必要性を減らし、後のInstructGPTGPT-4などのモデルに影響を与えた。公開はまた、バイアス、誤情報、アクセス制御など、大規模言語モデルの倫理的影響に関する議論を引き起こした。

GPT-3のアーキテクチャと訓練アプローチは、AnthropicGoogle DeepMindなどの後の大規模言語モデルのベンチマークとなった。APIとMicrosoftライセンスを通じた商業的成功は、AI研究のビジネスモデルを確立し、より広範な生成的AIの状況に影響を与えた。

技術的詳細

GPT-3は、マルチヘッドアテンションと位置エンコーディングを備えたトランスフォーマーアーキテクチャを使用している。エンコーダー・デコーダーモデルとは異なり、デコーダーのみの設計を採用し、層正規化や残差ネットワークなどの技術を使用している。訓練には、Adamなどのオプティマイザーと学習率スケジュールを用いた勾配降下法が関与した。モデルのパラメータは16ビット精度で保存され、メモリ要件を削減している。

GPT-3のコンテキストウィンドウは2,048トークンであり、処理できる入力の長さを制限するが、複数の段落にわたって一貫したテキストを生成できる。その少数ショット学習は、プロンプティングを通じて達成され、入力に例が提供され、モデルの重みは更新されない。この能力は重要な革新であり、微調整なしで広範な適用可能性を可能にした。

受容と懸念

GPT-3はその印象的なテキスト生成で広く注目を集めたが、潜在的な悪用に関する懸念も引き起こした。研究者は、偽ニュース、スパム、フィッシングコンテンツの生成などのリスクを強調した。OpenAIの初期の制限付きアクセスと後のコンテンツモデレーションツールは、これらのリスクを軽減することを目的とした。改善にもかかわらず、モデルが有害な言語を生成する傾向は懸念事項であり、AIの安全性と整合性に関する継続的な研究につながった。

Microsoftへの独占ライセンスは、他の研究者や企業が基盤となるモデルへのアクセスを制限されたため、物議を醸した。しかし、公開APIはより広範な実験を可能にし、言語モデルアプリケーションの急速な進歩に貢献した。

GPT-3の公開は、人工知能におけるマイルストーンを示し、大規模トランスフォーマーモデルの可能性を実証し、機械学習深層学習の未来を形作った。その影響は、後のモデルや成長する生成的AIの分野に見られる。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·machine-learning·language-model·openai
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴