GPT-2(Generative Pre-trained Transformer 2)は、OpenAIによって開発されたLarge language modelであり、同社の基礎的なGPTシリーズにおける2番目の反復を表す。これは800万のウェブページからなるデータセットで事前学習され、テキスト生成、翻訳、要約、および質問応答において顕著な進歩を示した。このモデルは、潜在的な悪用への懸念から当初は一般公開が差し控えられたが、最終的には2019年11月に完全に公開された。
GPT-2は、その前身であるGPT-1の直接的なスケールアップであり、パラメータ数とトレーニングデータセットのサイズの両方が10倍に増加している。これはTransformer (architecture)アーキテクチャを採用しており、注意機構を使用して入力テキストの関連部分に選択的に焦点を当てることで、より大きな並列化を可能にし、以前のRNN/CNN/LSTMベースのモデルを上回る性能を発揮した。その汎用学習能力により、シーケンス内の次の項目を正確に予測することで様々なタスクを実行できたが、長い文章では繰り返しや無意味な出力になることがあった。GPT-2は、その後、GPT-3やGPT-4などの後続モデルに取って代わられ、これらはもはやオープンソースではない。
トレーニングとアーキテクチャ
GPT-2のトレーニングは、トランスフォーマーアーキテクチャの大規模な並列化能力を活用し、以前の自然言語処理モデルよりも大規模なコーパスでトレーニングすることを可能にした。OpenAIは当初、大規模なウェブクロールコーパスであるCommonCrawlを検討したが、理解不能なコンテンツのために却下した。代わりに、WebTextと呼ばれる新しいコーパスを開発した。これは、2017年12月以前に少なくとも3カルマを獲得したRedditの投稿からリンクされたページをスクレイピングして作成されたものである。このコーパスは、HTMLをプレーンテキストに解析し、重複を除去し、過学習を避けるためにWikipediaのページを除外することでクリーンアップされた。
GPT-2のトレーニングコストは、Andrej Karpathyの声明に基づき、32個のTPU v3チップを168時間使用し、チップあたり毎時約8ドルで、約43,000ドルと推定されている。他の情報源では、毎時約256ドルのコストが引用されている。比較すると、BERTとXLNetのトレーニングにはそれぞれ6,912ドルと245,000ドルがかかった。GPT-2のアーキテクチャは、再帰や畳み込みの代わりに注意機構を実装した、生成的事前学習トランスフォーマーを備えた深いNeural networkである。
リリースと初期の制限
GPT-2は2019年2月14日に発表された。以前のOpenAIモデルとは異なり、悪意のある使用のリスクを理由に、ソースコードはすぐには公開されなかった。限定的なアクセスが選ばれた報道機関に許可され、OpenAIはスパムフィルターを回避するために使用できる製品レビューを生成するように微調整されたバージョンを実演した。Jeremy Howardなどの研究者は、ウェブを説得力のある散文で埋め尽くす可能性を警告し、Allen Institute for Artificial Intelligenceは「ニューラルフェイクニュース」の検出ツールを発表した。
脅威については意見が分かれた。Anima Anandkumarなどは、この制限を「悪意のあるでたらめ」と呼び、The Gradientは印刷機やPhotoshopと技術を比較する公開書簡を発表した。論争にもかかわらず、OpenAIは2019年8月20日に7億7400万パラメータの部分版をリリースし、2019年11月5日に完全な15億パラメータモデルをリリースした。
モデルのバリエーションと複製
GPT-2シリーズには、さまざまなサイズの4つのモデルが含まれており、段階的にリリースされた。最小のモデルは2019年2月に利用可能になり、その後、より大きなモデルが続いた。完全な15億パラメータモデルが最終リリースであった。モデルの手法は出版物で説明されており、他の人が自由ソフトウェアとして複製することを可能にした。そのような複製の1つであるOpenGPT-2は、2019年8月に、WebTextの自由ライセンス版であるOpenWebTextとともに、約50,000ドルの計算コストでリリースされた。
影響と遺産
GPT-2のリリースは、Generative AIにおける重要なマイルストーンを示し、大規模トランスフォーマーの可能性を実証した。その一貫したテキストを生成する能力は、The VergeやThe Guardianなどのメディアによって賞賛されたが、長い文章では繰り返しになることが指摘された。このモデルの当初の差し控えは、AI研究におけるオープンアクセスと安全性に関する議論を引き起こし、責任あるAI開発に関する将来の議論に影響を与えた。GPT-2は、GPT-3とGPT-4によって引き継がれ、これらは分野を前進させ続けたが、オープンソースの利用可能性からは離れた。