GPT-2のリリース

英語からの翻訳

GPT-2は、OpenAIによる大規模言語モデルであり、2019年に公開された。高度なテキスト生成能力と、悪意のある使用への懸念から当初は制限が設けられたことで知られ、AI開発における転換点となった。

GPT-2(Generative Pre-trained Transformer 2)は、OpenAIによって開発された大規模言語モデルであり、2019年2月14日に発表された。これはOpenAIの基盤となるGPTシリーズにおける2番目のモデルであり、GPT-1の後継、GPT-3の前身にあたる。GPT-2は800万のウェブページからなるデータセットで事前学習され、一貫性があり文脈に関連したテキストを生成する能力は、生成AIにおける重要な進歩と見なされた。このモデルは当初、部分的なリリースの際に公開が保留され、完全版である15億パラメータ版が利用可能になったのは2019年11月5日のことであった。言語翻訳、質問応答、文章要約の能力を持つため、研究者や評論家は、スパム生成やフェイクニュース作成などの悪用と有益な用途の両方の可能性を強調した。

アーキテクチャ

前身のGPT-1や後継モデルと同様に、GPT-2は深層学習トランスフォーマーアーキテクチャを使用している。これは、アテンションとして知られるメカニズムを実装するニューラルネットワークの一種である。このアテンションメカニズムは、系列変換を伴うタスクのパフォーマンスを向上させることが示されている。再帰や畳み込みに基づく古いモデルとは異なり、トランスフォーマーのアテンションメカニズムにより、モデルは入力テキストを並列に処理でき、トレーニングと推論の速度を大幅に向上させることができる。モデルのアーキテクチャはGPT-1のスケールアップ版とされ、パラメータ数(15億)とトレーニングデータサイズが10倍に増加した。専用ハードウェアで実現されたこの並列化により、従来よりも大規模なコーパスでのトレーニングが可能となり、一般的な機械学習タスクを処理する能力に貢献した。

トレーニング

GPT-2はWebTextでトレーニングされた。これは、2017年12月以前に少なくとも3カルマを獲得したReddit上のアウトバウンドリンクから収集された100ギガバイト以上のテキストからなるコーパスである。Redditは人間がキュレーションしたコンテンツの代理として使用され、低品質のページを除外した。HTMLはプレーンテキストに解析され、重複リンクは削除され、Wikipediaのページは過学習を防ぐためにトレーニングセットから除外された。これらの記事は他の多くのデータセットに頻繁に登場するためである。CommonCrawlは、その規模にもかかわらず、理解不能なコンテンツが大量に含まれていたため、採用されなかった。GPT-2のトレーニングインフラは32個のTPU v3チップを168時間使用し、当時プロジェクトに関わっていた研究者アンドレイ・カーパシーによると、計算コストは約43,000ドルであった。これは、トランスフォーマーの効率性により、同規模のモデルとしては比較的低コストであった。その結果、生成されるテキストは、人間の出力と区別がつかないこともあるレベルに達したが、長い文章では繰り返しや無意味な内容になることがあり、これは将来の大規模言語モデルが改善を目指す限界であった。

部分的なリリース

OpenAIが完全なモデルを直ちに公開しないという初期の決定は、モデルがスパム生成や偽情報などの悪意のある目的に使用される可能性があるという懸念に基づいていた。同社は2019年8月20日に、元のモデルの約半分のサイズである7億7400万パラメータの部分版(774Mリリースとしても知られる)を公開した。この部分的なリリースは、悪用を軽減しながら研究者がモデルの動作を理解できるようにするためであった。OpenAIのこのアプローチは、アニマ・アナンドクマーを含む一部の研究者から反発を招き、脅威は誇張されていると主張された。一方で、モデルがソーシャルメディアを区別不能な散文で埋め尽くす可能性があると主張する者もおり、アレン人工知能研究所はこれに対応してニューラルフェイクニュース検出器を構築した。

2019年2月のThe Vergeの記事で、ジェームズ・ヴィンセントは、GPT-2の出力はしばしば明らかに人間的ではないが、それでも言語生成AIの「最もエキサイティングな例の1つ」であると書いた。この記事は、偽の見出しを与えると、モデルが偽の引用や統計を使って記事の残りを書き、適切なプロンプトを与えればフィクションさえ書けることを示した。Voxのケルシー・パイパーは、「これまで見た中で最もクールなAIシステムの1つが、私を追い出すかもしれない」と書いたが、その出力を中立的な視点で説明した。The Guardianはそのテキストを「もっともらしい新聞の散文」と評した。

部分的なリリースにもかかわらず、OpenAIは完全なモデルのコードとコーパスを保持した。これにより、さまざまな第三者の成果が生まれた。2019年8月には、フリーソフトウェアの複製であるOpenGPT-2がOpenWebTextを使用して作成され、計算コストは約50,000ドルかかった。これは、モデルの初期リリース後に続いたオープンな研究開発を示している。

倫理的および社会的影響

GPT-2の完全なリリースを遅らせる決定は、人工知能技術のリスクと利点に関する公開討論を引き起こした。一部の研究者は、脅威は軽減可能であるとして認識される危険性を軽視したが、他の研究者は、本物の人間の声をかき消す可能性のある合成テキストの洪水が来ると警告した。さらに、肯定的または否定的な製品レビューを生成するための微調整モデルの部分的なリリースもあり、スパムの可能性を示すデモンストレーションとなった。誇大広告とオープンな方針への対応として、研究者グループは完全なリリースを求める公開書簡を発表し、言語モデルは脅威として誇張されていると述べ、Photoshopや印刷機などの技術が悪用されつつも日常生活に統合されてきたことを挙げた。

リリース保留の長期的な影響は、大規模言語モデルとその能力に対する一般の認識を高めたことである。GPT-2は最終的に人工知能の安全性に焦点を当てた研究の中心となり、その後のオープンソースモデルに影響を与えた。その後、GPT-3とGPT-4に取って代わられ、2024年時点では、もはやオープンソースではないGPT-3とGPT-4がより顕著になっている。この出来事は、強力なAIシステムを開発する際に透明性と予防措置のバランスを取る方法を考慮する上での重要なポイントとなった。

遺産

GPT-2は深層学習の分野における重要な発展を表し、その後の言語モデルのベンチマークとなった。タスク固有のデータに依存せず、シーケンス内の次の項目の予測に依存する汎用学習者として機能する能力は、後のトランスフォーマーにとって基本的なステップであった。モデルのパラメータ数とトレーニングコーパスのサイズは、ニューラルネットワークモデルのスケーリングへの道を確立した。その結果、生成AIの計算需要は増加し、GPT-2は人工知能の歴史におけるマイルストーンと見なされている。そのトレーニング原則は、多くの分野で大規模言語モデルの開発とアーキテクチャに影響を与え続けており、モデルは創発と機械学習を理解するためのよく研究された参照点となっている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:language-model·open-ai·artificial-intelligence·2019-releases
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴