OpenWebTextは、Redditの投稿から抽出されたウェブページのオープンソースデータセットであり、OpenAIのGPT-2言語モデルの訓練に使用された非公開のWebTextコーパスを再現するために作成された。大規模で多様なテキストコーパスを提供し、大規模言語モデルの訓練と評価に使用される。
背景と動機
OpenWebTextは2019年に、当時それぞれメリーランド大学とジョンズ・ホプキンス大学に所属していた研究者、アーロン・ゴカスランとヴァンヤ・コーエンによって発表された。その動機は、GPT-2の訓練に使用されたWebTextデータセットの完全版をOpenAIが公開しなかったことに由来する。WebTextは、少なくとも3カルマを獲得したRedditの投稿からのアウトバウンドリンクで構成され、合計約40GBのテキストであった。再現性とさらなる研究を可能にするため、ゴカスランとコーエンは、2005年から2018年4月までのReddit投稿からのすべてのアウトバウンドリンクをスクレイピングし、同じカルマ閾値を適用し、英語コンテンツにフィルタリングしてOpenWebTextを作成した。結果として得られたデータセットには800万以上のドキュメントが含まれ、合計で約38GBのテキストとなり、元のWebTextの規模と多様性を密接に反映している。
データセットの特徴
OpenWebTextは、大規模で非構造化されたテキストコーパスである。Wikipediaや書籍などの厳選されたデータセットとは異なり、ニュース記事、ブログ投稿、フォーラムの議論、個人のウェブサイトなど、幅広い文体、トピック、形式を捉えている。この多様性により、汎用言語モデルの訓練に価値がある。データセットはテキストファイルの集合として提供され、各ドキュメントは改行で区切られている。研究コミュニティでは、次単語予測やその他の言語モデリングタスクにおけるモデル性能を評価するためのベンチマークとして一般的に使用されている。しかし、公開ウェブコンテンツに由来するため、重複コンテンツ、低品質なテキスト、オンライン上の言説に存在する潜在的なバイアスなどの問題を引き継いでいる。
言語モデル訓練における使用
OpenWebTextは、自然言語処理(NLP)の分野で広く採用されている。これは、GPT-2の変種やその他のTransformerベースのアーキテクチャを含む、多くのオープンソース言語モデルの標準的な訓練コーパスとして機能する。例えば、Hugging Faceは、ファインチューニングや評価に一般的に使用される前処理済みのOpenWebTextバージョンを提供している。研究者は、GPT-2と比較可能な訓練分布を提供するため、モデル性能をGPT-2と比較するためにしばしばこれを使用する。このデータセットは、データキュレーション、モデルスケーリング、および訓練データがモデルの動作に与える影響に関する研究にも使用されている。その入手可能性により、特に生成AIの文脈において、大規模言語モデル開発における再現可能な研究が促進された。
影響と限界
OpenWebTextは、大規模ウェブコーパスへのアクセスを民主化することで、オープンソースAIコミュニティに大きな影響を与えた。これにより、独自データセットにアクセスできない研究者が、GPT-2と同規模のモデルを訓練および評価できるようになった。しかし、このデータセットには限界がある。厳選されたコーパスほどクリーンではなく、かなりの量の定型文、ナビゲーション要素、その他のノイズが含まれている。さらに、Redditのカルマに基づくスクレイピング手法は、Redditユーザーにアピールするコンテンツを優先する選択バイアスを導入する。データセットには、含まれる多くのウェブページの明示的なライセンス情報も欠けており、著作権に関する懸念が生じている。これらの問題にもかかわらず、OpenWebTextは大規模言語モデルの開発における基礎的なリソースであり続け、学術文献で参照され続けている。
関連データセットと進化
OpenWebTextは、NLPで使用されるウェブ規模のテキストデータセットのより広いエコシステムの一部である。他の注目すべき例としては、ウェブの大規模クロールであるCommon Crawlや、多様なソースの厳選コレクションであるThe Pileが挙げられる。C4(Colossal Clean Crawled Corpus)やRefinedWebなどのより最近のデータセットは、生のウェブクロールに存在するノイズと品質の問題の一部に対処するために開発された。これらの新しいデータセットは、より洗練されたフィルタリングと重複排除技術を採用している。それにもかかわらず、OpenWebTextは、歴史的なベンチマークおよびデータキュレーション手法を評価するためのベースラインとして関連性を維持している。その作成はまた、人工知能の分野におけるオープンデータの重要性を浮き彫りにし、その後の公開用訓練コーパスのリリースへの取り組みに影響を与えた。
関連項目
- 大規模言語モデル
- GPT-2
- Common Crawl
- The Pile
- データキュレーション