## Common Crawl Common Crawlは、ウェブ上の膨大なデータを収集し、公開している非営利団体です。その目的は、インターネット上の情報を誰でも自由に利用できるようにし、研究やイノベーションを促進することです。この団体は、定期的にウェブクロールを実行し、取得したデータを無料で公開しています。データセットは、数十億ものウェブページを含み、テキスト、メタデータ、リンク構造などが含ま

英語からの翻訳

Common Crawlは非営利団体であり、その自由に利用可能で定期的に更新されるウェブクロールデータのアーカイブであり、大規模言語モデルの訓練コーパスの原材料として広く使用されている。

Common Crawlは非営利団体であり、また、定期的に更新され、自由に利用できるペタバイト規模のウェブクロールデータのアーカイブの名称でもある。このアーカイブは、数十億のウェブページを体系的にクロールし、生のHTML、抽出されたテキスト、メタデータを公開ダウンロード用に公開することで収集される。2007年にGil Elbazによって設立されたCommon Crawlは、現代の大規模言語モデルの時代より10年以上先行しているが、そのアーカイブは、2010年代後半から2020年代にかけて研究者がウェブ規模のデータで大規模テキストモデルを訓練し始めると、LLMの事前学習にとって最も重要な原材料の一つとなった。

Common Crawlはおおむね毎月新しいクロールを公開しており、2020年代半ばまでにその累積アーカイブは数千億のウェブページに及んだ。これにより、ライセンス取得済みおよびキュレーションされたデータセットと並んで、AI訓練に利用可能な生テキストの最大の単一ソースの一つとなった。

歴史と運営

Common Crawlは、従来は主に大手検索エンジン企業だけが利用できたウェブ規模のデータへのアクセスを民主化するという表明された使命のもと、非営利団体として設立された。これにより、研究者、スタートアップ、独立系開発者に、GoogleやMicrosoftが社内でクロールできるものに匹敵する規模のリソースを提供している。この組織は、長年にわたり多くのテクノロジー企業や財団から資金と支援を受けている。そのクローラーは、robots.txtやその他の標準的なクロール慣行に従い、公開ウェブ上のリンクをほぼ無差別に辿る。つまり、生のアーカイブには、価値の高い参考資料からスパム、マーケティング文書、最近のクロールでは低品質のAI生成コンテンツまで、非常に幅広い品質のコンテンツが含まれる。

AI訓練における役割

Common Crawlの生のアーカイブはフィルタリングされておらず、非常に不均一であるため、ほとんどのAI研究所は直接訓練に使用せず、その上に派生したフィルタリング済みデータセットを構築する。よく知られた例としては、GoogleのT5モデルの訓練に使用されたC4データセット、GPT-2GPT-3などの初期GPTモデルの基盤となったデータセット、そして2020年代にHugging Face関連およびその他の研究グループがオープンな基盤モデル訓練用に公開した、フィルタリングおよび重複排除されたCommon Crawl派生データセットであるRefinedWebやFineWebが挙げられる。これらの派生データセットは、重複排除、言語識別、Wikipediaなどのキュレーションされた参照テキストを模倣するように訓練された品質分類器、毒性やスパムのフィルタリングなどの手順を適用し、通常は元のクロールページのごく一部のみを保持する。

批判と論争

Common Crawlが商業AI訓練への基盤的インプットとして果たす役割は、2023年以降のAI著作権訴訟のより広い波とともに、ますます厳しい scrutiny の対象となった。アーカイブには、権利保有者の明示的な許可なくスクレイピングされた著作権付きのニュース記事、書籍、その他の資料が含まれており、検索エンジンが長年依存してきたのと同じウェブクロール規範に基づいて収集されたが、新しくより論争の多い用途に適用されたためである。一部の出版社は、2023年以降、自社のコンテンツがAI訓練パイプラインに流れ込むのを防ぐために、robots.txtを介してCommon CrawlのクローラーCCBotをブロックする措置を講じた。これは、AI関連クローラー全般に対する多くのサイトの対応を反映している。Common Crawlは、こうしたオプトアウトに従い、中立的なデータ収集サービスとして運営していると述べ、下流での使用に関する責任は、そのアーカイブから訓練データセットを構築する組織にあると主張している。

重要性

Common Crawlが、独自のウェブインデックスに対する自由でオープンな代替手段として存在し続けることは、EleutherAIAllen Institute for AIなどの組織の研究者を含む研究者らによって、十分な資金を持つ閉鎖的な研究所が独自のプライベートクロールインフラを備え、ますます支配的になる分野において、非商業的かつオープンソースのAI研究を存続可能にするために重要であると指摘されている。

カテゴリ:datasets·infrastructure
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴