英語からの翻訳

LAION-5Bは、2022年に非営利団体LAIONによって公開された、58.5億組の画像とテキストのペアからなる大規模なオープンデータセットである。Stable Diffusionなどの生成モデルのトレーニングに広く使用されている。

LAION-5Bは、非営利団体LAION(大規模人工知能オープンネットワーク)によって作成された、58.5億組の画像とテキストのペアからなる大規模なオープンデータセットです。2022年に公開され、この種のデータセットとしては最大級の公開データの一つであり、Stable Diffusionなどの生成モデルの訓練に広く使用されています。これは、人工知能機械学習の分野における重要なリソースです。

歴史と作成

LAION-5Bの前身は、2021年8月に公開された4億組の画像とテキストのペアからなるデータセット、LAION-400Mです。より大規模なLAION-5Bは、数十億のウェブページをアーカイブするCommon Crawlウェブコーパスをクロールして構築されました。チームは、OpenAIが開発したCLIPモデルを使用して、画像とそれに関連する代替テキストまたはキャプションの埋め込みを計算しました。画像とテキストの埋め込み間のコサイン類似度が高いペアが保持され、低品質または不一致のペアは破棄されました。結果として得られたデータセットは、2022年10月に「LAION-5B: An open large-scale dataset for training next generation image-text models」という論文で公開されました。作成プロセスは、深層学習ニューラルネットワークの技術、特にCLIPで使用されるトランスフォーマーアーキテクチャに依存していました。

構成とサブセット

LAION-5Bは、LAION-2B-en(23.2億組の英語ペア)、LAION-2B-multi(22.7億組の多言語ペア)、LAION-1B-nolang(12.6億組の言語フィルタリングなしペア)の3つのサブセットで構成されています。このデータセットは画像を直接保存するのではなく、画像URL、代替テキスト、寸法、類似度スコアなどのメタデータを提供します。この設計により、研究者はオンデマンドで画像をダウンロードできますが、時間の経過とともに一部のURLがアクセス不能になる可能性もあります。サブセットは、大規模言語モデルやマルチモーダルシステムに関連する多言語および言語横断学習の研究を支援するように編成されています。

応用

LAION-5Bは、さまざまな生成AIモデルの訓練に使用されています。最も注目すべき例は、2022年8月にStability AIが公開したテキストから画像を生成するモデル、Stable Diffusionです。Stable Diffusionは、U-Netクロスアテンション層を備えた潜在拡散アーキテクチャを使用して、テキストプロンプトから画像を生成します。このモデルはLAION-5Bのサブセットで訓練され、オープンデータとオープンソースの手法で高品質な画像生成が達成できることを実証しました。LAION-5Bは、画像テキストモデル、対照モデル、その他のマルチモーダルシステムの訓練にも使用されています。これは、大規模データでのそのようなモデルの性能を評価するためのベンチマークとして機能します。このデータセットの規模と多様性は、大量のペアデータから恩恵を受けるマルチヘッドアテンションベースのアーキテクチャにとって特に価値があります。

論争と限界

このデータセットは、プライバシー、著作権、バイアスに関する懸念を引き起こしています。ウェブクロールに由来するため、個人の写真、著作権で保護されたアートワーク、不快または有害なコンテンツが含まれています。LAIONは既知の問題のある素材をフィルタリングしようと試みましたが、データセットの規模が大きいため完全な除去は困難です。2023年には、法的な苦情を受けてデータセットが一時的にオフラインになりましたが、追加のフィルタリングを施して後に復元されました。研究者はまた、このデータセットがウェブに存在するジェンダーや人種のステレオタイプを含むバイアスを反映していると指摘しています。これらの問題は、大規模なウェブスクレイピングデータセットに共通するものであり、活発な研究分野であり続けています。

影響と遺産

LAION-5Bは、オープンソースAIコミュニティの標準的なリソースとなっています。これは、民間企業が保有する独自データセットとは対照的に、ボランティア組織が大規模なデータセットを構築して共有できることを実証しました。このデータセットは、オープンマルチモーダルデータセットを作成するその後の取り組みに影響を与え、生成AIと機械学習の研究の波を可能にしました。その公開はまた、データガバナンスの重要性と責任あるデータセットキュレーションの必要性を浮き彫りにしました。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:datasets·image-text-pairs·multimodal-learning·open-source-ai
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴