英語からの翻訳

LAION-400Mは、LAION非営利団体によって作成された、4億組の画像とテキストのペアからなる大規模なオープンデータセットであり、マルチモーダルAIモデルのオープンな研究とトレーニングを可能にするために作られました。2021年に公開され、視覚言語モデルのトレーニングに広く使用されています。

LAION-400Mは、LAION非営利組織がキュレーションした、4億組の画像とテキストのペアからなる大規模なオープンデータセットである。2021年8月に公開され、人工知能におけるオープンな研究と開発、特に視覚情報とテキスト情報を整合させるマルチモーダルモデルの訓練を促進するために設計された。このデータセットは、その規模、アクセス可能性、そして以前は大企業のみが利用できたデータへのアクセスを民主化する役割で注目されている。

このデータセットは、公開ウェブページをクロールして画像と代替テキストのペアを抽出し、その後、低品質または不一致のペアを除去するフィルタリングプロセスを経て構築された。このアプローチは、OpenAIのCLIPの背後にあるような独自データセットで使用される方法論を反映しているが、完全にオープンなライセンスを備えている。LAION-400Mは、その後の多くのAIプロジェクト、特に人気のあるテキストから画像へのモデルであるStable Diffusionの訓練を含む、基礎的なリソースとして機能している。

構成とキュレーション

LAION-400Mは、ウェブクロールから取得された正確に4億組の画像とテキストのペアを含む。キュレーションパイプラインにはいくつかのステップが含まれる。まず、公開ウェブページから画像とそれに関連する代替テキストまたはキャプションが収集される。次に、事前訓練されたCLIPモデル(具体的にはOpenAIのViT-B/32)を使用したフィルタリングプロセスが適用され、各画像とそのテキスト間の類似度がスコアリングされる。類似度スコアが低いペアは破棄され、残ったデータが視覚コンテンツとテキスト記述の間に合理的な整合性を持つことが保証される。

さらに、データセットには、元のURL、画像寸法、テキスト長などのメタデータが含まれており、これらは下流タスクに有用である。フィルタリングはまた、重複する画像とテキストを除去し、冗長性を低減する。最終的なデータセットは、Parquetファイルと画像URLのセットとして配布され、ユーザーが自分で画像をダウンロードできるようにしている。これにより、データセットのサイズを管理可能に保ちながら、完全なコンテンツを保持している。

AI研究における重要性

LAION-400Mの公開は、オープンなAI研究における転換点となった。その利用可能性以前は、大規模な視覚言語モデルを訓練するには、OpenAIGoogle DeepMindなどの企業が保有することが多かった独自データセットへのアクセスが必要だった。LAION-400Mは公開の代替手段を提供し、学術機関や独立した研究者が規模を持ってモデルを実験することを可能にした。これは何百もの論文で引用され、Stable DiffusionやさまざまなCLIPバリアントを含む、いくつかの影響力のあるモデルの訓練における主要な構成要素となっている。

このデータセットはまた、データガバナンス、ライセンス、およびウェブスクレイピングデータの使用に関する倫理的影響についての議論を促進した。画像は公開されているが、その著作権状態はさまざまであり、LAIONは潜在的な著作権侵害について scrutinized されてきた。これに対応して、LAIONはデータセットが画像自体ではなくURLとメタデータのコレクションであることを強調し、コンテンツ削除のためのツールを提供している。

技術仕様

LAION-400Mは、各ペアの一意の識別子、画像URL、テキストキャプション、および幅、高さ、類似度スコアなどの追加メタデータを含む形式で保存されている。データセットは、効率的なダウンロードと処理のために複数のシャードに分割されている。ユーザーは通常、メタデータファイルをダウンロードし、必要に応じて画像を取得する。これにより、柔軟なストレージと帯域幅管理が可能になる。

訓練には、データセットはPyTorchやTensorFlowなどのフレームワークでよく使用され、標準のデータローダーと互換性がある。テキストは英語であり、画像は自然シーンから抽象芸術まで幅広いカテゴリをカバーしている。平均画像解像度は約400x400ピクセルだが、これは大きく変動する。

影響と遺産

LAION-400Mは、機械学習の分野に永続的な影響を与えてきた。これは、以前はクローズドシステムが支配的だったオープンソースのテキストから画像への生成の開発を可能にした。このデータで訓練されたモデルの成功は、独自データセットなしでも高品質の結果を達成できることを実証し、さらなるオープンデータイニシアチブを促進した。また、5億組のペアを含むLAION-5Bなど、より大規模な後継データセットの作成にもつながった。

このデータセットは、画像生成以外にも、画像分類、視覚的質問応答、クロスモーダル検索など、さまざまなアプリケーションで使用されている。その利用可能性はまた、研究者がデータを分析してモデルが何を学習するかを理解できるため、モデルの解釈可能性とバイアスに関する研究を促進した。

論争と倫理的考慮事項

LAION-400Mの使用は、同意と著作権に関する倫理的な疑問を提起している。データセット内の多くの画像は、個人のブログ、ソーシャルメディア、およびその他のウェブサイトから明示的な許可なしにスクレイピングされている。データセットは研究用に意図されているが、商業製品で使用されており、法的な課題につながっている。2023年には、複数のアーティストが、そのようなデータで訓練されたモデルを使用する企業に対して、作品の無断使用を理由に訴訟を起こした。

LAIONは、個人がデータセットから自分の画像の削除を要求するメカニズムを提供し、データセットが研究アーティファクトであることを強調することで対応している。しかし、議論は続いており、AI時代におけるオープンアクセスと個人の権利の間の緊張を浮き彫りにしている。

将来の方向性

2025年現在、LAION-400Mは広く使用されているリソースであり続けているが、キュレーションと倫理的保護が改善された新しいデータセットによってますます補完されている。その作成から得られた教訓は、有害なコンテンツのより良いフィルタリングや明確なライセンスなど、より責任あるデータ収集慣行の開発に情報を提供している。このデータセットの遺産は、AIイノベーションを加速するオープンデータの力の証であると同時に、ウェブ規模のデータ収集の複雑さについての警告の物語としても機能している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·vision-language·open-source·multimodal
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴