Aus dem Englischen übersetzt

LAION-5B ist ein groß angelegter offener Datensatz mit 5,85 Milliarden Bild-Text-Paaren, der 2022 von der gemeinnützigen Organisation LAION veröffentlicht wurde. Er wird häufig zum Trainieren generativer Modelle wie Stable Diffusion verwendet.

LAION-5B ist ein groß angelegter offener Datensatz mit 5,85 Milliarden Bild-Text-Paaren, der von der gemeinnützigen Organisation LAION (Large-scale Artificial Intelligence Open Network) erstellt wurde. Er wurde 2022 veröffentlicht und ist einer der größten öffentlich zugänglichen Datensätze seiner Art. Er wurde häufig zum Trainieren generativer Modelle wie Stable Diffusion verwendet. Er ist eine zentrale Ressource auf dem Gebiet der künstlichen Intelligenz und des maschinellen Lernens.

Geschichte und Entstehung

LAION-5B wurde durch LAION-400M vorbereitet, einen Datensatz mit 400 Millionen Bild-Text-Paaren, der im August 2021 veröffentlicht wurde. Der größere Datensatz LAION-5B wurde durch das Durchsuchen des Common-Crawl-Webkorpus erstellt, der Milliarden von Webseiten archiviert. Das Team verwendete ein CLIP-Modell, das von OpenAI entwickelt wurde, um Einbettungen von Bildern und deren zugehörigem Alt-Text oder Bildunterschriften zu berechnen. Paare mit hoher Kosinus-Ähnlichkeit zwischen Bild- und Texteinbettungen wurden beibehalten, während Paare von geringer Qualität oder mit Nichtübereinstimmung verworfen wurden. Der resultierende Datensatz wurde im Oktober 2022 in einem Papier mit dem Titel „LAION-5B: Ein offener groß angelegter Datensatz zum Trainieren von Bild-Text-Modellen der nächsten Generation“ veröffentlicht. Der Erstellungsprozess stützte sich auf Techniken aus dem Deep Learning und neuronalen Netzen, insbesondere auf die im CLIP verwendete Transformer-Architektur.

Zusammensetzung und Teilmengen

LAION-5B besteht aus drei Teilmengen: LAION-2B-en (2,32 Milliarden englische Paare), LAION-2B-multi (2,27 Milliarden mehrsprachige Paare) und LAION-1B-nolang (1,26 Milliarden Paare ohne Sprachfilterung). Der Datensatz speichert Bilder nicht direkt; stattdessen stellt er Metadaten wie Bild-URLs, Alt-Text, Abmessungen und einen Ähnlichkeitswert bereit. Dieses Design ermöglicht es Forschern, Bilder bei Bedarf herunterzuladen, bedeutet aber auch, dass einige URLs im Laufe der Zeit unzugänglich werden können. Die Teilmengen sind so organisiert, dass sie die Forschung im mehrsprachigen und sprachübergreifenden Lernen unterstützen, was für große Sprachmodelle und multimodale Systeme relevant ist.

Anwendungen

LAION-5B wurde verwendet, um eine Vielzahl von generativer KI-Modellen zu trainieren. Das bekannteste Beispiel ist Stable Diffusion, ein Text-zu-Bild-Modell, das im August 2022 von Stability AI veröffentlicht wurde. Stable Diffusion verwendet eine latente Diffusionsarchitektur mit einem U-Net und Cross-Attention-Schichten, um Bilder aus Textaufforderungen zu erzeugen. Das Modell wurde auf einer Teilmenge von LAION-5B trainiert und zeigte, dass eine hochwertige Bilderzeugung mit offenen Daten und Open-Source-Methoden erreicht werden kann. LAION-5B wurde auch zum Trainieren von Bild-Text-Modellen, kontrastiven Modellen und anderen multimodalen Systemen verwendet. Es dient als Benchmark zur Bewertung der Leistung solcher Modelle auf groß angelegten Daten. Die Größe und Vielfalt des Datensatzes sind besonders wertvoll für Architekturen, die auf Multi-Head-Attention basieren, da diese von großen Mengen gepaarter Daten profitieren.

Kontroversen und Einschränkungen

Der Datensatz hat Bedenken hinsichtlich Datenschutz, Urheberrecht und Verzerrungen aufgeworfen. Da er aus Web-Crawls stammt, enthält er persönliche Fotos, urheberrechtlich geschützte Kunstwerke und potenziell anstößige oder schädliche Inhalte. LAION hat versucht, bekanntes problematisches Material herauszufiltern, aber der schiere Umfang des Datensatzes macht eine vollständige Entfernung schwierig. Im Jahr 2023 wurde der Datensatz nach einer rechtlichen Beschwerde vorübergehend offline genommen, später jedoch mit zusätzlicher Filterung wiederhergestellt. Forscher haben auch festgestellt, dass der Datensatz die im Web vorhandenen Verzerrungen widerspiegelt, einschließlich Geschlechter- und Rassenstereotypen. Diese Probleme sind bei großen, aus dem Web gescrappten Datensätzen üblich und bleiben ein aktives Forschungsgebiet.

Auswirkungen und Vermächtnis

LAION-5B ist zu einer Standardressource in der Open-Source-KI-Community geworden. Er zeigte, dass groß angelegte Datensätze von einer Freiwilligenorganisation aufgebaut und geteilt werden konnten, im Gegensatz zu proprietären Datensätzen, die von privaten Unternehmen gehalten werden. Der Datensatz hat nachfolgende Bemühungen zur Erstellung offener multimodaler Datensätze beeinflusst und eine Welle der Forschung in generativer KI und maschinellem Lernen ermöglicht. Seine Veröffentlichung unterstrich auch die Bedeutung von Datenverwaltung und die Notwendigkeit einer verantwortungsvollen Kuratierung von Datensätzen.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:datasets·image-text-pairs·multimodal-learning·open-source-ai
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte