Aus dem Englischen übersetzt

LAION (Large-scale Artificial Intelligence Open Network) ist eine deutsche gemeinnützige Organisation, die Open-Source-KI-Modelle und Datensätze erstellt und vor allem für ihre großen Bild-Text-Datensätze bekannt ist, die zum Trainieren von Modellen wie Stable Diffusion verwendet werden.

LAION (Akronym für Large-scale Artificial Intelligence Open Network) ist eine deutsche gemeinnützige Organisation, die Open-Source-Modelle und Datensätze für künstliche Intelligenz entwickelt. Sie ist vor allem für die Veröffentlichung mehrerer großer Datensätze von Bildern und Bildunterschriften bekannt, die aus dem Internet gesammelt wurden und zum Training einer Reihe prominenter Text-zu-Bild-Modelle verwendet wurden, darunter Stable Diffusion und Imagen. Die Organisation verfolgt das Ziel, den Zugang zu KI-Ressourcen zu demokratisieren und Forschern sowie Entwicklern frei verfügbare Daten und Werkzeuge bereitzustellen.

Die Arbeit von LAION ist im weiteren Feld der künstlichen Intelligenz und des maschinellen Lernens angesiedelt und konzentriert sich auf die Erstellung großer Datensätze, die das Training anspruchsvoller Modelle ermöglichen. Ihre Datensätze sind zu grundlegenden Ressourcen für die Forschung im Bereich generativer KI geworden, insbesondere im Bereich der Text-zu-Bild-Synthese.

Geschichte und Gründung

LAION wurde in Deutschland als gemeinnützige Organisation gegründet, um offene Forschung und Entwicklung im Bereich der künstlichen Intelligenz zu fördern. Das genaue Gründungsdatum ist nicht weit verbreitet dokumentiert, aber die Organisation erlangte 2021 mit der Veröffentlichung ihres ersten großen Datensatzes Bekanntheit. Die Gründer, eine Gruppe von KI-Forschern und -Enthusiasten, wollten den Mangel an öffentlich verfügbaren großen Datensätzen für das Training von Modellen wie OpenAIs CLIP beheben, das mit Code und Gewichten, aber nicht mit seinen Trainingsdaten veröffentlicht worden war.

Die Organisation arbeitet mit einem auf Freiwilligen basierenden Modell und ist auf Beiträge aus der KI-Community angewiesen. Ihre Projekte werden oft durch Partnerschaften und Spenden von Unternehmen und Einzelpersonen finanziert, die ihre Mission des offenen Zugangs teilen.

Bilddatensätze

LAION hat mehrere große Datensätze von Bild-Text-Paaren öffentlich veröffentlicht, die von KI-Forschern weit verbreitet genutzt werden. Die Daten stammen aus dem Common Crawl, einem Datensatz gesammelter Webseiten. Die Entwickler durchsuchten das gecrawlte HTML nach <img>-Tags und behandelten deren Alt-Attribute als Bildunterschriften. Sie verwendeten CLIP, um Bilder zu identifizieren und zu verwerfen, deren Inhalt nicht zu ihren Bildunterschriften zu passen schien. LAION hostet den Inhalt der gesammelten Bilder nicht selbst; vielmehr enthält der Datensatz URLs, die auf Bilder verweisen, die Forscher selbst herunterladen müssen.

Der erste solche Datensatz, LAION-400M, wurde im August 2021 veröffentlicht und bestand aus 400 Millionen Bild-Text-Paaren. Die Paare wurden aus einer zufälligen Teilmenge von Webseiten extrahiert, die von Common Crawl zwischen 2014 und 2021 gesammelt wurden. Es war ein Versuch, den Prozess zu reproduzieren, den OpenAI zur Sammlung der 400 Millionen Bild-Text-Paare verwendet hatte, die zum Training des CLIP-Modells dienten - das Unternehmen hatte sich entschieden, den Code und die Gewichte des Modells als Open Source bereitzustellen, nicht jedoch seinen Trainingsdatensatz. Imagen, ein Text-zu-Bild-Modell, das 2022 von Google Brain angekündigt wurde, wurde auf LAION-400M in Kombination mit privaten internen Datensätzen trainiert.

Ein Nachfolger mit mehr als 5 Milliarden Paaren, LAION-5B, wurde im März 2022 veröffentlicht. Zum Zeitpunkt seiner Veröffentlichung war es der größte frei verfügbare Datensatz von Bild-Text-Paaren, der existierte. Seine Erstellung wurde von Doodlebot, Hugging Face und Stability AI finanziert, dem KI-Unternehmen hinter der Finanzierung des Stable-Diffusion-Text-zu-Bild-Modells, das darauf trainiert wurde.

OpenAssistant

OpenAssistant war ein auf künstlicher Intelligenz (KI) basierender Open-Source-Chat-Assistent, der Aufgaben verstehen, mit Drittsystemen interagieren und Informationen dynamisch abrufen konnte, um dies zu tun. Das Projekt wurde von einer Gruppe von Freiwilligen in Zusammenarbeit mit LAION entwickelt. Zu den Entwicklungszielen gehörte der freie Zugang zu großen Sprachmodellen, die lokal auf Verbraucherhardware ausgeführt werden können. Das Projekt wurde durch eine weltweite Crowdsourcing-Initiative unterstützt, an der über 13.500 Freiwillige beteiligt waren, die 600.000 von Menschen erzeugte Datenpunkte erstellt haben. Das Projekt wurde inzwischen eingestellt; die Datensätze und Modelle bleiben jedoch auf Hugging Face verfügbar.

Rechtliche und ethische Fragen

Im Februar 2023 wurde LAION in der Klage von Getty Images gegen Stable Diffusion als nicht beteiligte Partei genannt. Im April 2023 wurde LAION direkt von einem deutschen Fotografen verklagt, der seine Bilder aus dem Trainingssatz entfernt haben wollte. Im September 2024 wies das Landgericht Hamburg die Klage ab, was als „bahnbrechendes Urteil zu TDM-Ausnahmen [Text- und Data-Mining] für KI-Trainingsdaten“ in Deutschland und der EU allgemein beschrieben wurde.

Kritik und Kontroversen

Mehrere Studien zeigen, dass die Bilder in LAION-5B problematische Bilder und Textpaare von Vergewaltigung, Pornografie, bösartigen Stereotypen, rassistischen und ethnischen Beleidigungen sowie anderen äußerst problematischen Inhalten enthalten.

Eine Untersuchung des Bayerischen Rundfunks zeigte, dass LAIONs Datensätze, die auf Hugging Face gehostet werden, große Mengen privater und sensibler Daten enthalten, die von öffentlichen Websites gesammelt wurden.

Im Dezember 2023 veröffentlichte das Stanford Internet Observatory einen Bericht über LAION-5B, der 3.226 mutmaßliche Fälle von Links zu Material über sexuellen Kindesmissbrauch fand, von denen 1.008 extern validiert wurden. Als Reaktion darauf entfernte LAION vorübergehend LAION-5B und LAION-400M und berief sich auf seine „Null-Toleranz-Politik gegenüber illegalen Inhalten“ und „aus größter Vorsicht“. Im August 2024 veröffentlichte LAION einen bereinigten Datensatz namens Re-LAION-5B.

Auswirkungen und Vermächtnis

LAIONs Datensätze haben erhebliche Auswirkungen auf das Feld der KI gehabt und es Forschern ermöglicht, Modelle ohne proprietäre Daten zu trainieren. Die Veröffentlichung von LAION-400M und LAION-5B hat Innovationen in der Text-zu-Bild-Generierung angeregt, wobei Modelle wie Stable Diffusion sowohl in der Forschung als auch in kommerziellen Anwendungen weit verbreitet sind. Das Engagement der Organisation für Open Source hat auch andere Initiativen beeinflusst, wie die Entwicklung von Open-Source-Großsprachmodellen.

Trotz der Kontroversen bleibt LAION ein wichtiger Akteur im offenen KI-Ökosystem und stellt Ressourcen bereit, die für die Weiterentwicklung des Stands der Technik unerlässlich sind. Sein rechtlicher Sieg in Deutschland hat einen Präzedenzfall für die Nutzung von Web-Scraping-Daten im KI-Training geschaffen, was breitere Auswirkungen auf die Branche haben könnte.

Zukunftsrichtungen

Ab 2025 arbeitet LAION weiterhin an neuen Datensätzen und Modellen, mit einem Fokus auf die Verbesserung der Datenqualität und die Bewältigung ethischer Bedenken. Die Organisation ist auch an Diskussionen über KI-Regulierung und den verantwortungsvollen Umgang mit Daten beteiligt. Ihre laufenden Projekte zielen darauf ab, den Bedarf an großen Datenmengen mit dem Schutz individueller Rechte und der Verhinderung schädlicher Inhalte in Einklang zu bringen.

LAIONs Rolle in der KI-Community bleibt entscheidend, da sie einen Gegenpol zu den proprietären Ansätzen großer Technologieunternehmen wie OpenAI, Anthropic und Google DeepMind bietet. Durch die Bereitstellung offener Alternativen trägt LAION dazu bei, dass die KI-Entwicklung zugänglich und transparent bleibt.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·open-source·non-profit·datasets
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte