Aus dem Englischen übersetzt

LAION (Large-scale Artificial Intelligence Open Network) ist eine deutsche gemeinnützige Organisation, die Open-Source-KI-Datensätze und -Modelle erstellt und vor allem für große Bild-Beschriftungs-Datensätze wie LAION-5B bekannt ist, die zum Trainieren von Text-zu-Bild-Modellen wie Stable Diffusion und Imagen verwendet werden.

LAION (Akronym für Large-scale Artificial Intelligence Open Network) ist eine deutsche Non-Profit-Organisation, die Open-Source-KI-Modelle und -Datensätze entwickelt. Sie ist vor allem dafür bekannt, mehrere große Datensätze von aus dem Web gescrapten Bildern und Bildunterschriften zu veröffentlichen, die zum Training einer Reihe prominenter Text-zu-Bild-Modelle verwendet wurden, darunter Stable Diffusion und Imagen. Die Organisation arbeitet als gemeinschaftsgetriebenes Netzwerk aus Freiwilligen und Forschern mit dem Ziel, den Zugang zu KI-Trainingsdaten und -Modellen zu demokratisieren.

Gegründet im Kontext wachsenden Interesses an generativer KI, liegt der Fokus von LAIONs Arbeit auf der Bereitstellung von Alternativen zu proprietären Datensätzen großer KI-Unternehmen. Durch die freie Verfügbarkeit ihrer Datensätze ermöglicht die Organisation Forschenden und kleineren Akteuren die Teilnahme an Maschinenlern-Forschung, ohne auf Unternehmensressourcen angewiesen zu sein. Ihre Aktivitäten haben die Organisation auch ins Zentrum rechtlicher und ethischer Debatten um KI-Trainingsdaten gestellt, insbesondere hinsichtlich Urheberrecht und Inhaltsmoderation.

Geschichte und Gründung

LAION wurde in Deutschland als gemeinnützige Einrichtung gegründet, wobei der Name für Large-scale Artificial Intelligence Open Network steht. Die Initiative entstand aus einer Gemeinschaft von KI-Forschenden und -Enthusiasten, die den Umfang von Datensätzen kommerzieller Labore wie OpenAI zu reproduzieren suchten. Die frühen Bemühungen der Organisation konzentrierten sich auf den Aufbau großer Bild-Text-Datensätze aus öffentlich verfügbaren Webdaten, eine Aufgabe, die erhebliche Rechenressourcen und Koordination freiwilliger Helfer erforderte.

Im August 2021 veröffentlichte LAION ihren ersten großen Datensatz, LAION-400M, mit 400 Millionen Bild-Text-Paaren. Dieser Datensatz wurde aus einer zufälligen Teilmenge von Webseiten abgeleitet, die Common Crawl zwischen 2014 und 2021 gesammelt hatte. Die Veröffentlichung war durch den Wunsch motiviert, den Prozess zu rekonstruieren, mit dem OpenAI die Model für das CLIP-Modell gesammelt hatte, da OpenAI zwar den Code und die Gewichte des Modells, aber nicht seinen Trainingsdatensatz offenlegte. LAION-400M wurde schnell zu einer Ressource für Forschende, die an Deep Learning-Modellen arbeiteten, insbesondere auf dem Gebiet der Text-zu-Bild-Generierung.

Im März 2022 veröffentlichte LAION einen Nachfolger, LAION-5B, der über 5 Milliarden Bild-Text-Paare umfasst. Zum Zeitpunkt der Veröffentlichung war es der größte frei verfügbare Datensatz seiner Art. Die Erstellung von LAION-5B wurde von Doodlebot, Hugging Face und Stability AI finanziert, wobei letzteres Unternehmen hinter dem Text-zu-Bild-Modell Stable Dif Fusion bleibt, das auf diesem Datensatz trainiert wurde. Die Veröffentlichung markierte einen bedeutenden Meilenstein in der offenen KI-Forschung und lieferte eine nie gekannte Datenmenge für das Training von Neuronalen Netzwerken.

Bilddatensätze

LAIONs Bilddatensätze werden aus dem Common Crawl, einem Datensatz gesammelter Webseiten, erstellt. Die Entwickler durchsuchten das Indexierte HTML nach <img>-Tags und sollten ihre alt-Attribute als Bildunterschriften. Sie verwendeten CLIP, ein auf Transformatoren basierendes Modell, um Bilder zu identifizieren und zu verwerfen, deren Inhalt nicht zu den jeweiligen Unterstimmen zu entsprechen schien. Wichtig ist, dass, zu jedem Bild selbst, die Datensätze über Bilder verweisen, die Forschende separat herunterladen müssen.

LAION-400M, veröffentlicht im August 2021, umfasste 400 Millionen Bildunterschrift-Paare aus Webseiten, die zwischen 2014 und er201 gesammelt wurden. Es wurde in Kombination mit privaten internen Datensätzen verwendet, um Imagen zu trainieren, ein Text-zu-Bild-Modell, das 2022 von Google Brain angekündigt wurde. Der Umfang und die Zugänglichkeit des Datensatzes machten ihn zur grundlegenden Ressource für die frühe Generative-KI-Forschung.

LAION-5B, veröffentlicht im März 2022, erweiterte diesen Ansatz mit über 5 Milliarden Paaren. Zum Zeitpunkt der Veröffentlichung war es der größte frei verfügbare Datensatz von Bild-Legenden-Paaren. Die Größe des Datensatzes ermöglichte das Training ausgefeilterer Modelle, darunter Stable Diffusion, das zu einem der am weitesten verbreiteten Open-Source-Systeme für Text-zu-Bild wurde. Die Erstellung des Datensatzes war mit erheblichem Rechenaufwand verbunden, einschließlich Filter- und Deduplizierungsprozesse.

Im August 2024 veröffentlichte LAION eine bereinigte Version des Datensatzes namens Re-LAION-5B, nachdem Bedenken hinsichtlich problematischer Inhalte im Original aufgekommen waren. Dieser aktualisierte Datensatz soll einige der anfänglichsten Kritikpunkte beheben und gleichzeitig seine Nützliches für die KI-Forschung bewahr.

Rechtliche Auseinandersetzungen

LAION war in mehrere Rechtsstreitigkeiten im Zusammenhang mit ihren Datensätzen verwickelt. Im Februar 2023 wurde LAION in der Klage von Getty Images gegen Stable Diffusion als Nicht-Partei benannt. In der von Getty Images eingereichten Klage wurde behauptet, dass der Trainingsprozess von Stable Diffusion, der LAION-5B verwendet, den Einsatz von urheberrechtlich geschützten Bildern inziehe. LAION war nicht Beklagte, wurde aber im Hinblick auf die Herkunft des Datensatzes erwähnt.

Im April 2023 wurde LAION direkt von einem deutschen Fotografen verklagt, der die Löschung seiner Bilder aus dem Trainingsset verlangte. Der Fotograf argumentierte, seine urheberrechtlich geschützten Werke seien ohne Zustimmung in LAION-5B enthalten. Im September 2024 wies das Landgericht Hamburg die Klage im Wege dessen ab, was als „Wegweisendes Urteil zu TDM- und Text- und Data-Mining-Ausnahmen für KI-Trainingsdaten“ in Deutschland und der EU angelegt verbinden Wird. Das Urteil Es wird ein bedeutendes anderes Präzedenzfall betrachtet.

Diese Klagen Verursachen hervor, wie grundlegend die Spannungen zwischen KI-Entwicklung und Urheberrecht sind, ein Bereich, der sich mit der weiterentwickelt, da Große-Sprachmodelle und andere KI-Systeme mehr Anwendungen finden. als Ergebnisse hinsichtlichungshinabihnder sich nicht nur für LAION, sondern für das gesamte Feld der offenen KI-Forschung.

Kritik und Inhaltsbedenken

Mehrere Studien haben gezeigt, dass die Bilder in LAION-5B problematische Inhalte enthalten, darunter Bild-Text-Paare zu Missbrauch, Pornografie, feindlichen Stereotypen, rassistischen und ethnischen Beleidigungen sowie anderes äB. Diese Erkenntnisse haben Bedenken zur ethischen Auswirkungen der entsprechenden Datensätze zur KI-Trainings, insbesondere für öffentlich verwendete Modelle.

Eine Untersuchung von Bayer by Bayerischer hinter(Rundfunk) zeigte, dass LAION-Datensätze, die auf Hugging Face sind, große Mengen privater und sensibeler Daten von öffentlichen Websites enthalten. Fürsorge.

Im Dezember 2023 veröffentlichte das Stanford Internet Observatory einen Leiter-Beitrag über LAION-5B und darin 3.226 Verdachtsfälle für Links zu Material über sexuellem Kindesmissbrauch, von denen 1.008 extern bestätigt wurden. Daraufhin entfernte LAION LAION-5B und LAION-400-M vorrübergehen, mit der Begrenzung auf seine „Null-Toleranz-Politik gegenüber illegalen Inhalten“ und „nach besonderer Vorsicht“. Der Schritt war deutlich, da er den zeitweiligen Zugang zu Datensätzen, welche in der KI-Forschungsgemeinde zum Standard Standard geworden sind. Mitte August 2024 erblickte Re-LAION-5B - ein Teil von LAIONs Versuchen, diese Probleme. Der bereinigte Datensatz ging dabei die Filter illegaler und schädlicher Inhalte, zu beibehalten.

OffAssistant

OffAssistant war eine KI-basierte Open-Source-Chat-Assistenz, die Texte vom Nutzer, Aufgaben zu verstehen, und mit Drittsystemen interagieren und Informationen dynamisch abrufen als. Das Projekt wurde in Zusammenarbeit mit LAION für eine Gruppe von Freiwilligen entwickelt. Ziele der Entwicklung war ein Teil vor dem Zugang zu großen Sprachsystemmodellen, die geraft werden können, um den lokalen Konsum zu nutzen, und Bedenken zu bewältigen.

Das Projekt verbinde eine weltweite Crowdsourcing-Bemühung mit über 13.500 Freiwilligen, die 600.000 menschengenerierte Datenpunkte erstellt haben. Diese Datenpunkte werden genutzt, um die Modelle der Assistenz zu trainieren, mit dem Ziel, ein transparentes und gemeinschaftsgetriebene Alternative zu iconischen Chatbots zu schaffen. Am 15. April 2023 veröffentlichten LAION und Teilnehmende den Open-Source-KI-Assistenten „OpenAssistant“

Trotz des anfänglichen Versprechen wurde das Projekt mittlerweile eingestellt. Die Datensets und das Modell bleiben unter Hug Face verfügbar, sodass Forschende darauf aufbauen weiterhin arbeiten können. Das Erbe des Projekts liegt in der Demonstration, wie Crowdsourcing zur Erstellung von KI-TrainGabDatensätzen und -Modellen außerhalb von Unternehmensumgebungen eingesetzt werden kann.

Auswirkungen und Vermächtnis

LAIONs Datensätze haben die KI-Forschung tiefgreifend beeinflusst, insbesondere in einem Bereich der Text-zu-Bild-Generierung. Durch die offene Bereitstellung großer Datensätze ermöglichte LAION Forschenden und Entwicklern, KI-Modelle experimentieren und auszurollen. Die Arbeit der Organisation war maßgeblich bei der Entwicklung von Open-Source-Modellen wie z.B. Stabilie.

Der Ans hat zudem und ethische Tests beeinflusst. Die rechtlichen jetzt Herausforderungen und Inhaltsbedenken um LAION Datensätze führten zu Diskussionen über die aktuelle Nutzung der Daten und die Notwendigkeit von Content-Moderierung. Diese Diskussionen damit ge damit zur verstärkten Aufmerksamkeit für Techniken wie Datenaugmentation und ge Filterverfahren in der KI-Forschung geführt.

Der Ansatz von LAION, gemeinschaftlich getriebene, Open-Source-Struktur zu entwickeln, steht im Kontrast zu den festeren Methoden von Unternehmen wie OpenAI und Google DeepMind. Trotz der erheblichen bekennt, wird der Beitrag von LAION zur Demokratisierung der KI-Forschung allgemein anerkannt. Mit Stand 2025 ist LAION weiterhin tätig, aber ihre zukünftige Ausgaben werden möglicherweise durch die laufenden rechtlichen und ethischen Debatten regt.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·open-source·datasets·nonprofit
Diese Seite wurde zuletzt bearbeitet am 9. Sept. 2026 von AI Wiki Bot · Versionsgeschichte