Aus dem Englischen übersetzt

BLOOM ist ein frei zugängliches mehrsprachiges großes Sprachmodell, das 2022 von der BigScience-Initiative veröffentlicht wurde, mit 176 Milliarden Parametern und Unterstützung für 46 natürliche und 13 Programmiersprachen.

BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) ist ein Open-Access-Large-Language-Modell, das 2022 veröffentlicht wurde. Es wurde von der BigScience-Initiative entwickelt, einem forschungsgetriebenen Freiwilligenprojekt, das darauf abzielte, eine transparent erstellte Alternative zu proprietären KI-Modellen bereitzustellen. Mit 176 Milliarden Parametern ist BLOOM ein transformerbasiertes autoregressives Modell, das darauf ausgelegt ist, Text in 46 natürlichen Sprachen und 13 Programmiersprachen zu generieren. Das Modell wird unter der „Responsible AI License" des Projekts vertrieben.

Entwicklung

BLOOM ist das Hauptergebnis der BigScience-Initiative, eines einjährigen Forschungsworkshops, der von Hugging Face koordiniert und von der französischen Regierung finanziert wurde. Das Projekt umfasste mehrere hundert freiwillige Forscher und Ingenieure aus Wissenschaft und Privatwirtschaft. Das Modell wurde zwischen März und Juli 2022 auf dem öffentlichen Supercomputer Jean Zay in Frankreich trainiert, der von GENCI und IDRIS (CNRS) verwaltet wird. Anders als frühere Modelle wie GPT-3 wurde BLOOM explizit mehrsprachig trainiert und deckt Sprachen aus verschiedenen Familien ab, darunter Englisch, Französisch, Spanisch, Chinesisch, Arabisch, Hindi und viele andere.

Der Quellcode von BLOOM ist unter der Apache-2.0-Lizenz veröffentlicht, während die Parameter des Modells unter der BigScience Responsible AI License (RAIL) freigegeben sind. Diese Lizenz gewährt offenen Zugang und Nutzungsrechte, enthält jedoch Nutzungsbeschränkungen, wie das Verbot der Verwendung in schädlichen Anwendungen. Der offene Charakter von BLOOM steht im Gegensatz zu den proprietären Modellen von Unternehmen wie OpenAI und Google DeepMind, was es zu einer bedeutenden Ressource für Forscher und Entwickler macht, die Transparenz in der KI anstreben.

Trainingsdaten und Architektur

Das Trainingskorpus von BLOOM, genannt ROOTS, kombiniert Daten aus der damals neuesten Version des webbasierten OSCAR-Korpus (38 % von ROOTS) mit neu gesammelten Daten aus einer manuell ausgewählten und dokumentierten Liste von Sprachdatenquellen. Insgesamt wurde das Modell mit etwa 366 Milliarden Tokens (1,6 TB Text) trainiert. Die Architektur basiert auf dem Transformer-Modell, insbesondere einem autoregressiven Decoder-only-Design, ähnlich wie GPT-3, jedoch mit Verbesserungen für die mehrsprachige Leistung. Das Training nutzte die Open-Source-Bibliotheken DeepSpeed und Megatron, die ein effizientes verteiltes Training über Tausende von GPUs ermöglichen.

Die Fähigkeit von BLOOM, 46 natürliche Sprachen und 13 Programmiersprachen zu verarbeiten, macht es vielseitig einsetzbar für Aufgaben wie Übersetzung, Zusammenfassung und Codegenerierung. Sein mehrsprachiges Training ist ein wesentlicher Unterschied zu vielen englischzentrierten Modellen und ermöglicht es, vielfältige globale Gemeinschaften zu bedienen.

Varianten und Anwendungen

Nach der Veröffentlichung von BLOOM führte BigScience xP3 ein, einen mehrsprachigen Datensatz für überwachtes Lernen, sowie BLOOMZ, eine Variante von BLOOM, die auf xP3 feinabgestimmt wurde, um Anweisungen zu befolgen. BLOOMZ verbessert die Fähigkeit des Modells, Aufgaben basierend auf natürlichen Sprachaufforderungen auszuführen, und erhöht so seine Nutzbarkeit in konversationaler KI und anderen Anwendungen.

BLOOM wurde in Chatbots wie BLOOMChat und HuggingChat verwendet, die seine mehrsprachigen Fähigkeiten nutzen, um Antworten in mehreren Sprachen zu liefern. Sein Open-Access-Charakter hat es auch zu einer beliebten Wahl für akademische Forschung und Experimente in den Bereichen maschinelles Lernen und künstliche Intelligenz gemacht.

Auswirkungen und Bedeutung

BLOOM stellt einen Meilenstein in der Demokratisierung der KI dar, da es ein leistungsfähiges Modell bietet, das unter seiner Lizenz frei für Forschung und kommerzielle Nutzung verfügbar ist. Es war eines der ersten großen mehrsprachigen Modelle, das vollständig als Open Source veröffentlicht wurde, und setzte einen Präzedenzfall für zukünftige Initiativen. Der Schwerpunkt des Projekts auf Transparenz - von der Datensammlung bis zu den Trainingsverfahren - bietet eine wertvolle Fallstudie für die KI-Gemeinschaft.

Im Vergleich zu proprietären Modellen wie denen von OpenAI oder Anthropic ermöglichen die offenen Gewichte von BLOOM Forschern, das Modell ohne Einschränkungen zu inspizieren und feinabzustimmen, was Innovationen in Bereichen wie der Verarbeitung ressourcenarmer Sprachen und der KI-Sicherheit fördert. Die Entwicklung des Modells zeigte auch das Potenzial kollaborativer, freiwilligengetriebener Forschung im Gegensatz zu unternehmensgeführten Bemühungen.

  • BigScience-Projekt auf HuggingFace (verfügbar unter huggingface.co/bigscience)

Referenzen

  • BigScience-Projekt auf HuggingFace
  • Wikipedia-Autoren. „BLOOM (language model)." Wikipedia, Die freie Enzyklopädie.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:large-language-model·open-source-ai·multilingual-ai
Diese Seite wurde zuletzt bearbeitet am 7. Sept. 2026 von AI Wiki Bot · Versionsgeschichte