BLOOM-176B ist die größte Variante des BLOOM-Sprachmodells (BigScience Large Open-science Open-access Multilingual), das von der BigScience-Kollaboration entwickelt und im Juli 2022 veröffentlicht wurde. Mit 176 Milliarden Parametern ist es ein dichtes Transformer-basiertes Großsprachmodell, das darauf ausgelegt ist, Text in Dutzenden natürlichen Sprachen und Programmiersprachen zu erzeugen. Das Modell wurde mit dem ROOTS-Korpus trainiert, einem kuratierten Datensatz von über 1,6 Terabyte Text, und unter der Responsible AI License verfügbar gemacht, einer offenen Lizenz, die Nutzungsbeschränkungen zur Verhinderung schädlicher Anwendungen enthält.
BLOOM-176B wurde geschaffen, um eine groß angelegte, mehrsprachige Alternative zu proprietären Modellen bereitzustellen, wobei der Schwerpunkt auf Transparenz und Reproduzierbarkeit liegt. Seine Architektur folgt einem standardmäßigen Decoder-only-Transformer mit Multi-Head-Attention, Layer-Normalisierung und Positionskodierung, integriert jedoch mehrere Innovationen, darunter ein ALiBi-Schema (Attention with Linear Biases) für die Positionskodierung, das die Extrapolation auf längere Sequenzen verbessert. Das Modell unterstützt 46 natürliche Sprachen und 13 Programmiersprachen und ist damit eines der sprachlich vielfältigsten großen Modelle seiner Zeit.
Training und Rechenressourcen
Das Training von BLOOM-176B erforderte erhebliche Rechenressourcen. Das Modell wurde auf dem Supercomputer Jean Zay in Frankreich mit 384 NVIDIA-A100-GPUs mit jeweils 80 GB Speicher trainiert. Der Trainingsprozess dauerte etwa 3,5 Monate und verbrauchte rund 1.082.990 Rechenstunden. Das Team verwendete eine Mischung aus Deep-Learning-Optimierungstechniken, einschließlich des Adam-Optimierers mit einem Lernratenplan, der eine Aufwärmphase und einen Kosinusabfall umfasste. Gradienten-Clipping wurde zur Stabilisierung des Trainings angewendet, und bfloat16-Mischpräzision wurde genutzt, um den Speicherverbrauch zu reduzieren.
Die Trainingsdaten, ROOTS, wurden von der BigScience-Community zusammengestellt und umfassen 1,6 Terabyte Text aus verschiedenen Quellen, darunter Bücher, Nachrichtenartikel und Webinhalte. Der Datensatz wurde gefiltert und dedupliziert, um Qualität zu gewährleisten und Verzerrungen zu reduzieren. Das Modell wurde mit einer Kontextlänge von 2048 Token trainiert, und der ALiBi-Mechanismus ermöglichte es, zur Inferenzzeit längere Sequenzen ohne zusätzliches Training zu verarbeiten.
Fähigkeiten und Leistung
BLOOM-176B zeichnet sich durch Textgenerierung, Übersetzung und Zusammenfassung in seinen unterstützten Sprachen aus. Es zeigt starke Few-Shot-Lernfähigkeiten, ähnlich wie andere große Modelle, und kann Aufgaben wie Fragenbeantwortung und Codegenerierung ausführen. In Bewertungen erzielte es wettbewerbsfähige Ergebnisse bei Benchmarks wie SuperGLUE und mehrsprachigen Aufgaben, obwohl es bei rein englischen Aufgaben aufgrund seines mehrsprachigen Fokus manchmal hinter Modellen wie GPT-3 zurückblieb.
Eine bemerkenswerte Eigenschaft ist seine Fähigkeit, Text in ressourcenarmen Sprachen zu erzeugen, wie solchen aus afrikanischen und südostasiatischen Regionen, die in anderen Modellen oft unterrepräsentiert sind. Das Modell unterstützt auch Programmiersprachen wie Python, Java und C++ und ermöglicht Codevervollständigung und -generierung. Wie alle generativen KI-Modelle kann es jedoch voreingenommene oder sachlich falsche Ausgaben produzieren, und die Lizenz enthält Einschränkungen für die Nutzung in Hochrisikobereichen.
Veröffentlichung und Zugang
BLOOM-176B wurde im Juli 2022 über den Hugging Face Hub veröffentlicht, wobei die Gewichte zum Download verfügbar waren. Die Veröffentlichung wurde von einer detaillierten Modellkarte und einem technischen Bericht begleitet, die den Trainingsprozess und die beabsichtigten Verwendungen dokumentieren. Das Modell kann auf High-End-Hardware ausgeführt werden, aber seine Größe erfordert mehrere GPUs oder Amazon-Web-Services-Instanzen mit großem Speicher. Die BigScience-Kollaboration veröffentlichte auch kleinere Versionen, darunter BLOOM-7B und BLOOM-3B, um die Forschung auf weniger leistungsfähiger Hardware zu erleichtern.
Der offene Zugang zu BLOOM-176B machte es zu einer wertvollen Ressource für Forscher und Entwickler, insbesondere in der Wissenschaft und in Regionen mit begrenztem Zugang zu proprietären Modellen. Es wurde in Studien zu Verzerrungen, Interpretierbarkeit und mehrsprachiger NLP verwendet und trug zum breiteren Feld der Künstliche-Intelligenz-Forschung bei.
Auswirkungen und Vermächtnis
BLOOM-176B zeigte, dass groß angelegte Sprachmodelle kollaborativ und transparent entwickelt werden können, ohne auf Unternehmensressourcen angewiesen zu sein. Seine Veröffentlichung beeinflusste nachfolgende Open-Source-Bemühungen wie die Falcon- und Llama-Modelle, die ähnliche Lizenz- und Transparenzprinzipien übernahmen. Das Modell hob auch die Bedeutung mehrsprachiger Repräsentation im maschinellen Lernen hervor und ermutigte andere Projekte, sprachliche Vielfalt zu priorisieren.
Trotz seines Erfolgs stand BLOOM-176B vor Herausforderungen, darunter die hohen Kosten der Inferenz und die Schwierigkeit des Feintunings für spezifische Aufgaben. Stand 2025 bleibt es ein Referenzpunkt für offene Modelle, obwohl neuere Modelle es in Leistung und Effizienz übertroffen haben. Sein Vermächtnis liegt darin, zu beweisen, dass gemeinschaftsgetriebene KI-Entwicklung modernste Ergebnisse erzielen kann, während sie ethische Richtlinien einhält.