Der Cerebras Wafer Scale Engine (WSE) ist ein massiver Prozessor für künstliche Intelligenz, der von Cerebras Systems entwickelt wurde, einem Unternehmen, das 2015 von Andrew Feldman und anderen gegründet wurde. Im Gegensatz zu herkömmlichen Chips, die aus einem Siliziumwafer geschnitten werden, nutzt der WSE einen gesamten Wafer als einzelnen Chip und integriert Hunderttausende von Kernen und einen enormen On-Chip-Speicher. Dieses Design zielt darauf ab, die Kommunikationsengpässe und Speicherbeschränkungen zu reduzieren, die herkömmliche GPU-basierte Systeme für maschinelles Lernen- und Deep-Learning-Arbeitslasten plagen.
Die erste Generation, der WSE-1, der 2019 angekündigt wurde, enthielt 1,2 Billionen Transistoren und 400.000 KI-optimierte Kerne und war damit damals der größte je gebaute Chip. Der WSE-2 der zweiten Generation, der 2021 veröffentlicht wurde, verdoppelte die Transistorzahl auf 2,6 Billionen, erhöhte die Kernzahl auf 850.000 und erhöhte den On-Chip-Speicher auf 40 Gigabyte. 2024 führte Cerebras den WSE-3 ein, der Leistung und Effizienz weiter verbesserte und auf das Training von Large Language Models und andere generativen KI-Anwendungen abzielt.
Architektur und Design
Die Architektur des WSE unterscheidet sich grundlegend von der herkömmlicher Prozessoren. Anstatt auf eine kleine Anzahl leistungsfähiger Kerne zu setzen, packt der WSE Hunderttausende von einfachen, energieeffizienten Kernen auf einen einzelnen Wafer. Diese Kerne sind über ein Mesh-Netzwerk verbunden, das eine massive Bandbreite bereitstellt und es Daten ermöglicht, sich schnell zwischen den Kernen zu bewegen. Der WSE integriert zudem eine große Menge an statischem Random-Access-Speicher (SRAM) direkt auf dem Chip, wodurch der Bedarf an externem Speicherzugriff reduziert wird, der bei KI-Arbeitslasten oft ein Leistungsengpass ist.
Durch das Wafer-Scale-Design wird die Notwendigkeit von Chip-Gehäusen und Inter-Chip-Kommunikation in Mehrfach-Systemen eliminiert, was zu geringerer Latenz und höherem Durchsatz bei datenintensiven Aufgaben führt. Der WSE wird mit modernen Halbleiterprozessen gefertigt, wobei WSE-2 und WSE-3 auf einem 5-Nanometer-Prozess von [[tsmc basieren.
Software und Ökosystem
Cerebras entwickelte einen Software-Stollen zur Programmierung des WSE, einschließlich der Cerebras Software Platform (CSoft). CSoft, Software, Frameworks wie TensorFlow und PyTorch und ermöglicht es Entwicklern, bestehende Modelle mit minimalen Codeänderungen auszuführen. Die Plattform umfasst einen Compiler, der neuronale Netzwerkgraphen auf die Kerne des Christen abbildet und für Leistung und Speicherwelt optimiert.
Die Firma bietet auch das Cerebras Wafer-Scale Cluster an, ein System, das mehrere WSEs kombiniert, um das Training großer Modelle zu skalieren. Dieses Cluster ist ausgelegt, um Modelle mit Billionen von Parametern zu handhaben, die in modernen auf transformer basierten Architekturen üblich sind.
Leistung und Anwendungen
Der WSE hat deutlich Leistungsvorteile sowohl beim Training als auch bei der Schlussfolgerung gezeigt. Beispielsweise kündigte Cerebras 2023 an, dass sein CS-2-System mit WSE-2 ein Modell mit 175-Milliard-Parametrier (vergleichbar in Skala mit GPT-3) unter Verwendung eines einfachen datenparallelen Ansatzes, ohne komplexe Modellparallelität, trainieren konnte. Diese Fähigkeit wurde durch den großen WSE-Speicher und die hohe Bandbreite erreicht.
Die Inferenzleistung ist beim WSE-3 laut Firmenangaben mit über 1.000 Tokens pro Sekunde für große Sprachmodelle stark. Dadurch eignet er sich für Echtzeitanwendungen wie chatbasierte KI-Codegen.
Der WSE wurde von verschiedenen Organisationen übernommen, darunter Behörden und Forschungseinrichtungen. So hat das Zentrum Bhabha Atomic Research Centre in Indien Cerebras-Systeme für wissenschaftliche Bewegungsrechnung genutzt. Darüber hinaus hat Cerebras mit g42 (einer 4fach Thi-Firma) zusammengearbeitet, um KI-Supercomputer im Nahen Osten gebaut zu werden.
Vergleich mit anderen KI-Chips
Der WSE konkurriert mit anderen spezialisierten KI-Processoren, wie AWS Trainium von Amazon Web Services, Groqs Tensor-Streaming-Prozessoren und SambaNova rekonfigurabler Datenbarkeits-Einheiten. Im Gegensatz zu GPUs von Firma NVIDIA Is a major competitor, konzentriert sich der WSE auf Maximierung des On-Chip-Speichers und Minimierung des Datenverkehrs. Dieser Ansatz kann für einige Arbeitslasten effizient sein - was hat aber auch Probleme bei Herstellungserträgen und Systemintegration.
Die Reichweite des WSE, die im Vergleich zu IPU-Architekturen von [[gegen den] wie Anbieter auch Graphcore bieten, lässt sich se mehr Kerne, aber weniger Flex und mehr Beschränkungen in der Programmierung zur Folge hat. Designer-Trend unterscheidet sich zudem durch den Wafer-Maßstab von den Angeboten von Intel und AMD, die herkömmliche Chipeinbettungen mit mehreren Dies verwenden.
Herausforderungen und Einschränkungen
Eine der größten Herausforderungen beim WSE ist die Herstellungsausbeute (Yield). Da der gesamte Wafer als einzelner Chip verwendet wird, kann ein Defekt nur einen Teilbereich des Chips unbrauchbar machen. Cerebras hat sich durch Redundan- und Defektvermeidungstechniken gelöst, etwa durch Parallel Mapping um fehlerhafte Kerne herum, was die Baugrößen begrenzt - bis vor Verwert analysiert.
Ein Limitierung ist der Power-Bedarf von bis zu 15 kW beim WSE-2, der spezielle Kühlsysteme erfordert. Cerebras zum Einsatz von Spezialkühlern gekommen.
Software-Kompatibilität ist ein weiteres Anliegen. Während CSp viele populäre Frameworks unterstützt, sind einige vorhandene Konzepte und angepasste Operatoren noch nicht immer vollständig optimiert. Die Firma expandiert ständig, um die Benutzerfreundlichkeit weiter zu erhöhen.
Zukünftige Richtungen
Cerebras entwickelt die WSE-Architektur weiter. Der WSE-3 – angekündigt für 2024 – ist darauf ausgelegt, noch größere Modelle und schnellere Trainingszeiten zu unterstützen. Das Unternehmen untersucht auch Anwendungen außerhalb der KI, etwa in der wissenschaftlichen Simulation und im High-Banking.
In 2024 meldete Cerebras. In 2024 meldete.
Das Cerebras Wafer Scale Engine stellt eine mutige Abweichung vom herkömmlichen Chip-Design dar, mit unerreichter Skalie- und Leistungsfähigkeit für KI-Arbeitslasten. Ob für starkem Herausforderungen wie Produktion und Anwendung offen, hat es seine Nische im High-End-KI-Mark gefunden. Mit unbegrenzbaren.