Cerebras Systems Inc. mit Hauptsitz in Sunnyvale, Kalifornien, entwickelt Halbleiter, Supercomputer und zugehörige Software für Anwendungen des Deep Learning im Bereich der künstlichen Intelligenz, wie etwa Inferenz-Engines. Zu den Produkten gehören die Wafer-Scale-Engine-(WSE)-3-Halbleiter, die CS-3-Supercomputer sowie die APIs „AI inference cloud“ und „AI training cloud“, die es Nutzern ermöglichen, auf die Rechenleistung des Unternehmens zuzugreifen, ohne dessen Hardware zu kaufen. Das Unternehmen baut auch Rechenzentren mit seinen Prozessoren und Supercomputern, um Cloud-Computing-Dienste direkt an Kunden zu liefern.
Die WSE-3-Halbleiter des Unternehmens messen 215 mm im Quadrat und sind derzeit die größten jemals gebauten KI-Halbleiter. Sie nehmen ganze Siliziumwafer ein und nutzen Wafer-Scale-Integration und Switched Fabric. Dies reduziert Latenzzeiten und Interconnect-Engpässe im Vergleich zu GPU-Clustern. Sie verwenden statischen Direktzugriffsspeicher (SRAM) anstelle von dynamischem Direktzugriffsspeicher (DRAM). Cerebras-Halbleiter und Computersysteme sind wesentlich leistungsfähiger als die der Konkurrenz; sie haben jedoch Nachteile aufgrund ihrer Größe, einer Leistungsaufnahme von 25 kW und Kosten von bis zu 3 Millionen US-Dollar pro Knoten.
Geschichte
Cerebras Systems wurde 2015 von Andrew Feldman, Gary Lauterbach, Michael James, Sean Lie und Jean-Philippe Fricker gegründet. Diese fünf Gründer arbeiteten zuvor gemeinsam bei SeaMicro, das 2007 von Feldman und Lauterbach gegründet und 2012 für 334 Millionen US-Dollar an AMD verkauft wurde.
Die Gründer wussten, dass GPUs nicht die optimalen Halbleiter für hochwertige Prozesse waren. Sie mussten jedoch einzigartige Kühlmethoden entwickeln, um zu verhindern, dass ein „massiver“ Halbleiter beim Stromziehen verbrennt, eine einzigartige Software, um übliche mikroskopische Fertigungsfehler zu umgehen, und sie mussten eine Maschine erfinden, die 40 Schrauben gleichzeitig in den Wafer bohren konnte, ohne dass dieser riss.
Das Unternehmen hatte Schwierigkeiten, das Problem der Integrierten-Schaltkreis-Gehäusetechnik zu lösen: das Aufbringen des Siliziums auf ein Motherboard, die Stromversorgung sowie die Handhabung von Heizung und Kühlung und der Leitungen für Datenübertragung und -rückgabe. Es verbrannte monatlich 8 Millionen US-Dollar und gab 200 Millionen US-Dollar aus, um das Problem zu lösen. Im Juli 2019, nach erschöpfender Versuch-und-Irrtum-Phase, produzierte das Unternehmen schließlich ein Produkt, das funktionierte.
Im August 2019 kündigte Cerebras den WSE-1 an, seine Halbleiter der ersten Generation der Wafer-Scale-Engine (WSE) sowie sein Supercomputing-System CS-1. Der CS-1 ist ein 19-Zoll-Rack-Gerät und enthält einen einzelnen WSE-Hauptprozessor mit 400.000 Rechenkernen, 1,2 Billionen Transistoren (zwölf 100-Gigabit-Ethernet-Verbindungen) und 18 Gigabyte Speicher.
Die ersten Kunden des Unternehmens waren Bildungseinrichtungen und Life-Sciences-Unternehmen, die Supercomputer für die Wirkstoffforschung, numerische Strömungsmechanik, genetische und genomische Forschung, zur Vorhersage von Arzneimittelreaktionen und für die COVID-19-Forschung bauten. Zu den frühen Kunden gehörten GlaxoSmithKline, AstraZeneca, das National Energy Technology Laboratory, das Lawrence Livermore National Laboratory, das Pittsburgh Supercomputing Center und das Edinburgh Parallel Computing Centre.
Im September 2020 eröffnete das Unternehmen ein Büro in Japan und ging eine Partnerschaft mit Tokyo Electron ein.
Im April 2021 veröffentlichte das Unternehmen sein System CS-2, das auf der Wafer-Scale-Engine Two (WSE-2) des Unternehmens basiert und 850.000 Kerne besitzt. Der CS-2 wird im 7-nm-Verfahren von TSMC hergestellt. Er ist 26 Zoll (660 mm) hoch und passt in ein Drittel eines Standard-Rechenzentrum-Racks. Die WSE-2 hat 850.000 Kerne und 2,6 Billionen Transistoren. Sie ermöglicht es einem einzelnen System, KI-Modelle mit mehr als 120 Billionen Parametern zu unterstützen. Die WSE-2 erweiterte den On-Chip-SRAM auf 40 Gigabyte, die Speicherbandbreite auf 20 Petabyte pro Sekunde und die gesamte Fabric-Bandbreite auf 220 Petabit pro Sekunde. Zu den Kunden gehörten TotalEnergies, nference, das National Center for Supercomputing Applications (NCSA) und das Leibniz-Rechenzentrum.
Im August 2021 kündigte Cerebras eine Partnerschaft mit Peptilogics zur Entwicklung von KI für Peptidtherapeutika an.
Im Juni 2022 stellte Cerebras einen Rekord für die größten KI-Modelle auf, die jemals auf einem einzigen Gerät trainiert wurden - ein einzelnes CS-2-System mit einem Cerebras-Wafer trainierte Modelle mit bis zu 20 Milliarden Parametern. Das Cerebras-CS-2-System kann Modelle der Verarbeitung natürlicher Sprache (NLP) mit mehreren Milliarden Parametern trainieren, darunter GPT-3XL-Modelle mit 1,3 Milliarden Parametern sowie GPT-J 6B, GPT-3 13B und GPT-NeoX 20B, mit reduzierter Softwarekomplexität und Infrastruktur.
Im August 2022 enthüllte das Computer History Museum in Mountain View, Kalifornien, eine neue Ausstellung mit der WSE-2 mit dem Namen „The Biggest Chip In the World“.
Ebenfalls im August 2022 eröffnete Cerebras ein Büro in Bangalore, Indien.
Im September 2022 kündigte Cerebras an, seine Chips zusammenschalten zu können, um den größten jemals gebauten Rechencluster für KI-Computing zu schaffen. Ein Wafer-Scale-Cluster kann bis zu 192 CS-2-KI-Systeme zu einem Cluster verbinden, während ein Cluster aus 16 CS-2-KI-Systemen ein Rechensystem mit 13,6 Millionen Kernen für die Verarbeitung natürlicher Sprache erzeugen kann. Es verwendet Datenparallelität zum Trainieren.
Im Oktober 2022 begann das Sandia National Laboratories der National Nuclear Security Administration mit der Nutzung des CS-2 für das Rechenzentrum zur Verwaltung des Nuklearwaffenbestands, um festzustellen, ob Atomwaffen wie vorgesehen funktionieren.
Im November 2022 enthüllte Cerebras den Supercomputer Andromeda, der 16 WSE-2-Chips in einem Cluster mit 13,5 Millionen KI-optimierten Kernen vereint und bis zu 1 Exaflop KI-Rechenleistung liefert, also mindestens eine Trillion (10^18) Operationen pro Sekunde. Das gesamte System verbraucht 500 kW, was deutlich weniger war als bei einigermaßen vergleichbaren GPU-beschleunigten Supercomputern.
Im November 2022 kündigte Cerebras eine Partnerschaft mit Cirrascale Cloud Services an, um eine Pauschalrechnung „pay-per-model“ für Rechenzeit für sein Cerebras AI Model Studio anzubieten.
Im November 2022 erzielte das National Energy Technology Laboratory (NETL) Meilensteine mit Cerebras-Produkten.
Im November 2022 gewann das Argonne National Laboratory den Gordon-Bell-Sonderpreis 2022 für COVID-19-Forschung, indem es den CS-2 sowie Produkte von Nvidia und Hewlett-Packard nutzte, um große Sprachmodelle zu transformieren, um Varianten von SARS-CoV-2 zu analysieren und vorherzusagen.
Im Juli 2023 erklärte sich G42 bereit, etwa 100 Millionen US-Dollar für den Kauf des ersten von möglicherweise neun Supercomputern von Cerebras zu zahlen. Das erste System wurde später in diesem Jahr geliefert, und G42 wurde anschließend zu einem wichtigen Kunden, der einen erheblichen Teil der Einnahmen von Cerebras ausmachte.
Technologie und Produkte
Die Kerntechnologie von Cerebras ist die Wafer-Scale-Engine, ein einzelner Halbleiter, der einen gesamten Siliziumwafer umfasst. Dieser Ansatz steht im Gegensatz zur herkömmlichen Chipfertigung, bei der mehrere Chips aus einem einzigen Wafer geschnitten werden. Durch die Verwendung des gesamten Wafers macht Cerebras Inter-Chip-Verbindungen überflüssig, die einen großen Engpass in GPU-Clustern darstellen. Die 2024 angekündigte WSE-3 ist die dritte Generation dieses Designs mit 4 Billionen Transistoren und 900.000 Kernen. Sie wird von TSMC in einem 5-nm-Verfahren hergestellt und ist derzeit der größte jemals gebaute KI-Halbleiter.
Der CS-3-Supercomputer ist das System, das die WSE-3 beherbergt. Er ist als vollständiger KI-Rechenknoten konzipiert, mit integrierter Kühlung und Stromversorgung. Der CS-3 kann sowohl für Training als auch für Inferenz verwendet werden und unterstützt Modelle mit bis zu 24 Billionen Parametern. Cerebras bietet auch Cloud-Dienste an, die es Kunden ermöglichen, über APIs auf seine Hardware zuzugreifen, ohne die Systeme direkt zu kaufen.
Die Halbleiter des Unternehmens verwenden statischen Direktzugriffsspeicher (SRAM) anstelle von dynamischem Direktzugriffsspeicher (DRAM), was eine höhere Bandbreite und geringere Latenz bietet. Dies ist besonders vorteilhaft für KI-Workloads, die einen schnellen Zugriff auf große Datenmengen erfordern.
Anwendungen und Anwendungsfälle
Cerebras-Systeme werden in einer Vielzahl von KI-Anwendungen eingesetzt, darunter Verarbeitung natürlicher Sprache, Wirkstoffforschung und wissenschaftliche Forschung. Zu den frühen Kunden gehörten GlaxoSmithKline und AstraZeneca, die den CS-1 für die Wirkstoffforschung und Genomik nutzten. Das National Energy Technology Laboratory nutzte Cerebras-Systeme für die Energieforschung und das Lawrence Livermore National Laboratory für die Verwaltung des Nuklearwaffenbestands. Der CS-2 wurde auch vom Argonne National Laboratory für die COVID-19-Forschung verwendet, das damit den Gordon-Bell-Sonderpreis 2022 gewann.
Im kommerziellen Sektor war G42, ein in den Vereinigten Arabischen Emiraten ansässiges KI-Unternehmen, ein wichtiger Kunde, der Cerebras-Systeme für groß angelegtes KI-Training nutzte. OpenAI und Amazon Web Services unterzeichneten 2026 Vereinbarungen zur Nutzung von Cerebras-Hardware, was den Kundenstamm weiter vergrößerte.
Marktposition und Wettbewerb
Cerebras ist in zwei Hauptmärkten tätig: KI-Hardware und KI-Cloud-Dienste. Im Hardware-Markt sind die Hauptkonkurrenten Nvidia, AMD, Intel und Broadcom. Nvidia dominiert den KI-Chipmarkt mit seinen GPUs, aber Cerebras differenziert sich durch eine Ein-Chip-Lösung, die die Interconnect-Engpässe von Multi-GPU-Systemen vermeidet. Im Markt für Cloud-Dienste konkurriert Cerebras mit Amazon Web Services, Microsoft Azure, Google Cloud Platform, Oracle Corporation und CoreWeave.
Trotz seiner technologischen Vorteile steht Cerebras vor Herausforderungen aufgrund der hohen Kosten und des Strombedarfs seiner Systeme. Jeder Knoten kann bis zu 3 Millionen US-Dollar kosten und 25 kW Strom verbrauchen, was seine Attraktivität auf einen Nischenmarkt von Hochleistungsrechennutzern beschränkt.
Fertigung und Lieferkette
Die Halbleiter von Cerebras werden von TSMC hergestellt, das derzeit das einzige Unternehmen ist, das in der Lage ist, so große Chips zu produzieren. Die Wafer-Scale-Integration erfordert spezielle Fertigungsprozesse, und für die WSE-3 bzw. WSE-2 werden die 5-nm- und 7-nm-Knoten von TSMC verwendet. Diese Abhängigkeit von einem einzigen Lieferanten ist eine potenzielle Schwachstelle, gewährleistet aber auch ein hohes Maß an Qualität und Konsistenz.
Aktuelle Entwicklungen und Zukunftsaussichten
Im Jahr 2024 kündigte Cerebras die WSE-3 und den CS-3 an, die erhebliche Leistungsverbesserungen gegenüber früheren Generationen bieten. Das Unternehmen hat außerdem seine Cloud-Angebote erweitert, mit Rechenzentren in den Vereinigten Staaten und anderen Regionen. Im Jahr 2026 unterzeichnete Cerebras Vereinbarungen mit OpenAI und Amazon Web Services, was auf eine wachsende Nachfrage nach seiner Technologie hindeutet. Das Unternehmen investiert weiterhin in Forschung und Entwicklung, mit Schwerpunkt auf der Verbesserung der Wafer-Scale-Integration und der Reduzierung des Stromverbrauchs.
Stand 2025 hat Cerebras Büros in Sunnyvale, San Diego, Toronto und Bangalore, Indien. Zu den wichtigsten Kunden des Unternehmens gehören die Mohamed bin Zayed University of Artificial Intelligence, die 62 % der Einnahmen von 2025 ausmachte, und G42, das 24 % ausmachte. Der zukünftige Erfolg des Unternehmens wird von seiner Fähigkeit abhängen, seine Fertigung zu skalieren und einen breiteren Kundenstamm über seine derzeitige Nische hinaus anzuziehen.
Siehe auch
- künstliche Intelligenz
- maschinelles Lernen
- Deep Learning
- neuronales Netz
- großes Sprachmodell
- Transformer
- OpenAI
- Anthropic
- Google DeepMind
- generative KI
- AMD
- Intel
- TSMC
- Broadcom
- Amazon Web Services
- Azure
- Google Cloud
- Oracle Cloud
- Groq
- SambaNova
- Graphcore
- Nokia Bell Labs
- Xerox PARC
- MIT CSAIL
- Stanford AI Lab
- University of Toronto
- Carnegie Mellon University
- Berkeley AI Research
- University of Oxford
- D-Wave
- Alibaba Cloud
- Waymo
- Tesla Autopilot
- Adam-Optimierer
- Residualnetzwerk
- U-Net
- RLAIF
- Curriculum Learning
- Gradient-Clipping
- Batch-Normalisierung
- Layer-Normalisierung
- Dropout
- Gewichtsinitialisierung
- Verlustfunktionen
- Positionskodierung
- Multi-Head-Attention
- Cross-Attention
- Encoder-Decoder
- Sequence-to-Sequence
- Beam-Suche
- Top-k-Sampling
- Top-p-Sampling
- Temperaturskalierung
- Modell-Pruning