Wormhole ist eine Familie von KI-Beschleunigerkarten, die von Tenstorrent, einem fabless Halbleiterunternehmen, hergestellt wird. Diese Karten sind darauf ausgelegt, künstliche Intelligenz- und maschinelles Lernen-Workloads zu beschleunigen, insbesondere Deep-Learning-Modelle wie große Sprachmodelle und Transformer-basierte Architekturen. Die Wormhole-Serie zielt sowohl auf Inferenz- als auch auf Trainingsaufgaben ab und bietet eine skalierbare Architektur, die für größere Bereitstellungen miteinander verbunden werden kann. Tenstorrent positioniert Wormhole als flexible Alternative zu GPUs und betont Programmierbarkeit sowie einen Fokus auf datenflussbasierte Berechnung.
Die erste Generation, Wormhole, wurde 2020 angekündigt und begann 2021 mit der Auslieferung. Es folgten Wormhole n150 im Jahr 2023, eine Einzelkartenversion, und Wormhole n300, eine Doppelkartenkonfiguration. Diese späteren Karten basieren auf einem 6-nm-Prozess und verfügen über einen RISC-V-basierten Steuerprozessor. Die Architektur ist darauf ausgelegt, sparse und dichte Tensoroperationen effizient zu verarbeiten, mit einem Fokus auf die Reduzierung von Speicherengpässen, die bei herkömmlichen GPU-Designs üblich sind.
Architektur und Design
Der Wormhole-Beschleuniger ist um ein Gitter aus Tensix-Kernen aufgebaut, die jeweils eine RISC-V-CPU, eine Matrixmultiplikationseinheit und eine Vektor-Engine enthalten. Dieses heterogene Design ermöglicht eine flexible Ausführung verschiedener neuronaler Netzwerkoperationen. Die Kerne sind über ein Hochbandbreiten-, Niedriglatenz-Mesh-Netzwerk miteinander verbunden, was eine effiziente Datenfreigabe und Skalierung über mehrere Chips ermöglicht. Im Gegensatz zu GPUs, die auf einem SIMT-Modell (Single Instruction, Multiple Thread) basieren, verwendet Wormhole eine Datenflussarchitektur, die für bestimmte Workloads, insbesondere solche mit unregelmäßigen Speicherzugriffsmustern, effizienter sein kann.
Jeder Tensix-Kern enthält dedizierten Speicher, wodurch die Notwendigkeit häufiger Off-Chip-Speicherzugriffe reduziert wird. Die n150-Karte verfügt über 72 Tensix-Kerne, während die n300 144 Kerne über zwei Dies hat. Die Karten unterstützen eine Reihe von Datentypen, einschließlich FP32, FP16, BF16 und INT8, was eine Präzisionsflexibilität bei Training und Inferenz ermöglicht. Die Architektur umfasst auch eine dedizierte Ethernet-Schnittstelle für die Skalierung auf Mehrkartensysteme, die ein Protokoll verwendet, das direkten Speicherzugriff zwischen Karten unterstützt.
Leistung und Spezifikationen
Die Wormhole n150 liefert bis zu 100 Teraflops FP16-Rechenleistung und 200 Teraops INT8-Rechenleistung, mit 16 GB GDDR6-Speicher, der eine Bandbreite von 256 GB/s bietet. Die n300 verdoppelt diese Werte und bietet 200 Teraflops FP16 und 400 Teraops INT8, mit 32 GB Speicher. Der Stromverbrauch wird mit 150 W für die n150 und 300 W für die n300 angegeben, was sie im Vergleich zu einigen konkurrierenden Beschleunigern relativ energieeffizient macht. Die Karten verwenden eine PCIe-Gen-4-x16-Schnittstelle für die Host-Konnektivität und können über Ethernet für Mehrkartenkonfigurationen miteinander verbunden werden.
In Benchmark-Tests hat Wormhole eine wettbewerbsfähige Leistung bei neuronale Netzwerk-Inferenzaufgaben gezeigt, insbesondere für Transformer-basierte Modelle. Tenstorrent hat Ergebnisse veröffentlicht, die eine lineare Skalierung der Leistung beim Hinzufügen mehrerer n150-Karten zeigen, ein Schlüsselmerkmal für groß angelegte Bereitstellungen. Die Karten unterstützen auch Modellparallelität und Datenparallelität, was ein effizientes Training großer Modelle über mehrere Beschleuniger ermöglicht.
Software-Stack
Tenstorrent bietet einen umfassenden Software-Stack für Wormhole, einschließlich eines Low-Level-Treibers, einer Laufzeitbibliothek und höherer Frameworks. Das primäre Programmiermodell basiert auf einer C++-API, aber es gibt auch Unterstützung für beliebte Frameworks für maschinelles Lernen. Das Unternehmen hat einen benutzerdefinierten Compiler entwickelt, der Modelle aus Frameworks wie PyTorch und ONNX in optimierten Code für die Tensix-Kerne übersetzt. Dieser Compiler führt Graph-Level-Optimierungen durch, einschließlich Operator-Fusion und Speicherplanung, um die Leistung zu maximieren.
Für Benutzer, die mit GPU-Programmierung vertraut sind, bietet Tenstorrent ein Programmiermodell, das einige der Low-Level-Details abstrahiert, während fortgeschrittene Benutzer weiterhin benutzerdefinierte Kernel schreiben können. Der Software-Stack enthält einen Debugger und Profiling-Tools zur Unterstützung der Entwicklung. Tenstorrent bietet auch eine Bibliothek mit voroptimierten Operatoren für gängige neuronale Netzwerkschichten wie Multi-Head-Attention und Residual-Netzwerk-Blöcke, die direkt in Modellen verwendet werden können.
Ökosystem und Integration
Wormhole-Karten sind als eigenständige PCIe-Karten für Workstations und Server sowie in vorkonfigurierten Systemen erhältlich. Tenstorrent hat Partnerschaften mit Systemintegratoren geschlossen, um schlüsselfertige Lösungen für KI-Forschung und -Produktion anzubieten. Die Karten sind auch über Cloud-Dienstanbieter verfügbar, sodass Benutzer sie auf Mietbasis nutzen können. Tenstorrent hat ein Software Development Kit (SDK) entwickelt, das Beispiele und Tutorials enthält, um die Lernkurve für neue Benutzer zu verkürzen.
Das Unternehmen hat auch ein Community-Forum und ein Dokumentationsportal eingerichtet, das ein Ökosystem von Entwicklern fördert. Wormhole unterstützt den Open-Panel-Standard, eine Spezifikation für modulare Computersysteme, die die Integration in heterogene Rechenzentrumsumgebungen ermöglicht. Dies erlaubt es, Wormhole-Karten mit anderen Beschleunigern wie denen von AMD oder Intel in einem einzigen System zu kombinieren.
Anwendungsfälle und Anwendungen
Wormhole ist hauptsächlich auf KI-Forschung und -Entwicklung ausgerichtet, insbesondere auf das Training und die Bereitstellung großer Sprachmodelle. Seine hohe Speicherbandbreite und effiziente Datenflussarchitektur machen es für Transformer-basierte Modelle geeignet, die in der Verarbeitung natürlicher Sprache weit verbreitet sind. Die Karten werden auch für Computer-Vision-Aufgaben wie Bildklassifizierung und Objekterkennung verwendet, wobei Architekturen wie U-Net und Residual-Netzwerke genutzt werden.
Zusätzlich zu traditionellen KI-Workloads wird Wormhole für wissenschaftliche Rechenanwendungen wie Simulationen und Datenanalysen untersucht. Seine Programmierbarkeit ermöglicht es Forschern, benutzerdefinierte Algorithmen über standardmäßige neuronale Netzwerkoperationen hinaus zu implementieren. Tenstorrent hat auch seine Verwendung in Edge-Computing-Szenarien hervorgehoben, wo die Energieeffizienz der Karten ein Vorteil ist.
Vergleich mit Wettbewerbern
Wormhole konkurriert mit KI-Beschleunigern von Unternehmen wie Groq, SambaNova und Graphcore sowie mit GPUs von NVIDIA und AMD. Im Vergleich zu GPUs bietet Wormhole ein anderes Programmiermodell und potenziell eine bessere Effizienz für bestimmte Workloads, hat aber ein kleineres Software-Ökosystem. Im Vergleich zu anderen KI-spezifischen Chips ist Wormholes Hauptunterscheidungsmerkmal der Fokus auf eine Datenflussarchitektur mit einer großen Anzahl von Kernen, die flexibler sein kann als die festfunktionalen Designs einiger Wettbewerber.
In Bezug auf die Rohleistung sind Wormholes Spezifikationen mit Midrange-GPUs wettbewerbsfähig, bleiben jedoch hinter den High-End-Angeboten zurück. Seine Skalierbarkeit und Energieeffizienz sind jedoch starke Verkaufsargumente. Tenstorrent hat auch die Offenheit seines Software-Stacks betont, was eine größere Anpassung im Vergleich zu proprietären Alternativen ermöglicht.
Entwicklung und zukünftige Roadmap
Tenstorrent entwickelt die Wormhole-Serie weiter, mit laufenden Software-Updates und Optimierungen. Das Unternehmen hat Pläne für zukünftige Generationen seiner Beschleuniger angekündigt, die auf den Erkenntnissen aus Wormhole aufbauen. Diese zukünftigen Chips sollen eine höhere Leistung und verbesserte Effizienz bieten, möglicherweise unter Verwendung fortschrittlicherer Fertigungsprozesse. Tenstorrent arbeitet auch an der Erweiterung seines Software-Ökosystems, einschließlich besserer Unterstützung für beliebte Frameworks und Tools.
Das Unternehmen hat erhebliche Finanzmittel erhalten und Partnerschaften mit verschiedenen Organisationen geschlossen, darunter Samsung Electronics und TSMC, für Fertigungs- und Technologiekooperationen. Dies positioniert Tenstorrent, um im sich schnell entwickelnden KI-Beschleunigermarkt weiterhin wettbewerbsfähig zu bleiben.
Rezeption und Auswirkungen
Wormhole wurde in der KI-Community für seine innovative Architektur und den Fokus auf Programmierbarkeit gut aufgenommen. Frühe Anwender haben seine Leistung bei Transformer-Modellen und die einfache Skalierung gelobt. Einige Benutzer haben jedoch festgestellt, dass der Software-Stack weniger ausgereift ist als der etablierter GPU-Anbieter, was mehr Aufwand zur Optimierung von Modellen erfordert. Trotzdem hat der Open-Source-Charakter einiger Komponenten eine Gemeinschaft von Entwicklern angezogen.
Die Auswirkungen von Wormhole gehen über das Produkt selbst hinaus, da es einen wachsenden Trend spezialisierter KI-Hardware repräsentiert, der die Dominanz von GPUs herausfordert. Sein Erfolg hat zum breiteren Ökosystem von KI-Beschleunigern beigetragen und bietet Forschern und Unternehmen mehr Optionen.
Fazit
Wormhole ist ein bedeutender Eintrag im KI-Beschleunigerbereich und bietet eine einzigartige Architektur, die Leistung, Effizienz und Flexibilität ausbalanciert. Sein Fokus auf Datenfluss-Computing und RISC-V-basierte Steuerung macht es zu einer deutlichen Alternative zu herkömmlichen GPUs. Obwohl es Herausforderungen bei der Software-Reife gibt, machen seine starken Skalierungsfähigkeiten und das wachsende Ökosystem es zu einer praktikablen Option für viele KI-Workloads. Da Tenstorrent weiterhin am Design arbeitet, werden Wormhole und seine Nachfolger wahrscheinlich eine wichtige Rolle in der Zukunft der KI-Hardware spielen.
Referenzen
Tenstorrent hat technische Dokumentationen und Leistungsbenchmarks für die Wormhole-Serie veröffentlicht, die über die offizielle Website verfügbar sind. Das Unternehmen hat auch auf verschiedenen Branchenkonferenzen präsentiert und die Architektur und Designentscheidungen detailliert beschrieben. Für weitere Informationen können interessierte Leser diese Ressourcen sowie unabhängige Bewertungen und Analysen von Technologiepublikationen konsultieren.