Der Tensor Processing Unit (TPU) ist ein anwendungsspezifischer integrierter Schaltkreis, der von Google entwickelt wurde, um speziell Machine-Learning-Workloads zu beschleunigen, insbesondere die Matrixmultiplikationen, die das Herzstück des Trainings neuronaler Netze und der Inferenz bilden. Im Gegensatz zu einer Allzweck-GPU ist ein TPU gezielt für Tensoroperationen ausgelegt und nicht dafür konzipiert, Grafiken zu rendern.
Geschichte
Google begann 2015 mit dem internen Einsatz von TPUs, um Dienste wie die Suchranking, die Texterkennung in Street View und die Zugbewertung von AlphaGo während seiner Spiele zu beschleunigen, und kündigte den Chip öffentlich auf seiner I/O-Konferenz 2016 an. Die erste TPU-Generation konzentrierte sich auf die Inferenz für bereits trainierte Modelle; die zweite Generation, die 2017 veröffentlicht wurde, fügte Unterstützung für das Training hinzu, und Google stellte TPUs externen Kunden über Google Cloud zur Verfügung. Aufeinanderfolgende Generationen - TPU v3 (2018), v4 (2021), v5 (2023) und Trillium (2024) - steigerten jeweils Leistung und Speicher, und Mitte der 2020er-Jahre bildeten TPUs große zusammengeschaltete Pods aus Tausenden von Chips, die zum Training von Googles eigenen Foundation-Modellen verwendet wurden, einschließlich der Gemini-Familie, und die auch über Google Cloud an externe Kunden vermietet wurden.
Design und Vergleich mit GPUs
TPUs basieren auf einer systolischen Array-Architektur, einem Gitter aus Verarbeitungselementen, die Daten in einem festen Rhythmus an benachbarte Elemente weitergeben. Diese ist hocheffizient für die wiederholten Matrixmultiplikationen im Deep Learning, aber weitaus weniger flexibel als eine GPU für allgemeine parallele Berechnungen. Diese Spezialisierung verleiht TPUs einen Effizienzvorteil pro Watt und pro Dollar für das Training und den Betrieb neuronaler Netze in großem Maßstab, auf Kosten einer geringeren Anpassungsfähigkeit an Nicht-Tensor-Workloads. Während Nvidias GPUs auf der weit verbreiteten CUDA-Softwareplattform laufen, werden TPUs hauptsächlich über TensorFlow und später PyTorch sowie JAX, Googles eigener numerischer Rechenbibliothek, programmiert, was ihnen ein kleineres, aber wachsendes Software-Ökosystem verleiht.
Bedeutung
TPUs sind eines der deutlichsten Beispiele dafür, dass ein großes KI-Labor sein eigenes Chipdesign vertikal integriert, anstatt sich ausschließlich auf Handels-Silizium von Zulieferern wie Nvidia zu verlassen. Diese Strategie wurde später von anderen Unternehmen aufgegriffen, die maßgeschneiderte KI-Beschleuniger entwickeln, wie etwa Amazons Trainium und Metas MTIA, als die Nachfrage nach Trainings- und Inferenzkapazitäten für große Sprachmodelle während des KI-Booms der 2020er-Jahre wuchs. Da TPUs hauptsächlich über Google Cloud und nicht als eigenständige Hardware erhältlich sind, haben sie einen kleineren Anteil am gesamten KI-Beschleunigermarkt als GPUs, bilden jedoch die Grundlage für Googles interne KI-Infrastruktur, einschließlich Trainingsläufen für seine größten Modelle, und werden von Google als ein wesentlicher Grund angeführt, warum es mit Konkurrenten konkurrieren kann, die stärker von externer GPU-Versorgung abhängig sind.