英語からの翻訳

TPU v1は、Googleの初代テンソル処理ユニットであり、ニューラルネットワーク推論用のカスタムASICである。2016年に発表され、機械学習ワークロードにおいて、当時のCPUやGPUと比較して15〜30倍の性能向上と、30〜80倍の電力効率の改善を実現している。

TPU v1は、Googleがニューラルネットワークの推論を高速化するために開発したカスタム特定用途向け集積回路(ASIC)である、初代Tensor Processing Unitである。2015年に社内で導入され、2016年5月のGoogle I/Oで公に発表された。このチップはTensorFlowフレームワーク専用に設計されており、高容量・低精度の計算、主に8ビット整数を用いた計算に最適化されたシストリックアレイ行列乗算エンジンである。Googleのデータセンター全体に展開され、検索、ストリートビュー、フォトなどのサービスを支えた。

汎用プロセッサとは異なり、TPU v1はニューラルネットワークの特定の計算パターンを大規模に処理するために構築された。そのアーキテクチャは、初期のシストリックアレイシステムであるWARPと系譜を共有しており、Googleにおける3つの競合するAIアクセラレータ設計の中から選ばれた。開発はNorman P. Jouppiがテックリード兼主任アーキテクトとして率い、Amir Salekが2013年にGoogleのカスタムシリコン部門を設立した。このチップは設計から製造までわずか15ヶ月で完了し、カスタムASICとしては異例の速さであった。

アーキテクチャと仕様

TPU v1は、PCIe 3.0バスを介してホストプロセッサから複雑命令セットコンピュータ(CISC)命令によって駆動される8ビット行列乗算エンジンである。28 nmプロセスで製造され、ダイサイズは最大331 mm²である。このチップは700 MHzのクロック速度で動作し、熱設計電力は28〜40 Wであり、対象とするワークロードに対して非常にエネルギー効率が高い。

主要コンポーネントには、28 MiBのオンチップメモリと、256×256の8ビット乗算器のシストリックアレイからの結果を収集する4 MiBの32ビットアキュムレータが含まれる。パッケージには、8 GiBのデュアルチャネル2133 MHz DDR3 SDRAMが含まれ、34 GB/sのメモリ帯域幅を提供する。命令は、ホストとのデータ転送、行列乗算または畳み込みの実行、活性化関数の適用を処理し、推論に必要な中核的な操作をカバーする。

パフォーマンスと展開

2017年に第44回国際コンピュータアーキテクチャシンポジウム(ISCA 2017)で発表された画期的な論文「In-Datacenter Performance Analysis of a Tensor Processing Unit」において、Jouppiらは、TPU v1が当時のCPUおよびGPUと比較して15〜30倍の性能と、30〜80倍のワットあたりの性能を達成したことを実証した。これにより、このチップは大規模なニューラルネットワーク推論の基盤プラットフォームとして確立された。

Googleは生産サービス全体にTPUを展開した。Googleストリートビューのテキスト処理では、このチップはデータベース内のすべてのテキストを5日以内に見つけた。Googleフォトでは、単一のTPUが1日あたり1億枚以上の写真を処理できた。このチップはまた、Googleが検索結果の改善に使用するRankBrainも支え、AlphaGo対李世乭の囲碁対局やAlphaZeroシステムにも使用された。

GPUおよびCPUとの比較

TPUは、ラスタライゼーションやテクスチャマッピング用のハードウェアを備えず、1ジュールあたりの入出力操作が多い、高容量・低精度の計算用に設計されている。これにより、多くの推論タスクを支配する畳み込みニューラルネットワーク(CNN)に適している。対照的に、GPUは一部の完全結合ニューラルネットワークに利点があり、CPUはリカレントニューラルネットワーク(RNN)に利点がある場合がある。

プロセッサの種類によって、対応する機械学習モデルは異なる。大規模言語モデルで使用されるトランスフォーマーベースのニューラルネットワークでは、推論にはTPUが、トレーニングにはGPUが使用されることが多い。TPU ASICは、データセンターラック内のハードドライブスロットに収まるヒートシンクアセンブリに取り付けられており、高密度展開を容易にしている。

遺産と影響

TPU v1の成功は、トレーニング用のbfloat16浮動小数点サポートを導入したTPU v2を含む後続世代への道を開いた。Broadcomは共同開発者として、Googleのアーキテクチャを製造可能なシリコンに変換し、TSMCなどのファウンドリを通じて製造を管理してきた。このチップの設計は、より広範なAIアクセラレータの状況に影響を与え、他のベンダーも組み込み市場やロボティクス市場向けに同様の製品を開発している。

Googleは2018年に、Google Cloud Platform上のCloud TPUサービスを通じて、またKaggleやColaboratoryなどのノートブックベースのサービスを通じて、TPUを第三者に利用可能にした。TPU v1は人工知能ハードウェアにおける画期的な成果であり、機械学習ワークロードに対するドメイン固有プロセッサの価値を実証している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:hardware·google·ai-accelerator·tensor-processing-unit
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴