英語からの翻訳

TPU v2は、Googleの第2世代Tensor Processing Unitであり、2017年5月に発表され、bfloat16浮動小数点サポートと16 GBのHigh Bandwidth Memoryを特徴とし、機械学習モデルのトレーニングと推論の両方を可能にします。

TPU v2は、Googleがニューラルネットワークの機械学習ワークロードを高速化するために開発したカスタム特定用途向け集積回路(ASIC)である、第2世代のTensor Processing Unitである。2017年5月に発表され、初代TPUの後継として、浮動小数点演算の実行能力や、Google Brainが発明したbfloat16形式の採用など、重要なアーキテクチャ上の改良を導入した。これにより、TPU v2は整数演算に限定されていた前世代とは異なり、機械学習モデルのトレーニングと推論の両方に適したものとなった。TPU v2はGoogle CloudのCloud TPUサービスを通じて第三者に提供され、Google自身の本番システムでも、Transformerベースのモデルや大規模言語モデルを含む幅広い用途で広く使用された。

TPU v2は、初代TPUのメモリ帯域幅の制限に対処するために設計された。16 GBのHigh Bandwidth Memory(HBM)を搭載することで、第2世代の設計はメモリ帯域幅を600 GB/sに向上させ、チップあたり45テラFLOPSの性能を実現した。これらのチップは4チップモジュールに構成され、合計180テラFLOPSの性能を達成した。さらに、これらのモジュール64個が256チップのポッドに組み立てられ、合計11.5ペタFLOPSの性能を提供した。このスケーラブルなアーキテクチャにより、Googleはニューラルネットワークディープラーニングを含む大規模な機械学習タスクにTPU v2システムを展開することができた。

開発と歴史

TPU v2の開発は、GoogleのCustom Siliconグループを設立して率いたAmir Salekが主導し、Norman P. JouppiがTPUプログラム全体のテックリード兼主任アーキテクトを務めた。初代TPUはわずか15ヶ月で本番稼働に投入され、v2はその基盤の上に構築された。初代TPUのエンジニアの一人であり、後にGroqを設立したJonathan Rossによると、シストリックアレイアーキテクチャを使用するTPU設計は、Googleでの3つの競合するAIアクセラレータ提案の中から選ばれた。TPU v2は、業界初の本番向けディープラーニングトレーニングチップであり、AI向けカスタムシリコンのマイルストーンとなった。BroadcomはTPU v2を共同開発し、Googleのアーキテクチャを製造可能なシリコンに変換し、TSMCなどのファウンドリを通じて製造を管理した。

技術仕様

TPU v2は、整数演算と浮動小数点演算の両方をサポートする行列乗算エンジンである。その主要な革新は、従来の16ビット形式よりも広いダイナミックレンジを提供しながら、メモリと帯域幅の消費が少ない16ビット浮動小数点表現であるbfloat16形式の導入であった。これにより、ディープニューラルネットワークのトレーニングに特に効果的となった。各TPU v2チップには、乗算器と加算器のシストリックアレイと、600 GB/sの帯域幅を提供する16 GBのHBMが含まれている。チップは4チップモジュールで相互接続され、これらのモジュールはより大きなポッドに組み合わされる。256チップのポッド構成は11.5ペタFLOPSを提供し、Transformerや他の大規模言語モデルのトレーニングなどのタスクのための大規模な並列計算を可能にする。

アプリケーションと使用

GoogleはTPU v2システムをさまざまな本番アプリケーションで使用した。これらは、AlphaGo対Lee Sedolの囲碁対局シリーズや、ゲームのルールのみからチェス、将棋、囲碁を学習したAlphaZeroシステムで採用された。TPUはGoogle Street Viewのテキスト処理にも使用され、Street Viewデータベース内のすべてのテキストを5日未満で抽出することを可能にした。Google Photosでは、単一のTPUで1日あたり1億枚以上の写真を処理できた。さらに、TPU v2は検索結果を提供するGoogleのシステムであるRankBrainでも使用された。Google CloudのCloud TPUサービスを通じて、第三者は独自の機械学習ワークロードにTPU v2をアクセスでき、TensorFlow、JAX、PyTorchなどのフレームワークをサポートした。

GPUとの比較

GPUと比較して、TPUは1ジュールあたりの入出力操作が多く、大量の低精度計算向けに設計されている。ラスタライゼーションやテクスチャマッピング用のハードウェアを欠き、代わりに行列演算に焦点を当てている。TPUは畳み込みニューラルネットワーク(CNN)に適しており、GPUは一部の完全結合ニューラルネットワークに利点があり、CPUはリカレントニューラルネットワーク(RNN)に利点がある場合がある。大規模言語モデル用のTransformerベースのニューラルネットワークを含むワークフローでは、TPUは推論に使用されることが多く、GPUはトレーニングに頻繁に使用される。この役割分担は、各プロセッサタイプの異なる強みを反映しており、TPUは多くの現代のAIモデルに見られる特定の計算パターンに優れている。

遺産と影響

TPU v2は、2018年5月8日に発表され、チップあたりの性能が2倍で、ポッドのチップ数が4倍となったTPU v3を含む、その後のGoogleのTPUハードウェア世代のテンプレートを確立した。bfloat16の導入はAIハードウェアエコシステムに永続的な影響を与え、他のアクセラレータ設計に影響を与えた。2025年の時点で、Google CloudはTPUシステムの販売から多大な製品収益を生み出しており、Googleはさまざまな「ネオクラウド」やMetaなどの企業と、データセンターへのTPU展開について協議を行っている。TPU v2は、人工知能ハードウェアの歴史における基盤的プラットフォームであり続け、機械学習におけるカスタムシリコンの価値を実証している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:hardware·google·machine-learning·ai-accelerator
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴