ワームホール(テンストーレント)

英語からの翻訳

Wormholeは、Tenstorrentによって開発されたAIアクセラレータカードのシリーズであり、高性能なディープラーニングおよび大規模言語モデルの推論とトレーニングワークロード向けに設計されています。

Wormholeは、ファブレス半導体企業であるTenstorrentが製造するAIアクセラレータカードのファミリーです。これらのカードは、人工知能および機械学習のワークロード、特に深層学習モデル(大規模言語モデルトランスフォーマーベースのアーキテクチャなど)を加速するように設計されています。Wormholeシリーズは推論とトレーニングの両方のタスクを対象としており、より大規模な展開のためにリンクできるスケーラブルなアーキテクチャを提供します。TenstorrentはWormholeをGPUの柔軟な代替策として位置づけ、プログラマビリティとデータフローに基づく計算への重点を強調しています。

第一世代のWormholeは2020年に発表され、2021年に出荷が開始されました。その後、2023年にはシングルカード版のWormhole n150と、デュアルカード構成のWormhole n300が続きました。これらの後期カードは6nmプロセスで製造され、RISC-Vベースの制御プロセッサを搭載しています。このアーキテクチャは、スパースおよびデンスなテンソル操作を効率的に処理するように設計されており、従来のGPU設計に共通するメモリボトルネックの削減に重点を置いています。

アーキテクチャと設計

Wormholeアクセラレータは、Tensixコアのグリッドを基盤として構築されており、各コアにはRISC-V CPU、行列乗算ユニット、ベクトルエンジンが含まれています。このヘテロジニアスな設計により、さまざまなニューラルネットワーク操作を柔軟に実行できます。コアは高帯域幅、低レイテンシのメッシュネットワークを介して相互接続されており、複数のチップ間での効率的なデータ共有とスケーリングを可能にします。SIMT(Single Instruction, Multiple Thread)モデルに依存するGPUとは異なり、Wormholeはデータフローアーキテクチャを使用しており、特に不規則なメモリアクセスパターンを伴う特定のワークロードに対してより効率的です。

各Tensixコアには専用メモリが含まれており、オフチップメモリへの頻繁なアクセスを削減します。n150カードには72個のTensixコアがあり、n300には2つのダイにわたって144個のコアがあります。これらのカードは、FP32、FP16、BF16、INT8を含むさまざまなデータ型をサポートしており、トレーニングと推論での精度の柔軟性を提供します。アーキテクチャには、専用のイーサネットインターフェイスも含まれており、カード間の直接メモリアクセスをサポートするプロトコルを使用して、マルチカードシステムへのスケールアウトを可能にします。

パフォーマンスと仕様

Wormhole n150は、最大100テラFLOPSのFP16計算と200テラOPSのINT8計算を提供し、16 GBのGDDR6メモリで256 GB/sの帯域幅を実現します。n300はこれらの数値を倍増させ、FP16で200テラFLOPS、INT8で400テラOPS、32 GBのメモリを提供します。消費電力はn150で150W、n300で300Wと評価されており、一部の競合アクセラレータと比較して比較的電力効率が高いです。これらのカードはホスト接続にPCIe Gen 4 x16インターフェイスを使用し、マルチカード構成ではイーサネットを介して相互接続できます。

ベンチマークテストでは、Wormholeはニューラルネットワーク推論タスク、特にトランスフォーマーベースのモデルで競争力のあるパフォーマンスを示しています。Tenstorrentは、複数のn150カードを追加した際のパフォーマンスが線形にスケーリングすることを示す結果を公開しており、これは大規模展開の重要な機能です。これらのカードはモデル並列とデータ並列もサポートしており、複数のアクセラレータを使用した大規模モデルの効率的なトレーニングを可能にします。

ソフトウェアスタック

TenstorrentはWormhole向けの包括的なソフトウェアスタックを提供しており、低レベルドライバー、ランタイムライブラリ、高レベルフレームワークが含まれます。主要なプログラミングモデルはC++ APIに基づいていますが、一般的な機械学習フレームワークのサポートもあります。同社はカスタムコンパイラを開発しており、PyTorchやONNXなどのフレームワークからモデルをTensixコア用の最適化されたコードに変換します。このコンパイラは、オペレーター融合やメモリプランニングなどのグラフレベルの最適化を実行して、パフォーマンスを最大化します。

GPUプログラミングに精通したユーザーには、Tenstorrentは低レベルの詳細の一部を抽象化するプログラミングインターフェイスを提供しつつ、高度なユーザーがカスタムカーネルを記述することも可能にします。ソフトウェアスタックには、開発を支援するデバッガとプロファイリングツールが含まれています。Tenstorrentは、マルチヘッドアテンション残差ネットワークなどの一般的なニューラルネットワーク操作のための事前最適化された演算子ライブラリも提供しており、モデルで直接使用できます。

エコシステムと統合

Wormholeカードは、ワークステーションやサーバー用のスタンドアロンPCIeカードとして、また事前構成されたシステムとして利用可能です。Tenstorrentはシステムインテグレータと提携して、研究および本番環境向けのターンキーソリューションを提供しています。これらのカードはクラウドプロバイダーを通じてレンタルベースでアクセスすることも可能です。Tenstorrentは、学習曲線を短縮することを目的とした例やチュートリアルを含むソフトウェア開発キット(SDK)も開発しています。

同社はまた、コミュニティフォーラムとドキュメントポータルを作成し、開発者のエコシステムを支援しています。Wormholeは、モジュラーコンピュートシステムの仕様である開放型コンピュートプロジェクト標準をサポートしており、異種データセンター環境への統合を可能にします。これにより、WormholeをAMDNVIDIAなどの他のアクセラレータと同一システムで組み合わせることができます。

ユースケースと統合

Wormholeは主にAI研究と展開、特に大規模言語モデルのトレーニングと推論を対象としています。その高いメモリ帯域幅と効率的なデータフローアーキテクチャは、自然言語処理で広く使用されるトランスフォーマーモデルに適しています。また、畳み込みニューラルネットワークや残差ネットワークなどのアーキテクチャを用いた画像分類や物体検出などのコンピュータビジョンタスクにも使用されます。

Wormholeカードは、ワークステーションやサーバー向けのスタンドアロンPCIeカードとして、また事前構成済みシステムとして利用可能です。Tenstorrentはシステムインテグレータと提携し、AI研究と本番運用向けのターンキーソリューションを提供しています。また、クラウドプロバイダーを通じてレンタルベースでアクセスすることも可能です。Tenstorrentは、初心者向けの例やチュートリアルを含むソフトウェア開発キット(SDK)を提供しており、学習曲線を短縮しています。

レセプションと影響

Wormholeは、その革新的なアーキテクチャとプログラマビリティの強調により、AIコミュニティで注目を集めています。特に、大規模言語モデルのトレーニングにおけるスケーラビリティと電力効率が評価されています。ただし、ソフトウェアエコシステムはまだ成熟途上であり、一部のユーザーはGPUベースのフレームワークと比較して追加の最適化作業が必要だと指摘しています。

将来の見通し

TenstorrentはWormholeシリーズの継続的な開発を計画しており、将来の世代では性能の向上と新しい機能の追加が期待されています。同社はまた、ソフトウェアスタックの拡張に注力しており、AIアクセラレータ市場での競争力を強化しています。

結論

Wormholeは、性能、効率、柔軟性のバランスを提供する独自のアーキテクチャで、AIアクセラレータ市場における重要な参入を示しています。ソフトウェアの成熟度やエコシステムのサポートという課題は残るものの、そのスケーラビリティとプログラマビリティは、多様なAIワークロードにとって魅力的な選択肢となっています。AIハードウェアの状況が進化し続ける中、Wormholeとその後継製品は、GPU中心の計算への代替手段を提供する上で重要な役割を果たす可能性があります。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:ai-accelerator·hardware·tenstorrent·deep-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴