Wormhole是Tenstorrent(一家无晶圆厂半导体公司)生产的AI加速卡系列。这些卡旨在加速人工智能和机器学习工作负载,特别是深度学习模型,如大型语言模型和基于变换器的架构。Wormhole系列同时面向推理和训练任务,提供可扩展的架构,可链接在一起用于更大规模的部署。Tenstorrent将Wormhole定位为GPU的灵活替代品,强调可编程性和对基于数据流计算的关注。
第一代Wormhole于2020年发布,并于2021年开始出货。随后在2023年推出了Wormhole n150(单卡版本)和Wormhole n300(双卡配置)。这些后续卡基于6nm工艺制造,并配备基于RISC-V的控制处理器。该架构旨在高效处理稀疏和密集张量操作,重点是减少传统GPU设计中常见的存储器瓶颈。
架构与设计
Wormhole加速器围绕Tensix核心网格构建,每个核心包含一个RISC-V CPU、一个矩阵乘法单元和一个向量引擎。这种异构设计允许灵活执行各种神经网络操作。核心通过高带宽、低延迟的网格网络互连,实现高效的数据共享和多芯片扩展。与依赖SIMT(单指令、多线程)模型的GPU不同,Wormhole使用数据流架构,对于某些工作负载(尤其是具有不规则内存访问模式的工作负载)可能更高效。
每个Tensix核心包含专用内存,减少了对片外内存访问的需求。n150卡具有72个Tensix核心,而n300在两个芯片上共有144个核心。这些卡支持多种数据类型,包括FP32、FP16、BF16和INT8,允许在训练和推理中灵活调整精度。该架构还包括专用的以太网接口,用于扩展到多卡系统,使用支持卡间直接内存访问的协议。
性能与规格
Wormhole n150提供高达100 teraflops的FP16计算和200 teraops的INT8计算,配备16 GB GDDR6内存,提供256 GB/s的带宽。n300将这些数字翻倍,提供200 teraflops的FP16和400 teraops的INT8,内存为32 GB。功耗额定为n150的150W和n300的300W,与一些竞争加速器相比,相对节能。这些卡使用PCIe Gen 4 x16接口进行主机连接,并可通过以太网互连用于多卡配置。
在基准测试中,Wormhole在神经网络推理任务中表现出竞争力,尤其是对于基于变换器的模型。Tenstorrent已发布结果显示,添加多个n150卡时性能线性扩展,这是大规模部署的关键特性。这些卡还支持模型并行和数据并行,使跨多个加速器高效训练大型模型成为可能。
软件栈
Tenstorrent为Wormhole提供全面的软件栈,包括低级驱动程序、运行时库和更高级的框架。主要编程模型基于C++ API,但也支持流行的机器学习框架。该公司开发了一个自定义编译器,可将PyTorch和ONNX等框架的模型转换为针对Tensix核心优化的代码。该编译器执行图级优化,包括算子融合和内存规划,以最大化性能。
对于熟悉GPU编程的用户,Tenstorrent提供了一种编程模型,抽象了一些低级细节,同时仍允许高级用户编写自定义内核。软件栈包括调试器和性能分析工具,以辅助开发。Tenstorrent还提供预优化算子库,用于常见神经网络层,如多头注意力和残差网络块,可直接用于模型。
生态系统与集成
Wormhole卡可作为独立PCIe卡用于工作站和服务器,也可用于预配置系统。Tenstorrent已与系统集成商合作,为AI研究和生产提供交钥匙解决方案。这些卡也可通过云服务提供商获得,允许用户按需租用。Tenstorrent开发了软件开发工具包(SDK),包括示例和教程,旨在降低新用户的学习曲线。
该公司还创建了社区论坛和文档门户,促进了开发者生态系统的形成。Wormhole支持开放面板标准,这是模块化计算系统的规范,使其能够集成到异构数据中心环境中。这允许Wormhole卡与AMD或英特尔等其他加速器在同一系统中组合使用。
用例与应用
Wormhole主要面向AI研究和开发,特别是训练和部署大型语言模型。其高内存带宽和高效的数据流架构使其适用于基于变换器的模型,这些模型广泛用于自然语言处理。这些卡还用于计算机视觉任务,如图像分类和物体检测,利用U-Net和残差网络等架构。
除了传统AI工作负载外,Wormhole还被探索用于科学计算应用,如模拟和数据分析。其可编程性允许研究人员实现超越标准神经网络操作的自定义算法。Tenstorrent还强调了其在边缘计算场景中的用途,其中卡的能效是一个优势。
与竞争对手的比较
Wormhole与Groq、SambaNova和Graphcore等公司的AI加速器竞争,也与NVIDIA和AMD的GPU竞争。与GPU相比,Wormhole提供了不同的编程模型,并在某些工作负载上可能具有更好的效率,但软件生态系统较小。与其他AI专用芯片相比,Wormhole的主要差异化在于其专注于具有大量核心的数据流架构,这比一些竞争对手的固定功能设计更灵活。
在原始性能方面,Wormhole的规格与中端GPU相当,但落后于最高端产品。然而,其可扩展性和能效是强有力的卖点。Tenstorrent还强调了其软件栈的开放性,允许比专有替代方案更大的定制化。
发展与未来路线图
Tenstorrent继续开发Wormhole系列,持续进行软件更新和优化。该公司已宣布计划推出未来几代加速器,基于从Wormhole中吸取的经验教训。这些未来芯片预计将提供更高的性能和改进的效率,可能使用更先进的制造工艺。Tenstorrent还在扩大其软件生态系统,包括更好地支持流行框架和工具。
该公司已获得大量资金,并与包括三星电子和台积电在内的各种组织建立了制造和技术合作伙伴关系。这使Tenstorrent能够在快速发展的AI加速器市场中继续竞争。
反响与影响
Wormhole因其创新架构和对可编程性的关注而在AI社区受到好评。早期采用者称赞其在变换器模型上的性能和易于扩展性。然而,一些用户指出,软件栈不如成熟的GPU供应商成熟,需要更多努力来优化模型。尽管如此,某些组件的开源性质吸引了开发者社区。
Wormhole的影响不仅限于产品本身,它代表了挑战GPU主导地位的专业AI硬件增长趋势。其成功为AI加速器的更广泛生态系统做出了贡献,为研究人员和公司提供了更多选择。
结论
Wormhole是AI加速器领域的重要产品,提供了独特的架构,平衡了性能、效率和灵活性。其对数据流计算和基于RISC-V控制的关注使其成为传统GPU的独特替代品。虽然它在软件成熟度方面面临挑战,但其强大的扩展能力和不断增长的生态系统使其成为许多AI工作负载的可行选择。随着Tenstorrent继续迭代设计,Wormhole及其后继产品可能在AI硬件的未来中发挥重要作用。
参考文献
Tenstorrent已发布Wormhole系列的技术文档和性能基准,可通过其官方网站获取。该公司还在各种行业会议上介绍了架构和设计选择。如需更多信息,感兴趣的读者可以查阅这些资源,以及来自技术出版物的独立评论和分析。