Graphcore Limited是一家英国半导体公司,开发用于人工智能和机器学习的加速器。其旗舰产品智能处理单元(IPU)是一种大规模并行处理器,旨在将整个机器学习模型容纳在芯片内部,从而减少内存与计算之间频繁的数据移动需求。该公司成立于2016年,在2024年被软银集团收购之前,已成为AI硬件领域的重要参与者。
IPU架构与传统GPU不同,它使用大量小型处理核心(称为tiles),每个核心拥有自己的本地内存。这种设计允许对模型参数和激活值进行高带宽、低延迟的访问,特别适合深度学习工作负载,例如大型语言模型的训练和推理。Graphcore还开发了Poplar软件栈,以支持流行的机器学习框架,如TensorFlow和PyTorch。
历史
Graphcore由Simon Knowles和Nigel Toon于2016年创立,两人都是半导体行业的资深人士。公司迅速吸引了风险投资,首轮融资由Robert Bosch Venture Capital于2016年秋季领投,并获得了三星、Amadeus Capital Partners、C4 Ventures、Draper Esprit、Foundation Capital和Pitango的额外支持。2017年7月,由Atomico领投的B轮融资之后,又获得了红杉资本的5000万美元投资。到2018年12月,Graphcore完成了2亿美元的D轮融资,估值达到17亿美元,使其成为独角兽企业,投资者包括微软、三星和戴尔科技。
2019年11月,Graphcore宣布其C2 IPU卡可在Microsoft Azure上进行预览,标志着重要的云部署。2023年初,Meta Platforms收购了Graphcore的AI网络技术团队,但公司继续其核心业务。2024年7月,软银集团同意以约5亿美元收购Graphcore,该交易正在接受英国商业部投资安全部门的审查。
产品与技术
Graphcore的首个产品公告于2016年发布,即Poplar软件栈,被描述为世界上首个用于机器智能的图工具链。2017年7月,公司推出了其首款芯片Colossus GC2,这是一款16纳米的大规模并行、混合精度浮点处理器,于2018年上市。GC2以双芯片形式封装在单张PCI Express卡上,称为Graphcore C2 IPU,旨在与标准机器学习框架配合使用时发挥与GPU相同的作用。该设备依赖暂存内存来提升性能,而非传统的缓存层次结构。
2020年7月,Graphcore推出了其第二代处理器GC200,采用台积电的7纳米FinFET工艺制造。GC200是一款拥有590亿个晶体管、面积为823平方毫米的集成电路,包含1,472个计算核心和900兆字节的本地内存。2022年,Graphcore与台积电推出了Bow IPU,这是一种3D封装,将GC200芯片与电源传输芯片面对面键合,从而在较低核心电压下实现更高的时钟频率。公司还概述了一个长期目标,称为“Good machine”,以I.J. Good命名,旨在支持参数数量超过人脑突触数量的AI模型。
架构细节
GC2和GC200芯片均支持每个tile运行6个线程,分别产生7,296和8,832个线程。该架构使用MIMD(多指令多数据)并行性,分布式本地内存是设备上唯一的内存形式(寄存器除外)。较旧的GC2芯片每个tile拥有256 KiB内存,而较新的GC200每个tile约有630 KiB内存,排列成4个tile的岛,然后这些岛排列成列;在tile内部延迟最低。IPU支持带有随机舍入的IEEE FP16,以及性能较低的单精度FP32。本地执行的代码和数据必须适合单个tile,但消息传递允许使用所有片上或片外内存,AI软件使这一点透明化,包括PyTorch支持。
市场地位与影响
Graphcore将自己定位为AI加速器市场中英伟达的挑战者,专注于一种独特架构,既不同于GPU,也不同于Cerebras或Groq等其他AI芯片。其IPU特别针对神经网络模型的训练和推理,早期采用者包括Microsoft Azure和各种研究机构。2024年被软银收购被视为增强软银AI雄心的战略举措,尽管该交易在英国面临监管审查。Graphcore的技术继续在云和企业环境中使用,其软件栈仍是活跃的开发领域。
参见
- AI加速器
- 大规模并行处理器阵列