2024年4月,AI芯片制造商英伟达宣布收购Run:ai,这是一家开发用于管理和编排GPU集群软件的以色列初创公司。该交易估值约7亿美元,在获得监管批准后于2024年下半年完成。此次收购凸显了英伟达将其主导地位从硬件扩展到软件层的努力,该软件层优化了AI模型(尤其是大型语言模型)在基于GPU的基础设施上的训练和部署方式。
Run:ai由奥姆里·盖勒和罗南·达尔博士于2018年创立,两人均为特拉维夫大学前研究员。该公司迅速在运行需要大规模计算的Generative AI工作负载的企业中获得关注。其旗舰平台提供了一层抽象,使组织能够汇集GPU、高效调度作业并动态分配资源,解决了模型训练和Inference (AI)时代的关键瓶颈。在被收购前,Run:ai已通过风险投资筹集了约1.18亿美元,投资方包括Insight Partners和Tiger Global。
背景与商业案例
在过去几年中,大型神经网络的训练在计算需求上呈爆炸式增长。Transformer架构的兴起(为GPT-4和OpenAI的模型等系统提供动力)将GPU利用率推到了运营效率的前沿。许多组织发现其昂贵的GPU集群未被充分利用,有时因作业调度效率低下或资源碎片化而闲置。英伟达作为硬件供应商,观察到了这一痛点,并寻求提供完整的解决方案以吸引和留住客户。
英伟达的软件业务,包括CUDA编程模型及其快速增长的AI Enterprise套件,已成为重要的收入来源。通过收购Run:ai,英伟达旨在集成一个调度器,该调度器能够跨集群甚至跨不同供应商(如Microsoft Azure、Amazon Web Services、Google Cloud和VMware环境)联合GPU。此举将英伟达定位为不仅仅是芯片制造商,更是AI计算编排者。
Run:ai的产品与技术
Run:ai的核心产品包括基于Kubernetes的稳健性,可处理GPU分区、动态虚拟GPU实例,以及支持基于策略触发作业的调度器。它支持多种常用于Deep learning的框架,包括PyTorch和TensorFlow,并与MLflow和Kubeflow等流行工具集成。处理多GPU作业的技术(涉及Batch Normalization或其他模型优化)不得不被撤销,但该平台提供每GPU多路复用,在许多客户部署中将利用率从典型的40%提高到80%以上。
此外,Run:ai推出了一项名为“AI控制平面”的功能,允许数据科学家和工程师将硬件与运行的工作负载解耦,自动扩展计算资源。这将作业提交时间等指标从数小时缩短至数分钟,并为负责人提供了跨部门的成本和用量可见性。
财务细节与估值
最初,有报道称交易价值为7亿美元,但随后几周多家媒体称该数字接近10亿美元。英伟达拒绝就具体数字置评,但根据美国证券交易委员会的监管文件,最终成交价为7亿美元,包括现金和股票。该交易的结构使得Run:ai员工将并入英伟达位于以色列的研发中心,这是该公司在美国以外最大的研究基地之一;截至交易完成时,最终有数百名Run:ai员工加入。
该交易在无重大条件下获批,尤其是因为两家公司在AI调度器市场中均未占据足以扣留GPU的主导地位。此前,Run:ai拥有约100家企业客户,包括英伟达合作伙伴Etsy和金融机构等知名企业。
对行业的战略影响
在AI基础设施层面,此次收购标志着整合趋势。英伟达的竞争对手和客户均对此关注。AMD和Intel已推出对应产品,如AMD的开源ROCm堆栈。此举加剧了AI处理领域的平台之争,其中软件与硬件同等重要。它还促使Amazon Web Services等超大规模云服务商加大对其定制芯片(如AWS Trainium和Inference (AI)芯片)的投入,以差异化其产品。
此次收购还推动了关于私有云和公有云中GPU资源抽象的讨论。企业IT团队对此表示欢迎,希望在云和本地环境之间实现更无缝的扩展,这可能减少供应商锁定,尽管由英伟达运营的潜在影响仍有待观察。
监管与竞争审查
欧洲监管机构根据标准反垄断规则审查了该合并案。2024年12月,欧盟委员会在未要求让步的情况下批准了该交易,指出Run:ai在编排市场的份额有限。英伟达在硬件方面继续领先,但软件市场仍处于新兴阶段。同样,美国联邦贸易委员会决定不对此合并提出异议,尽管科技巨头在芯片和AI生态系统控制方面面临更广泛的审查。
IBM和Graphcore等竞争对手迅速采取行动,深化自身的调度器能力。例如,Graphcore推出了PopGrid,而Intel的oneAPI集合一直在构建开放生态系统。
整合与未来路径
在2024年11月完成交易后,英伟达开始将Run:ai的技术整合到其现有工具中,如NVIDIA AI Enterprise和NVIDIA Base Command。收购后的首批发布之一是与vGPU许可统一资源管理功能的“Run:AI on Nvidia AI Stack”。在交易完成后的第一个季度,英伟达表示Run:ai平台已向所有DGX客户提供,使其能够以最优资源调度运行工作负载。
未来,英伟达已宣布计划开放该平台,以支持GPU以外的加速器,包括定制ASIC,用于运行卡内基梅隆式研究框架的集群。
竞争对手的回应
AMD于2024年底宣布了自己的“无限光纤”调度软件。SambaNova Systems扩展了其云服务,提供自己的虚拟GPU控制,Groq则原生实现了多个动态调度器。围绕AI计算编排的整体竞争正在升温,迫使英伟达与第三方建立更强大的生态系统。
此次收购不仅巩固了英伟达在以色列的业务版图(截至2025年,当地员工超过1000人),还引发了对生态系统内软件层初创公司的多项其他投资,例如此前已被Microsoft (AI)收购的deepspeed(在2024年之前)。
对Run:ai客户的影响
Run:ai的客户最初对迁移至英伟达云堆栈持怀疑态度。然而,英伟达提供了长期权利和连续性计划,向合作伙伴保证了技术支持。截至2025年年中,该平台仍被大规模提供AI服务的设施和公司广泛使用,如huggingface和商业应用。
总体而言,英伟达与Run:ai的收购是一个战略里程碑,进一步巩固了英伟达不仅在GPU领域,而且在充分发挥AI计算潜力所需软件方面的核心地位。
参见
- NVIDIA-based AI芯片
- cloud-computing
- k8s (Kubernetes)