2024年4月,AI芯片制造商英伟达宣布收购Run:ai,这是一家开发用于管理和编排GPU集群软件的以色列初创公司。这笔交易估值约为7亿美元,在获得监管批准后于2024年下半年完成。此次收购凸显了英伟达将其主导地位从硬件扩展到软件层的努力,该软件层优化了AI模型(尤其是大语言模型)在基于GPU的基础设施上的训练和部署方式。
Run:ai由奥姆里·盖勒和罗南·达尔两位特拉维夫大学前研究员于2018年创立。该公司在运行生成式AI工作负载、需要大量计算能力的企业中迅速获得关注。其核心平台提供了一层抽象,使组织能够池化GPU资源、高效调度作业并动态分配资源,解决了模型训练和推理阶段的关键瓶颈问题。在被收购前,Run:ai已获得约1.18亿美元融资,投资方包括Insight Partners和Tiger Global。
近年来,大型神经网络的训练对计算需求呈爆炸式增长。Transformer架构的兴起(如GPT-4等模型所采用的)使得GPU利用率成为运营效率的关键指标。许多组织发现其昂贵的GPU集群利用率不足,常常因作业调度效率低下或资源碎片化而闲置。英伟达作为这些硬件的供应商,敏锐地观察到这一痛点,并寻求通过提供更完整的解决方案来吸引和留住客户。
英伟达的软件业务(包括CUDA编程模型和快速增长的AI企业套件)已成为其重要的收入来源。通过收购Run:ai,英伟达旨在集成一个能够跨集群、甚至跨不同供应商(如Azure、AWS、Google Cloud和VMware环境)实现GPU联邦调度的系统。这一举措将英伟达的定位从单纯的芯片制造商提升为AI计算领域的整体编排者。
Run:ai的核心产品基于Kubernetes构建,提供强大的容器编排能力。它支持深度学习中常用的多种框架,包括PyTorch和TensorFlow,并能与MLflow和Kubeflow等流行工具集成。该平台支持多GPU作业,并通过GPU分片技术将典型利用率从40%提升至80%以上。此外,Run:ai还引入了“AI控制平面”功能,使数据科学家和工程师能够将硬件管理与工作负载运行解耦,实现计算资源的自动扩展,将作业提交时间从数小时缩短至数分钟,并为跨部门提供成本和资源使用的可见性。
关于交易的财务细节,最初报道的估值约为7亿美元,但随后多家媒体称实际金额可能接近10亿美元。英伟达拒绝透露确切数字,但根据向美国证券交易委员会提交的文件,最终交易价格确认为约7亿美元,以现金加股票的形式支付。交易完成后,Run:ai的员工并入英伟达位于以色列的开发中心,该中心是英伟达在美国以外最大的研发基地之一。截至交易完成时,Run:ai已有约100名员工加入。
此次收购在行业内引发了广泛关注。英伟达的竞争对手AMD和Intel也在积极布局AI软件生态,例如AMD推出了开源的ROCm软件栈。超大规模云服务商如AWS也在加大自研定制芯片(如Trainium)的投入,以差异化其AI服务。监管方面,欧盟委员会于2024年12月批准了该交易,未附加任何条件,认为Run:ai在GPU编排市场的份额有限,不会对竞争构成威胁。美国联邦贸易委员会也未对此交易提出异议,尽管该机构对大型科技公司在AI领域的投资并购整体持更严格的审查态度。
收购完成后,英伟达开始将Run:ai的技术整合到其产品线中,包括AI Enterprise和Base Command等工具。首批整合成果之一是在英伟达的DGX云平台上提供Run:ai的调度功能。英伟达还计划将该平台开放,以支持除自家GPU以外的其他加速器,包括定制ASIC芯片。这一系列举措表明,英伟达正致力于构建一个更加开放和全面的AI计算生态,以巩固其在AI基础设施领域的领导地位。
另见
- 英伟达
- Kubernetes