Neural Magic 是一家软件公司,开发用于在通用 CPU 硬件上加速机器学习推理的技术。公司成立于 2017 年,总部位于马萨诸塞州波士顿,致力于通过消除对 GPU 等专用加速器的需求,使人工智能部署更加普及且成本更低。其核心方法结合了模型稀疏性和量化方面的算法创新,以及针对 CPU 的优化,使深度神经网络能够在标准 x86 处理器上高效运行。该公司的解决方案广泛应用于多个行业,涵盖计算机视觉、自然语言处理以及大规模生成式人工智能工作负载。
该公司源自麻省理工学院计算机科学与人工智能实验室和伯克利人工智能研究的科研成果,其创始团队探索了利用神经网络数学结构来降低计算需求的方法。Neural Magic 的技术基于一个观察:许多神经网络包含大量冗余,通过剪枝或量化权重,可以大幅减少推理所需的运算量。该公司的软件栈,包括 DeepSparse 运行时和 SparseML 工具包,使开发者能够压缩和加速模型,而无需定制硬件。这种方法使 Neural Magic 成为 AI 基础设施领域的重要参与者,尤其受到希望避免 GPU 集群高昂成本和供应链限制的组织的青睐。
历史与创立
Neural Magic 由马克·陈、雅各布·乌兹科赖特和卢卡斯·凯泽于 2017 年创立,三人均具有机器学习和系统背景。乌兹科赖特和凯泽曾为 Google 的Transformer架构做出早期贡献,而陈则研究过高效推理技术。三人希望将稀疏神经网络的研究成果商业化,该研究表明模型可以剪枝至原始规模的一小部分而仍保持准确性。公司最初以隐秘模式运营,在公开发布首批产品前,专注于发表学术论文并开发核心技术。
2020 年,Neural Magic 发布了 DeepSparse 推理引擎,该引擎在 CPU 上显著加速了卷积和 Transformer 模型的运行。公司还推出了 SparseML,这是一个用于在训练过程中应用稀疏性和量化的开源库。这些发布引起了企业和云服务提供商的关注,促成了与英特尔和超威半导体等公司的合作。到 2021 年,Neural Magic 已从包括 NEA、安德森·霍洛维茨和 Pillar VC 在内的投资者处筹集了超过 5000 万美元资金。公司继续扩展产品线,增加了对大型语言模型推理的支持,并集成了 PyTorch 和 Hugging Face Transformers 等流行框架。
技术与方法
Neural Magic 的核心技术围绕两种主要方法:稀疏性和量化。稀疏性涉及剪枝神经网络的权重,将许多权重设为零,从而减少推理期间所需的乘法运算次数。量化则将权重和激活值从 32 位浮点数降低到 8 位整数,进一步减少计算成本和内存带宽需求。该公司的软件会自动将这些技术应用于模型,通常只带来极小的精度损失,然后为目标 CPU 生成优化代码。
DeepSparse 运行时是执行这些压缩模型的引擎。它采用稀疏矩阵乘法技术,跳过零条目,并利用 AVX-512 和 VNNI 等 CPU 向量指令来加速剩余运算。运行时还包含一个即时编译器,可为每个模型和硬件配置生成专用内核。这种方法使 Neural Magic 能够在某些工作负载下实现媲美甚至超越 GPU 系统的推理速度,尤其是在批处理和实时应用场景中。
SparseML 是配套的训练库,提供 API 用于在模型训练或微调期间进行剪枝和量化。它支持渐进幅度剪枝技术,根据权重幅度逐步移除权重,以及量化感知训练,在训练过程中模拟低精度运算以保持准确性。这些工具设计为易于集成到现有的机器学习流水线中,使技术能够被广泛的开发者群体使用。
产品与服务
Neural Magic 提供多种产品,涵盖 DeepSparse 和 SparseML 两个品牌。DeepSparse 运行时以 Python 包和 Docker 容器形式提供,支持 CPU 和云部署。它包含服务器模式,可通过 REST API 提供模型服务,以及客户端库,用于将推理嵌入应用程序。公司还提供预优化模型库,包含一系列已经过剪枝和量化的流行模型,可直接部署使用。
SparseML 是一个开源库,与 PyTorch 和 TensorFlow 集成,提供命令行界面和 Python API,用于应用稀疏性和量化。它还包含常见模型的配方,如残差网络和 Transformer 变体,这些配方指定了剪枝计划和超参数。此外,Neural Magic 曾提供名为 DeepSparse Cloud 的云服务,提供带自动扩展的托管推理端点,但该服务后来被弃用,转而支持本地部署。
性能与基准测试
Neural Magic 发布基准测试结果以展示其技术的有效性。例如,在双路英特尔至强 Platinum 8380 服务器上,该公司报告称,经过剪枝和量化的 BERT-large 模型每秒可处理超过 1000 个句子,而未经优化的基线版本约为每秒 200 个句子。对于 YOLOv5 等计算机视觉模型,DeepSparse 在单路 CPU 上实现了超过每秒 100 帧的帧率,与 GPU 推理相比具有竞争力。
公司还强调 CPU 推理的成本优势。通过利用现有服务器基础设施,组织可以避免 GPU 集群的资本支出并降低能耗。Neural Magic 的技术尤其适合边缘部署场景,因为在这些场景中,功耗和空间受限,且需要低延迟的实时应用。然而,性能提升取决于模型架构和可实现的稀疏程度。密集模型如果冗余有限,可能只能获得较小的改进,而某些工作负载,尤其是需要大规模并行性的任务,仍然更适合 GPU。
市场地位与竞争
Neural Magic 所处的 AI 推理优化领域竞争激烈,涵盖硬件和软件两种解决方案。在硬件方面,英伟达凭借 GPU 占据主导地位,而格罗克和桑巴诺瓦则提供专用 AI 加速器。在软件方面,竞争对手包括OpenAI 的 Triton、谷歌深度思维 的 JAX,以及 TVM 和 ONNX Runtime 等编译器框架。Neural Magic 的差异化在于其完全专注于 CPU,而 CPU 在数据中心中无处不在且往往未被充分利用。
公司还面临来自新兴技术的竞争,如模型蒸馏和知识蒸馏,这些方法可以生成更小的模型而无需专用硬件。然而,Neural Magic 的方法可以与这些技术结合使用,其工具设计为补充现有的优化工作流程。2023 年,Neural Magic 被红帽收购,红帽是IBM 的子公司,收购金额未披露。此次收购旨在将 Neural Magic 的技术整合到红帽的 OpenShift AI 平台中,为企业客户提供基于 CPU 的推理选项。这一举措表明企业软件供应商对高效 AI 部署的兴趣日益增长。
使用案例与应用
Neural Magic 的技术已应用于多种实际场景。在计算机视觉领域,它加速了物体检测、图像分类和分割模型,用于零售、安防和制造业。在自然语言处理领域,它支持情感分析、命名实体识别和问答系统。公司对大型语言模型的支持还使得聊天机器人和代码生成工具能够在 CPU 上部署,降低了初创企业和中小型公司的成本。
一个值得注意的案例是医疗保健领域,Neural Magic 的软件被用于在医院服务器上运行医学影像模型,避免了将敏感数据发送到云端的需要。在金融领域,它加速了欺诈检测和算法交易模型,这些模型要求低延迟。该技术还应用于自动驾驶车辆和机器人领域,在这些场景中,CPU 通常是唯一可用的计算资源。
研究与开源
Neural Magic 维持着活跃的研究项目,在稀疏训练、量化和推理优化方面发表论文。其研究人员曾为 NeurIPS、ICML 和 MLSys 等会议做出贡献。公司还将其大部分软件开源,包括 SparseML 和 DeepSparse 的部分组件,从而建立了用户和贡献者社区。
开源策略帮助 Neural Magic 建立了庞大的用户基础,并在机器学习社区中赢得了信誉。开发者可以自由实验这些工具并将其集成到自己的项目中,而公司则从社区反馈和贡献中受益。这种方法与Hugging Face 和 Weights & Biases 等其他 AI 基础设施公司类似。
未来方向
展望未来,Neural Magic 旨在扩展对新兴模型架构和硬件的支持。随着Transformer 基础模型和生成式人工智能的兴起,公司正在投资优化大型语言模型推理,包括推测解码和动态批处理等技术。它还在探索对安谋控股 处理器和超威半导体 EPYC CPU 的支持,这些处理器在云环境中日益流行。
随着 AI 模型变得更大、更复杂,对高效推理的需求只会增长。Neural Magic 对 CPU 的关注可能变得越来越重要,因为组织正在寻求在性能、成本和能耗之间取得平衡。公司与红帽和 IBM 的整合为企业采用提供了途径,其开源生态系统也在持续吸引开发者。
结论
Neural Magic 已确立了自己在基于 CPU 的推理优化领域的先驱地位,为以 GPU 为中心的方法提供了有吸引力的替代方案。其稀疏性、量化和运行时工程的结合在通用硬件上实现了显著的性能提升,使 AI 更加普及和实惠。尽管仍存在挑战,例如 CPU 在某些工作负载上的固有局限性,但该公司的技术已在多个行业证明了其价值。在红帽和 IBM 的支持下,Neural Magic 有望在 AI 部署的未来中发挥关键作用。