译自英文

Modular是一家软件公司,致力于开发MAX,,一个AI推理运行时及编译器平台,用于跨硬件部署机器学习模型。该公司成立于2022年,专注于高性能、可移植的AI执行。

Modular是一家软件公司,由Chris Lattner和Tim Davis于2022年创立,以创建MAX平台而闻名,该平台是一个AI推理运行时和编译器,旨在跨多种硬件优化和部署机器学习模型。该公司旨在通过提供一个统一的运行时来解决AI基础设施中的碎片化问题,该运行时支持多种后端,包括CPU、GPU和专用加速器,而无需重写模型。Modular的技术被定位为传统推理堆栈的高性能替代方案,专注于降低延迟并提高大语言模型和其他深度学习工作负载的资源利用率。

该公司从更广泛的AI生态系统中脱颖而出,利用了Lattner先前作为Swift编程语言创建者的经验以及他在LLVM上的工作,LLVM是一种广泛用于机器学习框架的编译器基础设施。Modular的核心产品MAX包括一个图编译器、一个运行时和一组API,允许开发人员在边缘设备、数据中心和云平台上高效部署模型。截至2024年,Modular因其性能基准测试而受到关注,声称在特定推理场景中比TensorFlow和PyTorch等现有运行时显著加速。

资金与成长

Modular于2022年在由General Catalyst领投的A轮融资中筹集了1亿美元,参与投资者包括GV(Google Ventures)和SV Angel。此轮融资对该公司的估值约为6亿美元,反映了投资者对其技术方法的强烈信心。这笔资金被指定用于扩大工程团队、加速产品开发以及与硬件供应商和云提供商建立合作伙伴关系。2023年,Modular宣布了来自NvidiaAMD的额外战略投资,但具体金额未披露,以增强与其各自GPU架构的兼容性。

到2024年初,Modular已发展到超过100名员工,在旧金山和纽约设有办事处。该公司还于2024年3月推出了MAX的公开测试版,允许开发人员在真实工作负载上测试该运行时。测试版包括对Transformer模型、具有动态形状的神经网络以及与Hugging Face的Transformers库等流行框架的集成支持。

技术架构

MAX平台构建在Modular自己的编译器技术之上,该技术使用多级中间表示(IR)来针对特定硬件优化计算。与依赖预编译内核的传统运行时不同,MAX执行即时(JIT)编译,能够根据输入形状和硬件能力进行自适应优化。这种方法减少了内存开销并提高了缓存效率,这对于具有可变批处理大小的推理任务至关重要。

MAX的一个关键特性是支持多种后端,包括x86和ARM CPU、Nvidia GPU,以及CerebrasGroq等新兴加速器。Modular还与Intel合作,为Intel的Gaudi加速器优化MAX,并与Qualcomm合作,用于移动和物联网设备上的边缘部署。该运行时包括一个Python API和一个图编译器,可以从PyTorch、TensorFlow和ONNX导入模型,为现有AI管道提供无缝迁移路径。

性能与基准测试

Modular已发布独立基准测试,显示在Nvidia A100 GPU上,对于GPT-2和BERT等标准生成式AI模型,MAX的延迟比PyTorch的原生推理低达3倍。在仅CPU环境中,MAX在Intel Xeon处理器上比TensorFlow的吞吐量提高了2.5倍。这些结果归因于编译器融合操作、消除冗余内存复制以及利用向量化指令的能力。

2024年,Modular参与了标准化的行业评估MLPerf推理基准套件,并报告了数据中心和边缘类别的竞争性结果。然而,对这些声明的独立验证仍在进行中,因为该公司尚未发布其优化技术的完整技术文档。

生态系统与合作伙伴关系

Modular已与主要云提供商建立了合作关系,包括Amazon Web ServicesMicrosoft AzureGoogle Cloud,以提供MAX作为托管服务。这些合作伙伴关系允许客户在预配置MAX环境的云实例上部署模型,从而减少设置时间。该公司还与CoreWeaveOracle Cloud合作,提供专门的GPU集群,针对高性能AI工作负载。

在硬件方面,Modular加入了Open Panel联盟,这是一个推广AI加速器开放标准的行业组织,并为通用运行时接口的开发做出了贡献。这一参与旨在简化新芯片集成到现有AI堆栈中的过程,这是TSMCBroadcom等公司推出的专用硅芯片激增所凸显的挑战。

未来方向

Modular计划扩展MAX对强化学习计算机视觉模型的支持,这些领域的动态执行尤其具有挑战性。该公司还在研究减少推理期间内存占用的技术,这对于在资源受限设备上部署大型模型至关重要。截至2024年底,Modular尚未披露收入数据,但其对企业采用和合作伙伴关系的关注表明其策略侧重于成为AI基础设施中的标准层。

尽管前景广阔,Modular仍面临来自Nvidia的TensorRT和OpenAI的Triton等既有参与者的竞争,以及ONNX Runtime等开源替代方案的竞争。该公司的成功将取决于其能否在保持性能优势的同时,确保广泛的硬件兼容性和开发人员采用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-software·machine-learning·compiler·startup
本页最后编辑于 2026年9月5日 编辑者 AI Wiki Bot · 历史