译自英文

MLC LLM是一个开源机器学习编译框架,旨在跨多种硬件平台高效部署大型语言模型。它利用Apache TVM优化CPU、GPU及专用加速器上的LLM推理。

MLC LLM是一个机器学习编译框架,专注于大型语言模型的高效部署。作为一个开源项目,它利用Apache TVM编译器栈将LLM工作负载转换为优化的代码,可在各种硬件后端上运行,包括消费级GPU、移动设备和云服务器。该项目旨在通过为LLM推理提供统一的编译路径来解决AI硬件的碎片化问题,减少对特定供应商内核和手动优化的需求。

该框架由与Apache TVM社区相关的研究人员和工程师团队推出,并获得了卡内基梅隆大学和华盛顿大学等机构的贡献。其开发始于2020年代初,是使机器学习模型在从边缘设备到数据中心的各种环境中更具可移植性和可扩展性的更广泛努力的一部分。MLC LLM基于自动优化原则,使用算子融合、内存规划和量化等技术,以实现与手工调优实现相当的性能。

编译工作流

MLC LLM的核心在于其编译流水线,该流水线将预训练模型转换为可部署的产物。该过程从以PyTorch等框架或ONNX等标准格式指定的模型开始,然后使用TVM的中间表示来应用优化。这些优化包括为NVIDIA GPU自动生成CUDA内核、为Apple silicon生成Metal内核,以及为其他加速器生成Vulkan或OpenCL内核。编译后的输出可以打包为在目标设备上执行的运行时,而无需原始训练栈。

一个关键特性是对动态形状的支持,这在LLM推理中由于输入长度可变而很常见。MLC LLM通过生成能够适应不断变化的张量维度的代码来处理这一问题,这是传统静态编译中的一个重大挑战。此外,该框架与Hugging Face生态系统集成,允许用户直接从transformers库导入模型,从而简化了从业者的工作流程。

硬件支持

MLC LLM面向广泛的硬件,以使LLM部署更加可及。它通过ROCm支持AMD GPU,通过oneAPI支持Intel GPU,并使用Metal支持Apple设备。对于移动和嵌入式系统,它支持基于ARM的处理器和其他低功耗加速器。该项目还为专门的训练和推理芯片提供了实验性支持,例如AWS TrainiumGroq硬件,尽管这些不如主流后端成熟。

该框架的灵活性延伸到云环境,它可以在配备NVIDIA T4或A100 GPU的AWS实例上运行,也可以通过TVM栈在Google Cloud上使用TPU运行。这种广度旨在消除供应商为每个平台重写部署代码的需求,这是Generative AI行业中的一个常见痛点。

关键特性与优化

在其显著能力中,MLC LLM实现了推测解码,这是一种通过草拟多个令牌并并行验证来加速推理的技术,从而提高了自回归模型的吞吐量。它还支持各种量化方案,例如4位和8位整数量化,这减少了内存占用并提高了资源受限设备上的速度。这些优化在编译期间根据目标硬件的能力自动应用。

该项目包含一个用Rust和C编写的高性能运行时,确保执行期间的低开销。它还提供了Python API和命令行界面,使其适用于研究人员和生产开发者。截至2024年,MLC LLM已被用于在笔记本电脑和智能手机上以交互速度运行Llama 2和Mistral等模型,展示了其实用价值。

与Apache TVM的关系

MLC LLM与Apache TVM项目密切相关,这是一个最初由华盛顿大学研究人员开发的开源深度学习编译器。TVM为图级和算子级优化提供了基础基础设施,而MLC LLM通过为LLM工作流特定的高级抽象(如处理键值缓存和注意力机制)扩展了它。这种关系使MLC LLM能够继承TVM成熟的编译过程及其活跃的社区,该社区包括来自工业界和学术界的贡献者。这种合作凸显了Machine learning中向基于编译器的方法而非手动内核工程发展的更广泛趋势。

社区与采用

该项目托管在GitHub上,采用Apache 2.0许可证,鼓励全球开发者基础的贡献。提供了文档、教程和预编译模型,以降低新用户的入门门槛。MLC LLM已被BAIR (Berkeley AI Research)Stanford AI Lab的研究人员用于高效推理实验,并作为公司在异构机群上部署LLM的实用工具。其开发与Artificial intelligence社区中旨在使先进模型超越资源充足组织的民主化访问的持续努力相一致。

该框架持续发展,定期更新以支持更新的模型架构和硬件。虽然最初专注于推理,但这些技术可能扩展到训练工作负载,尽管这仍是一个活跃的研究领域。

局限性与未来方向

尽管有其优势,MLC LLM仍面临挑战,包括编译器工程的复杂性,这可能会阻止技术较弱的用户。性能提升依赖于硬件,可能需要调整编译标志以获得最佳结果。团队承认对于缺乏开放驱动程序的旧设备或专有加速器存在兼容性问题。未来的工作旨在改进性能调优的自动化,扩展对新兴硬件(如与Nokia Bell Labs相关的芯片)的支持,并与边缘部署框架集成。该项目的成功将取决于Deep learning生态系统中的持续合作以及对编译器研究的持续投资。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning-compilation·large-language-models·open-source-software·deployment
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史