译自英文

vLLM是一个开源框架,用于大语言模型的高吞吐量、内存高效的推理和服务,由加州大学伯克利分校开发,并以PagedAttention算法为核心。它支持连续批处理、量化以及兼容OpenAI的API等功能,并于2024年成为Linux基金会项目。

vLLM是一个用于大型语言模型及相关多模态模型推理和服务的开源软件框架。该项目最初在加州大学伯克利分校的Sky Computing实验室开发,核心是PagedAttention,一种针对Transformer键值缓存的内存管理方法,并支持连续批处理、分布式推理、量化以及兼容OpenAI的API等功能。其设计旨在为在生产环境中部署大型语言模型提供高吞吐量和内存效率。

该项目在人工智能社区中已获得显著关注,成为服务模型的标准工具,并被云服务提供商和硬件供应商广泛采用。其架构和设计影响了后续的推理框架,而其在2024年成为Linux基金会项目则标志着开源AI基础设施的一个里程碑。

历史

vLLM于2023年由加州大学伯克利分校Sky Computing实验室的研究人员推出。其核心思想在2023年论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》中进行了描述,该论文将系统呈现为一种高吞吐量、内存高效的大型语言模型服务引擎。论文详细说明了PagedAttention如何减少键值缓存中的内存浪费,这是Transformer推理中的一个关键瓶颈。

据项目维护者称,vLLM中的“v”最初代表“虚拟”,灵感来自虚拟内存。这一命名反映了该算法在概念上对操作系统分页技术的借鉴。

PyTorch的项目页面指出,加州大学伯克利分校于2024年7月将vLLM贡献给了Linux基金会。2025年,PyTorch基金会宣布vLLM已成为基金会托管的项目,正式将其治理纳入基金会框架之下。2026年1月,TechCrunch报道称,vLLM的创建者已推出初创公司Inferact以将该项目商业化,并筹集了1.5亿美元的种子资金。

架构

根据其2023年的论文,vLLM旨在通过减少Transformer推理期间使用的键值缓存中的内存浪费来提高大型语言模型服务的效率。论文介绍了PagedAttention,这是一种受操作系统虚拟内存和分页技术启发的算法,并描述vLLM使用块级内存管理和请求调度来提高吞吐量,同时保持相似的延迟。

PagedAttention的工作原理是将键值缓存划分为固定大小的块,这些块可以动态分配和释放,类似于操作系统管理物理内存页的方式。这种方法最大限度地减少了碎片化,并允许更有效地利用GPU内存,从而实现更高的批处理规模和更好的硬件资源利用。

项目文档和代码库描述了其对连续批处理、分块预填充、推测解码、前缀缓存、量化以及多种形式的分布式推理的支持。连续批处理允许系统在请求到达时进行处理,而不是等待完整批次,从而提高了响应速度和吞吐量。推测解码使用较小的草稿模型来加速生成,而前缀缓存则重用共享提示前缀的计算。

PyTorch将vLLM描述为一种高吞吐量、内存高效的推理和服务引擎,支持多种硬件后端,包括NVIDIA和AMD GPU、Google TPU、AWS Trainium以及Intel处理器。这种广泛的硬件支持使其成为多种部署场景(从本地集群到云环境)的多功能选择。

功能与能力

vLLM提供了兼容OpenAI的API,允许开发者将其集成到期望标准接口的现有应用程序和工具中。这种兼容性简化了从其他服务解决方案的迁移,并使其能够与LangChain和LlamaIndex等框架无缝使用。

vLLM中的量化支持包括INT8和INT4权重量化等技术,这些技术可在保持可接受精度的同时减少模型大小和内存占用。这对于在资源受限的硬件上部署大型模型尤为重要。

分布式推理能力使vLLM能够跨多个GPU或节点扩展,使用张量并行和流水线并行来处理超出单个设备内存的模型。这对于服务具有数千亿参数的尖端规模模型至关重要。

生态系统与采用

vLLM已成为AI基础设施生态系统中的基础组件,得到了主要云服务提供商和硬件供应商的集成。例如,AWS在其Trainium芯片上支持vLLM,Google Cloud在TPU上提供该框架。AMDIntel也针对其加速器优化了vLLM,将其覆盖范围扩展到了NVIDIA GPU之外。

该项目的开源性质培育了一个充满活力的贡献者社区,定期发布版本并不断增加功能。初创企业和企业对其的采用使其成为推理性能的基准,经常用于与其他框架(如Ollama和SGLang)的比较。

参见

  • Ollama
  • SGLang
  • TensorRT-LLM
  • llama.cpp
  • OpenVINO
  • 开放神经网络交换
  • 深度学习软件比较
  • 机器学习软件比较
  • 大学开发的软件列表
  • 开源AI软件列表
  • 大型语言模型列表
  • TurboQuant
  • 2025年至今全球内存供应短缺
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:open-source-software·large-language-models·machine-learning·artificial-intelligence
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史