vLLM是一个用于大型语言模型及相关多模态模型的推理和服务框架的开源软件。该项目最初由加州大学伯克利分校的Sky Computing实验室开发,其核心是PagedAttention,一种用于Transformer键值缓存的内存管理方法,并支持连续批处理、分布式推理、量化以及兼容OpenAI的API等功能。
历史
vLLM由加州大学伯克利分校Sky Computing实验室的研究人员于2023年推出。其核心思想在2023年的论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》中进行了描述,该论文将系统定位为用于大型语言模型的高吞吐量、内存高效的推理引擎。据项目维护者称,vLLM中的“v”最初代表“虚拟”,灵感来源于虚拟内存。
PyTorch的项目页面指出,加州大学伯克利分校于2024年7月将vLLM贡献给了Linux基金会。2025年,PyTorch基金会宣布vLLM已成为其托管项目。2026年1月,TechCrunch报道称,vLLM的创建者成立了初创公司Inferact,以将该技术商业化,并获得了1.5亿美元的种子资金。
架构
根据其2023年的论文,vLLM旨在通过减少Transformer推理过程中键值缓存的内存浪费来提高大型语言模型的服务效率。论文介绍了PagedAttention算法,该算法受操作系统中的虚拟内存和分页技术启发,并描述了vLLM如何使用块级内存管理和请求调度,在保持相似延迟的同时提高吞吐量。
项目文档和代码仓库描述了其对连续批处理、分块预填充、推测解码、前缀缓存、量化以及多种分布式推理形式的支持。PyTorch将vLLM描述为一个高吞吐量、内存高效的推理和服务引擎,支持多种硬件后端,包括NVIDIA和AMD的GPU、Google的TPU、AWS的Trainium以及Intel的处理器。
性能与用例
vLLM在学术界和工业界都被广泛用于大规模服务大型语言模型。其高吞吐量使其适用于聊天机器人、代码生成和实时AI助手等应用场景。该框架与流行的模型库集成,并可部署在亚马逊云服务、谷歌云和微软Azure等云平台上。
社区与治理
在贡献给Linux基金会后,vLLM成为了PyTorch基金会下的一个项目,该基金会为开源AI基础设施提供治理和支持。该项目拥有一个由学术界和工业界贡献者组成的活跃社区,其开发工作由来自伯克利AI研究和斯坦福AI实验室等机构的人员指导。
参见
- Ollama
- sglang
- TensorRT-LLM
- llama.cpp
- openvino
- open-neural-network-exchange
- comparison-of-deep-learning-software
- comparison-of-machine-learning-software
- list-of-software-developed-at-universities
- lists-of-open-source-artificial-intelligence-software
- list-of-large-language-models
- turboquant
- 2025-present-global-memory-supply-shortage