Historique
vLLM a été introduit en 2023 par des chercheurs affiliés au Sky Computing Lab de l'Université de Californie à Berkeley. Ses idées fondamentales ont été décrites dans l'article de 2023 « Efficacité de la gestion de la mémoire pour le service de modèles de langage de grande taille avec PagedAttention », qui présentait le système comme un moteur de service à haut débit et économe en mémoire pour les modèles de langage de grande taille. Selon un mainteneur du projet, le « v » dans vLLM faisait à l'origine référence à « virtuel », inspiré de la mémoire virtuelle.
La page du projet PyTorch indique que l'Université de Californie à Berkeley a contribué vLLM à la Linux Foundation en juillet 2024. En 2025, PyTorch a annoncé que vLLM était devenu un projet hébergé par la fondation. En janvier 2026, TechCrunch a rapporté que les créateurs de vLLM avaient lancé la startup commerciale pour monétiser le projet, levant 150 millions de dollars en financement de démarrage.
Architecture
Selon son article de 2023, vLLM a été conçu pour améliorer l'efficacité du service de modèles de langage de grande taille en réduisant le gaspillage de mémoire dans le cache clé-valeur utilisé lors de l'inférence des transformeurs. L'article a introduit PagedAttention, une technique inspirée de la mémoire virtuelle et de la pagination des systèmes d'exploitation, et a décrit vLLM comme utilisant une gestion de la mémoire par blocs et une planification des requêtes pour augmenter le débit tout en maintenant une latence similaire.
La documentation du projet et le dépôt décrivent le support de la mise en lot continue, du préremplissage par blocs, du décodage spéculatif, de la mise en cache des préfixes, de la quantification et de multiples formes d'inférence distribuée. PyTorch a décrit vLLM comme un moteur d'inférence et de service à haut débit et économe en mémoire qui prend en charge une gamme de matériels, notamment les GPU NVIDIA et AMD, les TPU Google, AWS Trainium et les processeurs Intel.
Performances et cas d'utilisation
vLLM est largement utilisé dans les milieux académiques et industriels pour servir des modèles de langage de grande taille à grande échelle. Son haut débit le rend adapté à des applications telles que les chatbots, la génération de code et les assistants en temps réel. Le framework s'intègre aux bibliothèques de modèles populaires et peut être déployé sur des plateformes cloud comme Amazon Web Services, Google Cloud et Microsoft Azure.
Communauté et gouvernance
Après avoir été contribué à la Linux Foundation, vLLM est devenu un projet sous l'égide de la PyTorch Foundation, qui assure la gouvernance et le soutien de l'infrastructure open source de l'IA. Le projet dispose d'une communauté active de contributeurs issus du monde académique et industriel, et son développement est dirigé par des mainteneurs d'organisations telles que berkeley-research-ai et Stanford AI Lab.
Voir aussi
- Ollama
- sglang
- TensorRT-LLM
- llama.cpp
- openvino
- open-neural-network-exchange
- comparison-of-deep-learning-software
- comparison-of-machine-learning-software
- list-of-software-developed-at-universities
- lists-of-open-source-artificial-intelligence-software
- list-of-large-language-models
- turboquant
- 2025-present-global-memory-supply-shortage