Traduit de l'anglais

vLLM est un framework open-source pour l'inférence et le service de grands modèles de langage à haut débit et à faible consommation mémoire, développé à l'UC Berkeley et centré sur l'algorithme PagedAttention. Il prend en charge des fonctionnalités telles que le batching continu, la quantification et les API compatibles avec OpenAI, et est devenu un projet de la Linux Foundation en 2024.

vLLM est un framework logiciel open-source pour l'inférence et le service de grands modèles de langage et de modèles multimodaux associés. Initialement développé au Sky Computing Lab de l'Université de Californie à Berkeley, le projet est centré sur PagedAttention, une méthode de gestion de la mémoire pour les caches clé-valeur des transformeurs, et prend en charge des fonctionnalités telles que le traitement par lots continu, l'inférence distribuée, la quantification et des API compatibles avec OpenAI. Il est conçu pour offrir un débit élevé et une efficacité mémoire lors du déploiement de grands modèles de langage dans des environnements de production.

Le projet a gagné une traction significative dans la communauté de l'intelligence artificielle en tant qu'outil standard pour le service de modèles, avec une adoption auprès des fournisseurs de cloud et des fabricants de matériel. Son architecture et sa conception ont influencé les frameworks d'inférence ultérieurs, et sa transition vers un projet de la Linux Foundation en 2024 a marqué une étape importante dans l'infrastructure open-source de l'IA.

Historique

vLLM a été introduit en 2023 par des chercheurs affiliés au Sky Computing Lab de l'UC Berkeley. Ses idées centrales ont été décrites dans l'article de 2023 « Efficient Memory Management for Large Language Model Serving with PagedAttention », qui présentait le système comme un moteur de service à haut débit et économe en mémoire pour les grands modèles de langage. L'article détaillait comment PagedAttention pouvait réduire le gaspillage de mémoire dans le cache clé-valeur, un goulot d'étranglement critique dans l'inférence des transformeurs.

Selon un mainteneur du projet, le « v » dans vLLM faisait initialement référence à « virtuel », inspiré de la mémoire virtuelle. Cette dénomination reflète la dette conceptuelle de l'algorithme envers les techniques de pagination des systèmes d'exploitation.

La page du projet PyTorch indique que l'Université de Californie à Berkeley a contribué vLLM à la Linux Foundation en juillet 2024. En 2025, la PyTorch Foundation a annoncé que vLLM était devenu un projet hébergé par la fondation, formalisant sa gouvernance sous l'égide de celle-ci. En janvier 2026, TechCrunch a rapporté que les créateurs de vLLM avaient lancé la startup Inferact pour commercialiser le projet, levant 150 millions de dollars en financement de démarrage.

Architecture

Selon son article de 2023, vLLM a été conçu pour améliorer l'efficacité du service des grands modèles de langage en réduisant le gaspillage de mémoire dans le cache clé-valeur utilisé lors de l'inférence des transformeurs. L'article a introduit PagedAttention, un algorithme inspiré de la mémoire virtuelle et des techniques de pagination des systèmes d'exploitation, et a décrit vLLM comme utilisant une gestion de la mémoire par blocs et une planification des requêtes pour augmenter le débit tout en maintenant une latence similaire.

PagedAttention fonctionne en divisant le cache clé-valeur en blocs de taille fixe, qui peuvent être alloués et désalloués dynamiquement, de manière similaire à la gestion des pages de mémoire physique par les systèmes d'exploitation. Cette approche minimise la fragmentation et permet une utilisation plus efficace de la mémoire GPU, permettant des tailles de lots plus élevées et une meilleure utilisation des ressources matérielles.

La documentation et le dépôt du projet décrivent la prise en charge du traitement par lots continu, du préremplissage par morceaux, du décodage spéculatif, de la mise en cache des préfixes, de la quantification et de plusieurs formes d'inférence distribuée. Le traitement par lots continu permet au système de traiter les requêtes à mesure qu'elles arrivent plutôt que d'attendre un lot complet, améliorant la réactivité et le débit. Le décodage spéculatif utilise des modèles de brouillon plus petits pour accélérer la génération, tandis que la mise en cache des préfixes réutilise les calculs pour les préfixes de prompts partagés.

PyTorch a décrit vLLM comme un moteur d'inférence et de service à haut débit et économe en mémoire qui prend en charge une gamme de backends matériels, y compris les GPU NVIDIA et AMD, les TPU Google, les AWS Trainium et les processeurs Intel. Cette large prise en charge matérielle en fait un choix polyvalent pour divers scénarios de déploiement, des clusters sur site aux environnements cloud.

Fonctionnalités et capacités

vLLM fournit une API compatible avec OpenAI, permettant aux développeurs de l'intégrer à des applications et outils existants qui attendent une interface standard. Cette compatibilité simplifie la migration depuis d'autres solutions de service et permet une utilisation transparente avec des frameworks comme LangChain et LlamaIndex.

La prise en charge de la quantification dans vLLM inclut des techniques telles que la quantification des poids INT8 et INT4, qui réduisent la taille du modèle et l'empreinte mémoire tout en maintenant une précision acceptable. Cela est particulièrement important pour déployer de grands modèles sur du matériel aux ressources limitées.

Les capacités d'inférence distribuée permettent à vLLM de s'adapter à plusieurs GPU ou nœuds, en utilisant le parallélisme tensoriel et le parallélisme de pipeline pour gérer des modèles qui dépassent la mémoire d'un seul appareil. Cela est essentiel pour servir des modèles à l'échelle frontalière avec des centaines de milliards de paramètres.

Écosystème et adoption

vLLM est devenu un composant fondamental de l'écosystème d'infrastructure IA, avec des intégrations de grands fournisseurs de cloud et fabricants de matériel. Par exemple, AWS prend en charge vLLM sur ses puces Trainium, et Google Cloud l'offre sur les TPU. AMD et Intel ont également optimisé vLLM pour leurs accélérateurs, élargissant sa portée au-delà des GPU NVIDIA.

La nature open-source du projet a favorisé une communauté dynamique de contributeurs, avec des versions régulières et un ensemble croissant de fonctionnalités. Son adoption par des startups et des entreprises en a fait une référence pour les performances d'inférence, souvent utilisée dans des comparaisons avec d'autres frameworks comme Ollama et SGLang.

Voir aussi

  • Ollama
  • SGLang
  • TensorRT-LLM
  • llama.cpp
  • OpenVINO
  • Open Neural Network Exchange
  • Comparaison des logiciels d'apprentissage profond
  • Comparaison des logiciels d'apprentissage automatique
  • Liste des logiciels développés dans les universités
  • Listes des logiciels d'IA open-source
  • Liste des grands modèles de langage
  • TurboQuant
  • Pénurie mondiale de mémoire de 2025 à aujourd'hui
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:open-source-software·large-language-models·machine-learning·artificial-intelligence
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique