vLLM es un software de código abierto para la inferencia y el servicio de modelos de lenguaje grandes y modelos multimodales relacionados. Desarrollado originalmente en el Sky Computing Lab de la Universidad de California, Berkeley, el proyecto se centra en PagedAttention, un método de gestión de memoria para las cachés de clave-valor de los transformadores, y admite funciones como el procesamiento por lotes continuo, la inferencia distribuida, la cuantización y las API compatibles con OpenAI. Está diseñado para proporcionar un alto rendimiento y eficiencia de memoria al implementar modelos de lenguaje grandes en entornos de producción.
El proyecto ha ganado una gran tracción en la comunidad de inteligencia artificial como una herramienta estándar para el servicio de modelos, con adopción por parte de proveedores de nube y fabricantes de hardware. Su arquitectura y diseño han influido en marcos de inferencia posteriores, y su transición a un proyecto de la Fundación Linux en 2024 marcó un hito en la infraestructura de IA de código abierto.
Historia
vLLM fue presentado en 2023 por investigadores afiliados al Sky Computing Lab de UC Berkeley. Sus ideas principales se describieron en el artículo de 2023 "Efficient Memory Management for Large Language Model Serving with PagedAttention", que presentaba el sistema como un motor de servicio de modelos de lenguaje de alto rendimiento y eficiencia de memoria. El artículo detallaba cómo PagedAttention podía reducir el desperdicio de memoria en la caché de clave-valor, un cuello de botella crítico en la inferencia de transformadores.
Según un mantenedor del proyecto, la "v" en vLLM originalmente significaba "virtual", en referencia a la memoria virtual, lo que refleja la inspiración del algoritmo en las técnicas de paginación de los sistemas operativos. Este nombre refleja la deuda conceptual del algoritmo con las técnicas de gestión de memoria de los sistemas operativos.
La página del proyecto en PyTorch indica que la Universidad de California, Berkeley, contribuyó con vLLM a la Fundación Linux en julio de 2024. En 2025, la Fundación PyTorch anunció que vLLM se había convertido en un proyecto alojado por la fundación, formalizando su gobernanza bajo este organismo. En enero de 2026, TechCrunch informó que los creadores de vLLM habían lanzado la empresa emergente Inferact para comercializar el proyecto, recaudando 150 millones de dólares en financiación inicial.
Arquitectura
Según su artículo de 2023, vLLM fue diseñado para mejorar la eficiencia del servicio de modelos de lenguaje grandes al reducir el desperdicio de memoria en la caché de clave-valor utilizada durante la inferencia de transformadores. El artículo presentaba PagedAttention, un algoritmo inspirado en las técnicas de memoria virtual y paginación de los sistemas operativos, y describía vLLM como un sistema que utiliza gestión de memoria por bloques y planificación de solicitudes para aumentar el rendimiento mientras mantiene una latencia similar.
PagedAttention funciona dividiendo la caché de clave-valor en bloques de tamaño fijo, que pueden asignarse y liberarse dinámicamente, de forma similar a cómo los sistemas operativos gestionan las páginas de memoria física. Este enfoque minimiza la fragmentación y permite un uso más eficiente de la memoria de la GPU, lo que posibilita tamaños de lote más grandes y una mejor utilización de los recursos de hardware.
La documentación y el repositorio del proyecto describen soporte para el procesamiento por lotes continuo, el prefill por fragmentos, la decodificación especulativa, el almacenamiento en caché de prefijos, la cuantización y múltiples formas de inferencia distribuida. El procesamiento por lotes continuo permite que el sistema procese las solicitudes a medida que llegan, en lugar de esperar a un lote completo, lo que mejora la capacidad de respuesta y el rendimiento. La decodificación especulativa utiliza modelos auxiliares más pequeños para acelerar la generación, mientras que el almacenamiento en caché de prefijos reutiliza los cálculos para prefijos de solicitudes compartidos.
Características y capacidades
vLLM proporciona una API compatible con OpenAI, lo que permite a los desarrolladores integrarlo con aplicaciones y herramientas existentes que esperan una interfaz estándar. Esta compatibilidad simplifica la migración desde otras soluciones de servicio y permite un uso fluido con marcos como LangChain y LlamaIndex.
El soporte de cuantización en vLLM incluye técnicas como la cuantización INT8 e INT4, que reducen el tamaño del modelo y la huella de memoria manteniendo una precisión aceptable. Esto es particularmente importante para implementar modelos grandes en hardware con recursos limitados.
Las capacidades de inferencia distribuida permiten que vLLM se escale a través de múltiples GPU o nodos, utilizando paralelismo de tensores y de pipelines para manejar modelos que exceden la memoria de un solo dispositivo. Esto es esencial para servir modelos de vanguardia con cientos de miles de millones de parámetros.
Ecosistema y adopción
vLLM se ha convertido en un componente fundamental en el ecosistema de infraestructura de IA, con integraciones de los principales proveedores de nube y fabricantes de hardware. Por ejemplo, AWS admite vLLM en sus chips Trainium, y Google Cloud lo ofrece en sus TPU. AMD e Intel también han optimizado vLLM para sus aceleradores, ampliando su alcance más allá de las GPU de NVIDIA.
La naturaleza de código abierto del proyecto ha fomentado una comunidad vibrante de contribuyentes, con lanzamientos regulares y un conjunto creciente de funciones. Su adopción tanto por parte de empresas emergentes como de grandes empresas lo ha convertido en un punto de referencia para el rendimiento de la inferencia, utilizado a menudo en comparaciones con otros marcos como Ollama y SGLang.
Véase también
- Ollama
- SGLang
- TensorRT-LLM
- llama.cpp
- OpenVINO
- Open Neural Network Exchange
- Comparación de software de aprendizaje profundo
- Comparación de software de aprendizaje automático
- Lista de software desarrollado por universidades
- Lista de software de IA de código abierto
- Lista de modelos de lenguaje grandes
- TurboQuant
- Escasez mundial de memoria en 2025-presente