Traducido del inglés

vLLM es un marco de software de código abierto para la inferencia y el servicio de alto rendimiento de modelos de lenguaje grandes, desarrollado en el Sky Computing Lab de UC Berkeley y centrado en la gestión de memoria PagedAttention.

vLLM es un marco de software de código abierto para la inferencia y el servicio de modelos de lenguaje grandes y modelos multimodales relacionados. Desarrollado originalmente en el Sky Computing Lab de la Universidad de California, Berkeley, el proyecto se centra en PagedAttention, un método de gestión de memoria para las cachés de clave-valor de los transformadores, y admite características como el batching continuo, la inferencia distribuida, la cuantización y las API compatibles con OpenAI.

Historia

vLLM fue presentado en 2023 por investigadores afiliados al Sky Computing Lab de la UC Berkeley. Sus ideas centrales se describieron en el artículo de 2023 "Efficient Memory Management for Large Language Model Serving with PagedAttention", que presentaba el sistema como un motor de servicio de alto rendimiento y eficiente en memoria para modelos de lenguaje grandes. Según un mantenedor del proyecto, la "v" en vLLM originalmente se refería a "virtual", inspirada en la memoria virtual.

La página del proyecto de PyTorch indica que la Universidad de California, Berkeley contribuyó con vLLM a la Linux Foundation en julio de 2024. En 2025, la PyTorch Foundation anunció que vLLM se había convertido en un proyecto alojado por la Fundación. En enero de 2026, TechCrunch informó que los creadores de vLLM habían lanzado la startup Inferact para comercializar el proyecto, recaudando 150 millones de dólares en financiación inicial.

Arquitectura

Según su artículo de 2023, vLLM fue diseñado para mejorar la eficiencia del servicio de modelos de lenguaje grandes reduciendo el desperdicio de memoria en la caché de clave-valor utilizada durante la inferencia de transformadores. El artículo presentó PagedAttention, un algoritmo inspirado en la memoria virtual y las técnicas de paginación de los sistemas operativos, y describió a vLLM como un sistema que utiliza gestión de memoria por bloques y programación de solicitudes para aumentar el rendimiento mientras mantiene una latencia similar.

La documentación y el repositorio del proyecto describen soporte para batching continuo, prefill fragmentado, decodificación especulativa, caché de prefijos, cuantización y múltiples formas de inferencia distribuida. PyTorch ha descrito a vLLM como un motor de inferencia y servicio de alto rendimiento y eficiente en memoria que admite una variedad de backends de hardware, incluidas las GPU de NVIDIA y AMD, los TPU de Google, AWS Trainium y los procesadores Intel.

Rendimiento y casos de uso

vLLM se utiliza ampliamente en entornos académicos e industriales para servir modelos de lenguaje grandes a escala. Su alto rendimiento lo hace adecuado para aplicaciones como chatbots, generación de código y asistentes de IA en tiempo real. El marco se integra con bibliotecas de modelos populares y puede desplegarse en plataformas en la nube como Amazon Web Services, Google Cloud y Azure.

Comunidad y gobernanza

Después de ser contribuido a la Linux Foundation, vLLM se convirtió en un proyecto bajo la PyTorch Foundation, que proporciona gobernanza y soporte para la infraestructura de IA de código abierto. El proyecto cuenta con una comunidad activa de contribuyentes de la academia y la industria, y su desarrollo está guiado por mantenedores de organizaciones como Berkeley AI Research y Stanford AI Lab.

Véase también

  • Ollama
  • sglang
  • TensorRT-LLM
  • llama.cpp
  • openvino
  • open-neural-network-exchange
  • comparison-of-deep-learning-software
  • comparison-of-machine-learning-software
  • list-of-software-developed-at-universities
  • lists-of-open-source-artificial-intelligence-software
  • list-of-large-language-models
  • turboquant
  • 2025-present-global-memory-supply-shortage
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:open-source-software·large-language-models·inference-engine·machine-learning
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial