vLLM é um framework de software de código aberto para inferência e serviço de modelos de linguagem de grande porte e modelos multimodais relacionados. Originalmente desenvolvido no Sky Computing Lab da Universidade da Califórnia, Berkeley, o projeto é centrado em PagedAttention, um método de gerenciamento de memória para caches de chave-valor em transformadores, e suporta recursos como batching contínuo, inferência distribuída, quantização e APIs compatíveis com OpenAI.
História
O vLLM foi introduzido em 2023 por pesquisadores afiliados ao Sky Computing Lab da UC Berkeley. Suas ideias centrais foram descritas no artigo de 2023 "Efficient Memory Management for Large Language Model Serving with PagedAttention", que apresentou o sistema como um mecanismo de serviço de alto rendimento e eficiência de memória para modelos de linguagem de grande porte. De acordo com um mantenedor do projeto, o "v" em vLLM originalmente se referia a "virtual", inspirado em memória virtual.
A página do projeto no PyTorch afirma que a Universidade da Califórnia, Berkeley, contribuiu com o vLLM para a Linux Foundation em julho de 2024. Em 2025, a PyTorch Foundation anunciou que o vLLM se tornou um projeto hospedado pela fundação. Em janeiro de 2026, a TechCrunch noticiou que os criadores do vLLM lançaram a startup Inferact para comercializar o projeto, levantando US$ 150 milhões em financiamento inicial.
Arquitetura
De acordo com seu artigo de 2023, o vLLM foi projetado para melhorar a eficiência do serviço de modelos de linguagem de grande porte, reduzindo o desperdício de memória no cache de chave-valor usado durante a inferência de transformadores. O artigo introduziu o PagedAttention, um algoritmo inspirado em memória virtual e técnicas de paginação de sistemas operacionais, e descreveu o vLLM como usando gerenciamento de memória em nível de bloco e agendamento de requisições para aumentar o rendimento, mantendo latência semelhante.
A documentação e o repositório do projeto descrevem suporte para batching contínuo, preenchimento em partes (chunked prefill), decodificação especulativa, cache de prefixos, quantização e múltiplas formas de inferência distribuída. O PyTorch descreveu o vLLM como um mecanismo de inferência e serviço de alto rendimento e eficiência de memória que suporta uma variedade de back-ends de hardware, incluindo GPUs NVIDIA e AMD, TPUs Google, AWS Trainium e processadores Intel.
Desempenho e Casos de Uso
O vLLM é amplamente utilizado em ambientes acadêmicos e industriais para servir modelos de linguagem de grande porte em escala. Seu alto rendimento o torna adequado para aplicações como chatbots, geração de código e assistentes de IA em tempo real. O framework integra-se com bibliotecas populares de modelos e pode ser implantado em plataformas de nuvem como Amazon Web Services, Google Cloud e Microsoft Azure.
Comunidade e Governança
Após ser contribuído para a Linux Foundation, o vLLM tornou-se um projeto sob a PyTorch Foundation, que fornece governança e suporte para infraestrutura de IA de código aberto. O projeto possui uma comunidade ativa de contribuidores da academia e da indústria, e seu desenvolvimento é orientado por mantenedores de organizações como BAIR (Berkeley AI Research) e Stanford AI Lab.
Veja Também
- Ollama
- sglang
- TensorRT-LLM
- llama.cpp
- openvino
- open-neural-network-exchange
- comparison-of-deep-learning-software
- comparison-of-machine-learning-software
- list-of-software-developed-at-universities
- lists-of-open-source-artificial-intelligence-software
- list-of-large-language-models
- turboquant
- 2025-present-global-memory-supply-shortage