vLLM é um framework de software de código aberto para inferência e serviço de modelos de linguagem de grande porte (LLMs) e modelos multimodais relacionados. Desenvolvido originalmente no Sky Computing Lab da Universidade da Califórnia, Berkeley, o projeto é centrado no PagedAttention, um método de gerenciamento de memória para caches de chave-valor de transformers, e suporta recursos como agrupamento contínuo, inferência distribuída, quantização e uma API compatível com a OpenAI. Ele é projetado para fornecer alta taxa de transferência e eficiência de memória na implantação de modelos em produção.
O projeto ganhou força significativa na comunidade de inteligência artificial como uma ferramenta padrão para servir modelos, com adoção em provedores de nuvem e fornecedores de hardware. Sua arquitetura influenciou frameworks subsequentes, e sua transição para um projeto da Linux Foundation em 2024 marcou um marco na infraestrutura de IA de código aberto.
História
O vLLM foi introduzido em 2023 por pesquisadores afiliados ao Sky Computing Lab da UC Berkeley. Suas ideias centrais foram descritas no artigo de 2023 "Efficient Memory Management for Large Language Model Serving with PagedAttention", que apresentou o sistema como um mecanismo de serviço de alto rendimento e eficiência de memória para LLMs. O artigo detalhou como o PagedAttention poderia reduzir o desperdício de memória no cache de chave-valor, um gargalo crítico na inferência de transformers.
De acordo com um mantenedor do projeto, o "v" em vLLM originalmente se referia a "virtual", inspirado na memória virtual. Essa nomenclatura reflete a dívida conceitual do algoritmo com técnicas de paginação de sistemas operacionais.
A página do projeto no PyTorch afirma que a Universidade da Califórnia, Berkeley, contribuiu com o vLLM para a Linux Foundation em julho de 2024. Em 2025, a PyTorch Foundation anunciou que o vLLM se tornou um projeto hospedado pela fundação, formalizando sua governança sob a organização. Em janeiro de 2026, o TechCrunch relatou que os criadores do vLLM lançaram a startup Inferact para comercializar o projeto, levantando US$ 150 milhões em financiamento inicial.
Arquitetura
De acordo com seu artigo de 2023, o vLLM foi projetado para melhorar a eficiência do serviço de modelos de linguagem de grande porte, reduzindo o desperdício de memória no cache de chave-valor usado durante a inferência de transformers. O artigo introduziu o PagedAttention, um algoritmo inspirado em memória virtual e técnicas de paginação de sistemas operacionais, e descreveu o vLLM como usando gerenciamento de memória em nível de blocos e agendamento de requisições para aumentar a taxa de transferência, mantendo latência semelhante.
O PagedAttention funciona dividindo o cache de chave-valor em blocos de tamanho fixo, que podem ser alocados e desalocados dinamicamente, de forma semelhante a como os sistemas operacionais gerenciam páginas de memória física. Essa abordagem minimiza a fragmentação e permite um uso mais eficiente da memória da GPU, possibilitando tamanhos de lote maiores e melhor utilização dos recursos de hardware.
A documentação e o repositório do projeto descrevem suporte para agrupamento contínuo, pré-preenchimento especulativo, decodificação especulativa, cache de prefixo, quantização e múltiplas formas de inferência distribuída. O agrupamento contínuo permite que o sistema processe requisições conforme elas chegam, em vez de esperar por um lote completo, melhorando a capacidade de resposta e a taxa de transferência. A decodificação especulativa usa modelos auxiliares menores para acelerar a geração, enquanto o cache de prefixo reutiliza computações para prefixos de prompt compartilhados.
O PyTorch descreveu o vLLM como um mecanismo de inferência e serviço de alto rendimento e eficiência de memória que suporta uma variedade de back-ends de hardware, incluindo GPUs NVIDIA e AMD, TPUs do Google, AWS Trainium e processadores Intel. Esse amplo suporte de hardware o torna uma escolha versátil para diversos cenários de implantação, desde clusters locais até ambientes de nuvem.
Recursos e Capacidades
O vLLM fornece uma API compatível com a OpenAI, permitindo que desenvolvedores o integrem com aplicações e ferramentas existentes que esperam uma interface padrão. Essa compatibilidade simplifica a migração de outras soluções de serviço e permite o uso contínuo com frameworks como LangChain e LlamaIndex.
O suporte a quantização no vLLM inclui técnicas como quantização de pesos INT8 e INT4, que reduzem o tamanho do modelo e a pegada de memória enquanto mantêm precisão aceitável. Isso é particularmente importante para implantar modelos grandes em hardware com recursos limitados.
As capacidades de inferência distribuída permitem que o vLLM escale em múltiplas GPUs ou nós, usando paralelismo de tensor e paralelismo de pipeline para lidar com modelos que excedem a memória de um único dispositivo. Isso é essencial para servir modelos de fronteira com centenas de bilhões de parâmetros.
Ecossistema e Adoção
O vLLM tornou-se um componente fundamental na infraestrutura de IA, com integrações de grandes provedores de nuvem e fornecedores de hardware. Por exemplo, AWS suporta o vLLM em seus chips Trainium, e Google Cloud o oferece em TPUs. AMD e Intel também otimizaram o vLLM para seus aceleradores, ampliando seu alcance além das GPUs NVIDIA.
A natureza de código aberto do projeto promoveu uma comunidade vibrante de contribuidores, com lançamentos regulares e um conjunto crescente de recursos. Sua adoção por startups e empresas o tornou uma referência para desempenho de inferência, frequentemente usado em comparações com outros frameworks como Ollama e SGLang.
Ver Também
- Ollama
- SGLang
- TensorRT-LLM
- llama.cpp
- OpenVINO
- Open Neural Network Exchange
- Comparação de software de aprendizado profundo
- Comparação de software de aprendizado de máquina
- Lista de software desenvolvido em universidades
- Listas de software de IA de código aberto
- Lista de modelos de linguagem de grande porte
- TurboQuant
- Escassez global de memória de 2025–presente