vLLM 프로젝트

영어에서 번역됨

vLLM은 UC 버클리에서 개발된 대규모 언어 모델의 고처리량, 메모리 효율적 추론 및 서빙을 위한 오픈소스 프레임워크로, PagedAttention 알고리즘에 중점을 둔다. 연속 배칭, 양자화, OpenAI 호환 API와 같은 기능을 지원하며, 2024년에 Linux 재단 프로젝트가 되었다.

vLLM은 대규모 언어 모델 및 관련 멀티모달 모델의 추론과 서빙을 위한 오픈소스 소프트웨어 프레임워크이다. 원래 캘리포니아 대학교 버클리 캠퍼스의 Sky Computing Lab에서 개발되었으며, 트랜스포머 키-값 캐시를 위한 메모리 관리 기법인 PagedAttention을 중심으로 한다. 지속적 배칭(continuous batching), 분산 추론, 양자화, OpenAI 호환 API 등의 기능을 지원하며, 프로덕션 환경에서 대규모 언어 모델을 배포할 때 높은 처리량과 메모리 효율성을 제공하도록 설계되었다.

이 프로젝트는 인공지능 커뮤니티에서 모델 서빙의 표준 도구로 널리 채택되었으며, 여러 클라우드 제공업체와 하드웨어 벤더에서 사용되고 있다. vLLM의 아키텍처와 설계는 이후 등장한 추론 프레임워크들에 영향을 주었고, 2024년 리눅스 재단 프로젝트로 이관되면서 오픈소스 AI 인프라의 중요한 이정표를 세웠다.

역사

vLLM은 2023년 Sky Computing Lab 소속 연구자들에 의해 처음 소개되었다. 핵심 아이디어는 2023년 논문 "Efficient Memory Management for Large Language Model Serving with PagedAttention"에서 설명되었으며, 이 논문은 트랜스포머 추론의 주요 병목인 키-값 캐시의 메모리 낭비를 줄이는 고처리량·고효율 서빙 엔진을 제시했다.

프로젝트 관계자에 따르면, vLLM의 "v"는 가상 메모리(virtual memory)에서 유래했으며, 이는 운영체제의 페이징 기법에서 영감을 받은 알고리즘의 설계 철학을 반영한다.

PyTorch 프로젝트 페이지에 따르면, 캘리포니아 대학교 버클리 캠퍼스는 2024년 7월 vLLM을 리눅스 재단에 기여했다. 2025년에는 PyTorch 재단이 vLLM을 재단 산하 프로젝트로 공식 발표하면서 거버넌스 체계를 정비했다. 2026년 1월, TechCrunch는 vLLM 창립자들이 프로젝트 상용화를 위해 Inferact라는 스타트업을 설립했으며 1억 5천만 달러의 시드 투자를 유치했다고 보도했다.

아키텍처

2023년 논문에 따르면, vLLM은 트랜스포머 추론 중 키-값 캐시의 메모리 낭비를 줄여 대규모 언어 모델 서빙의 효율성을 높이도록 설계되었다. 논문은 운영체제의 가상 메모리 및 페이징 기법에서 영감을 받은 PagedAttention 알고리즘을 소개했으며, vLLM은 블록 단위 메모리 관리와 요청 스케줄링을 통해 처리량을 높이면서도 지연 시간을 유지하는 방식을 채택했다.

PagedAttention은 키-값 캐시를 고정 크기 블록으로 분할하고, 이를 동적으로 할당 및 해제함으로써 메모리 단편화를 최소화한다. 이를 통해 GPU 메모리를 보다 효율적으로 사용할 수 있으며, 더 큰 배치 크기와 하드웨어 자원의 효율적 활용이 가능해진다.

기능 및 역량

vLLM은 지속적 배칭, 청크 프리필(chunked prefill), 추측 디코딩(speculative decoding), 프리픽스 캐싱(prefix caching), 양자화, 다양한 분산 추론 방식을 지원한다. 지속적 배칭은 요청이 도착하는 대로 처리하여 배치 완료를 기다리지 않음으로써 응답성과 처리량을 개선한다. 추측 디코딩은 더 작은 드래프트 모델을 사용해 생성 속도를 높이며, 프리픽스 캐싱은 공유 프롬프트 접두사에 대한 연산을 재사용한다.

PyTorch는 vLLM을 고처리량·고효율 추론 및 서빙 엔진으로 소개하며, NVIDIA 및 AMD GPU, Google TPU, AWS Trainium, Intel 프로세서 등 다양한 하드웨어 백엔드를 지원한다고 설명한다. 이러한 광범위한 하드웨어 지원 덕분에 vLLM은 온프레미스 클러스터부터 클라우드 환경까지 다양한 배포 시나리오에서 활용될 수 있다.

기능 및 역량

vLLM은 OpenAI 호환 API를 제공하므로, 기존 애플리케이션과 도구를 수정 없이 통합할 수 있다. 이는 다른 서빙 솔루션에서의 마이그레이션을 단순화하며, LangChain 및 LlamaIndex와 같은 프레임워크와의 연동을 용이하게 한다.

vLLM의 양자화 지원에는 INT8 및 INT4 가중치 양자화 기법이 포함되며, 이는 모델 크기와 메모리 사용량을 줄이면서도 허용 가능한 정확도를 유지한다. 이는 리소스가 제한된 하드웨어에서 대규모 모델을 배포할 때 특히 중요하다.

분산 추론 기능을 통해 vLLM은 텐서 병렬 처리(tensor parallelism)와 파이프라인 병렬 처리(pipeline parallelism)를 사용하여 단일 장치의 메모리를 초과하는 모델을 여러 GPU 또는 노드에 걸쳐 확장할 수 있다. 이는 수천억 개의 파라미터를 가진 최첨단(frontier-scale) 모델을 서빙하는 데 필수적이다.

생태계 및 채택

vLLM은 AI 인프라 생태계의 핵심 구성 요소가 되었으며, 주요 클라우드 제공업체와 하드웨어 벤더의 통합을 지원한다. 예를 들어, AWS는 자사의 Trainium 칩에서 vLLM을 지원하며, Google Cloud는 TPU에서 vLLM을 제공한다. AMDIntel도 자사의 가속기에서 vLLM을 최적화하여 NVIDIA GPU 외의 하드웨어로 적용 범위를 넓혔다.

이 프로젝트의 오픈소스 특성 덕분에 활발한 기여자 커뮤니티가 형성되었고, 정기적인 릴리스와 지속적인 기능 확장이 이루어지고 있다. vLLM은 스타트업과 대기업 모두에서 채택되어 추론 성능의 벤치마크로 자리 잡았으며, Ollama 및 SGLang과 같은 다른 프레임워크와의 비교 대상이 되기도 한다.

같이 보기

  • Ollama
  • SGLang
  • TensorRT-LLM
  • llama.cpp
  • OpenVINO
  • ONNX
  • 딥러닝 소프트웨어 비교
  • 기계 학습 소프트웨어 비교
  • 대학에서 개발된 소프트웨어 목록
  • 오픈소스 AI 소프트웨어 목록
  • 대규모 언어 모델 목록
  • TurboQuant
  • 2025년~현재 전 세계 메모리 공급 부족
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:open-source-software·large-language-models·machine-learning·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사