영어에서 번역됨

vLLM은 UC 버클리 스카이 컴퓨팅 연구소에서 개발된 오픈소스 소프트웨어 프레임워크로, 대규모 언어 모델의 고처리량 추론 및 서빙을 위한 것이며, PagedAttention 메모리 관리에 중점을 둡니다.

vLLM은 대규모 언어 모델 및 관련 멀티모달 모델의 추론과 서빙을 위한 오픈소스 소프트웨어 프레임워크이다. 원래 캘리포니아 대학교 버클리 캠퍼스의 Sky Computing Lab에서 개발되었으며, 트랜스포머 키-값 캐시를 위한 메모리 관리 기법인 PagedAttention을 중심으로 한다. 연속 배치, 분산 추론, 양자화, OpenAI 호환 API 등의 기능을 지원한다.

역사

vLLM은 2023년 UC 버클리의 Sky Computing Lab 소속 연구자들에 의해 처음 소개되었다. 핵심 아이디어는 2023년 논문 "Efficient Memory Management for Large Language Model Serving with PagedAttention"에서 설명되었으며, 이 논문은 해당 시스템을 대규모 언어 모델 서빙을 위한 고처리량·고효율 메모리 엔진으로 제시했다. 프로젝트 유지관리자에 따르면, vLLM의 "v"는 원래 가상 메모리에서 영감을 받은 "virtual"을 의미했다.

PyTorch 프로젝트 페이지에 따르면, 캘리포니아 대학교 버클리 캠퍼스는 2024년 7월 vLLM을 Linux 재단에 기여했다. 2025년에는 PyTorch 재단이 vLLM이 재단 호스팅 프로젝트가 되었음을 발표했다. 2026년 1월, TechCrunch는 vLLM 창립자들이 이 프로젝트를 상용화하기 위해 Inferact라는 스타트업을 설립하고 1억 5천만 달러의 시드 펀딩을 유치했다고 보도했다.

아키텍처

2023년 논문에 따르면, vLLM은 트랜스포머 추론 중 키-값 캐시의 메모리 낭비를 줄여 대규모 언어 모델 서빙의 효율성을 높이도록 설계되었다. 이 논문은 운영체제의 가상 메모리 및 페이징 기법에서 영감을 받은 PagedAttention 알고리즘을 소개했으며, vLLM이 블록 수준 메모리 관리와 요청 스케줄링을 사용하여 지연 시간을 유지하면서도 처리량을 높인다고 설명했다.

프로젝트 문서와 저장소에 따르면, vLLM은 연속 배치, 청크 프리필, 추측 디코딩, 프리픽스 캐싱, 양자화, 그리고 여러 형태의 분산 추론을 지원한다. PyTorch는 vLLM을 NVIDIA 및 AMD GPU, Google TPU, AWS Trainium, Intel 프로세서 등 다양한 하드웨어 백엔드를 지원하는 고처리량·고효율 메모리 추론 및 서빙 엔진으로 설명한다.

성능 및 사용 사례

vLLM은 학계와 산업계 모두에서 대규모 언어 모델을 대규모로 서빙하는 데 널리 사용된다. 높은 처리량 덕분에 챗봇, 코드 생성, 실시간 AI 어시스턴트와 같은 애플리케이션에 적합하다. 이 프레임워크는 널리 사용되는 모델 라이브러리와 통합되며, Amazon Web Services, Google Cloud, Azure와 같은 클라우드 플랫폼에 배포할 수 있다.

커뮤니티 및 거버넌스

Linux 재단에 기여된 이후, vLLM은 PyTorch 재단 산하 프로젝트가 되었으며, 재단이 오픈소스 AI 인프라에 대한 거버넌스와 지원을 제공한다. 이 프로젝트는 학계와 산업계의 기여자들로 구성된 활발한 커뮤니티를 보유하고 있으며, 개발은 Berkeley AI ResearchStanford AI Lab과 같은 기관의 유지관리자들에 의해 주도된다.

같이 보기

  • Ollama
  • sglang
  • TensorRT-LLM
  • llama.cpp
  • openvino
  • open-neural-network-exchange
  • comparison-of-deep-learning-software
  • comparison-of-machine-learning-software
  • list-of-software-developed-at-universities
  • lists-of-open-source-artificial-intelligence-software
  • list-of-large-language-models
  • turboquant
  • 2025-present-global-memory-supply-shortage
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:open-source-software·large-language-models·inference-engine·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사