vLLMは、大規模言語モデルおよび関連するマルチモーダルモデルの推論とサービングのためのオープンソースソフトウェアフレームワークである。もともとはカリフォルニア大学バークレー校のSky Computing Labで開発され、このプロジェクトはトランスフォーマーのキー・バリューキャッシュのメモリ管理手法であるPagedAttentionを中心としており、連続バッチ処理、分散推論、量子化、OpenAI互換APIなどの機能をサポートしている。本番環境での大規模言語モデルの展開において、高スループットとメモリ効率を提供するように設計されている。
このプロジェクトは、AIコミュニティにおいてモデルサービングの標準ツールとして大きな支持を得ており、クラウドプロバイダーやハードウェアベンダー全体での採用が進んでいる。そのアーキテクチャと設計は、その後の推論フレームワークに影響を与え、2024年のLinux Foundationプロジェクトへの移行は、オープンソースAIインフラストラクチャにおける節目となった。
歴史
vLLMは、2023年にUCバークレーのSky Computing Labに所属する研究者らによって発表された。その中核となるアイデアは、2023年の論文「Efficient Memory Management for Large Language Model Serving with PagedAttention」で説明されており、このシステムを大規模言語モデルのための高スループットかつメモリ効率の高いサービングエンジンとして提示した。この論文では、PagedAttentionが、トランスフォーマー推論における重要なボトルネックであるキー・バリューキャッシュのメモリ浪費をどのように削減できるかを詳述した。
プロジェクトのメンテナーによると、vLLMの「v」はもともと「virtual」を指しており、仮想メモリに着想を得たものである。この命名は、このアルゴリズムがオペレーティングシステムのページング技術に対して負っている概念的負債を反映している。
PyTorchのプロジェクトページには、カリフォルニア大学バークレー校が2024年7月にvLLMをLinux Foundationに寄与したと記載されている。2025年には、PyTorch FoundationがvLLMがFoundation主催プロジェクトになったことを発表し、財団の傘下でのガバナンスを正式化した。2026年1月、TechCrunchは、vLLMの開発者らがプロジェクトを商業化するためにスタートアップInferactを立ち上げ、1億5000万ドルのシード資金を調達したと報じた。
アーキテクチャ
2023年の論文によると、vLLMは、トランスフォーマー推論中に使用されるキー・バリューキャッシュのメモリ浪費を削減することで、大規模言語モデルのサービング効率を向上させるように設計された。この論文では、オペレーティングシステムの仮想メモリとページング技術に着想を得たアルゴリズムであるPagedAttentionを紹介し、vLLMがブロックレベルのメモリ管理とリクエストスケジューリングを使用して、同様のレイテンシを維持しながらスループットを向上させることを説明した。
PagedAttentionは、キー・バリューキャッシュを固定サイズのブロックに分割することで機能し、これらのブロックはオペレーティングシステムが物理メモリページを管理するのと同様に、動的に割り当ておよび解放できる。このアプローチにより、断片化が最小限に抑えられ、GPUメモリのより効率的な使用が可能になり、より高いバッチサイズとハードウェアリソースのより良い利用が可能になる。
プロジェクトのドキュメントとリポジトリには、連続バッチ処理、チャンク化プレフィル、投機的デコード、プレフィックスキャッシング、量子化、および複数の形式の分散推論のサポートが記載されている。連続バッチ処理により、システムは完全なバッチを待つのではなく、リクエストが到着したときに処理できるため、応答性とスループットが向上する。投機的デコードは、より小さなドラフトモデルを使用して生成を高速化し、プレフィックスキャッシングは、共有プロンプトプレフィックスの計算を再利用する。
PyTorchは、vLLMを、NVIDIAおよびAMD GPU、Google TPU、AWS Trainium、Intelプロセッサを含むさまざまなハードウェアバックエンドをサポートする、高スループットでメモリ効率の高い推論およびサービングエンジンであると説明している。この幅広いハードウェアサポートにより、オンプレミスクラスターからクラウド環境まで、多様な展開シナリオに対応できる汎用性の高い選択肢となっている。
機能と能力
vLLMはOpenAI互換APIを提供しており、開発者は標準的なインターフェースを期待する既存のアプリケーションやツールと統合できる。この互換性により、他のサービングソリューションからの移行が簡素化され、LangChainやLlamaIndexなどのフレームワークとのシームレスな使用が可能になる。
vLLMの量子化サポートには、INT8およびINT4ウェイト量子化などの技術が含まれており、許容可能な精度を維持しながらモデルサイズとメモリフットプリントを削減する。これは、リソースに制約のあるハードウェアに大規模モデルを展開する場合に特に重要である。
分散推論機能により、vLLMはテンソル並列処理とパイプライン並列処理を使用して複数のGPUまたはノードにスケーリングでき、単一デバイスのメモリを超えるモデルを処理できる。これは、数百億のパラメータを持つフロンティア規模のモデルをサービングするために不可欠である。
エコシステムと採用
vLLMはAIインフラストラクチャエコシステムの基盤コンポーネントとなっており、主要なクラウドプロバイダーやハードウェアベンダーからの統合が進んでいる。例えば、AWSはTrainiumチップでvLLMをサポートし、Google CloudはTPUで提供している。AMDとIntelも、それぞれのアクセラレータ向けにvLLMを最適化しており、NVIDIA GPUを超えてそのリーチを広げている。
このプロジェクトのオープンソースの性質により、活発なコントリビューターコミュニティが育成され、定期的なリリースと増え続ける機能セットが提供されている。スタートアップと企業の両方による採用により、推論パフォーマンスのベンチマークとなっており、OllamaやSGLangなどの他のフレームワークとの比較でよく使用される。
関連項目
- Ollama
- SGLang
- TensorRT-LLM
- llama.cpp
- OpenVINO
- Open Neural Network Exchange
- 深層学習ソフトウェアの比較
- 機械学習ソフトウェアの比較
- 大学で開発されたソフトウェアの一覧
- オープンソースAIソフトウェアの一覧
- 大規模言語モデルの一覧
- TurboQuant
- 2025年から現在までの世界的なメモリ供給不足