vLLM 简调
vLLM 是一个开源的大模型推理与服务引擎,核心用途是让开发者更高效地部署和服务 LLM / 多模态模型。
vLLM llm-inference model-serving kv-cache openai-compatible-api vLLM 是一个开源的大模型推理与服务引擎,核心用途是让开发者更高效地部署和服务 LLM / 多模态模型。
vLLM
1. 调研缘由
这次把 vLLM 放进简调,主要是因为它已经不只是一个围绕 PagedAttention 的学术/开源项目,而是成了开源大模型推理层的一块重要积木。官网把 vLLM 说成“高吞吐、内存高效”的 LLM 推理与服务引擎,主打的点包括 OpenAI-compatible API、PagedAttention、连续批处理和成本效率 [S1]。
截至 2026-07-08,vLLM GitHub 仓库显示约 85.7k stars、19.1k forks、98 个 releases,最新 release 为 v0.24.0(2026-06-29),采用 Apache-2.0 license,并显示 2000+ contributors [S2]。这些数字不一定直接跟商业成功画等号,但至少说明它在开源 AI 基础设施里关注度不低,维护也很活跃。
2. 简介与产品工作流
vLLM 是给 LLM 做推理和服务的开源框架。它不训模型,也不是给普通用户聊天的产品,它的用户是开发者和工程团队——用来跑模型、接请求、返回结果,充当服务层的那一环 [S1][S2]。
典型用法:你从 Hugging Face 或本地目录挑一个模型,用 vLLM 起一个推理服务;然后上层应用可以走 OpenAI-compatible API 来调它,而不必改写已有的 OpenAI SDK 代码 [S3]。vLLM 文档列出了它支持的在线服务接口,包括 Completions、Chat Completions、Responses、Embeddings、音频转录/翻译、Anthropic Messages、Cohere Embed/Rerank、Classification、Score、Pooling 等 [S3]。
顺便提一句,这里的 voice_audio 指的是 vLLM 能跑 ASR(语音转文字)模型。文档里 /v1/audio/transcriptions、/v1/audio/translations 和 /v1/realtime 都注明了只适用于 Automatic Speech Recognition 模型,别把它理解成全套语音助手或 TTS 产品 [S3]。
vLLM 支持生成类和 pooling 类模型。Pooling 简单说就是把文本或多模态输入变成向量、分类分数、相似度分数或者 rerank 分数,常用在检索、排序和 embedding 里 [S3][S4]。GitHub README 还列出了 decoder-only LLM、MoE 模型、多模态模型、embedding / retrieval 模型、reward / classification 模型等类型,并且说自己支持 200+ Hugging Face 模型架构 [S2]。
对用的人来说,vLLM 改变的是“模型服务”这一层:以前大家可能直接用 Transformers 跑模型,或者自己折腾 batching、KV cache、并发和 API server;vLLM 把这些事打包成一个框架,让你更容易把模型变成应用能调用的服务 [S1][S2][S3]。
3. 团队与资本背景
vLLM 最早由 UC Berkeley Sky Computing Lab 开发。GitHub README 写明,它起源于 UC Berkeley Sky Computing Lab,现在由来自学术机构和公司的开源社区维护,已经有 2000+ contributors [S2]。其 2023 年 SOSP 论文的作者包括 Woosuk Kwon、Zhuohan Li、Siyuan Zhuang、Ying Sheng、Lianmin Zheng、Cody Hao Yu、Joseph E. Gonzalez、Hao Zhang、Ion Stoica 等 [S5]。
治理上,vLLM 在 2024 年进了 LF AI & Data 的孵化器,官方博客说这么做的目的是防止以后被某一家单独控制,同时保持许可证和商标开放 [S6]。到了 2025 年,PyTorch Foundation 又宣布把 vLLM 收为托管项目,称项目由 UC Berkeley 贡献,治理和管理会放在 PyTorch Foundation 的中立透明治理模型下 [S7]。
得把话说清楚:vLLM 本身是个开源项目,目前没看到公开资料说它做过项目融资。不过,TechCrunch 在 2026-01-22 的报道提到,vLLM 的创建者已经成立了一家叫 Inferact 的商业公司,完成了 1.5 亿美元种子轮,估值 8 亿美元,由 a16z 和 Lightspeed 联合领投 [S10]。这说明 vLLM 周边已经有商业主体跑出来了,但不能把 Inferact 的融资直接当成 vLLM 开源项目融的钱。
官网上列出的现金赞助方有 a16z、Sequoia Capital、Skywork AI、ZhenFund,算力资源支持方有 Alibaba Cloud、AMD、Anyscale、AWS、Crusoe Cloud、Google Cloud、IBM、Intel、Lambda Lab、Nebius、Novita AI、NVIDIA、Red Hat、Roblox、RunPod、UC Berkeley 等 [S1]。这些都算项目资源信号,不是客户名单,也不代表收入。
4. 技术基础与生态位
vLLM 坐落在 AI 基础设施的“推理服务层”。它不管训模型,只管让模型在 GPU、CPU 或别的加速器上跑得更高效,再通过 API 把模型能力暴露给上面的应用 [S1][S2]。
vLLM 早期打底的核心技术是 PagedAttention。大白话:LLM 在生成的时候会一直存着之前算好的结果,这种缓存叫 KV cache;PagedAttention 就把操作系统分页的思路搬过来,把 KV cache 切成一块一块来管,省显存、少重复拷贝 [S5]。论文里说,在同等延迟下,vLLM 比 FasterTransformer、Orca 这些系统吞吐能高出 2–4 倍,长序列、大模型和复杂解码场景下优势更明显 [S5]。
到了工程层面,README 上列了一长串能力:连续批处理、chunked prefill、prefix caching、CUDA/HIP graphs、多种量化方法、FlashAttention / FlashInfer / TRTLLM-GEN / FlashMLA / Triton 等 attention kernel,还有 speculative decoding、disaggregated prefill / decode / encode 等等 [S2]。这些都指向同一个方向:vLLM 早就不单是一个注意力算法实现,它是一个模型服务 runtime。你可以把 runtime 理解为“跑模型的底座”,上层应用不用再操心显存、调度和并发的细节。
另一条线是模型和硬件的适配。README 写明 vLLM 支持 NVIDIA GPU、AMD GPU、x86/ARM/PowerPC CPU,还能通过插件支持 Google TPU、Intel Gaudi、IBM Spyre、Huawei Ascend、Rebellions NPU、Apple Silicon、MetaX GPU 等硬件 [S2]。PyTorch Foundation 的介绍里也强调 vLLM 跟 PyTorch 深度集成,借 PyTorch 当统一接口,去支持 NVIDIA GPU、AMD GPU、Google Cloud TPU、Intel GPU/CPU、Intel Gaudi、AWS Neuron 等后端 [S7]。
vLLM 也在往更完整的生产推理栈扩展。官网把 AIBrix、Production Stack、Semantic Router、Speculators、vLLM Omni 等列为生态项目 [S1]。AIBrix GitHub README 说自己是面向 GenAI inference infrastructure 的,提供了 LLM Gateway / Routing、autoscaler、unified AI runtime、distributed inference、distributed KV cache、heterogeneous serving、GPU failure detection 等组件 [S9]。
5. 市场与外部信号
看 vLLM 的市场信号,主要看开源活跃度、基金会治理、生产栈扩展和商业化动作,而不是传统的 SaaS 定价或 ARR 数据。截至 2026-07-08,GitHub 显示 vLLM 约 85.7k stars、19.1k forks、98 个 releases、v0.24.0 latest Jun 29, 2026、Apache-2.0 license,并显示 2000+ contributors [S2]。
赞助名单显示 vLLM 已经拿到不少云、芯片、AI 基础设施和科技公司的现金或算力支持,这能说明生态资源,但不能单独拿来证明实际用的人有多少 [S1]。
在生产化这个方向上,vLLM 官网把 AIBrix 和 Production Stack 放进了项目生态;AIBrix README 还显示截至 2026-07-08 约 4.9k stars、617 forks、20 个 releases,latest release 为 v0.7.0(2026-06-18)[S1][S8][S9]。这能看出来 vLLM 周边已经有面向 Kubernetes 和大规模推理部署的配套基础设施在长。
商业化方面,TechCrunch 报道 vLLM 创建者成立 Inferact 并融资 1.5 亿美元,用于把 vLLM 相关方向商业化 [S10]。这条信息说明推理基础设施赛道有资本在关注,但这份简调不做投资判断,也不会把商业化结果直接外推到 vLLM 的未来表现上。
6. 公开评价与主要分歧
正面评价(官方/基金会/独立实测):
- 官方自己把 vLLM 的核心价值概括成高吞吐、内存高效、OpenAI-compatible API 和更低的推理成本;这当然是官方口径,不算独立评价,但能反映出产品定位 [S1][S3]。
- PyTorch Foundation 把 vLLM 称为高吞吐、内存高效的 LLM 推理与服务引擎,并强调它跟 PyTorch 的深度集成和跨硬件后端支持;基金会背书,独立性不如第三方跑分,但能说明项目在生态里的位置 [S7]。
- 有篇 2025 年 arXiv 对比研究,拿 LLaMA-2 不同尺寸、不同并发测了,发现在高并发下 vLLM 比 Hugging Face TGI 吞吐高 2 到 24 倍,显存占用也低 19–27%;研究也指出低并发时 TGI 的首 token 延迟更低,说明优势跟场景强相关 [S11]。
- Spheron 在 2026 年用 H100 80GB 跑 Llama 3.3 70B FP8,对比了 vLLM、SGLang、TensorRT-LLM,发现它们在吞吐、TTFT、冷启动和显存上各有胜负。测试把 vLLM 归到通用、模型更新灵活、冷启动较快的那类,不过这场测试里,TensorRT-LLM 的峰值吞吐和 TTFT 更强 [S18]。
主要批评/质疑(研究论文/社区用户):
- vAttention 这篇论文从设计上质疑 PagedAttention:它认为 PagedAttention 为了运行时的物理显存分配,把 KV cache 的虚拟内存布局搞成了非连续,带来了编程和性能开销。论文提出 vAttention 当替代方案,并称在某些场景下,比基于 PagedAttention 的 kernel 吞吐最高能高出 1.23 倍 [S12]。
- 也有社区用户在 GitHub 上反馈,超长上下文或大 KV cache 的时候可能 OOM 或者起不来。比如 issue #5847 提到,100k+ context length 的模型在分配 KV cache 时 OOM;这只能说明个别用户遇到了,不能直接推出 vLLM 普遍有长上下文问题 [S13]。
- 还有 issue #40420 说,在特定的 TurboQuant / 长上下文 prefill 配置下,一次约 185K tokens 的请求会 CUDA OOM,把 engine 搞退出。这只是具体配置下的个例,不能据此说所有部署都会出一样的问题 [S14]。
存在分歧之处:
公开资料里的主要分歧,不在“vLLM 有没有用”,而在“它适合什么样的推理负载”。独立研究和实测把 vLLM 定位在高吞吐、通用模型服务、快速接入 OpenAI 兼容 API 这一侧,同时也提示,如果是低并发交互延迟、固定模型的 NVIDIA 极限优化、超长上下文显存管理、复杂生产路由这些场景,就得结合 TGI、TensorRT-LLM、SGLang 或者额外的生产栈一起评估 [S11][S12][S18]。
7. 同类对比(与头部/高知名度同类项目)
主要对标项目:
- SGLang:一个开源的 LLM / 多模态模型 serving 框架,主攻低延迟、高吞吐,靠 RadixAttention、prefix reuse 和结构化生成 [S15]。
- Hugging Face Text Generation Inference(TGI):Hugging Face 的 LLM 部署与服务工具,现在官方文档标了 maintenance mode,推荐后续转向 vLLM、SGLang 等下游引擎 [S16]。
- NVIDIA TensorRT-LLM:NVIDIA 面向 LLM 和视觉生成推理的开源优化库,聚焦 NVIDIA GPU 上的高性能推理,在 kernel 和 runtime 上做深度优化 [S17]。
关键维度对比(事实,标来源):
| 维度 | vLLM | SGLang | Hugging Face TGI | TensorRT-LLM |
|---|---|---|---|---|
| 项目定位 | LLM 推理与服务引擎,主打高吞吐、内存高效和 OpenAI-compatible API [S1][S3] | LLM / 多模态模型高性能 serving framework,面向低延迟和高吞吐 [S15] | LLM 部署与服务工具,Hugging Face 文档称目前处于 maintenance mode [S16] | 面向 LLM 和 Visual Gen inference 的 NVIDIA 优化库 [S17] |
| 核心技术侧重 | PagedAttention、连续批处理、chunked prefill、prefix caching、多种量化和 optimized kernels [S2][S5] | RadixAttention、zero-overhead CPU scheduler、prefill-decode disaggregation、speculative decoding、continuous batching、paged attention 等 [S15] | continuous batching、Flash Attention / Paged Attention、tensor parallelism、token streaming、Prometheus metrics 等 [S16] | custom kernels、Prefill-Decode disaggregation、Wide Expert Parallelism、Speculative Decoding、PyTorch-native LLM API 等 [S17] |
| API / 集成 | 支持 OpenAI Completions、Chat Completions、Responses、Embeddings、音频转录/翻译、Anthropic Messages、Cohere Embed/Rerank 等接口 [S3] | README 称兼容多数 Hugging Face models 和 OpenAI APIs [S15] | 文档称 TGI 支持高性能文本生成,并列出生产监控、SSE streaming 等功能;另标注 maintenance mode [S16] | 提供 Python LLM API,并可与 NVIDIA Dynamo、Triton Inference Server 等生态集成 [S17] |
| 模型 / 硬件覆盖 | README 称支持 200+ Hugging Face 模型架构,并覆盖 NVIDIA、AMD、CPU 及多类硬件插件 [S2] | README 称支持多类语言模型、embedding、reward、diffusion 模型,并支持 NVIDIA、AMD、Intel CPU、TPU、Ascend 等硬件 [S15] | 文档列出 Llama、Falcon、StarCoder、BLOOM、GPT-NeoX、T5 等热门开源 LLM [S16] | README 强调 NVIDIA GPU 上的高效推理,并支持单 GPU、多 GPU、多节点部署 [S17] |
| 当前维护状态信号 | GitHub 显示 98 个 releases,latest release 为 v0.24.0(2026-06-29)[S2] | GitHub README 显示仍在持续更新,并列出 2026 年多项更新与生产采用声明 [S15] | 官方文档明确写明目前进入 maintenance mode,仅接受小 bug fix、文档和轻量维护任务 [S16] | NVIDIA 官方 GitHub 和文档持续维护,README 列出近期功能和优化方向 [S17] |
公开评价中的对比(标源,非个人裁决):
- 那篇 arXiv 对比研究说,在他们测的设置下,vLLM 高并发吞吐比 TGI 强,但 TGI 低并发下 TTFT 更低;这个差别更像工作负载取舍,不是谁全好谁全坏 [S11]。
- Spheron 的 H100 测试显示,在 Llama 3.3 70B FP8 单卡 H100 下,TensorRT-LLM 吞吐和 TTFT 最强,vLLM 和 SGLang 冷启动更短,测试也强调三家的适用场景不一样 [S18]。
- SGLang 的 README 把重点放在 RadixAttention、prefix caching、MoE、结构化输出和多硬件支持上;vLLM 的 README 更侧重 PagedAttention、广泛的模型和硬件适配、OpenAI-compatible API 以及生产服务能力 [S2][S15]。
8. 信息缺口与后续观察
- 关于 vLLM 开源项目本身的收入、商业客户数或真实生产流量,目前没找到足够公开资料来确认。
- Inferact 的商业化方向已经有公开融资信息,但它的产品边界、跟 vLLM 开源项目的治理关系、商业版本功能差异,还得继续观察。
- vLLM 的 GitHub stars、forks、release 数量只能说明开源关注度和活跃度,不能直接推导成生产采用规模。
- 长上下文、多模态、MoE、异构 GPU、生产路由和自动扩缩容,这些会继续是 vLLM 的关键观察点。
- 如果后续做深挖,还得补实测:同一模型、同一硬件、同一并发下对比 vLLM / SGLang / TensorRT-LLM / TGI 的 TTFT、TPOT、吞吐、显存、冷启动和异常恢复。
9. 归纳洞察 ★
vLLM 背后是 AI 基础设施正在发生的一个变化:模型能力越来越多,难题早就不在“有没有模型”,而在“怎么稳定、便宜、高吞吐地把模型跑起来”。它卡的位置是推理 runtime,也就是把模型变成业务系统能直接调的服务。
vLLM 的演进路子也很典型:先是从 PagedAttention 这种单点系统优化入手,再靠 OpenAI 兼容 API、广泛模型支持、硬件适配,还有 AIBrix、Production Stack 这些生态组件,逐步进入生产推理栈。它的价值不单靠某个算法,也靠生态兼容和工程上容易落地。
拿它跟 SGLang、TGI、TensorRT-LLM 一比就清楚,开源推理引擎已经进入多路线并存的阶段。团队选哪个引擎,往往得看工作负载、硬件、模型更新频率、延迟目标、运维能力,不能光盯着一两个 benchmark 数字。
10. 来源与更新时间
- 信息截至(as_of): 2026-07-08
- 最后复查(last_checked): 2026-07-08
- 最后更新(last_updated): null