解剖 vLLM:一个开源推理引擎如何吃掉 AI 推理市场

2026.08.07 18:33
从伯克利一篇论文到全球最大科技公司的推理基础设施,vLLM 用两年时间完成了 AI 基础设施史上最惊人的逆袭。本文基于 Aleksa Gordić 4 万字深度技术分析,拆解 PagedAttention、连续批处理、前缀缓存、投机解码到多节点动态服务的完整优化矩阵,揭示 vLLM 如何成为 AI 推理管道上的 Linux。

想象一个场景:你部署了一个 70B 参数的 Llama 模型,用传统静态批处理对外提供服务。第一批请求涌入,GPU 计算利用率不到 30%,因为短请求必须等长请求跑完才能释放。60% 到 80% 的显存被 KV 缓存的碎片浪费掉,你不得不频繁重启服务来清理这个内存黑洞。2023 年以前,这几乎是每个 AI 推理团队都要面对的日常。

但今天,一个名为 vLLM 的开源项目,用一套层层叠加的系统架构方案,把这些问题变成了历史。它不仅仅是一个推理引擎,它正在成为 AI 基础设施层的 Linux。不是因为它最花哨,而是因为它最可靠、最开放、最被信任。

从伯克利到全球生产环境:vLLM 的崛起

2023 年 9 月,加州大学伯克利分校的研究团队在 SOSP 操作系统原理研讨会上发表了一篇论文《Efficient Memory Management for Large Language Model Serving with PagedAttention》。核心思想极其简单,但效果惊人:把操作系统虚拟内存的分页管理机制引入 LLM 推理的 KV 缓存管理,将非连续的内存块映射为逻辑上的连续空间。

这个想法被实现在一个名为 vLLM 的开源项目中。两年后的今天,它的用户名单几乎覆盖了全球 AI 产业的半壁江山。

Amazon Rufus 和 LinkedIn 的 AI 功能背后跑着 vLLM。Meta、Mistral AI、Cohere、IBM 在生产环境中使用它。Stripe 迁移到 vLLM 后,推理成本降低了 73%,每天 5000 万次 API 调用只需要原来 1/3 的 GPU 集群。Tesla 在生产环境中采用 KServe 加 llm-d 加 vLLM 的推理栈。Red Hat、Google Cloud、IBM Research、NVIDIA 和 CoreWeave 联合发起了 llm-d 项目,构建基于 Kubernetes 的分布式推理堆栈,底层引擎就是 vLLM。

一个开源项目,从 2023 年一篇论文起步,到 2025 年成为全球最大科技公司的 AI 推理基础设施。这不是偶然。vLLM 的成功根植于它对现代 LLM 推理系统核心瓶颈的深刻理解,以及一套层层叠加的系统级优化方案。

2025 年 8 月 29 日,AI 系统工程师 Aleksa Gordić 发布了一篇长达 4 万字的深度技术分析《Inside vLLM: Anatomy of a High-Throughput LLM Inference System》。这篇博客基于 vLLM 仓库 2025 年 8 月 9 日的代码提交,对 vLLM 的 V1 引擎进行了从底层到上层的完整解剖。这篇分析为我们理解现代 AI 推理系统的设计哲学,提供了一份极其珍贵的技术说明书。

PagedAttention:改变游戏规则的第一个变量

LLM 推理的核心瓶颈在于 KV 缓存。每一次生成长序列,模型都需要为每个 token 计算 Key 和 Value 矩阵,并缓存起来供后续的 attention 计算使用。对于一个大模型,在 16K 上下文长度下,KV 缓存可达数 GB,比模型权重本身还要大。

传统推理框架的问题是 KV 缓存被分配为连续的内存块。当一个请求完成后释放缓存,会在内存中留下各种大小的空洞。这些碎片随着请求数量增加而不断累积,根据 vLLM 论文的数据,传统系统因此浪费了 60% 到 80% 的显存。

PagedAttention 的解决方案极其直接:把 KV 缓存分割成固定大小的块,用类似操作系统虚拟内存的方式管理,按需分配,不连续存储,通过块表来映射逻辑位置和物理位置。默认块大小为 16 个 token。

这个设计带来的直接效果是内存碎片几乎完全消除。根据第三方学术基准测试,PagedAttention 减少了 19% 到 27% 的内存消耗,使得相同显存下可以承载更大的批处理规模。在一项针对 vLLM 和 HuggingFace TGI 的对比研究中,vLLM 在同等硬件条件下实现了 2 到 24 倍的吞吐量优势,GPU 利用率达到 85% 到 92%,而 TGI 仅为 68% 到 74%。

连续批处理:让 GPU 永远不闲着

PagedAttention 解决了内存效率问题,但推理吞吐量的另一个瓶颈在于调度策略。

传统静态批处理的工作方式是收集一批请求,一起推理,等所有请求都完成后释放整批。这导致短请求必须等长请求,GPU 在等待中空转。

vLLM 实现了连续批处理,也叫迭代级调度。每一轮解码步骤结束时,vLLM 检查运行队列中哪些请求已经完成生成,立即把等待队列中的下一个请求插入空位。GPU 在每一轮推理中处理的是一个动态变化的超级批次。

具体实现上,vLLM 将所有序列的 token 展平并拼接成一个超长序列,通过位置索引和 attention mask 确保每个序列只关注自己的 token。这完全避免了 right-padding 带来的计算浪费。

根据 Anyscale 的基准测试,连续批处理在 vLLM 上可以实现 23 倍的吞吐量提升。如今,这已经成为所有主流推理引擎的标配功能。

从预填到解码:vLLM 的进阶优化矩阵

连续批处理解决了短请求等长请求的问题,但引入了一个新的矛盾。Prefill 阶段和 Decode 阶段的计算特性完全不同。

Prefill 是计算密集型,可以并行处理整个 prompt 的所有 token。Decode 是内存密集型,每次只生成一个 token,计算资源利用率极低,学术论文中记录到 GPU 计算单元利用率低于 20%。如果一个长 prompt 的 prefill 阶段占据了整个 GPU,所有正在解码的请求都会被阻塞。这就是 prefill 阻塞问题。

vLLM 的 chunked prefill 把长 prompt 切分成多个块,每个块在 prefill 完成后立即释放 GPU 给 decode 请求使用。这就像高速公路上的潮汐车道,在 prefill 和 decode 之间动态分配计算资源。

在对话式 AI 应用中,大量请求共享相同的系统提示。例如,一个 AI 客服助手每次请求都包含相同的指令。传统框架每次都要重新计算这些相同 token 的 KV 缓存,造成大量浪费。

vLLM 的自动前缀缓存通过 SHA-256 对每个 KV 缓存块进行哈希,存储在内存中。当新请求的 token 前缀与某个已缓存的块匹配时,直接复用缓存,跳过计算。系统提示越长,节省的计算量越大。

投机解码则是 vLLM 优化体系中最具想象力的一个模块。LLM 推理的根本瓶颈在于解码的自回归特性:一次只能生成一个 token,每个 token 都需要一次完整的前向传播。投机解码的核心思路是用一个更小的草稿模型快速生成多个候选 token,然后用大模型并行验证这些 token。

vLLM 支持多种投机解码方案,包括标准投机解码、EAGLE 系列、Medusa 以及自投机解码。根据 vLLM 官方博客的测试,在摘要任务上使用 prompt lookup decoding 方式,可以实现最高 2.8 倍的加速。不过,投机解码在低 QPS 环境下效果最好,在高并发场景下由于额外计算开销,收益可能大幅缩减甚至消失。

从单 GPU 到多节点:vLLM 的扩展架构

vLLM 的架构设计从一开始就考虑到了水平扩展。在引擎核心层面,它通过一个名为 Engine Core 的组件统一管理调度、KV 缓存和模型执行。Engine Core 内部包含模型执行器、调度器、结构化输出管理器和 KV 缓存管理器。

在单 GPU 场景下,vLLM 使用 UniProcExecutor,一个 Worker 进程操作一个 GPU。当需要扩展到多 GPU 时,它切换到 MultiProcExecutor,多个 Worker 进程各司其职,通过分布式负载均衡客户端实现请求分配。

vLLM 支持四种并行策略。张量并行把单个 Transformer 层切分到多个 GPU。流水线并行把不同层分配到不同 GPU。数据并行在多个 GPU 上运行完整模型副本处理不同请求。专家并行则是 MoE 模型中专用的策略。

在服务层,vLLM 提供了 OpenAI 兼容的 API,支持异步生成、流式输出、多轮对话等生产级功能。配合 Kubernetes 和 llm-d 项目,可以实现弹性扩缩容和高可用部署。

推理引擎的新战场

vLLM 的成功不是偶然的。它告诉我们一个道理:在 AI 推理这个战场上,模型架构的进步和系统工程的优化是同等重要的两条腿。过去两年,模型参数规模从 70B 飙到 1T 以上,而推理引擎的吞吐量同样提升了数十倍。如果只有模型进步而没有系统优化,今天的 AI 应用成本将是不可承受的。

更重要的是,vLLM 代表了开源社区在 AI 基础设施领域的一次集体胜利。从伯克利校园的一个研究项目,到被全球科技巨头采用的生产级系统,vLLM 证明了系统级的创新和模型级的创新同样具有颠覆性。

当然,竞争也在加剧。SGLang 凭借 RadixAttention 和结构化生成能力,在高并发 MoE 场景下展现出更强性能。TensorRT-LLM 的编译引擎路径在 NVIDIA 硬件上能榨出最高原始吞吐量。但 vLLM 凭借最广泛的硬件覆盖、最多的模型架构支持和最成熟的社区生态,稳坐推理引擎的头把交椅。

随着 vLLM 团队宣布 2025 年向训练后流程扩展,以及 Red Hat、NVIDIA、Google Cloud 等巨头联合推动 llm-d 项目,vLLM 正在从推理引擎进化为 AI 全生命周期基础设施。OpenAI 联合创始人 John Schulman 也开始使用 vLLM 进行后训练工作,这本身就是最有力的背书。

在 AI 军备竞赛中,谁控制了推理管道,谁就掌握了 AI 落地的最后一公里。vLLM 正在成为这条管道上的 Linux。不是因为它最花哨,而是因为它最可靠、最开放、最被信任。

作品声明:内容由AI生成