一、概述

从 v0.15.0 到 v0.25.0,vLLM 完成了 11 个主要版本的迭代,累计包含 5000+ 次提交,吸引了 数百位贡献者。这段演进历程的核心主题是:从单一推理引擎向全栈推理平台转型,在架构、性能、生态和部署体验四个维度实现了质的飞跃。

版本

提交数

贡献者

核心主题

v0.15.0

335

158

V1 架构奠基、Mamba 支持

v0.16.0

440

203

异步调度 + 流水线并行整合

v0.17.0

699

272

Model Runner V2 成熟、FA4 集成

v0.18.0

445

213

KV 卸载智能化、gRPC 支持

v0.19.0

448

197

零气泡调度 + 推测解码协同

v0.20.0

752

320

DeepSeek V4 首发、CUDA 13 升级

v0.21.0

367

202

推理模型思考预算支持

v0.22.0

459

230

DeepSeek V4 生产就绪、多级 KV 卸载

v0.23.0

408

200

MRv2 默认化、Rust 前端成熟

v0.24.0

571

256

MiniMax-M3 支持、生态扩展

v0.25.0

558

232

MRv2 全面默认、旧架构退出

二、架构演进:从 V1 到 Model Runner V2

2.1 Model Runner V2 (MRv2) 的崛起

MRv2 是这段演进中最核心的架构变革,经历了从实验性功能到全面默认执行后端的完整生命周期:

阶段

版本

关键里程碑

孵化期

v0.15.0

VLM 支持,架构改进

扩展期

v0.16.0

流水线并行 (PP) 支持

成熟期

v0.17.0

EAGLE3 + CUDA Graph、Pooling 模型支持

深化期

v0.18.0

概率性拒绝采样、XD-RoPE 支持

攻坚期

v0.19.0

零气泡异步调度 + 推测解码协同

普及期

v0.20.0

Eagle Prefill 全 CUDA 图、自动 CG 模式

默认期

v0.22.0

Qwen3 稠密模型默认启用

全面期

v0.23.0

Llama/Mistral 稠密模型默认启用

最终期

v0.25.0

所有稠密模型默认启用,旧架构移除

关键性能数据:

  • MRv2 + FlashInfer 采样器:采样速度提升 ~15%

  • 可中断 CUDA Graph:高并发下延迟降低 ~23%

  • 流水线并行气泡消除:吞吐量提升 ~12%

  • MRv2 在 CPU 瓶颈场景下:吞吐提升高达 56%

2.2 V1 架构的演进与并存

在 MRv2 发展的同时,V1 架构也在持续演进,两者在 v0.25.0 之前并存:

特性

V1 架构

MRv2

异步调度 + PP

v0.16.0 实现

v0.17.0 实现

推测解码

早期支持

逐步补齐

CUDA Graph

全图模式

分段/混合模式

默认覆盖

所有模型

逐步扩展至全部稠密模型

v0.25.0 的里程碑意义:移除了遗留的 PagedAttention 实现,标志着旧执行架构的彻底退出,MRv2 成为唯一标准。

三、性能与核心技术突破

3.1 推测解码 (Speculative Decoding) 的全面进化

推测解码是这段演进中迭代最频繁、进步最大的技术领域:

版本

关键改进

v0.15.0

EAGLE3 支持 (Pixtral/Llava)

v0.16.0

并行起草 (P-EAGLE)、结构化输出支持

v0.17.0

MRv2 + EAGLE3 + CUDA Graph

v0.18.0

NGram GPU 实现、概率性拒绝采样

v0.19.0

零气泡协同(里程碑)

v0.20.0

融合概率拒绝采样 Kernel

v0.21.0

思考预算支持(推理模型关键)

v0.22.0

DeepSeek V4 MTP 支持

v0.23.0

DFlash 后端、动态 SD

v0.24.0

EAGLE3 for Qwen3、异构词表支持

v0.25.0

DSpark 原生集成、思考预算完善

里程碑技术:

  • DSpark 集成 (v0.25.0):DeepSeek 的推测解码方案原生集成,在 8×B300 GPU 上,DeepSeek-V4-Pro-DSpark 达到 ~250 tokens/s,平均接受长度约 5

  • 零气泡协同 (v0.19.0):彻底解决了异步调度与推测解码无法协同的历史难题。

3.2 KV Cache 管理:从简单卸载到智能分层

版本

关键改进

v0.15.0

KV 卸载冗余加载预防

v0.17.0

权重卸载 V2 预取机制

v0.18.0

复用频率门控、FlexKV 后端

v0.19.0

通用 CPU 卸载 + 可插拔策略

v0.20.0

GPU 端 KV 事件、统一内存布局

v0.21.0

HMA 深度整合、滑动窗口组

v0.22.0

多级 KV 卸载框架(GPU → CPU → 文件系统)

v0.24.0

多级异步批量查找

关键成果:

  • 多级 KV 卸载使 KV Cache 可以扩展到磁盘甚至远程存储,为无限长上下文提供可能

  • DeepSeek V4 在 bf16 下处理 100 万 token 上下文仅需 9.62 GiB KV Cache(通过 c4a + c128a 两级压缩)

3.3 FlashAttention 4 (FA4) 集成

版本

进展

v0.17.0

FA4 深度集成,长序列吞吐提升 18.6%

v0.18.0

FA4 回归为 MLA Prefill 默认后端

v0.20.0

支持 head-dim 512 + 分页 KV (SM90+)

v0.22.0

SM80 (A100) FA4 支持

v0.24.0

统一 FlashAttention 跨层布局

3.4 量化技术矩阵

vLLM 在这段演进中建立了完整的量化支持矩阵:

量化类型

支持版本

说明

FP8

v0.15.0+

W8A8 动态/静态量化

NVFP4

v0.22.0+

Blackwell 专用,MoE 加速 10-20 倍

Humming

v0.25.0

2/3/5/6/7-bit 打包量化

Marlin

v0.18.0+

MoE 扩展支持

INT4 KV

v0.25.0

Triton per-token-head 量化

MXFP4

v0.24.0+

MiniMax-M3 支持

NVFP4 MoE 性能:CUTLASS FP8 矩阵乘法在 SM90 上速度提升 180-290%;Qwen3-Next-80B 在 H100 上 fused_moe FP8 提升 25%

四、新模型与架构支持

4.1 关键模型支持时间线

模型/架构

支持版本

备注

Mamba/Mamba2

v0.15.0

首款非 Transformer 架构支持

Qwen3 全系列

v0.17.0

GDN 架构、MTP 支持

DeepSeek V4

v0.20.0

首发支持,v0.22.0 生产就绪

Gemma 4

v0.19.0

首发日支持,MoE + 多模态

MiniMax-M3

v0.24.0

BF16/FP8/MXFP4 多精度

Kimi-K2.5

v0.15.0

GLM-OCR/GLM-5

v0.16.0

Molmo2

v0.15.0

Sarvam MoE

v0.18.0

Hunyuan v3

v0.20.0

预览版

DiffusionGemma

v0.24.0

扩散 LLM 首款支持

4.2 模型架构演进

架构类型

首批支持版本

优化完成版本

稠密 Transformer

v0.15.0

v0.25.0 (MRv2 默认)

MoE

v0.15.0

v0.22.0 (大规模重构)

Mamba/SSM

v0.15.0

v0.22.0 (深度优化)

MLA (DeepSeek)

v0.20.0

v0.22.0 (生产就绪)

VLM 多模态

v0.15.0

v0.20.0 (ViT 全 CUDA 图)

扩散 LLM

v0.24.0

五、分布式与服务能力

5.1 并行策略演进

并行策略

支持版本

性能数据

TP (张量并行)

v0.15.0 (已有)

PP (流水线并行)

v0.16.0 + 异步调度

吞吐 +30.8%

DP (数据并行)

v0.15.0

EP (专家并行)

v0.17.0

DCP (解码上下文并行)

v0.16.0

序列并行

v0.25.0

吞吐 +1.9~5.0%

弹性 EP

v0.19.0+

动态扩缩容

5.2 PD 分离式服务 (Disaggregated Serving)

特性

支持版本

KV 推送 (Prefill→Decode)

v0.24.0 (NIXL)

Mooncake PP 支持

v0.24.0

Mooncake GDN + MLA 支持

v0.25.0

NIXL Mamba1 支持

v0.25.0

5.3 Rust 前端演进

版本

能力

v0.22.0

实验性合入

v0.23.0

流式生成、动态 LoRA、服务信息端点

v0.24.0

API key 认证、CORS、/tokenize、/pause/resume

预期收益:API 侧 P99 延迟降低 40~60%,单节点长连接上限从 5K 提升至 50K

六、关键里程碑与版本推荐

6.1 版本演进路线图

v0.15.0 ──→ v0.16.0 ──→ v0.17.0 ──→ v0.18.0 ──→ v0.19.0
  │            │            │            │            │
 Mamba      异步PP整合    FA4集成      KV卸载智能化  零气泡协同
 首发        +30.8%        +18.6%      多级存储      里程碑
                                                  ↓
v0.25.0 ←─ v0.24.0 ←─ v0.23.0 ←─ v0.22.0 ←─ v0.21.0 ←─ v0.20.0
  │            │            │            │            │
 MRv2全面    MiniMax-M3   MRv2默认    DSV4生产    推理模型    DeepSeekV4
 旧架构退出   生态扩展     Llama系列   多级KV卸载   思考预算    首发

6.2 按场景推荐版本

场景

推荐版本

理由

生产环境稳定部署

v0.23.0 / v0.24.0

MRv2 成熟,生态完善,bug 修复充分

DeepSeek V4 部署

v0.22.0+

生产级优化,建议 v0.25.0

推理模型 (R1/Qwen3)

v0.21.0+

思考预算支持

极致性能追求

v0.25.0

最新优化,MRv2 全面默认

AMD ROCm 平台

v0.24.0+

平台支持最完善

视频多模态 (VLM)

v0.25.0

EVS 视频采样支持

6.3 破坏性变更提醒

版本

变更内容

v0.18.0

Ray 不再是默认依赖

v0.20.0

CUDA 13 + PyTorch 2.11,V100 终止支持

v0.21.0

Transformers v4 弃用,C++20 编译要求

v0.23.0

Transformers v5 主要适配完成

v0.25.0

移除旧版 PagedAttention 实现

七、总结

从 v0.15.0 到 v0.25.0,vLLM 的演进呈现出清晰的脉络:

  1. 架构统一:MRv2 从实验性功能成长为唯一标准执行后端,实现了推理架构的世代交替。

  2. 性能突破:通过异步调度与流水线并行的整合(+30.8% 吞吐)、零气泡与推测解码的协同、FA4 深度集成(+18.6% 长序列吞吐)等关键技术,持续刷新推理性能上限。

  3. 模型覆盖:从 Qwen3 到 DeepSeek V4,从 Gemma 4 到 MiniMax-M3,vLLM 实现了对主流前沿模型的"首发日支持",特别是对 MoE、Mamba、MLA 等新架构的深度优化。

  4. 生态成熟:从单纯的推理引擎演变为包含 Rust 高性能前端、多级 KV 卸载、PD 分离式服务、弹性 EP 在内的全栈推理平台。

  5. 量化完备:建立了覆盖 FP8、NVFP4、MXFP4、Marlin、Humming 等完整量化矩阵,使大模型推理在成本与性能间取得最佳平衡。

这一演进使 vLLM 从"最快的 LLM 推理引擎"成长为"最全面的 LLM 推理平台",为生产级大模型部署提供了坚实的技术底座。