一、概述
从 v0.15.0 到 v0.25.0,vLLM 完成了 11 个主要版本的迭代,累计包含 5000+ 次提交,吸引了 数百位贡献者。这段演进历程的核心主题是:从单一推理引擎向全栈推理平台转型,在架构、性能、生态和部署体验四个维度实现了质的飞跃。
版本 | 提交数 | 贡献者 | 核心主题 |
|---|---|---|---|
v0.15.0 | 335 | 158 | V1 架构奠基、Mamba 支持 |
v0.16.0 | 440 | 203 | 异步调度 + 流水线并行整合 |
v0.17.0 | 699 | 272 | Model Runner V2 成熟、FA4 集成 |
v0.18.0 | 445 | 213 | KV 卸载智能化、gRPC 支持 |
v0.19.0 | 448 | 197 | 零气泡调度 + 推测解码协同 |
v0.20.0 | 752 | 320 | DeepSeek V4 首发、CUDA 13 升级 |
v0.21.0 | 367 | 202 | 推理模型思考预算支持 |
v0.22.0 | 459 | 230 | DeepSeek V4 生产就绪、多级 KV 卸载 |
v0.23.0 | 408 | 200 | MRv2 默认化、Rust 前端成熟 |
v0.24.0 | 571 | 256 | MiniMax-M3 支持、生态扩展 |
v0.25.0 | 558 | 232 | MRv2 全面默认、旧架构退出 |
二、架构演进:从 V1 到 Model Runner V2
2.1 Model Runner V2 (MRv2) 的崛起
MRv2 是这段演进中最核心的架构变革,经历了从实验性功能到全面默认执行后端的完整生命周期:
阶段 | 版本 | 关键里程碑 |
|---|---|---|
孵化期 | v0.15.0 | VLM 支持,架构改进 |
扩展期 | v0.16.0 | 流水线并行 (PP) 支持 |
成熟期 | v0.17.0 | EAGLE3 + CUDA Graph、Pooling 模型支持 |
深化期 | v0.18.0 | 概率性拒绝采样、XD-RoPE 支持 |
攻坚期 | v0.19.0 | 零气泡异步调度 + 推测解码协同 |
普及期 | v0.20.0 | Eagle Prefill 全 CUDA 图、自动 CG 模式 |
默认期 | v0.22.0 | Qwen3 稠密模型默认启用 |
全面期 | v0.23.0 | Llama/Mistral 稠密模型默认启用 |
最终期 | v0.25.0 | 所有稠密模型默认启用,旧架构移除 |
关键性能数据:
MRv2 + FlashInfer 采样器:采样速度提升 ~15%
可中断 CUDA Graph:高并发下延迟降低 ~23%
流水线并行气泡消除:吞吐量提升 ~12%
MRv2 在 CPU 瓶颈场景下:吞吐提升高达 56%
2.2 V1 架构的演进与并存
在 MRv2 发展的同时,V1 架构也在持续演进,两者在 v0.25.0 之前并存:
特性 | V1 架构 | MRv2 |
|---|---|---|
异步调度 + PP | v0.16.0 实现 | v0.17.0 实现 |
推测解码 | 早期支持 | 逐步补齐 |
CUDA Graph | 全图模式 | 分段/混合模式 |
默认覆盖 | 所有模型 | 逐步扩展至全部稠密模型 |
v0.25.0 的里程碑意义:移除了遗留的 PagedAttention 实现,标志着旧执行架构的彻底退出,MRv2 成为唯一标准。
三、性能与核心技术突破
3.1 推测解码 (Speculative Decoding) 的全面进化
推测解码是这段演进中迭代最频繁、进步最大的技术领域:
版本 | 关键改进 |
|---|---|
v0.15.0 | EAGLE3 支持 (Pixtral/Llava) |
v0.16.0 | 并行起草 (P-EAGLE)、结构化输出支持 |
v0.17.0 | MRv2 + EAGLE3 + CUDA Graph |
v0.18.0 | NGram GPU 实现、概率性拒绝采样 |
v0.19.0 | 零气泡协同(里程碑) |
v0.20.0 | 融合概率拒绝采样 Kernel |
v0.21.0 | 思考预算支持(推理模型关键) |
v0.22.0 | DeepSeek V4 MTP 支持 |
v0.23.0 | DFlash 后端、动态 SD |
v0.24.0 | EAGLE3 for Qwen3、异构词表支持 |
v0.25.0 | DSpark 原生集成、思考预算完善 |
里程碑技术:
DSpark 集成 (v0.25.0):DeepSeek 的推测解码方案原生集成,在 8×B300 GPU 上,DeepSeek-V4-Pro-DSpark 达到 ~250 tokens/s,平均接受长度约 5。
零气泡协同 (v0.19.0):彻底解决了异步调度与推测解码无法协同的历史难题。
3.2 KV Cache 管理:从简单卸载到智能分层
版本 | 关键改进 |
|---|---|
v0.15.0 | KV 卸载冗余加载预防 |
v0.17.0 | 权重卸载 V2 预取机制 |
v0.18.0 | 复用频率门控、FlexKV 后端 |
v0.19.0 | 通用 CPU 卸载 + 可插拔策略 |
v0.20.0 | GPU 端 KV 事件、统一内存布局 |
v0.21.0 | HMA 深度整合、滑动窗口组 |
v0.22.0 | 多级 KV 卸载框架(GPU → CPU → 文件系统) |
v0.24.0 | 多级异步批量查找 |
关键成果:
多级 KV 卸载使 KV Cache 可以扩展到磁盘甚至远程存储,为无限长上下文提供可能
DeepSeek V4 在 bf16 下处理 100 万 token 上下文仅需 9.62 GiB KV Cache(通过 c4a + c128a 两级压缩)
3.3 FlashAttention 4 (FA4) 集成
版本 | 进展 |
|---|---|
v0.17.0 | FA4 深度集成,长序列吞吐提升 18.6% |
v0.18.0 | FA4 回归为 MLA Prefill 默认后端 |
v0.20.0 | 支持 head-dim 512 + 分页 KV (SM90+) |
v0.22.0 | SM80 (A100) FA4 支持 |
v0.24.0 | 统一 FlashAttention 跨层布局 |
3.4 量化技术矩阵
vLLM 在这段演进中建立了完整的量化支持矩阵:
量化类型 | 支持版本 | 说明 |
|---|---|---|
FP8 | v0.15.0+ | W8A8 动态/静态量化 |
NVFP4 | v0.22.0+ | Blackwell 专用,MoE 加速 10-20 倍 |
Humming | v0.25.0 | 2/3/5/6/7-bit 打包量化 |
Marlin | v0.18.0+ | MoE 扩展支持 |
INT4 KV | v0.25.0 | Triton per-token-head 量化 |
MXFP4 | v0.24.0+ | MiniMax-M3 支持 |
NVFP4 MoE 性能:CUTLASS FP8 矩阵乘法在 SM90 上速度提升 180-290%;Qwen3-Next-80B 在 H100 上 fused_moe FP8 提升 25%。
四、新模型与架构支持
4.1 关键模型支持时间线
模型/架构 | 支持版本 | 备注 |
|---|---|---|
Mamba/Mamba2 | v0.15.0 | 首款非 Transformer 架构支持 |
Qwen3 全系列 | v0.17.0 | GDN 架构、MTP 支持 |
DeepSeek V4 | v0.20.0 | 首发支持,v0.22.0 生产就绪 |
Gemma 4 | v0.19.0 | 首发日支持,MoE + 多模态 |
MiniMax-M3 | v0.24.0 | BF16/FP8/MXFP4 多精度 |
Kimi-K2.5 | v0.15.0 | |
GLM-OCR/GLM-5 | v0.16.0 | |
Molmo2 | v0.15.0 | |
Sarvam MoE | v0.18.0 | |
Hunyuan v3 | v0.20.0 | 预览版 |
DiffusionGemma | v0.24.0 | 扩散 LLM 首款支持 |
4.2 模型架构演进
架构类型 | 首批支持版本 | 优化完成版本 |
|---|---|---|
稠密 Transformer | v0.15.0 | v0.25.0 (MRv2 默认) |
MoE | v0.15.0 | v0.22.0 (大规模重构) |
Mamba/SSM | v0.15.0 | v0.22.0 (深度优化) |
MLA (DeepSeek) | v0.20.0 | v0.22.0 (生产就绪) |
VLM 多模态 | v0.15.0 | v0.20.0 (ViT 全 CUDA 图) |
扩散 LLM | v0.24.0 | — |
五、分布式与服务能力
5.1 并行策略演进
并行策略 | 支持版本 | 性能数据 |
|---|---|---|
TP (张量并行) | v0.15.0 (已有) | — |
PP (流水线并行) | v0.16.0 + 异步调度 | 吞吐 +30.8% |
DP (数据并行) | v0.15.0 | — |
EP (专家并行) | v0.17.0 | — |
DCP (解码上下文并行) | v0.16.0 | — |
序列并行 | v0.25.0 | 吞吐 +1.9~5.0% |
弹性 EP | v0.19.0+ | 动态扩缩容 |
5.2 PD 分离式服务 (Disaggregated Serving)
特性 | 支持版本 |
|---|---|
KV 推送 (Prefill→Decode) | v0.24.0 (NIXL) |
Mooncake PP 支持 | v0.24.0 |
Mooncake GDN + MLA 支持 | v0.25.0 |
NIXL Mamba1 支持 | v0.25.0 |
5.3 Rust 前端演进
版本 | 能力 |
|---|---|
v0.22.0 | 实验性合入 |
v0.23.0 | 流式生成、动态 LoRA、服务信息端点 |
v0.24.0 | API key 认证、CORS、/tokenize、/pause/resume |
预期收益:API 侧 P99 延迟降低 40~60%,单节点长连接上限从 5K 提升至 50K。
六、关键里程碑与版本推荐
6.1 版本演进路线图
v0.15.0 ──→ v0.16.0 ──→ v0.17.0 ──→ v0.18.0 ──→ v0.19.0
│ │ │ │ │
Mamba 异步PP整合 FA4集成 KV卸载智能化 零气泡协同
首发 +30.8% +18.6% 多级存储 里程碑
↓
v0.25.0 ←─ v0.24.0 ←─ v0.23.0 ←─ v0.22.0 ←─ v0.21.0 ←─ v0.20.0
│ │ │ │ │
MRv2全面 MiniMax-M3 MRv2默认 DSV4生产 推理模型 DeepSeekV4
旧架构退出 生态扩展 Llama系列 多级KV卸载 思考预算 首发6.2 按场景推荐版本
场景 | 推荐版本 | 理由 |
|---|---|---|
生产环境稳定部署 | v0.23.0 / v0.24.0 | MRv2 成熟,生态完善,bug 修复充分 |
DeepSeek V4 部署 | v0.22.0+ | 生产级优化,建议 v0.25.0 |
推理模型 (R1/Qwen3) | v0.21.0+ | 思考预算支持 |
极致性能追求 | v0.25.0 | 最新优化,MRv2 全面默认 |
AMD ROCm 平台 | v0.24.0+ | 平台支持最完善 |
视频多模态 (VLM) | v0.25.0 | EVS 视频采样支持 |
6.3 破坏性变更提醒
版本 | 变更内容 |
|---|---|
v0.18.0 | Ray 不再是默认依赖 |
v0.20.0 | CUDA 13 + PyTorch 2.11,V100 终止支持 |
v0.21.0 | Transformers v4 弃用,C++20 编译要求 |
v0.23.0 | Transformers v5 主要适配完成 |
v0.25.0 | 移除旧版 PagedAttention 实现 |
七、总结
从 v0.15.0 到 v0.25.0,vLLM 的演进呈现出清晰的脉络:
架构统一:MRv2 从实验性功能成长为唯一标准执行后端,实现了推理架构的世代交替。
性能突破:通过异步调度与流水线并行的整合(+30.8% 吞吐)、零气泡与推测解码的协同、FA4 深度集成(+18.6% 长序列吞吐)等关键技术,持续刷新推理性能上限。
模型覆盖:从 Qwen3 到 DeepSeek V4,从 Gemma 4 到 MiniMax-M3,vLLM 实现了对主流前沿模型的"首发日支持",特别是对 MoE、Mamba、MLA 等新架构的深度优化。
生态成熟:从单纯的推理引擎演变为包含 Rust 高性能前端、多级 KV 卸载、PD 分离式服务、弹性 EP 在内的全栈推理平台。
量化完备:建立了覆盖 FP8、NVFP4、MXFP4、Marlin、Humming 等完整量化矩阵,使大模型推理在成本与性能间取得最佳平衡。
这一演进使 vLLM 从"最快的 LLM 推理引擎"成长为"最全面的 LLM 推理平台",为生产级大模型部署提供了坚实的技术底座。