查看: 10|回复: 0

大模型本地部署最强引擎,vLLM 又发大版本了,v0.23.0

[复制链接]

1万

主题

0

回帖

5万

积分

论坛元老

积分
58665
发表于 2026-6-20 16:57:12 | 显示全部楼层 |阅读模式
大模型本地部署,vLLM 推理优化,动手实验

离大谱,向 vLLM 提交虚假PR,给简历注水,被拉出在全世界面前示众

vLLM 是当前最流行的开源大模型推理引擎之一,从 DeepSeek 到 Llama 到 Qwen,基本上你能想到的主流模型它都支持

【图片1】

这次 v0.23.0 版本的核心主题就一句话:让更多模型跑得更快,让更多硬件用得上
【图片2】

1. DeepSeek-V4 全面成熟

上个版本 v0.22.0 刚引入 DeepSeek-V4 支持,这次直接做了一大轮硬化和优化。稀疏 MLA 元数据从 V3.2 中解耦,加了 TRTLLM gen attention kernel,EPLB 支持 Mega-MoE,滑动窗口 KV cache 的选择性前缀缓存保留,DSA MTP 的 index-share 特性——看不懂没关系,总结就是:跑 DeepSeek-V4 现在稳多了,快多了

更关键的是,模型从 torch.compile 中解耦了,意味着启动速度和兼容性都上了一个台阶。甚至还加了 XPU attention decode 路径,Intel 显卡也能跑了

2. Model Runner V2 覆盖更多主流模型

MRv2(Model Runner V2)现在默认对 Llama 和 Mistral dense 模型启用了,加上之前的 Qwen3,基本上主流开源模型全覆盖。新增了 FlashInfer 采样器、可中断 CUDA graph、流水线并行气泡消除、混合模型 kernel block-size 支持,以及 Gemma 4 MTP

如果你在生产环境用 Llama 或 Mistral,升级到 v0.23.0 会自动享受到 MRv2 带来的性能提升,不需要手动配置

3. Rust 前端长大了

实验性的 Rust 前端这次加了一堆生产级特性:streaming generate 端点、动态 LoRA 端点、/version 和 /server_info 端点、服务器路由扩展钩子、请求 ID header,还有一堆新的 tool parser(InternLM2、hy_v3、Phi-4-mini、Gemma4)

说实话,Rust 前端的进度超出我预期。照这个速度,下个大版本可能就不是 "experimental" 了

4. Gemma 4 全方位支持

Google 的 Gemma 4 在这个版本得到了全面支持:encoder-free 的 Gemma 4 Unified、Gemma 4 MTP(多 token 预测),以及一堆准确性和启动修复。量化时自动排除 vision embedder,ViT 线性层转换为 vLLM 原生实现

5. 多层级 KV Cache 卸载

KV cache 卸载框架新增了 object-store 作为二级存储层,HMA 默认启用,还支持按请求级别设置卸载策略。这对超长上下文场景太有用了——显存不够?往 CPU 甚至对象存储里卸

性能提升

这次的性能优化很实在:

CUTLASS FP8 scaled-mm padding bypass:提升 20%

MoE-permute buffer 预分配:提升 9-14%

Triton MoE 后端在 Hopper 上默认启用

H200/RTX PRO 的 selective_state_update 调优

Gemma RMS all-reduce 融合

DGX B300 的 NUMA 自动绑定

20% 的提升不是靠算法创新,纯粹是工程优化把冗余计算干掉了。这种"脏活"最见功力

硬件支持

这个版本的硬件覆盖范围简直离谱:

NVIDIA:Hopper(H100/H200)全面优化,新增 DGX B300 NUMA 绑定

AMD ROCm:升级到 7.2.3,AITER v0.1.13.post1,RDNA3(gfx1100)原生 W4A16 kernel

Intel XPU:vllm-xpu-kernel v0.1.7,FP8 MoE,DeepSeek-V4 decode 路径

CPU:AMD Zen CPU 加速(zentorch),CPU Triton 采样

TPU:tpu-inference 升级到 v0.21.0

RISC-V:WNA16 helpers(是的,RISC-V!)

ARM64:CI 镜像支持

PowerPC:SHM communicator

一个推理引擎同时跑在 7 种架构上,这在开源界也是头一份了吧

新增模型

Step-3.7-Flash:阶跃星辰的 Flash 版本

Cosmos3 Reasoner:NVIDIA 的推理模型

Gemma 4 Unified:Google 的 encoder-free 多模态

JetBrains Mellum v2:代码生成模型

Granite Speech Plus:IBM 的语音模型

Cohere Mini Code:Cohere 的代码小模型

加上一堆修复:Qwen3-VL、GLM-5.1、GLM-4.1V、MiniCPM-V-4.6、Kimi-K2.5……基本上你在国内能用到的模型,这个版本都照顾到了

API 更新

Anthropic Messages API:支持结构化输出和 effort 参数

OpenAI Responses API:system_fingerprint 字段、streaming tool calling with required

统一 Parser:推理(reasoning)和工具调用(tool-call)的解析统一到了 Parser.parse() 接口

这个统一 Parser 是个好设计,之前推理输出和工具调用是两套解析逻辑,现在合一了,对下游应用开发者来说是好消息

安装
pip install vllm==0.23.0

如果你需要特定硬件支持(比如 ROCm),参考官方文档选对应的安装命令

不建议升级的场景:如果你当前版本运行稳定且不用上述新特性,观望一两周等社区反馈也可以

注意:MiniMax M3 在这个版本还不支持,需要按照 vLLM recipe 操作

【图片3】

内容来源于互联网[玫瑰]




回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部