论坛
BBS
默认
简体中文
繁體中文
登录
全球主机MJJ交流论坛
»
论坛
›
主机交流
›
水池
›
大模型本地部署最强引擎,vLLM 又发大版本了,v0.23.0 ...
返回列表
发新帖
查看:
10
|
回复:
0
大模型本地部署最强引擎,vLLM 又发大版本了,v0.23.0
[复制链接]
hlx
hlx
当前离线
积分
58665
1万
主题
0
回帖
5万
积分
论坛元老
论坛元老, 积分 58665, 距离下一级还需 9941334 积分
论坛元老, 积分 58665, 距离下一级还需 9941334 积分
积分
58665
关注TA
发消息
发表于 2026-6-20 16:57:12
|
显示全部楼层
|
阅读模式
大模型本地部署,vLLM 推理优化,动手实验
离大谱,向 vLLM 提交虚假PR,给简历注水,被拉出在全世界面前示众
vLLM 是当前最流行的开源大模型推理引擎之一,从 DeepSeek 到 Llama 到 Qwen,基本上你能想到的主流模型它都支持
【图片1】
这次 v0.23.0 版本的核心主题就一句话:让更多模型跑得更快,让更多硬件用得上
【图片2】
1. DeepSeek-V4 全面成熟
上个版本 v0.22.0 刚引入 DeepSeek-V4 支持,这次直接做了一大轮硬化和优化。稀疏 MLA 元数据从 V3.2 中解耦,加了 TRTLLM gen attention kernel,EPLB 支持 Mega-MoE,滑动窗口 KV cache 的选择性前缀缓存保留,DSA MTP 的 index-share 特性——看不懂没关系,总结就是:跑 DeepSeek-V4 现在稳多了,快多了
更关键的是,模型从 torch.compile 中解耦了,意味着启动速度和兼容性都上了一个台阶。甚至还加了 XPU attention decode 路径,Intel 显卡也能跑了
2. Model Runner V2 覆盖更多主流模型
MRv2(Model Runner V2)现在默认对 Llama 和 Mistral dense 模型启用了,加上之前的 Qwen3,基本上主流开源模型全覆盖。新增了 FlashInfer 采样器、可中断 CUDA graph、流水线并行气泡消除、混合模型 kernel block-size 支持,以及 Gemma 4 MTP
如果你在生产环境用 Llama 或 Mistral,升级到 v0.23.0 会自动享受到 MRv2 带来的性能提升,不需要手动配置
3. Rust 前端长大了
实验性的 Rust 前端这次加了一堆生产级特性:streaming generate 端点、动态 LoRA 端点、/version 和 /server_info 端点、服务器路由扩展钩子、请求 ID header,还有一堆新的 tool parser(InternLM2、hy_v3、Phi-4-mini、Gemma4)
说实话,Rust 前端的进度超出我预期。照这个速度,下个大版本可能就不是 "experimental" 了
4. Gemma 4 全方位支持
Google 的 Gemma 4 在这个版本得到了全面支持:encoder-free 的 Gemma 4 Unified、Gemma 4 MTP(多 token 预测),以及一堆准确性和启动修复。量化时自动排除 vision embedder,ViT 线性层转换为 vLLM 原生实现
5. 多层级 KV Cache 卸载
KV cache 卸载框架新增了 object-store 作为二级存储层,HMA 默认启用,还支持按请求级别设置卸载策略。这对超长上下文场景太有用了——显存不够?往 CPU 甚至对象存储里卸
性能提升
这次的性能优化很实在:
CUTLASS FP8 scaled-mm padding bypass:提升 20%
MoE-permute buffer 预分配:提升 9-14%
Triton MoE 后端在 Hopper 上默认启用
H200/RTX PRO 的 selective_state_update 调优
Gemma RMS all-reduce 融合
DGX B300 的 NUMA 自动绑定
20% 的提升不是靠算法创新,纯粹是工程优化把冗余计算干掉了。这种"脏活"最见功力
硬件支持
这个版本的硬件覆盖范围简直离谱:
NVIDIA:Hopper(H100/H200)全面优化,新增 DGX B300 NUMA 绑定
AMD ROCm:升级到 7.2.3,AITER v0.1.13.post1,RDNA3(gfx1100)原生 W4A16 kernel
Intel XPU:vllm-xpu-kernel v0.1.7,FP8 MoE,DeepSeek-V4 decode 路径
CPU:AMD Zen CPU 加速(zentorch),CPU Triton 采样
TPU:tpu-inference 升级到 v0.21.0
RISC-V:WNA16 helpers(是的,RISC-V!)
ARM64:CI 镜像支持
PowerPC:SHM communicator
一个推理引擎同时跑在 7 种架构上,这在开源界也是头一份了吧
新增模型
Step-3.7-Flash:阶跃星辰的 Flash 版本
Cosmos3 Reasoner:NVIDIA 的推理模型
Gemma 4 Unified:Google 的 encoder-free 多模态
JetBrains Mellum v2:代码生成模型
Granite Speech Plus:IBM 的语音模型
Cohere Mini Code:Cohere 的代码小模型
加上一堆修复:Qwen3-VL、GLM-5.1、GLM-4.1V、MiniCPM-V-4.6、Kimi-K2.5……基本上你在国内能用到的模型,这个版本都照顾到了
API 更新
Anthropic Messages API:支持结构化输出和 effort 参数
OpenAI Responses API:system_fingerprint 字段、streaming tool calling with required
统一 Parser:推理(reasoning)和工具调用(tool-call)的解析统一到了 Parser.parse() 接口
这个统一 Parser 是个好设计,之前推理输出和工具调用是两套解析逻辑,现在合一了,对下游应用开发者来说是好消息
安装
pip install vllm==0.23.0
如果你需要特定硬件支持(比如 ROCm),参考官方文档选对应的安装命令
不建议升级的场景:如果你当前版本运行稳定且不用上述新特性,观望一两周等社区反馈也可以
注意:MiniMax M3 在这个版本还不支持,需要按照 vLLM recipe 操作
【图片3】
内容来源于互联网[玫瑰]
回复
使用道具
举报
返回列表
发新帖
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖并转播
回帖后跳转到最后一页
浏览过的版块
VPS综合讨论
Archiver
|
手机版
|
小黑屋
|
全球主机MJJ交流论坛
Powered by
Discuz!
X5.0
© 2001-2026
Discuz! Team
.
在本版发帖
返回顶部
快速回复
返回顶部
返回列表