楼主: sentinelK

RTX PRO 5000(或其他 48GB 显存)的 Qwen3.8-27B-FP8 配置交流(prefill 5000+t/s, decode 60+t/s)

[复制链接]

3

主题

57

回帖

123

积分

注册会员

积分
123
 楼主| 发表于 2026-8-19 11:23:25 | 显示全部楼层
@hejw19970413 vllm 的 prefill 性能是不是要差一些,sg-lang 也是最近更新 prefill 速度才大幅度提升的。
回复

使用道具 举报

0

主题

15

回帖

30

积分

新手上路

积分
30
发表于 2026-8-19 11:30:22 | 显示全部楼层
请问 sglang 跟 llama.cpp 对比性能怎么样
回复

使用道具 举报

3

主题

57

回帖

123

积分

注册会员

积分
123
 楼主| 发表于 2026-8-19 11:32:22 | 显示全部楼层
@noqwerty sglang 和 vllm 吊打 llama.cpp
回复

使用道具 举报

9

主题

12

回帖

53

积分

注册会员

积分
53
发表于 2026-8-19 11:37:41 | 显示全部楼层
llama.cpp 之前 agent 调用太慢,但是现在使用 deepseekharness 很神奇,缓存命中的情况下 prefill 可以一瞬间完成。。直接 decode
回复

使用道具 举报

0

主题

20

回帖

40

积分

新手上路

积分
40
发表于 2026-8-19 11:43:54 | 显示全部楼层
笑死,连推理引擎也有鄙视链。用 llama.cpp 的看不起用 ollama 的,vllm 的看不起前两者
回复

使用道具 举报

0

主题

7

回帖

14

积分

新手上路

积分
14
发表于 2026-8-19 12:24:51 | 显示全部楼层
刚好我也在租用 RTX PRO 5000 ,等有空了我也部署上去试试。
另外楼主还有别的适合 RTX PRO 5000 部署的模型分享吗?
回复

使用道具 举报

3

主题

57

回帖

123

积分

注册会员

积分
123
 楼主| 发表于 2026-8-19 12:31:07 | 显示全部楼层
@hronro LLM 的话,qwen3.8-27B 是断崖领先的,其他模型看不到尾灯。
多媒体领域 Minimax H3 很强,可以体验一下。
回复

使用道具 举报

1

主题

58

回帖

119

积分

注册会员

积分
119
发表于 2026-8-19 13:01:03 | 显示全部楼层
@sentinelK Muse Glimmer 看官方是可以跟千问打的有来有回的,128K 上下文对单卡也更友好
回复

使用道具 举报

1

主题

7

回帖

17

积分

新手上路

积分
17
发表于 2026-8-19 13:59:16 | 显示全部楼层
一边期待 AI 股涨价一边期待 AI 泡沫。最可怜是 AI 股没涨够数,但是 RAM, flash, GPU 贵过天
回复

使用道具 举报

0

主题

7

回帖

14

积分

新手上路

积分
14
发表于 2026-8-19 14:02:49 | 显示全部楼层
sglang 在 codex 上遇到了不少微妙的问题,包括但不限于 codex 的扩展工具类型支持问题(比如 mcp 相关、工具检索等),开启 EAGLE 后 xgrammar 进行 tool call 受控采样时会偶然遇到 triton kernel 的问题导致奔溃,加入多模态会导致输出长度可能超过模型上下文限制导致报错,加入图片偶现 prefill cuda graph 问题,SMG 对于 codex 的很多扩展的 responses 协议字段强校验通不过报错。修了半天算了还是换 vllm 吧,不过 vllm 也遇到了非常偶现的 cuda 内存越界,真是服了
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部