sentinelK 发表于 2026-8-19 11:23:25

@hejw19970413 vllm 的 prefill 性能是不是要差一些,sg-lang 也是最近更新 prefill 速度才大幅度提升的。

noqwerty 发表于 2026-8-19 11:30:22

请问 sglang 跟 llama.cpp 对比性能怎么样

sentinelK 发表于 2026-8-19 11:32:22

@noqwerty sglang 和 vllm 吊打 llama.cpp

wcwcxiaobin 发表于 2026-8-19 11:37:41

llama.cpp 之前 agent 调用太慢,但是现在使用 deepseekharness 很神奇,缓存命中的情况下 prefill 可以一瞬间完成。。直接 decode

strobber16 发表于 2026-8-19 11:43:54

笑死,连推理引擎也有鄙视链。用 llama.cpp 的看不起用 ollama 的,vllm 的看不起前两者

hronro 发表于 2026-8-19 12:24:51

刚好我也在租用 RTX PRO 5000 ,等有空了我也部署上去试试。
另外楼主还有别的适合 RTX PRO 5000 部署的模型分享吗?

sentinelK 发表于 2026-8-19 12:31:07

@hronro LLM 的话,qwen3.8-27B 是断崖领先的,其他模型看不到尾灯。
多媒体领域 Minimax H3 很强,可以体验一下。

catazshadow 发表于 2026-8-19 13:01:03

@sentinelK Muse Glimmer 看官方是可以跟千问打的有来有回的,128K 上下文对单卡也更友好

kita 发表于 2026-8-19 13:59:16

一边期待 AI 股涨价一边期待 AI 泡沫。最可怜是 AI 股没涨够数,但是 RAM, flash, GPU 贵过天

yjhatfdu2 发表于 2026-8-19 14:02:49

sglang 在 codex 上遇到了不少微妙的问题,包括但不限于 codex 的扩展工具类型支持问题(比如 mcp 相关、工具检索等),开启 EAGLE 后 xgrammar 进行 tool call 受控采样时会偶然遇到 triton kernel 的问题导致奔溃,加入多模态会导致输出长度可能超过模型上下文限制导致报错,加入图片偶现 prefill cuda graph 问题,SMG 对于 codex 的很多扩展的 responses 协议字段强校验通不过报错。修了半天算了还是换 vllm 吧,不过 vllm 也遇到了非常偶现的 cuda 内存越界,真是服了
页: 1 [2] 3 4 5
查看完整版本: RTX PRO 5000(或其他 48GB 显存)的 Qwen3.8-27B-FP8 配置交流(prefill 5000+t/s, decode 60+t/s)