yjhatfdu2 发表于 2026-8-19 14:05:02

@catazshadow 规模更大,所有评测都落后一大截,AA 更是 35 比 52 ,这怎么叫打的有来有回呢?应该是全方位无死角吊打。Qwen 你也可以开 128k 上下文

yjhatfdu2 发表于 2026-8-19 14:05:44

@yjhatfdu2 我是 PRO 6000 ,感觉现在 sm120 架构还是支持有限

hertzry 发表于 2026-8-19 14:09:39

sglang 和 vllm 折腾了一天没跑起来,打算换 ollama 再试试。

coefu 发表于 2026-8-19 14:17:08

@wcwcxiaobin把 context 拉到 262144 试试,在接近快满的时候,慢的怀疑人生。😂

catazshadow 发表于 2026-8-19 14:21:57

@yjhatfdu2 不如都开 128K 再比比

sentinelK 发表于 2026-8-19 14:22:12

@yjhatfdu2 最神的是 sglang 的 responses 接口,流式传输 xhigh 思考长度直接 body 是空,其他思考长度就没问题。直接给我搞力竭了。我现在主力 dsh 来调用……

yjhatfdu2 发表于 2026-8-19 14:25:27

@sentinelK 这个应该是因为 qwen3.8 只有几个有限的思考等级,和 codex 的那几个不匹配,需要改 jinja 模版做映射

coefu 发表于 2026-8-19 14:28:10

@noqwerty 如果是都支持的卡,llama.cpp 性能 不如 sglang / vllm 。但是很多老旧架构的卡,异构卡,sglang/vllm 都不支持,就不谈什么性能了,起码 llama.cpp 还能编译了跑起来。

sentinelK 发表于 2026-8-19 14:29:08

@yjhatfdu2 但是非流式就没问题,其他思考长度,放弃流式传输,用其他格式(比如老的 openAI chat 补全)都可以。就 xhigh+responses+流式有这个问题……

codex 又没法关闭流式,老的补全接口也去掉了……

我又不愿意开代理,codex 开代理有很多异常中断的问题。

暂时放弃

yjhatfdu2 发表于 2026-8-19 14:29:40

@catazshadow 开 128K 和能力有什么关系? Qwen3.8 估计关掉 thinking 都可以把 muse 吊起来打,所有的客观测试分数都相差两代的水平了,AA 比开了 reasoning 的 Qwen3.6 27B 都低三分,也就比 Qwen3.6 35B 好一点,真的是拉大了。
页: 1 2 [3] 4 5
查看完整版本: RTX PRO 5000(或其他 48GB 显存)的 Qwen3.8-27B-FP8 配置交流(prefill 5000+t/s, decode 60+t/s)