coefu 发表于 2026-8-19 14:36:49

@yjhatfdu2 muse team 走走换换一大批人,估计也是很难做好了,都沦落到第三梯队了。

wcwcxiaobin 发表于 2026-8-19 14:48:37

@coefu 128k 能办公用用就不错了。它这个混合架构 256K 注意力可能不集中

yjhatfdu2 发表于 2026-8-19 14:53:29

@wcwcxiaobin 你可以试试呢,muse 大部分的局部注意力,长上下文也有可能不集中

yjhatfdu2 发表于 2026-8-19 14:55:55

@sentinelK 我现在用的是最新的 vllm ,改了一下 jinja ,基本上没有遇到这些问题,但是有个偶现的 GPU 报 Xid 31 导致奔溃的问题,可是 flashinfer 的 B12x 内核在长上下文、高并发、MTP 下的 bug ,就先凑合着用吧,codex 跑几个小时可能会遇到一次

slowgen 发表于 2026-8-19 14:56:59

unsloth 的 NVFP4 没什么问题,反而是 SGLang 用 RadixArk 的那个 NVFP4 + DSpark 有大问题,给了 85G 显存还会 OOM 。
LMCache 记得用,冷对话的 KV Cache 可以转移到内存,避免时间太久对话被丢掉需要重建 KV Cache ,从而又走一遍 prefill 阶段。

同时今天出 Dflash 2 ,加速效果比 DSpark 还猛,可以继续测了。

我这几天用 DeepSeek Harness 跑 DeepSeek-V4-Flash-0731 和 Qwen3.8 27B ,都是 NVFP4 ,跑了几亿 token 做测试,结果在做 GUI 方面 Qwen3.8 很亮眼,在移植 tabby 项目到 tauri2 + rust 的测试中,有以下难点:
1.我在虚拟机里跑的 Linux Mint ,GPU 是虚拟的,可能用不到加速,运行过程中可能黑屏白屏、帧数低等问题;
2.rust 编程能力的问题
3.e2e 测试的问题,自动化界面点击测试

Qwen3.8 27B 全面领先,毕竟有视觉能力,一路高歌猛进,/goal 设定目标就可以了,虚拟机丢旁边看着它一直推进,SFTP 面板都在做 GUI 的冒烟测试。构建完成后空载内存只有 39MB ,看到原子弹爆炸了。
就是中间有一个 bug ,反馈给它后,它自己用了插桩、探针、前端 SPY 、hook 多种手段来调试,花了 5100w 的 token ,修了一行代码,再次看到原子弹爆炸,xhigh 真就是用电力换能力了。

catazshadow 发表于 2026-8-19 15:08:42

@yjhatfdu2 那是给定任务的结果,在我这里两个都大差不差,都差一口气,muse 跑得更快心情更舒畅

yangyaofei 发表于 2026-8-19 15:29:55

DFlash2: https://huggingface.co/incoai/Qwen3.8-27B-DFlash2 试试, 还能提速应该

昨天用笔记本跑了一下 qwen3.8-27B 没感觉能达到 flash 的程度, 甚至觉得蠢而且没有遵从我的 `agents.md` 指令

stefwoo 发表于 2026-8-19 15:36:08

5090,4090,3090 可以看 ninfer 项目及其 fork 项目,专门为这几个显卡写的推理引擎。

zp396099430 发表于 2026-8-19 16:09:42

@sentinelK 卧槽,心动了,不过自营现在 68000 了诶。。

sentinelK 发表于 2026-8-19 16:19:45

@zp396099430 Minimax H3 出的时候已经上扬了,再加上 Qwen3.8-27B 。

不过 pro 5000 已经是最后上涨的了,pro6000 已经翻倍半年了。
页: 1 2 3 [4] 5
查看完整版本: RTX PRO 5000(或其他 48GB 显存)的 Qwen3.8-27B-FP8 配置交流(prefill 5000+t/s, decode 60+t/s)