@yjhatfdu2 muse team 走走换换一大批人,估计也是很难做好了,都沦落到第三梯队了。
@coefu 128k 能办公用用就不错了。它这个混合架构 256K 注意力可能不集中
@wcwcxiaobin 你可以试试呢,muse 大部分的局部注意力,长上下文也有可能不集中
@sentinelK 我现在用的是最新的 vllm ,改了一下 jinja ,基本上没有遇到这些问题,但是有个偶现的 GPU 报 Xid 31 导致奔溃的问题,可是 flashinfer 的 B12x 内核在长上下文、高并发、MTP 下的 bug ,就先凑合着用吧,codex 跑几个小时可能会遇到一次
unsloth 的 NVFP4 没什么问题,反而是 SGLang 用 RadixArk 的那个 NVFP4 + DSpark 有大问题,给了 85G 显存还会 OOM 。
LMCache 记得用,冷对话的 KV Cache 可以转移到内存,避免时间太久对话被丢掉需要重建 KV Cache ,从而又走一遍 prefill 阶段。
同时今天出 Dflash 2 ,加速效果比 DSpark 还猛,可以继续测了。
我这几天用 DeepSeek Harness 跑 DeepSeek-V4-Flash-0731 和 Qwen3.8 27B ,都是 NVFP4 ,跑了几亿 token 做测试,结果在做 GUI 方面 Qwen3.8 很亮眼,在移植 tabby 项目到 tauri2 + rust 的测试中,有以下难点:
1.我在虚拟机里跑的 Linux Mint ,GPU 是虚拟的,可能用不到加速,运行过程中可能黑屏白屏、帧数低等问题;
2.rust 编程能力的问题
3.e2e 测试的问题,自动化界面点击测试
Qwen3.8 27B 全面领先,毕竟有视觉能力,一路高歌猛进,/goal 设定目标就可以了,虚拟机丢旁边看着它一直推进,SFTP 面板都在做 GUI 的冒烟测试。构建完成后空载内存只有 39MB ,看到原子弹爆炸了。
就是中间有一个 bug ,反馈给它后,它自己用了插桩、探针、前端 SPY 、hook 多种手段来调试,花了 5100w 的 token ,修了一行代码,再次看到原子弹爆炸,xhigh 真就是用电力换能力了。
@yjhatfdu2 那是给定任务的结果,在我这里两个都大差不差,都差一口气,muse 跑得更快心情更舒畅
DFlash2: https://huggingface.co/incoai/Qwen3.8-27B-DFlash2 试试, 还能提速应该
昨天用笔记本跑了一下 qwen3.8-27B 没感觉能达到 flash 的程度, 甚至觉得蠢而且没有遵从我的 `agents.md` 指令
5090,4090,3090 可以看 ninfer 项目及其 fork 项目,专门为这几个显卡写的推理引擎。
@sentinelK 卧槽,心动了,不过自营现在 68000 了诶。。
@zp396099430 Minimax H3 出的时候已经上扬了,再加上 Qwen3.8-27B 。
不过 pro 5000 已经是最后上涨的了,pro6000 已经翻倍半年了。