@catazshadow 规模更大,所有评测都落后一大截,AA 更是 35 比 52 ,这怎么叫打的有来有回呢?应该是全方位无死角吊打。Qwen 你也可以开 128k 上下文
@yjhatfdu2 我是 PRO 6000 ,感觉现在 sm120 架构还是支持有限
sglang 和 vllm 折腾了一天没跑起来,打算换 ollama 再试试。
@wcwcxiaobin把 context 拉到 262144 试试,在接近快满的时候,慢的怀疑人生。😂
@yjhatfdu2 不如都开 128K 再比比
@yjhatfdu2 最神的是 sglang 的 responses 接口,流式传输 xhigh 思考长度直接 body 是空,其他思考长度就没问题。直接给我搞力竭了。我现在主力 dsh 来调用……
@sentinelK 这个应该是因为 qwen3.8 只有几个有限的思考等级,和 codex 的那几个不匹配,需要改 jinja 模版做映射
@noqwerty 如果是都支持的卡,llama.cpp 性能 不如 sglang / vllm 。但是很多老旧架构的卡,异构卡,sglang/vllm 都不支持,就不谈什么性能了,起码 llama.cpp 还能编译了跑起来。
@yjhatfdu2 但是非流式就没问题,其他思考长度,放弃流式传输,用其他格式(比如老的 openAI chat 补全)都可以。就 xhigh+responses+流式有这个问题……
codex 又没法关闭流式,老的补全接口也去掉了……
我又不愿意开代理,codex 开代理有很多异常中断的问题。
暂时放弃
@catazshadow 开 128K 和能力有什么关系? Qwen3.8 估计关掉 thinking 都可以把 muse 吊起来打,所有的客观测试分数都相差两代的水平了,AA 比开了 reasoning 的 Qwen3.6 27B 都低三分,也就比 Qwen3.6 35B 好一点,真的是拉大了。