@hejw19970413 vllm 的 prefill 性能是不是要差一些,sg-lang 也是最近更新 prefill 速度才大幅度提升的。
请问 sglang 跟 llama.cpp 对比性能怎么样
@noqwerty sglang 和 vllm 吊打 llama.cpp
llama.cpp 之前 agent 调用太慢,但是现在使用 deepseekharness 很神奇,缓存命中的情况下 prefill 可以一瞬间完成。。直接 decode
笑死,连推理引擎也有鄙视链。用 llama.cpp 的看不起用 ollama 的,vllm 的看不起前两者
刚好我也在租用 RTX PRO 5000 ,等有空了我也部署上去试试。
另外楼主还有别的适合 RTX PRO 5000 部署的模型分享吗?
@hronro LLM 的话,qwen3.8-27B 是断崖领先的,其他模型看不到尾灯。
多媒体领域 Minimax H3 很强,可以体验一下。
@sentinelK Muse Glimmer 看官方是可以跟千问打的有来有回的,128K 上下文对单卡也更友好
一边期待 AI 股涨价一边期待 AI 泡沫。最可怜是 AI 股没涨够数,但是 RAM, flash, GPU 贵过天
sglang 在 codex 上遇到了不少微妙的问题,包括但不限于 codex 的扩展工具类型支持问题(比如 mcp 相关、工具检索等),开启 EAGLE 后 xgrammar 进行 tool call 受控采样时会偶然遇到 triton kernel 的问题导致奔溃,加入多模态会导致输出长度可能超过模型上下文限制导致报错,加入图片偶现 prefill cuda graph 问题,SMG 对于 codex 的很多扩展的 responses 协议字段强校验通不过报错。修了半天算了还是换 vllm 吧,不过 vllm 也遇到了非常偶现的 cuda 内存越界,真是服了