查看: 8|回复: 8

想本地化最小成本部署 qwen3.8 27b 求个配置建议

[复制链接]

4

主题

3

回帖

18

积分

新手上路

积分
18
发表于 6 天前 | 显示全部楼层 |阅读模式
我目前机箱和电源( 850w )都只支持单卡,目前是 2080ti 22G 魔改,能跑 4bit 量化版本 但是 KV 不够了,上下文太短。想换卡,换 3090 24G 还是 4080s 32G 魔改呢?后者比前者贵 5000 左右,要不要换呢?还是说等老黄的大饼(显存内存一体笔记本)还是加预算上 mac 呢?如果不本地部署,买订阅也够用 4 、5 年。但是未来不好说啊,自己能有一个推理和执行 skills 准确率 80%以上的大模型真的很香
回复

使用道具 举报

1

主题

213

回帖

429

积分

中级会员

积分
429
发表于 6 天前 | 显示全部楼层
我 4090 跑起来感觉就那样,都是营销号在吹牛皮。个人感觉都不如新出的 gemini3.7-flash
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 6 天前 | 显示全部楼层
你们单卡 24GB 怎么跑起来的?量化多少上下文多少?
我这边测试 4*24GB 刚刚跑起来,速度还特别慢
```
docker run -itd --name Qwen3.8-27B-8bit --gpus all --ipc=host -v /data/models/btbtyler09_Qwen3.8-27B-GPTQ-8bit:/models -p 8000:8000 vllm/vllm-openai:v0.27.1-x86_64-ubuntu2404 --model /models --served-model-name Qwen3.8-27B --port 8000 --api-key 6f08cbed -tp 4 --gpu-memory-utilization 0.98 --kv-cache-dtype fp8 --max-model-len 262144 --max-num-seqs 6 --enable-chunked-prefill --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --enable-prefix-caching --enable-prompt-tokens-details --enable-force-include-usage
```


回复

使用道具 举报

0

主题

11

回帖

22

积分

新手上路

积分
22
发表于 6 天前 | 显示全部楼层
850W 电源,270KP+Z890 ,拆分成双槽 PCIE5.0 x 8 ,插 2 块 5060TI 16G ,跑 27b q4 ,23token/s 。

估计是双槽通讯延迟损耗 + 5060TI 位宽太小导致的,图隐私,倒也是能用。

要体验更好,最好单卡 32G 以上吧,70ti 80ti 那种。
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 6 天前 | 显示全部楼层
建议 Linux + 32GB VRAM GPU + Qwen3.8-27B-UD-Q5_K_XL.gguf + llama.cpp ,可以上到 200k 的上下文。不建议用 vllm ,只能上到 4 位量化,推理质量显著劣于 llama.cpp 的 Q5 量化
回复

使用道具 举报

1

主题

32

回帖

67

积分

注册会员

积分
67
发表于 6 天前 | 显示全部楼层
我用 Mac Studio M4 Max 64G + MTPLX 能跑 60tps ,但是 prefill 很慢,特别是接入 claude code 这种 AI 工具,首字要等几分钟
回复

使用道具 举报

0

主题

9

回帖

18

积分

新手上路

积分
18
发表于 6 天前 | 显示全部楼层
等 Qwen3.8 35BA3B 吧。3.8 27B 最大问题不是权重。而是 kv cache 。q8 量化跑满 262k 上下文要 8-9G 显存。开 turbo quant 有损失。即使是 Blackwell 显卡,vllm 和 sglang 都还没支持完整的 nvfp4 kv cache 支持
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 6 天前 | 显示全部楼层
单卡 24GB GPU + llama.cpp + Qwen3.8-27B-UD-Q4_K_XL.gguf 可以上到 100K 的上下文,推理质量优于同 4 位量化的 vLLM 配置
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 6 天前 | 显示全部楼层
AMD R9700 看看呗,全新的 1 万块 3 年质保比魔改卡靠谱多了,开 MTP 也有 25+的 tokens/s 了
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部