|
|
发表于 2026-7-8 14:22:37
|
显示全部楼层
能产多少 token 取决于你用的什么卡、跑的什么参数的模型、模型架构是什么、跑的什么量化、有没有用其他优化。
按照现在个人本地部署普遍 qwen3.6 27b 或者 gemma4 31b 的情况下(两个都是能以单卡 5090 32G ,q4 量化部署的,参数量相对比较大的稠密模型),其实大概 60-80 左右的 tps 也出不了多少 token ,粗算一下一度电也就能出 40wtoken 左右。
自部署换用 MoE 模型倒是个提升吞吐量数字的好办法,可是消费级单卡能部署的 MoE 模型实际用起来都太笨了没什么用途,尤其有些 MoE 模型还默认强制开深度思考,那就更慢了。 |
|