论坛
BBS
默认
简体中文
繁體中文
登录
全球主机MJJ交流论坛
»
论坛
›
主机交流
›
水池
›
mac ultra deepseek harness & qwen3.8-27B 几点经验 ...
返回列表
发新帖
查看:
4
|
回复:
0
mac ultra deepseek harness & qwen3.8-27B 几点经验
[复制链接]
coefu
coefu
当前离线
积分
47
1
主题
22
回帖
47
积分
新手上路
新手上路, 积分 47, 距离下一级还需 3 积分
新手上路, 积分 47, 距离下一级还需 3 积分
积分
47
关注TA
发消息
发表于
5 天前
|
显示全部楼层
|
阅读模式
1 ,不要用 llama.cpp ,虽然它可以超长 context ,并能量化 context ;但是超长 context 一旦处理慢了点,deepseek harness 底层用来连接模型的 pi 就容易超时 hang 住,再次连接的时候,重新 prefill 之前超长的 context 会非常耗时,且 llama.cpp 在同一个 slot 中处理的时候,后续不管 pp/tg 都非常慢。
2 ,推荐 mlx-dspark ,umem 够的情况下,用 draft 模型,不够,用--lookup-drafts 模式,context 不要搞默认 256k ,有个 64k 足矣,当单个 context 不够,自动切 slot 。前缀缓存( Prefix Caching / KV-Cache Reuse )和 探针验证与 Small-M 优化内核( Small-M Kernel Optimization ),让其能在 context prefill 极速,这是 llama.cpp 的最大问题。后续的 tg 阶段,也提速。虽然没有 context 量化,但是以上技术完全弥补了,且 context 不量化不损失质量。
3 ,让 dsh 自己写联网插件和记忆插件,保证客观知识的相对准确性,以及多个会话的延续性。
回复
使用道具
举报
返回列表
发新帖
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖并转播
回帖后跳转到最后一页
Archiver
|
手机版
|
小黑屋
|
全球主机MJJ交流论坛
Powered by
Discuz!
X5.0
© 2001-2026
Discuz! Team
.
在本版发帖
返回顶部
快速回复
返回顶部
返回列表