|
|
楼主 |
发表于 2026-8-16 00:11:47
|
显示全部楼层
@carousel95
我的问题, 没有交代上下文
这两天网上流程用 DeepSeek Harness 的极简模式可以达到之前所谓的灰度测试时的高水准
官方仓库的极简模式明确说"The minimal preset owns the complete RL agent composition."
简单说就是复刻模型后训练时强化学习时的运行环境
系统提示词固定"You are a helpful software engineer assistant."
只有两个工具"bash"和"str_replace_editor", 工具 schema 也是复刻训练时的
只有这样,才能做到官方的跑分
但真实的,解决现实任务的 agent ,怎么可能满足这个环境 |
|