echoVic 发表于 2026-7-17 15:46:13

@TArysiyehua benchmark 确实还没有,标准集( SWE-bench 这类)不太适合 Orca 这种 goal 模式跑几十轮的场景,后面会找几个典型任务录完整过程。

目前收到不少人说比 codewhale 好用,这对我来说比跑分更有参考价值。欢迎你也试试,有具体对比场景的话可以聊。
页: 1 [2]
查看完整版本: 做 DeepSeek Agent 近一个月,同步下 Orca 的进展