https://deepswe.datacurve.ai/
你要是对比下来,我发现最有性价比的还是 sol
其中,high 是性价比最高的,69%的成绩,达到 fable5 xhigh 的水平了
terra 性价比不算高,medium 的 sol 都比 xhigh 的 terra 强一点,所以我宁愿用 medium 的 sol
5.6-terra 用了几天,xhigh 的远慢于 high ,甚至有时候 max 都比 xhigh 快,我也不知道为什么
sol 我用了几次 xhigh ,也比 terra 快,就很奇怪
我拿两个任务稍微分析了一下,猜测是思维链设计的不一样,会过多的做结果验证,又无法快速的结束(找不到问题,或者无法快速有效解决问题),所以反而耗时更长。可能是模型能力考虑或者训练时候就是这么设计的。
我现在倾向于直接把思维程度拉满( max )或者用 sol ,快速解决掉遇到的问题耗时反而会更短