这两天总算是体感了一下 chatgpt(codex)和 workbuddy 之间的差别
想做一个武侠游戏,准备先收集整理一下金庸相关的武侠作品内容,包括门派、人物、武功等,并且根据关联关系建立武侠知识图谱,为后面做游戏做些准备,于是先用 Chatgpt 来干,活又细又慢,耗掉了我 5 个 plus 的重置,基本形成了一个数据基础,基于此生成了一个网页来查看相关关系和具体细节,我把我最熟悉的相关门派、人物、武功都看了一遍,除了有缺失的,基本没有错误。忽然突发奇想,反正 workbuddy 也有之前薅羊毛来的几千积分,想对比一下区别,于是乎用同样的提示词输入 workbuddy ,惊喜的是速度比 chatgpt 快几倍,过程中观察发现比 chatgpt 少了不少交叉比对来验证数据结果的正确性,结束后也生成了一个网页来查看关系和细节描述,同样去看我最熟悉的相关门派、人物、武功,发现了近 10 处细节错误。
从过程差异来看,感觉模型处理这样的任务差异不大,似乎主要就是缺在交叉验证数据结果这块,侧面思考一下,各个 agent app 的 harness 设计还是非常重要啊, 你来回核对 workbuddy 细节、修补漏洞的时间远比你等 gpt 生成慢 成本要高的多的多 所以是不是还是 harness 流程设计很重要 可是现在有相关比较完善的开源项目吗,我感觉都找不到 我也觉得,其实大部分代码编写场景其实流程更重要,我觉得写的快了,那如何测试更重要,我甚至认为测试是最需要尽快处理的问题了。 模型能力差太多了,这些 agent 都是互相抄,大差不差 应该让 codex 用便宜的模型,这样速度可能慢一点,准备用效果可能也还行 模型能力查很多 你确定你对比的是 codex 和 workbuddy 吗,你对比的明明是顶级模型和一个免费的垃圾模型 agent harness 不是什么高深的技术,现在市面上叫得上名字的 agent harness 不会有什么显著的差异,前提是得用相同的模型 这个场景重度依赖网度搜索工具,搜索质量差,模型再聪明也是白搭。
页:
[1]
2