查看: 12|回复: 12

这两天总算是体感了一下 chatgpt(codex)和 workbuddy 之间的差别

[复制链接]

2

主题

3

回帖

12

积分

新手上路

积分
12
发表于 昨天 11:52 | 显示全部楼层 |阅读模式
想做一个武侠游戏,准备先收集整理一下金庸相关的武侠作品内容,包括门派、人物、武功等,并且根据关联关系建立武侠知识图谱,为后面做游戏做些准备,于是先用 Chatgpt 来干,活又细又慢,耗掉了我 5 个 plus 的重置,基本形成了一个数据基础,基于此生成了一个网页来查看相关关系和具体细节,我把我最熟悉的相关门派、人物、武功都看了一遍,除了有缺失的,基本没有错误。

忽然突发奇想,反正 workbuddy 也有之前薅羊毛来的几千积分,想对比一下区别,于是乎用同样的提示词输入 workbuddy ,惊喜的是速度比 chatgpt 快几倍,过程中观察发现比 chatgpt 少了不少交叉比对来验证数据结果的正确性,结束后也生成了一个网页来查看关系和细节描述,同样去看我最熟悉的相关门派、人物、武功,发现了近 10 处细节错误。

从过程差异来看,感觉模型处理这样的任务差异不大,似乎主要就是缺在交叉验证数据结果这块,侧面思考一下,各个 agent app 的 harness 设计还是非常重要啊,
回复

使用道具 举报

0

主题

14

回帖

28

积分

新手上路

积分
28
发表于 昨天 13:09 | 显示全部楼层
你来回核对 workbuddy 细节、修补漏洞的时间远比你等 gpt 生成慢 成本要高的多的多
回复

使用道具 举报

0

主题

6

回帖

12

积分

新手上路

积分
12
发表于 昨天 13:14 | 显示全部楼层
所以是不是还是 harness 流程设计很重要 可是现在有相关比较完善的开源项目吗,我感觉都找不到
回复

使用道具 举报

0

主题

1

回帖

2

积分

新手上路

积分
2
发表于 昨天 13:45 | 显示全部楼层
我也觉得,其实大部分代码编写场景其实流程更重要,我觉得写的快了,那如何测试更重要,我甚至认为测试是最需要尽快处理的问题了。
回复

使用道具 举报

0

主题

1

回帖

2

积分

新手上路

积分
2
发表于 昨天 13:58 | 显示全部楼层
模型能力差太多了,这些 agent 都是互相抄,大差不差
回复

使用道具 举报

0

主题

10

回帖

20

积分

新手上路

积分
20
发表于 昨天 14:24 | 显示全部楼层
应该让 codex 用便宜的模型,这样速度可能慢一点,准备用效果可能也还行
回复

使用道具 举报

4

主题

3

回帖

18

积分

新手上路

积分
18
发表于 昨天 14:32 | 显示全部楼层
模型能力查很多
回复

使用道具 举报

2

主题

6

回帖

18

积分

新手上路

积分
18
发表于 昨天 14:36 | 显示全部楼层
你确定你对比的是 codex 和 workbuddy 吗,你对比的明明是顶级模型和一个免费的垃圾模型
回复

使用道具 举报

2

主题

6

回帖

18

积分

新手上路

积分
18
发表于 昨天 14:39 | 显示全部楼层
agent harness 不是什么高深的技术,现在市面上叫得上名字的 agent harness 不会有什么显著的差异,前提是得用相同的模型
回复

使用道具 举报

3

主题

46

回帖

101

积分

注册会员

积分
101
发表于 昨天 14:47 | 显示全部楼层
这个场景重度依赖网度搜索工具,搜索质量差,模型再聪明也是白搭。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部