testsb 发表于 2026-7-12 13:41:19

@xing7673 它的 coding 其实是 Text 大目录的子项,具体是写函数或者小功能,比如写个网页之类的。

GLM 高的在 Agent 排名这里: https://arena.ai/leaderboard/agent

Agent 排名综合了 prompt 理解、任务规划、调度执行之类的综合工作。

409164 发表于 2026-7-12 13:58:58

感觉本站是真没帖子了,这个帖子反复出现在首页好几天了(无恶意

xing7673 发表于 2026-7-12 14:13:25

@testsb #40 这个合理一些,因为现在主要 coding 输出都是通过 agent 了,几乎没人使用 raw 的 code 文本了

cskeleton 发表于 2026-7-12 14:16:45

@testsb #23 Arena 主要是聊天的,one shot ,所以它能测的东西也是很片面的。

testsb 发表于 2026-7-12 15:30:14

@cskeleton #43

是,聊天只能囊括内容创作、内容质量、解决方案、论题研究等这些偏单点/定向探索能力。

但当前模型最广泛的应用就是工程化、工作流自动化,比如现在最多人关注的编程能力。所以 Arena 最近才补了个 Agent 排名以补短板,确实比其他固定测试集的排名晚了很多。

fbu11 发表于 2026-7-12 18:41:50

@409164 #41 不至于哈哈哈,我是“2026-07-11 10:44:02 +08:00”创建的帖子,gpt 发完新版本后太多人发帖子了吧哈哈哈,全是这个话题
页: 1 2 3 4 [5]
查看完整版本: GPT5.6 SOL 也就那么回事