楼主: fbu11

GPT5.6 SOL 也就那么回事

[复制链接]

1

主题

26

回帖

55

积分

注册会员

积分
55
发表于 2026-7-12 13:41:19 | 显示全部楼层
@xing7673 它的 coding 其实是 Text 大目录的子项,具体是写函数或者小功能,比如写个网页之类的。

GLM 高的在 Agent 排名这里: https://arena.ai/leaderboard/agent

Agent 排名综合了 prompt 理解、任务规划、调度执行之类的综合工作。
回复

使用道具 举报

0

主题

13

回帖

26

积分

新手上路

积分
26
发表于 2026-7-12 13:58:58 | 显示全部楼层
感觉本站是真没帖子了,这个帖子反复出现在首页好几天了(无恶意
回复

使用道具 举报

0

主题

18

回帖

36

积分

新手上路

积分
36
发表于 2026-7-12 14:13:25 | 显示全部楼层
@testsb #40 这个合理一些,因为现在主要 coding 输出都是通过 agent 了,几乎没人使用 raw 的 code 文本了
回复

使用道具 举报

0

主题

9

回帖

18

积分

新手上路

积分
18
发表于 2026-7-12 14:16:45 | 显示全部楼层
@testsb #23 Arena 主要是聊天的,one shot ,所以它能测的东西也是很片面的。
回复

使用道具 举报

1

主题

26

回帖

55

积分

注册会员

积分
55
发表于 2026-7-12 15:30:14 | 显示全部楼层
@cskeleton #43

是,聊天只能囊括内容创作、内容质量、解决方案、论题研究等这些偏单点/定向探索能力。

但当前模型最广泛的应用就是工程化、工作流自动化,比如现在最多人关注的编程能力。所以 Arena 最近才补了个 Agent 排名以补短板,确实比其他固定测试集的排名晚了很多。
回复

使用道具 举报

1

主题

38

回帖

79

积分

注册会员

积分
79
 楼主| 发表于 2026-7-12 18:41:50 | 显示全部楼层
@409164 #41 不至于哈哈哈,我是“2026-07-11 10:44:02 +08:00”创建的帖子,gpt 发完新版本后太多人发帖子了吧哈哈哈,全是这个话题
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部