楼主: blackantt

编程能力排名是 claude fable5 > gpt sol extra > claude 4.8 吗?

[复制链接]

7

主题

6

回帖

33

积分

新手上路

积分
33
发表于 4 天前 | 显示全部楼层
For coding rankings, I would separate public leaderboard scores from actual workflow fit: frontend polish, code-review quality, latency, and context handling can move the order quite a bit. https://kimi3.org/benchmarks/?utm_source=v2ex&utm_medium=comment&utm_campaign=kimi3_org&utm_content=benchmarks_1229132 is a useful Kimi K3 reference for checking benchmark context and practical trade-offs against Claude and GPT-style models.
回复

使用道具 举报

0

主题

1

回帖

2

积分

新手上路

积分
2
发表于 4 天前 | 显示全部楼层
大项目编程能力看 DeppSWE
https://deepswe.datacurve.ai/
回复

使用道具 举报

3

主题

27

回帖

63

积分

注册会员

积分
63
发表于 4 天前 | 显示全部楼层
感觉得辨证着来👀这件事

我目前还在用 gpt-5.5 哈哈哈
回复

使用道具 举报

0

主题

22

回帖

44

积分

新手上路

积分
44
发表于 4 天前 | 显示全部楼层
榜单迟早要被玩坏,就和之前无数的榜单一样。上一个被搞坏的应该是手机相机的榜单吧?
回复

使用道具 举报

0

主题

5

回帖

10

积分

新手上路

积分
10
发表于 4 天前 | 显示全部楼层
评论说某某第一的,是三个模型都用过?
回复

使用道具 举报

0

主题

34

回帖

68

积分

注册会员

积分
68
发表于 4 天前 | 显示全部楼层
现在头部几个模型能力差不多了,还搞排名意义不大了。
回复

使用道具 举报

0

主题

7

回帖

14

积分

新手上路

积分
14
发表于 4 天前 | 显示全部楼层
T0:Fable 5 、GPT 5.6 sol 、Kimi K3
T1:opus-4.8 、GPT 5.5 、Grok 4.5
T2:muse-spark-1.1 、Gemini-3.6-flash 、GLM-5.2
回复

使用道具 举报

19

主题

11

回帖

79

积分

注册会员

积分
79
 楼主| 发表于 4 天前 | 显示全部楼层
@poxiaohy Fable 5 、GPT 5.6 sol  里的主要 thinking 模式之间呢? 如果有 Fable 5(low, mid,high,...) 、GPT 5.6 sol(ultra) , 到底应该用哪个来编程?
回复

使用道具 举报

0

主题

7

回帖

14

积分

新手上路

积分
14
发表于 4 天前 | 显示全部楼层
@blackantt 不同子模型能力得综合各种排行榜来评价。至于实际工作,每个人遇到的项目复杂度不一样,对需求复杂度评判标准也不一样,具体用什么模型,只能靠自己的体感去体验。比如有的人任务复杂,需求量大,那就直接上 claude 和 GPT 最强的;有的人追求快,不想被封,也有一定性能,那 grok 挺好的;有的人偏爱国产,那就上 Kimi 和 GLM 。有的人需求简单,DeepSeek-flash 都够用了。
回复

使用道具 举报

0

主题

5

回帖

10

积分

新手上路

积分
10
发表于 4 天前 | 显示全部楼层
@mmdsun 这个是前端
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部