楼主: blackantt

编程能力排名是 claude fable5 > gpt sol extra > claude 4.8 吗?

[复制链接]

0

主题

5

回帖

10

积分

新手上路

积分
10
发表于 4 天前 | 显示全部楼层
@Thiece #11 没仔细看,请问链接里的第一个表是不是考虑到了性价比?我看 sol 比 fable 也便宜太多了。
回复

使用道具 举报

0

主题

1

回帖

2

积分

新手上路

积分
2
发表于 4 天前 | 显示全部楼层
@mmdsun webdev 榜单混元排 16 、qwen3.7-max 排 20 ,ds-v4-pro-thinking 31 ,榜单和现实差距太大了
回复

使用道具 举报

0

主题

8

回帖

16

积分

新手上路

积分
16
发表于 4 天前 | 显示全部楼层
gpt5.6sol 我的感受是明显优于 5.5 的
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 4 天前 | 显示全部楼层
@blackantt kimi 3 写代码要比实际好很多,但是要深度思考开最大、测评也是用的 max GLM5.2 也是。如果不开最大就很差,简直两个模型。 现在有中转站都混用国产模型和 GPT/Claude 写代码已经看不出来了。我们公司内部也准备搞个测试实验针对写代码的情况盲测。
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 4 天前 | 显示全部楼层
@loshine1992 模型编程能力一般都是选用前端的,因为前端好观察、量化打分。并且现在前端工程也不是简单 html 页面了、工程化也复杂 用来评估模型代码能力没什么问题的。Agent Arena 排行 Kimi 3 就掉到第三了。另外已知 GLM 5.2 要开 max 模式,也就是最大深度思考才能比得过海外模型。kimi 3 估计送测也是 max 模式吧 虽然排行没有写 实际感觉还是 max 最大思考深度 才会聪明一些。
回复

使用道具 举报

4

主题

35

回帖

82

积分

注册会员

积分
82
发表于 4 天前 | 显示全部楼层
我反而觉得 fable 5 是不如 5.6 sol 的
上周我实验了好久,发现同样的 xhigh 的强度,
不使用任何 skill 的情况下,在使用相同的 agent.mdclaude.md 的情况下
纯后端无任何前端 UI 的 swift 6 代码
新 feature 的情况下测试了十多次,fable 5 有概率写不出一次编译过的代码
大概出现了 3 4 次(先不管功能是否正确,只管写完的代码能否一次编译通过) 但是 5.6 sol 从来没遇到编译不过的
再和 UI 相关上,fable 就更是灾难,使用 /simplify 对 UI 部分的代码进行精简,结果就是精简完的代码完全改变了 UI 的样式,和交互逻辑。很自以为是,但是因为 codex 没有原生的 /simplify 就直接引用了 https://github.com/anthropics/claude-plugins-official/blob/main/plugins/code-simplifier/agents/code-simplifier.md 做了一些必要的修改后作为本地 skill 使用,结果比 fable 好太多了,不会出现 UI 被改变,交互被改坏的情况
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部