https://artificialanalysis.ai/
代码能力还是提升的,相对 gpt5.5 对业务的细节考虑更充分了,但架构设计能力不如 fable5,这个等 gpt6 新底座
模型能力是多边形的,一个人的使用场景根本无法覆盖所有场景,所以根据自己的体验下结论就很尬。
就我个人而言,GPT5.6 的多模态和生图能力是超过 fable 的。。做游戏的素材生成,设计稿还原提升很大。
当然写代码方面相比 5.5 提升很小
指令遵循反而退步了,主动性太高,很容易做出意外的操作。而且真的太慢了,梦回 gpt 5.2 。开 fast 好点,但是额度禁不起烧
@testsb Opus 4.6 简直王中王 API 被下架了😭
这东西就是个弱智,跑了 2 天,我的 100 多个 case 一个都没给我交付,我都不知道他在搞什么。明明一个 case 一个 case 的做,老早就做完了,他倒好,定义这测试那,看着是在做事,昨天一天烧了我 20 亿 token 。我今天等不及了,问他现在交付了几个 case ,好家伙,0/160
目前最好用的 ai
@hero0earth 同感,不知道这货是干啥,每次思考时间都很久。无奈,开了 5.5 继续蹬。慢的让人发指了。现在感觉逼着开多个了,写个提示词,下次执行完估计得一两个小时了。
体感就是慢,是我开思考太高档的原因吗
@testsb #5 Arena 更是最野榜的野榜,完全靠用户的问题打分评价,都没有专业人员设计过确定的题目和确定的输入输出。尤其是 code 的场景,更是完全不贴用户的使用体验。要么是不能很好地考察模型的 agent 能力,而且它的场景基本上都是用户从零开始构建一个工程,和在已经现有的代码库上进行操作完全不同
@FlashEcho #18 Muse Spark 和 Gemini 3 Pro 在 GPT 5.5 和 Opus 4.8 上面就知道有多野了🤣