@testsb #5 gemini pro 能到前排的 接近你使用感受?你只是想找一个 claude 最前的榜单吧
@testsb #6
这个榜里 gemini 排 5.5 前边简直就是搞笑榜了,用过的心里都有数,我就不多说了
@xing7673 @willxiang
https://arena.ai/leaderboard/text/overall 这个是综合能力,就像 #11 楼的朋友说的:
"模型能力是多边形的,一个人的使用场景根本无法覆盖所有场景,所以根据自己的体验下结论就很尬"
你们可能更关注 coding ,得看 https://arena.ai/leaderboard/text/coding
额度消耗的太快了,我一个小任务都做不完就没了
@FlashEcho 榜单评测方法有两面性,我觉得各个榜单有各自的优劣。
Arena 靠用户投票,基本就是大多数人的体感了,因为每个人使用场景不同,所以这种方式优势是测试集多样,相反缺点也是测试集不固定,横向直接比较说服力低,这也是你吐槽的点吧。
而做特定测试集的那些榜单,测试集固定结果清晰,很方便模型的直接横向比较,这是优点,但也不是完美的,因为模型多迭代几代很容易把某些测试变成考卷考试,做针对性优化。
这次 GPT 5.6 据说就针对某些榜单做过针对优化,而且还针对性的改了某些榜单的测试基准。相当于不仅考卷,还自己改了考题。
@dingawm 你忘了 ai 的通用问答场景。claude 系天天抬杠,很多时候给出的答案根本不可用
深度使用一天,fable5 还是明显更强
@hero0earth 太赞同了
高级别很容易就思考过度 然后做一些更复杂的逻辑 结果 token 花了 任务没完成😅
有些任务做很久出不了结果,但是如果是一个比较容易收敛的任务,质量很高。
所以关键就在于,它经常无法自己收敛,有点像数学里的级数或极限,得学会让他自己收敛,避免过度思考。