|
|
发表于 2026-7-11 20:27:04
|
显示全部楼层
@FlashEcho 榜单评测方法有两面性,我觉得各个榜单有各自的优劣。
Arena 靠用户投票,基本就是大多数人的体感了,因为每个人使用场景不同,所以这种方式优势是测试集多样,相反缺点也是测试集不固定,横向直接比较说服力低,这也是你吐槽的点吧。
而做特定测试集的那些榜单,测试集固定结果清晰,很方便模型的直接横向比较,这是优点,但也不是完美的,因为模型多迭代几代很容易把某些测试变成考卷考试,做针对性优化。
这次 GPT 5.6 据说就针对某些榜单做过针对优化,而且还针对性的改了某些榜单的测试基准。相当于不仅考卷,还自己改了考题。 |
|