JoeJoeJoe 发表于 2026-7-9 09:20:19

7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准

信息来源:

https://openai.com/index/separating-signal-from-noise-coding-evaluations

https://i.imgur.com/4liyX9X.png

https://x.com/OpenAI/status/2074972179385720836

https://i.imgur.com/ba2kuZh.png
页: [1]
查看完整版本: 7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准