7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准
信息来源:https://openai.com/index/separating-signal-from-noise-coding-evaluations
https://i.imgur.com/4liyX9X.png
https://x.com/OpenAI/status/2074972179385720836
https://i.imgur.com/ba2kuZh.png
页:
[1]