查看: 8|回复: 0

7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准

[复制链接]

3

主题

27

回帖

63

积分

注册会员

积分
63
发表于 2026-7-9 09:20:19 | 显示全部楼层 |阅读模式
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部