7 月 9 日, OpenAI 主动承认用于代码评测的 SWE-Bench Pro 有约 30% 的任务有缺陷,导致分数失真,不再推荐它作为前沿模型的主要评测标准

7 月 9 日
 JoeJoeJoe

信息来源:

https://openai.com/index/separating-signal-from-noise-coding-evaluations

https://x.com/OpenAI/status/2074972179385720836

1201 次点击
所在节点    OpenAI
6 条回复
HHHans
7 月 9 日
是不是测完发现自己的 5.6 跑分打不过 Fable
loveshuyuan
7 月 9 日
打不过 = 测试用例有问题
diudiuu
7 月 9 日
大家都有 30% = 没有缺陷
zhmouV2
7 月 9 日
xai 发 grok4.5 的 benchmark 里面 SWE Pro 5.5xhigh 打不过 glm5.2
JoeJoeJoe
7 月 9 日
@HHHans
@loveshuyuan
@diudiuu
@zhmouV2

哈哈哈哈 打不过 = 测试用例有问题, 一琢磨好像也能说的通.
paopjian
7 月 9 日
我就好奇他们这测试集发出来没做过人工审查么, 没审查过也敢做指标, 现在好怕各种模型把测试集都练了, 那评估个屁

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1225998

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX