SWE-bench 排行榜失效了:254 份提交审计出
上个月朋友给公司挑 Coding Agent,A 产品 SWE-bench 分数 79.2%,B 产品 78.5%,果断选了 A。结果一查,这俩在同一批题上根本没差别。
9 月 15 号有篇论文把这事扒得底朝天。他们审计了 254 份提交,发现 Verified 榜前三十名里,29 对相邻组合全都没法在统计上区分开。
榜首两名其实完全并列,都解出了 396 题。前十名里有 285 道题大家全对、51 道全错,真正能拉开差距的只剩 164 道。顶尖模型都在同一批题上栽跟头,拿 500 题去排座次本来就不够用。
更离谱的是,同一个模型换个 scaffold,分数最高能波动 29.8 个百分点。这比整个榜单前三十名的总跨度(8.8 点)还要大三倍多。你看到的微小差距,大概率只是噪声。
现在连头部厂商自己都不怎么用这个榜了。真要选型,别再为小数点纠结,先把自己的测试配置钉死,再从真实报错日志里捞几十个用例建自己的评测。
原文SWE-bench 排行榜失效了:254 份提交审计出的三个真相