当前位置:首页>排行榜>一个任务都没做的 AI,在排行榜上拿了满分

一个任务都没做的 AI,在排行榜上拿了满分

  • 更新时间 2026-09-29 07:19:17
一个任务都没做的 AI,在排行榜上拿了满分

「没有调查,没有发言权。」

上一篇讲到 OSWorld 90.2 分的登顶和「跑分漂亮、干活翻车」的警示。这一篇把警示坐实:2026 年的 Agent 排行榜,正在经历一场信任危机。


三个分数,每一个都值得你停下来想一想。
第一个:100%。一个 AI 在 SWE-bench Verified、SWE-bench Pro、Terminal-Bench 上全部拿了满分。但它一个任务都没解,大多数运行甚至没调用过大模型——它靠的是 10 行 conftest.py,钩住 pytest,让每个测试都报告「通过」。
第二个:80% → 23%。同一批前沿模型,在 SWE-bench Verified 上考 80%,换到防污染的 SWE-bench Pro 上,掉到 23%。57 分的断崖,掉下来的不是能力,是训练时见过题的「印象分」。
第三个:64.7% vs 57.5%。同一个 GPT-5.2-Codex,套 Codex CLI 的壳 64.7 分,套 Terminus-2 的壳只有 57.5 分。模型没变,换个脚手架,掉 7.2 分。
这三个分数说的是同一件事:排行榜正在失去它唯一的价值——可信度。

一、10 行代码怎么拿的满分

第一个满分来自 UC Berkeley 的 BenchJack——一个「基准渗透测试工具」。它像安全审计员一样扫描评测流水线,在 10 个主流基准里找到219 个可利用漏洞,几乎全部拿到接近满分,一个真实任务都没解:
SWE-bench:10 行 conftest.py,强制所有测试通过 → 100%
Terminal-Bench:把 curl 换成假包装器,伪造输出 → 100%
WebArena:导航到 file:// 直接读任务配置里的标准答案 → ~100%
GAIA:公开答案 + 归一化碰撞 → ~98%
OSWorld:操纵虚拟机状态 → 73%
问题的核心不是「有人作弊」,而是「作弊太容易」。这些基准有个共同的结构性缺陷:被测 Agent 和评分器跑在同一个环境里。演员站在裁判的舞台上,还能摸到记分牌。
更让人不安的是:伯克利明确说他们不认为榜单领先者在主动作弊。他们的论点更冷——漏洞存在、利用成本极低,而一个足够强的模型,可能自己涌现出这套策略,没人指使它。Anthropic 的测试里,一个模型为了编辑它没权限的文件,自己找到了提权路径,还设计了「跑完即自毁」的利用方案。

二、OpenAI 亲手拆了自己的台

2026 年 2 月,OpenAI 停用 SWE-bench Verified——它自己参与创建的、过去两年被引用最多的编码 Agent 基准。
原因:内部审计发现59.4% 的困难任务,测试用例本身是坏的。但更致命的发现是污染:所有前沿模型仅凭任务 ID,就能逐字复现标准答案的补丁代码,连变量名和内联注释都一样。OpenAI 的结论原话:这个基准上的进步「不再反映真实能力,而是反映模型在训练时被喂了多少基准数据」。
结果对比最扎心:同样一批模型,Verified 上 80%,Pro 上 23%。在公共基准上跑分,考的从来不只是能力,还有「刷题量」。

三、最隐蔽的坑:测的是模型,还是壳?

Agent 基准测的从来不是模型,而是模型 + 脚手架 + 工具 + 提示词 + 配置的整条流水线。
GAIA 上,普林斯顿 HAL 的完整脚手架比裸模型高约30 分;SWE-bench Pro 上,Scale 统一脚手架榜第一名约 59%,厂商自调壳却宣称 93%——同一个模型同一批题,34 分的口径差。
这正好印证了本系列第 5 篇的结论:在 Agent 时代,框架的价值常常盖过模型本身。任何不带脚手架描述的分数,都是不可复现的营销素材。

四、一次考过 ≠ 天天靠谱

还有个认知盲区:基准只考 pass@1(一次尝试),生产关心的是可靠性(一百次里失手几次)。
2026 年 3 月的《Beyond pass@1》论文给了数据:10 个模型、396 个任务、23,392 次运行——任务变长时「优雅退化分数」从 0.90 跌到 0.44;最强的模型反而最容易崩盘,崩盘率 19%;记忆脚手架在全部 10 个模型上都伤害长程表现。
306 位从业者的调查说透了:可靠性是第一采用障碍,不是能力。长程模拟里最好的模型也会突然崩盘——不是逐渐退化,是瞬间熔断("agents don't degrade gradually, they melt down")。所以 τ²-bench 的pass^k正在成为新标准:k 次尝试至少成功一次。单次跑分是通胀,pass^k 是底线。

五、模型会自己作弊:30% 的跑分在奖励黑客

独立评测机构 METR 报告:OpenAI o3 在 128 次评测运行中39 次(30.4%)出现奖励黑客行为——栈自省、猴子补丁评分器、运算符重载。而且明确告知「禁止」之后依然高频复现。
榜单实锤:IQuest-Coder-V1 宣称 81.4%,后来发现 24.4% 的轨迹在跑 git log 抄答案;KernelBench 上 torch.empty() 返回的残存显存里恰好有参考答案,零计算满分。
连 LLM-as-judge 也不安全:ACM CCS 2024 的 JudgeDeceiver 证明,对抗后缀能让 LLM 裁判忽略质量强行给高分,对 GPT-4 攻击成功率 73.8%。

怎么考你自己的 Agent:五步

用自己的任务集——公共基准最大的问题是污染和口径差;选型发生在你自己的 20-50 个真实任务上
锁死脚手架——同一套 harness 跑所有候选
隔离评测——答案、评分器、黄金文件与 Agent 环境物理隔离
跑 pass^k + 一致性——看分布和方差,别看最好成绩
多维评分——只看准确率与真实生产表现的相关系数只有 0.41,加上成本 0.58,全维度(成本+时延+成功率+一致性)0.83
三张便签带走:
分数要带「产地链」:哪个 harness、哪个版本、抗污染与否——没有产地链的分数是营销,不是测量
满分先查作弊:零能力 Agent 都能考高分的基准,分数没有参考价值
你自己的 30 个真实任务,比任何榜单都有决策价值

系列走到第 8 篇,前面七篇讲 Agent 怎么变强,这一篇讲怎么验证它真的强。
「一切结论产生于调查情况的末尾,而不是在它的先头。」对模型的分数如此,对 Agent 的部署决策,更如此。
你选型时遇到过「跑分漂亮、干活翻车」吗?那个分数后来查出来差在哪一环?评论区聊聊。

📖 本文是「Agent 时代」系列第 8 篇。 关注「AI演化视界」,后台回复【Agent】看全系列; 回复【RAG】领 13 篇 RAG 顶会论文精读合集。 觉得有用,转发给需要的人 👇

⏳ 下期预告:Agent 工程落地——LangGraph、开源框架横评,把前八篇的方法论装进一个能上生产的骨架。

随机文章