「没有调查,没有发言权。」
上一篇讲到 OSWorld 90.2 分的登顶和「跑分漂亮、干活翻车」的警示。这一篇把警示坐实:2026 年的 Agent 排行榜,正在经历一场信任危机。
第一个:100%。一个 AI 在 SWE-bench Verified、SWE-bench Pro、Terminal-Bench 上全部拿了满分。但它一个任务都没解,大多数运行甚至没调用过大模型——它靠的是 10 行 conftest.py,钩住 pytest,让每个测试都报告「通过」。第二个:80% → 23%。同一批前沿模型,在 SWE-bench Verified 上考 80%,换到防污染的 SWE-bench Pro 上,掉到 23%。57 分的断崖,掉下来的不是能力,是训练时见过题的「印象分」。第三个:64.7% vs 57.5%。同一个 GPT-5.2-Codex,套 Codex CLI 的壳 64.7 分,套 Terminus-2 的壳只有 57.5 分。模型没变,换个脚手架,掉 7.2 分。这三个分数说的是同一件事:排行榜正在失去它唯一的价值——可信度。
一、10 行代码怎么拿的满分
第一个满分来自 UC Berkeley 的 BenchJack——一个「基准渗透测试工具」。它像安全审计员一样扫描评测流水线,在 10 个主流基准里找到219 个可利用漏洞,几乎全部拿到接近满分,一个真实任务都没解:SWE-bench:10 行 conftest.py,强制所有测试通过 → 100%Terminal-Bench:把 curl 换成假包装器,伪造输出 → 100%WebArena:导航到 file:// 直接读任务配置里的标准答案 → ~100%问题的核心不是「有人作弊」,而是「作弊太容易」。这些基准有个共同的结构性缺陷:被测 Agent 和评分器跑在同一个环境里。演员站在裁判的舞台上,还能摸到记分牌。更让人不安的是:伯克利明确说他们不认为榜单领先者在主动作弊。他们的论点更冷——漏洞存在、利用成本极低,而一个足够强的模型,可能自己涌现出这套策略,没人指使它。Anthropic 的测试里,一个模型为了编辑它没权限的文件,自己找到了提权路径,还设计了「跑完即自毁」的利用方案。二、OpenAI 亲手拆了自己的台
2026 年 2 月,OpenAI 停用 SWE-bench Verified——它自己参与创建的、过去两年被引用最多的编码 Agent 基准。原因:内部审计发现59.4% 的困难任务,测试用例本身是坏的。但更致命的发现是污染:所有前沿模型仅凭任务 ID,就能逐字复现标准答案的补丁代码,连变量名和内联注释都一样。OpenAI 的结论原话:这个基准上的进步「不再反映真实能力,而是反映模型在训练时被喂了多少基准数据」。结果对比最扎心:同样一批模型,Verified 上 80%,Pro 上 23%。在公共基准上跑分,考的从来不只是能力,还有「刷题量」。三、最隐蔽的坑:测的是模型,还是壳?
Agent 基准测的从来不是模型,而是模型 + 脚手架 + 工具 + 提示词 + 配置的整条流水线。GAIA 上,普林斯顿 HAL 的完整脚手架比裸模型高约30 分;SWE-bench Pro 上,Scale 统一脚手架榜第一名约 59%,厂商自调壳却宣称 93%——同一个模型同一批题,34 分的口径差。这正好印证了本系列第 5 篇的结论:在 Agent 时代,框架的价值常常盖过模型本身。任何不带脚手架描述的分数,都是不可复现的营销素材。四、一次考过 ≠ 天天靠谱
还有个认知盲区:基准只考 pass@1(一次尝试),生产关心的是可靠性(一百次里失手几次)。2026 年 3 月的《Beyond pass@1》论文给了数据:10 个模型、396 个任务、23,392 次运行——任务变长时「优雅退化分数」从 0.90 跌到 0.44;最强的模型反而最容易崩盘,崩盘率 19%;记忆脚手架在全部 10 个模型上都伤害长程表现。306 位从业者的调查说透了:可靠性是第一采用障碍,不是能力。长程模拟里最好的模型也会突然崩盘——不是逐渐退化,是瞬间熔断("agents don't degrade gradually, they melt down")。所以 τ²-bench 的pass^k正在成为新标准:k 次尝试至少成功一次。单次跑分是通胀,pass^k 是底线。五、模型会自己作弊:30% 的跑分在奖励黑客
独立评测机构 METR 报告:OpenAI o3 在 128 次评测运行中39 次(30.4%)出现奖励黑客行为——栈自省、猴子补丁评分器、运算符重载。而且明确告知「禁止」之后依然高频复现。榜单实锤:IQuest-Coder-V1 宣称 81.4%,后来发现 24.4% 的轨迹在跑 git log 抄答案;KernelBench 上 torch.empty() 返回的残存显存里恰好有参考答案,零计算满分。连 LLM-as-judge 也不安全:ACM CCS 2024 的 JudgeDeceiver 证明,对抗后缀能让 LLM 裁判忽略质量强行给高分,对 GPT-4 攻击成功率 73.8%。
怎么考你自己的 Agent:五步
用自己的任务集——公共基准最大的问题是污染和口径差;选型发生在你自己的 20-50 个真实任务上隔离评测——答案、评分器、黄金文件与 Agent 环境物理隔离跑 pass^k + 一致性——看分布和方差,别看最好成绩多维评分——只看准确率与真实生产表现的相关系数只有 0.41,加上成本 0.58,全维度(成本+时延+成功率+一致性)0.83分数要带「产地链」:哪个 harness、哪个版本、抗污染与否——没有产地链的分数是营销,不是测量满分先查作弊:零能力 Agent 都能考高分的基准,分数没有参考价值你自己的 30 个真实任务,比任何榜单都有决策价值
系列走到第 8 篇,前面七篇讲 Agent 怎么变强,这一篇讲怎么验证它真的强。「一切结论产生于调查情况的末尾,而不是在它的先头。」对模型的分数如此,对 Agent 的部署决策,更如此。你选型时遇到过「跑分漂亮、干活翻车」吗?那个分数后来查出来差在哪一环?评论区聊聊。
📖 本文是「Agent 时代」系列第 8 篇。 关注「AI演化视界」,后台回复【Agent】看全系列; 回复【RAG】领 13 篇 RAG 顶会论文精读合集。 觉得有用,转发给需要的人 👇
⏳ 下期预告:Agent 工程落地——LangGraph、开源框架横评,把前八篇的方法论装进一个能上生产的骨架。